VisualBERT: A Simple and Performant Baseline for Vision and Language
- 类型:arxiv
- 标识:1908.03557
- 链接:https://arxiv.org/abs/1908.03557
- 主题:multimodal
- 主分类:multimodal
- 形态:method
- 被引:2375
- 被引来源:Semantic Scholar
- S2被引:2375
- OpenAlex被引:1235
- 影响力被引:265
- TLDR:Analysis demonstrates that VisualBERT can ground elements of language to image regions without any explicit supervision and is even sensitive to syntactic relationships, tracking, for example, associations between verbs and image regions corresponding to their arguments.
- OpenAlex ID:W2968124245
- OpenAlex DOI:10.48550/arxiv.1908.03557
- DOI:10.48550/arxiv.1908.03557
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/1908.03557
- OpenAlex更新:2026-08-23
- 待LLM分类:否
- 标题中文:VisualBERT: 一个简单且性能优异的视觉与语言基线模型
- TLDR中文:分析表明,VisualBERT 能够在无任何显式监督的情况下将语言元素对应到图像区域,甚至对句法关系敏感,例如能够跟踪动词与其论元对应图像区域之间的关联。
- 来源文件:
- [OpenAlex discover]
- [S2 enrich]