HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million\n Narrated Video Clips
- 类型:arxiv
- 标识:1906.03327
- 链接:https://arxiv.org/abs/1906.03327
- 主题:multimodal
- 主分类:multimodal
- 形态:method
- 被引:1510
- 被引来源:Semantic Scholar
- S2被引:1510
- OpenAlex被引:926
- 影响力被引:245
- TLDR:It is demonstrated that a text-video embedding trained on this data leads to state-of-the-art results for text-to-video retrieval and action localization on instructional video datasets such as YouCook2 or CrossTask.
- OpenAlex ID:W2984008963
- OpenAlex DOI:10.48550/arxiv.1906.03327
- DOI:10.48550/arxiv.1906.03327
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/1906.03327
- OpenAlex更新:2026-08-23
- 副分类:rag
- 待LLM分类:否
- 标题中文:HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips
- TLDR中文:在 YouCook2、CrossTask 等教学视频数据集上,基于该数据训练的文本-视频 embedding 在文本到视频检索与动作定位任务上达到了 SOTA 结果。
- 来源文件:
- [OpenAlex discover]
- [S2 enrich]