1.36 亿条"视频+字幕"是从哪儿白嫖来的?—— 一篇 2019 年论文把多模态 AI 的数据天花板直接掀翻

  • 关联论文:1906.03327

你有没有想过这种怪事:

教 AI 看视频,难的不是模型,是数据。 给一段 30 秒视频写一句"画面里在干嘛",人工标注 1 小时视频的成本是图像标注的几十倍。 2018 年最大的"视频-文本"数据集 MSR-VTT 也只有 1 万段视频,根本喂不饱模型。 怎么办?

Google DeepMind + INRIA 的 Miech / Zhukov / Alayrac 等人在 2019 年给出了一个近乎白嫖的解法。

他们的核心洞察非常具体——YouTube 上有海量"教人做事"的视频(做饭、修理、做手工、做 DIY),它们的自动字幕(ASR)就是当前画面的天然描述。字幕和画面不完全对齐,但"大致同步"已经够用。

于是他们写了 6 步 pipeline:

  1. 用手工构造的关键词词表从 YouTube 搜出 ~120 万个 how-to 视频
  2. 下载,总时长 15.2 万小时
  3. 跑 ASR 拿到字幕,过滤掉自动翻译、长度过短的视频
  4. 保留连续字幕段 ≥2 秒的片段
  5. 把每个短片段(clip)+ 同时段字幕 = 一个 (video_clip, transcript_clip) 配对
  6. 最终得到 1.36 亿个训练配对——比当时最大的 MSR-VTT 多 约 3 个数量级(约 1000 倍)

几乎没有人力标注成本。 一夜之间,"视频-文本"对齐学习从"几万条"跨到了"亿级"规模。

关键洞察:自然监督 ≠ 干净标注,但够用

传统数据集的逻辑是"先标干净,再训模型"——这要求每一条数据都是"画面里发生了什么"的精确描述。

HowTo100M 反过来:我不要精确描述,我要大规模弱相关。

  • 字幕是 ASR 出来的,有错别字、有停顿、有跑题
  • 字幕和画面不是帧对齐,可能差几秒
  • 但只要统计上"这段视频里讲的是蛋炒饭的做法"和"这段画面里有人在打蛋",模型就能学到语义对应

这种"自然监督"(natural supervision)路线后来成为多模态预训练的主流——CLIP(图像-文本)、Wav2Vec(语音-文本)、HuBERT 都是这个套路。但 HowTo100M 是视频领域的开山样本

核心方法:MIL-NCE + S3D 双编码器

视频端:S3D

S3D 是 I3D 的轻量版——把空间卷积和时间卷积分开,空间上复用 Inception 预训练权重,时间上用 1D stride conv。比 I3D 少约 30% 参数,但保留时间建模能力。每段视频 clip 抽成 512 维 embedding。

文本端:Word2Vec + 平均池化

论文里试了 Word2Vec / LSTM / bag-of-words,最终用最简单的 Word2Vec 平均池化——证明在亿级数据量下,复杂文本编码器不是必须。

训练目标:MIL-NCE(Multiple Instance Learning + Noise-Contrastive Estimation)

标准 InfoNCE 需要严格的正负样本对——视频片段 A 对应字幕 X,错一行就掉点。MIL-NCE 放宽了这个约束:

  • 正样本:同视频同一时间窗内的多个字幕片段(Multiple Instance)
  • 负样本:同 batch 内其他视频的字幕

这样即使 ASR 字幕和画面差几秒,只要大致在同一时间窗内,就算正样本——对噪声鲁棒,训练稳定。

效果:2019 年的全 SOTA

YouCook2 零样本检索(没在 YouCook2 上训练,直接测): - R@1 = 8.2 / R@5 = 21.4 / R@10 = 29.1

MSR-VTT 零样本: - R@1 = 9.0 - fine-tune 后 R@1 = 14.9

CrossTask(多步骤任务分类基准): - 绝对提升 7 个百分点——在传统方法只刷 1-2pp 的基准上,这是大跃迁

为什么这件事对(不搞 AI 的)你也重要

1. 数据规模决定 AI 能力的上限

从 AlexNet(1400 万图像)到 CLIP(4 亿图像-文本对),每一次 AI 能力的跃迁背后都是数据规模的 10-100 倍增长。HowTo100M 把视频领域的天花板从 10K 推到 100M,直接催生了 VideoCLIP、VideoMAE、InternVideo 等后续所有视频大模型

2. "白嫖自然监督"是 AI 数据工程的核心范式

今天的 Laion-5B(图像-文本)、The Stack(代码)、RedPajama(文本)都是同款思路——用现成的互联网内容做弱监督,省掉人工标注的天价成本。HowTo100M 是这条路在视频领域的首次完整示范。

3. YouTube 字幕 = 免费家教

每段 how-to 视频就是一个免费家教在边做边讲,AI 听 + 看就能学"什么是做饭"、"什么是组装家具"。这是"自然监督"路线最经典的具象化

⚠️ 工程坑清单(避免踩雷)

  1. YouTube ToS:今天直接爬 YouTube 字幕做训练集大概率违反服务条款。HowTo100M 是 2019 年特殊窗口期的产物,今天不能再原样复现——只能找合规视频源(Bilibili 创作者授权、学术数据集等)

  2. 域偏移:在医疗手术、电商直播、自动驾驶、强交互场景,字幕-画面相关性与 how-to 视频差异极大。论文 Section 6 讨论了域偏移但没给具体数字,经验上迁移可能掉 5-10 个点

  3. 存储成本:原始视频约 500 TB。实际工程几乎都跳过原始数据,直接用论文公开的 S3D pretrained weight——GitHub antoine77340/HowTo100M 可下载(约 1GB)

  4. MIL-NCE 的 α 超参:论文默认 α=0,但根据数据噪声程度可能需要调到 0.3-0.5——否则负样本采样可能过强/过弱

  5. ASR 质量过滤:自动字幕里夹带 emoji、广告词、跑题内容,需要 langdetect + 正则过滤一遍,否则训练时会被噪声带偏

  6. S3D 训练成本:128 GPU × 数天——个人/小团队不要重训,直接用官方权重

何时不要用 HowTo100M 的数据 / 思路

实时直播 / 强交互视频:how-to 字幕无法覆盖弹幕、互动、连续切换 ❌ 强隐私场景(手术室、家庭监控):YouTube 字幕自然监督不适用,需要专业标注 ❌ 纯视觉任务(如目标检测):字幕带来的语义信息用不上,应该用 COCO / Objects365 ❌ 中文为主的下游:how-to 字幕以英文为主,中文迁移需要找 Bilibili / 抖音的合规数据

适合谁读 / 谁该用

  • 多模态研究者:理解"自然监督 + 大规模"路线如何打破数据瓶颈
  • 视频理解工程师:在做视频检索、视频问答、视频摘要时的强 baseline
  • 数据工程师:学习"用现成互联网内容做弱监督"的工程范式
  • AI 产品经理:理解为什么"数据规模"比"模型大小"更值得投资

一句话给老板

"我们想做的视频 AI 卡在没数据。一篇 2019 年的论文 HowTo100M 演示了怎么用 YouTube 字幕白嫖出 1.36 亿训练对——这是后来所有视频大模型的祖宗。我们可以借鉴这个思路,从 Bilibili / 抖音拿合规数据,把数据规模从 10K 推到 10M。"

三个标题变体

  1. "AI 看视频为什么突然变聪明了?1.36 亿条 YouTube 字幕白嫖出来的训练数据"
  2. "我们训 AI 的瓶颈不是模型,是数据——一篇 2019 年被引 1500+ 的论文教你怎么破"
  3. "Google 的工程师怎么用 YouTube 做饭视频训练 AI——这个脑洞改变了整个视频 AI 行业"

📱 小红书风格卡片文案

📚 今天被这篇 2019 年的论文震到了

Google 的工程师干了件很野的事: 他们把 YouTube 上 120 万个"教人做饭/修东西"的视频,自动切成 1.36 亿个短片段,每个片段配上 ASR 字幕——直接当 AI 训练数据用。

你没看错:几乎零人工标注成本,数据规模比之前最大的视频数据集多了约 1000 倍。

关键是——字幕和画面不是帧对齐的,差几秒很正常。 他们用了一个叫 MIL-NCE 的损失函数,专门对付这种"弱对齐"。

效果? - YouCook2 零样本检索涨到 R@10=29.1 - MSR-VTT 零样本 R@1=9.0 - CrossTask 涨 7 个百分点

这篇论文是后面所有视频大模型(VideoCLIP / VideoMAE / InternVideo)的祖宗。

核心脑洞:不要精确标注,要大规模弱相关。 YouTube 字幕 = 免费家教在边做边讲,AI 听 + 看就能学。

📎 arXiv 1906.03327 · 被引 1517 次 · 至今仍是视频-文本预训练的事实标准

#AI科普 #多模态 #视频理解 #数据集 #自监督学习 #深度学习 #论文分享 #技术分享

📎 arXiv 1906.03327 · ICCV 2019 · 被引 1,517 次(Semantic Scholar 2026) 📅 2019 年提出,至今仍是视频-文本预训练数据的"原始股"

💬 评论区聊聊:你工作中遇到哪些 AI 任务,卡在"没有标注数据"而不是"模型不够强"

AI #多模态 #视频理解 #HowTo100M #数据集 #自监督学习 #深度学习 #人工智能 #论文分享 #技术科普 #数据科学 #机器学习 #MILNCE #S3D