当 AI 终于有"足够多的视频"可看——arXiv 2608.24845 把 1000 万小时开源视频砸进训练池,把视频/音频预训练推到 CommonCrawl 级别

  • 关联论文:2608.24845

你有没有想过这件事 🎬:

现在的大模型能看图、能听懂你说话、能在视频里精准找到"猫从沙发上跳下来那一帧"。 但你猜——训练它的视频总共有多少小时?

答:很多所谓"超大视频数据集"其实只给你元数据几万小时——真要上千万小时的开源视频,在 2026 年之前基本是个空白。

这就像你想教孩子认世界,但只给他看了 10 本绘本、5 部动画片,就让他去街上认人和车。

arXiv 2608.24845(LAION-BVD) 做了一件听起来"朴素但改变规则"的事——

LAION 团队从 CommonCrawl 里捞出 1.3B 个平台特定视频 URL,下载了 80M 个共 1000 万小时(≈ 1141 年连续播放)的音视频双模态数据。 每一段都配了视频 caption + 音频 caption。 而且——全开源

1000 万小时比 HowTo100M(约 13.6 万小时)高出近两个数量级,比 YouTube-8M 标签集(约 50 万小时)高近两个数量级

为什么这件事重要?因为今天的视频 / 音频多模态预训练一直被"数据不够大、不够开放、不够对齐"三个字悄悄卡住——而 LAION-BVD 把这三个限制一次性拆掉。


0 · TL;DR(30 秒版)

arXiv 2608.24845 解决一件具体的事:

多模态预训练进入"视频 + 音频"原生训练阶段后,缺的不是更强的模型,而是真正开源的大规模视频数据。LAION-BVD 发布 80M 视频、~1000 万小时的音视频双 caption 数据集,并发现"场景切换帧"可作为 image-text 数据源的补充——把视频/音频预训练推到 CommonCrawl 级别。

对从业者最直接的含义:视频 / 音频多模态研究终于有了一个"开源、可下载、可复现"的训练底座——从此"我没有好数据"不再是借口。


1 · 痛点:你以为数据够了,其实一直卡在三道门

1.1 卡点 1:开源数据根本不够大

现存大规模视频数据集几乎都带限制:

  • YouTube-8M:标签集约 50 万小时,仅给元数据,原始视频不公开;
  • HowTo100M:约 13.6 万小时,平台访问受限、版权问题;
  • WTS:类似限制。

研究社区想复现"千万小时级训练"实验?基本没门。大厂内部有数据,但论文里的 SOTA 你无法独立验证。

1.2 卡点 2:音频 + 视频对齐数据稀缺

很多视频数据集只有视频、没有同步的音频 caption——你拿它做 audio-text 任务(音频检索、音频问答、音频 captioning)就缺一半。

要找到"音视频双 caption 对齐"的数据集,2026 年之前只有 LAION-BVD 把这条路打通了。

1.3 卡点 3:通用预训练范式在视频侧未到位

图像侧有 LAION-5B、DataComp 这种通用开源基准——研究者可以直接对照 scaling law。视频侧的对应物一直未到位,每个团队都要自己爬、自己清洗、自己 caption——成本极高。

LAION-BVD 把视频侧的"CommonCrawl"做出来了。


2 · LAION-BVD 怎么做"1000 万小时开源"

2.1 整条流水线

CommonCrawl WARC
   ↓ (规则抽取 platform-specific video URL)
1.3B URL 集合
   ↓ (下载 + 完整性 / 时长校验)
80M 已下载视频(~1000 万小时)
   ↓ (内容感知场景切分:shot detection + 场景边界)
N 个 clip(按内容变化切而非固定步长)
   ↓ (合成 caption:视频 + 音频分别生成)
aligned (video_caption, audio_caption) pairs

关键工程点:

  • URL 阶段 1.3B、下载阶段 80M——比例约 6%,意味着大量 URL 是失效 / 私有 / 删除 / 限速的。但 1.3B URL 这个数本身已经把"可下载视频总量"明确化;
  • 场景切分是内容感知(content-aware scene detection)而非固定时间窗——保证 clip 在语义上有意义,caption 也更有信息量;
  • caption 合成对视频与音频分别进行——最后得到 (video_caption, audio_caption) 对,可用于视频文本、音频文本、视听多模态任务。

2.2 副产物:场景切换帧作为 image-text 数据源

论文里有一个看似副线、但工程上重要的发现:场景切分时会自然得到"场景切换帧"——这些帧在视觉分布上与"标准网络图片语料"显著不同。把它们当作 image-text 数据单独训练,模型在 image-text retrieval 上表现强劲。

直觉:场景切换帧通常捕捉"过渡瞬间",构图与统计特征跟"网页图片 = 单帧 + 文本"的世界不一样,是一个被忽视的 image-text 数据源。

2.3 模型规模 + 训练量双轴 scaling

论文给出的实验设计有两个轴:

  • 模型规模:1× / 3× / 9× 等不同大小——性能随规模稳定提升;
  • 训练量:训练 tokens / hours 增长——性能随训练量稳定提升;
  • 任务:video-text retrieval / audio-text retrieval——与同期同规模数据持平或领先。

与同期 ImageNet-style scaling law 在视频侧呼应——第一次在视频/音频侧看到稳定的 scaling


3 · 普通读者最该记住的 4 件事

1️⃣ "1000 万小时 ≈ 1141 年"是个让人记住的对照——把抽象数字具象化,是科普最该做的事:比 HowTo100M 高两个数量级,比 YouTube-8M 高近两个数量级;

2️⃣ 开源才是真贡献:很多视频数据集只给元数据不给视频、或受平台访问限制。LAION-BVD 的"全开源"是真正的科研基础设施级贡献,不是"又一个大模型";

3️⃣ 音频 + 视频双 caption 是被忽视的资源:audio-text 任务(音频检索、音频问答、音频 captioning)的研究者会直接受益——以前没有大规模音视频对齐训练源,现在有了;

4️⃣ 场景切换帧是被忽视的 image-text 数据源:免费的副产品,可以低成本用作 image-text 训练增强——这是一类被忽视的"分布",值得更多探索。


4 · 这篇论文为什么和你(普通读者)有关?

  • 如果你是视频 / 音频多模态研究者:直接接入 LAION-BVD,评估自家方法在 1000 万小时开源数据上的 scaling 行为——从此"我没有好数据"不再是借口;
  • 如果你是大模型数据工程师:CommonCrawl → 视频 URL → 下载 → 切分 → caption 这条流水线可以照搬到内部爬虫,是构建私有 dataset 的最小范式;
  • 如果你是 audio-text 任务研究者:直接利用 audio caption 做开源训练基线——AudioCaps、Clotho 这些数据集规模小一个量级,LAION-BVD 是新基准;
  • 如果你是关注大模型伦理与开源合规的研究者:评估 license / 隐私 / NSFW 的处理范式——LAION-5B 的 Safety Classifier 是先例;
  • 如果你是普通 AI 关注者:下次看到"我们的视频模型在 100 万小时数据上训练"的宣传,问一句"开源吗?可下载吗?音视频对齐吗?"——这三条筛掉 80% 的过度宣传。

5 · 一句话总结

视频 / 音频多模态预训练第一次有了"开源、可下载、可复现"的千万小时级底座——LAION-BVD 用 80M 视频 / 1000 万小时把这条路打通了,并顺手挖出一个被忽视的 image-text 数据源(场景切换帧)。 它不是"又一个更大模型",是真正的科研基础设施级贡献——从此研究者不必再为"没有好数据"找借口。


三个标题变体

  1. 《当 AI 终于有"足够多的视频"可看——arXiv 2608.24845 把 1000 万小时开源视频砸进训练池》
  2. 《1000 万小时 ≈ 1141 年:arXiv 2608.24845 把视频/音频预训练推到 CommonCrawl 级别》
  3. 《"我没有好数据"不再是借口——arXiv 2608.24845 发布首个千万小时级开源视频/音频数据集》

📱 小红书风格卡片文案

🎬 当 AI 终于有"足够多的视频"可看

你猜——

现在大模型能看图、能听懂你说话、能精准找到视频里"猫从沙发上跳下来那一帧"。 但训练它的视频总共有多少小时?

答:在 LAION-BVD 之前,很多所谓"超大视频数据集"其实只给你元数据或几万小时。 真要上千万小时的开源视频?2026 年之前基本是个空白

这就像你想教孩子认世界,但只给他看了 10 本绘本、5 部动画片,就让他去街上认人和车。

arXiv 2608.24845(LAION-BVD) 改变规则——

🔸 核心数字: ① 从 CommonCrawl 捞出 1.3B 个视频 URL ② 下载了 80M 个视频 ③ 共 1000 万小时音视频双模态(≈ 1141 年连续播放) ④ 全开源视频 + 音频双 caption 对齐 ⑤ 1000 万小时比 HowTo100M 高两个数量级

🔸 核心机制: ✅ CommonCrawl → URL → 下载 → 内容感知切分 → 双 caption——经典流水线视频版 ✅ 场景切换帧副产物——可作为 image-text 数据增强的免费新源 ✅ 模型 + 训练量双轴 scaling 稳定——视频侧首次看到稳定 scaling law

🔸 3 个普通读者最该记住的点: 1️⃣ "1000 万小时 ≈ 1141 年"——比 HowTo100M 高两个数量级,是开源视频数据的新基准 2️⃣ 开源才是真贡献——很多数据集只给元数据,LAION-BVD 的"全开源"是科研基础设施级贡献 3️⃣ 音频 + 视频双 caption 是被忽视的资源——audio-text 研究者直接受益

🔸 谁该读: 📌 视频 / 音频多模态研究者——直接接入评估 scaling 📌 大模型数据工程师——流水线可照搬 📌 audio-text 任务研究者——新基准 📌 关注大模型伦理与开源合规——评估 license / NSFW 处理范式

AI #视频理解 #音频AI #多模态 #开源数据集 #LAION #大模型训练 #数据基础设施