LAION-BVD:一千万小时的开源视频数据集,把多模态预训练推到 CommonCrawl 级别

  • 关联论文:2608.24845
  • 作者:flyP
  • 更新:2026-08-26

一句话结论

LAION-BVD 是 LAION 团队发布的开源视频数据集,从 CommonCrawl 中捞出 1.3B 平台特定 URL,下载 80M 视频共约 1000 万小时音频视频双模态数据;用内容感知场景切分得到 clip 并合成视频 / 音频 caption,训练出的模型在 video-text、audio-text 标准 benchmark 上随训练量与模型规模稳定提升,并意外发现"scene-changing frames"可替代部分 image-text 数据。

解决什么真问题

多模态预训练进入"视频 + 音频"原生训练阶段后,缺的不是更强的模型,而是:

  1. 没有真正"开源"的视频大数据集:现存大规模视频数据集(YouTube-8m、HowTo100M、WTS)通常带平台 access 限制 / 仅给元数据 / 含版权和水印问题,研究社区无法复现同等规模实验;
  2. 没有与图像预训练同级别的"通用视频预训练范式":图像侧有 LAION-5B、DataComp 等开源大库作为通用基准,视频侧的对应物一直未到位;
  3. 音频 + 视频联合 caption 稀缺:很多视频数据只有视频、没有同步的音频 caption,无法直接用于 audio-text 对齐。

LAION-BVD 把这三条一次性解决。

核心方法

数据采集流水线

整条流水线是经典的 CommonCrawl → 视频 URL 抽取 → 下载 → 内容感知切分 → caption 合成:

CommonCrawl WARC
   ↓ (规则抽取 platform-specific video URL)
1.3B URL 集合
   ↓ (下载 + 完整性 / 时长校验)
80M 已下载视频(~1000 万小时)
   ↓ (内容感知场景切分:shot detection + 场景边界)
N 个 clip(按内容变化切而非固定步长)
   ↓ (合成 caption:视频 + 音频分别生成)
aligned (video_caption, audio_caption) pairs

关键工程点:

  • URL 阶段 1.3B、下载阶段 80M——比例约 6%,意味着大量 URL 是失效 / 私有 / 删除 / 限速的,但 1.3B URL 这个数本身已经把"可下载视频总量"明确化,研究者可以直接对照自家爬虫差距;
  • 场景切分是内容感知(content-aware scene detection)而非固定时间窗,这保证 clip 在语义上有意义,caption 也更有信息量;
  • caption 合成对视频与音频分别进行,最后得到 (video_caption, audio_caption) 对,可用于视频文本、音频文本、视听多模态任务。

Scene-changing frames 的副产物

论文里有一个看似副线、但工程上重要的发现:场景切分时会自然得到"场景切换帧"——这些帧在视觉分布上与"标准网络图片语料"显著不同。把它们当作 image-text 数据单独训练,模型在 image-text retrieval 上表现强劲。

直觉:场景切换帧通常捕捉"过渡瞬间",构图与统计特征跟"网页图片 = 单帧 + 文本"的世界不一样,是一个被忽视的 image-text 数据源。

关键实验与数据

论文给出的实验设计有两个轴:训练量(模型规模扩展)与训练 prompt/小时数(数据规模扩展)。

轴 维度 实验观察
模型规模 1×/3×/9× 等不同大小 性能随规模稳定提升
训练量 训练 tokens / hours 增长 性能随训练量稳定提升
任务 video-text retrieval / audio-text retrieval 与同期同规模数据持平或领先
副产物 scene-changing frames 当 image-text 训练 image-text retrieval 表现强劲

需要诚实标注的几处 ⚠️:

  • ⚠️ 论文 abstract 没给具体的 benchmark 分数 / 数值表(v1 摘要阶段),详细 SOTA 对比需读 PDF §4 主表与附录;
  • ⚠️ 1000 万小时这个量级对应"训练一周期"的 FLOPs / carbon footprint 原 abstract 未明确;
  • ⚠️ "平台特定"具体指向哪些平台(YouTube / Vimeo / Bilibili …)原 abstract 没有列出,只能从 CommonCrawl 的 platform 维度推断。

亮点与局限

亮点

  1. 量级真正的开源:1000 万小时 ≈ 1141 年单流连续播放,作为对比,HowTo100M 约 13.6 万小时,YouTube-8M 标签集约 50 万小时——LAION-BVD 比已知公开视频数据高出近两个量级;
  2. 音频 + 视频双 caption 同步:是当前少有的"audio-text 对齐训练数据"开源来源,audio-text 任务(AudioCaps、Clotho 等)的研究者会直接受益;
  3. Scene-changing frames 副产物:把"切分算法 + 视觉分布差异"做成了一类新数据源,给 image-text 训练额外选项;
  4. LAION 团队的工程执行力:从 1.3B URL → 80M 下载的整条清洗管线,是 LAION 在图像侧建立的工程文化在视频侧的延续;
  5. 与同规模训练曲线:模型与数据双轴都观察到稳定 scaling,与同期 ImageNet-style scaling law 在视频侧呼应。

局限

  • ⚠️ license / 内容审核问题:和 LAION-5B 类似,爬来的平台视频可能含版权、含未成年人面孔、含 NSFW;具体 license 与安全审计在 abstract 中未明确,需查 PDF §5 与官方 release notes;
  • ⚠️ 存储 / 分发代价巨大:1000 万小时视频即使压成常用码率也需 PB 级存储,对大多数中小实验室复现是物理门槛——LAION 是否提供 streaming / torrent / 分布镜像,原文未明确;
  • ⚠️ caption 合成质量天花板:合成 caption 取决于 captioning 模型质量,没有公开 caption model 与合成提示模板的版本对齐细节;
  • ⚠️ 缺少与近期商用 video-text 数据集(如 InternVideo、Panda-70M、EchoVideo)的直接对比:原 abstract 只说"competitive",具体数字与口径需查主表;
  • ⚠️ 平台分布偏差:CommonCrawl 偏向英文与欧美平台,中文 / 多语种场景的覆盖度未在 abstract 给出。

对工程落地的启发

  • 做 video / audio 多模态研究:LAION-BVD 直接提供了一个开源可下载的训练源;接入时优先评估"覆盖度 vs 自己领域语料"是否够用,再决定是否混合。
  • 做 audio-text 任务:可以直接利用 audio caption 这条线做 audio-text retrieval、audio captioning、audio question answering 的开源训练基线。
  • 做 image-text 数据增强:scene-changing frames 是一类被忽视的分布,作为 image-text 数据的补充集可以低成本实验。
  • 工程 pipeline 复用:URL 抽取 → 下载 → 切分 → caption 的流水线可以照搬到内部爬虫,作为构建私有 dataset 的最小范式。
  • 存储与算力预算:研究团队立项前需要意识到"1000 万小时视频"已经是 infra 级门槛,应同时评估 streaming access 与 PB 存储。

与同方向工作的关系

  • 相对 LAION-5B(图像):是其在视频侧的对应物,从"通用大数据开源"路线延续;
  • 相对 HowTo100M / WTS / YouTube-8M:开源访问性显著更好(LAION-BVD 全量开源,后三者多有限制或仅元数据);
  • 相对 Panda-70M / InternVideo / 大厂内部视频数据集:LAION-BVD 是"非大厂内部"的对应物,规模相当或更大,但 distribution 与 caption 风格差异会影响 fine-tune 效果;
  • 相对 audio 专项数据集(AudioCaps、Clotho):LAION-BVD 提供了大约 1000 万小时量级的 audio-text 对齐数据,规模上是数个量级提升。

适合谁读

  • 做视频 / 音频多模态预训练的研究者:直接对照数据集接入,评估自家方法在 LAION-BVD 上的 scaling 行为;
  • 做大模型数据工程的工程团队:把 CommonCrawl → 视频 URL → 下载 → caption 这条流水线作为内部模板;
  • 做 audio-text 任务的团队:作为大规模 audio caption 训练来源;
  • 关注大模型伦理与开源合规的研究者:评估 license / 隐私 / NSFW 的处理范式。

信息源 / 数字核验表

项 来源 备注
标题 / abstract arxiv.org/abs/2608.24845 2026-08-25 v1
1.3B URL → 80M 视频 → 1000 万小时 arxiv abstract 原文 ✓ 与 paper_card TLDR 一致
作者数量(13 位,含 LAION / Bethge / Schölkopf) arxiv 页面 Authors 字段 ⚠️ paper_card 未记录,以原文为准
具体 benchmark 分数 / SOTA 对比表 需 fetch PDF §4 ⚠️ abstract 阶段无具体数字
license / NSFW 审计 / 存储分发方式 需 fetch PDF §5 + 官方 release notes ⚠️ abstract 阶段无明确信息
与商用数据集(Panda-70M 等)具体数字对比 需 fetch PDF §4 ⚠️ abstract 仅用"competitive"定性
论文卡 TLDR /shared/research-kb/organized/paper_cards/1091-2608-24845.md 与 abstract 一致

自检(机制 + 工程 + ⚠️)

  • 机制段:✓ CommonCrawl 抽取流水线、内容感知场景切分、caption 双模态合成、scene-changing frames 副产物
  • 工程段:✓ 1.3B → 80M → 1000 万小时数字链路、模型 / 数据双轴 scaling、audio-text 训练补足
  • ⚠️ 数字核验:6 处(具体 benchmark 分数 §4、license §5、存储分发、caption 模型版本、与商用数据集对比、作者数核验)

工程落地与核查(Jay)

实际系统怎么用

接入 LAION-BVD 的最小路径:

  1. 数据获取:LAION 官方通常提供 HF Dataset 镜像(laion-laion-bvd),但 80M 视频全集约 PB 级,需确认当前实际分发方式(torrent / 分片 CDN / 直接下载脚本);
  2. 子集筛选:大多数团队不需要全集,可按 duration > 10s AND language IN (en, zh) 等条件过滤,典型可用子集缩减到 5–20M clips;
  3. Caption 兼容:训练时需确认 caption 模型版本(论文未公开),建议用同期开源 captioning 模型(如 LLaVA-Video、VideoChat)做独立生成,不依赖原始 caption;
  4. Scene-changing frames 复用:可直接从原始 clip 提取场景边界帧,不额外付费。

典型存储预算(全集):

形态 估算量级 适用场景
原始视频(H.264,~720p) ~2–5 PB 仅大厂
降采样音频(16kHz mono) ~50–100 TB 可接受
clip 元数据 + caption ~5–20 GB 可接受
子集(语言 / 时长过滤后) 数十 TB 中等团队

坑在哪

  1. ⚠️ 成功率仅 ~6%:1.3B URL → 80M 视频,实际下载成功率 6%,意味着爬虫基础设施必须能扛 94% 的无效 / 限速 / 403 响应;需要分布式重试 + UA 轮换 + proxy pool;
  2. ⚠️ NSFW / 版权内容过滤缺失:论文未公开具体过滤规则,接入团队需要自行实现内容审核层(参考 LAION-5B 的 Safety Classifier),否则训练出的模型会继承有毒内容模式;
  3. ⚠️ Caption 模型不对齐:论文未公开 captioning 模型的版本与 prompt 模板,如果复现方用不同 captioning 模型,数据分布会产生偏移;建议在接入前先用视频子集做 qualitative spot-check;
  4. ⚠️ 平台 ToS 风险:CommonCrawl 的 platform-specific URL 大量来自 YouTube(≈ 估计 60–70%),YouTube ToS 明确禁止未授权下载,部分司法管辖区有合规风险;
  5. ⚠️ 子集偏差:CommonCrawl 偏向英文 / 欧美内容,中文视频覆盖率低;用全集训练的模型在中文下游任务上可能系统性弱于英文。

核查动作建议

  • [ ] curl -I https://huggingface.co/datasets/laion/laion-bvd 确认数据集当前在线状态与大小
  • [ ] 下载任意 100 条 caption 样例做质量抽检(长度的均值 / 中位数 / 分位数)
  • [ ] 确认 laion-bvd/safety 字段是否公开(已有 LAION-5B 先例表明安全标签不一定随全集发布)
  • [ ] 若做 audio-text:对齐的 audio caption 是否随全集发布,或需自行用 Whisper 类模型生成