MMProLong · 长上下文 VLM 继续预训练配方精读

  • 任务实例:flyP(2026-09-14 09:50 Asia/Shanghai 高频轮次)
  • 论文:Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
  • 作者/团队:Zhaowei Wang、Lishu Luo、Haodong Duan、Weiwei Liu、Sijin Wu 等(多机构,含 HKUST Yangqiu Song 组)
  • 链接:https://arxiv.org/abs/2605.13831(v1, 2026-05-13;标注 "work in progress")
  • 分类:多模态 · 长上下文 · 持续预训练 · 视觉-语言模型
  • 建议路径notes/multimodal/2026-05-MMProLong-long-context-LVLM.mdreviews/2026-09-MMProLong.md

1. 核心贡献

针对当前大视觉-语言模型(LVLM)从 32K 扩到 128K+ 长上下文时训练配方不透明、数据配比靠经验的问题,给出一份系统化的"长上下文继续预训练(LongPT)"消融研究,并产出可复现的模型 MMProLong(基于 Qwen2.5-VL-7B-Instruct,仅 5B token 增量预算):

  1. 数据形态消融:长文档 VQA 数据显著优于纯 OCR 转写数据;instruction-formatted 长数据让短上下文能力几乎不掉点,因此不必混入短数据
  2. 长度分布消融:平衡(混合 32K–128K 多档长度)> 单点聚焦(如只用 128K)训练;说明长上下文能力本质是跨长度、跨位置的"关键信息检索"能力,而非 128K 位置专精。
  3. 任务比例消融:检索(retrieval)仍是主要瓶颈,重检索、辅以少量推理数据配比最优。
  4. 泛化能力:MMProLong 在 256K / 512K(超出训练窗口 128K)上仍保持强性能,且零样本迁移到"网页多模态 needle-in-haystack"、"视觉-文本压缩"、"长视频理解"任务,无需任务专属训练。

论文把 "LongPT recipe" 写成一个明确配方:长文档 VQA + 多档长度 + 重检索 + 仅 5B token。可作为内部做长上下文 VLM 微调时的对照基线。

2. 主要问题与风险

  • "work in progress" 状态:v1 还没放出完整附录和评测脚本,5B token 的数据来源、长文档 VQA 的具体构造方式、消融表格这些关键细节要等正式版或 GitHub 仓库。待补查
  • 数据是否使用 Qwen2.5-VL 的原生数据,还是新合成?
  • "balanced length" 各档比例如何选?
  • 与 InternVL3 / Eagle 2.5 / LongVILA 等同期长上下文方案的可比性如何?
  • 基线公平性:以 Qwen2.5-VL-7B 为底,但没有给出与"同 token 量下继续 SFT / 继续 OCR 转写"的同预算对照;如果同等 5B token 跑纯 OCR 转写基线,差距是否会收窄?实验风险点
  • 泛化声明:网页 needle、视觉-文本压缩、长视频三项的零样本迁移是亮点,但评测集规模、采样偏差、与专用长视频模型(VideoLLaMA3 / LongVU)的差距没在摘要里说清楚。复现难度:中
  • 检索瓶颈结论的可推广性:检索重于推理的结论来自内部数据配比,未必适用其他底座(如 InternVL3、LLaVA-OneVision)。结论可信度高但范围受限。
  • 缺少对"长上下文失败模式"的分析:摘要只给平均提升 7.1%,未拆分跨长度位置(U 型曲线?中段塌陷?)、跨图像/视频模态

3. 可信度判断

  • 数据点合理性:5B token 取得 +7.1% 长文档 VQA、在 128K 之外还能泛化到 256K/512K,与 LongLoRA / Eagle 2.5 等长上下文 SOTA 的趋势一致,可信度中高。
  • 方法论:三组消融(数据形态 / 长度分布 / 任务比例)方向正确,且结论彼此自洽。
  • 局限性:报告期较短、评测集仅"代表性"四类,不能直接断言是 SOTA;更适合作为"训练配方参考"而非"排行榜第一"。
  • 整体评级:方法学贡献 > 模型本身。可信度 B+(arXiv 在投,未见同行评审)。

4. 是否建议入库

建议入库,理由: - 与 flyP 既有长上下文/多模态笔记(Image-Tokenizers、WMRL 等)形成互补,专攻训练侧而非模型架构。 - 5B token 预算对中小机构复现友好,可作为内部训练团队的对照基线。 - "检索是主要瓶颈"与"长度平衡 > 单点聚焦"两条经验,对内部 RAG/长文档 Agent 选型有直接指导价值。

5. 后续验证动作

  1. 追踪正式版 / GitHub:等作者放出代码与数据卡后核对 5B token 的具体来源。
  2. 横向对照:与同期 arXiv 2604.x 的 LongVL / LongVILA2、Eagle 2.5 (arXiv:2504.15271) 做"同预算同底座"消融。
  3. 内部复现建议:用 Qwen2.5-VL-7B 跑 5B token 的"长文档 VQA + 多档长度 + 重检索"配方,对照纯 OCR 转写基线,验证 +7.1% 是否可重复。算力门槛约 8×H100 训练 3-5 天。
  4. 关注评测补强:建议作者补充 MMLongBench、MileBench、LongVideoBench 上的拆分结果(按位置、按长度)。

6. 一句话总结

一份"小预算、可复现、检索优先"的长上下文 VLM LongPT 配方,方法学价值高于排行榜价值;适合入库作为训练团队参照基线,但需等正式版补全数据卡与对照实验。