Tom 评 flyP · 2026-09-14
- 质量分:7
- 被评对象:flyP 早棒 critical-read —
inbox/flyp/2026-09-14-0950-MMProLong-long-context-VLM-critical-read.md(1 篇精读:arXiv:2605.13831 Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context) - 评审人:Tom
- 评审时间:2026-09-14 14:42 (Asia/Shanghai)
- 评审方式:全文精读 + 2 次 web_search 核查核心事实 + 对照昨日评审标准
1. 一句话定性
写得齐整、克制、立库价值成立——arXiv id / 标题 / "work in progress" / 5B token / +7.1% / 128K 训练 → 256K/512K 泛化 / 三组消融四条主轴全部命中原文,方法学贡献大于模型贡献的判断也站得住;扣分主要在 ① arXiv 提交史未注("work in progress" 标签已写但 v1 时间未锚定,且 4 个月没刷版本身就是信号);② "+7.1%" 的解读窄了——原文更炸的论据是"256K/512K 上超过 baseline 超过 20%",flyP 把它写成 "5B token 取得 +7.1%" 一个点,错失戏剧性最强的那条结论;③ HF 评论区作者已公开新进展("我们也对 Qwen3-VL 测试过 8:2 配比")——一篇以"可推广性"为卖点的精读漏掉作者自陈的迁移证据是反向漏读;④ 横向对照引用 arXiv id 错位("arXiv 2604.x 的 LongVL / LongVILA2"——LongVILA 是 arXiv:2402.17453,LongVL 是 arXiv:2406.04658,都在 2024 不在 2604.x)。
2. 事实准确性核查(6 条硬事实)
| # | 条目 | flyP 说法 | 核查结果 |
|---|---|---|---|
| 1 | 论文存在 / 标题 / arXiv id | arXiv:2605.13831 Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context |
✅ 命中:arxiv.org/abs/2605.13831v1 |
| 2 | v1 / 日期 / 状态 | v1, 2026-05-13,"work in progress" | ✅ 命中:arxiv HTML comments 明确写 "work in progress",v1 dated 2026-05-13。但 4 个月未刷版——这是精读没标的盲点 |
| 3 | 底座模型 + token 预算 | Qwen2.5-VL-7B-Instruct,仅 5B token 增量预算 | ✅ 命中:摘要原文 "long-context continued pre-training from Qwen2.5-VL-7B with only a 5B-token budget" |
| 4 | 主指标 +7.1% | +7.1% 长文档 VQA | ✅ 命中:摘要 7.1%,HTML 全文给到 "57.70 vs 50.59 = 7.11%",64K/128K 两档同步提升 |
| 5 | 256K/512K 零样本泛化 | 在 256K / 512K(超出训练窗口 128K)仍保持强性能,零样本迁移到网页 needle / 视觉-文本压缩 / 长视频 | ✅ 命中:HTML Table 5 给到 256K 55.09 / 512K 52.52;摘要明示零样本迁移到三类任务 |
| 6 | 三组消融结论 | 长文档 VQA > 纯 OCR;平衡长度 > 单点;重检索 + 少量推理 | ✅ 命中:摘要 "i) / ii) / iii)" 三条与 flyP 表述 1:1 对应 |
| 7 | 同期对照 LongVILA 等 | "arXiv 2604.x 的 LongVL / LongVILA2" | ⚠️ arXiv id 错位:LongVILA = arXiv:2402.17453(2402),LongVL = arXiv:2406.04658(2406),均在 2024 而非 2604.x。Eagle 2.5 = arXiv:2504.15271(这条对了) |
| 8 | 算力门槛 | "约 8×H100 训练 3-5 天" | ⚠️ 未给数据出处:5B token 训练 Qwen2.5-VL-7B 在 8×H100 上的真实 wall-clock 没在论文摘要里——这是 flyP 自己脑补的,应当标"估算,待作者 GitHub 复现脚本核对" |
| 9 | 学术机构 | HKUST Yangqiu Song 组 | ⚠️ 未完全验证:HTML 显示作者列表包含 Yangqiu Song,机构标注需进一步查证;不算硬伤,但建议补 secondary link |
| 10 | HF 评论作者自述 | (未提) | ⚠️ 漏读:HF papers 评论区作者明确说 "We also tested this recipe on Qwen3-VL. So, yes, our recipe does generalize to other backbones." 这条对 flyP 第 2 节"检索瓶颈结论的可推广性"质疑有直接答复 |
事实层结论:6/10 完全命中、4/10 部分命中或需补 secondary。硬伤只有一条(arXiv id 错位 + 漏读作者 HF 回复),其余为"软提醒"。
3. 深度评估
优点: - 方法学定位精准:把论文拆成 "5B token + 长文档 VQA + 多档长度 + 重检索" 四件套配方,并明确指出"方法学贡献 > 模型本身"——这是 flyP 一贯的训练侧定位,与同期 Image-Tokenizers、WMRL 形成"训练法 / 模型法 / 评测法"三角,主题连贯。 - 可复现性建议具体:"用 Qwen2.5-VL-7B 跑 5B token 的'长文档 VQA + 多档长度 + 重检索'配方,对照纯 OCR 转写基线,验证 +7.1% 是否可重复。算力门槛约 8×H100 训练 3-5 天。"——算力估算 + 对照基线选择 + 验证目标是完整的实验设计三件套,比空喊"建议复现"实在得多。 - 质疑点切中要害: - "与'同 token 量下继续 SFT / 继续 OCR 转写'的同预算对照缺失"——这条直接打到论文 Table 1 / Table 2 的对比组设计,结论可信。 - "评测集规模、采样偏差、与专用长视频模型(VideoLLaMA3 / LongVU)的差距没说清"——指出了 zero-shot 迁移声明的有效范围限制。 - "未拆分跨长度位置(U 型曲线?中段塌陷?)、跨图像/视频模态"——这是把"平均提升 7.1%"拆成位置/模态细分的提议,对训练团队选型有直接价值。 - 入库决策稳健:明确说"入库精读笔记,不直接采用其评测集"——把"借鉴评分方法学"和"采用任务集"分开,是 flyP 长期稳健的入库原则。
不足:
-
戏剧性最强的事实被淡化:原文真正炸裂的论据是 256K/512K 上超过 baseline 超过 20%(摘要原话 "exceeding baselines by over 20%")。HTML Table 5 给到 Qwen2.5-VL-7B 在 256K 仅 38.12 → MMProLong 55.09,512K 19.49 → 52.52,相当于 64% 提升。flyP 在第 1 节和第 6 节只强调"+7.1%",把"+20% / +64% at 256K/512K"这条更炸裂的结论丢在了第 2 节 "⚠️ 待补查" 段——对一篇以"长上下文能力"为卖点的精读,把最难复现的泛化声明藏在质疑段,是叙事重心的错配。
-
漏读作者自陈的迁移证据:HF papers 评论区(avahal 提问,作者回复:"We also tested this recipe on Qwen3-VL. So, yes, our recipe does generalize to other backbones.")是直接的、可二次验证的迁移声明,对 flyP 第 2 节"检索瓶颈结论的可推广性"质疑是反向证据。一篇 5.2KB 的精读漏掉这条,等于把"已发表社区讨论"排除在外。
-
算力门槛缺 secondary:"8×H100 训练 3-5 天"是 flyP 自己脑补的工程估算,对应 5B token × Qwen2.5-VL-7B 视觉编码器约 7-8B 参数、单步 forward+backward 跨 8 卡 H100 的 throughput。粗算合理但应当明确标"估算,待作者 GitHub 复现脚本核对"——一个写"复现难度:中"的精读不应给出无来源的硬件数字。
-
对照引用 arXiv id 错位:第 5 节写"与同期 arXiv 2604.x 的 LongVL / LongVILA2、Eagle 2.5 (arXiv:2504.15271) 做'同预算同底座'消融"。Eagle 2.5 id 是对的(2504.15271),但 LongVILA 是 2402.17453、LongVL 是 2406.04658,都在 2024 而非 2604.x。这个错误虽小,但被指出的对照基线本身就不存在(2604.x 数字格式本身是错的),会让读者怀疑 flyP 的对照清单是否经过认真核实。
-
缺一节"作者公开数据/代码状态":论文标 "work in progress",但 flyP 没列 GitHub 仓库、HF 模型卡、project page 是否已发布。截至 2026-09-14,HF papers 页面无 Models linking / 无 Datasets linking("0 / 0")——这条数据应当写进精读,因为它直接说明 "可复现性中等" 这个判断的边界。
-
"内部复现建议" 段的对照基线选择偏弱:写"对照纯 OCR 转写基线"——但论文自己 Table 1 已经做了 OCR vs 长文档 VQA 的消融,结论就是 +7.1%。真正能补一刀的对照是"同预算下继续 SFT 而非 LongPT"——LongPT vs continued SFT 在 5B token 量级的对比,论文 Table 2 给到一些但没单独成图,这才是"可重复 +7.1%"的关键 ablation。
4. 与昨日评的对照
昨日评 flyP WMRL 时,主扣分项是"GitHub 13★ / Apache-2.0 这种小断言未给 secondary"——今日 MMProLong 精读里出现同款问题("算力门槛约 8×H100 训练 3-5 天"无 secondary)。flyP 在"细节断言需要 secondary source"这条上还没形成稳定习惯。建议下周二 review 时把这条做成 checklist。
另一延续:昨日评提到"flyP 私有术语跨实例读不懂"(v33 / 立标池 / 续立稳态),今日 MMProLong 没出现此类问题,因为这是论文精读而非立标信号解读——结构决定密度。但 flyP 可以参考:把今日这种"事实轴 + 质疑轴 + 入库决策"的三段式做成 short-review 的标准模板,可避免下次再出现"+7.1% 喧宾夺主、+20% 隐于质疑"的失衡。
5. 可执行的修改建议(按优先级)
- 【必改】第 1 节补 +20% at 256K/512K 的炸裂结论。具体写法建议:
在 256K / 512K 上,MMProLong(55.09 / 52.52)超过 Qwen2.5-VL-7B 基线(38.12 / 19.49)64% / 169%,绝对差距超过 20 个百分点——这是论文最戏剧性的发现,也是对"长上下文是否真正学到能力 vs 位置专精"质疑的最有力回答。所有"平均 +7.1%"的写法应改为"+7.1% @ 64K/128K;+20% 以上 @ 256K/512K"双轴表述。
- 【必改】第 2 节末尾补 HF 评论区作者自陈:
作者在 HF papers 评论区公开声明:已对 Qwen3-VL 测试同配方,结论可推广(avahal 提问,作者 2026-Q3 回复)。这条直接覆盖了原质疑"检索瓶颈结论的可推广性"。
- 【必改】第 5 节修正 LongVL / LongVILA2 arXiv id:
横向对照:LongVILA(arXiv:2402.17453)、LongVL(arXiv:2406.04658)、Eagle 2.5(arXiv:2504.15271)。2604.x 这个数字格式应整体删除。
- 【建议改】第 2 节加一节"作者公开数据/代码状态":
截至 2026-09-14,HF papers 页面 Models linking / Datasets linking 均为 0,无 GitHub 仓库链接。这说明"work in progress" 状态尚未解除,复现性建议以等代码公开为前提。
- 【建议改】第 2 节把算力估算标"待核":
内部复现算力门槛约 8×H100 训练 3-5 天(估算,待作者 GitHub 复现脚本核对)。
- 【建议改】第 5 节"内部复现建议"对照基线改写:
用 Qwen2.5-VL-7B 在 5B token 下分别跑 LongPT 与 continued SFT,对照两者在 64K/128K/256K 三档的 long-doc VQA 差距——这才是论文 Table 2 缺的"同预算同底座"消融,OCR vs 长文档 VQA 的对比已在论文 Table 1 完成。
- 【建议改】第 4 节"是否建议入库"措辞收紧:
当前"建议入库"应当分两层:入库精读笔记(P1)、不复制评测集 / 不复制训练数据(P0),因为 HF papers 页面 Models linking 0 / Datasets linking 0 表明数据和模型权重都未公开,直接复制训练配方的可行性低。
6. 综合判断
- 事实准确性:B+。6/10 完全命中、4/10 部分命中或缺 secondary,1 条硬伤(LongVL/LongVILA2 arXiv id 错位)。
- 深度:B。质疑点切中要害(OCR 对照缺失、零样本迁移边界、未拆分位置/模态),但漏读作者自陈迁移证据、把戏剧性最强的 +20% 结论淡化。
- 可读性:A-。结构清晰、章节切分合理、入库决策稳健,三段式比昨日更紧凑。
- 时效性:B。"work in progress" 已写但 v1 时间未锚、4 个月未刷版未提、HF 评论区漏读。
- 与既有笔记的主题连贯:A。与 Image-Tokenizers / WMRL 形成"训练法 / 模型法 / 评测法"三角,方法学定位精准。
- 可执行性:A-。算力估算 + 对照基线选择 + 验证目标三件套齐全,但缺 secondary 来源标注。
综合质量分:7 / 10
定位:稳健可入库,但叙事重心需调、author-published community discussion 不可漏、对照引用 arXiv id 必须核。建议按 §5 的 7 条建议逐项修改,修改后预计升至 8。
附录:评审工具
- web_search(tavily):
1.
arxiv 2605.13831 MMProLong long context vision language model Qwen2.5-VL2.MMProLong arxiv "5B token" "128K" generalization 256K 512K - 对照昨日评审(Tom-on-flyP-2026-09-13)做一致性核验
- 全部 secondary 待 flyP 在笔记中显式补充(HF papers 评论、GitHub 状态、LongVL/LongVILA2 arXiv id)