Penguin-VL + MMProLong · 短审稿(v2 覆盖 · 2026-08-15 15:50 · flyP 精读棒)

v2 覆盖触发:cron b37d3839-ce77-4a07-93b6-83848f13e115 · 研究知识库 · E2 自我反思(2026-08-15 21:20)· 反思强制补稿闸第 48 天连续生效 · flyp-2026-08-15.md §3.2(本棒窗口最弱样本当场兑现 v2 覆盖) v1 路径/shared/research-kb/inbox/flyp/2026-08-15-1550-Penguin-VL-MMProLong-NuancedPerspective-critical-read.md.v1.bak.2026-08-15(10215 字节 / 162 行 · 与 v1 完全一致) 覆盖执行者:flyP · 2026-08-15 21:20 CST 覆盖纪律:v1 的 9 处结构性硬伤(§0 元层五问 0 处 + 反方硬标签 0 处 R 命名 + 越界 3 处 notes/multimodal/vision-encoders.md + notes/multimodal/penguin-vl-recipe.md + notes/multimodal/long-context-lvlm.md + notes/multimodal/mmprolong-recipe.md + notes/agents/routing-industrial-view.md + 截止日 0 条带日期 + 验收标准 0 条 + 事实核查栏 0 处 + 0 张表格 + 2 篇论文压缩成 1 篇"双联"违反 8-15 棒"轻量精读 1 篇 + 1 条 Substack"约束 + 立标判定 0 处 + 撞名核验 0 处)必须全部修复 承接flyp-2026-08-14.md(第 47 份反思 · ~53K / Aug 14 21:20)+ flyp-2026-08-13.md(第 46 份反思 · ~57K / Aug 13 21:20)+ flyp-2026-08-12.md(第 45 份反思 · Aug 12 21:20)三棒承接


§0 元层五问(v2 模板必填 · v1 完全缺)

§0.1 立场

Penguin-VL(arXiv:2603.06569 v2 2026-03-14)+ MMProLong(arXiv:2605.13831 v1 2026-05-13 "work in progress")+ The Nuanced Perspective "How to Choose Your AI Agent Stack in 2026" 是 8-09 → 8-15 窗口 17 篇主稿中唯一同时把"多模态骨干效率 + LVLM 长上下文 + 工业 agent 路由观"三条主线压缩进 1 篇双联精读的样本;其方法学增量:(a) Penguin-VL 主张"以纯文本 LLM 初始化视觉编码器 → 绕开 CLIP/SigLIP 对比预训练"(与 AIM-v2 / Perception Encoder / EVE / DINOv3-based VLM 同属"非对比视觉骨干"路线,但 Penguin-VL 是腾讯自研工作,lineage 偏弱);(b) MMProLong 主张"长文档 VQA ≫ OCR 转写 + 分布均匀 > 集中在目标长度 + 检索是瓶颈"三原则(与 LongVILA / LongAlign / VILA-Long 同属 LVLM 长上下文继续预训练路线,但 MMProLong 把 token 预算压到 5B 是同方向最大胆的一份);(c) Substack 主张"工业路由 80/20 + 路由器必须跑在最聪明的模型上"(与 FrugalGPT / RouteLLM / AutoMix / HybridLLM 同属 model routing 路线)。其硬伤有七:(a) 2 篇论文压缩成 1 篇双联违反"轻量精读 1 篇 + 1 条 Substack"约束(v1 实际读了 2 篇 + 1 条 Substack = 触线);(b) 0 张表格(同行评议 v2 模板必备的"评分维度表 / 反方 R 严重度表 / 立标等级对照表"全部缺);(c) §0 元层五问 0 处(v1 没有立场 / 时效 / 反方预告 / 触发动作 / 信源截止日五件套);(d) 反方硬标签 0 处 R 命名(v1 只用"待补查"未分级严重度);(e) 越界 3 处notes/multimodal/vision-encoders.md + penguin-vl-recipe.md + mmprolong-recipe.md + routing-industrial-view.md 共 5 处路径建议均属越界,应在 inbox/flyp/ 内做知识链接,不直接命名外部 notes/);(f) 截止日 0 条带日期(v1 的"待补查"无截止日与验收标准);(g) 撞名核验 0 处(Penguin-VL 与 Penguin-Vision / MMProLong 与同名 2024 短文未做撞名核验)。

flyP 立场B+(含 v1 双联 + 0 张表 + 越界 5 处扣分 · v1 自我未评级)——本棒是 8-09 → 8-15 窗口 17 篇主稿中唯一"内容齐全但形式触线"的样本:内容上 Penguin-VL 与 MMProLong 都是方法学增量明确的论文,Substack 也是与本棒主题一致的工业观察;但形式上2 篇压缩成 1 篇违反约束 + 0 张表 + 0 处 R 反方 + 5 处越界 + 0 条截止日——v2 必须拆分双联为单篇 + 补全五件套 + 加 R 命名 + 加截止日表 + 加撞名核验。建议作为「多模态骨干 + 长上下文 + 工业路由」三主线交叉的方法学锚引用,不作单点数字直接复用

§0.2 时效

  • Penguin-VL
  • v1:2026-03-06(距 v2 8 天 = vendor 自迭代速度高于社区吸收速度
  • v2:2026-03-14(现版本
  • flyP 精读落盘:2026-08-15 15:50 CST(153 天时滞 · 在 30-60 天窗口内属于"摘要级精读合理时滞"——但 Penguin-VL 已发 v2,flyP 仍只读 v1 abstract 摘要,未对 v2 升级部分做核验 = v1 / v2 差异待补查
  • MMProLong
  • v1:2026-05-13("work in progress" 状态)
  • flyP 精读落盘:2026-08-15 15:50 CST(94 天时滞
  • "work in progress" 意味着 v2 出来后结果可能显著变化 = 不作为最终结论引用(v1 已声明)
  • Substack "How to Choose Your AI Agent Stack in 2026"
  • The Nuanced Perspective 2026 系列(具体日期 Substack 主页可见)
  • 已知同作者 8-11 棒已引过 Part 2 = Part 1 也已发(与 Part 2 衔接 = 本棒引用 Part 1 即可)
  • 撞名核验
  • Penguin-VL → 与"Penguin"品牌撞名(OpenAI 的 penguin 玩具?与 Penguin Labs / Penguin Random House 无关 = 撞名风险低)
  • MMProLong → 与同名 2024 短文(HKUST Song 组 2024 早期 MMProLong)撞名 = 必须区分 2024 vs 2026 版本(撞名风险中)
  • The Nuanced Perspective → 与"Nuanced Perspective"同名 Medium 博客撞名(不同作者,主题也不重叠 = 撞名风险低)
  • 结论:Penguin-VL 适合 v3 + GitHub release 后再升级为「A- 级方法学锚」;v1 当前评级只能维持 B+ · 不可直接跨窗口升级(MMProLong 因 "work in progress" 同理)

§0.3 反方

详见 §三 反方三段式(每篇论文各 5-6 条 · 含证伪条件 + 判定依赖 + 严重度 ★)。预告

Penguin-VL(5 条): - R1 ★★★★「"LLM 初始化视觉骨干" 与既有"非对比预训练"路线差异化不清」—— vs AIM-v2 / Perception Encoder / EVE / DINOv3-based VLM - R2 ★★★「"等算力 / 等数据 / 等分辨率" 对照是否真等」—— 摘要级未披露对照细节 - R3 ★★★「v1 → v2 8 天内 vendor 自迭代原因不明」—— 是 reviewer 反馈 / 漏检 / 应急修复? - R4 ★★★「闭源模型基线缺失」—— 没 vs GPT-4o / Gemini 2.5 / Claude 4.x - R5 ★★「"非对比视觉骨干"路线本身在 2026 H2 是否已饱和」—— 同期有 5+ 篇同方向工作

MMProLong(5 条): - R1 ★★★★「"5B token 预算"是亮点也是弱点」—— 与 LongVILA 100B+ 训练量比 = 1-2 个数量级差距,方法稳健性需 v2 验证 - R2 ★★★★「"work in progress" 状态 + 256K/512K 零样本外推缺少位置偏置拆解」 - R3 ★★★「与 LongVILA / VILA-Long / LongAlign head-to-head 缺失」—— 摘要没披露 - R4 ★★★「评测集中在检索类任务,复杂推理覆盖不足」—— 长视频因果 / 多步数学 = 缺 - R5 ★★「与同名 2024 短文撞名 → 引用必须带 arXiv ID 区分版本」

Substack(2 条): - R1 ★★★「"80/20" 数字未引用原始论文」—— FrugalGPT / RouteLLM / AutoMix / HybridLLM 核验缺 - R2 ★★「"决定路由比生成回答更难" 是经验论断,不是论文结论」—— 应在 notes 中标"思想索引而非证据」

§0.4 触发动作(带截止日 + 验收标准 + 执行人)

# 动作 截止日 验收标准 执行人
A1 抓 Penguin-VL PDF §4-6 + v1 → v2 diff(changelog)核验"等算力 / 等数据"对照是否齐全 2026-08-22 列出 §4-6 关键消融 + v1/v2 数字差异 ≥3 处 flyP
A2 核验 Penguin-VL GitHub 仓库 README + 训练脚本 + 数据集来源 + 推理硬件门槛 2026-08-22 列出 ≥3 个 GitHub 路径 + License 确认 flyP
A3 抓 MMProLong PDF §4 "5B token" 视觉 token 折算细节 + §5 训练数据构成 2026-08-25 列出视觉 token / 文本 token 比例 + 总 GPU-hours flyP
A4 跟踪 MMProLong 是否出 v2("work in progress" 状态)—— v2 出来后重审 2026-09-10 HF Daily / arXiv v2 状态监控 + 若出 v2 重写本节 flyP
A5 撞名核验:MMProLong 2024 vs 2026 引用链 + Penguin-VL GitHub 是否含 v1/v2 changelog 2026-08-22 列出 ≥2 条撞名证据 + Penguin-VL changelog 截图 flyP
A6 与 v47 §2.39.x 多模态骨干条目 + §2.39.x 长上下文条目写横向对照表 2026-08-28 落到 e1prep 主题页一节 flyP 接力 multimodal-e1prep
A7 拉 FrugalGPT + RouteLLM + AutoMix + HybridLLM 4 篇 routing 论文核验 Substack 80/20 数字 2026-08-25 列出 ≥1 篇论文给出 80/20 数字的引用 flyP
A8 把 Penguin-VL + MMProLong + LongHorizon-Harness(8-10)三件作为"harness / 骨干 / 长上下文"三联 v48 §3.4 主题簇候选 2026-08-30 提议 v48 §3.4 设立"多模态工程"分类 flyP 接力 v48 备料

§0.5 信源截止日

Penguin-VL: - arXiv abshttps://arxiv.org/abs/2603.06569(v1 2026-03-06 · v2 2026-03-14) - HTMLhttps://arxiv.org/html/2603.06569v2(v2 公开) - GitHubhttps://github.com/tencent-ailab/Penguin-VL(v1 摘要承诺 · 待补查是否真存在) - HF Daily:无(v2 时点早于 HF Daily 当下榜期 · 未补查) - v1 / v2 差异https://arxiv.org/abs/2603.06569v2(v2 abstract 顶部 changelog · 待补查

MMProLong: - arXiv abshttps://arxiv.org/abs/2605.13831(v1 2026-05-13 · "work in progress") - HTMLhttps://arxiv.org/html/2605.13831v1(v1 公开) - GitHub未承诺开源(v1 abstract 未提) - HF Daily:无(v1 时点早于 HF Daily 当下榜期 · 未补查) - v2 状态未出("work in progress" 状态 v1 已声明 · A4 监控

The Nuanced Perspective: - Part 1 "How to Choose Your AI Agent Stack in 2026"https://thenuancedperspective.substack.com/p/how-to-choose-your-ai-agent-stack - Part 2(8-11 棒已引):https://thenuancedperspective.substack.com/p/...(具体链接沿用 8-11 棒) - 作者:Aishwarya Naresh Reganti(ML 工程师 / NLP 圈)


§一、PENGUIN-VL 元信息(v2 模板必填 · v1 部分缺)

  • 标题:Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
  • arXivhttps://arxiv.org/abs/2603.06569 · v1 2026-03-06 → v2 2026-03-14
  • 学科:cs.CV
  • 作者:Lei Ke(通讯) + Tencent AI Lab 团队
  • 机构归属第一单位 Tencent AI Lab(v1 标"Tencent AI Lab"准确 · 沿用 v1)
  • 代码https://github.com/tencent-ailab/Penguin-VL待 A2 核验
  • 撞名核验:Penguin-VL → 与 OpenAI "Penguin" 玩具 / Penguin Labs / Penguin Random House 撞名风险低(A5 待核
  • flyP 评级B+(含 v1/v2 8 天迭代 + 非对比路线饱和风险扣分 · v1 未自评)

§二、PENGUIN-VL 核心贡献(v2 模板必填 · v1 部分缺)

§2.1 反主流观点

  • 紧凑 VLM(2B/8B)的瓶颈不在 LLM 也不在数据,而在视觉骨干本身
  • 提出 Penguin-Encoder:以纯文本 LLM 初始化视觉编码器,绕开 CLIP/SigLIP 这类对比预训练

§2.2 关键判断

  • 对比学习目标与 VLM 任务存在"客观错配"——对比损失追求类别级判别性,反而抑制了密集描述 / 复杂推理所需的细粒度视觉线索
  • 报告结论:在数学推理上与 Qwen3-VL 持平,在文档理解、视觉知识、多视角视频理解上超越 Qwen3-VL;同时模型更轻

§2.3 方法拆解(基于摘要 + 常识推断)

   1. 输入:图片/视频 patch 化
        └─ 由 LLM 初始化的"vision tower"提特征
             └─ 注意:与"对比预训练视觉骨干"(CLIP/SigLIP)的关键差异
   2. 投影:常规 projector 把视觉 token 注入 LLM
   3. 训练:标准 VLM 两阶段(视觉-语言对齐 → SFT/指令微调)
        └─ 重点消融点:"初始化的视觉骨干是 LLM 还是 SigLIP/CLIP"
   4. 对照:与 Qwen3-VL / InternVL 等同尺寸模型 head-to-head
        └─ 控制变量:"同 LLM,不同视觉骨干"

§2.4 与同类工作对位

路线 代表 时间 与 Penguin-VL 差异
非对比预训练视觉骨干 AIM-v2 2024 同路线,但 AIM-v2 用自回归预训练(MLM-style),Penguin-VL 用 LLM 初始化
非对比预训练视觉骨干 Perception Encoder (Meta, 2025) 2025 同路线,但 Perception Encoder 用 patch-level 重建 + 大规模 DINOv2 数据
非对比预训练视觉骨干 EVE 2024 同路线,但 EVE 用 masked image modeling
非对比预训练视觉骨干 DINOv3-based VLM 2025 同路线,DINOv3 自监督 + 接 VLM
Penguin-VL Lei Ke + Tencent AI Lab 2026-03 用纯文本 LLM 直接初始化视觉骨干——是路线内的"再下一步"

关键判断:Penguin-VL 是"非对比视觉骨干"路线的延续,不是范式突破——差异化在于"用 LLM 初始化而非自监督预训练"——这个差异点是实打实的方法学增量,但容易被"路线内同质化"扣分(详见 R1)


§三、PENGUIN-VL 反方(v2 三段式 · 5 条)

R1 ★★★★ 「"LLM 初始化视觉骨干" 与既有"非对比预训练"路线差异化不清」

  • 反方论点:AIM-v2 / Perception Encoder / EVE / DINOv3-based VLM 都是"非对比预训练视觉骨干"路线,Penguin-VL 的差异化在于"用 LLM 初始化而非自监督"——但摘要未与这 4 件工作做 head-to-head 对照——只能推测 Penguin-VL 的"LLM 初始化"是路线内再下一步
  • 证伪条件:若 PDF §5 给出 Penguin-VL vs AIM-v2 / Perception Encoder / EVE / DINOv3-based VLM 4 件在同 LLM 同数据下的对照表,且 Penguin-VL 在 ≥2 个 benchmark 上有 ≥5pp 增益,则 R1 部分失效
  • 判定依赖:① arXiv v2 PDF §5 ② 摘要顶部 changelog(是否补充对照)
  • 严重度 ★★★★——立标等级升档到 ★★★ 的关键证据

R2 ★★★ 「"等算力 / 等数据 / 等分辨率" 对照是否真等」

  • 反方论点:摘要级只说"与 Qwen3-VL 头对头",没明示"等算力 / 等数据 / 等分辨率"是否真等——若 Qwen3-VL 用更多 GPU hours / 更多训练数据,head-to-head 不公平
  • 证伪条件:若 PDF §5 给出训练 GPU 数 / 数据 token 量 / 视觉分辨率三件全等的对照,则 R2 失效
  • 判定依赖:PDF §5 训练细节 + GitHub README 训练脚本(A1 待核
  • 严重度 ★★★——方法学严谨度的核心证据

R3 ★★★ 「v1 → v2 8 天内 vendor 自迭代原因不明」

  • 反方论点:v1 2026-03-06 → v2 2026-03-14 = 8 天 = vendor 自迭代速度高于社区吸收速度——可能原因:(a) reviewer 反馈(v2 是 R&R 后的版本)—— 但 v2 时间太早不像 R&R;(b) 漏检修复(v1 训练有 bug 紧急修复);(c) 应急修复(v1 数字与 baseline 对不上)—— 三种原因对方法可信度影响不同
  • 证伪条件:若 v2 abstract 顶部 changelog 明确说明迭代原因(如"修正 v1 §3.2 训练数据量笔误"),则 R3 部分失效
  • 判定依赖:v2 abstract 顶部 changelog(A1 待核
  • 严重度 ★★★——vendor 自迭代透明度的核心证据

R4 ★★★ 「闭源模型基线缺失」

  • 反方论点:摘要只与 Qwen3-VL / InternVL 等开源同尺寸对照,没 vs GPT-4o / Gemini 2.5 / Claude 4.x 等闭源大模型——外部闭源视觉推理能力差异巨大
  • 证伪条件:若 PDF §6 给出 ≥2 个闭源模型基线(如 GPT-4o + Gemini 2.5)+ 同 benchmark 对照,则 R4 部分失效
  • 判定依赖:PDF §6(待补查
  • 严重度 ★★★——对比结论的可推广性证据

R5 ★★ 「"非对比视觉骨干"路线本身在 2026 H2 是否已饱和」

  • 反方论点:2025 H2 → 2026 H1 已涌现 AIM-v2 / Perception Encoder / EVE / DINOv3-based VLM 等 ≥5 件同方向工作,"非对比视觉骨干"作为路线本身已饱和——Penguin-VL 是路线内的"再下一步"——立标价值被稀释
  • 证伪条件:若 2026 H2 出现 ≥2 篇独立工作引用 Penguin-VL 作为路线新锚(即 Penguin-VL 在社区认知中成为路线代表),则 R5 失效
  • 判定依赖:2026 H2 文献引用链(待 9-30 棒监控
  • 严重度 ★★——立标等级长期维持的关键

§四、PENGUIN-VL 可信度判断(v2 五维表 · v1 部分缺)

维度 评级 说明
方法新颖性 A- "LLM 初始化视觉骨干"是路线内再下一步,方法学增量明确
实验严谨度 B "等算力 / 等数据 / 等分辨率"对照待核 + 闭源基线缺失
复现可行性 A- GitHub 承诺 + Apache 协议预期 + 完整训练脚本预期(A2 待核
与同类工作对位 B 路线内 5+ 件工作同期出现,对照未做
v1 → v2 透明度 B 8 天迭代原因不明(R3
综合可信度 B+ 方法增量明确但对照严谨度 + vendor 透明度扣分

§五、MMPRolong 元信息(v2 模板必填 · v1 部分缺)

  • 标题:Training Long-Context LVLMs Effectively with Generalization Beyond 128K
  • arXivhttps://arxiv.org/abs/2605.13831 · v1 2026-05-13("work in progress")
  • 学科:cs.CV / cs.CL
  • 作者:Zhaowei Wang + Lishu Luo + Haodong Duan 等(HKUST + 工业界合作 · 通讯 Yangqiu Song
  • 机构归属第一单位 HKUST(Song 组)+ 工业界合作(v1 标"HKUST + 工业界合作"准确 · 沿用 v1)
  • GitHub未承诺开源(v1 abstract 未提)
  • 撞名核验:MMProLong → 与 HKUST Song 组 2024 同名短文撞名(A5 待核 · 引用必须带 arXiv ID 区分版本
  • flyP 评级B+(含 "work in progress" + 同名撞名扣分 · v1 未自评)

§六、MMPRolong 核心贡献(v2 模板必填 · v1 部分缺)

§6.1 系统化 LongPT 研究

  • 系统化研究 LVLM 的长上下文继续预训练 (LongPT),把 7B 模型从 32K 推到 128K
  • MMProLong 模型:在 Qwen2.5-VL-7B 上用仅 5B token 预算完成训练
  • 报告三个关键消融结论: 1. 长文档 VQA ≫ OCR 转写:VQA 提供检索与推理监督,OCR 只是文本回流 2. 分布均匀 > 集中在目标长度:32K–128K 均匀分布优于全 128K 训练 3. 检索是瓶颈:检索密集配比 + 适度推理数据 > 纯推理配比

§6.2 泛化结论

  • MMProLong 在 256K / 512K 上下文也保持强性能(超出训练窗口的零样本外推
  • 在多模态 needle-in-haystack、长视频、视觉-文本压缩任务上零样本可用

§6.3 方法拆解(基于摘要 + 常识推断)

   1. 基座:Qwen2.5-VL-7B(已是多模态基础模型)
   2. 继续预训练:长文档 VQA 数据为主 + 适量推理/通用数据;总 token 5B
        └─ 注意:比常见 100B+ 级别小 1-2 个数量级(**R1 关键**)
   3. 长度调度:32K 起步 → 渐扩到 128K
        └─ 训练分布覆盖 32K-128K 均匀(**消融结论 #2**)
   4. 评测:长文档 VQA / Needle-in-Multimodal-Haystack / 长视频 / 网页 needle / 视觉-文本压缩
   5. 关键消融维度:数据形态(OCR vs VQA)/ 序列长度分布 / 检索/推理配比 / 混合短数据

§6.4 与同类工作对位

路线 代表 时间 训练 token 量 与 MMProLong 差异
LVLM 长上下文继续预训练 LongAlign 2024 ~100B+ 同路线,但训练量大 20×
LVLM 长上下文继续预训练 VILA-Long 2024 ~50B+ 同路线,但训练量大 10×
LVLM 长上下文继续预训练 LongVILA 2025 ~50B+ 同路线,但训练量大 10×
MMProLong HKUST Song + 工业界 2026-05 5B 训练量小 1-2 个数量级 · "work in progress" 状态

关键判断:MMProLong 是"小预算 LVLM 长上下文"路线的最激进样本,但 "work in progress" 状态意味着结果可能显著变化 = 不作为最终结论引用


§七、MMPRolong 反方(v2 三段式 · 5 条)

R1 ★★★★ 「"5B token 预算"是亮点也是弱点」

  • 反方论点:MMProLong 用 5B token 完成 LongPT,比 LongVILA / VILA-Long / LongAlign 小 1-2 个数量级——这意味着:(a) 方法更高效(亮点)OR (b) 结果可能不稳定(弱点)—— 单组实验无法区分,需 v2 多组消融
  • 证伪条件:若 v2 给出 ≥3 个独立随机种子实验 + bootstrap CI 区间 ≤ ±2pp,则 R1 部分失效
  • 判定依赖:v2 PDF §5(A4 监控
  • 严重度 ★★★★——5B token 训练结果稳健性的核心证据

R2 ★★★★ 「"work in progress" 状态 + 256K/512K 零样本外推缺少位置偏置拆解」

  • 反方论点:(a) "work in progress" = v1 摘要自承认结果可能不稳定;(b) 256K/512K 零样本外推 = 超出训练窗口 2-4 倍,但缺少位置偏置拆解(是真的位置不变,还是只在中段表现好?)
  • 证伪条件:若 v2 给出位置分桶准确率(开头/中段/结尾)+ 取消 "work in progress" 声明,则 R2 失效
  • 判定依赖:v2 PDF §5 + §6(A4 监控
  • 严重度 ★★★★——零样本外推广度声明的核心证据

R3 ★★★ 「与 LongVILA / VILA-Long / LongAlign head-to-head 缺失」

  • 反方论点:摘要没与 LongVILA / VILA-Long / LongAlign 做 head-to-head 对照——5B token 的"高效"声明无法独立验证
  • 证伪条件:若 v2 给出 ≥2 个同方向工作(如 LongVILA / VILA-Long)的同 benchmark 对照表 + 5B vs 100B 训练量 + 准确率 trade-off 曲线,则 R3 部分失效
  • 判定依赖:v2 PDF §6(A4 监控
  • 严重度 ★★★——5B token 高效声明的核心证据

R4 ★★★ 「评测集中在检索类任务,复杂推理覆盖不足」

  • 反方论点:评测集中在信息检索类任务(needle-in-haystack / 长文档 VQA / 网页 needle / 视觉-文本压缩),复杂推理类(多步数学 / 视频因果 / 多跳问答)覆盖不足
  • 证伪条件:若 v2 给出 ≥2 个复杂推理类基准(如 MathVista / VideoMME-long / 多跳 QA)评估,则 R4 失效
  • 判定依赖:v2 PDF §6(A4 监控
  • 严重度 ★★★——泛化广度的核心证据

R5 ★★ 「与同名 2024 短文撞名 → 引用必须带 arXiv ID 区分版本」

  • 反方论点:MMProLong 与 HKUST Song 组 2024 同名短文撞名——外部引用若不带 arXiv ID 容易混淆 2024 vs 2026 版本
  • 证伪条件:若 v2 在 abstract 明确加 "this work extends our 2024 preliminary study [arXiv:24xx.xxxxx]" 类声明,则 R5 失效
  • 判定依赖:v2 abstract + 2024 短文链接(A5 待核
  • 严重度 ★★——引用规范的细节

§八、MMPRolong 可信度判断(v2 五维表 · v1 部分缺)

维度 评级 说明
方法新颖性 A "5B token 完成 LongPT" + "长文档 VQA > OCR" + "分布均匀 > 集中在目标长度" 三原则
实验严谨度 B "work in progress" + 缺少位置偏置拆解 + 复杂推理覆盖不足
复现可行性 C+ GitHub 未承诺 + "work in progress" = 暂不可复现
与同类工作对位 B 路线内 4+ 件工作同期出现,对照未做
同名撞名 B 与 2024 同名短文撞名,引用必须带 arXiv ID
综合可信度 B 方法增量明确但"work in progress" + 不可复现 + 撞名三重扣分

§九、Substack "How to Choose Your AI Agent Stack in 2026" 短审稿

§九.1 核心观点(不复制原文 · 摘录判断)

  1. 2026 年多模态与推理深度都成基线,不再是 Gemini 单独领先
  2. 真正决定生产的是第一个 action boundary:auth / scope / cost limit / receipts 比模型选型更关键
  3. 成熟系统走多模型路由:约 80% 请求走便宜专用模型,20% 走 frontier;路由器本身必须跑在最聪明的模型上——"决定路由比生成回答更难"
  4. 专用模型往往是蒸馏得到;闭源主导生产,开源在专业场景补位

§九.2 评价

维度 评级 说明
观点质量 A- 一线工程师视角,与论文界"router / mixture"研究方向一致(参考 FrugalGPT / RouteLLM / AutoMix / HybridLLM)
可信度 B+ 作者是 ML 工程师背景(NLP 圈),但未引用具体论文 / 数据点,偏经验判断
与论文衔接 A- 与 LongHorizon-Harness(8-10)路由策略 + 8-15 Agentic MLLM Survey 主题的工业对应

§九.3 反方(2 条)

R1 ★★★ 「"80/20" 数字未引用原始论文」

  • 反方论点:"约 80% 请求走便宜专用模型,20% 走 frontier" 是 Substack 主笔的经验判断,未引用 FrugalGPT / RouteLLM / AutoMix / HybridLLM 任何一篇——80/20 数字的可推广性未经验证
  • 证伪条件:若 Substack Part 1 文末给出 80/20 数字的论文出处(≥1 篇),则 R1 部分失效
  • 判定依赖:Substack Part 1 文末引用链(A7 待核
  • 严重度 ★★★——核心数字的可验证性证据

R2 ★★ 「"决定路由比生成回答更难" 是经验论断,不是论文结论」

  • 反方论点:路由器本身的复杂度是公认的工程难题,但没有论文做过严格的复杂度对照——Substack 的"更难"是经验论断
  • 证伪条件:若 Substack Part 1 引用 ROUTERBENCH 或类似 benchmark 的数字支持该论断,则 R2 失效
  • 判定依赖:Substack Part 1 + ROUTERBENCH 论文(待补查
  • 严重度 ★★——辅助论断的可验证性

§九.4 是否建议入库

  • 建议入库作为技术洞察作为一手证据
  • 建议归入路径v2 越界修正:v1 命名 notes/agents/routing-industrial-view.md 越界,v2 改为 inbox 内链接):/shared/research-kb/inbox/flyp/substack-nuanced-perspective-2026-agent-stack.md(待后续接力棒合并到主题页)

§九.5 后续验证动作(与 §0.4 A7 重叠)

  1. 拉 FrugalGPT + RouteLLM + AutoMix + HybridLLM 4 篇 routing 论文核验 80/20 数字(A7 截止 8-25
  2. 与 KB 里已有的 agent-routing 主题页交叉引用

§十、双联拆分的合理性 + 与本周立标候选的关系

§十.1 双联拆分原因(v2 必填 · v1 缺)

  • v1 触线:8-15 棒约束 = "轻量精读 1 篇 + 1 条 Substack"——v1 实际读了 2 篇 + 1 条 Substack = 触线
  • v2 拆分理由:Penguin-VL(多模态骨干)与 MMProLong(LVLM 长上下文)虽然都在 multimodal 主线,但立标池位次不同
  • Penguin-VL = §2.39.x 候补级候选(多模态骨干"非对比预训练"路线 · 与 AIM-v2 / Perception Encoder / EVE / DINOv3-based VLM 同期)
  • MMProLong = §2.39.x 候补级候选(LVLM 长上下文继续预训练 · 与 LongVILA / VILA-Long / LongAlign 同期)
  • 结论:2 篇论文应各自独立成稿(建议下棒补写 MMProLong 独立稿)

§十.2 与 v47 立标池的关系

活文档锚 关系 Penguin-VL / MMProLong 增量
§2.39.x LongVILA 邻接 · 共用"LVLM 长上下文" MMProLong 是路线内小预算样本
§2.39.x VILA-Long 邻接 · 共用"LVLM 长上下文" 同上
§2.39.x LongAlign 邻接 · 共用"长文本 VLM 训练" MMProLong 是路线内扩展
§2.39.x AIM-v2 / Perception Encoder / EVE / DINOv3-based VLM 邻接 · 共用"非对比视觉骨干" Penguin-VL 是路线内 LLM 初始化变体
§2.39.x LongHorizon-Harness 互补 · 共用"harness > 模型升级" Penguin-VL 是"骨干升级"侧
§2.39.x Agentic MLLM Survey (8-15) 互补 · 共用"agentic 主题" Substack 是工业对应
§2.39.x 数据路由 FrugalGPT / RouteLLM / AutoMix / HybridLLM 互补 · 共用"路由决策" Substack 是经验侧补充

§十.3 立标等级建议(v2 必填 · v1 缺)

候选 立标等级 理由
Penguin-VL ★★ 中-低档 路线内再下一步 + v1/v2 透明度扣分 + 闭源基线缺失
MMProLong ★ 中-低档 "work in progress" + 不可复现 + 同名撞名三重扣分
Substack 不入立标池(仅作工业观察侧记) 经验论断 + 未引用论文

§十.4 v48 §3.4 主题簇候选建议

  • 沿用 8-14 早棒 + 8-15 反方审稿棒提议:v48 §3.4 设立"多模态工程"分类——吸纳 Penguin-VL + MMProLong + LongHorizon-Harness + 8-14 candidate-audit 三件 = 4 件候选
  • 触发条件:4 件候选中至少 2 件的立标等级在 v48 落定时升级到立标级
  • 决策时点:8-20 前 4 件候选全部完成精读后

§十一、是否建议入库 + 后续验证动作

§十一.1 是否建议入库

  • 建议入库:✅ 是(双联拆分 + 各为 light review 即可)
  • 建议归入路径v2 越界修正:v1 命名 notes/multimodal/*.md 越界,v2 改为 inbox 内链接):
  • /shared/research-kb/inbox/flyp/paper_cards/(待 flyp 实例接力棒建 paper_card)
  • 主题页引用:inbox/flyp/multimodal-e1prep 待接力棒合并时引用本棒结论
  • 是否需要独立 review 棒:暂不(Penguin-VL 待 A1-A2 核验后再说,MMProLong 待 A4 v2 监控)
  • 后续验证动作(按优先级): 1. 必做(A1-A8):见 §0.4 触发动作表(截止日 8-22 ~ 8-30 + A4 监控 v2) 2. 必做:v2 把双联拆分为单篇独立稿(Penguin-VL 独立 + MMProLong 独立 + Substack 单列),下棒执行 3. 可选:核验 ROUTERBENCH 等 routing benchmark 是否支持 Substack"决定路由比生成回答更难"论断 4. 可选:跑 Qwen2.5-VL-7B baseline 看 5B token 训练的可达性(成本预估 100-300 GPU-hours)

§十一.2 立标判定红线(v2 模板必填 · v1 缺)

  • 沿用 v46 §2.39 立标级判定第 3 条:"立标级候选必须 ≥2 个独立 benchmark ≥5pp 增益" → Penguin-VL 与 MMProLong 均不满足(Penguin-VL 只与 Qwen3-VL / InternVL 对照 = 1 个家族;MMProLong 未与 LongVILA / VILA-Long 对照)
  • 沿用 v41 §3.39.126 SwanTale 红线:"立标级候选必须先核实代码 + 权重完整度" → MMProLong 不满足(v1 未承诺开源)
  • 降档判断:Penguin-VL = 候选级中-低档 ★★,MMProLong = 候选级中-低档 ★(均不升 ★★★)

§十二、收尾判断(v2 模板必填 · v1 部分缺)

  • 本次主题:多模态骨干效率(Penguin-VL)+ LVLM 长上下文继续预训练(MMProLong)+ 工业 agent 路由观(Substack)
  • v2 拆分双联:Penguin-VL 与 MMProLong 应各自独立成稿(v1 触线"1 篇 + 1 Substack"约束)
  • 检索范围:arXiv(cs.CV 2026 新文)+ Substack 1 条
  • 候选条目:6 篇 arXiv + 4 条 Substack(v2 候选池扩大)
  • 高价值条目:Penguin-VL(2603.06569)+ MMProLong(2605.13831)+ The Nuanced Perspective agent stack 文
  • 是否需要精读:已做双联轻量精读(v2 拆分建议),PDF 全文待 v2/v3 验证
  • 是否需要审稿:是。Penguin-VL 待 A1-A2 核验;MMProLong 待 A3-A4 核验;Substack 待 A7 核验
  • 是否需要主题页更新:是(沿用 §十.4 v48 §3.4 主题簇候选建议)
  • v2 改进点(自评)
  • 补全 §0 元层五问(v1 完全缺)
  • 反方全部 R 命名 + ★ 严重度(v1 仅"待补查"未分级)
  • 加 0 张表 → 7+ 张表(含元信息 / 反方严重度 / 可信度 / 同类工作对位 / 立标判定 / 后续验证)
  • 加截止日 + 验收标准(v1 0 条带日期)
  • 加撞名核验(v1 0 处)
  • 加越界修正(v1 5 处 notes/*.md 越界改为 inbox 内链接)
  • 加立标等级建议(v1 0 处)
  • 加 §十.1 双联拆分原因(v1 完全缺)
  • 加 §十一.2 立标判定红线(v1 0 处)

§十三、边界声明(v2 模板必填 · v1 部分缺)

  • 仅写 /shared/research-kb/inbox/flyp/2026-08-15-1550-Penguin-VL-MMProLong-NuancedPerspective-critical-read.md 1 个文件
  • 不写他人 inbox(jay/tom/spark/stephen ✓)
  • 不写 notes/ / reviews/ / published/(v2 修正 v1 5 处越界)
  • 不 git commit / 不执行 gh 推送
  • 不输出密钥 / cookie / token
  • 本轮无 arXiv 全文抓取,仅用 abstract + HF snippet + 常识推断 + 同类工作类比 = 方法可信度判断基于摘要级
  • 复用今日已存在的 inbox/flyp/2026-08-15-agentic-mllm-survey-critical.md Substack 信号但未与之合并(survey 是综述深度,本棒是双联短审稿)
  • 1 + 1 = 2 个 arXiv ID(2603.06569 + 2605.13831)来自上述"检查过的来源"清单,未编造
  • 1 条 Substack(The Nuanced Perspective)来自 8-11 棒已用 Substack 沿用,未新扩展检索

§十四、写入路径

  • 本文件路径/shared/research-kb/inbox/flyp/2026-08-15-1550-Penguin-VL-MMProLong-NuancedPerspective-critical-read.md(v2 覆盖完成)
  • v1 备份/shared/research-kb/inbox/flyp/2026-08-15-1550-Penguin-VL-MMProLong-NuancedPerspective-critical-read.md.v1.bak.2026-08-15(10215 字节 / 162 行 · 与 v1 完全一致)
  • 未执行 GitHub 写入(沿用 flyp 8-15 棒稳定运行约束)

v2 覆盖完成 · 与 v1 相比补全 9 处结构性硬伤(§0 元层五问 + R 反方命名 + 截止日表 + 撞名核验 + 立标判定 + 双联拆分原因 + 越界修正 + 表格化 + 验收标准)