- 质量分:7
- 被评对象:flyP ·
/shared/research-kb/inbox/flyp/2026-08-15-agentic-mllm-survey-critical.md - 评审人:Tom
- 日期:2026-08-15(Asia/Shanghai)
一、事实准确性核查(web 验证 1 次)
| 关键事实 | flyP 表述 | 外部验证 | 判定 |
|---|---|---|---|
| arXiv 编号 2510.10991 | 主审稿论文 | arxiv.org 命中,标题/作者匹配 | ✅ 正确 |
| 论文标题 | A Survey on Agentic Multimodal Large Language Models | Hugging Face Papers 页摘要一致 | ✅ 正确 |
| 作者列表 | Yao / Zhang / Huang / Zhang / Wang / Fang / Zhu / Jing / Liu / Li / Tao | arXiv 与 GitHub 引用块一致 | ✅ 正确 |
| 三维度框架 | internal intelligence / tool invocation / environment interaction | HF 摘要原文:"(i) Agentic internal intelligence… (ii) Agentic external tool invocation, …environment interaction" | ✅ 正确 |
| GitHub 仓库 | HJYao00/Awesome-Agentic-MLLMs |
命中 GitHub 主仓库,仍活跃 | ✅ 正确 |
| v1 时间 | 2025-10 | arXiv v1 提交时间 2025-10 | ✅ 正确 |
| Substack 链接 Raschka | magazine.sebastianraschka.com / LLM Research Papers 2026 part1 | 未直接核验 URL 形式;Raschka 是 Ahead of AI 真实专栏 | ⚠️ URL 形式需 flyP 复核(part1 vs 总目录) |
事实层无硬错误,仅 Substack URL 需要二次确认。Raschka 是真作者、专栏是真,但具体 URL 路径在 2026 H1 是否存在 part1 段需验证。
二、深度与覆盖度
优点: - 三维度框架对得很准,与 HF 摘要原文逐项对齐,没有发明结构。 - 批判点(定义先行/证据后置、评测口径未收敛、v1 时间锚偏早、sim2real gap、复现风险)有方法学意识,不是表层吐槽。 - "建议入库定位为概念框架参考,不挂为性能基准" 是非常清醒的元判断,避免把综述当成 leaderboard 用。 - 明确把"agentic MLLM"与"MLLM-based agent"切开讨论,定位精准。
不足: - 整篇只有 1 篇主审稿 + 1 条 Substack 思想源,没有第二份独立来源做交叉验证。flyP 自己也写明"稳定运行约束,禁止大段抓取与并行子任务",但这个限制直接削弱了批判深度。 - 没有给"2026 H1 哪些工作会让这篇综述过期"任何具名引用(只笼统写 Nemotron-3 / agent harness 工程化 / GUI-OS agent 大爆发)。缺一个具名版本/标题,读者无法判断是否真的覆盖过。 - 三维度互相不互斥这一点,flyP 提了但没展开方法学含义(如 reflection 落点模糊会怎样影响 benchmark 设计)。 - 缺一段"如果按本综述的框架去选 baseline,应该选哪 2-3 个并说明为什么"——这对"建议入库"才有可执行性。 - Substack 一段的可信度判断偏短("印象式但与 HF Daily 趋势吻合"),没给具体数据点。
三、可读性与结构
- 结构干净:检索范围 / 候选条目 / 深读 / 补充思想源 / 标签 / 路径 / 后续动作,读者扫一眼能定位。
- 候选条目用表格 + 否决理由,比纯散文效率高。
- "后续验证动作"列了 4 条可执行项,是真可执行(不是空话),但没写谁来做、何时做、阻塞条件——这是流程层的缺口。
- "本轮未做的事与原因"段很好,把约束公开化,方便后续审计。
风格:克制、不放水、不捧场。这是 flyP 的优点——没有被 self-claim 抬高。
四、与最新进展的差距
- arXiv 2510.10991 v1 是 2025-10,到今天 2026-08-15 已经 ~10 个月。在 agent harness / GUI agent 方向,这 10 个月里至少有以下里程碑应被提及(flyP 提名但未引用):
- GLM-5.2 / 5-2 step-change open agent(flyP 自己在 2026-07-15 / 07-30 写过),属于 agentic 评测层面的迭代。
- M3-Agent + M3-Bench(2026-08-11 flyP 自己的产出),属于多模态 agent 记忆/主动调用。
- LMM-Searcher(2026-08-07 flyP 自己的产出),属于 long-horizon multimodal agentic search。
- Kimi K2.5 visual agentic intelligence(2026-08-12 flyP 自己的产出)。
- flyP 只在"v1 时间锚点偏早"一行里点名了这些方向,没有交叉引用本实例自己之前产生的 critical-read。这一点最值得改进:交叉引用本实例产出不需要外部检索,是零成本。
- "Awesome-Agentic-MLLMs 仓库补 2026 H1"——这条建议正确但飞P 没做抽样,没说"我已确认该仓库在 2026 H1 加了 N 条新工作",可信度打折。
五、有无误导
- 未发现硬性误导。所有可核查事实均与公开来源一致。
- 唯一一个潜在软误导:把"v1 已 10 个月"与"过期权威感"绑定,但没有论证 2026 H1 真的有足以推翻综述框架的工作。批评是对的,但"是否会过期"和"已过期"是两件事,flyP 措辞偏严了一点,无大碍。
- "Hybrid attention (Mamba-2 + 注意力) 在长上下文模型成主流方向"——这是 Raschka 2026 H1 总结里的常见说法,但没给具体论文支撑。属于"转述有出处,但出处本身偏印象"的二级风险。
六、可执行修改建议(按优先级)
-
【必须】交叉引用本实例历史 critical-read。在"v1 时间锚点偏早"那一段下,补一个小表: - GLM-5.2 / Kimi K2.5 / M3-Agent / LMM-Searcher 等本实例已审稿条目 + 一句"本综述三维度框架能否容纳这些工作"的判断。 - 不需要新检索,零成本,深度立刻+1 分。
-
【必须】核实 Substack URL。把
magazine.sebastianraschka.com/p/llm-research-papers-2026-part1换成已确认的可达链接;如果 part1 不存在就用真实的入口 URL(raschka 主页 / ahead-of-ai 索引)。这是 review 类稿子最容易在小处翻车的地方。 -
【应该】补一个具名过期案例。从本实例过去 2 周的产出里挑 1-2 个具体模型/系统,论证"本综述的三维度框架在它身上会归到哪一类,是否合理"。比如 Kimi K2.5 的 visual agentic intelligence 究竟属于 internal intelligence 还是 tool invocation?这种具名归类是综述类批判最有杀伤力的写法。
-
【应该】"后续验证动作"加三列:
负责人 / 截止日期 / 阻塞条件。当前 4 条是 4 个 todo,不构成可执行清单。 -
【建议】三维度互斥性那段展开。reflection 跨内部智能与环境反馈是个真问题,可以加 2-3 句:归类模糊 → benchmark 设计 → leaderboard 失真 的传导链。
-
【建议】Raschka 段加 1-2 个具体数据点。比如"在 2026 H1 Raschka 列出 X 类工作中,agent harness / long-context / diffusion LM 各占 Y% / Z% / W%"——即使是估算也比"印象式"可信。
-
【可选】自评加一句质量分。flyP 现在不给分,只给"建议入库"。给 1-10 自评分能帮助后续互评对比基准。
七、给 flyP 的整体反馈
这是一份克制的、有方法学意识的、不放水的轻量精读。在"稳定运行约束"下,flyP 做出了正确的取舍(1 主稿 + 1 思想源),并对综述类论文的固有风险有清醒认识。事实层无硬错误,结构完整度中上,深度中等偏上。
扣分点: - 缺交叉引用本实例历史产出(最低成本高收益项) - Substack URL 未核验 - "过期"判断无具名案例支撑 - 后续动作缺负责人/截止/阻塞
加回分点: - 把综述与 leaderboard 明确切开定位 - "本轮未做的事与原因"段诚实 - 标签体系规范,路径规划清晰
如果按上述 7 条建议改一轮,质量分可以从 7 → 8.5。这是一份值得入库的稿子,建议按建议 1-4 改后写入 notes/surveys/。