flyP 精读与批判 · 2026-08-15
本次轮次:轻量精读模式(稳定运行约束)。仅 1 篇主审稿 + 1 条 Substack 思想源;不做全文抓取、不开子任务。 实例:flyP;草稿目录:
/shared/research-kb/inbox/flyp/仅产出 GitHub-ready 草稿,不执行 git commit / push / gh pr。
一、本次主题
Agentic Multimodal Large Language Models:概念边界、实验可信度与复现陷阱
候选池里这一篇与 flyP "多模态 + 长上下文" 主线最贴,且方法论层面(survey)可与本轮高频讨论的 long-context / agent harness 议题形成对照。Substack 一条作为补充思想来源,不再扩展检索。
二、检索范围与候选条目
2.1 检索范围
- arXiv(cs.CV / cs.AI / cs.CL)
- Hugging Face Papers / Daily Papers
- 官方博客与项目仓库
- Substack 高质量作者 newsletter(上限 1 条)
2.2 候选条目
| # | 条目 | 来源 | 入选理由 / 否决理由 |
|---|---|---|---|
| 1 | A Survey on Agentic Multimodal Large Language Models (arXiv 2510.10991) | arXiv | 主审稿。综述结构清晰、仓库活跃、三维度框架便于和现有 notes 对齐。 |
| 2 | LongLoRA / TokenSelect / AccLLM(HF Daily Papers long-context 集) | HF Papers | 作为上下文对照,不在本轮深读;已在前几轮 long-context 主题中覆盖。 |
| 3 | Agent Harness for LLMs Survey(Meng et al., 2026, Preprints) | HF Datasets | 已被多个实例审过,本次仅作交叉引用。 |
| 4 | Sebastian Raschka — "LLM Research Papers: The 2026 List (Jan–May)" | Substack(Ahead of AI) | 唯一 Substack 思想源,用于校准 2026 上半年研究风向(hybrid arch / agent harness / long-context / diffusion LM)。 |
| 5 | Large Multimodal Agents: A Survey(arXiv 2402.15116) | arXiv | 作为对比基线,本次不重读。 |
三、高价值条目深读
3.1 A Survey on Agentic Multimodal Large Language Models
- 链接: https://arxiv.org/abs/2510.10991
- 作者: Huanjin Yao, Ruifei Zhang, Jiaxing Huang, Jingyi Zhang, Yibo Wang, Bo Fang, Ruolin Zhu, Yongcheng Jing, Shunyu Liu, Guanbin Li, Dacheng Tao
- 版本: v1,2025-10
- 代码 / 资源: https://github.com/HJYao00/Awesome-Agentic-MLLMs (作者承诺持续更新)
- 分类标签:
surveyagentic-mllmmultimodal-reasoningtool-useenvironment-interaction
核心贡献
-
三维度概念框架 —— 把 "agentic MLLM" 与传统 "MLLM-based agent" 区分开: - (i) 内部智能:长时序规划、推理、反思、记忆; - (ii) 外部工具调用:主动使用工具以扩展知识/能力; - (iii) 环境交互:在虚拟/物理环境中执行动作、调整策略、维持目标导向行为。 这是少有的明确把 "agentic" 与 "agent-with-MLLM" 切开做的综述。
-
开源资源整合 —— 同一团队维护
Awesome-Agentic-MLLMs仓库,汇编训练框架、训练 / 评测数据集,对后续工程化复现友好。 -
下游应用盘点 —— 覆盖 GUI agent、embodied / robotics、autonomous driving、medical / scientific 等方向。
主要问题(批判视角)
-
综述类论文的固有风险:定义先行、证据后置。 "Agentic" 的三维度边界并不互斥(如 reflection 既是内部智能又依赖环境反馈),框架可读性高但可证伪性低,容易出现"凡是强的 MLLM 都被归入 agentic"的循环论证倾向。
-
评测口径未收敛。 综述本身也承认下游评测标准碎片化;论文更多是"列举",缺少跨任务、跨模态的归一化指标或 meta-analysis。读者很难从这篇综述直接判断哪个 agentic MLLM 在哪个任务上真的更好。
-
v1 时间锚点偏早。 2025-10 提交的综述对 2026 上半年的新工作(Nemotron-3 hybrid、agent harness 工程化、GUI / OS agent 大爆发)覆盖不足,需要用
Awesome-Agentic-MLLMs仓库补齐,否则会形成"过期权威感"。 -
方法风险 —— 综述对 "tool invocation" 的训练范式(prompting / SFT / RL)与 "environment interaction" 的 sim2real gap 缺乏系统性归因,容易让读者低估真实部署难度。
-
实验 / 复现风险 —— 综述并未做统一复现;附录里贴出的评测集基准彼此不兼容,单任务最佳不代表系统级最佳。
可信度
- 作者团队:Guanbin Li / Dacheng Tao 组在 MLLM 方向持续产出,可信度中高。
- 结构完整度:高(含框架、训练、评测、应用、未来方向)。
- 数据可信度:中(综述性质,本身不产生新实验;需以仓库为补充一手源)。
- 时效性:中(v1 已 10 个月,需补 2026 H1)。
是否建议入库
建议入库,定位为 notes/surveys/agentic-mllm-survey-2510.10991.md,并在主题页 topics/agentic-mllm.md 里挂为"概念框架参考",不挂为"性能基准"。需要配套一条 README 说明:本综述提供分类与术语,不提供排名。
后续验证动作
- 拉取
HJYao00/Awesome-Agentic-MLLMs仓库当前 main 分支,补充 2026 上半年新增条目。 - 抽出 2-3 个被该综述反复引用的子方向(如 GUI agent、tool-use SFT、embodied),分别写独立
notes/条目并标注实验细节。 - 在
topics/long-context-multimodal.md中交叉引用,避免与 long-context 主题重复审稿。 - 跟踪 Substack(Raschka / Nathan Lambert 等)2026 H2 的 agent harness 长文,做一次方法学层面的对照笔记。
3.2 Substack 补充思想源(单条)
- 作者 / 专栏: Sebastian Raschka — Ahead of AI
- 链接: https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
- 发布时间: 2026 上半年系列盘点
- 核心观点: 2026 H1 论文分布明显向 agent harness / long-context / diffusion LM / 实用 serving infra 倾斜;hybrid attention(Mamba-2 + 注意力)在长上下文模型(Nemotron-3 等)成主流方向。
- 可信度判断: 中高。作者有持续论文阅读习惯,分类与统计偏印象式,但与 HF Daily / OpenReview 趋势吻合。可作为风向校准,不作为唯一事实来源。
- 后续行动: 仅记录在
notes/substack/2026-08-15-rasbt-h1-papers.md(待补查:作者是否在 2026 H2 续写 part2、是否覆盖 agent harness 工程化专题)。
四、分类标签汇总
surveyagentic-mllmmultimodal-reasoningtool-useenvironment-interactionlong-context(交叉)agent-harness(交叉)substack/rasbt
五、建议写入路径
| 用途 | 路径 | 状态 |
|---|---|---|
| 本次批判稿(已写入) | /shared/research-kb/inbox/flyp/2026-08-15-agentic-mllm-survey-critical.md |
✅ |
| 后续正式 notes | notes/surveys/agentic-mllm-survey-2510.10991.md |
待 sync 任务合并 |
| 主题页引用 | topics/agentic-mllm.md |
待 sync 任务合并 |
| Substack 思想源台账 | notes/substack/2026-08-15-rasbt-h1-papers.md |
待 sync 任务合并 |
六、是否需要精读 / 审稿 / 主题页更新
- 精读(本次): ✅ arXiv 2510.10991;✅ Substack 一条 Raschka。
- 审稿: 本稿即短审稿(核心贡献 / 主要问题 / 可信度 / 入库建议 / 验证动作)。
- 主题页更新:
topics/agentic-mllm.md需要新增条目(执行合并时再写入)。 - 后续动作: 待 sync 任务串行合并;本实例本轮不执行 GitHub 写入。
七、本轮未做的事与原因
- 未抓全文 / 未跑实验:稳定运行约束,禁止大段抓取与并行子任务。
- 未对 long-context 系列再深读:上一轮(2026-06-17)已覆盖。
- 未多 Substack 扩展:任务硬性约束,最多 1 条。
- 未写入 review / published:实例权限只到 inbox。