2026-08-20 flyP 双精读 · XSkill 与 AXPO

角色:flyP。本轮按稳定运行约束做 1-2 篇批判性精读(本次 2 篇:XSkill、AXPO),围绕多模态 agent 持续学习与策略优化两条互补路径。 不写 GitHub,不动 published/review 目录;只产出 inbox 草稿。


候选筛选(候选 → 入选)

ID arXiv 标题 时间 入选理由
A 2603.12056v3 XSkill: Continual Learning from Experience and Skills in Multimodal Agents 2026-07-01 ICML 2026,多模态 agent 持续学习双流知识库,与 flyP 多模态/长上下文关注点强对齐
B 2605.28774v1 Agent Explorative Policy Optimization for Multimodal Agentic Reasoning (AXPO) 2026-05-27 RL 视角下 agentic reasoning 的训练-推理 gap 修正,结构性问题清晰、Qwen3-VL-Thinking 多尺度评估
落选 2603.16777 Anticipatory Planning for Multimodal AI Agents CVPR Findings 2026 主题相近但与 XSkill 重复度高,本轮让位
落选 2606.09669 SpatialWorld 真实任务空间推理基准 偏评测,已在 06-27 周边同类处理
落选 2606.29399 LLM-Guided Planning for Nuclear Regulatory Docs 领域狭窄,仅 ICML workshop 影响力有限
落选 2603.02888 LLandMark 多智能体视频检索 应用层、与本轮主题互补但偏窄

精读一 · XSkill(arXiv:2603.12056, ICML 2026)

一句话

双流经验/技能知识库 + 视觉 grounding 的累积-检索闭环,让多模态 agent 在不更新参数的情况下持续从轨迹中提炼并复用经验(action-level)与技能(task-level)。

方法拆解(基于摘要 + v3 修订信息)

  • 经验(Experience):动作级、面向"选哪个工具/怎么决策"的细粒度短提示。
  • 技能(Skill):任务级、面向"如何规划与编排工具使用"的结构化模板。
  • 抽取与整合阶段:从 multi-path rollouts 中用"视觉 grounded 摘要 + cross-rollout critique"提取经验与技能,避免单条轨迹噪声。
  • 检索阶段:检索以当前视觉上下文为锚,输出适应到当前任务;用过的轨迹反馈进累积阶段,构成持续学习闭环。
  • 评估:5 个跨领域基准 + 4 个 backbone;与 tool-only / 学习式基线对比均 SOTA;强调 zero-shot 泛化。

贡献判断

  • 新颖性(中-高):把"经验 vs 技能"双流显式拆开并以视觉 grounding 为统一接口,是已有 memory-of-thought / ExpeL / AutoGuide 路线的清晰演进,但双流分工和 grounded 摘要相对克制的工程式创新。
  • 完整性(高):5 基准 × 4 backbone × 与多类基线对比,覆盖 ablation 条件(complementary roles、zero-shot、continual loop)。v3 修订在 ICML 接收后继续打磨过,质量信号较强。
  • 可复现性(待补查):作者未在摘要给代码链接,需查 v3 PDF 或项目页确认 release;五基准选型与评测协议若公开则价值高。

主要问题与风险

  • 记忆膨胀:experience 与 skill 是两条独立累积通道,长期运行后仍存在合并/淘汰成本;摘要与 critique 的 LLM 自身成本与偏置未量化。
  • 检索失效模式:摘要与检索共用视觉 grounding,但若 grounding 失败(OCR/小目标/低光照),整条链路会被污染;缺少失败案例分类。
  • 持续学习"不更新参数"的局限:摘要/skill 来自 LLM 自身,实质上仍是 in-context 学习外推,存在模型规模与上下文上限的天花板。
  • 评测偏工具使用:五基准是否覆盖规划失败而非工具失败路径,需要看附录实验分布。

可信度

中高。ICML 2026 + 多 backbone 多基准的实验规模支持结论稳健性,但等待代码与 prompt 公开以验证实现细节。

是否建议入库

建议。归类 notes/agents/multimodal-agents,建议路径: - notes/agents/multimodal-agents/xskill-continual-learning-dual-stream.md - 与既有 agent-long-context 系列互为补集(XSkill 偏 in-context 经验池,长上下文路径偏 KV/检索)。

后续验证动作

  1. 查 v3 PDF 的项目页 / GitHub,确认是否 release 代码、prompt 与五基准列表。
  2. 跟踪它是否被后续 ExpeL / AgentBank / SkillRise 类工作引用,作为持续学习范式基线。
  3. 2026-07-31-SkillRise-and-Metis-cross-task-skill-vs-native-memory 做 cross-review:跨任务 skill 与双流 experience/skill 的方法学差异。

精读二 · AXPO(arXiv:2605.28774, 2026-05-27)

一句话

把"Thinking-Acting Gap"作为训练目标缺陷显式建模,在 GRPO 的 all-wrong 子组里固定 thinking 前缀并重采样 tool call + continuation,配合基于不确定性的前缀选择,提升 agentic reasoning 训练效率与多尺度 Pass@k。

方法拆解(基于摘要 + 项目页线索)

  • 问题定义:Thinking 与 Acting 是结构性不对称(前者默认、自洽,后者高方差、辅助),GRPO 下出现两类症状——tool use 命中率仅 ~30%,all-wrong tool-using 子组占 ~40%。
  • 核心算子 AXPO:对所有-wrong 的 tool-using 子组,冻结 thinking 前缀重采样 tool call 及其后续,配以不确定性驱动的 prefix 选择
  • 训练流程:SFT 起点 + AXPO 在 GRPO 框架上的替换;9 个多模态基准、3 个 Qwen3-VL-Thinking 规模(8B 显著受益,可比 4 倍参数 32B Base 在 Pass@4)。
  • 结果:相对 SFT+GRPO,平均 +1.8pp Pass@1 与 +1.8pp Pass@4(8B);8B SFT+AXPO 在 Pass@4 上超过 32B Base。

贡献判断

  • 新颖性(中-高):把"prefix-fixing + resampling"作为 RL 训练侧纠偏手段是清晰贡献,比单纯 GRPO reward shaping 更直接;不确定性前缀选择是配套机制。
  • 完整性(中-高):9 基准 × 3 尺度,覆盖 thinking-only / tool-augmented 双视角,并给出跨规模比较;项目页可作为复现入口。
  • 可复现性(中):Qwen3-VL-Thinking 是开放权重系列,AXPO 改的是 RL 训练算法而非模型权重,复现链路较直接;但 prefix 选择的具体不确定性度量需要查正文。

主要问题与风险

  • 作用半径:AXPO 假设"thinking 部分正确、tool 部分错误"是主要病灶;如果真实错误分布偏向 thinking 本身(很多 MLLM 现实如此),prefix-fixing 会强化错误前提。
  • 不确定性度量质量:摘要中"uncertainty-based prefix selection"未指明是 token entropy、semantic entropy 还是 self-consistency 类;不同选择会显著影响稳定性。
  • Pass@4 优势 ≠ Pass@1:8B 超过 32B 的前提是 Pass@4,反映的是采样效率提升而非单次能力跃迁;要警惕把采样多样性吃满的解释。
  • 基准偏覆盖:9 基准多为 reasoning 类,真实 agent 工作流(长任务、检索、GUI)覆盖度待补。

可信度

。项目页与开放基座模型有助复现,但摘要级别信息不足以判定 prefix-fixing 在分布漂移 / 长任务上的鲁棒性,需要看正文消融。

是否建议入库

建议。归类 notes/agents/agentic-rl,建议路径: - notes/agents/agentic-rl/axpo-thinking-acting-gap-fix.md - 与 Agent-STAR-RL-Recipe-Tool-Use(2026-07-18)形成 RL 配方对照。

后续验证动作

  1. 读 v1 PDF 确认不确定性度量的具体形式(entropy / self-consistency / reward variance)。
  2. 跟踪 AXPO 是否被后续 agentic-RL 工作吸收作为 prefix-level 纠偏基线。
  3. 与 ReOPD(prefix replay 蒸馏,2026-07-26)做对比:蒸馏式 prefix 复用 vs RL 式 prefix-fixing 的权衡。

主题页联动建议

  • notes/agents/multimodal-agents/index.md 新增 2 条条目(XSkill、AXPO),交叉关联 SkillRise、Agent-STAR、ReOPD、PRCO/TVI。
  • notes/agents/agentic-rl/index.md 新增 AXPO 条目,作为 thinking-acting gap 修正路线的代表。
  • 本周 digest(2026-08-19-multimodal-weekly-digest.md 已存在)下次更新时把这两条作为增量候选。

后续检索方向(下次 cron 可选)

  • 代码与项目页核验:XSkill release、AXPO 项目页 byungkwanlee。
  • 跟踪 ICML 2026 multimodal agent workshop 收录列表,补齐与 XSkill 同期的持续学习基线。

Substack(按规则最多 1 条线索)

  • 未在本轮使用 Substack;本次任务以 arXiv 主源为主、agent 训练机制为核心,符合"Substack 最多 1 条补充"约束。

输出控制

  • 本次未抓取全文,仅基于摘要 + 分类索引判断;代码与不确定性度量细节标记为"待补查"。
  • 不执行 GitHub 写入;草稿落 /shared/research-kb/inbox/flyp/