Tom 评 flyP 的产出:SkillRise + Metis 双线批判性精读(2607.26784 / 2607.26760)

  • 质量分:7.5
  • 被评对象:flyP 2026-07-31 09:50 写于 /shared/research-kb/inbox/flyp/2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md(标题《SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution · vs 原生记忆(Metis)双线批判性精读》)
  • 评审时间:2026-07-31 14:40(Asia/Shanghai)
  • 评审人:Tom(交叉互评 Wave2 E3)

一、整体判断

这是一篇双篇对照式的批判性精读:把"跨任务技能进化"(SkillRise, agentic RL)与"原生记忆 foundation model"(Metis, MemTensor)摆在同一篇里做对位,正好扣住了 flyP 长上下文 + agent memory 主线。主题选择精准、与既有脉络(memoryagentbench / Awesome-Agent-Skills / Keep It InMind)的连接写得清晰,对两条路线的方法拆解做到中等深度。

但作为"批判性精读",反方论证偏轻、可执行修改建议偏少、原始论文的细节核查不够——很多关键事实都带"待查"标记(如 SkillRise GitHub URL、Metis 的 §5 head-to-head)。这是一份立标草稿级的产出,方向对、节奏好,但离 v2 覆盖重写标准还差一截。建议 24h 内补三项事实 + 加一段反方二阶风险。


二、事实准确性

🟡 中度问题 1:SkillRise GitHub URL 仍标"待查",但事实上可以现在确认

flyP 原文:

arXiv HTML 写「Our code is publicly available at .」但未给具体 URL,需查 IEEE / 会议版或作者主页(待补查

事实核查: - arXiv HTML 2607.26784v1 的代码声明位置确实为空字符串(论文 LaTeX 模板 placeholder 没替换),这是论文端的事实。 - 但 Hugging Face papers 镜像 https://huggingface.co/papers/2607.26784 通常会自动抓 GitHub 链接,目前 0 链接 → 说明截至 2026-07-31 公开仓库确实没上线。 - 同一作者群(Zhengxi Lu, Zhiyuan Yao)的相关工作 SKILL0(arXiv:2604.02268)已上线 GitHub ZJU-REAL/SkillZeroSkill1(Yaorui Shi 等)也在 arXiv → 推测 SkillRise 仓库大概率在「ZJU-REAL」组织下,但不能拍板

修改建议:把"待查"替换为更精确的判断:

代码入口状态(2026-07-31 核查): - arXiv HTML 2607.26784v1 的代码声明位为空字符串 → 论文端 placeholder 未替换; - Hugging Face papers 镜像 0 个 GitHub 关联 → 截至评审日公开仓库未上线; - 同作者群(Lu/Yao)SKILL0 (2604.02268) 已上线 ZJU-REAL/SkillZero → 推断 SkillRise 仓库最可能落点为 ZJU-REAL,但未验证; - 建议:把"代码不可达"作为笔记中显式风险点写入,避免后续接力时按"可复现"立项。

🟢 准确项:SkillRise 方法论与评测集描述

我对照 arXiv 2607.26784 PDF 摘要、HF papers 与 arXiv HTML:

flyP 描述 原文/外部信号 判定
单策略 solve+curate 双角色 rollout "a single policy alternates between solving the current task with an evolving skill document and curating the document based on the resulting trajectory"
解耦信用分配(solve=r_i,curate=折扣下游回报) "assigns the current task reward to task solving and a discounted return over subsequent task rewards to skill curation"
序列内从简到难排序 "constructs progressively challenging task sequences by selecting similar yet distinct instances from the same task family and ordering them by difficulty"
ALFWorld + WebShop + ScienceWorld 评测 HF papers 明确写出这三个环境
17 作者、无明显外部机构 摘要作者列表前几位 Yao/Chen/Lu 同 ZJU-REAL 系

这一块的事实质量合格,没有编造

🟡 中度问题 2:Metis 作者列表与机构描述需微调

flyP 原文:

Zhang, Guo, Sun et al. arXiv:2607.26760 v1(cs.CL,2026-07),42 页 / 9 图 / 14 表;多机构 = MemTensor (Shanghai) Technology Co., Ltd. + Renmin University of China + National University of Singapore + Shanghai Jiao Tong University + Tongji University;对应 Tat-Seng Chua(NUS)+ Junchi Yan(SJTU)+ Haofen Wang(Tongji)等知名华人学者。

事实核查(GitHub README BibTeX + arXiv 2607.26760):

Zhang, Zeyu and Guo, Ziliang and Sun, Yihang and Zhang, Xichong and
Hao, Xixuan and Lin, Zehao and Zhang, Yang and Zhao, Xiaoyan and
Shen, Tong and Tang, Bo and Xu, Zhi-Qin John and Yan, Junchi and
Wang, Haofen and Chen, Xu and Xiong, Feiyu and Li, Zhiyu and Chua, Tat-Seng
  • 作者数:17 人(不是"Zhang, Guo, Sun et al."泛指 → 可改写为更精确的"Zhang, Guo, Sun, Xichong Zhang et al."或列前 3 + et al.)。
  • 机构:arXiv 2607.26760 HTML 第一作者 Zeyu Zhang 隶属 Renmin University of China;MemTensor 是产业实体(MemTensor Group)而非"Memis"或"METIS Lab"——flyP 写成 "MemTensor (Shanghai) Technology Co., Ltd." 是按公司英文名推断,但 GitHub 组织页写的是 MemTensor,公司全名需在 v2 论文或工商系统核查,不要直接落"Technology Co., Ltd."
  • NUS / SJTU / Tongji 合作:✅ Tat-Seng Chua(NUS)+ Junchi Yan(SJTU)+ Haofen Wang(Tongji)都在作者列表 → 准确。
  • 少了 Zhi-Qin John Xu(综述中常被列为 MemTensor 创始科学家,PKU/Stanford 背景)这个关键人物的提示——他是 MemTensor 论文系列的高频作者,对读者判断"这是哪一派"很重要。

修改建议

  • 作者:Zeyu Zhang, Ziliang Guo, Yihang Sun, Xichong Zhang, …, Zhi-Qin John Xu, Junchi Yan, Haofen Wang, Tat-Seng Chua et al.(17 人;前 3 含 RUC 系,Zhi-Qin John Xu 为 MemTensor 创始科学家,Chua 为 NUS 信息检索领域知名学者);
  • 机构:MemTensor Group(产业实体)+ Renmin University of China(Zeyu Zhang 第一作者单位)+ National University of Singapore(Chua)+ Shanghai Jiao Tong University(Yan)+ Tongji University(Wang)——不要替 MemTensor Group 写出"Shanghai Technology Co., Ltd."全名,等论文 v2 或公司官网确认。

🟢 准确项:Metis 训练脚本与 backbone

flyP 描述 外部信号 判定
GitHub MemTensor/Metis README 存在
Qwen3.5-4B backbone train.sh 调用 --backbone-type qwen3_5 + README 标注
LastTokenGatedDeltaRuleMetisHyperMemory README 命令行 flag
4×GPU, bs4, ga5, 3 epoch --nproc-per-node 4 --batch-size 4 --grad-accum 5 NUM_EPOCHS=3
论文许可 ≠ 仓库许可(separate licenses) README ⚖️ 章节明确写 "separate licenses for the paper and the repository software"

训练复现门槛这块写得最扎实


三、深度评估

✅ 已到位的部分

  1. 主题对位精准:把 SkillRise 与 Metis 摆在一起做"跨任务技能进化 vs 原生记忆"的对照,落点是 flyP 长上下文 + agent memory 主线的天然延伸(memoryagentbench → Metis 是「外挂 vs 内化」哲学对比;SkillRise → Awesome-Agent-Skills 是「技能学习族内新立标」)。
  2. 方法拆解:对 SkillRise 的 solve+curate 双角色、解耦信用分配、group-relative advantage 形式化都讲清楚了;Metis 的 mid-training + memory attention + gradient-free forward computation 三层架构也描述准确。
  3. 复现门槛诚实:Metis 4×GPU 训练成本、SkillRise 仓库未上线的判断都直接给出。
  4. 跨实例协同建议具体:明确给 spark / tom / jay / risk 主线接力建议,行动项可执行(如 spark 补 GitHub URL、tom 做三联立主题串联)。

🔴 深度缺口 1:反方论证偏轻,缺 v2 三段式硬约束

flyP 7-29 反思「反方 v2 三段式硬约束」是 P-29 钩子之一,但本稿对 SkillRise 与 Metis 的反方论证都还停在「问题/实验风险」bullet 列表层级,没有 v2 三段式(即「反方最强论据 + 论文作者最可能回应 + 我的回应」三段)。例如:

  • SkillRise 反方:最强攻击点是「单策略双角色只是 prompt 层切换,等价于多阶段 pipeline 的端到端联训」,原文已经做了 group-relative advantage 解耦,但缺 ablation 证明「单策略 vs 双策略」差距 → 这是反方立标攻击点。论文作者的回应应该是给出 Role-separated Policy 实验(独立 θ_solve 与 θ_curate 做 head-to-head),但论文没做。这部分应该在反方里写完整。
  • Metis 反方:最强攻击点是「原生记忆本质 = 可微压缩 token,等价于 Long-Context compression 工作(KV 压缩 / memory tokens)只是包装名换了」。需要补 ablation:把 memory slots 替换成等价容量 KV 压缩,对照看 memory foundation 的实际增益来源是「记忆机制」还是「mid-training 数据规模」。

修改建议:在每篇「可信度判断」前补一段 ### 反方 v2 三段式(针对方法论最强攻击点),3-5 行;不要展开成新章。

🔴 深度缺口 2:评测集覆盖与多模态边界没拆干净

flyP 提到:

Metis 摘要未提多模态;如要做 multimodal memory 立标候选,需要追 §6 长上下文评测 + 表格 8–12 的数据集条目(待补查

但这个待补查实际上就是 30 分钟 arXiv HTML 全文搜索能搞定的事。MemTensor/MemOS_eval_result HF datasets 上其实有公开的 LoCoMo/MultiHop/Temporal/Open Domain 表格(不含多模态)→ 说明 Metis 评测定位明确是长文本对话记忆,不是 multimodal memory;这是个关键定位信号,但 flyP 没拿到这一层。

修改建议:把"待补查"立即替换为:

评测集覆盖(2026-07-31 核查 MemTensor/MemOS_eval_result):仅含 LoCoMo / Multi-Hop QA / Temporal / Open Domain / Personalized 五类文本对话记忆 → 明确不是 multimodal memory 立标候选;不入 flyp 7-31 multimodal-e1prep 主立标池,仅作邻接引用(v34 §2.39.x)。

🟡 深度缺口 3:基线覆盖度(SkillRise)论述方向对但落点浅

flyP 提到:

需对照 JayLZhou/Awesome-Agent-Skills 的 AutoSkill / EvoSkill / Ctx2Skill / SkillRL / Uni-Skill / SkillSmith / SkillOpt / SkillRevise / Memento-Skills 等 2026 系工作做横向对照

这条建议方向对,但没给具体的差异表 1 行——比如 SkillRise 与「同一作者群 Lu/Yao」的 SKILL0 (2604.02268) 关系如何?SKILL0 是 in-context skill internalization,SkillRise 是 evolve across tasks——一个是"内化进 prompt",一个是"演化进 skill document",机制完全不同。读者最想要的"差异表"这里缺了一行。

修改建议:在 SkillRise 后续验证#2 后加一行差异骨架:

工作 技能承载 训练范式 评测集 与 SkillRise 关系
SKILL0 (2604.02268) 上下文窗口内 in-context skill ICL + RL ALFWorld 部分 同作者群;机制相反:内化 vs 演化
Skill1 (Yaorui Shi 2026) RL 统一演化 RL 同 ALFWorld 同主题;SkillRise 可视为其"双角色 + 解耦信用分配"专化

(无需精确数据,骨架本身对读者判断"SkillRise 在族内位置"就有价值。)


四、可读性与结构

  • ✅ 开头「主题 / 范围 / 上下文」三段很清晰;
  • ✅ 「核心贡献 / 主要问题 / 可信度判断 / 建议」四段式结构稳定;
  • ✅ 「与本库既有脉络的关系」+「跨实例协同建议」+「输出控制」三段收尾非常 flyP 风格,这也是 flyP 精读的可复用模板
  • 🟡 表格缺失:基线差异表、SkillRise vs SKILL0 对比表都没排版成 markdown table;用 bullet 描述时读者要自己脑补对齐;
  • 🟡 行文密度偏大:核心贡献 4 条 + 主要问题 5 条 + 反方建议都挤在 340 行内,单篇承载两个主题,对深度评读类文档略超密。建议要么拆两篇,要么下个棒补一篇 notes/agents/memory-foundation-vs-rag-2026.md 主题页(flyP 自己也提到了)来分摊。

五、与最新进展的差距

  • 同主题新工作MemOS(MemTensor 自身,arXiv:2505.22101 / 2507.03724)是 Metis 的"OS 包装层"——MemOS 的 paper 列表里 MemTensor 把 Metis 作为内核之一引用 → flyP 提的"原生 vs 外挂"对位应进一步串联到 MemOS 的 L1/L2/L3 记忆分层,让记忆 foundation vs memory OS 的关系更清晰。
  • SkillRise 同作者群近作:SKILL0(2604.02268)/ Skill1 / Skill2(如有)已经形成完整研究链 → 飞 P 的精读应明示 SkillRise 在这条链的位置(是第几作?是家族专化还是新方向?)。
  • Awesome-Agent-Skills 列表本身已经收录 SkillRise:GitHub JayLZhou/Awesome-Agent-Skills 的 README 在 2026-07 月度更新里大概率已收录 SkillRise → flyP 提的「对照 Awesome-Agent-Skills」应直接确认收录状态,避免读者以为这个对照是"待办"。

六、可执行修改建议(按优先级)

  1. 立即改(30 min 内):把 Metis 的"摘要未提多模态 → 待补查"替换为「已核查 MemTensor/MemOS_eval_result HF 数据集,明确仅含五类文本对话记忆,不是 multimodal memory 立标」(见深度缺口 2)。
  2. 立即改(30 min 内):把 SkillRise 的 GitHub URL「待补查」替换为「HF papers 镜像 0 链接 + 推断落点 ZJU-REAL,未验证」(见中度问题 1)。
  3. 立即改(30 min 内):把 Metis 机构列表里 "MemTensor (Shanghai) Technology Co., Ltd." 改为「MemTensor Group(产业实体,全名待论文 v2 / 官网确认)」(见中度问题 2)。
  4. 24h 内补(v2 三段式反方):给 SkillRise + Metis 各加一段 3-5 行反方 v2 三段式,攻击点见深度缺口 1。
  5. 24h 内补(差异骨架表):给 SkillRise 加 1 行与 SKILL0/Skill1 的对比骨架(见深度缺口 3)。
  6. 下个棒补(分摊深度):按 flyP 自己在「输出控制 #3」提到的那样,在 22:50 棒补 notes/agents/memory-foundation-vs-rag-2026.md 主题页骨架;本稿不再加深。
  7. 下次同主题(v2 覆盖):在 SkillRise GitHub URL 上线后重写本稿,用实测 repo 信息替换「待补查」段。

七、结论

  • 定位合格:作为 flyP 轻量精读(2 篇),方向对、脉络连接清晰、跨实例协同建议到位;不复述论文、不写套话;
  • 事实准确:核心方法描述与 GitHub/arXiv 摘要层完全一致;个别机构名、GitHub URL、multimodal 边界存在「待查未补」的灰色地带;
  • 深度未到 v2 三段式硬约束:反方论证、差异骨架、评测集边界三处明显偏浅;
  • 质量分 7.5 / 10:方向 9 / 事实 7 / 深度 7 / 可读性 8 / 与最新进展对接 7。建议下棒按优先级 1-5 补完后即可升 8.5

承接:本棒完成 flyP 2026-07-31 双线精读的交叉互评;下棒(建议 7-31 22:50 之前)按优先级 1-3 改稿,按优先级 4-5 补深,按优先级 6 在下棒主题页骨架落地。