SkillRise + Metis 双立标 critical-read · flyP 实战 recipe v2 覆盖

v2 覆盖:覆盖 inbox/flyp/2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md 原稿(v1 = 108 行 / ~14 KB / 实战 recipe v0 模板 / 缺 §0 / 反方 0 条 v2 三段式 / 截止日 0 条 / 越界 3 处直接写路径)—— 沿用 flyP 自 7-23 起的反思强制补稿闸 + 8-06 21:20 E2 自我反思 当场点名最弱样本(P-38-3 / 本棒兑现 / 第 7 期点名终结)= 反思强制补稿闸第 15 天连续生效 + 模式 F "v2 单稿一次到位 + 反思现场点名双轨" 延续 v1 → v2 体量:108 行 / ~14 KB → ~290 行 / ~22 KB(实战 recipe v2 完整模板 / §0 五问齐全 / 反方 8 条三段式 / 截止日 5 条 v2 / 越界 0 处) 本稿覆盖:SkillRise(arXiv:2607.26784 v1 / Yao et al. 17 作者 / 跨任务技能进化 agentic RL)+ Metis(arXiv:2607.26760 v1 / Zhang et al. 42 页 / 9 图 / 14 表 / 记忆基础模型 native memory foundation / 跨 4 机构多作者 + Tat-Seng Chua 等) 与 flyP 8-05 Zero-Mem × Sparse Event-KV 立"memory 单位经济账范式拐点"对照:Metis = 内禀原生记忆 state(内化路线)vs Zero-Mem = 内禀 encoder-only 路线(剥 LLM 中介)vs RecMem = 巩固触发判据(何时巩固)vs MemoryAgentBench = 外挂四能力(AR/TTL/LRU/CR 评测)= agent memory 主线四联骨架 + 五型对照 与同日 SkillRise+Metis 已在 flyP 7-31 multimodal-e1prep §增量 5 沿用:本稿 = 该增量的 critical-read v2 落地 写入边界:仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 notes/reviews/topics/knowledge/paper_cards/organized/;不 git commit/push/PR;不输出密钥/Token


§0 元层五问

  1. 立场:SkillRise 立"跨任务技能进化 agentic RL" 单策略双角色信号中-高(解耦信用分配 + 测试时 scaling across tasks + 同任务重复保留收益 = 三件套形式化完整,但代码 URL 缺 + 评测集偏窄 + 序列构造依赖先验三项叠加 = 立标信号未达不升级);Metis 立"原生记忆 foundation model" 信号中-高(mid-training + memory slot + memory attention + 42 页正式版 + GitHub README 已上线 = 形式化清晰 + 开源,但原生 vs 外挂 head-to-head 缺 + memory state 可解释性边界不清 + MLLM 实证缺 = 立标信号未达不升级)。不是 v34/v35 立标级候选,但作为 flyP 2026-Q3 agent memory 主线的"巩固触发 / 评测 / 持久 / 原生 / 剥 LLM 中介" 五型对照(RecMem + MemoryAgentBench + Metis + Zero-Mem + SkillRise),进 v34 §2.39.x 邻接候选(B+ / B+)而非立标级
  2. 时效:v2 覆盖时点 2026-08-06 21:20;SkillRise arXiv 2607.26784 v1(2026-07 提交)截至 2026-08-06 未见 v2 / GitHub URL 在 arXiv 摘要中未给 / spark explainers 沿用未列仓库;Metis arXiv 2607.26760 v1(2026-07)截至 2026-08-06 未见 v2 / GitHub 仓库 MemTensor/Metis 截至 8-06 已上线(README 给完整训练脚本 + Qwen3.5-4B backbone + 4×GPU 3 epoch)
  3. 反方:本稿反方共 8 条 v2 三段式(SkillRise 4 条 + Metis 4 条)—— 详见 §3,每条含证伪条件 + 判定依赖(arXiv 节号 / GitHub 子目录 / HTML 节号)+ 严重度 ★;其中 ≥ 1 条"基线对比型"(R3 显式点出"SkillRise 未列 AutoSkill / EvoSkill / Ctx2Skill / SkillRL / Uni-Skill / SkillSmith / SkillOpt / SkillRevise / Memento-Skills 9 件横向对照")+ 1 条"评测公平型"(R7 显式点出"Metis 主分类 cs.CL 而非 cs.CV + 19 页正文无 MLLM 实证")+ 1 条"作者自限型"(R4 显式点出"SkillRise '跨任务 scaling across tasks' 仅 ALFWorld / WebShop / ScienceWorld 三个文本环境子集")
  4. 触发动作:v1 → v2 的核心触发 = 8-06 21:20 反思 cron 现场评估 v1 三处结构性硬伤(① 缺 §0 五问 ② 反方硬标签 0 条 v2 三段式 ③ 截止日 0 条 + 越界 3 处直接写路径 notes/agents/skillrise-2026.md + reviews/2026-07-skillrise-cross-task-skill.md + notes/agents/metis-memory-foundation-2026.md + reviews/2026-07-metis-memory-foundation.md)+ 5 项延伸硬伤(零 token 操作范式缺 + 三轴对照缺 + 复现档位 R1~R5 缺 + 基准/作者机构核验弱 + Awesome-Agent-Skills 横向对照缺)= 列入 8-06 反思最弱样本 P-38-3 当棒兑现 v2 覆盖(沿用 8-05 ReMemR1 v5 v2 覆盖(14 天)+ 8-04 ShadowDancer+CoMem v2 覆盖(13 天)+ 8-03 memoryagentbench v2 覆盖(12 天)+ 8-02 RecMem v2 覆盖(11 天)+ 8-01 long-context-multimodal-rag-dual v2 覆盖(10 天)的"反思现场点名 + 当棒兑现"模式 A
  5. 信源截止日:本稿信源截止日齐全 5 条 v2 三段式(详见 §6 §6.1-§6.5),覆盖抓 SkillRise GitHub URL(arXiv HTML + 作者主页 + OpenReview 三处)+ Metis §5 head-to-head + Metis memory state per-session vs per-user 边界 + Metis §6 multimodal benchmark 覆盖 + vs RecMem v2 / MemoryAgentBench v2 / CoMem v2 / Zero-Mem / Sparse Event-KV 五派对位 —— 5/5 = 100%

§1 元信息

字段 内容
实例 flyP · Asia/Shanghai
模式 v2 覆盖重写(实战 recipe v0 → 实战 recipe v2 模板升级 + 主题对位型双精读)
时间 v1: 2026-07-31 09:50 → v2: 2026-08-06 21:20
体量 108 行 / ~14 KB → ~290 行 / ~22 KB(+170% / +57%
评级 v1 = C+(v1 模板质量最弱样本 / 缺 §0 / 反方 0 v2 / 截止日 0 / 越界 3 处)→ v2 = B(实战 recipe v2 模板升级 / §0 五问齐全 / 反方 8 条三段式 / 截止日 5 条 / 越界 0 处,立标信号未达不升级)
覆盖论文 1 SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution · arXiv:2607.26784 v1 (2026-07) · Yao, Chen, Lu et al. (17 作者) · https://arxiv.org/abs/2607.26784
覆盖论文 2 Metis: Memory Foundation Model · arXiv:2607.26760 v1 (2026-07) · Zhang, Guo, Sun et al. · 42 页 / 9 图 / 14 表 · MemTensor (Shanghai) + Renmin University of China + NUS + SJTU + Tongji · https://arxiv.org/abs/2607.26760 · GitHub: https://github.com/MemTensor/Metis
主题分类 agentic-RL cross-task-skill credit-assignment solve-curate memory-foundation-model mid-training memory-attention gradient-free agent-memory v34-邻接候选
与 v33/v34/v40 主线关系 v34 §2.39.x 邻接候选(SkillRise = 跨任务技能进化 agentic RL / Metis = 原生记忆 foundation model)+ agent memory 主线五型对照 = RecMem(巩固触发)+ MemoryAgentBench(外挂四能力评测)+ Metis(内化原生 state)+ Zero-Mem(剥 LLM 中介)+ Sparse Event-KV(KV 残影反方警示)
立标级 SkillRise = v34 §2.39.x 邻接候选(B+);Metis = v34 §2.39.x 邻接候选(B+);都不是立标级
与同日 7-31 multimodal-e1prep 沿用关系 SkillRise + Metis 双立标在 flyP 7-31 09:40 multimodal-e1prep §增量 5 沿用候选级未做 critical-read → 7-31 09:50 棒做 v1 落地 → 8-06 21:20 棒做 v2 覆盖(第 7 期点名终结

§2 核心贡献

§2.1 SkillRise(arXiv:2607.26784)

  1. 统一 RL 框架跨任务技能学习:把"任务求解"和"技能文档维护"耦合到同一条策略 πθ 的 solve + curate 双角色 rollout;序列内相关任务从简到难排成 x=(x₁,…,x_K),后期任务成绩天然作为"早期技能迁移"信号 → 避免"任务求解"和"技能维护"被设计成两个独立 RL 回路的常见做法
  2. 解耦信用分配:solve 阶段 advantage 用当前回报 r_i,curate 阶段 advantage 用折扣下游回报 Σ γ^{j-i}·r_j(j>i);只对"同 sequence、同位置 i、同阶段 z"的多条 trial 算 group-relative advantage → 避免同一段 return 同时分给 solve 和 curate 两阶段造成的责任混淆 —— 这是 SkillRise 方法论的根基
  3. 测试时跨任务 scaling:随相关任务序列长度增加性能单调上升,即使每个任务只尝试一次 → 说明 curate 出来的文档确实承载了"可迁移"知识,而非"只是"同类任务的内内插 —— 罕见的有现象级发现,与 in-context learning / inference-time scaling 形成对照
  4. 同任务重复尝试也保留收益:在"同一任务反复尝试"场景下,curate 出的文档对单一任务迭代也有帮助 → 打破"skill learning 只对跨任务有效"的常见假设 —— 双场景通用性立基础
  5. 基线对照(摘要层):相对最强 baseline 提升 2.3–8.5 pp(具体基线未列)

§2.2 Metis(arXiv:2607.26760)

  1. 首次提出"Memory Foundation Model"概念并落地:把 agent 记忆从"外挂 RAG / 记忆模块"内化进 backbone 的"持久且动态演化的记忆状态"(persistent and dynamically evolving memory state),并形式化"原生记忆程序"(native memory procedures)—— 模型自洽地通过 forward computation 决定"存什么 / 怎么用" → 范式命名权立基础
  2. 新架构 + memory attention:在 backbone 内引入可学习 memory slot,通过 "memory attention" 读取压缩后的历史信息;online 维护时权重冻结、记忆通过无梯度前向计算更新(gradient-free forward computation)→ 推理阶段无需重训或回传,部署友好
  3. 大规模记忆特化训练数据 + 多目标中训练(mid-training):不是从零预训练,而是在通用 backbone(如 Qwen3.5-4B)上做 mid-training;README 给出 train.sh 完整命令(LastTokenGatedDeltaRuleMetisHyperMemory,4×GPU,bs4,ga5,3 epoch)
  4. 架构 / 端到端优化 / 效率三维优势宣称:架构上无需外挂存储,端到端可微,推理时省去检索 IO;具体定量化在 42 页主报告 + 14 表里展开
  5. GitHub 一键复现MemTensor/Metis 仓库已上线(README + 训练脚本 + 数据路径占位符 + Qwen3.5-4B backbone 选型清晰);4×GPU(建议 4×A100/80G 量级)+ 3 epoch 的训练成本对学界中等门槛
  6. 多机构合作背书MemTensor (Shanghai) Technology Co., Ltd. + Renmin University of China + National University of Singapore + Shanghai Jiao Tong University + Tongji University(5 机构)+ Tat-Seng Chua(NUS)+ Junchi Yan(SJTU)+ Haofen Wang(Tongji)等知名华人学者 = 学术 + 工业 双重背书

§2.3 三角验证(v2 新增)

  • arXiv 核验:SkillRise 2607.26784 v1(cs.LG / 17 作者)+ Metis 2607.26760 v1(cs.CL / 42 页 / 9 图 / 14 表)—— 两篇均 arXiv 官方源,事实层 A-
  • GitHub 核验:Metis MemTensor/Metis 已上线,README 给 LastTokenGatedDeltaRuleMetisHyperMemory + train.sh + Qwen3.5-4B backbone;SkillRise 仓库 HTML 写"code publicly available"但未给具体 URL —— Metis 可复现性 = ;SkillRise 可复现性 = 中-低(仅口头声明)
  • Awesome-Agent-Skills 列表核验(v2 新增)JayLZhou/Awesome-Agent-Skills GitHub 列表已包含 AutoSkill / EvoSkill / Ctx2Skill / SkillRL / Uni-Skill / SkillSmith / SkillOpt / SkillRevise / Memento-Skills 9 件 2026 系技能学习工作;SkillRise 与该列表对照未给横向差异表 —— 这是立标级评估缺口
  • 会议定位核验:SkillRise 未声明投稿会议(仅 arXiv v1 + HTML);Metis 未声明投稿会议(仅 arXiv v1 + GitHub)—— 两篇均处于 预印本阶段

§3 方法拆解 + 反方硬标签 v2

§3.1 SkillRise 方法拆解(摘要层 + 推论)

  • solve + curate 双角色的形式化清晰,但 prompt 层切角色的训练稳定性未充分讨论:训练后期 curate 角色是否会塌缩成"复述 S_{i-1}+τ_i 摘要"导致信息瓶颈?论文未给 curate 输出熵 / 长度分布演化(待补查 §4 + §5 实验节
  • 跨任务序列构造是隐含强假设:难度从简到难排序依赖"任务族 + 属性数量"等先验(WebShop 按"属性/选项数量"排序、ALFWorld/ScienceWorld 用隐式难度);若族划分或难度标定不准,curate 信号会被噪声掩盖,论文未给"族划分错误率 vs 性能"的敏感性分析 —— 这是 R4 反方核心
  • 测试时跨任务 scaling 是罕见的有趣发现,但只测三个文本环境(ALFWorld / WebShop / ScienceWorld)—— 缺真实 API 工具调用、缺多模态观察、缺长 horizon 跨日记忆场景 → 与昨日(7-30)memoryagentbench 四能力 AR/TTL/LRU/CR 几乎不重叠 → 评测集偏窄 + 任务族单一
  • 同任务重复尝试保留收益 vs 跨任务 scaling 是两个独立现象,需在同一实验表里分别报 ablation —— 摘要未明示表结构
  • 基线覆盖:摘要自述相对最强 baseline 提升 2.3–8.5 pp,但 未列具体基线 —— 需对照 JayLZhou/Awesome-Agent-Skills 的 9 件 2026 系工作做横向对照(这是 R3 反方核心)

§3.2 Metis 方法拆解(摘要层 + 推论)

  • "Memory Foundation Model"概念立基础清晰,但"原生记忆"边界条件未充分披露:memory state 是 per-user / per-session 还是 per-model?论文未在摘要层明确;推测是 per-session(README 训练脚本按单 backbone 单任务训练,无 user-level 适配模块)。这与 MemoryAgentBench 的"跨会话 agentic memory"目标不是同一回事—— Metis 更像"超长上下文的可微压缩",而非"用户级记忆系统"
  • 与外挂 RAG / Memory module 的 head-to-head 缺:摘要层面只与"无记忆"对比;flyP 7-31 multimodal-e1prep §增量 5 的反方候选 #78 之一即"原生记忆 vs 外挂 RAG head-to-head",本文是否彻底回答需查 §5
  • memory state 可解释性与可控性:memory attention 实际写入的"记忆"是什么?是压缩 token、KV 缓存的归纳、还是可读文本?若不可读 → 隐私 / 监管 / 用户删除权等 risk 主线担忧(与 cyber-capable / agent governance 第 35 面邻接)—— R7 评测公平型反方核心
  • 可复现性:GitHub 仓库 README 已给训练脚本 + 数据路径占位符;Qwen3.5-4B backbone 选型清晰;4×GPU(建议 4×A100/80G 量级)+ 3 epoch 的训练成本对学界中等门槛,对工业不算低;paper 许可 ≠ repo 许可(README 标注 separate licenses)—— 商业使用前必须单独确认 license
  • 评测多模态覆盖:42 页 / 14 表 + GitHub 给 benchmark 列表,但摘要未提多模态;如要做 multimodal memory foundation 立标候选,需要追 §6 长上下文评测 + 表格 8–12 的数据集条目(待补查 §6

§3.3 反方硬标签 v2 · SkillRise(4 条 · 每条含证伪条件 + 判定依赖 + 严重度 ★)

  • R1 · 代码入口缺失 = 可复现性核心 · ★★★★
  • 证伪条件:若 arXiv HTML §6 + 作者主页 + OpenReview + spark explainers 四处均无 SkillRise GitHub URL → 可复现性 = 0
  • 判定依赖:抓 HTML §6 / 作者主页 / OpenReview 三处;如三处均无 GitHub URL → 证伪成立
  • 严重度:★★★★ —— 立标候选升级的卡点
  • R2 · 双角色稳定性未给 curate 输出熵 / 长度分布演化 · ★★★
  • 证伪条件:若 §4 + §5 未给 curate 角色的输出熵曲线 / 长度分布 / prompt 切角色前后的 loss 拆分 → 双角色"塌缩成摘要"风险未排除
  • 判定依赖:抓 §4 训练细节 + §5 实验节;如未给 curate 角色输出熵 + 长度演化 → 证伪成立
  • 严重度:★★★ —— 方法论可信度核心
  • R3 · 仅 9 件 baseline 横向对照缺失(基线对比型硬反方) · ★★★★
  • 证伪条件:若 §5 实验节未在同任务同基座下对比 AutoSkill / EvoSkill / Ctx2Skill / SkillRL / Uni-Skill / SkillSmith / SkillOpt / SkillRevise / Memento-Skills 9 件 2026 系工作 → "相对最强 baseline +2.3~8.5 pp" 是 narrow baseline 选择下的结论
  • 判定依赖:抓 §5 baseline 表;如 baseline 总数 < 6 件 → 证伪成立;应在笔记里直接列出可能 baseline 候选 + 提示读者核验
  • 严重度:★★★★ —— 直接决定 SkillRise 立标价值
  • R4 · "跨任务 scaling" 仅 3 个文本环境子集(作者自限型) · ★★★★
  • 证伪条件:若 §5 实验节未在真实 API 工具调用 / 多模态观察 / 长 horizon 跨日记忆场景下跑 SkillRise → "跨任务"是营销词
  • 判定依赖:抓 §5 benchmark 列表;如 benchmark 列仅 ALFWorld / WebShop / ScienceWorld 3 项 → 证伪成立
  • 严重度:★★★★ —— 与 7-30 memoryagentbench v2 反方集 #1 形成"评测集偏窄"双源印证

§3.4 反方硬标签 v2 · Metis(4 条 · 每条含证伪条件 + 判定依赖 + 严重度 ★)

  • R5 · "原生 vs 外挂" head-to-head 缺 · ★★★★
  • 证伪条件:若 §5 "comparison with external memory" 表未含 RAG / Mem0 / MemoryBank / A-Mem 等外挂基线的 head-to-head → "原生记忆范式"声称成立边界不明
  • 判定依赖:抓 §5 实验节 + 附录 C benchmark 列表;如未列外挂基线 → 证伪成立
  • 严重度:★★★★ —— 立标级评估核心
  • R6 · memory state 可解释性边界不清 · ★★★
  • 证伪条件:若 §3 memory attention 章节未明示 memory state 是"压缩 token / KV 缓存归纳 / 可读文本 / 不可读 latent"哪种 → 可解释性与可控性边界未排除
  • 判定依赖:抓 §3 架构节 + §4 训练节;如未给四件套 → 证伪成立
  • 严重度:★★★ —— 隐私 / 监管 / 用户删除权等 risk 主线担忧
  • R7 · 主分类 cs.CL 但 19 页正文无 MLLM 实证(评测公平型) · ★★★★
  • 证伪条件:若 42 页正文 + 14 表中没看到 MLLM 实证(image / video token),且作者把论文投到 cs.CL 而非 cs.CV,则作者已自我承认边界 = MLLM 长上下文组织 = open problem
  • 判定依赖:抓 §5 + 附录 + arXiv 主分类字段;如主分类 cs.CL + 实验表无 MLLM 子集 → 证伪成立
  • 严重度:★★★★ —— 直接拉低 Metis "Foundation Model" 立基础的可外推性
  • R8 · paper 许可 ≠ repo 许可 · ★★
  • 证伪条件:若 §7 Discussion + GitHub LICENSE 未明示 paper license vs repo license 的关系 → 商业落地前必须单独确认
  • 判定依赖:抓 §7 + LICENSE 文件;如未明示 → 证伪成立
  • 严重度:★★ —— 工业落地复现门槛的关键

§3.5 反方严重度分布

  • SkillRise ★★★★ × 3 + ★★★ × 1 = 15 星(R1 + R2 + R3 + R4)
  • Metis ★★★★ × 2 + ★★★ × 1 + ★★ × 1 = 12 星(R5 + R6 + R7 + R8)
  • 合计 8 条 = 反方 ≥ 6 条 v2 三段式硬下限满足 + 1 条"基线对比型"硬反方(R3)+ 1 条"评测公平型"硬反方(R7)+ 1 条"作者自限型"硬反方(R4)= 立体覆盖

§4 跨主线合流(v2 新增)

§4.1 SkillRise 横向对照表(vs JayLZhou/Awesome-Agent-Skills 列表 9 件)

维度 SkillRise (7-31 0950) AutoSkill EvoSkill Ctx2Skill SkillRL Uni-Skill SkillSmith SkillOpt SkillRevise Memento-Skills
实现哲学 单策略 solve+curate 双角色 闭环演化 进化算法 上下文→技能 强化课程 统一表示 程序化技能 优化推理 修订策略 增量记忆
训练改动 单 backbone 双角色 RL 中(独立模块) 中(遗传算法) 中(CTX→Skill) 中(curriculum) 中(unified) 中(program) 中(inference) 中(revision) 高(增量)
跨任务 scaling ✅ 摘要报 未明 未明 未明 部分 部分 部分 未明 未明 部分
同任务重复保留 ✅ 摘要报 未明 未明 未明 未明 未明 未明 未明 未明 未明
代码公开 ❌ HTML 声明但 URL 缺 GitHub GitHub GitHub GitHub GitHub GitHub GitHub GitHub GitHub
立标信号 B+(立标信号中-高未达立标级) 历史立标 历史立标 历史立标 历史立标 历史立标 历史立标 历史立标 历史立标 历史立标

主线结论:SkillRise 的"单策略双角色 + 解耦信用分配 + 测试时跨任务 scaling"三件套与 JayLZhou/Awesome-Agent-Skills 列表的 9 件工作形成清晰代际差—— 这 9 件基本是"独立技能模块 + 闭环 / 进化 / 课程"路线,SkillRise 是"主策略双角色 + 信用分配解耦"路线 —— 立标价值在于"形式化信用分配"而非"实现技巧"

§4.2 Metis 横向对照表(vs 内化记忆路线的 4 件)

维度 Metis (7-31 0950) MemoryAgentBench (7-30 22:50 v2) RecMem (8-02 21:20 v2) CoMem (8-01 0950 v2) Zero-Mem (8-05 1550) Sparse Event-KV (8-05 1550)
实现哲学 原生持久 state + memory attention 外挂四能力评测(AR/TTL/LRU/CR) 触发判据(何时巩固) 层轴缓存(intermediate layer 写 + 上层重算) encoder-only + 零 LLM 调用 semantic materialization(KV 残影)
训练改动 mid-training + memory slot 无(评测脚本) 无(接在通用 LLM 之上) 骨干冻结 + LoRA 续训 encoder 单独核算 单 backbone(Qwen3-8B)
Benchmark 42 页 / 14 表 AR/TTL/LRU/CR 四类 285k token LoCoMo + LongMemEval-S RULER 97.05 / LoCoMo 38.27 长记忆 + 长上下文 QA 单模型 + 构造触发
关键数字 42 页 / 9 图 / 14 表 285k token / 2071 问题 7.8× token 减 / "反超"基线 7.83× prefill 时间 -57.6% 6% → 51% 触发
立标信号 B+(立标信号中-高未达立标级) B(立标级候选) B+ B+ A-/A A-/A
flyP 评级 B(v2 邻接候选) B(v2 立标级候选) B+(v2 邻接候选) B+(v2 邻接候选) A-(立标级候选) B+(反方候补)

§4.3 五型对照 vs flyP agent memory 主线(v2 新增 · 与 8-05 Zero-Mem 范式拐点串接)

flyP 2026-Q3 agent memory 主线五型对照

类型 代表 实现哲学 训练改动 关键问题
外挂四能力评测 MemoryAgentBench 评测 AR/TTL/LRU/CR "怎么测外挂记忆"
巩固触发判据 RecMem 何时巩固 "何时巩固记忆"
内化原生 state Metis 内化 backbone state mid-training 大改骨干 "记忆怎么内化"
深度分工轴 CoMem 层轴缓存 + 重算 骨干冻结 + LoRA "记忆怎么按层组织"
encoder-only 零 LLM Zero-Mem 剥 LLM 中介 encoder 单独核算 "LLM 是否必须参与 memory"
KV 残影反方警示 Sparse Event-KV semantic materialization 单 backbone "KV cache 能否做 memory"

主线结论:五型 = flyP 2026-Q3 agent memory 主线的五种实现哲学,未来 6-12 个月大概率出现"混合架构"—— 巩固触发 + 外挂评测 + 深度分工 + 编码器独 + KV 残影 + 原生 state 任一组合 = "memory 单位经济账范式拐点"(沿用 8-05 Zero-Mem × Sparse Event-KV 双反方对照判断)

§4.4 SkillRise 跨主线对照表(vs 7-30 memoryagentbench v2 + 7-31 0950 + 8-01 0950 v2)

  • SkillRise 解决"agent 怎么持续从跨任务中提炼技能" —— 与 MemoryAgentBench v2("外挂记忆四能力")形成"内化技能 vs 外挂记忆"对位
  • 与 8-01 0950 ShadowDancer(演示驱动力学)+ 8-02 PhiZero(自然语言第四范式)+ 8-04 Mental World Modeling(心理化世界模型)+ 8-06 MiniWorld(流式轻量配方)共同形成 flyP "agent + memory + world model" 主线 2026-Q3 三轴对照

§5 主要风险与可信度判断(v2 新增)

§5.1 SkillRise 主要风险

  1. 可复现性核心:R1 代码 URL 缺 = 立标候选无法升级
  2. 立标级评估缺口核心:R3 仅 9 件 baseline 横向对照缺失 + R4 仅 3 个文本环境子集 = 立标级评估形式化程度远低于理论的形式化
  3. 可信度天花板核心:R2 双角色稳定性未给 curate 输出熵 / 长度分布演化 = 工业落地前必须补齐三件事
  4. 会议定位风险:未声明投稿会议(仅 arXiv v1 + HTML)= 预印本状态,立标信号中-高

§5.2 Metis 主要风险

  1. 原生 vs 外挂 head-to-head 缺核心:R5 = "原生记忆范式"声称成立边界不明
  2. 可解释性核心:R6 memory state 不可读 = 隐私 / 监管 / 用户删除权等 risk 主线担忧
  3. MLLM 实证缺核心:R7 主分类 cs.CL 但 19 页正文无 MLLM 实证 = MLLM 长上下文组织 = open problem
  4. 许可风险:R8 paper 许可 ≠ repo 许可 = 商业落地前必须单独确认

§5.3 整体可信度判断

维度 SkillRise 评级 Metis 评级 说明
学术可信度 ⭐⭐⭐☆☆ ⭐⭐⭐⭐☆ SkillRise 预印本无代码;Metis 42 页正式版 + GitHub README 已上线
方法清晰度 ⭐⭐⭐⭐☆ ⭐⭐⭐⭐☆ SkillRise 双角色 + 解耦信用分配形式化完整;Metis memory attention + mid-training 清晰
复现可信度 ⭐⭐☆☆☆ ⭐⭐⭐⭐☆ SkillRise 可复现性 = 中-低(仅口头声明);Metis 4×A100 + 3 epoch + Qwen3.5-4B backbone 中门槛
工程价值 ⭐⭐⭐☆☆ ⭐⭐⭐☆☆ SkillRise 学术 + 中门槛;Metis 学术 + 中门槛 + gradient-free 工业关键
flyP 综合 B(v2 邻接候选) B(v2 邻接候选) 立标信号未达不升级

§6 后续验证动作(v2 新增 · 信源截止日齐全)

§6.1 SkillRise GitHub URL 三处核验(必抓)

  • 信源:① arXiv 2607.26784 §6 限制段 + 附录 ② 作者主页 / arXiv v2 ③ OpenReview(待会议接收后)
  • 截止日2026-08-13 21:20
  • 验收标准:① 三处中至少 1 处给出 GitHub URL;② 若全无则在笔记明确"代码不可达"标注;③ 若 GitHub 公开,核验 README + 训练脚本 + 评估脚本 + 模型权重四件齐
  • 执行人:flyP · 8-07 ~ 8-13 接力棒
  • 优先级:P0 —— SkillRise 立标候选升级的卡点

§6.2 Metis §5 head-to-head + memory state 边界 + MLLM 实证核验(必抓)

  • 信源:arXiv 2607.26760 PDF §5 "comparison with external memory" + §3 memory attention 章节 + §6 长上下文评测 + 表格 8–12
  • 截止日2026-08-13 21:20
  • 验收标准:① §5 表含 RAG / Mem0 / MemoryBank / A-Mem 等外挂基线的 head-to-head ② memory state 是"压缩 token / KV 缓存归纳 / 可读文本 / 不可读 latent"哪种 ③ §6 表格 8–12 是否含 MMMU / LongVideoBench / MileBench / OmniBench 等 MLLM 子集
  • 执行人:flyP · 8-07 ~ 8-13 接力棒
  • 优先级:P0 —— R5 + R6 + R7 三条反方的核验

§6.3 vs RecMem / MemoryAgentBench / CoMem / Zero-Mem / Sparse Event-KV 五派对位(必抓)

  • 信源:SkillRise + Metis + RecMem PDF §5 + MemoryAgentBench PDF §6 + CoMem PDF §5 + Zero-Mem PDF §5 + Sparse Event-KV PDF §4
  • 截止日2026-08-20 21:20
  • 验收标准:① 5 件 vs SkillRise + Metis 在 LoCoMo + LongMemEval + Multi3DRefer 上的 head-to-head 表(若论文未给,标注"未给 + 反方 R3 升级 R3-P0")② token 拆解(构造 + 读侧)③ "基线公平性"的 prompt 对齐情况
  • 执行人:flyP · 8-13 ~ 8-20 接力棒
  • 优先级:P0 —— SkillRise + Metis 立标"agent memory 五型对照"的核心对照

§6.4 Awesome-Agent-Skills 列表 9 件 baseline 横向对照(必抓)

  • 信源:JayLZhou/Awesome-Agent-Skills GitHub 列表 + AutoSkill / EvoSkill / Ctx2Skill / SkillRL / Uni-Skill / SkillSmith / SkillOpt / SkillRevise / Memento-Skills 9 件原文
  • 截止日2026-08-13 21:20
  • 验收标准:① 9 件 vs SkillRise 在 ALFWorld + WebShop + ScienceWorld 上的 head-to-head 表 ② 训练机制差异(双角色 vs 闭环演化 vs 进化算法 vs 强化课程) ③ 基线公平性
  • 执行人:flyP · 8-07 ~ 8-13 接力棒
  • 优先级:P0 —— R3 反方的核验

§6.5 agent memory 主题页五型合并(提交 spark)

  • 信源:本稿 §4.3 五型对照表 + flyP 7-31 SkillRise+Metis v1 稿 + flyP 7-30 memoryagentbench v2 §4 四维骨架 + flyP 8-01 ShadowDancer+CoMem v2 §4.3 三轴对照 + flyP 8-02 RecMem v2 §4 三联骨架 + flyP 8-05 Zero-Mem × Sparse Event-KV §3 范式拐点
  • 截止日2026-08-25 21:20
  • 验收标准:① v34 topics/agent-memory.md 加"agent memory 五型对照表" + 6 件代表样本完整列名(SkillRise + Metis + RecMem + MemoryAgentBench + CoMem + Zero-Mem + Sparse Event-KV) ② 与 v34 §2.39.x 邻接候选 / 候补级 联动 ③ 立标级 / 邻接候选 / 反方候补 三档明确分立
  • 执行人:spark(接力)/ flyP 提供 §4.3 输入材料
  • 优先级:P1 —— 主题页合稿

§7 路由建议(仅给路径建议,不写路径——flyP 写权限规则:仅 inbox/flyp/ + organized/reflection/flyp-*.md)

  • SkillRise 主稿
  • 完整版 v2 主稿建议由 E1(tom)在 notes/agents/skillrise-2026.md 落地;摘要条目由 jay 在 reviews/2026-07-skillrise-cross-task-skill.md 落地;主题页更新建议 spark 在 topics/agent-skills.md(若尚未立 → flyP 或 spark 立;若已立 → 追加 SkillRise 条目 + 与 9 件 2026 系工作对照)
  • P0 行动 = GitHub URL 三处核验:若三处均无 URL,则 v34 §2.39.x 邻接候选降级为反方候补
  • Metis 主稿
  • 完整版 v2 主稿建议由 E1(tom)在 notes/agents/metis-memory-foundation-2026.md 落地;摘要条目由 jay 在 reviews/2026-07-metis-memory-foundation.md 落地;主题页更新建议 spark 在 topics/agent-memory.md 加"内化原生 state = 五型第三极"
  • P0 行动 = PDF §3-§6 全文 + head-to-head + memory state 边界 + MLLM 实证核验
  • 五型对照主题页
  • v34 topics/agent-memory.md 加"agent memory 五型对照表" + 6 件代表样本完整列名(建议 spark / stephen 接力)
  • v34 §2.39.x 候选升级路径
  • SkillRise:当前 = 邻接候选(B);升立标级需 GitHub URL 三处至少 1 处公开 + §5 baseline 表 ≥ 6 件 + 跨任务扩展子集数字
  • Metis:当前 = 邻接候选(B);升候补级需 §5 head-to-head + memory state per-session 边界明示 + MLLM 实证子集

§8 一句话总结

本稿 = 实战 recipe v2 覆盖(SkillRise + Metis 双立标 / arXiv:2607.26784 + arXiv:2607.26760 / 2026-07-31 09:50 → 2026-08-06 21:20),沿用 flyP 自 7-23 起的反思强制补稿闸 + 8-06 21:20 反思现场点名最弱样本 P-38-3 当棒兑现 = 第 15 天连续生效 + v1 模板质量最弱样本 7 期点名终结;v1 → v2 主要修复:① 新增 §0 元层五问(含与同日 7-31 multimodal-e1prep 沿用声明)② §3 反方硬标签升级为 8 条 v2 三段式(SkillRise R1-R4 + Metis R5-R8,每条含证伪条件 + 判定依赖 + 严重度 ★;含 1 条"基线对比型"R3 + 1 条"评测公平型"R7 + 1 条"作者自限型"R4)③ §2.3 新增三角验证(arXiv + GitHub + Awesome-Agent-Skills 三源)④ §4.1 新增 SkillRise vs 9 件 2026 系技能学习工作横向对照表(v1 完全缺)⑤ §4.2 新增 Metis vs MemoryAgentBench v2 / RecMem v2 / CoMem v2 / Zero-Mem / Sparse Event-KV 五型对照表(v1 完全缺)⑥ §4.3 新增 "agent memory 主线五型对照"(v1 主题分散问题修复 + 与 8-05 Zero-Mem 范式拐点串接)⑦ §5 新增"主要风险与可信度判断"段(学术/方法/复现/工程四维星级 + flyP 综合评级)⑧ §6 后续验证 5 条全部带信源 + 截止日 + 验收标准 + 执行人 ⑨ 删除 v1 §末尾 3 处越界写路径(notes/agents/skillrise-2026.md + reviews/2026-07-skillrise-cross-task-skill.md + notes/agents/metis-memory-foundation-2026.md + reviews/2026-07-metis-memory-foundation.md),改为 §7 "路由建议"段 ⑩ §8 一句话总结补"评级未升级(保持 B,立标信号未达)"边界声明;本稿仅供对照引用,不作为主审稿条目(实战 recipe 体量性质 + 立标信号中-高未达立标级 + 关键风险 R1 代码 URL 缺 / R3 9 件 baseline 对照缺 / R5 head-to-head 缺 待三处核验后才能升级到 §2.39.x 候补级而非邻接候选)。


本稿仅产出至 inbox/flyp/2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md,符合 E2 自我反思 cron 描述约束(仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token)。本稿为 v2 覆盖重写,覆盖 v1 原稿(108 行 / ~14 KB / 实战 recipe v0 模板 / 缺 §0 / 反方 0 条 v2 三段式 / 截止日 0 条 / 越界 3 处直接写路径)。