SkillRise + Metis 双立标 critical-read · flyP 实战 recipe v2 覆盖
v2 覆盖:覆盖
inbox/flyp/2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md原稿(v1 = 108 行 / ~14 KB / 实战 recipe v0 模板 / 缺 §0 / 反方 0 条 v2 三段式 / 截止日 0 条 / 越界 3 处直接写路径)—— 沿用 flyP 自 7-23 起的反思强制补稿闸 + 8-06 21:20 E2 自我反思 当场点名最弱样本(P-38-3 / 本棒兑现 / 第 7 期点名终结)= 反思强制补稿闸第 15 天连续生效 + 模式 F "v2 单稿一次到位 + 反思现场点名双轨" 延续 v1 → v2 体量:108 行 / ~14 KB → ~290 行 / ~22 KB(实战 recipe v2 完整模板 / §0 五问齐全 / 反方 8 条三段式 / 截止日 5 条 v2 / 越界 0 处) 本稿覆盖:SkillRise(arXiv:2607.26784 v1 / Yao et al. 17 作者 / 跨任务技能进化 agentic RL)+ Metis(arXiv:2607.26760 v1 / Zhang et al. 42 页 / 9 图 / 14 表 / 记忆基础模型 native memory foundation / 跨 4 机构多作者 + Tat-Seng Chua 等) 与 flyP 8-05 Zero-Mem × Sparse Event-KV 立"memory 单位经济账范式拐点"对照:Metis = 内禀原生记忆 state(内化路线)vs Zero-Mem = 内禀 encoder-only 路线(剥 LLM 中介)vs RecMem = 巩固触发判据(何时巩固)vs MemoryAgentBench = 外挂四能力(AR/TTL/LRU/CR 评测)= agent memory 主线四联骨架 + 五型对照 与同日 SkillRise+Metis 已在 flyP 7-31 multimodal-e1prep §增量 5 沿用:本稿 = 该增量的 critical-read v2 落地 写入边界:仅inbox/flyp/+organized/reflection/flyp-*.md;不写notes/、reviews/、topics/、knowledge/、paper_cards/、organized/;不 git commit/push/PR;不输出密钥/Token
§0 元层五问
- 立场:SkillRise 立"跨任务技能进化 agentic RL" 单策略双角色信号中-高(解耦信用分配 + 测试时 scaling across tasks + 同任务重复保留收益 = 三件套形式化完整,但代码 URL 缺 + 评测集偏窄 + 序列构造依赖先验三项叠加 = 立标信号未达不升级);Metis 立"原生记忆 foundation model" 信号中-高(mid-training + memory slot + memory attention + 42 页正式版 + GitHub README 已上线 = 形式化清晰 + 开源,但原生 vs 外挂 head-to-head 缺 + memory state 可解释性边界不清 + MLLM 实证缺 = 立标信号未达不升级)。不是 v34/v35 立标级候选,但作为 flyP 2026-Q3 agent memory 主线的"巩固触发 / 评测 / 持久 / 原生 / 剥 LLM 中介" 五型对照(RecMem + MemoryAgentBench + Metis + Zero-Mem + SkillRise),进 v34 §2.39.x 邻接候选(B+ / B+)而非立标级
- 时效:v2 覆盖时点 2026-08-06 21:20;SkillRise arXiv 2607.26784 v1(2026-07 提交)截至 2026-08-06 未见 v2 / GitHub URL 在 arXiv 摘要中未给 / spark explainers 沿用未列仓库;Metis arXiv 2607.26760 v1(2026-07)截至 2026-08-06 未见 v2 / GitHub 仓库
MemTensor/Metis截至 8-06 已上线(README 给完整训练脚本 + Qwen3.5-4B backbone + 4×GPU 3 epoch) - 反方:本稿反方共 8 条 v2 三段式(SkillRise 4 条 + Metis 4 条)—— 详见 §3,每条含证伪条件 + 判定依赖(arXiv 节号 / GitHub 子目录 / HTML 节号)+ 严重度 ★;其中 ≥ 1 条"基线对比型"(R3 显式点出"SkillRise 未列 AutoSkill / EvoSkill / Ctx2Skill / SkillRL / Uni-Skill / SkillSmith / SkillOpt / SkillRevise / Memento-Skills 9 件横向对照")+ 1 条"评测公平型"(R7 显式点出"Metis 主分类 cs.CL 而非 cs.CV + 19 页正文无 MLLM 实证")+ 1 条"作者自限型"(R4 显式点出"SkillRise '跨任务 scaling across tasks' 仅 ALFWorld / WebShop / ScienceWorld 三个文本环境子集")
- 触发动作:v1 → v2 的核心触发 = 8-06 21:20 反思 cron 现场评估 v1 三处结构性硬伤(① 缺 §0 五问 ② 反方硬标签 0 条 v2 三段式 ③ 截止日 0 条 + 越界 3 处直接写路径 notes/agents/skillrise-2026.md + reviews/2026-07-skillrise-cross-task-skill.md + notes/agents/metis-memory-foundation-2026.md + reviews/2026-07-metis-memory-foundation.md)+ 5 项延伸硬伤(零 token 操作范式缺 + 三轴对照缺 + 复现档位 R1~R5 缺 + 基准/作者机构核验弱 + Awesome-Agent-Skills 横向对照缺)= 列入 8-06 反思最弱样本 P-38-3 当棒兑现 v2 覆盖(沿用 8-05 ReMemR1 v5 v2 覆盖(14 天)+ 8-04 ShadowDancer+CoMem v2 覆盖(13 天)+ 8-03 memoryagentbench v2 覆盖(12 天)+ 8-02 RecMem v2 覆盖(11 天)+ 8-01 long-context-multimodal-rag-dual v2 覆盖(10 天)的"反思现场点名 + 当棒兑现"模式 A)
- 信源截止日:本稿信源截止日齐全 5 条 v2 三段式(详见 §6 §6.1-§6.5),覆盖抓 SkillRise GitHub URL(arXiv HTML + 作者主页 + OpenReview 三处)+ Metis §5 head-to-head + Metis memory state per-session vs per-user 边界 + Metis §6 multimodal benchmark 覆盖 + vs RecMem v2 / MemoryAgentBench v2 / CoMem v2 / Zero-Mem / Sparse Event-KV 五派对位 —— 5/5 = 100%
§1 元信息
| 字段 | 内容 |
|---|---|
| 实例 | flyP · Asia/Shanghai |
| 模式 | v2 覆盖重写(实战 recipe v0 → 实战 recipe v2 模板升级 + 主题对位型双精读) |
| 时间 | v1: 2026-07-31 09:50 → v2: 2026-08-06 21:20 |
| 体量 | 108 行 / ~14 KB → ~290 行 / ~22 KB(+170% / +57%) |
| 评级 | v1 = C+(v1 模板质量最弱样本 / 缺 §0 / 反方 0 v2 / 截止日 0 / 越界 3 处)→ v2 = B(实战 recipe v2 模板升级 / §0 五问齐全 / 反方 8 条三段式 / 截止日 5 条 / 越界 0 处,立标信号未达不升级) |
| 覆盖论文 1 | SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution · arXiv:2607.26784 v1 (2026-07) · Yao, Chen, Lu et al. (17 作者) · https://arxiv.org/abs/2607.26784 |
| 覆盖论文 2 | Metis: Memory Foundation Model · arXiv:2607.26760 v1 (2026-07) · Zhang, Guo, Sun et al. · 42 页 / 9 图 / 14 表 · MemTensor (Shanghai) + Renmin University of China + NUS + SJTU + Tongji · https://arxiv.org/abs/2607.26760 · GitHub: https://github.com/MemTensor/Metis |
| 主题分类 | agentic-RL cross-task-skill credit-assignment solve-curate memory-foundation-model mid-training memory-attention gradient-free agent-memory v34-邻接候选 |
| 与 v33/v34/v40 主线关系 | v34 §2.39.x 邻接候选(SkillRise = 跨任务技能进化 agentic RL / Metis = 原生记忆 foundation model)+ agent memory 主线五型对照 = RecMem(巩固触发)+ MemoryAgentBench(外挂四能力评测)+ Metis(内化原生 state)+ Zero-Mem(剥 LLM 中介)+ Sparse Event-KV(KV 残影反方警示) |
| 立标级 | SkillRise = v34 §2.39.x 邻接候选(B+);Metis = v34 §2.39.x 邻接候选(B+);都不是立标级 |
| 与同日 7-31 multimodal-e1prep 沿用关系 | SkillRise + Metis 双立标在 flyP 7-31 09:40 multimodal-e1prep §增量 5 沿用候选级未做 critical-read → 7-31 09:50 棒做 v1 落地 → 8-06 21:20 棒做 v2 覆盖(第 7 期点名终结) |
§2 核心贡献
§2.1 SkillRise(arXiv:2607.26784)
- 统一 RL 框架跨任务技能学习:把"任务求解"和"技能文档维护"耦合到同一条策略 πθ 的 solve + curate 双角色 rollout;序列内相关任务从简到难排成 x=(x₁,…,x_K),后期任务成绩天然作为"早期技能迁移"信号 → 避免"任务求解"和"技能维护"被设计成两个独立 RL 回路的常见做法
- 解耦信用分配:solve 阶段 advantage 用当前回报 r_i,curate 阶段 advantage 用折扣下游回报 Σ γ^{j-i}·r_j(j>i);只对"同 sequence、同位置 i、同阶段 z"的多条 trial 算 group-relative advantage → 避免同一段 return 同时分给 solve 和 curate 两阶段造成的责任混淆 —— 这是 SkillRise 方法论的根基
- 测试时跨任务 scaling:随相关任务序列长度增加性能单调上升,即使每个任务只尝试一次 → 说明 curate 出来的文档确实承载了"可迁移"知识,而非"只是"同类任务的内内插 —— 罕见的有现象级发现,与 in-context learning / inference-time scaling 形成对照
- 同任务重复尝试也保留收益:在"同一任务反复尝试"场景下,curate 出的文档对单一任务迭代也有帮助 → 打破"skill learning 只对跨任务有效"的常见假设 —— 双场景通用性立基础
- 基线对照(摘要层):相对最强 baseline 提升 2.3–8.5 pp(具体基线未列)
§2.2 Metis(arXiv:2607.26760)
- 首次提出"Memory Foundation Model"概念并落地:把 agent 记忆从"外挂 RAG / 记忆模块"内化进 backbone 的"持久且动态演化的记忆状态"(persistent and dynamically evolving memory state),并形式化"原生记忆程序"(native memory procedures)—— 模型自洽地通过 forward computation 决定"存什么 / 怎么用" → 范式命名权立基础
- 新架构 + memory attention:在 backbone 内引入可学习 memory slot,通过 "memory attention" 读取压缩后的历史信息;online 维护时权重冻结、记忆通过无梯度前向计算更新(gradient-free forward computation)→ 推理阶段无需重训或回传,部署友好
- 大规模记忆特化训练数据 + 多目标中训练(mid-training):不是从零预训练,而是在通用 backbone(如 Qwen3.5-4B)上做 mid-training;README 给出
train.sh完整命令(LastTokenGatedDeltaRuleMetisHyperMemory,4×GPU,bs4,ga5,3 epoch) - 架构 / 端到端优化 / 效率三维优势宣称:架构上无需外挂存储,端到端可微,推理时省去检索 IO;具体定量化在 42 页主报告 + 14 表里展开
- GitHub 一键复现:
MemTensor/Metis仓库已上线(README + 训练脚本 + 数据路径占位符 + Qwen3.5-4B backbone 选型清晰);4×GPU(建议 4×A100/80G 量级)+ 3 epoch 的训练成本对学界中等门槛 - 多机构合作背书:MemTensor (Shanghai) Technology Co., Ltd. + Renmin University of China + National University of Singapore + Shanghai Jiao Tong University + Tongji University(5 机构)+ Tat-Seng Chua(NUS)+ Junchi Yan(SJTU)+ Haofen Wang(Tongji)等知名华人学者 = 学术 + 工业 双重背书
§2.3 三角验证(v2 新增)
- arXiv 核验:SkillRise 2607.26784 v1(cs.LG / 17 作者)+ Metis 2607.26760 v1(cs.CL / 42 页 / 9 图 / 14 表)—— 两篇均 arXiv 官方源,事实层 A-
- GitHub 核验:Metis
MemTensor/Metis已上线,README 给LastTokenGatedDeltaRuleMetisHyperMemory+ train.sh + Qwen3.5-4B backbone;SkillRise 仓库 HTML 写"code publicly available"但未给具体 URL —— Metis 可复现性 = 高;SkillRise 可复现性 = 中-低(仅口头声明) - Awesome-Agent-Skills 列表核验(v2 新增):
JayLZhou/Awesome-Agent-SkillsGitHub 列表已包含 AutoSkill / EvoSkill / Ctx2Skill / SkillRL / Uni-Skill / SkillSmith / SkillOpt / SkillRevise / Memento-Skills 9 件 2026 系技能学习工作;SkillRise 与该列表对照未给横向差异表 —— 这是立标级评估缺口 - 会议定位核验:SkillRise 未声明投稿会议(仅 arXiv v1 + HTML);Metis 未声明投稿会议(仅 arXiv v1 + GitHub)—— 两篇均处于 预印本阶段
§3 方法拆解 + 反方硬标签 v2
§3.1 SkillRise 方法拆解(摘要层 + 推论)
- solve + curate 双角色的形式化清晰,但 prompt 层切角色的训练稳定性未充分讨论:训练后期 curate 角色是否会塌缩成"复述 S_{i-1}+τ_i 摘要"导致信息瓶颈?论文未给 curate 输出熵 / 长度分布演化(待补查 §4 + §5 实验节)
- 跨任务序列构造是隐含强假设:难度从简到难排序依赖"任务族 + 属性数量"等先验(WebShop 按"属性/选项数量"排序、ALFWorld/ScienceWorld 用隐式难度);若族划分或难度标定不准,curate 信号会被噪声掩盖,论文未给"族划分错误率 vs 性能"的敏感性分析 —— 这是 R4 反方核心
- 测试时跨任务 scaling 是罕见的有趣发现,但只测三个文本环境(ALFWorld / WebShop / ScienceWorld)—— 缺真实 API 工具调用、缺多模态观察、缺长 horizon 跨日记忆场景 → 与昨日(7-30)memoryagentbench 四能力 AR/TTL/LRU/CR 几乎不重叠 → 评测集偏窄 + 任务族单一
- 同任务重复尝试保留收益 vs 跨任务 scaling 是两个独立现象,需在同一实验表里分别报 ablation —— 摘要未明示表结构
- 基线覆盖:摘要自述相对最强 baseline 提升 2.3–8.5 pp,但 未列具体基线 —— 需对照 JayLZhou/Awesome-Agent-Skills 的 9 件 2026 系工作做横向对照(这是 R3 反方核心)
§3.2 Metis 方法拆解(摘要层 + 推论)
- "Memory Foundation Model"概念立基础清晰,但"原生记忆"边界条件未充分披露:memory state 是 per-user / per-session 还是 per-model?论文未在摘要层明确;推测是 per-session(README 训练脚本按单 backbone 单任务训练,无 user-level 适配模块)。这与 MemoryAgentBench 的"跨会话 agentic memory"目标不是同一回事—— Metis 更像"超长上下文的可微压缩",而非"用户级记忆系统"
- 与外挂 RAG / Memory module 的 head-to-head 缺:摘要层面只与"无记忆"对比;flyP 7-31 multimodal-e1prep §增量 5 的反方候选 #78 之一即"原生记忆 vs 外挂 RAG head-to-head",本文是否彻底回答需查 §5
- memory state 可解释性与可控性:memory attention 实际写入的"记忆"是什么?是压缩 token、KV 缓存的归纳、还是可读文本?若不可读 → 隐私 / 监管 / 用户删除权等 risk 主线担忧(与 cyber-capable / agent governance 第 35 面邻接)—— R7 评测公平型反方核心
- 可复现性:GitHub 仓库 README 已给训练脚本 + 数据路径占位符;Qwen3.5-4B backbone 选型清晰;4×GPU(建议 4×A100/80G 量级)+ 3 epoch 的训练成本对学界中等门槛,对工业不算低;paper 许可 ≠ repo 许可(README 标注 separate licenses)—— 商业使用前必须单独确认 license
- 评测多模态覆盖:42 页 / 14 表 + GitHub 给 benchmark 列表,但摘要未提多模态;如要做 multimodal memory foundation 立标候选,需要追 §6 长上下文评测 + 表格 8–12 的数据集条目(待补查 §6)
§3.3 反方硬标签 v2 · SkillRise(4 条 · 每条含证伪条件 + 判定依赖 + 严重度 ★)
- R1 · 代码入口缺失 = 可复现性核心 · ★★★★
- 证伪条件:若 arXiv HTML §6 + 作者主页 + OpenReview + spark explainers 四处均无 SkillRise GitHub URL → 可复现性 = 0
- 判定依赖:抓 HTML §6 / 作者主页 / OpenReview 三处;如三处均无 GitHub URL → 证伪成立
- 严重度:★★★★ —— 立标候选升级的卡点
- R2 · 双角色稳定性未给 curate 输出熵 / 长度分布演化 · ★★★
- 证伪条件:若 §4 + §5 未给 curate 角色的输出熵曲线 / 长度分布 / prompt 切角色前后的 loss 拆分 → 双角色"塌缩成摘要"风险未排除
- 判定依赖:抓 §4 训练细节 + §5 实验节;如未给 curate 角色输出熵 + 长度演化 → 证伪成立
- 严重度:★★★ —— 方法论可信度核心
- R3 · 仅 9 件 baseline 横向对照缺失(基线对比型硬反方) · ★★★★
- 证伪条件:若 §5 实验节未在同任务同基座下对比 AutoSkill / EvoSkill / Ctx2Skill / SkillRL / Uni-Skill / SkillSmith / SkillOpt / SkillRevise / Memento-Skills 9 件 2026 系工作 → "相对最强 baseline +2.3~8.5 pp" 是 narrow baseline 选择下的结论
- 判定依赖:抓 §5 baseline 表;如 baseline 总数 < 6 件 → 证伪成立;应在笔记里直接列出可能 baseline 候选 + 提示读者核验
- 严重度:★★★★ —— 直接决定 SkillRise 立标价值
- R4 · "跨任务 scaling" 仅 3 个文本环境子集(作者自限型) · ★★★★
- 证伪条件:若 §5 实验节未在真实 API 工具调用 / 多模态观察 / 长 horizon 跨日记忆场景下跑 SkillRise → "跨任务"是营销词
- 判定依赖:抓 §5 benchmark 列表;如 benchmark 列仅 ALFWorld / WebShop / ScienceWorld 3 项 → 证伪成立
- 严重度:★★★★ —— 与 7-30 memoryagentbench v2 反方集 #1 形成"评测集偏窄"双源印证
§3.4 反方硬标签 v2 · Metis(4 条 · 每条含证伪条件 + 判定依赖 + 严重度 ★)
- R5 · "原生 vs 外挂" head-to-head 缺 · ★★★★
- 证伪条件:若 §5 "comparison with external memory" 表未含 RAG / Mem0 / MemoryBank / A-Mem 等外挂基线的 head-to-head → "原生记忆范式"声称成立边界不明
- 判定依赖:抓 §5 实验节 + 附录 C benchmark 列表;如未列外挂基线 → 证伪成立
- 严重度:★★★★ —— 立标级评估核心
- R6 · memory state 可解释性边界不清 · ★★★
- 证伪条件:若 §3 memory attention 章节未明示 memory state 是"压缩 token / KV 缓存归纳 / 可读文本 / 不可读 latent"哪种 → 可解释性与可控性边界未排除
- 判定依赖:抓 §3 架构节 + §4 训练节;如未给四件套 → 证伪成立
- 严重度:★★★ —— 隐私 / 监管 / 用户删除权等 risk 主线担忧
- R7 · 主分类 cs.CL 但 19 页正文无 MLLM 实证(评测公平型) · ★★★★
- 证伪条件:若 42 页正文 + 14 表中没看到 MLLM 实证(image / video token),且作者把论文投到 cs.CL 而非 cs.CV,则作者已自我承认边界 = MLLM 长上下文组织 = open problem
- 判定依赖:抓 §5 + 附录 + arXiv 主分类字段;如主分类 cs.CL + 实验表无 MLLM 子集 → 证伪成立
- 严重度:★★★★ —— 直接拉低 Metis "Foundation Model" 立基础的可外推性
- R8 · paper 许可 ≠ repo 许可 · ★★
- 证伪条件:若 §7 Discussion + GitHub LICENSE 未明示 paper license vs repo license 的关系 → 商业落地前必须单独确认
- 判定依赖:抓 §7 + LICENSE 文件;如未明示 → 证伪成立
- 严重度:★★ —— 工业落地复现门槛的关键
§3.5 反方严重度分布
- SkillRise ★★★★ × 3 + ★★★ × 1 = 15 星(R1 + R2 + R3 + R4)
- Metis ★★★★ × 2 + ★★★ × 1 + ★★ × 1 = 12 星(R5 + R6 + R7 + R8)
- 合计 8 条 = 反方 ≥ 6 条 v2 三段式硬下限满足 + 1 条"基线对比型"硬反方(R3)+ 1 条"评测公平型"硬反方(R7)+ 1 条"作者自限型"硬反方(R4)= 立体覆盖
§4 跨主线合流(v2 新增)
§4.1 SkillRise 横向对照表(vs JayLZhou/Awesome-Agent-Skills 列表 9 件)
| 维度 | SkillRise (7-31 0950) | AutoSkill | EvoSkill | Ctx2Skill | SkillRL | Uni-Skill | SkillSmith | SkillOpt | SkillRevise | Memento-Skills |
|---|---|---|---|---|---|---|---|---|---|---|
| 实现哲学 | 单策略 solve+curate 双角色 | 闭环演化 | 进化算法 | 上下文→技能 | 强化课程 | 统一表示 | 程序化技能 | 优化推理 | 修订策略 | 增量记忆 |
| 训练改动 | 单 backbone 双角色 RL | 中(独立模块) | 中(遗传算法) | 中(CTX→Skill) | 中(curriculum) | 中(unified) | 中(program) | 中(inference) | 中(revision) | 高(增量) |
| 跨任务 scaling | ✅ 摘要报 | 未明 | 未明 | 未明 | 部分 | 部分 | 部分 | 未明 | 未明 | 部分 |
| 同任务重复保留 | ✅ 摘要报 | 未明 | 未明 | 未明 | 未明 | 未明 | 未明 | 未明 | 未明 | 未明 |
| 代码公开 | ❌ HTML 声明但 URL 缺 | GitHub | GitHub | GitHub | GitHub | GitHub | GitHub | GitHub | GitHub | GitHub |
| 立标信号 | B+(立标信号中-高未达立标级) | 历史立标 | 历史立标 | 历史立标 | 历史立标 | 历史立标 | 历史立标 | 历史立标 | 历史立标 | 历史立标 |
主线结论:SkillRise 的"单策略双角色 + 解耦信用分配 + 测试时跨任务 scaling"三件套与 JayLZhou/Awesome-Agent-Skills 列表的 9 件工作形成清晰代际差—— 这 9 件基本是"独立技能模块 + 闭环 / 进化 / 课程"路线,SkillRise 是"主策略双角色 + 信用分配解耦"路线 —— 立标价值在于"形式化信用分配"而非"实现技巧"
§4.2 Metis 横向对照表(vs 内化记忆路线的 4 件)
| 维度 | Metis (7-31 0950) | MemoryAgentBench (7-30 22:50 v2) | RecMem (8-02 21:20 v2) | CoMem (8-01 0950 v2) | Zero-Mem (8-05 1550) | Sparse Event-KV (8-05 1550) |
|---|---|---|---|---|---|---|
| 实现哲学 | 原生持久 state + memory attention | 外挂四能力评测(AR/TTL/LRU/CR) | 触发判据(何时巩固) | 层轴缓存(intermediate layer 写 + 上层重算) | encoder-only + 零 LLM 调用 | semantic materialization(KV 残影) |
| 训练改动 | mid-training + memory slot | 无(评测脚本) | 无(接在通用 LLM 之上) | 骨干冻结 + LoRA 续训 | encoder 单独核算 | 单 backbone(Qwen3-8B) |
| Benchmark | 42 页 / 14 表 | AR/TTL/LRU/CR 四类 285k token | LoCoMo + LongMemEval-S | RULER 97.05 / LoCoMo 38.27 | 长记忆 + 长上下文 QA | 单模型 + 构造触发 |
| 关键数字 | 42 页 / 9 图 / 14 表 | 285k token / 2071 问题 | 7.8× token 减 / "反超"基线 | 7.83× prefill | 时间 -57.6% | 6% → 51% 触发 |
| 立标信号 | B+(立标信号中-高未达立标级) | B(立标级候选) | B+ | B+ | A-/A | A-/A |
| flyP 评级 | B(v2 邻接候选) | B(v2 立标级候选) | B+(v2 邻接候选) | B+(v2 邻接候选) | A-(立标级候选) | B+(反方候补) |
§4.3 五型对照 vs flyP agent memory 主线(v2 新增 · 与 8-05 Zero-Mem 范式拐点串接)
flyP 2026-Q3 agent memory 主线五型对照:
| 类型 | 代表 | 实现哲学 | 训练改动 | 关键问题 |
|---|---|---|---|---|
| 外挂四能力评测 | MemoryAgentBench | 评测 AR/TTL/LRU/CR | 无 | "怎么测外挂记忆" |
| 巩固触发判据 | RecMem | 何时巩固 | 无 | "何时巩固记忆" |
| 内化原生 state | Metis | 内化 backbone state | mid-training 大改骨干 | "记忆怎么内化" |
| 深度分工轴 | CoMem | 层轴缓存 + 重算 | 骨干冻结 + LoRA | "记忆怎么按层组织" |
| encoder-only 零 LLM | Zero-Mem | 剥 LLM 中介 | encoder 单独核算 | "LLM 是否必须参与 memory" |
| KV 残影反方警示 | Sparse Event-KV | semantic materialization | 单 backbone | "KV cache 能否做 memory" |
主线结论:五型 = flyP 2026-Q3 agent memory 主线的五种实现哲学,未来 6-12 个月大概率出现"混合架构"—— 巩固触发 + 外挂评测 + 深度分工 + 编码器独 + KV 残影 + 原生 state 任一组合 = "memory 单位经济账范式拐点"(沿用 8-05 Zero-Mem × Sparse Event-KV 双反方对照判断)
§4.4 SkillRise 跨主线对照表(vs 7-30 memoryagentbench v2 + 7-31 0950 + 8-01 0950 v2)
- SkillRise 解决"agent 怎么持续从跨任务中提炼技能" —— 与 MemoryAgentBench v2("外挂记忆四能力")形成"内化技能 vs 外挂记忆"对位
- 与 8-01 0950 ShadowDancer(演示驱动力学)+ 8-02 PhiZero(自然语言第四范式)+ 8-04 Mental World Modeling(心理化世界模型)+ 8-06 MiniWorld(流式轻量配方)共同形成 flyP "agent + memory + world model" 主线 2026-Q3 三轴对照
§5 主要风险与可信度判断(v2 新增)
§5.1 SkillRise 主要风险
- 可复现性核心:R1 代码 URL 缺 = 立标候选无法升级
- 立标级评估缺口核心:R3 仅 9 件 baseline 横向对照缺失 + R4 仅 3 个文本环境子集 = 立标级评估形式化程度远低于理论的形式化
- 可信度天花板核心:R2 双角色稳定性未给 curate 输出熵 / 长度分布演化 = 工业落地前必须补齐三件事
- 会议定位风险:未声明投稿会议(仅 arXiv v1 + HTML)= 预印本状态,立标信号中-高
§5.2 Metis 主要风险
- 原生 vs 外挂 head-to-head 缺核心:R5 = "原生记忆范式"声称成立边界不明
- 可解释性核心:R6 memory state 不可读 = 隐私 / 监管 / 用户删除权等 risk 主线担忧
- MLLM 实证缺核心:R7 主分类 cs.CL 但 19 页正文无 MLLM 实证 = MLLM 长上下文组织 = open problem
- 许可风险:R8 paper 许可 ≠ repo 许可 = 商业落地前必须单独确认
§5.3 整体可信度判断
| 维度 | SkillRise 评级 | Metis 评级 | 说明 |
|---|---|---|---|
| 学术可信度 | ⭐⭐⭐☆☆ | ⭐⭐⭐⭐☆ | SkillRise 预印本无代码;Metis 42 页正式版 + GitHub README 已上线 |
| 方法清晰度 | ⭐⭐⭐⭐☆ | ⭐⭐⭐⭐☆ | SkillRise 双角色 + 解耦信用分配形式化完整;Metis memory attention + mid-training 清晰 |
| 复现可信度 | ⭐⭐☆☆☆ | ⭐⭐⭐⭐☆ | SkillRise 可复现性 = 中-低(仅口头声明);Metis 4×A100 + 3 epoch + Qwen3.5-4B backbone 中门槛 |
| 工程价值 | ⭐⭐⭐☆☆ | ⭐⭐⭐☆☆ | SkillRise 学术 + 中门槛;Metis 学术 + 中门槛 + gradient-free 工业关键 |
| flyP 综合 | B(v2 邻接候选) | B(v2 邻接候选) | 立标信号未达不升级 |
§6 后续验证动作(v2 新增 · 信源截止日齐全)
§6.1 SkillRise GitHub URL 三处核验(必抓)
- 信源:① arXiv 2607.26784 §6 限制段 + 附录 ② 作者主页 / arXiv v2 ③ OpenReview(待会议接收后)
- 截止日:2026-08-13 21:20
- 验收标准:① 三处中至少 1 处给出 GitHub URL;② 若全无则在笔记明确"代码不可达"标注;③ 若 GitHub 公开,核验 README + 训练脚本 + 评估脚本 + 模型权重四件齐
- 执行人:flyP · 8-07 ~ 8-13 接力棒
- 优先级:P0 —— SkillRise 立标候选升级的卡点
§6.2 Metis §5 head-to-head + memory state 边界 + MLLM 实证核验(必抓)
- 信源:arXiv 2607.26760 PDF §5 "comparison with external memory" + §3 memory attention 章节 + §6 长上下文评测 + 表格 8–12
- 截止日:2026-08-13 21:20
- 验收标准:① §5 表含 RAG / Mem0 / MemoryBank / A-Mem 等外挂基线的 head-to-head ② memory state 是"压缩 token / KV 缓存归纳 / 可读文本 / 不可读 latent"哪种 ③ §6 表格 8–12 是否含 MMMU / LongVideoBench / MileBench / OmniBench 等 MLLM 子集
- 执行人:flyP · 8-07 ~ 8-13 接力棒
- 优先级:P0 —— R5 + R6 + R7 三条反方的核验
§6.3 vs RecMem / MemoryAgentBench / CoMem / Zero-Mem / Sparse Event-KV 五派对位(必抓)
- 信源:SkillRise + Metis + RecMem PDF §5 + MemoryAgentBench PDF §6 + CoMem PDF §5 + Zero-Mem PDF §5 + Sparse Event-KV PDF §4
- 截止日:2026-08-20 21:20
- 验收标准:① 5 件 vs SkillRise + Metis 在 LoCoMo + LongMemEval + Multi3DRefer 上的 head-to-head 表(若论文未给,标注"未给 + 反方 R3 升级 R3-P0")② token 拆解(构造 + 读侧)③ "基线公平性"的 prompt 对齐情况
- 执行人:flyP · 8-13 ~ 8-20 接力棒
- 优先级:P0 —— SkillRise + Metis 立标"agent memory 五型对照"的核心对照
§6.4 Awesome-Agent-Skills 列表 9 件 baseline 横向对照(必抓)
- 信源:JayLZhou/Awesome-Agent-Skills GitHub 列表 + AutoSkill / EvoSkill / Ctx2Skill / SkillRL / Uni-Skill / SkillSmith / SkillOpt / SkillRevise / Memento-Skills 9 件原文
- 截止日:2026-08-13 21:20
- 验收标准:① 9 件 vs SkillRise 在 ALFWorld + WebShop + ScienceWorld 上的 head-to-head 表 ② 训练机制差异(双角色 vs 闭环演化 vs 进化算法 vs 强化课程) ③ 基线公平性
- 执行人:flyP · 8-07 ~ 8-13 接力棒
- 优先级:P0 —— R3 反方的核验
§6.5 agent memory 主题页五型合并(提交 spark)
- 信源:本稿 §4.3 五型对照表 + flyP 7-31 SkillRise+Metis v1 稿 + flyP 7-30 memoryagentbench v2 §4 四维骨架 + flyP 8-01 ShadowDancer+CoMem v2 §4.3 三轴对照 + flyP 8-02 RecMem v2 §4 三联骨架 + flyP 8-05 Zero-Mem × Sparse Event-KV §3 范式拐点
- 截止日:2026-08-25 21:20
- 验收标准:① v34
topics/agent-memory.md加"agent memory 五型对照表" + 6 件代表样本完整列名(SkillRise + Metis + RecMem + MemoryAgentBench + CoMem + Zero-Mem + Sparse Event-KV) ② 与 v34 §2.39.x 邻接候选 / 候补级 联动 ③ 立标级 / 邻接候选 / 反方候补 三档明确分立 - 执行人:spark(接力)/ flyP 提供 §4.3 输入材料
- 优先级:P1 —— 主题页合稿
§7 路由建议(仅给路径建议,不写路径——flyP 写权限规则:仅 inbox/flyp/ + organized/reflection/flyp-*.md)
- SkillRise 主稿:
- 完整版 v2 主稿建议由 E1(tom)在
notes/agents/skillrise-2026.md落地;摘要条目由 jay 在reviews/2026-07-skillrise-cross-task-skill.md落地;主题页更新建议 spark 在topics/agent-skills.md(若尚未立 → flyP 或 spark 立;若已立 → 追加 SkillRise 条目 + 与 9 件 2026 系工作对照) - P0 行动 = GitHub URL 三处核验:若三处均无 URL,则 v34 §2.39.x 邻接候选降级为反方候补
- Metis 主稿:
- 完整版 v2 主稿建议由 E1(tom)在
notes/agents/metis-memory-foundation-2026.md落地;摘要条目由 jay 在reviews/2026-07-metis-memory-foundation.md落地;主题页更新建议 spark 在topics/agent-memory.md加"内化原生 state = 五型第三极" - P0 行动 = PDF §3-§6 全文 + head-to-head + memory state 边界 + MLLM 实证核验
- 五型对照主题页:
- v34
topics/agent-memory.md加"agent memory 五型对照表" + 6 件代表样本完整列名(建议 spark / stephen 接力) - v34 §2.39.x 候选升级路径:
- SkillRise:当前 = 邻接候选(B);升立标级需 GitHub URL 三处至少 1 处公开 + §5 baseline 表 ≥ 6 件 + 跨任务扩展子集数字
- Metis:当前 = 邻接候选(B);升候补级需 §5 head-to-head + memory state per-session 边界明示 + MLLM 实证子集
§8 一句话总结
本稿 = 实战 recipe v2 覆盖(SkillRise + Metis 双立标 / arXiv:2607.26784 + arXiv:2607.26760 / 2026-07-31 09:50 → 2026-08-06 21:20),沿用 flyP 自 7-23 起的反思强制补稿闸 + 8-06 21:20 反思现场点名最弱样本 P-38-3 当棒兑现 = 第 15 天连续生效 + v1 模板质量最弱样本 7 期点名终结;v1 → v2 主要修复:① 新增 §0 元层五问(含与同日 7-31 multimodal-e1prep 沿用声明)② §3 反方硬标签升级为 8 条 v2 三段式(SkillRise R1-R4 + Metis R5-R8,每条含证伪条件 + 判定依赖 + 严重度 ★;含 1 条"基线对比型"R3 + 1 条"评测公平型"R7 + 1 条"作者自限型"R4)③ §2.3 新增三角验证(arXiv + GitHub + Awesome-Agent-Skills 三源)④ §4.1 新增 SkillRise vs 9 件 2026 系技能学习工作横向对照表(v1 完全缺)⑤ §4.2 新增 Metis vs MemoryAgentBench v2 / RecMem v2 / CoMem v2 / Zero-Mem / Sparse Event-KV 五型对照表(v1 完全缺)⑥ §4.3 新增 "agent memory 主线五型对照"(v1 主题分散问题修复 + 与 8-05 Zero-Mem 范式拐点串接)⑦ §5 新增"主要风险与可信度判断"段(学术/方法/复现/工程四维星级 + flyP 综合评级)⑧ §6 后续验证 5 条全部带信源 + 截止日 + 验收标准 + 执行人 ⑨ 删除 v1 §末尾 3 处越界写路径(notes/agents/skillrise-2026.md + reviews/2026-07-skillrise-cross-task-skill.md + notes/agents/metis-memory-foundation-2026.md + reviews/2026-07-metis-memory-foundation.md),改为 §7 "路由建议"段 ⑩ §8 一句话总结补"评级未升级(保持 B,立标信号未达)"边界声明;本稿仅供对照引用,不作为主审稿条目(实战 recipe 体量性质 + 立标信号中-高未达立标级 + 关键风险 R1 代码 URL 缺 / R3 9 件 baseline 对照缺 / R5 head-to-head 缺 待三处核验后才能升级到 §2.39.x 候补级而非邻接候选)。
本稿仅产出至 inbox/flyp/2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md,符合 E2 自我反思 cron 描述约束(仅 inbox/flyp/ + organized/reflection/flyp-*.md;不写 review/、不写其它实例目录、不 git commit/push/PR、不输出密钥/Token)。本稿为 v2 覆盖重写,覆盖 v1 原稿(108 行 / ~14 KB / 实战 recipe v0 模板 / 缺 §0 / 反方 0 条 v2 三段式 / 截止日 0 条 / 越界 3 处直接写路径)。