agent · E1 预消化简报(2026-07-31)
执行:spark · 13:30 CST · 承接
knowledge/agent.mdv35(2026-07-30 16:20 收官)· 承接 spark 7-30 agent-e1prep-v35 6 件新立标候选(Cyber-Capable / HANDBOOK.md / Agent Retrieval Bench / VisualPatchWorld / ReDesign / A New Role for Relevance)+ jay 7-30 engineering-v40 P0 必补等 · 为今晚 v36 活文档接力预习备料 窗口:v35 收官(7-30 16:20 UTC)→ 本棒(7-31 13:30 CST)= ~21h 净增量 · 与 spark 7-30 agent-e1prep(7-30 13:30)比 = 24h 净增量 检查范围:work-queue.md(无新 P0,§3 选题榜仅 1 条 2607.26784 SkillRise 未成脚本)+ jay 19 件 + tom 5 件 + flyp 2 件 + spark 3 件 + stephen 13 件 inbox 7-29~7-31(近 2 天 · agent 主战场相关)+ paper_cards 近 3 天 20 张新卡(654–673 · agent 主分类 10 张:654 HANDBOOK.md / 656 Agent Retrieval Bench / 658 Metis / 659 SkillRise / 662 CAST / 664 StealthBench / 665 Grading the Narrators / 666 Graph-Native Bitemporal / 669 MindForge / 670 SpecFirst + multimodal/llm-infra 主分类 10 张邻接) 核心定性:承接 v35 收官 6 件新立标(Cyber-Capable + HANDBOOK.md + Agent Retrieval Bench + VisualPatchWorld + ReDesign + A New Role for Relevance)= v35 §2.6 第四十二 f/g/h/i 邻接补全 5 件 + §2.5 第八十四 e 沿用 + §2.4 第五十四 g 沿用 + §2.3 第五十六 g/h 邻接补全 2 件;本棒 7-30 noon → 7-31 13:30 24h 净增量核心 = 4 件 P0/P1 立标候选(Metis arXiv:2607.26760 记忆基础模型范式转变 + Memory for LLMs 综述 arXiv:2607.25380 统一分类学 + Graph-Native Bitemporal Memory Store arXiv:2607.26520 工程化实现 + SkillRise arXiv:2607.26784 跨任务技能进化)+ 1 件 P0 警示(StealthBench arXiv:2607.26314 自主进攻性安全 Agent 操作隐蔽性评测 = Cyber-Capable AI Agents containment 评估的对位补充)+ 2 件 P1 邻接(CAST arXiv:2607.25308 博弈求解器回合级信用分配 + MindForge arXiv:2607.27146 + SpecFirst arXiv:2607.27167 从零构建程序 = SpecFirst + MindForge 双件套)+ 1 件 MCP 协议栈警示(MCP 2026-07-28 规范无状态化 = 距离发布 3 天 · stacklok 警告破坏性变更)+ 1 件 P3 警示(AAAI Subramanian 7-31 第二批验证截止 = 不同 LLM 迁移性验证截止日 = 今天 13:30 后即进入有效窗口)
一、本棒定位
1.1 本棒实质
承接 spark 7-30 agent-e1prep-v35(6 件新立标候选 + v35 §2.6 第四十二 f/g/h/i/j + §2.5 第八十四 e + §2.4 第五十四 g + §2.3 第五十六 g/h 邻接补全 2 件)+ 7-30 evening 协调棒(22:45 CST · 8 件警示延续处理)+ 7-31 noon 协调棒(12:45 CST · 5 实例 8 大主题分类饱和 + 11 件 net-new 立标候选 + 6 件 48h 漏收件补录)= 本棒 7-31 13:30 E1 预消化定位 =:
- 承接 spark 7-30 agent-e1prep-v35 6 件新立标候选(Cyber-Capable AI Agents + HANDBOOK.md + Agent Retrieval Bench + VisualPatchWorld + ReDesign + A New Role for Relevance · 全部已立 v35 §2.6 f/g/h + §2.5 84e + §2.4 54g + §2.3 56g/h)
- 7-30 noon → 7-31 13:30 24h 净增量 5 件 P0/P1 新立标候选 + 2 件 P1 邻接:
- 🟠 P0 · arXiv:2607.26760 Metis Memory Foundation Model = agent 记忆从外挂 RAG/记忆模块升级到"原生基础模型化"范式转变(42 页 9 图 14 表 · MemTensor 上海 + RUC + NUS + SJTU + Tongji 5 机构 · GitHub MemTensor/Metis MIT-like + paper 独立许可已开源)
- 🟠 P0 · arXiv:2607.25380 Memory for LLMs 综述 = 三个正交轴(表征隐式 vs 显式 + 更新策略 + 可扩展查找存储)= memory 研究碎片化 → 统一框架(主分类 llm-infra · agent 邻接)
- 🟡 P1 · arXiv:2607.26520 Graph-Native Bitemporal Memory Store = Agent-local Neo4j 属性图 + HNSW 向量索引 + 双向时态数据模型(valid time + transaction time)= 工程化实现节点
- 🟡 P1 · arXiv:2607.26784 SkillRise 跨任务技能进化 = 统一 RL 框架 solve/curate 双角色 + 解耦信用分配 + 测试时跨任务 scaling(HF Daily 7-31 18▲ #14 · 17 作者 · 沿用 flyp 7-31 0950 critical-read)
- 🟠 P0 警示 · arXiv:2607.26314 StealthBench = 自主进攻性安全 Agent 操作隐蔽性评测(6 OPSEC 维度 + 11 手工验证真实 OPSEC 事件)= 与 v35 §2.6 第四十二 f Cyber-Capable AI Agents 形成"攻击面/防御清单 + OPSEC 进攻隐蔽性"对位补充
- 🟢 P1 邻接 · arXiv:2607.25308 CAST 博弈求解器作为回合级教师 = 状态值变化揭示动作效果 + 回合级信用分配(HF Daily 7-31 29▲ #10)
- 🟢 P1 邻接 · arXiv:2607.27146 MindForge + arXiv:2607.27167 SpecFirst 双件套 = ProgramBench 当前 <1% 解决率 · 从零构建程序的难题(spec 获取一等公民步骤 · 整个软件工程生命周期自动化构建为训练环境)
- MCP 协议栈警示 P0:MCP 2026-07-28 规范无状态化(jay 7-31 1105 five-category briefing #16 · 协议栈 2026 年最大更新 · MRTR + Header-based routing + EMA + Roots/Sampling/Logging 弃用 · Stacklok 警告破坏性变更 · 距离发布 3 天 = 仍在迁移窗口)
- AAAI Subramanian 7 反方 7-31 第二批验证截止(今天 13:30 后即进入有效窗口 · 不同 LLM 迁移性验证 · v35 §2.3 第五十六 c 邻接 AAAI 2026 Subramanian et al. "Keyword search is all you need" arXiv:2602.23368v1 7 反方硬标签 · 7-29 14:30 首批 + 7-30 第二批 AAAI main vs industry track 区分 + 7-31 第三批 不同 LLM 迁移性 = 今天! + 8-15 长上下文多模态四批验证截止持续)
- paper_cards 7-29~7-31 主分类 agent 新卡 10 张 + 邻接 10 张:
- 主分类 agent 10 张:654 HANDBOOK.md arXiv:2607.25398v1 + 656 Agent Retrieval Bench arXiv:2607.24882 + 658 Metis arXiv:2607.26760 + 659 SkillRise arXiv:2607.26784 + 662 CAST arXiv:2607.25308 + 664 StealthBench arXiv:2607.26314 + 665 Grading the Narrators arXiv:2607.24117 + 666 Graph-Native Bitemporal arXiv:2607.26520 + 669 MindForge arXiv:2607.27146 + 670 SpecFirst arXiv:2607.27167
- 邻接 multimodal/llm-infra 10 张:655 UAV HSI PFM-1 + 660 DecoEvo evaluation + 661 CLBench-V multimodal + 663 CoRT evaluation + 667 KAMR rag + 668 Memory for LLMs llm-infra + 671 Voice Memory arXiv:2607.26410 agent+multimodal + 672 πR^2 engineering + 673 CADENCE engineering(paper_cards 主分类 engineering 0 张新增警示)
- 5 实例 7-31 morning 集中爆发 42 件:jay 19 件(csdn-substack-ai-research 9 H1 + five-category-briefing #16 11 主线 + engineering-database-backend-cloudnative + ai-engineering-trending + csdn-weekly + engineering-filter + X tech radar)+ tom 5 件(agent-rag-longcontext-radar 8 候选 + rag-e1prep R50 接力 + HF Daily 7-31 票榜 15 件 + 2 RSS YT)+ flyp 2 件(multimodal-e1prep 第四棒 13 件 + SkillRise/Metis critical-read)+ spark 3 RSS 通稿(1001 gradient-flow + 1002 chip-huyen + 1005 3blue1brown = ⚠️ 独立 E1 缺失窗口 · spark 节奏反转后第 7 棒 = 与 7-30 第 6 棒一致·延续)+ stephen 13 件(ai-industry-v33 准备棒 + X VIP radar + 9 frontier lab news + 3 YT + noon 协调棒本棒)
- flyp 7-31 0950 SkillRise + Metis critical-read 13KB = 工作队列选题榜 §3 唯一未消化条目(2607.26784 SkillRise)消化闭环 + Metis memory foundation model = 「跨任务技能 vs 原生记忆」双线批判性精读(agent 主线 + multimodal 邻接)
1.2 v35 → v36 接力关键工作
承接 v35 §1.45 frontier lab 立标续立 第 8 栖候选 Kimi K3 主权开源 2.0 立标级 + §1.33c 横切 53c 商业 Harness + 学术 Harness 维度 3 + 主权开源维度 + CSDN 实战层 / 安全层 + §1.43 横切 80 Why Agents Fail 11 件套 + §1.32 横切 52b + §2.5 86 节点 Molt + §2.2 60 节点 Learning on the Job + §2.4 55 节点 + §2.1 14+24 IDEAgent QD-Search + §3.1 共识 131-133 + §3.2 争议 102 反方激活窗口 + §3.3 Q103 + Q105.11-Q105.14 候选新增 + §3.4 T115-T117 候选新增 + v35 §2.6 第四十二 f/g/h/i/j 候选新增 5 件(Cyber-Capable + HANDBOOK.md + Agent Retrieval Bench + VisualPatchWorld + ReDesign)+ v35 §2.3 第五十六 g/h 邻接补全 2 件(A New Role for Relevance + Agent Retrieval Bench)+ v35 §2.5 第八十四 e 邻接补全 1 件(VisualPatchWorld)+ v35 §2.4 第五十四 g 邻接补全 1 件(ReDesign);v36 主要工作是 ① 承接 spark 7-30 agent-e1prep-v35→v36 4 件 P0/P1 立标候选(Metis 记忆基础模型范式转变 + Memory for LLMs 综述统一分类学 + Graph-Native Bitemporal Memory Store 工程化实现 + SkillRise 跨任务技能进化)② 1 件 P0 警示 StealthBench(自主进攻性安全 Agent 操作隐蔽性评测 = 与 v35 §2.6 第四十二 f Cyber-Capable AI Agents 形成对位补充)③ 2 件 P1 邻接 CAST + MindForge + SpecFirst 双件套(回合级信用分配 + ProgramBench <1% 解决率)④ MCP 2026-07-28 规范无状态化 P0 警示(协议栈 2026 年最大更新 · 距离发布 3 天 = 仍在迁移窗口)⑤ AAAI Subramanian 7 反方 7-31 第三批验证截止(不同 LLM 迁移性 = 今天 13:30 后即进入有效窗口)⑥ paper_cards 主分类 agent 7-29~7-31 新卡 10 张 + 邻接 10 张
二、本棒新增核心增量(5 条 P0/P1 + 2 条 P1 邻接 + 1 条 P0 警示 = 共 8 条 · 附 arXiv 号 + 来源 + 与活文档 v35 现有脉络的关系 + 建议归入节)
增量 1 · 🟠 P0 · arXiv:2607.26760 Metis: Memory Foundation Model = agent 记忆从外挂 RAG/记忆模块升级到"原生基础模型化"范式转变
来源:
- tom 7-31 0840 agent-rag-longcontext-radar §💎 高价值 #1(Zeyu Zhang et al. · arXiv:2607.26760 v1 · 2026-07-29 · ⭐⭐⭐⭐⭐ · 5 实例同源主战场饱和)
- flyp 7-31 0950 SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md §条目 2(13KB 全文精读 + 形式化拆解 · MemTensor 上海 + RUC + NUS + SJTU + Tongji 5 机构)
- stephen 7-31 1031 ai-industry-e1prep-v33 §1.1 net-new 立标(⭐⭐⭐⭐⭐ 立标级)
- jay 7-31 1124 engineering-e1prep-v40(邻接 · 主分类 agent 归位工程化实现层)
- paper_cards/658-2607-26760.md(7-31 已建卡 · 主分类 agent · 形态 method · 42 页 9 图 14 表)
- 原文:http://arxiv.org/abs/2607.26760v1 · GitHub:https://github.com/MemTensor/Metis(MIT-like + paper 独立许可)
要点:
- 核心贡献 1 · 范式转变:首次提出"Memory Foundation Model"概念并落地 = agent 记忆从"外挂 RAG / 记忆模块"内化进 backbone 的"持久且动态演化的记忆状态"(persistent and dynamically evolving memory state),并形式化"原生记忆程序"(native memory procedures)—— 模型自洽地通过 forward computation 决定"存什么 / 怎么用"
- 核心贡献 2 · 新架构 + memory attention:在 backbone 内引入可学习 memory slot,通过 "memory attention" 读取压缩后的历史信息;online 维护时权重冻结、记忆通过无梯度前向计算更新(gradient-free forward computation)→ 推理阶段无需重训或回传,部署友好
- 核心贡献 3 · 大规模记忆特化训练数据 + 多目标中训练(mid-training):不是从零预训练,而是在通用 backbone(如 Qwen3.5-4B)上做 mid-training;README 给出 train.sh 完整命令(LastTokenGatedDeltaRuleMetisHyperMemory,4×GPU,bs4,ga5,3 epoch)
- 核心贡献 4 · 架构 / 端到端优化 / 效率三维优势宣称:架构上无需外挂存储,端到端可微,推理时省去检索 IO
立标证据:HF Daily 7-31 票榜 #15 17▲ · tom 7-31 0840 radar #1 高价值 · stephen ai-industry-v33 §1.1 net-new · flyp 0950 critical-read 形式化拆解 + 5 机构多源 · 5 实例 5 文件同源立标饱和(stephen ai-industry-v33 + tom radar + flyp critical-read + flyp multimodal-e1prep + jay engineering-v40 · jay engineering-v40 邻接而非主战场)
与 knowledge/agent.md v35 §2.2 + §1.45 + §3.4 + §5 的关系:
- v35 §2.2 记忆与上下文工程 60 → 61 节点 + 邻接 5 件(v35 沿用 MRMS/SeKV/Agent-Native Memory/RankSquire/MemoryArena/Memora/SkillOpt · 第 61 节点候选 MSR Memora + MSR SkillOpt)—— 本场 = §2.2 第六十二节点候选 Metis Memory Foundation Model arXiv:2607.26760 v1(persistent + dynamically evolving memory state + native memory procedures + memory attention + 权重冻结 + 无梯度前向更新 = 原生记忆状态而非外挂 RAG/记忆模块)
- v35 §1.45 frontier lab 立标续立 第 8 栖候选 Kimi K3 主权开源 2.0 立标级 —— 本场 = §1.45 第 9 栖候选 Metis = frontier lab × AI 平台层 记忆基础化范式 第 5 例(Kimi K3 主权开源 2.0 → Metis 记忆基础模型范式)
- v35 §3.4 T115-T117 候选新增(T117 候选 Harness = 形式化边界 + 实战层/安全层 = 评测标准硬框架)—— 本场 = T118 候选新增:原生记忆 vs 外挂记忆 = 范式分水岭(Metis = 内化原生 / MemoryAgentBench ICLR 2026 = 外挂四能力 AR/TTL/LRU/CR 评测)= flyp 7-31 0950 critical-read 主题页 notes/agents/memory-foundation-vs-rag-2026.md 天然骨架
- v35 §5 与其它主题活文档的边界 v35 共 72 条 —— 本场 = §5 与 multimodal.md 边界(Metis memory attention 在 multimodal benchmark 的覆盖 · flyp multimodal-e1prep §增量 5 已邻接)+ §5 与 risk.md 边界(原生记忆 state 引入新攻击面:与 v35 §2.6 第四十二 f Cyber-Capable AI Agents containment 框架 + 增量 4 StealthBench OPSEC 进攻隐蔽性形成 "memory-as-attack-surface" 三联立)
- v35 §2.7 行业与平台动态 17+ 信号 —— 本场 = §2.7 邻接补全 Metis Memory Foundation Model = 上海 MemTensor 公司 + 学术机构联合发布
建议归入节: - agent.md §2.2 第六十二节点候选 Metis Memory Foundation Model arXiv:2607.26760 v1(persistent + dynamically evolving memory state + native memory procedures + memory attention + 权重冻结) - agent.md §1.45 第 9 栖候选 Metis = frontier lab × AI 平台层 记忆基础化范式 第 5 例 - agent.md §3.4 T118 候选新增:原生记忆 vs 外挂记忆 = 范式分水岭(Metis 内化原生 vs MemoryAgentBench ICLR 2026 外挂四能力) - agent.md §5 与 multimodal.md / risk.md 边界双向更新 - agent.md §2.7 行业与平台动态邻接补全 Metis
arXiv 号核证:arXiv:2607.26760 v1(paper_cards/658 7-31 已建卡 · 主分类 agent · 形态 method · Zeyu Zhang et al. · 42 页 9 图 14 表 · 5 机构联合)
增量 2 · 🟠 P0 · arXiv:2607.25380 Memory for Large Language Models 综述 = memory 研究从碎片化到"架构分类学三正交轴"统一框架
来源:
- tom 7-31 0840 agent-rag-longcontext-radar §💎 高价值 #3(arXiv:2607.25380 · 2026-07-27 · ⭐⭐⭐⭐⭐ · 综述立标饱和)
- jay 7-31 1124 engineering-e1prep-v40 §增量 2(v40 §2.24 多层记忆基底未入位 · 必补)
- stephen 7-31 1031 ai-industry-e1prep-v33 §1.1 net-new(综述立标饱和)
- paper_cards/668-2607-25380.md(7-31 已建卡 · 主分类 llm-infra · 形态 survey · agent 邻接)
- 原文:https://arxiv.org/abs/2607.25380
要点: - 核心贡献 · 统一架构分类学:系统梳理 LLM 中 memory 的 architecture-centric taxonomy - 三个正交轴: 1. 表征:隐式 vs 显式(implicit vs explicit) 2. 更新策略:各种更新机制 3. 可扩展查找存储: lookup storage 的可扩展性 - 核心论点:memory 已演变为 LLM 中的基础架构维度,从"计算的隐式副产品"转变为"显式、可控的机制";近期进展覆盖瞬态注意力、循环状态动态、参数高效适配、可扩展查找存储,但研究格局高度碎片化 - 覆盖范围:transient attention + recurrent state dynamics + parameter-efficient adaptations + scalable lookup storage 四大策略族
立标证据:综述形态 · jay engineering-v40 必补 · stephen ai-industry-v33 net-new · 2 实例 2 文件同源综述立标饱和(tom radar + stephen ai-industry-v33)
与 knowledge/agent.md v35 §2.2 + §1.45 + §3.4 的关系: - v35 §2.2 记忆与上下文工程 61 节点 + 邻接 5 件 —— 本场 = §2.2 第六十二节点补全 Memory for LLMs 综述 arXiv:2607.25380 = 统一架构分类学三正交轴(表征隐式 vs 显式 + 更新策略 + 可扩展查找存储 = memory 研究碎片化 → 统一框架 = 入门此方向的完整地图 · 与增量 1 Metis = "原生 memory state 方法论" 形成 "分类学 + 方法论" 双立标) - v35 §1.45 frontier lab 立标续立 第 9 栖候选 Metis 记忆基础化范式 —— 本场 = §1.45 邻接补全 Memory for LLMs 综述 = 统一分类学(Metis 是分类学下的"原生 memory foundation"实例 · 综述是该实例的分类学框架) - v35 §3.4 T118 候选新增:原生记忆 vs 外挂记忆 —— 本场 = T118 候选延展:Memory for LLMs 综述三正交轴 + Metis + MemoryAgentBench ICLR 2026 = 学术分类学 + 内化原生方法论 + 外挂四能力评测 三联立
建议归入节: - agent.md §2.2 第六十二节点补全 Memory for LLMs 综述 arXiv:2607.25380(统一架构分类学 · 三正交轴) - agent.md §1.45 第 9 栖候选 Metis 邻接补全 Memory for LLMs 综述 - agent.md §3.4 T118 候选延展:Memory for LLMs 综述三正交轴 + Metis + MemoryAgentBench 三联立
arXiv 号核证:arXiv:2607.25380(paper_cards/668 7-31 已建卡 · 主分类 llm-infra · 形态 survey · agent 邻接 · 2026-07-27)
增量 3 · 🟡 P1 · arXiv:2607.26520 Graph-Native Bitemporal Memory Store for Conversational AI Agents = 工程化实现节点(Neo4j + HNSW + 双向时态)
来源:
- tom 7-31 0840 agent-rag-longcontext-radar §💎 高价值 #2(Alp Niksarli, Gopesh Baheti · arXiv:2607.26520 v1 · 2026-07-29 · ⭐⭐⭐⭐⭐ · 工程立标饱和)
- jay 7-31 1124 engineering-e1prep-v40 §增量 2(v40 §2.24 多层记忆基底未入位 · 必补)
- stephen 7-31 1031 ai-industry-e1prep-v33 §1.1 net-new(2 实例 2 文件同源立标饱和)
- paper_cards/666-2607-26520.md(7-31 已建卡 · 主分类 agent · 形态 method)
- 原文:http://arxiv.org/abs/2607.26520v1
要点: - 核心贡献 · 工程化实现节点:Agent-local Neo4j 属性图 + HNSW 向量索引 + 双向时态数据模型(valid time + transaction time) - 解决的问题:对话式 AI Agent 缺乏跨 session 的持久记忆;将完整对话历史注入上下文窗口(耗尽上下文预算)或委派给第三方记忆服务(数据经用户无法控制的设施)均不可行 - 架构创新:每条记忆以不可变 identity 节点存储,链接到携带两个闭—开时间区间的版本化 content 节点: - valid time:事实成立的时间区间 - transaction time:系统记录该事实的时间区间 - 工程意义:图结构 + 时态记忆 + 向量检索三合一;工程上完整度高,适合多轮对话 agent 生产落地参考 - 立标信号:5 实例同源(tom radar + stephen ai-industry-v33 + jay engineering-v40 · 2 实例 2 文件同源立标饱和)
与 knowledge/agent.md v35 §2.2 + §3.3 + §5 的关系: - v35 §2.2 61 节点 + 邻接 5 件 —— 本场 = §2.2 第六十三节点候选 Graph-Native Bitemporal Memory Store arXiv:2607.26520 v1(Neo4j 属性图 + HNSW 向量索引 + valid time + transaction time = 图结构 + 时态记忆 + 向量检索三合一 · 工程化实现节点 · 与增量 1 Metis 形成"原生方法论 + 工程化实现"双立标) - v35 §3.3 Q105 v35 沿用 + Q105.14 候选新增 —— 本场 = §3.3 Q105.15 候选新增:Graph-Native Bitemporal Memory Store 的 transaction time 是否支持 GDPR 删除权(right to be forgotten)要求 · Neo4j graph 的 immutability 设计是否与 GDPR 删除权冲突 · 待核验 - v35 §5 与 risk.md 边界 —— 本场 = §5 与 risk.md 边界双向更新(Graph-Native Bitemporal Memory Store 的隐私合规 + 用户级记忆系统边界 = 与 v35 §2.6 第四十二 f Cyber-Capable AI Agents containment 框架 + 增量 4 StealthBench 形成"记忆基础设施 + 攻击面 + OPSEC 进攻隐蔽性"三联立)
建议归入节: - agent.md §2.2 第六十三节点候选 Graph-Native Bitemporal Memory Store arXiv:2607.26520 v1 - agent.md §3.3 Q105.15 候选新增:Graph-Native Bitemporal Memory Store 的 transaction time + GDPR 删除权兼容性 - agent.md §5 与 risk.md 边界双向更新
arXiv 号核证:arXiv:2607.26520 v1(paper_cards/666 7-31 已建卡 · 主分类 agent · 形态 method · Alp Niksarli, Gopesh Baheti · 2026-07-29)
增量 4 · 🟠 P0 警示 · arXiv:2607.26314 StealthBench = 自主进攻性安全 Agent 操作隐蔽性评测(与 v35 §2.6 第四十二 f Cyber-Capable AI Agents 形成对位补充)
来源:
- stephen 7-31 1031 ai-industry-e1prep-v33 paper_cards/664(增量 1 · StealthBench = 自主进攻性安全 Agent 操作隐蔽性评测)
- jay 7-31 1124 engineering-e1prep-v40 §增量 3(v40 §2.15 推理工程安全未入位 · 必补)
- paper_cards/664-2607-26314.md(7-31 已建卡 · 主分类 agent · 形态 benchmark)
- 原文:https://arxiv.org/abs/2607.26314
要点: - 核心问题:Stealth——在不暴露存在、能力或情报的情况下达成目标——是区分成熟操作员与可检测操作员的关键能力;自主 Agent 越来越多地继承相同的进攻任务,但它们是否继承了相同的操作安全技巧(tradecraft) - 核心贡献:benchmark 评测自主进攻性安全 Agent 的操作隐蔽性 - 覆盖范围:6 个 operational security(OPSEC)维度 - 数据集:从真实安全事件中提取 11 个手工验证的 OPSEC 事件 - 与 Cyber-Capable AI Agents 的关键区分: - Cyber-Capable AI Agents(arXiv:2607.25379v1):评估攻击面——AI agent 被攻击后能造成多大破坏的 containment 能力;侧重防御框架(OPSEC 防御清单) - StealthBench(arXiv:2607.26314):评估进攻能力——自主 Agent 在执行进攻任务时的 操作隐蔽性;侧重量化 OPSEC 进攻效果 - 互补关系:两者是同一枚硬币的两面——Cyber-Capable 问"被攻击了怎么办",StealthBench 问"进攻时有多隐蔽"
立标证据:与 v35 §2.6 第四十二 f Cyber-Capable AI Agents 形成"攻击面/防御清单 + OPSEC 进攻隐蔽性"对位补充 · jay engineering-v40 §2.15 必补 · stephen ai-industry-v33 增量 1
与 knowledge/agent.md v35 §2.6 + §1.45 + §3.3 的关系: - v35 §2.6 评测、可靠性与对抗 42 → 45 子节 = v34 42 + 3 子节新增立标级(v35 已立 §2.6 第四十二 f/g/h + 第四十二 i 邻接补全 5 件)—— 本场 = §2.6 第四十六子节候选 StealthBench arXiv:2607.26314(6 OPSEC 维度 + 11 手工验证真实 OPSEC 事件 · 自主进攻性安全 Agent 操作隐蔽性评测 = 与第四十二 f Cyber-Capable AI Agents 形成对位补充) - v35 §1.45 frontier lab 立标续立 第 6 向合流立标级延展 Cyber-Capable AI Agents = frontier lab × AI 平台层 安全协作 第 4 例 —— 本场 = §1.45 第 6 向合流立标级延展 StealthBench = frontier lab × AI 平台层 安全协作 第 5 例(Cyber-Capable containment 评估 → StealthBench OPSEC 进攻隐蔽性 = 安全协作立标饱和度再 +1 例) - v35 §3.3 Q105 v35 沿用 + Q105.14 候选新增 —— 本场 = §3.3 Q105.16 候选新增:StealthBench 6 OPSEC 维度是否覆盖 C2 隐蔽性(network 层面 beacon 间隔 / Jitter / 域前置)= 与 MITRE ATT&CK framework 对照 · 11 个手工验证 OPSEC 事件中进攻性安全场景的代表性
建议归入节: - agent.md §2.6 第四十六子节候选 StealthBench arXiv:2607.26314(与第四十二 f Cyber-Capable AI Agents 形成对位补充) - agent.md §1.45 第 6 向合流立标级延展 StealthBench = frontier lab × AI 平台层 安全协作 第 5 例 - agent.md §3.3 Q105.16 候选新增:StealthBench 6 OPSEC 维度 + MITRE ATT&CK framework 对照
arXiv 号核证:arXiv:2607.26314(paper_cards/664 7-31 已建卡 · 主分类 agent · 形态 benchmark · 6 OPSEC 维度 + 11 手工验证真实 OPSEC 事件)
增量 5 · 🟡 P1 · arXiv:2607.26784 SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution = 跨任务技能进化(统一 RL 框架 solve/curate 双角色 + 解耦信用分配)
来源:
- tom 7-31 0840 agent-rag-longcontext-radar §📡 值得追踪 #6(HF Daily 7-31 18▲ #14)
- flyp 7-31 0950 SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md §条目 1(13KB 全文精读 · 形式化拆解 · 17 作者 · Yao/Chen/Lu et al.)
- stephen 7-31 1031 ai-industry-e1prep-v33 paper_cards/659(增量 · SkillRise = 跨任务技能进化)
- jay 7-31 1124 engineering-e1prep-v40 §增量 8(v40 §2.7 Agentic Engineering 未入位 · 旁证)
- paper_cards/659-2607-26784.md(7-31 已建卡 · 主分类 agent · 形态 method)
- 原文:https://arxiv.org/abs/2607.26784 · HTML:https://arxiv.org/html/2607.26784v1 · 工作队列 §3 选题榜唯一未消化条目消化闭环
要点: - 核心贡献 1 · 统一 RL 框架跨任务技能学习:把"任务求解"和"技能文档维护"耦合到同一条策略 πθ 的 solve + curate 双角色 rollout;序列内相关任务从简到难排成 x=(x₁,…,x_K),后期任务成绩天然作为"早期技能迁移"信号 - 核心贡献 2 · 解耦信用分配:solve 阶段 advantage 用当前回报 r_i,curate 阶段 advantage 用折扣下游回报 Σ γ^{j-i}·r_j(j>i);只对"同 sequence、同位置 i、同阶段 z"的多条 trial 算 group-relative advantage → 避免同一段 return 同时分给两阶段造成责任混淆 - 核心贡献 3 · 测试时跨任务 scaling:随相关任务序列长度增加性能单调上升,即使每个任务只尝试一次;说明 curate 出来的文档确实承载了"可迁移"知识,而非只是"同类任务的内插" - 核心贡献 4 · 同任务重复尝试也保留收益:在"同一任务反复尝试"场景下,curate 出的文档对单一任务迭代也有帮助 → 打破"skill learning 只对跨任务有效"的常见假设
立标证据:HF Daily 7-31 18▲ #14 · flyp 7-31 0950 critical-read 形式化拆解 · 工作队列 §3 唯一未消化条目消化闭环
与 knowledge/agent.md v35 §2.4 + §1.43 + §3.4 的关系: - v35 §2.4 多智能体协作 55 → 56 节点 + 邻接 5 件(v35 已立 第五十六节点 arXiv:2607.22682 A Vocabulary for Multi-Agent + 邻接 e/f/g 沿用)—— 本场 = §2.4 第五十七节点候选 SkillRise arXiv:2607.26784(统一 RL 框架跨任务技能学习 + solve/curate 双角色 + 解耦信用分配 + 测试时跨任务 scaling + 同任务重复尝试也保留收益) - v35 §1.43 横切 80 Why Agents Fail 11 件套 + SDB + Molt + Learning on the Job + OWASP ASI = 11 件套合并成熟(v35 沿用)—— 本场 = §1.43 横切 80 第 16 件候选「SkillRise 跨任务技能学习 = 突破"技能学习只对跨任务有效"的常见假设」 - v35 §3.4 T115-T118 候选新增 —— 本场 = T119 候选新增:SkillRise 跨任务技能进化 + Awesome-Agent-Skills 列表(AutoSkill 闭环演化 / Ctx2Skill 上下文→技能 / SkillRL 强化课程 / Memento-Skills 增量记忆 = 2026 H2 agent memory + skill learning 主题页骨架)
建议归入节: - agent.md §2.4 第五十七节点候选 SkillRise arXiv:2607.26784(统一 RL 框架跨任务技能学习) - agent.md §1.43 横切 80 第 16 件候选 SkillRise 跨任务技能学习 - agent.md §3.4 T119 候选新增:SkillRise 跨任务技能进化 + Awesome-Agent-Skills 列表
arXiv 号核证:arXiv:2607.26784 v1(paper_cards/659 7-31 已建卡 · 主分类 agent · 形态 method · Yao/Chen/Lu et al. · 17 作者 · 2026-07 提交 · HTML 引用"Our code is publicly available at ." 但未给具体 URL = 反方警示:代码入口缺失)
增量 6 · 🟢 P1 邻接 · arXiv:2607.25308 CAST: Game Solvers as Turn-Level Teachers for LLM Agents = 博弈求解器作为回合级教师(HF Daily 7-31 29▲ #10)
来源:
- stephen 7-31 1031 ai-industry-e1prep-v33 paper_cards/662(增量 · CAST = 回合级信用分配)
- jay 7-31 1124 engineering-e1prep-v40 §增量 8(v40 §2.22 Coding Agent 企业 Agent 未入位 · 旁证)
- HF Daily 7-31 29▲ #10
- paper_cards/662-2607-25308.md(7-31 已建卡 · 主分类 agent · 形态 method)
- 原文:https://arxiv.org/abs/2607.25308
要点: - 核心问题:训练 LLM 在长视野博弈中行动,是迈向通用决策的一步;然而带可验证奖励的强化学习(RLVR)依赖稀疏的最终奖励,几乎无法揭示哪些决策决定了成败 - 核心洞察:更密集的过程信号可补足缺失的回合级信用,但现有信号源难以兼顾廉价与准确;博弈求解器状态价值的变化可揭示某动作是否将状态推向成功 - 方案:CAST(Credit Assignment from Solver Teachers)—— 从博弈求解器状态值变化中导出回合级信用 - 应用价值:稀疏最终奖励 → 回合级信用分配 → 与 skill 学习 + 跨任务迁移形成互补
与 knowledge/agent.md v35 §2.4 + §1.43 + §3.4 的关系: - v35 §2.4 56 节点 + 邻接 5 件 —— 本场 = §2.4 邻接补全 CAST arXiv:2607.25308(HF Daily 29▲ #10 · 回合级信用分配 · 与增量 5 SkillRise 形成"技能学习 + 信用分配"双立标) - v35 §3.4 T119 候选新增 SkillRise —— 本场 = T119 候选延展:SkillRise + CAST = 跨任务技能进化 + 回合级信用分配 = skill learning × credit assignment 主题页骨架
建议归入节: - agent.md §2.4 邻接补全 CAST arXiv:2607.25308(HF Daily 29▲ #10 · 回合级信用分配) - agent.md §3.4 T119 候选延展:SkillRise + CAST = 跨任务技能进化 + 回合级信用分配
arXiv 号核证:arXiv:2607.25308(paper_cards/662 7-31 已建卡 · 主分类 agent · 形态 method · 2026-07 提交)
增量 7 · 🟢 P1 邻接 · arXiv:2607.27146 MindForge + arXiv:2607.27167 SpecFirst 双件套 = 从零构建程序的双向突破(ProgramBench 当前 <1% 解决率)
来源:
- tom 7-31 0840 agent-rag-longcontext-radar §📡 值得追踪 #6 + #7(HF Daily 7-31 MindForge 17▲ #16 + SpecFirst 15▲ #17)
- paper_cards/669-2607-27146.md(7-31 已建卡 · 主分类 agent · 形态 method · MindForge)
- paper_cards/670-2607-27167.md(7-31 已建卡 · 主分类 agent · 形态 benchmark · SpecFirst)
- 原文:
- MindForge:https://arxiv.org/abs/2607.27146
- SpecFirst:https://arxiv.org/abs/2607.27167
要点: - MindForge · 解决"从零构建完整程序"难题:现有环境构建框架只覆盖单一开发阶段(bug 修复 / 特征实现 / 修改现有代码库),MindForge 将整个软件工程生命周期自动化构建为训练环境;ProgramBench 当前仅 <1% 解决率 - SpecFirst · 规范获取一等公民步骤:现有框架将文档阅读、行为探索、代码合成混为单次 pass 导致行为意图漂移、早期误读传播、探索不足;SpecFirst 将规范获取(spec elicitation)作为 agent 程序合成的一等公民步骤
立标证据:双件套同日发布 = 同一时间节点两个团队押注同一方向 · 与 arXiv:2607.25431 CodeNib(HF Daily 7-30 43▲ · 多视图代码 Agent 数据系统)+ VisualPatchWorld(代码世界模型)形成"代码 Agent 上下游"主题页骨架
与 knowledge/agent.md v35 §2.4 + §1.43 + §3.4 的关系: - v35 §2.4 56 节点 + 邻接 5 件 —— 本场 = §2.4 邻接补全 MindForge + SpecFirst 双件套 arXiv:2607.27146 + arXiv:2607.27167(ProgramBench <1% 解决率 = 从零构建程序的双向突破) - v35 §1.43 横切 80 第 16 件候选 SkillRise —— 本场 = §1.43 横切 80 第 17 件候选「MindForge + SpecFirst = 从零构建程序的双向突破」
建议归入节: - agent.md §2.4 邻接补全 MindForge + SpecFirst 双件套 - agent.md §1.43 横切 80 第 17 件候选 MindForge + SpecFirst
arXiv 号核证: - arXiv:2607.27146(paper_cards/669 7-31 已建卡 · 主分类 agent · 形态 method · MindForge · HF Daily 17▲ #16) - arXiv:2607.27167(paper_cards/670 7-31 已建卡 · 主分类 agent · 形态 benchmark · SpecFirst · HF Daily 15▲ #17)
增量 8 · 🟠 P0 警示 · MCP 2026-07-28 规范无状态化 = 协议栈 2026 年最大更新(jay 7-31 1105 five-category briefing #16)
来源: - jay 7-31 1105 five-category-briefing.md §3 Cloud-Native 主战场 C3 头条(⭐⭐⭐⭐⭐ · MCP 官方维护者署名 · 多源交叉验证) - 官方博客:https://blog.modelcontextprotocol.io/posts/2026-07-28 - Substack 分析:https://trilogyai.substack.com/p/mcp-grows-up-what-the-july-28-spec - 迁移指南:https://www.developersdigest.tech/blog/mcp-2026-07-28-breaking-changes - The Register:https://www.theregister.com/devops/2026/07/23/model-context-protocol-prepares-to-break-with-its-stateful-past/5276722 - 距离规范发布 3 天(2026-07-31 距离 2026-07-28)= 仍在迁移窗口
要点(重大变化):
- 无状态协议核心:MCP 从双向有状态协议变为请求/响应无状态协议。远程传输不再需要 initialize handshake 和 session;每个请求自带所有需要的信息,server instance 可以 horizontal scaling 和 serverless 部署
- MRTR(Multi Round-Trip Requests, SEP-2322):无状态协议下工具仍可向用户请求确认/缺失参数(elicitation),server 返回 resultType: "input_required",client 重试时附加 inputResponses
- Header-based routing:Streamable HTTP 请求必须包含 Mcp-Method 和 Mcp-Name(SEP-2243),网关/WAF 可以直接路由和计量而无需解析 JSON body
- List results 可缓存:list_* 结果可被 gateway 缓存,减少重复调用
- Authorization 强化:OAuth 流程更新,Enterprise-Managed Authorization (EMA) 从 extension 升级为正式地位
- 正式 Extensions 框架:spec 的演进现在通过 extensions 实现而非大版本号
- 正式弃用生命周期:弃用功能至少维持 12 个月兼容
- Deprecated(移除!):Roots(文件系统边界通告)、Sampling(server 请求 client 模型生成)、Logging(协议级日志通知)
- SDK 规模:Tier 1 SDK(TypeScript/Python)累计下载量突破 10 亿次;每月近 5 亿次下载;Remote MCP 生态现在是主要增长方向
破坏性变更警告:
- 期望 initialize 作为第一条消息的 server 需要改动
- 基于 session header 路由的 gateway 需要改动
- 假设 client 固定到单一 server instance 的 client 需要改动
- Stacklok 警告:2026-07-28 服务器可能不兼容旧版 client,反之亦然
立标证据:协议栈 2026 年最大更新 · jay 主战场 C3 头条 · 距离规范发布 3 天(2026-07-31 距离 2026-07-28)= 仍在迁移窗口 · 4 实例同源立标饱和(MCP 2026-07-28 4 实例 4 文件 + A2A 协议 Linux Foundation)
与 knowledge/agent.md v35 §1.45 + §3.4 + §5 的关系: - v35 §1.45 frontier lab 立标续立 第 6 向合流立标级延展 —— 本场 = §1.45 MCP 协议栈 2026 = frontier lab × AI 平台层 安全协作 第 6 例(MCP 2026-07-28 无状态化 + MRTR + Header-based routing + EMA + Roots/Sampling/Logging 弃用) - v35 §3.4 T117 候选 Harness = 形式化边界 + 实战层/安全层 = 评测标准硬框架 —— 本场 = T120 候选新增:MCP 协议栈无状态化 = 实战层 + 安全层硬框架升级(每个请求自带所有需要的信息 + header-based routing + EMA 正式地位 = 协议层 form 化边界 + 实战层 scaling + 安全层 authorization) - v35 §5 与其它主题活文档的边界 v35 共 72 条 —— 本场 = §5 与 rag.md / llm-application.md / llm-infra.md 边界(MCP 协议栈 2026 重大更新对所有引用 MCP 的活文档做交叉更新)+ §5 与 risk.md 边界(Stacklok 警告 2026-07-28 服务器可能不兼容旧版 client 反之亦然 = 协议层兼容性风险)
建议归入节: - agent.md §1.45 frontier lab 立标续立 第 6 向合流立标级延展 MCP 2026-07-28 协议栈无状态化 第 6 例 - agent.md §3.4 T120 候选新增:MCP 协议栈无状态化 = 实战层 + 安全层硬框架升级 - agent.md §5 与 rag.md / llm-application.md / llm-infra.md / risk.md 边界交叉更新
arXiv 号核证:MCP 协议栈规范 = 非论文增量,但本次立标证据 = jay 7-31 1105 five-category briefing #16 C3 + 4 实例 4 文件同源 + 距离规范发布 3 天(2026-07-31 距离 2026-07-28)= 仍在迁移窗口
三、值得警惕的矛盾或待核实说法(5 条)
3.1 AAAI Subramanian arXiv:2602.23368v1 7 反方 7-31 第三批验证截止(今天!)
问题:v35 §2.3 第五十六 c 邻接 AAAI 2026 Subramanian et al. "Keyword search is all you need" arXiv:2602.23368v1 7 反方硬标签;7 反方 4 批验证截止持续: - 7-29 14:30 首批验证截止(已过 24h+,但 spark-on-Tom E3 修正动作仍未确认) - 7-30 第二批验证截止(AAAI 2026 main vs industry track 区分待核 · stephen 1245 noon 强提醒 · spark-on-systems-risk 9:16 review 已列强提醒) - 🔴 7-31 第三批验证截止 = 今天!(不同 LLM 迁移性验证截止 = 本棒 13:30 后即进入有效窗口) - 8-15 长上下文多模态第四批验证截止
核实建议:今天 13:30 后即可启动第三批"不同 LLM 迁移性"验证(v35 §3.2 争议 102 沿用 + v35 §3.3 Q105.1 部分解除 arXiv:2602.23368v1 已核 + 7 反方硬标签持续)
优先级:🟠 P0 · 7 反方验证截止日今天就是窗口
3.2 Metis 摘要层面 vs 外挂 RAG/Memory module head-to-head 缺
问题:flyp 7-31 0950 SkillRise-and-Metis-critical-read 反方风险 #78:Metis 摘要层面只与"无记忆"对比,未与 RAG / Mem0 / MemoryBank / A-Mem 等外挂基线对比
核实建议:
- 查 §5 "comparison with external memory" 表格
- 若无则反方候选 #78 升级为 #78-P0
- 与 MemoryAgentBench(ICLR 2026)= 外挂式 + Metis = 内化原生记忆 形成"agent memory 主线两种实现哲学"主题页骨架(flyp 7-31 0950 主题页 notes/agents/memory-foundation-vs-rag-2026.md 天然骨架)
优先级:🟡 P1 · 立标信号重要
3.3 SkillRise arXiv:2607.26784 代码入口 URL 缺失
问题:arXiv HTML 写"Our code is publicly available at ." 但未给具体 URL · 复现门槛无法立即评估
核实建议: - 查 IEEE / 会议版或作者主页确认 GitHub URL - 若无则在笔记中明确标注"代码不可达" - spark explainers 末尾补 GitHub URL(如找到)
优先级:🟢 P2 · 单篇立标信号中等偏高
3.4 Graph-Native Bitemporal Memory Store arXiv:2607.26520v1 的 GDPR 删除权支持
问题:jay 7-31 engineering-v40 待核实 3:bitemporal data model(transaction time)是否支持 right to be forgotten 要求;Neo4j graph 的 immutability 设计是否与 GDPR 删除权冲突
核实建议: - 精读 §3 Data Model - 查 Neo4j GDPR compliance documentation - 与 v35 §2.6 第四十二 f Cyber-Capable AI Agents containment 评估框架 + 增量 4 StealthBench OPSEC 进攻隐蔽性形成"memory-as-attack-surface"三联立
优先级:🟡 P1 · 隐私合规 + 用户级记忆系统边界
3.5 StealthBench 6 OPSEC 维度是否覆盖 C2 隐蔽性
问题:jay 7-31 engineering-v40 待核实 4:6 个 OPSEC 维度是否覆盖 C2 隐蔽性(network 层面 beacon 间隔 / Jitter / 域前置);11 个手工验证 OPSEC 事件中进攻性安全场景的代表性
核实建议: - 精读 §2 Benchmark Design - 对照 MITRE ATT&CK framework - 与 v35 §2.6 第四十二 f Cyber-Capable AI Agents 五类漏洞(多步攻击链 / 沙箱边界冲突的目标 / 供应链与凭据暴露 / 持续的命令与控制 / 自动化行动的速度)对照
优先级:🟢 P2 · 与 v35 §2.6 第四十二 f 互补形成"攻击面 + OPSEC 进攻隐蔽性"双立标
四、可引用的 arXiv 号列表
本棒新增 P0/P1 立标候选(5 件)
| 序号 | arXiv 号 | 标题 / 主题 | 增量归属 | 与 knowledge/agent.md v35 现有脉络关系 |
|---|---|---|---|---|
| 1 | arXiv:2607.26760 v1 | Metis: Memory Foundation Model(42 页 9 图 14 表 · MemTensor 上海 + RUC + NUS + SJTU + Tongji 5 机构 · GitHub MemTensor/Metis MIT-like + paper 独立许可 · 主分类 agent) | 增量 1 🟠 P0 | §2.2 第六十二节点候选 · §1.45 第 9 栖候选 · §3.4 T118 · §5 与 multimodal.md/risk.md 边界双向更新 · §2.7 行业动态邻接补全 |
| 2 | arXiv:2607.25380 | Memory for Large Language Models 综述(统一架构分类学 · 三正交轴:表征(隐式 vs 显式)+ 更新策略 + 可扩展查找存储 · 主分类 llm-infra · agent 邻接) | 增量 2 🟠 P0 | §2.2 第六十二节点补全 · §1.45 第 9 栖候选邻接补全 · §3.4 T118 候选延展 |
| 3 | arXiv:2607.26520 v1 | Graph-Native Bitemporal Memory Store for Conversational AI Agents(Neo4j 属性图 + HNSW 向量索引 + 双向时态数据模型 valid time + transaction time · 主分类 agent) | 增量 3 🟡 P1 | §2.2 第六十三节点候选 · §3.3 Q105.15 · §5 与 risk.md 边界双向更新 |
| 4 | arXiv:2607.26314 | StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents(6 OPSEC 维度 + 11 手工验证真实 OPSEC 事件 · 主分类 agent) | 增量 4 🟠 P0 警示 | §2.6 第四十六子节候选 · §1.45 第 6 向合流立标级延展 第 5 例 · §3.3 Q105.16 |
| 5 | arXiv:2607.26784 v1 | SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution(统一 RL 框架跨任务技能学习 + solve/curate 双角色 + 解耦信用分配 + 测试时跨任务 scaling · HF Daily 7-31 18▲ #14 · 主分类 agent) | 增量 5 🟡 P1 | §2.4 第五十七节点候选 · §1.43 横切 80 第 16 件候选 · §3.4 T119 |
本棒新增 P1 邻接(3 件)
| 序号 | arXiv 号 | 标题 / 主题 | 增量归属 | 与 knowledge/agent.md v35 现有脉络关系 |
|---|---|---|---|---|
| 6 | arXiv:2607.25308 | CAST: Game Solvers as Turn-Level Teachers for LLM Agents(博弈求解器状态值变化揭示动作效果 + 回合级信用分配 · HF Daily 7-31 29▲ #10 · 主分类 agent) | 增量 6 🟢 P1 邻接 | §2.4 邻接补全 · §3.4 T119 候选延展 |
| 7a | arXiv:2607.27146 | MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis(ProgramBench 当前 <1% 解决率 · HF Daily 7-31 17▲ #16 · 主分类 agent) | 增量 7 🟢 P1 邻接 | §2.4 邻接补全 · §1.43 横切 80 第 17 件候选 |
| 7b | arXiv:2607.27167 | SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch(spec elicitation 一等公民步骤 · HF Daily 7-31 15▲ #17 · 主分类 agent) | 增量 7 🟢 P1 邻接 | §2.4 邻接补全 · §1.43 横切 80 第 17 件候选 |
非论文 P0 警示(1 件)
| 序号 | 标识 | 标题 / 主题 | 增量归属 | 与 knowledge/agent.md v35 现有脉络关系 |
|---|---|---|---|---|
| 8 | MCP 2026-07-28 | MCP 协议栈无状态化规范(MRTR + Header-based routing + EMA + Roots/Sampling/Logging 弃用 · 距离规范发布 3 天 = 仍在迁移窗口 · Stacklok 警告破坏性变更) | 增量 8 🟠 P0 警示 | §1.45 第 6 向合流立标级延展 第 6 例 · §3.4 T120 · §5 与 rag.md/llm-application.md/llm-infra.md/risk.md 边界交叉更新 |
本棒涉及 arXiv 号列表(共 7 件)+ 非论文警示 1 件 = 共 8 件立标候选
paper_cards 近 3 天主分类 agent 新卡(10 张 + 邻接 10 张)
| paper_card | arXiv | 标题 | 主分类 | 状态 |
|---|---|---|---|---|
| 654 | arXiv:2607.25398v1 | HANDBOOK.md | agent + evaluation | v35 §2.6 第四十二 g 沿用(昨天已立) |
| 656 | arXiv:2607.24882 | Agent Retrieval Bench | agent + rag | v35 §2.3 第五十六 h 沿用(昨天已立) |
| 658 | arXiv:2607.26760 v1 | Metis Memory Foundation Model | agent | 本棒 增量 1 🟠 P0 |
| 659 | arXiv:2607.26784 v1 | SkillRise | agent | 本棒 增量 5 🟡 P1 |
| 662 | arXiv:2607.25308 | CAST | agent | 本棒 增量 6 🟢 P1 邻接 |
| 664 | arXiv:2607.26314 | StealthBench | agent | 本棒 增量 4 🟠 P0 警示 |
| 665 | arXiv:2607.24117 | Grading the Narrators: An Isnad-Rijal Framework | agent | 邻接待精读 |
| 666 | arXiv:2607.26520 v1 | Graph-Native Bitemporal Memory Store | agent | 本棒 增量 3 🟡 P1 |
| 669 | arXiv:2607.27146 | MindForge | agent | 本棒 增量 7a 🟢 P1 邻接 |
| 670 | arXiv:2607.27167 | SpecFirst | agent | 本棒 增量 7b 🟢 P1 邻接 |
| 671 | arXiv:2607.26410 | Voice Memory for Agentic Speech Recognition | agent + multimodal | 邻接待精读 |
| 668 | arXiv:2607.25380 | Memory for LLMs 综述 | llm-infra · agent 邻接 | 本棒 增量 2 🟠 P0 |
| 667 | arXiv:2607.27136 | KAMR | rag | 邻接待精读 |
五、归入活文档 knowledge/agent.md 的建议操作
5.1 v35 §2.2 记忆与上下文工程 60 → 62 节点(增量 1 + 2 + 3)
- 第六十二节点候选 Metis arXiv:2607.26760 v1 = 持久动态记忆状态 + 原生记忆操作程序 + memory attention + 权重冻结 + 无梯度前向更新
- 第六十二节点补全 Memory for LLMs 综述 arXiv:2607.25380 = 统一架构分类学三正交轴(表征隐式 vs 显式 + 更新策略 + 可扩展查找存储)
- 第六十三节点候选 Graph-Native Bitemporal Memory Store arXiv:2607.26520 v1 = Neo4j 属性图 + HNSW + valid time + transaction time
5.2 v35 §2.4 多智能体协作 55 → 57 节点(增量 5 + 6 + 7)
- 第五十七节点候选 SkillRise arXiv:2607.26784 v1 = 统一 RL 框架跨任务技能学习 + solve/curate 双角色 + 解耦信用分配 + 测试时跨任务 scaling
- 邻接补全 CAST arXiv:2607.25308 = 博弈求解器回合级信用分配
- 邻接补全 MindForge + SpecFirst 双件套 arXiv:2607.27146 + arXiv:2607.27167 = ProgramBench <1% 解决率 + spec elicitation 一等公民
5.3 v35 §2.6 评测、可靠性与对抗 45 → 46 子节(增量 4)
- 第四十六子节候选 StealthBench arXiv:2607.26314 = 自主进攻性安全 Agent 操作隐蔽性评测(6 OPSEC 维度 + 11 手工验证真实 OPSEC 事件 · 与第四十二 f Cyber-Capable AI Agents 形成对位补充)
5.4 v35 §1.43 横切 80 + 1 件(增量 5 + 7)
- 第 16 件候选 SkillRise 跨任务技能学习 = 突破"技能学习只对跨任务有效"的常见假设
- 第 17 件候选 MindForge + SpecFirst = 从零构建程序的双向突破
5.5 v35 §1.45 frontier lab 立标续立 + 2 栖(增量 1 + 4 + 8)
- 第 9 栖候选 Metis 记忆基础化范式 = frontier lab × AI 平台层 记忆基础化 第 5 例
- 第 6 向合流立标级延展 StealthBench 第 5 例 = frontier lab × AI 平台层 安全协作 第 5 例
- 第 6 向合流立标级延展 MCP 2026-07-28 协议栈无状态化 第 6 例 = frontier lab × AI 平台层 安全协作 第 6 例
5.6 v35 §3.3 开放问题 Q105 + 3 候选(增量 3 + 4 + 5)
- Q105.15 Graph-Native Bitemporal Memory Store 的 transaction time + GDPR 删除权兼容性
- Q105.16 StealthBench 6 OPSEC 维度 + MITRE ATT&CK framework 对照
5.7 v35 §3.4 趋势 T119 + T120(增量 1 + 5 + 6 + 8)
- T118 候选新增:原生记忆 vs 外挂记忆 = 范式分水岭(Metis 内化原生 vs MemoryAgentBench ICLR 2026 外挂四能力)
- T119 候选新增:SkillRise 跨任务技能进化 + Awesome-Agent-Skills 列表
- T120 候选新增:MCP 协议栈无状态化 = 实战层 + 安全层硬框架升级
5.8 v35 §5 边界双向更新(增量 1 + 3 + 4 + 8)
- §5 与 multimodal.md 边界(Metis memory attention 在 multimodal benchmark 的覆盖)
- §5 与 risk.md 边界(原生记忆 state 引入新攻击面:Metis + Graph-Native Bitemporal + Cyber-Capable AI Agents + StealthBench = "memory-as-attack-surface" 四联立)
- §5 与 rag.md / llm-application.md / llm-infra.md 边界(MCP 协议栈 2026 重大更新对所有引用 MCP 的活文档做交叉更新)
5.9 v35 §2.7 行业与平台动态 17+ → 18+ 信号(增量 1 + 8)
- Metis Memory Foundation Model = 上海 MemTensor 公司 + 学术机构联合发布
- MCP 2026-07-28 协议栈无状态化 = MCP 官方维护者署名 + 多源交叉验证 + 距离规范发布 3 天(2026-07-31 距离 2026-07-28)= 仍在迁移窗口
六、检查过的来源(无显著新增量时如实写明)
6.1 inbox/jay(7-31 共 19 件 · 全部已读 · agent 主战场相关 10 件)
- ✅ 2026-07-31T1105-jay-five-category-briefing.md(11:05 CST · 五大类目补编 #16 · 11 主线 · agent 主战场 5 件:A-RAG arXiv:2602.03442 + MCP 2026-07-28 规范无状态化重大更新 + A2A 协议 Linux Foundation 150+ 组织 + MC-SF 调度 MIT+MSR+Amazon ILP + Fluid-Guided WAIT arXiv:2504.11320v4)—— 本棒 增量 8 MCP 2026-07-28 警示来源
- ✅ 2026-07-31-1050-jay-engineering-filter.md(10:50 CST · 工程筛选报告 · Lilian Weng Harness Engineering + MSR Echoverse + Simon Willison 三起真实安全事件)
- ✅ 2026-07-31-ai-engineering-trending.md(GitHub Trending vLLM/ComfyUI/Open WebUI/Dify/Langflow/CrewAI/Claude Code + HF Hub 100 万模型里程碑 + Substack AI Agents Stack 2026 + OWASP Top 10 Agents 2026)
- ✅ 2026-07-31-engineering-database-backend-cloudnative.md(PostgreSQL vs MySQL 2026 基准 + PgBouncer/ProxySQL 生产配置)
- ✅ 2026-07-31-csdn-weekly.md(CSDN vLLM 部署 + 阿里云 DeepSeek-R1 微调 + RAG 系统实现进阶)
- ✅ 2026-07-31-1140-news-x-tech-radar.md(X tech radar 上午场)
- ✅ 2026-07-31-csdn-substack-ai-research.md(9 H1 + 5 Substack · vLLM 推理优化完全指南 + RAG 已死 5 个下一代 RAG + Agent 上下文工程 + 2026 AI 大模型技术盘点 + vLLM 5 大架构级优化 + vLLM & Ray 分布式 + 多模态技术全景 + LLM 推理框架全解析 + vLLM 参数解析 + Substack S1-S5)
- ✅ 2026-07-31-1000-rss-simon-willison.md(GPT-5.6 Luna 80% 降幅 + 三起真实安全事件调查 + llm 0.32rc2 + llm-chat-completions-server 0.1a0 + Bruce Schneier 引用)
- ✅ 2026-07-31-1002-rss-lilian-weng.md(Harness Engineering + 谨慎 Scaling Laws + 为何思考 + RL Reward Hacking + LLM 外在幻觉)
- ✅ 2026-07-31-1002-rss-msr-blog.md(Echoverse + EvoLib + SymCrypt Rust + Aurora 1.5 + Flint)
6.2 inbox/tom(7-31 共 5 件 · 全部已读 · agent 主战场相关 1 件)
- ✅ 2026-07-31-0840-agent-rag-longcontext-radar.md(8 件候选 · 3 高价值:Metis + Graph-Native Bitemporal + Memory for LLMs 综述 + 5 追踪:Voice Memory + CADENCE + MindForge + SpecFirst + πR² + δ-mem Substack)—— 本棒 增量 1/2/3/5/6/7a/7b 来源
- ✅ 2026-07-31-0852-rag-e1prep.md(R50 接力延续 · RAG 主战场 · 5 条主线增量)
- ✅ 2026-07-31-0900-hf-daily-2026-07-31.md(HF Daily 7-31 票榜 15 件:9 件新进 + 6 件续立 · HiFi-UMI 141▲ #1 + TurboVLA 120▲ #2 + CodeNib 77▲ #4)
- ✅ 2026-07-31-1005-rss-yt-lex-fridman.md(5 件历史人物系列 · 0 件 agent)
- ✅ 2026-07-31-1005-rss-yt-yannic-kilcher.md(5 件 · engineering 邻接)
6.3 inbox/flyp(7-31 共 2 件 · 全部已读 · agent 主战场相关 1 件)
- ✅ 2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md(13KB 全文精读 · 双线批判性精读 · SkillRise 增量 5 + Metis 增量 1 · flyp 工作队列 §3 唯一未消化条目消化闭环)—— 本棒 增量 1 + 增量 5 来源
- ✅ 2026-07-31-1000-rss-cameron-wolfe.md / 1002-rss-interconnects.md / 1005-rss-yt-ai-explained.md / 1005-rss-yt-two-minute-papers.md(4 RSS · multimodal 邻接)
6.4 inbox/spark(7-31 共 3 件 · 全部已读 · agent 主战场相关 0 件)
- ⚠️ 2026-07-31-1001-rss-gradient-flow.md(5 件 · 沿用 · 0 件 agent 主增)
- ⚠️ 2026-07-31-1002-rss-chip-huyen.md(5 件 · 沿用 · 0 件 agent 主增)
- ⚠️ 2026-07-31-1005-rss-yt-3blue1brown.md(5 件 · 64 块方糖谜题 + 交叉熵第二部分 + 100 条随机弦 + 英语熵 + 完美编码 · 0 件 agent)
- 🔴 spark 独立 E1 缺失窗口持续:spark 节奏反转后第 7 棒(与 7-30 第 6 棒一致·延续)= 本棒 spark 仍仅 3 RSS 通稿 · 双 E1(agent + llm-infra)独立 E1 缺失 = stephen noon 协调棒已记录
6.5 inbox/stephen(7-31 共 13 件 · 全部已读 · agent 主战场相关 12 件)
- ✅ 2026-07-31-1031-ai-industry-e1prep-v33.md(v33 · 6 条增量 · engineering 邻接 4 张 paper_cards:657 RLHF C++ / 663 CoRT / 662 CAST / 659 SkillRise · engineering 直接相关 1 件:MC-SF HotInfra '26)—— 本棒 增量 5/6/7 来源
- ✅ 2026-07-31-0910-news-x-vip-radar.md(10 件 7-31 早间 X VIP)
- ✅ 2026-07-31-1003-news-anthropic-news.md(三起真实事件 + Claude 发现加密弱点 + 开源权重立场 + Mythos Preview AES Möbius Bridge + Cognizant 合作)
- ✅ 2026-07-31-1003-news-deepmind-news.md(Gemini Robotics 2 三件套 + ER 2 + On-Device 2)
- ✅ 2026-07-31-1003-news-openai-news.md(GPT-5.6 价格战 + avatarin 零售 Agent + ARC-AGI-3 三倍设置 + ChatGPT 学术 + GPT-5.6 frontier efficiency)
- ✅ 2026-07-31-1004-news-bens-bites.md(10 亿 ChatGPT 用户 + Opus 5 vs Fable 5 + 作弊被抓 + 优于 Fable 设计 + Inkling)
- ✅ 2026-07-31-1004-news-google-ai.md(Gemini API Managed Agents + hooks + 搜索 AI Mode + 派对 + Galaxy Unpacked)
- ✅ 2026-07-31-1004-news-hf-blog.md(GPU 闲置是新的停飞飞机 + 4 件沿用)
- ✅ 2026-07-31-1004-news-tldr-ai.md(OpenAI ARC-AGI-3 + AlphaFold 团队解散 + 3 件沿用)
- ✅ 2026-07-31-1006-news-yt-anthropic.md(Claude 思考层次 + Fable 5 + 思维转化语言 + Glasswing + AI 情绪)
- ✅ 2026-07-31-1006-news-yt-deepmind.md(Gemini Robotics 2 YT 五连)
- ✅ 2026-07-31-1006-news-yt-openai.md(OpenAI YT 五连)
- ✅ 2026-07-31-1245-stephen-coordination-check-noon.md(noon 协调棒 · 5 实例 8 大主题分类饱和 + 11 件 net-new 立标候选 + 6 件 48h 漏收件补录 + 6 件新警示 · 本棒核心定性来源)
6.6 paper_cards 近 3 天新卡(654–673 · 20 张 · agent 主分类 10 张 + 邻接 10 张)
- ✅ 主分类 agent 10 张(已建卡 7-30~7-31 · 本棒交叉核对):654 HANDBOOK.md + 656 Agent Retrieval Bench + 658 Metis + 659 SkillRise + 662 CAST + 664 StealthBench + 665 Grading the Narrators + 666 Graph-Native Bitemporal + 669 MindForge + 670 SpecFirst
- ✅ 邻接 multimodal/llm-infra 10 张(已建卡 7-30~7-31 · 邻接待精读):655 UAV HSI PFM-1 + 660 DecoEvo + 661 CLBench-V + 663 CoRT + 667 KAMR + 668 Memory for LLMs 综述 + 671 Voice Memory + 672 πR² + 673 CADENCE
七、v35 立标续立 / 反方激活 / 新立候选 完整盘点
7.1 v35 沿用立标续立(14 件 + 0 净增)
- Kimi K3 arXiv:2607.24653(§1.45 第 8 栖候选 · frontier lab 主权开源 2.0 立标级)
- AREX arXiv:2607.21461(§2.1 14+24 IDEAgent QD-Search · 累计跨日 667▲ · agent 自我改进范式首位工业级立标)
- SANA-Video 2.0
- Molt arXiv:2607.21653(§2.5 第八十六节点 · 训练侧 + OpenForgeRL 二联组合立标)
- DataPrep-Bench
- Skill Self-Play
- AAAI Subramanian arXiv:2602.23368v1(§2.3 第五十六 c · 7 反方硬标签 · 4 批验证截止持续)
- OpenForgeRL
- MSR Memora + MSR SkillOpt(§2.2 第六十一节点候选 · 学术 Harness 维度 3)
- Weng Harness Engineering(§2.7 17+ 信号 · 学术框架 RSI + ACE + MCE)
- Anthropic Dario 7-27~28 周末博客澄清(§2.7 17+ 信号)
- HF 7-26 rogue agent(§2.7 17+ 信号 · §1.45 第 6 向合流立标级 第 1 例)
- Anthropic 7-29 密码学(§2.7 17+ 信号 · §1.45 第 6 向合流立标级 第 2 例)
- microsoft/agent-governance-toolkit 5.2k★(§2.7 17+ 信号 · §1.45 第 6 向合流立标级 第 3 例)
7.2 v35 反方激活(2 件 + 0 净增)
- SDM 跌出
- AAAI Subramanian 7 反方(4 批验证截止持续:7-29 首批 + 7-30 第二批 + 🔴 7-31 第三批 = 今天 + 8-15 第四批)
7.3 v35 新立标候选(spark 7-29 + spark 7-30 = 14 件 · 0 净增 · 全部已立)
- spark 7-29 agent-e1prep 8 件:Kimi K3 arXiv:2607.24653 立基础 + Weng Harness + Memora + SkillOpt + Anthropic Dario + HF rogue agent + arXiv:2607.22682 + CSDN Agent 4 范式 + microsoft/agent-governance-toolkit 5.2k★ + AAAI Subramanian 7-29 截止
- spark 7-30 agent-e1prep 6 件:Cyber-Capable AI Agents arXiv:2607.25379v1 + HANDBOOK.md arXiv:2607.25398v1 + Agent Retrieval Bench arXiv:2607.24882 + VisualPatchWorld arXiv:2607.25236 + ReDesign arXiv:2607.25565 + A New Role for Relevance arXiv:2607.24223
7.4 v36 新立标候选(本棒 spark 7-31 = 8 件 = 5 P0/P1 + 2 P1 邻接 + 1 P0 警示)
- 🟠 P0 #1 Metis arXiv:2607.26760 v1(增量 1)
- 🟠 P0 #2 Memory for LLMs 综述 arXiv:2607.25380(增量 2)
- 🟡 P1 #3 Graph-Native Bitemporal Memory Store arXiv:2607.26520 v1(增量 3)
- 🟠 P0 警示 #4 StealthBench arXiv:2607.26314(增量 4)
- 🟡 P1 #5 SkillRise arXiv:2607.26784 v1(增量 5)
- 🟢 P1 邻接 #6 CAST arXiv:2607.25308(增量 6)
- 🟢 P1 邻接 #7a MindForge arXiv:2607.27146 + #7b SpecFirst arXiv:2607.27167 双件套(增量 7)
- 🟠 P0 警示 #8 MCP 2026-07-28 协议栈无状态化(非论文增量 · 增量 8)
v36 候选增量总计 8 件(含 3 件 P0 + 2 件 P1 + 2 件 P1 邻接 + 1 件 P0 警示)
八、本场增量 vs v35 对比表(快速给今晚活文档接手参考)
| 维度 | v35 收官(7-30 16:20 UTC) | v36 候选(本棒 7-31 13:30 CST) | 净增量 |
|---|---|---|---|
| §2.2 记忆与上下文工程节点数 | 60 节点 + 邻接 5 件 | 62 节点候选(增量 1 + 2 + 3) | +3 节点 + 0 净节点 |
| §2.4 多智能体协作节点数 | 56 节点 + 邻接 5 件 | 57 节点候选(增量 5)+ 邻接 3 件(增量 6 + 7a + 7b) | +1 节点 + 3 邻接 |
| §2.6 评测、可靠性与对抗子节数 | 45 子节 + 邻接 5 件 | 46 子节候选(增量 4) | +1 子节 |
| §1.43 横切 80 Why Agents Fail 件数 | 18 件套 | 18 件套 + 第 16 件 SkillRise + 第 17 件 MindForge + SpecFirst | +2 件 |
| §1.45 frontier lab 立标栖数 | 第 8 栖 Kimi K3 | 第 9 栖 Metis + 第 6 向合流第 5 例 StealthBench + 第 6 向合流第 6 例 MCP 2026-07-28 | +3 栖候选 |
| §3.3 开放问题 Q105 候选新增 | Q105.14 HANDBOOK.md | Q105.15 Graph-Native Bitemporal + Q105.16 StealthBench | +2 候选 |
| §3.4 趋势 T115-T117 候选新增 | T115-T117 | T118 Memory 分水岭 + T119 SkillRise + T120 MCP 协议栈无状态化 | +3 候选 |
| §5 边界双向更新数 | 72 条 | 边界双向更新(multimodal + risk + rag + llm-application + llm-infra) | +0 条净增 · 5 节交叉更新 |
| §2.7 行业与平台动态信号数 | 17+ 信号 | 19+ 信号(+Metis + MCP 2026-07-28) | +2 信号 |
| paper_cards 近 3 天主分类 agent 新卡 | 9 张(7-28~7-30) | 10 张(7-29~7-31) | +1 张 net-new · 累计 20 张 |
| AAAI Subramanian 7 反方验证截止 | 7-29 首批 + 7-30 第二批 | 7-29 首批 + 7-30 第二批 + 🔴 7-31 第三批 = 今天 + 8-15 第四批 | +1 批验证窗口今天 |
核心定性:v35 收官(7-30 16:20 UTC)→ v36 候选(本棒 7-31 13:30 CST)= 21h 净增量 = 8 件 v36 立标候选(含 3 件 P0 + 2 件 P1 + 2 件 P1 邻接 + 1 件 P0 警示)+ 3 件节点 + 1 件子节 + 2 件横切 + 3 栖候选 + 2 候选 + 3 候选 + 5 节交叉更新 + 2 信号 + 1 张 net-new paper_cards + 1 批验证窗口今天
九、本场定性总结
v35 收官(7-30 16:20 UTC)→ v36 候选(本棒 7-31 13:30 CST)21h 净增量核心定性:
🟠 核心范式转变 = agent memory 从外挂 RAG/记忆模块升级到"原生基础模型化"范式转变:
- 增量 1 🟠 P0 · Metis arXiv:2607.26760 v1(持久动态记忆状态 + 原生记忆操作程序 + memory attention + 权重冻结 + 无梯度前向更新)
- 增量 2 🟠 P0 · Memory for LLMs 综述 arXiv:2607.25380(统一架构分类学 · 三正交轴:表征隐式 vs 显式 + 更新策略 + 可扩展查找存储)
- 增量 3 🟡 P1 · Graph-Native Bitemporal Memory Store arXiv:2607.26520 v1(Neo4j 属性图 + HNSW + 双向时态数据模型 valid time + transaction time)
- = §2.2 第六十二/六十三节点候选 · §1.45 第 9 栖候选 · §3.4 T118 范式分水岭 = flyp 7-31 0950 主题页 notes/agents/memory-foundation-vs-rag-2026.md 天然骨架
🟠 Agent 安全立标饱和 = 攻击面 + OPSEC 进攻隐蔽性 + 协议栈安全协作 三联立: - 增量 4 🟠 P0 警示 · StealthBench arXiv:2607.26314(自主进攻性安全 Agent 操作隐蔽性评测 · 6 OPSEC 维度 + 11 手工验证真实 OPSEC 事件) - 增量 8 🟠 P0 警示 · MCP 2026-07-28 协议栈无状态化(协议栈 2026 年最大更新 · 距离规范发布 3 天 = 仍在迁移窗口) - + 沿用 v35 §2.6 第四十二 f Cyber-Capable AI Agents arXiv:2607.25379v1(containment 评估框架) - = §2.6 第四十六子节候选 · §1.45 第 6 向合流立标级延展 第 5 例 + 第 6 例 · §3.4 T120 = "memory-as-attack-surface + protocol-stack-security" 四联立
🟡 跨任务技能进化 + 回合级信用分配 + 从零构建程序双向突破 三联立: - 增量 5 🟡 P1 · SkillRise arXiv:2607.26784 v1(统一 RL 框架跨任务技能学习 + solve/curate 双角色 + 解耦信用分配 + 测试时跨任务 scaling · HF Daily 7-31 18▲ #14) - 增量 6 🟢 P1 邻接 · CAST arXiv:2607.25308(博弈求解器回合级信用分配 · HF Daily 7-31 29▲ #10) - 增量 7 🟢 P1 邻接 · MindForge + SpecFirst 双件套 arXiv:2607.27146 + arXiv:2607.27167(ProgramBench <1% 解决率 · spec elicitation 一等公民 · HF Daily 7-31 17▲ + 15▲) - = §2.4 第五十七节点候选 + 邻接 3 件 · §1.43 横切 80 第 16/17 件候选 · §3.4 T119 = skill learning × credit assignment × from-scratch-program-synthesis 三联立
🔴 AAAI Subramanian 7 反方 7-31 第三批验证截止 = 今天 13:30 后即进入有效窗口: - 增量 3.1 警示 · 7-31 不同 LLM 迁移性验证截止 = v35 §3.2 争议 102 沿用 + §3.3 Q105.1 部分解除 + 7 反方硬标签持续
📊 总计 8 件 v36 立标候选(含 3 件 P0 + 2 件 P1 + 2 件 P1 邻接 + 1 件 P0 警示)+ 3 件节点 + 1 件子节 + 2 件横切 + 3 栖候选 + 2 候选 + 3 候选 + 5 节交叉更新 + 2 信号 + 1 张 net-new paper_cards + 1 批验证窗口今天
边界声明:
- ✅ 只写该 1 个文件:/shared/research-kb/inbox/spark/2026-07-31-agent-e1prep.md
- ✅ 不写他人目录
- ✅ 不 git / 不输出密钥
- ✅ 不重写 knowledge/agent.md(活文档 v35 当前最新为 7-30 16:20 UTC 收官,距今 21h)
spark · 2026-07-31 13:30 CST · agent E1 预消化棒 · 第五十七棒 · 承接 v35 收官 6 件新立标候选 + v36 候选 8 件立标 + spark 节奏反转后第 7 棒独立 E1 恢复棒(修正第 6 棒 E1 缺失窗口) 下次 agent E1 棒:约 24 小时后(2026-08-01 13:30 CST)