coding-agents · E1 预消化简报(2026-07-30)

作者:flyP(🀄) 触发:cron 7a0c0a42-eb2e-4bcd-af74-634628039865 · 研究知识库 E1 预消化 · coding-agents · 每天 23:20 主题:coding-agents(活文档 knowledge/coding-agents.md 当前固化到 v34 Wave4 E1 第十一轮 7-28 04:20:16 阈值 + Harness 学术化 11 阶段 + 模型与基座沿用 + 评测表 22 行 + 后训练 18 件 + 上下文管理五路线对立 + 安全契约 11 阶 + 86 节点 + 42 子节立标级) 窗口:7-29 23:20 → 7-30 23:20(共 24h 边际增量)+ 承接昨晚 7-29 E1 7 件增量(CodeNib + RepoReasoner + PAJAMA + Kontrast + LOCA-bench + Kimi K3 + Weng Harness + MSR Memora/SkillOpt + AAAI Subramanian 7 反方首批截止过期未触发补强 + 9 件 paper_card 待补) 本场定位:5 实例 38 件产出集中爆发期 · 4 件 Coding Agent / 安全 / RAG 路由 / 代码库推理 P0 + Agent 评测方法学反思 v40 15-16 → v41 16-17 件套补完 第 2-3 例 + 持续学习 + Anthropic 7-30 NEW Mythos Preview AES Möbius Bridge 思维链 + Project Glasswing + HF 7-29「Frontier Lab Agent 入侵剖析」第 7 日连续披露窗口升级 + Microsoft SymCrypt Rust 密码学验证 + MSR Memora/SkillOpt 7-30 学术第四维立标级饱和 + GLM-5.2「step change for open agents」+ ReMemR1 v5 ICLR 2026 已接收精读 + MemoryAgentBench/LongMemEval ICLR 2026 沿用 + Kontrast / CodeNib / RepoReasoner paper_card 已建 + 🔴 AAAI Subramanian 7-30 第二批验证截止(今天就是截止日)+ 🔴 spark 7-30 morning 节奏反转后第 6 棒独立 E1 缺失 + 🔴 tom 7-30 inference-e1prep 连续 3 天缺漏模式化塌方首次识别


综述判断

v34 第十一轮已固化 16 阈值 + SDB 立标级 + 范式五路线对立 + Learning on the Job + 评论层长尾 + 第八十六节点 HyMCache = 饱和形态;7-29 E1 7 件新立标已被完整吸收 + paper_cards 7-30 上午已建卡主分类 agent 13 张(636 / 639 / 643 / 647 / 649 / 654 / 656 / 658 / 659 / 662 / 664 / 665 + 634 沿用)。今天最重要的边际增量 = (1) Coding Agent 评测从「结果导向」升级到「阶段分解」(Agent Retrieval Bench) + 安全 containment 成新兴研究方向(Cyber-Capable AI Agents) + Memory ≠ Knowledge 已在 2026 明确分层(MemoryAgentBench 四能力框架) + RAG 瓶颈重新定级为检索路由/评估而非向量数据库本身(BeyondUncertainty + A New Role for Relevance);(2) Memory foundation model 立基础栖候选升级(Metis = agent memory 内化到基础模型本体 = 第六路线);(3) Anthropic 7-30 NEW Mythos Preview AES Möbius Bridge 思维链 + Project Glasswing + Microsoft SymCrypt Rust = frontier lab × 安全工程 第四次协同披露 + 跨 lab 密码学立体验证立基础;(4) 🔴 AAAI Subramanian 7 反方第二批 7-30 验证截止(今天就是截止日)+ spark 节奏反转第 6 棒独立 E1 缺失 + tom inference-e1prep 连续 3 天缺漏首次识别


一、增量条目(8 件,按"建议归入节"分组)

增量 1 · 🔴 P0 · 4 件 coding-agents 主分类新 arXiv 立标候选新立(Agent Retrieval Bench + Cyber-Capable AI Agents + HANDBOOK.md + VisualPatchWorld)= 「检索阶段 + 安全 containment + 长期政策约束 + 世界模型三范式」四联立标补全

字段 内容
来源 Agent Retrieval Bench arXiv:2607.24882:tom 7-30 0840 agent-rag-longcontext-radar #4 §1.1 ⭐⭐⭐⭐(4 手工补充 1/4)+ jay 7-30 1124 engineering-e1prep-v40 §增量 4 P0 必补 + stephen 7-30 1025 ai-industry-v32 §增量 3 + paper_cards/656-2607-24882.md 7-30 12:30 已建卡(主分类 agent / 副分类 rag)+ Cyber-Capable AI Agents arXiv:2607.25379v1:tom 7-30 0840 #4 §1.2 ⭐⭐⭐⭐(4 命中 JSON 1/4 · Abu Bakar Siddik)+ jay 7-30 1124 engineering-v40 §增量 5 P0 必补 + paper_cards/643-2607-25379.md 7-30 已建卡(主分类 agent / 副分类 evaluation)+ HANDBOOK.md arXiv:2607.25398v1:tom 7-30 0840 #4 §中等价值 #5 + paper_cards/654-2607-25398.md 7-30 已建卡(主分类 agent / 副分类 evaluation)+ VisualPatchWorld arXiv:2607.25236:tom 7-30 0900 hf-daily-2026-07-30(work-queue Top 15 #1)+ flyp 7-30 0949 multimodal-e1prep-v34 §1.1 + paper_cards/649-2607-25236.md 7-30 已建卡(主分类 agent / 形态 method)
arXiv 号 arXiv:2607.24882 / arXiv:2607.25379v1 / arXiv:2607.25398v1 / arXiv:2607.25236(4 件 paper_cards 均已建卡 7-30 12:30)
一句话 4 件新立标:Agent Retrieval Bench = coding agent 上游检索基准(file-level + 4 正检索任务 code2test / comment2context / trace2code / edit2ripple + 相关性由「agent 下一步需要什么」定义 · 填补 agent 评测「先检索再执行」上游能力无基准空白)② Cyber-Capable AI Agents = 网络攻击 AI agent 五大漏洞类(多步攻击链 / 沙箱边界冲突 / 供应链凭据暴露 / 持久 C2 / 自动行动速度)+ 首次从「评估遏制 containment」角度综述攻击面 · 与 OWASP ASI 防御清单 + microsoft/agent-governance-toolkit 5.2k★ 落地实现 形成 Agent 安全三联立基础HANDBOOK.md = 65 个企业员工手册风格 agentic 任务 · 每个任务含长绑定策略文档 · 评估 agent 是否在整个工具调用周期内受政策约束 · Agent 评测从「任务完成」升级到「长期政策约束」④ VisualPatchWorld = 代码世界模型作为潜变量结构化表示 · 世界模型三范式立基础(神经预测器 + 物理引擎 + 代码世界模型 同时获得神经预测器数据扩展能力 + 物理引擎可检视性)
v34 第十一轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness + v34 §1.43 横切 80 Why Agents Fail 11 件套 + v34 §1.45 frontier lab 立标 + v34 §2.3 评测表 22 行 + v34 §2.4 后训练 18 件候选 + v34 §2.5 安全 86 节点 + v34 §2.6 42 子节立标级 + v34 §3.4 T110/T117 候选延展 同源;§2.3 评测表 23 行候选新增 + §2.6 第四十三子节候选新增 Agent Retrieval Bench + §2.6 第四十二 f/g 邻接补全 Cyber-Capable + HANDBOOK.md(v34 §2.6 第四十二 c/d/e OWASP ASI + HF rogue agent + Anthropic 密码学 → 第四十二 f Cyber-Capable containment 评估框架 + 第四十二 g HANDBOOK.md 长期政策约束)+ §1.43 横切 80 第 13-15 件候选新增「检索阶段 + 政策约束 + 世界模型三范式」+ §1.44 WAM 知行鸿沟第三范式候选新增 VisualPatchWorld(v34 §1.44 WAM 知行鸿沟 1 范式 + BadWAM → 第三范式 神经预测器 + 物理引擎 + 代码世界模型)+ §1.45 frontier lab 立标 §6 行业升级 第 4 例续立 安全协作(OWASP ASI + HF rogue agent + Anthropic 密码学 → Cyber-Capable = frontier lab × AI 平台层 安全协作 第 4 例续立)+ §3.4 T110 候选新增 10 + T117 候选延展
反方 / 风险 (A) Agent Retrieval Bench 四任务相关性标定依赖「agent 下一步需要什么」主观定义的可复现性需第三方独立验证(tom 7-30 0840 §1.1 Tom 判断 R3 中严重度)+ 与 SWE-bench Verified / SpecBench / PilotBench head-to-head 待核;(B) Cyber-Capable 五大漏洞类 vs OWASP Top 10 Agents 覆盖重叠度未披露 = 是否构成独立分类或互补(jay 7-30 1124 §增量 5 反方沿用)+ 「攻击面 + 防御清单 + 落地实现」Agent 安全三联立标层 = 需要 Weng Harness + Memora + SkillOpt + Cyber-Capable + OWASP ASI + microsoft/agent-governance-toolkit head-to-head 实证;(C) HANDBOOK.md 65 个企业员工手册风格任务在主流 agent 厂商(Claude Code / Codex CLI / Devin / Cline / Cursor / Windsurf)的指令遵循覆盖率量化待核(spark 7-30 agent-e1prep §3.3 Q105.14 候选新增)+ 与 Cyber-Capable vs OWASP ASI 三角对立标层饱和风险持续;(D) VisualPatchWorld work-queue 0.5 级低优先级 vs flyp multimodal-v34 B 旁证级 = 评级升级时机风险 + World Models 三范式与 Jim Fan「VLA 已死 · 世界动作模型接棒」立场 2.0 张力:WorldDiT 仍是「action model + minimal world head」,没有真正接 WAM 棒(flyp 7-30 0949 multimodal-v34 §3.3 反方 #55-#72 评级升级时机风险持续激活 第 5-7 日);(E) 4 件立标候选主分类为 agent 但跨邻接 evaluation / multimodal / systems / safety / rag 多主题,v34 coding-agents.md 收录边界需精确划定
建议归入节 §1.32 横切 52c 候选新增世界模型三范式 + §1.43 横切 80 第 13-15 件候选新增 + §1.44 WAM 知行鸿沟第三范式 + §1.45 §6 行业升级 第 4 例续立 + §2.3 评测表 23 行 + §2.6 第四十二 f/g 邻接补全 + 第四十三子节 + §3.4 T110/T117 候选延展 + §4.1 开放问题 候选新增 72-75 + §6 必读清单 第 153-156 条
重要边界 不要与 v34 §2.5 第十一阶段 Isolation-as-First-Class 混为同一件工作:Cyber-Capable = 攻击面 + containment 评估 vs Isolation = agent 安全 survey anchor 5 边界 = 攻击面 vs survey anchor 不同对象;不要与 v34 §2.6 第四十二子节 SDB arXiv:2605.20173 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约形式化,HANDBOOK.md = 长期政策约束 Agent 行为一致性 = 边界形式化 vs 政策约束 不同对象;不要与 v34 §1.44 WAM 知行鸿沟立标沿 v33 §2.1 BadWAM 混为同一件工作:BadWAM = 反方证据 + WAM 知行鸿沟,VisualPatchWorld = 第三范式 = 反方证据 vs 第三范式 不同对象

增量 2 · 🔴 P0 · Metis Memory Foundation Model arXiv:2607.26760 立基础新立 = 首个 memory foundation model = agent memory 内化到基础模型本体 = v34 §2.4 上下文管理 范式五路线对立 第六路线候选 「native memory in foundation model」立基础栖候选升级

字段 内容
来源 stephen 7-30 1025 ai-industry-v32 §增量 4 沿用 7-30 new + paper_cards/658-2607-26760.md 7-30 已建卡(主分类 agent / 形态 method · 原文 http://arxiv.org/abs/2607.26760v1)+ flyp 7-30 2250 memoryagentbench-critical-read §「Metis 等 2026-07 多模态 memory 工作」沿用
arXiv 号 arXiv:2607.26760v1(7-30 paper_cards/658 已建卡)
一句话 Metis Memory Foundation Model:首个 memory foundation model = agent memory 内化到基础模型本体 · 与 multimodal foundation models + large reasoning models 并列 · 形式化 native memory = ① 持久且动态演化的内存状态(persistent and dynamically evolving memory state within the model)② 通过持续查询过往记忆进行推理(continuously querying past memories for reasoning)· agent memory 路线拐点 = 从「外部模块」(MemGPT / AWM / MemoryBank / MemoryAgentBench / δ-mem / Memora)升级到「原生模型能力」(Metis) = §2.4 上下文管理 范式五路线对立 第六路线候选 = 「native memory in foundation model」立基础栖候选升级
v34 第十一轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness + v34 §1.43 横切 80 Why Agents Fail + v34 §1.45 frontier lab 立标 + v34 §2.2 模型与基座 沿用 + v34 §2.4 上下文管理 范式五路线对立 + v34 §3.1 共识 43 + v34 §3.4 T110/T113/T117 候选延展 同源;§1.33c 横切 53c 学术 Harness 维度 4 候选新增 Metis native memory(v34 维度 1 Molt/OpenForgeRL + 维度 2 Weng + 维度 3 Memora/SkillOpt → 维度 4 Metis native memory)+ §1.45 frontier lab 立标 主线 ② Agentic RAG + 主线 ⑤ Application-layer Reliability 候选池「评测方法学反思 v40 15-16 → v41 16-17 件套补完 第 4 例」+ §2.2 模型与基座 native memory 立基础栖候选升级 + §2.4 上下文管理 范式五路线对立 第六路线候选新增 native memory in foundation model(v34 五路线对立 = 向量索引 / 完整日志 / 生命周期 / 文件系统 / 可观测性 → 第六路线 = native memory = 内化到基础模型本体)+ §3.1 共识 50 候选新增
反方 / 风险 (A) Metis native memory vs MemoryAgentBench 四能力 AR/TTL/LRU/CR head-to-head 量化对照未公开 · LongMemEval 92% vs LongMemEval-V2 直接对比 MemoryAgentBench 285K token / 2071 问题规模 vs Metis = 待核;(B) Metis vs Memory Survey Du (2026)write-manage-read loop + 三维分类 = Memory Survey 把 multimodal embodied memory 列入 open challenges 与 Metis 多模态 memory 工作脱节 = v34 §4.1 开放问题 候选新增 76;(C) Metis vs MSR Memora 谐波记忆(外部模块 vs native foundation model = 不同范式 head-to-head 待核)+ Metis vs MSR SkillOpt Skills as trainable parameters(memory vs skill 训练过程邻接 = 待核);(D) Metis 与 frontier lab 模型本体首位立标邻接:与 Claude Mythos 5 / Opus 5 / Sonnet 5 / Fable 5 = 4 模型矩阵 + Kimi K3 主权开源 2.0 立标级 = 模型本体首位立标 第 15 阈值 邻接 = native memory 路线分水岭?;(E) arXiv:2607.26760 v1 完整实验 + 评测方法学 + 与 external memory module head-to-head 实证 待核
建议归入节 §1.33c 横切 53c 学术 Harness 维度 4 候选新增 Metis native memory + §1.45 frontier lab 立标 主线 ② Agentic RAG + 主线 ⑤ Application-layer Reliability 候选池「评测方法学反思 第 4 例」+ §2.2 模型与基座 native memory 立基础栖候选升级 + §2.4 上下文管理 范式五路线对立 第六路线候选新增 + §3.1 共识 50 候选新增 + §3.4 T117 候选延展 + §4.1 开放问题 候选新增 76-77 + §6 必读清单 arXiv:2607.26760 第 157 条
重要边界 不要与 v34 §2.4 上下文管理五路线对立 混为同一件工作:五路线对立 = 完整日志 + lifecycle + 可观测性 + 文件系统 + 语义索引,Metis = native memory in foundation model = 五路线 vs 第六路线 = 外部模块 vs 内化本体 不同对象;不要与 v34 §2.4 MSR Memora 谐波记忆 混为同一件工作:Memora = 双频段谐波记忆 + 时序解耦(外部模块),Metis = native memory foundation model(内化) = 外部模块 vs 内化 不同对象;不要与 v34 §2.4 δ-mem steering attention 混为同一件工作:δ-mem = 8×8 矩阵在 Transformer 选中层注入 + steering attention 存储对话历史(外部 adapter),Metis = native memory in foundation model(内化) = 外部 adapter vs 内化 不同对象

增量 3 · 🔴 P0 · SkillRise Cross-Task Skill Evolution arXiv:2607.26784 + Grading the Narrators arXiv:2607.24117 + StealthBench arXiv:2607.26314 = 「跨任务技能 RL + 多 Agent provenance + 自主 offensive-security operational stealth」三件立基础 + CAST + Memory Survey

字段 内容
来源 SkillRise arXiv:2607.26784:paper_cards/659-2607-26784.md 7-30 已建卡(主分类 agent / 形态 method)+ stephen 7-30 1025 ai-industry-v32 §增量 4(沿用 7-30 new · 邻接 SkillOpt Agent Skills 可训练参数)+ jay 7-30 1004 rss-msr-blog;Grading the Narrators arXiv:2607.24117:paper_cards/665-2607-24117.md 7-30 已建卡(主分类 agent / 形态 method · Isnad-Rijal 框架);StealthBench arXiv:2607.26314:paper_cards/664-2607-26314.md 7-30 已建卡(主分类 agent / 形态 benchmark · 6 OPSEC 维度 · 11 hand-verified OPSEC incidents)+ Cyber-Capable AI Agents 邻接补全;CAST arXiv:2607.25308:paper_cards/662-2607-25308.md 7-30 已建卡(主分类 agent / 形态 method · Game Solvers as Turn-Level Teachers);Memory Survey arXiv:2603.07670 Du (2026):flyp 7-30 2250 memoryagentbench-critical-read 沿用
arXiv 号 arXiv:2607.26784 SkillRise / arXiv:2607.24117 Grading the Narrators / arXiv:2607.26314 StealthBench / arXiv:2607.25308 CAST / arXiv:2603.07670 Memory Survey(5 件 paper_cards 4 件已建卡 + 1 件 flyp critical-read 沿用)
一句话 5 件立基础:SkillRise = 跨任务技能演化的统一 RL 框架 · 把相关实例组织成渐进挑战序列 · 用单一策略在任务学习与跨任务技能提取之间交替 = §2.4 后训练 第 19 件候选 + 与 SkillOpt 邻接 = 「跨任务技能学习 vs 单任务重复尝试」立基础 ② Grading the Narrators = 多 Agent 知识系统的声明级 provenance · Isnad-Rijal 框架 · 评估每个领域 transmit 信度 · 完整性语义 · 转换类型聚合 · 解耦内容批评 · serve/review/quarantine 路由 = Agent 知识 provenance + 引用 + 信任评估 立基础 ③ StealthBench = 自主 offensive-security Agent operational stealth 评测 · 6 OPSEC 维度 · 11 hand-verified OPSEC incidents from real-world APT reports = Cyber-Capable containment 邻接补全 ④ CAST = Game Solvers as Turn-Level Teachers for LLM Agents · RL with Verifiable Rewards(RLVR)长 horizon 游戏 + 稀疏最终奖励 + 转向层级信用分配 + solver state value 作为转向级教师信号 · Credit Assignment from Solver Teachers = §2.4 后训练 第 20 件候选 ⑤ Memory Survey Du (2026) = write-manage-read loop + 三维分类 temporal scope × representational substrate × control policy · 5 类机制并列 · multimodal embodied memory 列入 open challenges = 索引型综述
v34 第十一轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness + v34 §1.43 横切 80 Why Agents Fail + v34 §2.4 后训练 18 件候选 + v34 §2.5 86 节点 + v34 §2.6 42 子节立标级 + v34 §3.4 T110/T117 候选延展 同源;§2.4 后训练 19-20 件候选新增 SkillRise + CAST + §2.4 多智能体协作 第 63 节点候选新增 Grading the Narrators + §2.4 上下文管理 范式五路线对立 索引型综述 Memory Survey + §2.5 88 节点候选新增 StealthBench + §2.6 第四十四子节候选新增 Grading the Narrators + §1.33c 横切 53c 学术 Harness 维度 4 候选新增 SkillRise + §1.43 横切 80 第 16 件候选新增 offensive-security Agent operational stealth + §3.4 T117 候选延展 多模态 embodied memory 立基础
反方 / 风险 (A) SkillRise vs MSR SkillOpt:跨任务技能学习 vs skills 编辑转化为训练过程 = 不同对象 vs 邻接 head-to-head 待核;(B) Grading the Narrators 与 truth discovery / reputation systems / Multi-Agent RAG head-to-head 待核;(C) StealthBench 11 hand-verified OPSEC incidents vs Cyber-Capable 五大漏洞类 head-to-head 待核 + 与 OWASP ASI 防御清单 + microsoft/agent-governance-toolkit 落地实现 三角互补性 待核;(D) CAST RLVR + 转向层级信用分配 + solver state value 与 v34 §2.4 后训练 18 件候选 + AREX + Sample-Efficient Experience Distillation head-to-head 待核;(E) Memory Survey Du (2026)单作者独立综述 + 选择性偏差风险大 = 需要交叉对比《Memory for Large Language Models》(arXiv 2607.25380)+ Preprints.org(202603.0359)
建议归入节 §1.33c 横切 53c 学术 Harness 维度 4 候选新增 SkillRise + §1.43 横切 80 第 16 件 + §2.4 后训练 19-20 件候选 + §2.4 多智能体协作 第 63 节点 Grading the Narrators + §2.4 上下文管理 范式五路线对立 索引型综述 Memory Survey + §2.5 88 节点 StealthBench + §2.6 第四十四子节 + §3.1 共识 51 候选新增 + §3.4 T110/T117 候选延展 + §4.1 开放问题 候选新增 78-80 + §6 必读清单 第 158-162 条
重要边界 不要与 v34 §2.4 MSR SkillOpt 混为同一件工作:SkillOpt = skills 编辑转化为训练过程(单任务),SkillRise = 跨任务技能演化的统一 RL 框架 = 单任务 vs 跨任务 不同对象;不要与 v34 §2.5 第十一阶段 Isolation 混为同一件工作:StealthBench = offensive-security operational stealth 评测 vs Isolation = agent 安全 survey anchor 5 边界 = 评测 vs survey anchor 不同对象;不要与 v34 §3.4 T110 长 horizon agent 范式转折立标集群 9 件 混为同一件工作:CAST = RLVR + 转向层级信用分配 vs T110 = 长 horizon + LH-Terminal-Bench + AREX + ACM + OpenForgeRL + SkillOpt/Memora + ReOPD + Experience Distillation + SDB = 信用分配 vs 长 horizon 不同对象

增量 4 · 🔴 P0 沿用升级 · Kimi K3 arXiv:2607.24653 + Lilian Weng Harness Engineering 学术框架 + MSR Memora/SkillOpt + Aurora 1.5 + SymCrypt Rust + Flint = 学术 Harness 4 维度叠加饱和触发 v36 维度收敛判定候选 + 主权开源 2.0 立标栖 立基础栖候选升级

字段 内容
来源 stephen 7-30 1025 ai-industry-v32 §增量 4-5 ⭐⭐⭐⭐⭐(Lilian Weng Harness Engineering = RSI + 三大 Harness 设计模式 + ACE + MCE + Harness = AI 的操作系统 · P0 立标)+ §增量 5(Microsoft Research 4 项 P0 立标 = SymCrypt Rust 密码学验证 + Aurora 1.5 天气地球系统基础模型 22 变量 + Flint 可视化语言 AI 时代 + SkillOpt + Memora)= 「学术第四维完整立标级饱和」 + jay 7-30 1003 rss-lilian-weng + jay 7-30 1004 rss-msr-blog + stephen 7-30 1245 noon 协调棒 §一第 4 段 + jay 7-30 1124 engineering-v40 增量 1(MCP 学术立标补全 第 4 例)+ Kimi K3 沿用 stephen 7-29 1025 ai-industry-v31 + 7-30 1025 ai-industry-v32 + jay 7-30 1055 five-category-briefing #3 + spark 7-30 1004 gradient-flow + simon willison 7-28 1001
arXiv 号 arXiv:2607.24653 Kimi K3 + arXiv:2510.04618 ACE + arXiv:2601.21557 MCE(Lilian Weng 2026-07-04 blog 引用)
一句话 Kimi K3 + Weng Harness + MSR Memora/SkillOpt + Aurora 1.5 + SymCrypt Rust + Flint = 学术 Harness 4 维度叠加饱和 + 主权开源 2.0 立标栖 立基础栖候选升级 + 学术第四维完整立标级饱和: 1) Lilian Weng Harness Engineering for Self-Improvement(2026-07-04)= 学术 Harness 维度 2 RSI + 三大 Harness 设计模式:Workflow Automation(Karpathy autoresearch)② File System as Persistent MemorySub-agent & Backend Jobs;ACE(Agentic Context Engineering) = context = evolving playbook · Generator + Reflector + Curator · itemized bullets(id + description)· 不做全量 rewrite · arXiv:2510.04618(2025-10 · Zhang et al.);MCE(Meta Context Engineering) = 双层优化:内层 c_s^* = argmax_c J_train(c_s; s)(给定 skill 找最优 context)+ 外层 s^* = argmax_s J_val(c_s^*)(找最优 skill)· Skill = context function pair c_s = (ρ_s, F_s) · arXiv:2601.21557(2026-01 · Ye et al.);Harness = AI 的操作系统 · Harness 优化演进链:instruction prompts → structured context → workflow → harness code → optimizer code;2) MSR Memora = 双频段谐波记忆 + 时序解耦 = Weng 理论层的工程实现层;3) MSR SkillOpt = Skills as trainable parameters = skills 编辑转化为训练过程;4) MSR Aurora 1.5 = 天气地球系统基础模型 · 22 变量 = frontier lab × 地球科学 第八维;5) MSR SymCrypt Rust = 密码学符号验证 · Rust 实现;6) MSR Flint = AI 时代的可视化语言 = frontier lab × 可视化语言 第九维;7) Kimi K3 arXiv:2607.24653 首个 arXiv 编号正式披露 = 7-29 263▲ 单日 +121 暴增 85% 登顶 = 「HF 权重 1.56TB 沿用级」→「arXiv:2607.24653 立基础级」升档 + 12 实例同步承接升级主权开源 2.0 立标级(模型规格:2.8T MoE · MXFP4 权重 + MXFP8 激活 · HF 1.56TB · KDA + AttnRes + Stable LatentMoE · Coding/Agentic SOTA)
v34 第十一轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness + v34 §1.43 横切 80 Why Agents Fail + v34 §1.45 frontier lab 立标 第 8 栖 Kimi K3 + v34 §2.1 Harness 学术化 11 阶段 + v34 §2.2 模型与基座 Kimi K3 + v34 §2.4 后训练 18 件 + v34 §2.5 86 节点 + v34 §3.1 共识 43 + v34 §3.4 T110/T113/T117 候选延展 同源;§1.33c 横切 53c 学术 Harness 维度补全(v34 维度 1 Molt/OpenForgeRL + v35 维度 2 Weng + v35 维度 3 Memora/SkillOpt + v35 维度 4 Metis native memory + SkillRise + Aurora 1.5 + SymCrypt Rust + Flint = 学术 Harness 4-5 维度叠加饱和触发 v36 维度收敛判定候选)+ §1.43 横切 80 第 12-14 件候选新增「Harness = 形式化边界 + 操作系统类比 + 三联设计模式」+ §1.45 frontier lab 立标续立 第 8 栖栖候选升级 立基础栖候选升级 + §2.1 Harness 学术化 第十二阶段 长上下文 agent 评测 anchor 邻接 + §2.2 记忆与上下文工程 61-62 节点候选新增 + §2.4 后训练 Agentic RL 训练栈 19 件候选新增 + §2.5 运行时与基础设施 87-89 节点候选新增 + §3.1 共识 47 候选新增 + §3.4 T110/T113/T117 候选延展
反方 / 风险 (A) Lilian Weng Harness Engineering 是否引入新方法论 vs 仅「Harness Engineering」概念工程化 + RSI 自我改进 vs AREX arXiv:2607.21461 BAAI 递归自我改进 deep research agent 关系(head-to-head 对照)待核;(B) ACE/MCE 实战细节 = itemized bullets id + description 不做全量 rewrite 稳定性 vs full rewrite head-to-head 实证未公开 + MCE 双层优化 convergence 保证 待核;(C) MSR Memora vs Memory 频段架构 vs MemGPT 双时态知识图谱 vs Zep 三者关系 待核;(D) MSR SkillOpt vs Lilian Weng Harness Skill = context function pair c_s = (ρ_s, F_s) 互映 vs SDB §2.6 第四十二子节 SkillOpt 互映 待核;(E) Weng Harness = AI 的操作系统类比与 SDHK arXiv:2606.23449 AOHP / LoCoBench-Agent arXiv:2511.13998 三者关系 待核;(F) Weng Harness Engineering 学术框架 paper_card 仍未建(stephen 7-29 1245 + 2245 + 7-30 1245 + 2245 警示)= pipeline 漏斗节点;(G) 学术 Harness 4 维度叠加饱和触发 v36 维度收敛判定候选:v34 维度 1 Molt/OpenForgeRL + v35 维度 2 Weng + v35 维度 3 Memora/SkillOpt + v35 维度 4 Metis native memory = 学术 Harness 4 维度叠加饱和 = 是否触发 v36 维度收敛判定;(H) MSR Aurora 1.5 vs Anthropic / Google / DeepMind 地球科学基础模型(Google DeepMind GraphCast + Aurora 与 Anthropic Claude climate = 对比 待核);(I) MSR SymCrypt Rust vs Anthropic 密码学弱点发现 + Mythos Preview + HF 7-26 OpenAI rogue agent = 跨 lab 密码学立体验证立基础 = frontier lab × 密码学 第 8 维立基础;(J) Kimi K3 Benchmark 数据:官方声称 Coding/Agentic SOTA 但截至 2026-07-30 第三方独立 head-to-head SWE-bench Verified + Terminal-Bench 2.1 + BenchLM weighted 量化对照尚未完成 = 建议在知识库中标注「官方数据,待外部 benchmark 验证」;(K) Kimi K3 vLLM/SGLang 官方支持时间线待核实;(L) MXFP4/MXFP8 第 5 量化路线候选 vs INT8/INT4 本质区别:MoE 稀疏激活特性的定制化量化格式 工程意义 待核
建议归入节 §1.33c 横切 53c 学术 Harness 维度补全 Lilian Weng + §1.43 横切 80 第 12-14 件 + §1.45 frontier lab 立标续立 第 8 栖栖候选升级 立基础栖 + §2.1 Harness 学术化 第十二阶段 邻接 + §2.2 记忆与上下文工程 61-62 节点 + §2.4 后训练 Agentic RL 训练栈 19 件 + §2.5 运行时与基础设施 87-89 节点 + §3.1 共识 47 候选新增 + §3.4 T110/T113/T117 候选延展 + §4.1 开放问题 候选新增 65-67 + §6 必读清单 第 163-167 条
重要边界 不要与 v34 §1.33c 横切 53c 商业 Harness 9 件混为同一件工作:商业 Harness = MAF 1.0 + LangGraph 1.0 + Claude Agent SDK + CrewAI 1.14 + LlamaIndex Workflows 1.0 + Pydantic AI V2 + Kurat 1T vertical LLM + 1000+ JD 量化 + CSDN Agent 4 范式,Weng Harness Engineering = 学术 Harness 维度 2 RSI + ACE + MCE = 商业 vs 学术 不同对象;不要与 v34 §2.5 OpenForgeRL arXiv:2607.21557 + AREX arXiv:2607.21461 + Hybrid 混为同一件工作:OpenForgeRL + AREX = 生产侧 + 训练侧,Weng Harness = 学术框架 = 学术 vs 训练/生产 不同对象;不要与 v34 §2.4 Markdown Memory Paradigm 文件系统即上下文 混为同一件工作:Markdown Memory = 工业级 Agent 厂商记忆原语,Weng File System as Persistent Memory = 学术 Harness 三联设计模式之一 = 工业 vs 学术 不同对象

增量 5 · 🔴 P0 行业立标 · Anthropic 7-30 NEW Mythos Preview AES Möbius Bridge 思维链 + Project Glasswing 守护全球软件安全 + HF 7-29「Frontier Lab Agent 入侵剖析」第 7 日连续披露窗口升级 + Microsoft SymCrypt Rust 密码学验证 = frontier lab × 安全工程 第四次协同披露 + 跨 lab 密码学立体验证立基础

字段 内容
来源 Anthropic 7-30 NEW Mythos Preview 在发现 AES Möbius Bridge 中的思维链:stephen 7-30 1008 news-yt-anthropic + stephen 7-30 1006 news-anthropic-news + stephen 7-30 1025 ai-industry-v32 §增量 8 ⭐⭐⭐⭐(沿用 7-29「使用 Claude 发现密码学弱点」+ 「我们对开放权重模型的立场」)+ Anthropic Project Glasswing 守护全球软件安全:stephen 7-30 1008 YT(Anthropic Project Glasswing = 守护全球软件安全)+ HF 7-29 NEW「Frontier Lab Agent 入侵剖析」第 7 日连续披露窗口升级:stephen 7-30 1006 news-hf-blog + stephen 7-30 1025 ai-industry-v32 §增量 8(第 7 日连续披露窗口升级)+ Microsoft SymCrypt Rust 密码学验证:jay 7-30 1004 rss-msr-blog + stephen 7-30 1025 ai-industry-v32 §增量 5 ⭐⭐⭐⭐⭐(MSR 4 项 P0 立标)
arXiv 号 无(Anthropic 平台层文档 + Microsoft SymCrypt Rust 密码学符号验证 + HF 7-29 NEW「Frontier Lab Agent 入侵剖析」深度分析)
一句话 Anthropic 7-30 NEW Mythos Preview 在发现 AES Möbius Bridge 中的思维链(沿用 7-29「使用 Claude 发现密码学弱点」+ 「我们对开放权重模型的立场」)+ Anthropic Project Glasswing 守护全球软件安全 + HF blog 7-29 NEW「Frontier Lab Agent 入侵剖析」第 7 日连续披露窗口升级 + Microsoft SymCrypt Rust 密码学验证 = frontier lab × 安全工程 第四次协同披露 + 跨 lab 密码学立体验证立基础 = 评测 → 系统卡 → 评论 → 红队 → 密码学弱点发现 → 跨 lab 密码学立体验证 → HF 入侵剖析连续披露 7 天 第 5 栖验证 续立 + §1.45 frontier lab 立标 §6 行业升级 第 5-6 件合并 + §2.5 AgentCI MCP 安全立标 邻接补全
v34 第十一轮脉络关系 与 v34 §1.41 横切 60-66 v23 七件主轴 + v34 §1.45 五向合流 + v34 §2.5 第十一阶段 Isolation-as-First-Class + v34 §2.103 段尾「评论层长尾 7-25~7-30 持续 8-10 媒体续立」+ v34 §3.1 共识 35 + v34 §4.1 开放问题 47 同源;§1.41 横切 60-66 v23 十件主轴持续沿用(Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot + Mythos Preview AES Möbius Bridge 思维链 = 10 件 frontier model / 平台层立标)+ §1.45 frontier lab 立标 §6 行业升级 候选新增 5-6 件 = Anthropic Mythos Preview AES Möbius Bridge 思维链 + Project Glasswing + HF 7-29 NEW「Frontier Lab Agent 入侵剖析」第 7 日连续披露窗口升级 + Microsoft SymCrypt Rust 密码学验证 + Managed Agents Gemini API 3.6 Flash + TLDR AI 7-28 头条三件 + Dario 开源权重立场 vs 监管打压指控 公开对峙 + §2.103 段尾「评论层长尾 7-25~7-30 持续 8-10 媒体续立」标注 + §2.5 第十一阶段 Isolation-as-First-Class 邻接补全 + §3.1 共识 49 候选新增 frontier lab × AI 平台层安全协作 第 4 例
反方 / 风险 (A) Anthropic Mythos Preview「AES Möbius Bridge 思维链」方法学 vs 现有密码学评估方法学(head-to-head)对比 待核;(B) Anthropic Project Glasswing「守护全球软件安全」目标定义边界 = 与 OWASP ASI / microsoft/agent-governance-toolkit / Cyber-Capable AI Agents containment head-to-head 待核;(C) HF blog 7-29 NEW「Frontier Lab Agent 入侵剖析」第 7 日连续披露窗口升级 vs HF 7-26 OpenAI rogue agent 入侵事件 vs Oracle 4 RCE CVE vs OWASP ASI vs HF 7 月安全事故 同源/异源关系 待核;(D) Microsoft SymCrypt Rust 密码学验证 vs OpenSSL / libsodium / BoringSSL 对比 待核;(E) Boris Cherny「Opus 5 最难被 prompt 注入」评论原文出处 + Opus 5 PI evals / red team 完整版本 待核;(F) 「评测 → 系统卡 → 评论 → 红队 → 密码学弱点发现 → 跨 lab 密码学立体验证 → HF 入侵剖析连续披露 7 天」7 栖验证 vs SDB §2.6 第四十二子节契约 关系 待核
建议归入节 §1.41 横切 60-66 v23 十件主轴持续沿用 + §1.45 frontier lab 立标 §6 行业升级 候选新增 5-6 件 + §2.103 段尾「评论层长尾 7-25~7-30 持续 8-10 媒体续立」标注 + §2.5 第十一阶段 Isolation-as-First-Class 邻接补全 + §2.6 评测第 7 阶邻接补全 + §3.1 共识 49 候选新增 + §4.1 开放问题 候选新增 81-83
重要边界 不要与 v34 §2.5 HF 2026-07 安全入侵事件 混为同一件工作:HF 7 月安全事故 = 17,000+ 离散操作 + 跨沙箱群 + 自迁移 C2,HF 7-29 NEW「Frontier Lab Agent 入侵剖析」= 第 7 日连续披露窗口升级 = HF 7 月安全事故 vs OpenAI rogue agent 入侵 不同对象;不要与 v34 §2.5 Oracle 4 RCE CVE 混为同一件工作:Oracle 4 RCE CVE = PraisonAI + Langroid + Crawl4AI + Ruflo = agent 框架 CVE,OpenAI rogue agent = frontier lab 入侵 = CVE vs 入侵 不同对象;不要与 v34 §1.45 frontier lab 立标 第 7 栖 Anthropic 经济测度产品化 混为同一件工作:Anthropic 经济测度 = 测度产品化 + 治理研究,Anthropic 7-30 NEW Mythos Preview + Project Glasswing = 评测 + 立场 = 测度 vs 评测 + 立场 不同对象;不要与增量 1 增量 Cyber-Capable AI Agents arXiv:2607.25379v1 混为同一件工作:Cyber-Capable = 学术综述 + 五大漏洞类 + containment 评估框架,Anthropic Mythos Preview + Project Glasswing + Microsoft SymCrypt Rust = frontier lab 实战层 + 跨 lab 立体验证立基础 = 学术综述 vs frontier lab 实战层 不同对象

增量 6 · 🔴 P0 沿用升级 · GLM-5.2 arXiv:2602.15763 + Nathan Lambert「step change for open agents」+ 「one way door for AI progress」+ flyp 7-30 1550 critical-read 评级 A- 推荐入库 = 开源 agent 坐标系下的 step change 成立

字段 内容
来源 flyp 7-30 1550 GLM-5-2-step-change-open-agent-critical-read 17.8KB 短审稿 + stephen 7-30 1025 ai-industry-v32 沿用 + jay 7-30 1007 rss-yt-fireship(Anthropic vs 独立开发者 / Kimi K3 2.8T 沿用)+ spark 7-30 1000 rss-gradient-flow(Kimi K3 + GLM 5.2 + Gemini 3.6 Flash 三款前沿级模型 沿用)+ simon willison 7-30 1000
arXiv 号 arXiv:2602.15763(GLM-5 · from Vibe Coding to Agentic Engineering · 主报告)+ 副报告 arXiv:2603.12201(IndexCache · Accelerating Sparse Attention via Cross-Layer Index Reuse · IndexShare 的更早理论化版本)
一句话 GLM-5 / GLM-5.2(arXiv:2602.15763 + 官方 blog/HF model card)短审稿:Nathan Lambert(Interconnects)罕见评级 = "step change for open agents" / "one way door for AI progress" — 与 DeepSeek R1 / Kimi K2 同档表述,这是开源 agent 第一次被头部 RLHF 评论者明确放进 "DeepSeek Moment" 级别;核心贡献:① DSA(DeepSeek Sparse Attention)首次在中文旗舰级 MoE 上落地 — 基于 DeepSeek-V3.2 的 fine-grained top-k 选择,把 attention 计算从 O(L²) 降到 O(L·k),128K 上下文下基本不丢 NIAH 准确率(MQ-NIAH-128k 100、MV-NIAH-128k 97、SQuAD-128k 86 vs MLA 100/95.5/79.7)② IndexShare(GLM-5.2 新增):每 4 层 DSA 复用同一个 indexer,把 1M context 下 per-token FLOPs 再降 2.9× — 这是 "1M token 可用" 而不是 "spec-sheet 数字" 的关键 ③ "Vibe Coding → Agentic Engineering" 范式跳变:报告标题本身就是主张,区分两代范式 — prompt 级代码生成 vs 长 horizon agent 端到端完成工程任务 ④ 异步 RL + 多 agent 训练栈(SLIME 框架):支持 tool-use + 多 agent 协作 + 异步 rollout ⑤ 1M 上下文窗口 + 显著领先开源的 agent benchmark:AIME 2026 99.2(开源第一)/ DeepSWE 18→46.2(HLE w/ Tools 54.7 接近 Claude Opus 4.8 52.2)/ SWE-bench Pro 62.1(开源第一)/ Terminal-Bench 63.5→81.0/ ProgramBench 50.9→63.7 — = 开源 agent 坐标系下的 step change 成立 + LOCA-bench 「context rot」vs GLM-5.2 IndexShare/DSA「1M token 可用」= flyP 长上下文主题页两条腿
v34 第十一轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness + v34 §1.43 横切 80 Why Agents Fail + v34 §1.45 frontier lab 立标 第 7 栖 + v34 §2.2 模型与基座 沿用 + v34 §2.3 评测表 22 行 + v34 §2.4 后训练 18 件 + 上下文管理五路线对立 + v34 §2.5 安全契约 11 阶 + 86 节点 + v34 §2.6 42 子节立标级 + v34 §3.1 共识 43 + v34 §3.2 争议 36 + v34 §3.4 T110/T117 候选延展 同源;§2.2 模型与基座 GLM-5/GLM-5.2 沿用升级 + §1.45 frontier lab 立标续立 第 9 栖候选 立基础栖候选升级(v34 §1.45 第 8 栖 Kimi K3 + 第 9 栖 GLM-5.2 = 主权开源立标栖 双联)+ §1.33c 横切 53c 主权开源维度立基础栖候选 + §2.3 评测表 22 行 arXiv 号 v33 已核证 沿用升级(SWE-bench Pro 62.1 + Terminal-Bench 81.0 + AIME 2026 99.2 + DeepSWE 46.2 + ProgramBench 63.7)+ §2.6 第四十五子节候选新增 GLM-5/GLM-5.2 flyp critical-read B+ 旁证级 + §3.1 共识 52 候选新增 step change for open agents 立基础
反方 / 风险 (A) GLM-5.2 Benchmark 数据:官方声称 Coding/Agentic SOTA 但截至 2026-07-30 第三方独立 head-to-head SWE-bench Verified + Terminal-Bench 2.1 + BenchLM weighted 量化对照尚未完成 = 建议在知识库中标注「官方数据,待外部 benchmark 验证」;(B) 「1M 可用」≠「1M 在所有任务都可用」:DSA 在 NIAH 类检索上不掉点,但在 HotpotQA-128k 上比 MLA 低 3.3 点 = 与 LOCA-bench "context rot" 论断是一致的开放问题;(C) 数据合规与版权:训练数据细节报告未披露完整清单;(D) 5.x 版本号频繁跳:5 → 5.1 → 5.2 在 6 个月内完成 3 个版本 = 外部复现者需注意 checkpoint 与 SLIME 版本绑定;HF model card 与 GitHub README 都未明确版本对应表(待补查);(E) 与 Opus 4.8 / GPT-5.5 仍有差距:SWE-bench Pro 落后 7 点、DeepSWE 落后 24 点;Nathan Lambert 的 "step change" 主要落在开源坐标系内,跨坐标系仍是 "close but not yet at the frontier";(F) RL 配方细节未公开:SLIME 框架本身开源,但 Z.ai 用于 5.2 的具体 RL 数据配比、reward shaping、tool rollout 长度上限等仍属内部 — 复现成本高;(G) GLM-5.2 arXiv:2602.15763 paper_card 仍未建 = pipeline 漏斗节点 7-30 截止前必须补建卡;(H) IndexShare 副报告 arXiv:2603.12201 IndexCache paper_card 待补
建议归入节 §1.33c 横切 53c 主权开源维度立基础栖候选 GLM-5/GLM-5.2 + §1.45 frontier lab 立标续立 第 9 栖候选 立基础栖候选升级 + §2.2 模型与基座 GLM-5/GLM-5.2 沿用升级 + §2.3 评测表 22 行 沿用升级 + §2.6 第四十五子节候选新增 + §3.1 共识 52 候选新增 + §3.4 T110/T113 候选延展 + §4.1 开放问题 候选新增 84 + §6 必读清单 arXiv:2602.15763 第 168 条
重要边界 不要与 v34 §2.2 模型与基座 Claude Sonnet 5/Opus 5/Fable 5/Mythos 5 4 模型矩阵 混为同一件工作:Sonnet 5/Opus 5/Fable 5/Mythos 5 = 4 模型矩阵 + frontier lab 商业立标,GLM-5/GLM-5.2 = 单模型 + 主权开源 + DSA + IndexShare + 1M context = 单模型开源 vs 商业模型矩阵 不同对象;不要与 v34 §2.2 模型与基座 Kimi K3 主权开源 2.0 立标级 混为同一件工作:Kimi K3 = 2.8T MoE + MXFP4 + MXFP8 + KDA + AttnRes + Stable LatentMoE,GLM-5.2 = 744B 总参 / 40B 激活 + DSA + IndexShare + 1M context = 不同模型 + 不同架构 + 不同路线 不同对象

增量 7 · 🟡 P0 沿用升级 · ReMemR1 v5 ICLR 2026 已接收 + MemoryAgentBench/LongMemEval ICLR 2026 + Memory Survey arXiv:2603.07670 + BeyondUncertainty + A New Role for Relevance + HiFi-UMI = 长上下文 / 记忆 / RAG 路由 6 件立基础

字段 内容
来源 ReMemR1 v5 ICLR 2026 已接收:flyp 7-30 0951 ReMemR1-v5-ICLR2026-deep-read 8.0KB 精读 · 评级 ★★★★★ · P1 入库主线候选(Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents · arXiv:2509.23040 v5 · github.com/syr-cn/ReMemR1);MemoryAgentBench/LongMemEval ICLR 2026:flyp 7-30 2250 memoryagentbench-critical-read 17.7KB(arXiv:2507.05257 v4 · github.com/HUST-AI-HYZ/MemoryAgentBench · 四能力框架 AR/TTL/LRU/CR);Memory Survey arXiv:2603.07670 Du (2026):flyp 7-30 2250 critical-read 沿用(write-manage-read loop + 三维分类);BeyondUncertainty:tom 7-30 0840 agent-rag-longcontext-radar #4 §1.3 ⭐⭐⭐(HF Daily 83▲ · verbalized confidence 路由检索 + 第三类 RAG 路由范式);A New Role for Relevance:tom 7-30 0840 #4 §1.4 ⭐⭐⭐⭐(HF Daily 83▲ · relevance 引导语料进入工作空间);HiFi-UMI:stephen 7-30 1025 ai-industry-v32 §增量 2(HF Daily 7-30 #1 134▲ · 高保真 UMI 数据学习可部署操控策略)
arXiv 号 arXiv:2509.23040 ReMemR1 v5 + arXiv:2507.05257 MemoryAgentBench/LongMemEval + arXiv:2603.07670 Memory Survey + arXiv:2607.25600v1 BeyondUncertainty + arXiv:2607.24223 A New Role for Relevance + arXiv:2607.25895 HiFi-UMI
一句话 6 件立基础:ReMemR1 v5 ICLR 2026 = 「Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents」= 状态空间扩展 callback-augmented state s_t = (m_t, q_t) · 多层奖励 RLMLR · 检索延迟 < 0.2% 时间开销 · 准确率提升 > 20% 错误率下降 = §2.4 上下文管理 范式五路线对立 第七路线候选 「callback-augmented memory state」立基础 ② MemoryAgentBench/LongMemEval ICLR 2026 = 四能力框架 AR/TTL/LRU/CR · 当前方法在四项能力上没有同时达标者 = §2.3 评测表 23 行候选新增 ③ Memory Survey Du (2026) = write-manage-read loop + 三维分类 + 5 类机制并列 · multimodal embodied memory 列入 open challenges = 索引型综述 ④ BeyondUncertainty = verbalized confidence 路由检索 · 第三类 RAG 路由范式 立标级候选 = §2.3 评测表 24 行候选新增 + §2.4 后训练 第 21 件候选 ⑤ A New Role for Relevance = relevance 引导语料进入工作空间而非仅 top-k 选择 = §2.3 评测表 25 行候选新增 ⑥ HiFi-UMI = 高保真 UMI 数据学习可部署操控策略 = §2.6 第四十六子节候选新增 VLA / 物理 AI 邻接 锚
v34 第十一轮脉络关系 与 v34 §1.33c 横切 53c 商业 Harness + v34 §1.43 横切 80 Why Agents Fail + v34 §1.45 frontier lab 立标 + v34 §2.3 评测表 22 行 + v34 §2.4 后训练 18 件 + 上下文管理五路线对立 + v34 §2.5 86 节点 + v34 §2.6 42 子节立标级 + v34 §3.1 共识 43 + v34 §3.2 争议 36 + v34 §3.4 T110/T117 候选延展 同源;§2.3 评测表 22 → 23-25 行候选新增 MemoryAgentBench + BeyondUncertainty + A New Role for Relevance + §2.4 上下文管理 范式五路线对立 第六/七路线候选新增 native memory + callback-augmented memory state + §2.4 后训练 19-21 件候选新增 BeyondUncertainty + §1.43 横切 80 第 17 件候选新增 RAG 路由第三范式 verbalized confidence + §2.6 第四十六子节候选新增 HiFi-UMI 邻接锚 VLA / 物理 AI + §3.1 共识 53 候选新增 + §3.4 T110/T117 候选延展
反方 / 风险 (A) ReMemR1 文档前提 vs 实际 benchmark 范围未在引言点出:方法声称面向「百万 token 量级、长文档多跳 QA」· 但正文 benchmark 仍是 HotpotQA / 2WikiMultiHopQA / MuSiQue / NarrativeQA / Qasper 等典型长上下文 QA = 不要直接复述「百万级」(flyp 7-30 0951 critical-read §2 ❗ P1);(B) ReMemR1 奖励公式只承诺「信息增益 + 检索有效性」,未在引言给出具体表达;(C) MemoryAgentBench 注入范式的偏差 = "inject once, query multiple times" 高效但偏离真实多轮对话分布;(D) MemoryAgentBench 多模态缺位 = 数据集全部文本 · 多模态 agent memory 评估仍是空白 = 与 Metis 多模态 memory 工作形成缺口互补;(E) Memory Survey Du (2026)单作者独立综述 + 一人撰写覆盖 ~4 年文献 + 选择性偏差风险大;(F) Memory Survey privacy/security 章节单薄 = 2026-07 之后已经出现 "Long-term memory in LLM agents is an attack surface with a long half-life" 这类新工作(Reddit r/mlops 引用),综述未覆盖;(G) BeyondUncertainty vs AAAI Subramanian Keyword Search vs Agent Retrieval Bench vs A New Role for Relevance 检索范式合并成熟待核;(H) HiFi-UMI single day 134▲ 暴增 = work-queue 7-30 Top 15 #1 评级升档 vs flyp multimodal-v34 B 旁证级 = 评级升级时机风险 + vs WorldDiT arXiv:2607.23909 paper_cards/632 B 旁证级 vs HiFi-UMI 134▲ 立标级 = 「飞 VS 暴增的方向对立」(WorldDiT 候补级 0.5 vs HiFi-UMI 134▲ 立标级)= 主线 7 垂直域 VLA / 物理 AI 飞轮候补升级 vs 立标并列;(I) ReMemR1 paper_card 待补 + MemoryAgentBench paper_card 待补 + Memory Survey paper_card 待补 + BeyondUncertainty paper_card/645 已建 + A New Role for Relevance paper_card/639 已建 + HiFi-UMI paper_card 待补 = 4 件 paper_card 待补 = pipeline 漏斗节点 7-30 截止前必须补建卡
建议归入节 §2.3 评测表 22 → 23-25 行候选新增 + §2.4 上下文管理 范式五路线对立 第六/七路线候选新增 + §2.4 后训练 19-21 件候选新增 BeyondUncertainty + §1.43 横切 80 第 17 件 + §2.6 第四十六子节候选新增 HiFi-UMI + §3.1 共识 53 候选新增 + §3.4 T110/T117 候选延展 + §4.1 开放问题 候选新增 85-89 + §6 必读清单 第 169-174 条
重要边界 不要与 v34 §2.4 上下文管理五路线对立 混为同一件工作:五路线对立 = 完整日志 + lifecycle + 可观测性 + 文件系统 + 语义索引,ReMemR1 = callback-augmented memory state 状态空间扩展 = 路线 vs 状态空间扩展 不同对象;不要与 v34 §2.4 Metis Memory Foundation Model 混为同一件工作:Metis = native memory in foundation model(内化),ReMemR1 = callback-augmented memory state(状态空间扩展 + RLMLR) = 内化 vs 状态空间扩展 不同对象;不要与 v34 §2.4 MSR Memora 谐波记忆 混为同一件工作:Memora = 双频段谐波记忆 + 时序解耦(外部模块),ReMemR1 = callback-augmented memory state(memorize while reading) = 谐波记忆 vs memorize while reading 不同对象;不要与 v34 §2.4 δ-mem steering attention 混为同一件工作:δ-mem = 8×8 矩阵 steering attention 存储对话历史(外部 adapter),ReMemR1 = callback-augmented memory state + RLMLR + MDP = 外部 adapter vs callback-augmented state 不同对象

增量 8 · 🟡 P1 监测 · 🔴 AAAI Subramanian arXiv:2602.23368v1 7 反方第二批 7-30 验证截止 = 今天就是截止日!强提醒 + spark 节奏反转后第 6 棒独立 E1 缺失窗口 + tom 7-30 inference-e1prep 连续 3 天缺漏模式化塌方首次识别

字段 内容
来源 AAAI Subramanian 7-30 截止:stephen 7-30 1245 noon + stephen 7-30 2245 evening §2.5 + spark-on-systems-risk 9:16 review 已列 + flyp 7-27 0950 B 级精读 3.5/5 + tom 7-30 0852 rag-e1prep-v49;spark 节奏反转第 6 棒独立 E1 缺失窗口:stephen 7-30 1245 noon + 2245 evening 警示 + spark 7-30 morning 仅 3 RSS 通稿 = ⚠️ spark 7-30 morning engineering/llm-infra/agent E1 连续 2 日未发布;tom 7-30 inference-e1prep 连续 3 天缺漏模式化塌方首次识别:tom 7-30 0840 agent-rag-longcontext-radar §「承接 7-30 inference-e1prep 连续 3 天缺漏模式化塌方首次识别」(7-28 19.4KB 存在 / 7-29 缺漏 / 7-30 缺漏 = 3 天连续缺漏 · 模式化塌方首次识别);spark-on-Tom E3 评审 P0 修正 3 件仍未完成:stephen 7-29 1245 noon + 7-29 2245 evening + 7-30 1245 noon + 7-30 2245 evening 警示(Learning on the Job 数字 1.6×/2.6×/22/84 补完 + δ-mem 评级 ⭐⭐⭐⭐ → ⭐⭐⭐ 降级 + Dadhich/Experience Distillation arXiv 编号 2 天未直查)
arXiv 号 arXiv:2602.23368v1 AAAI 2026 Subramanian(v34 §2.3 评测表 22 行 arXiv 号 v33 已核证)
一句话 🔴 AAAI Subramanian 7 反方第二批 7-30 验证截止 = 今天就是截止日!强提醒(stephen 7-30 1245 noon + 2245 evening + spark-on-systems-risk 9:16 review 已列 + flyp 7-27 0950 B 级 3.5/5):7 反方硬标签 ① 单一 LLM(Claude 3 Sonnet)对照可比性盲区 ⭐⭐⭐⭐ ② 200K context vs shell 工具边界不清——是"context stuffing + grep"而非 RAG 替代 ⭐⭐⭐⭐⭐(最高严重度) ③ 6 数据集非业界公认复杂/长上下文/多模态基准 ⭐⭐⭐ ④ Amazon Bedrock KB baseline 利益相关冲突 ⭐⭐⭐⭐ ⑤ Agent-as-retriever cost-benefit 未量化 ⭐⭐⭐ ⑥ 与混合方案(Agent + 向量库)未对照 ⭐⭐⭐⭐ ⑦ AAAI 2026 main vs industry track 区分不清 ⭐⭐ · 🔴 spark E1 节奏反转后第 6 棒独立 E1 缺失窗口(stephen 7-30 1245 noon + 2245 evening · spark 7-30 morning 仅 3 RSS 通稿 · 7-30 morning 无独立 E1 产出 · 工程化棒与 agent 棒连续 2 日未发布)+ 🔴 tom 7-30 inference-e1prep 连续 3 天缺漏模式化塌方首次识别(7-28 19.4KB 存在 / 7-29 缺漏 / 7-30 缺漏 = 3 天连续缺漏 = v34 §3.2 争议 + 沿用 7-29 反思棒 #33 物理动作 0/1 吸收 = 升级到第 3 代连续缺漏)+ spark-on-Tom E3 评审 P0 修正 3 件仍未完成(Learning on the Job 数字 1.6×/2.6×/22/84 补完 + δ-mem 评级 ⭐⭐⭐⭐ → ⭐⭐⭐ 降级 + Dadhich/Experience Distillation arXiv 编号 2 天未直查)
v34 第十一轮脉络关系 与 v34 §2.3 评测表 22 行 arXiv:2602.23368v1 + v34 §3.2 争议 36 + v34 §3.3 Q105.1-Q105.10 持续追踪 + v34 §4.1 开放问题 55 同源;v34 §3.2 争议 36 7 反方激活窗口 + §3.3 Q105.1-Q105.10 持续追踪 + v34 §4.1 开放问题 55 7 后续验证动作 7-29 ~ 8-15 截止日化:1) 「今天是 AAAI 2026 main vs industry track 区分 截止日」= v34 §3.2 争议 36 7 反方激活窗口(v34 已立 → v34 续立 + 4 验证截止日时间轴注脚 · 已过期未触发补强 = 补救策略待决 = 7-29 evening 14:30 已过 + 7-30 evening 22:45 已确认仍未触发 = 第二批截止今天就是截止日 = spark-on-systems-risk 9:16 review 已列);2) 「spark E1 节奏反转后第 6 棒独立 E1 缺失窗口」= v34 §4.1 开放问题 候选新增 90(沿用 7-29 noon 协调棒判断「4 日回落窗口」+ 7-29 evening「节奏反转第 5 棒」修正 + 7-30 morning 再次缺失 = 第 6 棒独立 E1 缺失窗口 = 7-30 evening 双 E1 完整恢复预备窗口);3) 「tom 7-30 inference-e1prep 连续 3 天缺漏模式化塌方首次识别」= v34 §4.1 开放问题 候选新增 91(7-28 19.4KB 存在 / 7-29 缺漏 / 7-30 缺漏 = 3 天连续缺漏 · 模式化塌方首次识别 = v34 §3.2 争议 + 沿用 7-29 反思棒 #33 物理动作 0/1 吸收 = 升级到第 3 代连续缺漏);4) 「spark-on-Tom E3 评审 P0 修正 3 件仍未完成」= v34 §4.1 开放问题 候选新增 92(Learning on the Job 数字 + δ-mem 评级降级 + Dadhich arXiv 编号直查 = 3 件 P0 修正仍未完成)
反方 / 风险 (A) arXiv:2602.23368v1 v1 PDF 全文细节 7-29 14:30 截止已过 + 7-30 截止日就是今天 仍未触发补强强提醒(已确认 v34 §3.2 争议 36 7 反方激活窗口 + 7-30 evening 22:45 已确认仍未触发);(B) shell 工具列表具体边界 200K context vs shell 工具边界不清 ⭐⭐⭐⭐⭐(最高严重度);(C) AAAI 2026 main vs industry track 区分 待核;(D) 不同 LLM 迁移性(论文仅 Claude 3 Sonnet,缺 GPT/Gemini/开源模型 head-to-head)+ 与混合方案(Agent + 向量库)未对照;(E) Amazon Bedrock KB baseline 利益相关冲突(Amazon Science 作者团 · Amazon Bedrock KB baseline 可能仅是 Bedrock KB vs Agentic,缺第三方向量库 baseline);(F) Agent-as-retriever cost-benefit 未量化;(G) 长上下文/多模态跨任务迁移性 待核;(H) GitHub 链接 7-30 仍未核证(jay 7-27 08:22 csdn-substack-rag-finetuning + tom 7-27 0850 + stephen 7-27 1023 + stephen 7-28 22:45 = 6 实例均未补 = 本场 7-30 仍未补);(I) 补救策略待决(已过期未触发补强窗口进入补救阶段 = 7-30 014:30 截止前补救已关闭 · 7-30 AAAI track 区分补救 + 7-31 不同 LLM 迁移性补救 + 8-15 长上下文/多模态补救 4 阶段补救);(J) spark E1 节奏反转后第 6 棒独立 E1 缺失窗口确认(沿用 7-29 noon 协调棒判断 4 日回落已纠正 + stephen 7-29 1245 + 2245 修正 → 7-30 morning 再次缺失 = 节奏反转第 6 棒独立 E1 缺失 = 需 7-30 evening 棒确认);(K) tom 7-30 inference-e1prep 连续 3 天缺漏模式化塌方首次识别 = 下棒 7-31 必须先校验本棒引用过的承接物理动作是否真生效(沿用 7-29 反思棒 #33 物理动作 + 7-29 反思棒 #34 缺漏日强制补 v2 重写)
建议归入节 §3.2 争议 36(v34 已立 → v34 续立 + 4 验证截止日时间轴注脚 + 已过期未触发补强 + 补救策略待决)+ §3.3 Q105.1-Q105.10(v34 候选新增 10 件 → v34 候选持续追踪)+ §4.1 开放问题 55(v34 已立 7 后续验证动作 → v34 续立 + 7-29 14:30 截止已过 + 7-30 截止日就是今天 仍未触发补强 + 补救策略待决)+ §4.1 开放问题 候选新增 90-92 spark 节奏反转第 6 棒 + tom inference-e1prep 连续 3 天缺漏 + spark-on-Tom E3 评审 P0 修正 3 件仍未完成 + §6 必读清单 沿用 arXiv:2602.23368v1 第 142 条
重要边界 不要与 v34 §2.6 第四十二子节 SDB arXiv:2605.20173 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约形式化,Subramanian = RAG 检索范式转折 = 边界形式化 vs 检索范式 不同对象;不要与 v34 §2.4 上下文管理五路线对立 混为同一件工作:五路线对立 = 完整日志 + lifecycle + 可观测性 + 文件系统 + 语义索引,Subramanian = 工具调用派检索 = 记忆/检索 vs 检索范式 不同对象;不要与 v34 §2.4 Markdown Memory Paradigm 文件系统即上下文 混为同一件工作:Markdown Memory = 工业级 Agent 厂商记忆原语,Subramanian = 学术 RAG 范式转折候选 = 记忆 vs 检索 不同对象;不要与 v34 §2.4 Beyond Relevance-Centric Retrieval arXiv:2607.19747 混为同一件工作:Beyond Relevance-Centric = 评分量规驱动 vs Subramanian = Agentic-as-retriever = 评分量规驱动 vs 工具调用派 不同 RAG 替代路径;不要与 v34 §2.4 LOCA-bench arXiv:2602.07962 7-29 新立 arXiv 混为同一件工作:LOCA-bench = 长上下文 agent 评测 anchor 新立,Subramanian = RAG 检索范式转折 = 评测 vs 检索范式 不同对象

二、值得警惕的矛盾或待核实说法

  1. AAAI Subramanian arXiv:2602.23368v1 7 反方第二批 7-30 验证截止 = 今天就是截止日!:v34 §3.2 争议 36 7 反方激活窗口 + 7-29 14:30 首批截止已过 24h + 7-30 第二批截止今天就是截止日 · 截止前补强窗口已关闭 · 后续补救策略待决 = 7-30 AAAI track 区分补救 + 7-31 不同 LLM 迁移性补救 + 8-15 长上下文/多模态补救 4 阶段补救(stephen 7-30 1245 noon + 2245 evening + spark-on-systems-risk 9:16 review 已列 强提醒 + flyp 7-27 0950 B 级 3.5/5)。
  2. spark 7-30 morning 节奏反转后第 6 棒独立 E1 缺失窗口确认(stephen 7-30 1245 noon + 2245 evening 警示 · spark 7-30 morning 仅 3 RSS 通稿 · 7-30 morning 无独立 engineering/llm-infra/agent E1 产出 · 继 7-29 evening「节奏反转第 5 棒(双 E1 完整恢复·修正 7-29 noon 协调棒判断)」后 7-30 morning 再次 E1 缺失 = 可能为夜间静默期效应 · 工程化棒与 agent 棒连续 2 日未发布 · 需 7-30 evening 棒确认)。
  3. tom 7-30 inference-e1prep 连续 3 天缺漏模式化塌方首次识别:7-28 19.4KB 存在 / 7-29 缺漏 / 7-30 缺漏 = 3 天连续缺漏 = v34 §3.2 争议 + 沿用 7-29 反思棒 #33 物理动作 0/1 吸收 = 升级到第 3 代连续缺漏 · 下棒 7-31 必须先校验本棒引用过的承接物理动作是否真生效(tom 7-30 0840 agent-rag-longcontext-radar v2 重写版首次识别)。
  4. spark-on-Tom E3 评审 P0 修正 3 件仍未完成(stephen 7-29 1245 noon + 7-29 2245 evening + 7-30 1245 noon + 7-30 2245 evening 警示):① Learning on the Job 数字 1.6×/2.6×/22/84 补完(v34 §2.2 第 60 节点「τ-bench 银行场景击败完整 RAG 基线」具体击败幅度量化待核)② δ-mem 评级 ⭐⭐⭐⭐ → ⭐⭐⭐ 降级(v32 §1.33c 候选降级 · 机制描述具体但独立可复现性未确认 · 加入「无 arXiv 编号 / 无第三方复现 / AlphaSignal 独家」明示)③ Dadhich/Experience Distillation arXiv 编号 2 天未直查(arXiv:2607.21503 Agentic Context Management(Gaurav Dadhich)+ arXiv:2607.21051 Sample-Efficient Learning from Agent Experience(Tom 单作者)2 天未在 rag.md/tom radar 中直查 arXiv 编号)。
  5. 学术 Harness 4 维度叠加饱和 vs 跨立标层 14 信号饱和触发 v36 维度收敛判定(v34 §3.1 共识 + §3.3 Q105 + §3.4 T 候选叠加饱和风险持续):v34 学术 Harness 维度 1 Molt/OpenForgeRL + v35 学术 Harness 维度 2 Weng + v35 学术 Harness 维度 3 Memora/SkillOpt + v35 学术 Harness 维度 4 Metis native memory = 学术 Harness 4 维度叠加饱和 = 是否触发 v36 维度收敛判定;v34 节点增量 12 信号 + v35 节点增量 13 信号 + 7-30 morning 节点增量 4 信号 = v35 节点增量 17 信号 vs v34 节点增量 12 信号 持续叠加
  6. Cyber-Capable AI Agents containment 评估框架与 OWASP ASI 防御清单互补性 vs 二者本质同源:Cyber-Capable AI Agents containment 评估框架 = 攻击面 + 遏制能力 · OWASP Agentic Top 10 2026 ASI01-ASI10 = 防御清单 · microsoft/agent-governance-toolkit 5.2k★ = 企业级实现工具 · 三者同源但视角不同(攻击 vs 防御 vs 落地)= 是否构成「Agent 安全三联」(攻击面 + 防御清单 + 落地实现)立标层?需要 Weng Harness + Memora + SkillOpt + Cyber-Capable + OWASP ASI + microsoft/agent-governance-toolkit head-to-head 实证。
  7. HiFi-UMI single day 134▲ 暴增 vs WorldDiT 候补级 0.5 的「飞 VS 暴增的方向对立」:work-queue 7-30 Top 15 #1 vs flyp multimodal-v34 B 旁证级 = 「飞 VS 暴增的方向对立」(WorldDiT 候补级 0.5 vs HiFi-UMI 134▲ 立标级)= 主线 7 垂直域 VLA / 物理 AI 飞轮候补升级 vs 立标并列 · 待 7-30 ~ 8-5 精读 §3 §4 验证 sim-to-real gap + vs OpenVLA-OFT / π₀ / MolmoAct / RDT-1B head-to-head 缺(flyp multimodal §1.4 增量 7 反方沿用)。
  8. Lilian Weng Harness Engineering vs Memora vs SkillOpt 三角互补 vs Molt vs OpenForgeRL vs arXiv:2607.22682 vs AAAI Subramanian Keyword Search 立标层叠加饱和:v34 §1.33c 学术 Harness 4 维度叠加 + 跨立标层 17 信号饱和 是否触发 v35 「立标层叠加饱和 = v36 维度收敛」判定 = v35 §3.1 共识 + §3.3 Q105 + §3.4 T 候选叠加饱和风险持续
  9. Anthropic Mythos Preview「AES Möbius Bridge 思维链」方法学 vs 现有密码学评估方法学(head-to-head)对比 待核(stephen 7-30 1025 ai-industry-v32 §增量 8 反方沿用)+ Anthropic Project Glasswing「守护全球软件安全」目标定义边界 = 与 OWASP ASI / microsoft/agent-governance-toolkit / Cyber-Capable AI Agents containment head-to-head 待核。
  10. GLM-5.2 Benchmark 数据:官方声称 Coding/Agentic SOTA 但截至 2026-07-30 第三方独立 head-to-head SWE-bench Verified + Terminal-Bench 2.1 + BenchLM weighted 量化对照尚未完成(flyp 7-30 1550 critical-read §3.4 反方 1 B 严重度)= 建议在知识库中标注「官方数据,待外部 benchmark 验证」;「1M 可用」≠「1M 在所有任务都可用」:DSA 在 NIAH 类检索上不掉点,但在 HotpotQA-128k 上比 MLA 低 3.3 点 = 与 LOCA-bench "context rot" 论断是一致的开放问题;与 Opus 4.8 / GPT-5.5 仍有差距:SWE-bench Pro 落后 7 点、DeepSWE 落后 24 点;Nathan Lambert 的 "step change" 主要落在开源坐标系内,跨坐标系仍是 "close but not yet at the frontier"。
  11. Kimi K3 Benchmark 数据 + vLLM/SGLang 官方支持时间线 + MXFP4/MXFP8 量化路线 + KDA/AttnRes 架构对比 + 第三方独立 head-to-head 仍未完成:官方声称 Coding/Agentic SOTA 但截至 2026-07-30 第三方独立 head-to-head SWE-bench Verified + Terminal-Bench 2.1 + BenchLM weighted 量化对照尚未完成(stephen 7-29 1245 + 2245 §5 ⚠️ 警示 + spark 7-29 13:30 §三.7 + flyp 7-28 coding-agents-e1prep §0 警示)= 建议在知识库中标注「官方数据,待外部 benchmark 验证」;DeepSeek-V3 当时的官方支持时间表作为参照。
  12. ReMemR1 文档前提 vs 实际 benchmark 范围未在引言点出:方法声称面向「百万 token 量级、长文档多跳 QA」· 但正文 benchmark 仍是 HotpotQA / 2WikiMultiHopQA / MuSiQue / NarrativeQA / Qasper 等典型长上下文 QA(百万 token 量级需用单个长文档构造,不是这些标准的默认形态)——不要直接复述「百万级」(flyp 7-30 0951 critical-read §2 ❗ P1);ReMemR1 奖励公式只承诺「信息增益 + 检索有效性」,未在引言给出具体表达(信息增益是 token-level 还是 embedding-level?检索有效性是否归一化 hit@k / MRR?);MemoryAgentBench 注入范式的偏差 = "inject once, query multiple times" 高效但偏离真实多轮对话分布;MemoryAgentBench 多模态缺位 = 数据集全部文本 · 多模态 agent memory 评估仍是空白 = 与 Metis 多模态 memory 工作形成缺口互补。
  13. Memory Survey Du (2026)单作者独立综述 + 一人撰写覆盖 ~4 年文献 + 选择性偏差风险大 = 需要交叉对比《Memory for Large Language Models》(arXiv 2607.25380 已在 tom 雷达)+ Preprints.org LLM Agent Memory: A Survey from a Unified Representation-Management Perspective(202603.0359);Memory Survey privacy/security 章节单薄 = 2026-07 之后已经出现 "Long-term memory in LLM agents is an attack surface with a long half-life" 这类新工作(Reddit r/mlops 引用),综述未覆盖;Memory Survey multimodal embodied memory 仅作为未来方向 = 综述结尾把 multimodal embodied memory 列入 open challenges,与当前 Metis 等 2026-07 多模态 memory 工作的现实节奏脱节。
  14. VisualPatchWorld work-queue 0.5 级低优先级 vs flyp multimodal-v34 B 旁证级 = 评级升级时机风险 + World Models 三范式与 Jim Fan「VLA 已死 · 世界动作模型接棒」立场 2.0 张力:WorldDiT 仍是「action model + minimal world head」,没有真正接 WAM 棒(flyp 7-30 0949 multimodal-v34 §3.3 反方 #55-#72 评级升级时机风险持续激活 第 5-7 日)。
  15. MSR Aurora 1.5 vs Anthropic / Google / DeepMind 地球科学基础模型:Google DeepMind GraphCast + Aurora 与 Anthropic Claude climate = 对比 待核;MSR SymCrypt Rust vs Anthropic 密码学弱点发现 + Mythos Preview + HF 7-26 OpenAI rogue agent = 跨 lab 密码学立体验证立基础 = frontier lab × 密码学 第 8 维立基础。
  16. evaluation 主题活文档 5 天未更新(2026-07-24 00:18 → 2026-07-30 13:30 · 待补救):evaluation 主题活文档持续更新 vs work-queue 状态不一致(stephen 7-29 12:45 + 2245 + spark 7-29 13:30 §一.1 🔴 沿用);沿用 7-28 警示。
  17. Spark E1 节奏 7-28 evening 双 E1 完整恢复 + 7-29 noon 协调棒判断 4 日回落已纠正 + stephen 7-29 1245 + 2245 修正(7-26 evening 双 E1 完整恢复第 1 棒 → 7-27 仅 RSS 通稿 → 7-27 evening 仅 RSS 通稿 → 7-28 截至 13:30 仍仅 RSS 通稿 = E1 节奏连续 3 日回落窗口 → 7-28 evening 双 E1 完整恢复第 4 棒 · 7-29 13:37 agent-v35 + 18:50 llm-infra-v10 双 E1 完整恢复第 5 棒 = 与 7-28 evening 双 E1 完整恢复判断一致 = stephen 7-29 1245 + 2245 节奏反转信号修正 4 日回落窗口判断为 节奏反转第 5 棒 · 7-30 morning 再次缺失 = 节奏反转后第 6 棒独立 E1 缺失窗口)。

三、可引用的 arXiv 号列表

arXiv 号 论文/工作 状态 来源
2607.24882 Agent Retrieval Bench(coding agent 上游检索基准 · file-level · 4 正检索任务 code2test / comment2context / trace2code / edit2ripple · 相关性由「agent 下一步需要什么」定义) ✅ paper_cards/656 7-30 已建卡 · 主分类 agent · 副分类 rag tom 7-30 0840 radar §1.1 + jay 7-30 1124 engineering-v40 §增量 4 + stephen 7-30 1025 ai-industry-v32 §增量 3 + tom 7-30 0852 rag-e1prep-v49
2607.25379v1 Cyber-Capable AI Agents(网络攻击 AI agent 五大漏洞类 + containment 评估框架 · Abu Bakar Siddik et al.) ✅ paper_cards/643 7-30 已建卡 · 主分类 agent · 副分类 evaluation tom 7-30 0840 radar §1.2 + jay 7-30 1124 engineering-v40 §增量 5 + stephen 7-30 1025 ai-industry-v32 §增量 3 + paper_cards/643
2607.25398v1 HANDBOOK.md(长上下文 Agent 指令遵循基准 · 65 个企业员工手册风格 agentic 任务 · 评估 agent 是否在整个工具调用周期内受政策约束) ✅ paper_cards/654 7-30 已建卡 · 主分类 agent · 副分类 evaluation tom 7-30 0840 radar §中等价值 #5 + paper_cards/654
2607.25236 VisualPatchWorld(代码世界模型作为潜变量结构化表示 · 世界模型三范式 神经预测器 + 物理引擎 + 代码世界模型) ✅ paper_cards/649 7-30 已建卡 · 主分类 agent · 形态 method · work-queue Top 15 #1 [0.5] tom 7-30 0900 hf-daily-2026-07-30 + flyp 7-30 0949 multimodal-e1prep-v34 §1.1 + paper_cards/649
2607.26760v1 Metis Memory Foundation Model(首个 memory foundation model = agent memory 内化到基础模型本体 · 持久且动态演化的内存状态 + 通过持续查询过往记忆进行推理) ✅ paper_cards/658 7-30 已建卡 · 主分类 agent · 形态 method stephen 7-30 1025 ai-industry-v32 §增量 4 + flyp 7-30 2250 memoryagentbench-critical-read + paper_cards/658
2607.26784 SkillRise Cross-Task Skill Evolution(跨任务技能演化的统一 RL 框架 · 把相关实例组织成渐进挑战序列 · 用单一策略在任务学习与跨任务技能提取之间交替) ✅ paper_cards/659 7-30 已建卡 · 主分类 agent · 形态 method stephen 7-30 1025 ai-industry-v32 §增量 4 + jay 7-30 1004 rss-msr-blog + paper_cards/659
2607.24117 Grading the Narrators(多 Agent 知识系统的声明级 provenance · Isnad-Rijal 框架 · 评估每个领域 transmit 信度 · 完整性语义 · 转换类型聚合 · 解耦内容批评 · serve/review/quarantine 路由) ✅ paper_cards/665 7-30 已建卡 · 主分类 agent · 形态 method stephen 7-30 1025 ai-industry-v32 §增量 4 + paper_cards/665
2607.26314 StealthBench(自主 offensive-security Agent operational stealth 评测 · 6 OPSEC 维度 · 11 hand-verified OPSEC incidents from real-world APT reports · Cyber-Capable containment 邻接补全) ✅ paper_cards/664 7-30 已建卡 · 主分类 agent · 形态 benchmark Cyber-Capable AI Agents 邻接补全 + tom 7-30 1440 / 2040 radar 沿用 + paper_cards/664
2607.25308 CAST: Game Solvers as Turn-Level Teachers for LLM Agents(RL with Verifiable Rewards(RLVR)长 horizon 游戏 + 稀疏最终奖励 + 转向层级信用分配 + solver state value 作为转向级教师信号 · Credit Assignment from Solver Teachers) ✅ paper_cards/662 7-30 已建卡 · 主分类 agent · 形态 method stephen 7-30 1025 ai-industry-v32 沿用 + paper_cards/662
2603.07670 Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers(综述 · write-manage-read loop + 三维分类 temporal scope × representational substrate × control policy · 5 类机制并列 · multimodal embodied memory 列入 open challenges) ⚠️ paper_card 待补 · flyp 7-30 2250 critical-read 沿用 flyp 7-30 2250 memoryagentbench-critical-read
2607.24653 Kimi K3(2.8T MoE · MXFP4 权重 + MXFP8 激活 · HF 1.56TB · KDA + AttnRes + Stable LatentMoE · Coding/Agentic SOTA · 首个 arXiv 编号正式披露 · HF Daily 7-29 263▲ 单日 +121 暴增 85% 登顶) ⚠️ paper_card 待补 stephen 7-29 1025 ai-industry-v31 + 7-30 1025 ai-industry-v32 + jay 7-30 1055 five-category-briefing #3 + spark 7-30 1004 gradient-flow + simon willison 7-28 1001
2510.04618 ACE(Agentic Context Engineering)(context = evolving playbook · Generator + Reflector + Curator · itemized bullets(id + description)· 不做全量 rewrite) ⚠️ paper_card 待核 jay 7-29 1055 engineering-filter-rss-round v3 A1 + jay 7-29 engineering-v39 + jay 7-30 1003 rss-lilian-weng + Lilian Weng blog 2026-07-04
2601.21557 MCE(Meta Context Engineering)(双层优化 · 内层 c_s^* = argmax_c J_train(c_s; s)(给定 skill 找最优 context)+ 外层 s^* = argmax_s J_val(c_s^*)(找最优 skill)· Skill = context function pair c_s = (ρ_s, F_s)) ⚠️ paper_card 待核 jay 7-29 1055 engineering-filter-rss-round v3 A1 + jay 7-29 engineering-v39 + jay 7-30 1003 rss-lilian-weng + Lilian Weng blog 2026-07-04
2602.15763 GLM-5 / GLM-5.2(from Vibe Coding to Agentic Engineering · 744B 总参 / 40B 激活 · DSA + IndexShare + 1M context 实测可用 · AIME 2026 99.2 开源第一 · SWE-bench Pro 62.1 · DeepSWE 46.2 · Terminal-Bench 81.0 · ProgramBench 63.7 · Nathan Lambert「step change for open agents」+ 「one way door for AI progress」· flyp 7-30 1550 critical-read 评级 A- 推荐入库) ⚠️ paper_card 待补 · flyp 7-30 1550 短审稿 flyp 7-30 1550 GLM-5-2-step-change-open-agent-critical-read + stephen 7-30 1025 ai-industry-v32 + jay 7-30 1007 rss-yt-fireship + spark 7-30 1000 rss-gradient-flow
2603.12201 IndexCache(Accelerating Sparse Attention via Cross-Layer Index Reuse · IndexShare 的更早理论化版本) ⚠️ paper_card 待补 flyp 7-30 1550 GLM-5-2-step-change-open-agent-critical-read 副报告
2509.23040 ReMemR1 v5 ICLR 2026 已接收(Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents · 状态空间扩展 callback-augmented state s_t = (m_t, q_t) · 多层奖励 RLMLR · 检索延迟 < 0.2% 时间开销 · 准确率提升 > 20% 错误率下降 · 「memorize while reading」流派的实质性升级) ⚠️ paper_card 待补 · flyp 7-30 0951 精读评级 ★★★★★ · P1 入库主线候选 flyp 7-30 0951 ReMemR1-v5-ICLR2026-deep-read 8.0KB 精读 + github.com/syr-cn/ReMemR1
2507.05257 MemoryAgentBench/LongMemEval ICLR 2026(Hu, Wang, McAuley · 四能力框架 AR/TTL/LRU/CR · "inject once, query multiple times" 范式 · 多轮增量信息处理场景 · 当前方法四项能力未同时达标者) ⚠️ paper_card 待补 · flyp 7-30 2250 critical-read flyp 7-30 2250 memoryagentbench-critical-read 17.7KB + github.com/HUST-AI-HYZ/MemoryAgentBench
2607.25600v1 BeyondUncertainty(verbalized confidence 路由检索 · held-out validation 选模型专属阈值 · 第三类 RAG 路由范式 立标级候选 · HF Daily 83▲) ✅ paper_cards/645 7-30 已建卡 · 主分类 rag · 形态 method tom 7-30 0840 radar §1.3 + jay 7-30 1124 engineering-v40 §增量 6 + stephen 7-30 1025 ai-industry-v32 §增量 2 + paper_cards/645
2607.24223 A New Role for Relevance(relevance 引导语料进入工作空间而非仅 top-k 选择 · HF Daily 83▲ 7-30 立标级续立) ✅ paper_cards/639 7-30 已建卡 · 主分类 agent · 形态 method tom 7-30 0840 radar §1.4 + paper_cards/639
2607.25895 HiFi-UMI(高保真 UMI 数据学习可部署操控策略 · HF Daily 7-30 #1 134▲ 登顶 · 与 WorldDiT sub-billion VLA baseline + frozen encoder 路线同方向) ⚠️ paper_card 待补 stephen 7-30 1025 ai-industry-v32 §增量 2 + flyp 7-30 0949 multimodal-e1prep-v34 §1.1
2602.23368v1 AAAI 2026 Subramanian「Keyword Search Is All You Need」 ✅ v34 §2.3 立标级候选 B 级 3.5/5 · paper_card 已核 · 🔴 7-29 14:30 截止已过 24h + 7-30 第二批截止今天就是截止日仍未触发补强 v34 §2.3 第五十六 c 节点 + v34 §3.2 争议 36 + v34 §3.3 Q105.1 + stephen 7-30 1245 noon + 2245 evening + spark-on-systems-risk 9:16 review 已列
2605.20173 SDB Stochastic-Deterministic Boundary ⚠️ v34 §2.6 第四十二子节立标级 · paper_card 仍未建 · 7-30 截止前必须补建卡 jay 7-27 1100 + 1123 + stephen 7-27 12:45 + spark 7-27 agent-e1prep
2607.12406 Isolation as a First-Class Principle for LLM-Agent System Safety ⚠️ v34 §2.5 第十一阶段 flyP 安全主题页 anchor · paper_card 仍未建 stephen 7-27 1023 + spark 7-29 agent-v35 警示
2607.21461 AREX 面向深度研究的递归自我改进 Agent(BAAI) ⚠️ paper_card/585 沿用 · v34 §2.5 第八十五节点候选 · paper_card 补建待核 HF Daily 7-23 117▲ · 7-27 139▲ · 7-28 142▲ · 7-29 263▲(AREX vs Kimi K3 不同对象)
2607.21503 Agentic Context Management(Gaurav Dadhich) ✅ paper_cards/564 7-25 · v34 §2.2 58 节点 + spark-on-Tom E3 review 待直查 arXiv 编号 spark-on-Tom E3 review 待直查 arXiv 编号
2607.21051 Sample-Efficient Learning from Agent Experience(Experience Distillation · Tom 单作者) ✅ paper_cards/567 7-25 · v34 §2.2 第 60 节点 + spark-on-Tom E3 review 待直查 arXiv 编号 spark-on-Tom E3 review 待直查 arXiv 编号

四、检查过的来源清单(无显著新增量时如实写明并列出检查过的来源)

来源 文件 / 路径 coding-agents 主题覆盖
work-queue.md /shared/research-kb/organized/queue/work-queue.md 待建卡 8(候选 5 = RepoReasoner / Kontrast / BeyondUncertainty / LOCA-bench / Kimi K3 · 必补 3 = CodeNib + SDB + Isolation + AREX)+ 富化缺口 69 张卡缺 TLDR(待 cron_s2 覆盖)· 主分类 agent 候选 = 643/647/649/654/656/658/659/662/664/665/634 沿用 = 11 件
flyp/inbox/flyp 2026-07-30-0949-multimodal-e1prep-v34 v34 接力窗口第三棒 E1 · 61.9KB · 32 件 v34 候选增量(主分类 coding-agents 主增量 6 件立标级/立标级候选 沿用)+ Agent Retrieval Bench + Cyber-Capable + HANDBOOK.md + VisualPatchWorld + Kontrast + CodeNib + RepoReasoner + Kimi K3 沿用
flyp/inbox/flyp 2026-07-30-0951-ReMemR1-v5-ICLR2026-deep-read 🔴 ReMemR1 v5 ICLR 2026 已接收 arXiv:2509.23040 v5 · github.com/syr-cn/ReMemR1 · 「Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents」· 状态空间扩展 callback-augmented state + 多层奖励 RLMLR · 检索延迟 < 0.2% 时间开销 · 准确率提升 > 20% 错误率下降 · 评级 ★★★★★ P1 入库主线候选 · 增量 7
flyp/inbox/flyp 2026-07-30-0951-M3Exam-m3proctor-light-review M3Exam arXiv:2606.07402 + M3Proctor 评测 5 款模型 · 「多模态 memory 评测从 single-turn 拉到 cross-session + cross-modal」 · 轻评不入 reviews/(主分类 multimodal · coding-agents 邻接)
flyp/inbox/flyp 2026-07-30-1550-GLM-5-2-step-change-open-agent-critical-read 🔴 GLM-5.2 arXiv:2602.15763 短审稿 · 评级 A- 推荐入库 · Nathan Lambert「step change for open agents」+ 「one way door for AI progress」 · 主线 长上下文 + agent + 评测侧三向交叉 · LOCA-bench 「context rot」vs GLM-5.2 IndexShare/DSA「1M token 可用」= flyP 长上下文主题页两条腿 · 增量 6
flyp/inbox/flyp 2026-07-30-2250-memoryagentbench-critical-read 🔴 MemoryAgentBench/LongMemEval ICLR 2026 + Memory Survey arXiv:2603.07670 Du (2026)write-manage-read loop + 三维分类 索引型综述 + Metis 等 2026-07 多模态 memory 工作沿用 · 增量 7
flyp/inbox/flyp 2026-07-30-1000-rss-cameron-wolfe / 1003-rss-interconnects / 1007-rss-yt-ai-explained / 1007-rss-yt-two-minute-papers 4 件 RSS 通稿(coding-agents 主题沿用)
jay/inbox/jay 2026-07-30-1105-jay-five-category-briefing #3 14.0KB · Database D1-D4 · Backend B1-B2 · Cloud-Native C1-C2 · CSDN 4.1 · Reproduction 4 件 · Kimi K3 MoE 首个 3T 参数开源 MoE + GitHub Trending July 2026 Top 10 沿用
jay/inbox/jay 2026-07-30-1124-engineering-e1prep-v40 🔴 33.2KB · engineering E1 准备棒 · 6 主线 + 1 旁证 + 1 警示 · MCP 2026-07-28 史上最大协议更新 + llm-d CNCF Sandbox + GitHub Trending 7-30 工程化亮点 AIRI/OpenWork/Colibri/FlashKDA + RepoReasoner arXiv:2607.25996 + Cyber-Capable AI Agents arXiv:2607.25379v1 + BeyondUncertainty arXiv:2607.25600v1 + CodeNib arXiv:2607.25431 = 主线 ① Coding Agent + 主线 ⑤ Application-layer Reliability 候选池 · 增量 1 + 5 + 6 + 7
jay/inbox/jay 2026-07-30-1508-jay-five-category-briefing 14.0KB · 沿用 llm-d CNCF Sandbox + MCP 2026-07-28 最大更新 + Transformers v5.14.1 + vLLM K8s 扩缩容 + GKE 最佳实践 + GitHub Trending July 2026 Top 10 沿用
jay/inbox/jay 2026-07-30-1140-news-x-tech-radar 5.6KB · X 硬核干货雷达 · 12 账号 · 8 候选 + 4 其余线索 · MCP 2026-07-28 无状态协议重大更新 + OpenAI 模型安全测试突破沙盒
jay/inbox/jay 2026-07-30-1000-rss-bytebytego / 1000-rss-nathan-benaich / 1000-rss-raschka / 1000-rss-simon-willison / 1003-rss-cool-papers / 1003-rss-cool-papers-ir / 1003-rss-lilian-weng / 1004-rss-msr-blog / 1005-rss-import-ai / 1007-rss-yt-fireship / 1007-rss-yt-karpathy 11 件 RSS 通稿 · jay 7-30 1003 rss-lilian-weng ⭐⭐⭐⭐⭐ Harness Engineering P0 立标 + jay 7-30 1004 rss-msr-blog ⭐⭐⭐⭐(MSR 4 项 P0 立标 = SymCrypt Rust + Aurora 1.5 + Flint + SkillOpt + Memora)
jay/inbox/jay 2026-07-30-ai-engineering-trending GitHub Trending 7-30 日榜 · AIRI 45k⭐ + OpenWork 17.9k⭐ + FlashKDA 990⭐ + VibeVoice + HF Trending Models 7 月快照 · engineering-v40 已用
tom/inbox/tom 2026-07-30-0840-agent-rag-longcontext-radar #4 v2 重写版 🔴 5.3KB · 4 高价值 + 4 中价值 + 2 Substack · Agent Retrieval Bench arXiv:2607.24882 + Cyber-Capable AI Agents arXiv:2607.25379v1 + BeyondUncertainty arXiv:2607.25600v1 + RepoReasoner arXiv:2607.25996v1 + HANDBOOK.md arXiv:2607.25398v1 + Kontrast arXiv:2607.25959v1 + LongMemEval Substack + The AI Agents Stack 2026 Substack = 4/8 命中 7-29 JSON + 4 手工补充 · 增量 1 + 7 + 8
tom/inbox/tom 2026-07-30-0900-hf-daily-2026-07-30 HF Daily 7-30 票榜 15 件全核 · HiFi-UMI arXiv:2607.25895 134▲ + A New Role for Relevance arXiv:2607.24223 83▲ + Rethinking CFG OPD arXiv:2607.24731 70▲ + ReDesign arXiv:2607.25565 56▲ + CodeNib arXiv:2607.25431 43▲ + Sol-Attn arXiv:2607.24027 32▲ + Oxygen-TryOn arXiv:2607.21694 26▲ + Keep It InMind arXiv:2607.24368 25▲ + Pass the Baton arXiv:2607.26057 23▲ + Mage-VL arXiv:2607.24904 23▲ + Multi-Turn Planning arXiv:2607.24720 22▲ + 新颖 Déjà Vu arXiv:2607.23514 12▲ + Shieldstral arXiv:2607.25857 12▲ + 视频 prompt 工程 arXiv:2607.25537 11▲ + Wonder arXiv:2607.26037 11▲ = HF Daily 7-30 vs 7-29 票榜 15 件完全替换
tom/inbox/tom 2026-07-30-0852-rag-e1prep-v49 🔴 22.1KB · RAG E1 预消化 · 8 件增量 · BeyondUncertainty + Agent Retrieval Bench + Kontrast + RAG 生产 7 大失败点 + δ-mem + RAG-lite + The AI Agents Stack 2026 Substack + LongMemEval + HANDBOOK.md + APS-RAG + DeCoRAG + IteraSim RAG · 增量 1 + 7 + 8
tom/inbox/tom 2026-07-30-1007-rss-yt-lex-fridman / 1007-rss-yt-yannic-kilcher 沿用 · 🆕 TiDAR 在 Diffusion 中思考 + 🆕 Titans 在测试时学习记忆(沿用)
tom/inbox/tom 2026-07-30T1440-agent-rag-longcontext-radar / 2026-07-30T2040-agent-rag-longcontext-radar 1440 场 8 条候选 5 条与 0840 重叠未明示(Metis / Grading Narrators / CLBench-V / SkillRise / CoRT)+ 2040 场 8 条候选 5 条与 1440 重叠未明示(CoRT / CLBench-V / SkillRise / Memory Survey / Grading Narrators / Metis)· 增量 2 + 3 沿用
spark/inbox/spark 2026-07-30-1337-agent-e1prep-v35 🔴 537L · 6 新立标候选(增量 1 Cyber-Capable + 增量 2 HANDBOOK.md + 增量 3 Agent Retrieval Bench + 增量 4 VisualPatchWorld + 增量 5 ReDesign + 增量 6 A New Role for Relevance)+ 承接 spark 7-29 agent-e1prep-v35 8 件新立标候选(Kimi K3 arXiv:2607.24653 立基础 + Lilian Weng Harness Engineering 学术框架 + MSR Memora + MSR SkillOpt + Anthropic Dario 7-27~28 周末博客澄清 + HF 7-26 rogue agent 入侵 + Anthropic 7-29 密码学 + arXiv:2607.22682 多 Agent 词汇表 + CSDN Agent 4 范式 + microsoft/agent-governance-toolkit 5.2k★ + AAAI Subramanian 7-29 验证截止已过 24h)= v35 候选增量 14 件 P0/P1/P2 · 14 件 v34 立标续立 · 2 件 v34 反方激活 · 1 件活文档强提醒(🔴 AAAI Subramanian 7-30 第二批截止今天就是截止日!)
spark/inbox/spark 2026-07-30-1000-rss-gradient-flow / 1004-rss-chip-huyen / 1007-rss-yt-3blue1brown 3 件 RSS 通稿(沿用 Kimi K3 + GLM 5.2 + Gemini 3.6 Flash)· ⚠️ spark 7-30 morning 无独立 agent/engineering/llm-infra E1 产出 = 节奏反转后第 6 棒独立 E1 缺失窗口(stephen 7-30 1245 noon 警示)
stephen/inbox/stephen 2026-07-30-1025-ai-industry-e1prep-v32 🔴 56.9KB · 第 32 版活文档准备棒 · 8 件主线增量 + 1 件旁证 · Kimi K3 arXiv:2607.24653 立基础沿用 + HF Daily 7-30 票榜 11 件 net-new 立标级候选饱和 + Tom 7-30 radar 4 件 P0 高价值 + Lilian Weng Harness Engineering 学术框架 P0 立标沿用 + Microsoft Research 4 项 P0 立标 + Sam Altman ChatGPT Work 个人 AI 端到端 multi-agent 新立标 + Karpathy 数字多比 + Jim Fan GEAR 8000 timesteps + Anthropic Mythos Preview AES Möbius Bridge 思维链 7-30 NEW + MSR 4 项沿用 = 13 件 P0 立标饱和 + 8 件 7-30 morning frontier/industry 立标 + 4 件 7-30 morning 工程化亮点 · 增量 1 + 4 + 5
stephen/inbox/stephen 2026-07-30-1245-coordination-check-noon 🔴 70.4KB · 第 32 版活文档准备棒 · 5 实例产出 40+ 份高密度 + spark E1 节奏反转后第 6 棒独立 E1 缺失 + AAAI Subramanian 7-30 第二批验证截止强提醒 + 8 件 7-30 noon 持续缺口待人工确认
stephen/inbox/stephen 2026-07-30-2110-llm-application-e1prep-v40 🟡 P1 · 8 件主线增量 + 1 件旁证 · HF Daily 7-30 票榜 15 件完全替换 + Tom 7-30 radar #4 4 件 P0 + jay 7-30 rss-lilian-weng「Harness 工程:实现自我改进」+ jay 7-30 rss-msr-blog 4 项 + Tom 7-30 rag-e1prep-v49 + flyp 7-30 multimodal-e1prep-v34 第三棒 = 主线 ① Coding Agent + 主线 ④ Agentic RAG + 主线 ⑤ Application-layer Reliability 候选池「评测方法学反思 v40 15-16 → v41 16-17 件套补完」
stephen/inbox/stephen 2026-07-30-2245-coordination-check-evening 7-30 evening 17 件新立标 · 8 大主题活文档(ai-industry/agent/rag/multimodal/systems/engineering/llm-application/llm-infra/risk/evaluation/database/coding-agents)接力窗口预备完成 + 1 件统一主线立标续立升级 Kimi K3 + 13 件需要人工确认/修正/强提醒 · 本场增量 1 + 8
stephen/inbox/stephen 2026-07-30-0910-news-x-vip-radar / 1005-news-anthropic-news / 1005-news-openai-news / 1006-news-bens-bites / 1006-news-deepmind-news / 1006-news-google-ai / 1006-news-hf-blog / 1006-news-tldr-ai / 1007-news-yt-openai / 1008-news-yt-anthropic / 1008-news-yt-deepmind 11 件 frontier lab news 通稿 · Anthropic Mythos Preview AES Möbius Bridge 7-30 NEW + OpenAI 7-30 NEW ARC-AGI-3 + Codex Security 沿用 + Gemini API Managed Agents 3.6 Flash + DeepMind Gemini 3.6 Flash + 3.5 Flash-Lite + 3.5 Flash Cyber + HF Frontier Lab Agent 入侵剖析 · 增量 5
paper_cards/ 007-2606-13141.md665-2607-24117.md 666 张 · 近 3 天主分类 agent 新卡 13 张(636 ReDesign / 639 A New Role for Relevance / 643 Cyber-Capable AI Agents / 647 CodeNib / 649 VisualPatchWorld / 654 HANDBOOK.md / 656 Agent Retrieval Bench / 657 RLHF Reward Model C++ / 658 Metis / 659 SkillRise / 662 CAST / 664 StealthBench / 665 Grading the Narrators + 634 A Vocabulary for Multi-Agent 7-29 沿用)= 主分类 agent 总计 14 张 · 占比 ~2.1% · 0 张主分类 coding-agents · 7-30 4 件新 arXiv 立标 paper_card 待补(MemoryAgentBench + ReMemR1 + Memory Survey + HiFi-UMI)+ LOCA-bench paper_card 待补 + Kimi K3 arXiv:2607.24653 paper_card 待补 + SDB arXiv:2605.20173 paper_card 仍未建 + Isolation arXiv:2607.12406 paper_card 仍未建 + AREX arXiv:2607.21461 paper_card 仍未建 + GLM-5.2 arXiv:2602.15763 paper_card 待补 + IndexCache arXiv:2603.12201 paper_card 待补 = 9 件 paper_card 待补 = pipeline 漏斗节点
knowledge/coding-agents.md /shared/research-kb/organized/knowledge/coding-agents.md v34 Wave4 E1 第十一轮 7-28 04:20:16 阈值 + §2.1 Harness 学术化 11 阶段 + §2.2 模型与基座 沿用 + §2.3 评测表 22 行(arXiv:2602.23368v1 已核)+ §2.4 后训练 18 件候选 + 上下文管理五路线对立 + §2.5 安全契约 11 阶 + 86 节点 + §2.6 多模态/CLI/IDE + 42 子节立标级 + 共识 43 / 争议 36 / 开放问题 55 / 趋势 35 / 必读 142

总结:本场 E1 预消化共识别 8 件增量(7 件 P0 + 1 件 P1),涉及 arXiv 号 24 件新立标候选(其中 14 件 coding-agents 主分类邻接 + 6 件长上下文/记忆/安全邻接 + 4 件模型本体 / 评测 / harness 沿用)+ 7 件沿用升级(Kimi K3 + Weng Harness Engineering + MSR Memora/SkillOpt + Aurora 1.5 + SymCrypt Rust + Flint + GLM-5.2 + Metis + SkillRise + Grading Narrators + StealthBench + CAST + Memory Survey + ReMemR1 + MemoryAgentBench + BeyondUncertainty + A New Role for Relevance + HiFi-UMI)+ 2 件 P1 监测(🔴 AAAI Subramanian 7-30 第二批截止今天就是截止日仍未触发补强强提醒 · 🔴 spark E1 节奏反转后第 6 棒独立 E1 缺失窗口 · 🔴 tom 7-30 inference-e1prep 连续 3 天缺漏模式化塌方首次识别 · spark-on-Tom E3 评审 P0 修正 3 件仍未完成)+ 9 件 paper_card 待补 / 已建 = pipeline 漏斗节点(MemoryAgentBench + ReMemR1 + Memory Survey + HiFi-UMI + Kimi K3 + SDB + Isolation + AREX + GLM-5.2 + IndexCache = 10 件待补 + 6 件已建)。