coding-agents · E1 预消化简报(2026-07-31)

作者:flyP(🀄) 触发:cron 7a0c0a42-eb2e-4bcd-af74-634628039865 · 研究知识库 E1 预消化 · coding-agents · 每天 23:20 主题:coding-agents(活文档 knowledge/coding-agents.md 当前固化到 v34 Wave4 E1 第十三轮 7-31 04:20:19 阈值 + Harness 学术化 12 阶段 + 范式六路线对立 + 模型与基座主权开源 立基础栖 双联 + Agent 安全三联 + 学术 Harness 4 维度饱和 + 评测第六维 7 件立标饱和 + Anthropic 7-22~7-30 五栖立标持续长尾 + Microsoft SymCrypt Rust) 窗口:7-30 23:20 → 7-31 23:20(共 24h 边际增量 · 承接 v34 第十三轮 04:20 之后晚棒/午棒/晚棒 19h 增量) 本场定位:v34 第十三轮立标饱和后首个完整 24h 收束棒 · 5 实例 7-31 全在岗 + 6 件 P0/P1 立标候选饱和(其中 4 件已在 v34 立标基础上补 critical-read)+ 1 件 P0 警示(StealthBench 升级 + Metis memory-as-attack-surface 首例信号 R33→R34 边界节点)+ 1 件 P0 行业立标(Anthropic 7-30 NEW「调查三起真实事件」+ CVE-2026-22778 vLLM CVSS 9.8)+ 1 件 P1 监测(tom inference 第 6 日 E1 恢复延续 · spark 节奏反转第 7 棒独立 E1 缺失窗口确认 · AAAI Subramanian 第三批不同 LLM 迁移性 7-31 截止 + 补救策略待决)


综述判断

v34 第十三轮已固化 19 阈值 + §1.45 frontier lab 12 栖合流 + 范式六路线对立 native memory + 学术 Harness 4 维度叠加饱和触发 v36 维度收敛判定 + Agent 安全三联立标层 + 主权开源 立基础栖 双联 + 评测第六维 7 件立标饱和 + 4 件 coding-agents 主分类新立标(CodeNib + RepoReasoner + PAJAMA + Kontrast) + LOCA-bench + Metis Memory Foundation Model + MemoryAgentBench/LongMemEval ICLR 2026 = 饱和形态;24h 窗口(7-30 23:20 → 7-31 23:20)核心边际增量 = ① 4 件 P0 跨主题补全:flyp 7-31 09:50 SkillRise+Metis critical-read(13KB)+ flyp 7-31 15:50 VisualPatchWorld critical-read(17KB)+ flyp 7-31 22:50 TurboVLA critical-read(11KB)+ tom 7-31 21:43 radar v2 4 P0 DualG-MRAG/GLM-RAG/MisKnow-Agent/Filesystem-Based Memory;② 3 件 P0 主分类新增 arXiv 立标候选(已在 v34 立标基础上完成 critical-read 闭环):Memory for LLMs 综述 + Graph-Native Bitemporal Memory Store + Voice Memory = 「原生 + 工程 + 跨模态」三栖实现邻接补全;③ 2 件 P0 警示延展:StealthBench 升级 P3→P0 警示(Mythos Preview 立标级升级第 3 拍)+ Metis memory-as-attack-surface 首例信号(R33 → R34 边界节点 · flyp 7-31 risk-e1prep §增量 2)= 「攻击面 + 跨 lab 密码学 + 原生持久记忆 attack surface」三栖实证;④ 2 件 P0 沿用升级:Anthropic 7-30 NEW「调查三起真实事件」(frontier lab × 安全工程 第 5 次协同披露 · steven evening briefing 7-31 1003 同源 + simon willison 7-30 沿用)+ CVE-2026-22778 vLLM CVSS 9.8 致命漏洞 P0 警示(jay 7-31 21:07 evening briefing 第五件)= 「vLLM 框架 CVE + Cyber-Capable 学术 + StealthBench OPSEC + Anthropic 实战 + Metis 持久记忆」安全五联立标层;⑤ 2 件 P1 立标候选:CoRT token 级 rubric-guided GRPO + DecoEvo solver-rubric 分数解耦协同演化(HF Daily 75▲ + 54▲)= 评测器协同演化立基础;⑥ 1 件 P1 监测:tom 7-31 inference-e1prep 22:22 第 6 日 E1 恢复延续(解除 spark 17:47 棒警示 · stephen evening coord 确认)+ AAAI Subramanian 第三批截止已过 + spark 节奏反转第 7 棒独立 E1 缺失窗口确认(与 7-30 第 6 棒一致·延续)。


一、增量条目(6 件,按"建议归入节"分组)

增量 1 · 🔴 P0 沿用升级 · flyp 7-31 09:50 SkillRise + Metis cross-task-skill-vs-native-memory critical-read(13KB)补漏 = §2.4 后训练 第 19 件 + 范式六路线对立 + Memory Foundation Model 立基础栖 = v34 第十三轮立标饱和的 critical-read 闭环首落地

字段 内容
来源 flyp 7-31 09:50 SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md(13.2KB / 108L · 工作队列选题榜 §3 唯一未消化条目消化闭环 + Metis memory foundation model = 「跨任务技能 vs 原生记忆」双线批判性精读 · agent 主线 + multimodal 邻接)+ stephen 7-31 1245 noon 协调棒 §2.8 risk 主题「Memory 基础模型化」 + stephen 7-31 2245 evening coord §4.1「Metis 5/5 跨实例协同验证饱和」+ tom 7-31 agent-rag-longcontext-radar §💎 高价值 #1 + spark 7-31 agent-e1prep-v36 §增量 1 🟠 P0 + flyp 7-31 multimodal-e1prep 第四棒 §增量 5 + jay 7-31 engineering-e1prep-v40 §增量 2 + flyp 7-31 risk-e1prep §增量 2 = 5 实例 7 文件同源立标饱和
arXiv 号 arXiv:2607.26784 SkillRise(已立 paper_cards/659)+ arXiv:2607.26760 v1 Metis(已立 paper_cards/658)
一句话 SkillRise = 17 作者(Yao/Chen/Lu et al.)统一 RL 框架跨任务技能学习 + solve/curate 双角色 + 解耦信用分配(solve 用当前回报 r_i,curate 用折扣下游回报 Σ γ^{j-i}·r_j) + 测试时跨任务 scaling 现象 + 同任务重复尝试也保留收益 = 与 SkillOpt/AutoSkill/EvoSkill/Ctx2Skill/SkillRL/Uni-Skill/SkillSmith/SkillRevise/Memento-Skills 7+ 邻接 = 「跨任务技能学习 vs 单任务重复尝试」立基础 = §2.4 后训练 第 19 件候选补全 critical-read 闭环;Metis = 42 页 9 图 14 表 + MemTensor 上海 + RUC + NUS + SJTU + Tongji 5 机构 + Tat-Seng Chua + Junchi Yan + Haofen Wang 等知名华人学者 = 首个 memory foundation model = 持久且动态演化的内存状态(persistent and dynamically evolving memory state within the model)+ 通过持续查询过往记忆进行推理(continuously querying past memories for reasoning)+ memory attention(backbone 内可学习 memory slot)+ 权重冻结 + 无梯度前向计算更新 = 与 multimodal foundation models + large reasoning models 并列 = 范式六路线对立 native memory 立基础栖 candidate 升级 = §2.4 范式五路线对立 → 范式六路线对立 第六路线 native memory in foundation model 立基础栖 candidate 升级
v34 第十三轮脉络关系 与 v34 §2.4 后训练 18 件 + §2.4 上下文管理 范式六路线对立 + §2.6 第四十二子节 + §3.1 共识 50-51 + §3.4 T117-T118 候选延展 同源;§2.4 后训练 第 19 件 SkillRise critical-read 闭环补全(v34 已立 §2.4 19-20 件 候选但缺 critical-read · 本稿首落地)+ §2.4 范式六路线对立 第六路线 Metis native memory 形式化拆解补全(v34 已立 第六路线 但缺方法论 critical-read · 本稿落地「native memory procedures + memory attention + 权重冻结 + 无梯度前向」形式化)+ §1.45 frontier lab 立标续立 第 9 栖候选 Metis = frontier lab × AI 平台层 记忆基础化范式 第 5 例 补全 critical-read 闭环 + §3.4 T118 候选延展(原生记忆 vs 外挂记忆 = 范式分水岭)+ §5 与 multimodal.md/risk.md 边界双向更新(原生记忆 state 引入新攻击面 + 多模态 benchmark 覆盖 待核)
反方 / 风险 (A) SkillRise GitHub URL 缺失:arXiv HTML 写「Our code is publicly available at .」但未给具体 URL · 复现门槛因此无法立即评估(flyp 0950 critical-read §主要问题 #1);(B) SkillRise 跨任务序列构造是隐含强假设:难度从简到难排序依赖「任务族 + 属性数量」等先验 · 论文未给「族划分错误率 vs 性能」的敏感性分析;(C) SkillRise 评测集偏窄:ALFWorld / WebShop / ScienceWorld 都是「文本环境下的离散动作」 · 缺真实 API 工具调用、缺多模态观察、缺长 horizon 跨日记忆场景 · 与 MemoryAgentBench 四能力 AR/TTL/LRU/CR 几乎不重叠;(D) Metis「原生记忆」边界条件不清晰:memory state 是 per-user / per-session 还是 per-model?论文未在摘要层明确 · 推测是 per-session · 这与 MemoryAgentBench 的「跨会话 agentic memory」目标不是一回事;(E) Metis 与外挂 RAG / Memory module 的 head-to-head 缺:摘要层面只与「无记忆」对比 · flyp 0950 critical-read §反方风险 #78 升级为 #78-P0;(F) Metis memory state 可解释性与可控性:memory attention 实际写入的「记忆」是什么?若不可读 → 隐私 / 监管 / 用户删除权等 risk 主线担忧;(G) Metis paper 许可 ≠ repo 许可 — 商业使用前必须单独确认 license;(H) Metis 评测多模态覆盖:42 页 / 14 表 + GitHub 给 benchmark 列表 · 但摘要未提多模态 · 如要做 multimodal memory 立标 candidate 需要追 §6 长上下文评测 + 表格 8–12 的数据集条目(待补查);(I) Metis 与 frontier lab 模型本体首位立标邻接 native memory 路线分水岭? Claude Mythos 5 / Opus 5 / Sonnet 5 / Fable 5 = 4 模型矩阵 + Kimi K3 主权开源 2.0 立标级 = 模型本体首位立标 第 15 阈值 邻接;(J) 跨实例协同:spark explainers/2607-26784.md 末尾补 GitHub URL 与对照 Awesome-Agent-Skills 横向表 · tom radar 把 SkillRise + Metis 与既有 radar(Graph-Native Bitemporal / Keep It InMind / MemoryAgentBench)做「2026 H2 agent memory 三联立:外挂四能力 vs 原生 foundation vs 时序有效系统」主题串联 · jay csdn 棒可做「Metis 复现实战」· risk 主线 Metis 持久原生记忆 state 是否引入新攻击面(stephen evening coord 确认 R33 → R34 边界节点)
建议归入节 §2.4 后训练 第 19-20 件 critical-read 闭环补全 + §2.4 范式六路线对立 native memory 形式化拆解补全 + §1.45 frontier lab 立标续立 第 9 栖候选 critical-read 闭环补全 + §3.1 共识 50-51 critical-read 落地 + §3.4 T118 候选延展 + §5 与 multimodal.md/risk.md 边界双向更新 + §4.1 开放问题 候选新增 90-93(SkillRise GitHub URL 缺 + Metis per-session vs per-user 边界 + Metis 外挂 RAG head-to-head + Metis 多模态评测覆盖)+ §6 必读清单 沿用 arXiv:2607.26784 + arXiv:2607.26760 第 175-176 条
重要边界 不要与 v34 §2.4 SkillOpt 混为同一件工作:SkillOpt = skills 编辑转化为训练过程(单任务),SkillRise = 跨任务技能演化的统一 RL 框架 = 单任务 vs 跨任务 不同对象;不要与 v34 §2.4 MSR Memora 谐波记忆 混为同一件工作:Memora = 双频段谐波记忆 + 时序解耦(外部模块),Metis = native memory in foundation model(内化) = 外部模块 vs 内化 不同对象;不要与 v34 §2.4 δ-mem steering attention 混为同一件工作:δ-mem = 8×8 矩阵 steering attention 存储对话历史(外部 adapter),Metis = native memory in foundation model(内化) = 外部 adapter vs 内化 不同对象;不要与 v34 §2.4 PRO-LONG 完整结构化日志 混为同一件工作:PRO-LONG = 编码 agent 在日志里检索(第一路线完整日志),Metis = 内化到基础模型本体(第六路线) = 第一路线 vs 第六路线 不同对象;不要与 v34 §2.4 AHE experience observability 混为同一件工作:AHE = component / experience / decision 三层可观测性(第三路线),Metis = native memory = 第三路线 vs 第六路线 不同对象

增量 2 · 🔴 P0 沿用升级 · flyp 7-31 15:50 VisualPatchWorld code-world-model-as-third-paradigm critical-read(17KB)补漏 + flyp 7-31 22:50 TurboVLA deconstruct-LLM-centric-VLA critical-read(11KB)补漏 = §1.44 WAM 知行鸿沟 第三范式候选补全 + §1.6 推理效率 + §1.7 VLA 立基础 = 「世界模型三范式 + LLM 解构派 VLA」 双立基础 7-31 闭环

字段 内容
来源 flyp 7-31 15:50 VisualPatchWorld-code-world-model-as-third-paradigm-critical-read.md(17.1KB / 158L · spark explainers/2607-25236.md 已落地科普视角 · 本稿为首次系统批判 · v34 §2.39.x 候补级 + §1.44 WAM 第三范式候选 沿用但缺 critical-read → 本稿补漏)+ flyp 7-31 22:50 TurboVLA-deconstruct-LLM-centric-VLA-critical-read.md(11.8KB / 122L · HF Daily 7-31 #2 · 120▲ · v34 §2.39.x 候补级 沿用但缺 critical-read → 本稿补漏 · 7-31 multimodal-e1prep §增量 2 TurboVLA 候补级升级候选 闭环)
arXiv 号 arXiv:2607.25236 v1 VisualPatchWorld(已立 paper_cards/649 · HKBU-KnowComp / Bai Jiaxin · GitHub HKBU-KnowComp/VisualPatchWorld 代码已开源 · 2026-07-28 03:23 UTC)+ arXiv:2607.27205 v1 TurboVLA(尚无 paper_card · Dingkang Liang et al. · GitHub H-EmbodVis/TurboVLA + HF H-EmbodVis/TurboVLA · 2026-07-29 17:59 UTC)
一句话 VisualPatchWorld(VPW) = 在世界模型两大成熟路线(神经预测器 / 手工物理引擎)之外正式立「代码世界模型」作为第三范式 = 形式由算法自动选 + 参数由数据拟合 + 对象是可执行 Python 程序 = 主动探针选定性形式 + 多步预测误差拟合自由参数 + MPC 滚动 + 选择性二次验证 = 在 LeWM 四任务套件上 69.0% 平均规划成功 + 超出最强代码基线 23.5 pp = v34 §1.44 WAM 知行鸿沟 第三范式立基础 · 与 WorldDiT(神经派 0.5 级候补)形成「飞 VS 暴增的方向对立」 · 「可读 vs 数据扩展」交易有水分:数据扩展性仅限同一定性形式内的参数拟合 · 一旦超出定性形式候选集(linear/damped/spring/contact-based)就无法表示 · LeWM 接触密集 pushing 已是明确短板 · 缺 WorldDiT/Dreamer/CWM 三方 head-to-head · 缺工业界对接案例 · 立标信号 B 旁证级;TurboVLA = 直面「VLA = LLM-centric V→L→A」这条自 RT-2 以来的隐性默认 · 把流程改写为 V + L → A = 视觉与语言独立编码、双向轻量交互、紧凑 action chunk decoder 直出 = 0.2B 参数 + 31.2 ms 推理延迟 + 0.9 GB 推理 VRAM + 32 Hz 控制频率 + 消费级 RTX 4090 = 在 LIBERO(仿真机器人操控基准)上达到 97.7% 平均成功率 = 与 Think in Tags / Chain-of-Action / Discrete Diffusion VLA / 7-29 WorldDiT v34 §2.39.x 走同一条「去 LLM-centric 化」路径 · 但 TurboVLA 更彻底 —— 直接跳过 LLM 这一中央接口 = 「LLM 解构派」立基础 · 范式声称边界窄:缺主流当代 VLA head-to-head(π0/OpenVLA-7B/Octo)+ OOD 长尾测试缺 + 真实机器人 success rate 表缺 + 「V+L→A」可能是「把 LLM 体积藏在 encoder 里」的形式变化 ≠ 范式跃迁 · 立标信号 B 旁证级
v34 第十三轮脉络关系 与 v34 §1.6 推理效率 + §1.7 VLA + §1.44 WAM 知行鸿沟 立基础 + §1.32 横切 52c 商业 Harness 学术化 + §2.6 第四十二/四十三/四十四子节立标级 + §3.3 Q105 反方集 同源;§1.44 WAM 知行鸿沟 第三范式候选补全 VisualPatchWorld critical-read 闭环(v34 §1.44 已立「神经预测器 + 物理引擎 + 代码世界模型」三联结构 · 但缺 VPW critical-read · 本稿补漏)+ §1.6 推理效率 TurboVLA V+L→A 直接融合 0.2B / 32Hz / <1GB RTX4090 立基础(v34 §1.6 推理效率已立 · 但缺 TurboVLA 立基础 · 本稿补漏 · 与 Think in Tags / Discrete Diffusion VLA 形成「LLM 解构三连」)+ §1.7 VLA 立基础 TurboVLA V+L→A 直接融合 0.2B = LLM 解构派立基础(v34 §1.7 VLA 立基础 已立 · 但缺 TurboVLA · 本稿补漏 · 与 WorldDiT 扩散式 VLA、Gemini Robotics 2 多模态 VLA、OpenVLA 7B 开源基线、π0 foundation VLA 并列)+ §3.3 反方集新增 2 条 #79(VPW)+ #80(TurboVLA)(v34 §3.3 反方集候选新增 5 条 #73-#77 沿用 · 本稿新增 2 条 候选反方问题)+ §7.1 引用 +2 件 #144(VPW)+ #145(TurboVLA)
反方 / 风险 (A) VPW 范式声称「同时具备神经预测器数据扩展 + 物理引擎可读性」有水分:数据扩展性仅限同一定性形式内的参数拟合 · 一旦任务物理超出定性形式候选集(目前公开是 linear/damped/spring/contact-based)代码模型就无法表示 · 对流体/柔性物体/铰链多体/可形变绳索/复杂多接触/生物组织这类物理没有 fit 阶段可以救的结构空间(flyp 7-31 15:50 critical-read §主要问题 A);(B) VPW LeWM 接触密集 pushing 已是明确短板:接触动力学本来是物理引擎对神经世界模型最稳健的优势域 · 代码模型在这里落后 → 「代码派」可能正好反向丢掉了它最应该强的地方;(C) VPW 缺 WorldDiT / Dreamer / DreamerV4 / GAIR-Nav / V-JEPA / DiT-based world model head-to-head:69.0% / +23.5 pp 是「相对代码 baseline」而非「相对神经 baseline」 · 立标价值因此降一档;(D) VPW 缺 Meta CWM(Code World Model 32B dense transformer)工作分工:CWM 是「代码本身的世界模型」(从程序执行 trace 学习) · VPW 是「视觉 / 物理世界的代码世界模型」 · 两者名字易混;(E) TurboVLA 「LLM-centric 等价于 V→L→A」是把现有 VLA 简化了:RT-2 是这种结构 · 但 π0 / OpenVLA / HPT / 3D-VLA / EO-1 等近期 VLA 早已做「V + L 早期融合 + LLM-as-backbone」的多通路并行 · TurboVLA 没有 head-to-head 对比 π0(参数同为 ~3B 量级但使用 LLM backbone)/ OpenVLA-7B / Octo · 等于先把对手压扁再打;(F) TurboVLA 「V + L → A」轻量取决于视觉与语言先验:0.2B 参数能拿到 97.7% LIBERO · 高度依赖视觉 backbone 的预训练质量(推测用 SigLIP / DINOv2 类强 backbone)和语言编码器(推测用 Llama 蒸馏或 CLIP text tower) · 真正的 LLM 体积可能被「借」到了 V encoder / L encoder 里;(G) TurboVLA 仿真 → 真实硬件迁移鸿沟是这道题的死穴:LIBERO 是固定物体集 + 固定任务模板 + 仿真物理的 benchmark · sim2real gap 巨大 · README 的「real-world tasks GIF」只有图 · 没有 real-world 任务的成功率表 / 平均轨迹长度 / 与 OpenVLA / π0 的 head-to-head 对比;(H) TurboVLA 31.2 ms 是孤立 latency 不是 closed-loop cycle time:加上 I/O / 通信 / 执行器响应 · 真实闭环频率可能远低于 32 Hz · 论文需要给出 end-to-end closed-loop cycle time;(I) TurboVLA 0.9 GB VRAM 是「推理 VRAM」,不含 ROS / 视觉采集 / 状态估计 / 安全监控 等部署必需模块的常驻内存;(J) TurboVLA action chunk decoder 是否处理 safety constraint:没有 LLM 中介意味着没有 LLM-based commonsense safety 检查;(K) TurboVLA vs diffusion-based VLA 在相同参数预算下的对比缺 · 如果 diffusion-based 0.2B 模型也能达到 95%+ · 「范式突破」就只是工程优化,不是范式创新;(L) TurboVLA 「双向轻量 vision-language 交互」细节是论文最弱部分:多少层 cross-attention?多少个 token?Q/K/V 维度多少?交互频率如何?这些才是判断「真轻量还是假轻量」的关键数字
建议归入节 §1.6 推理效率 新增「TurboVLA V+L→A 直接融合 0.2B / 32Hz / <1GB RTX4090」立基础 + §1.7 VLA 立基础 新增「TurboVLA LLM 解构派立基础」 + §1.44 WAM 知行鸿沟 第三范式候选补全 VisualPatchWorld critical-read + §3.3 反方集新增 #79(VPW)+ #80(TurboVLA) + §7.1 引用 +2 件 #144(VPW)+ #145(TurboVLA) + §4.1 开放问题 候选新增 94-95(VPW WorldDiT head-to-head 缺 + TurboVLA OOD 长尾 + 真实机器人 success rate 表缺)
重要边界 不要与 v34 §2.39.x WorldDiT 候选级 混为同一件工作:WorldDiT = sub-billion 统一 DiT VLA + 最小 world head(frozen encoder + auxiliary RGB supervision) = 神经派 + 极简世界头,VPW = 代码派(代码作为潜变量结构化表示) = 神经派 vs 代码派 不同对象;不要与 v34 §1.7 VLA Gemini Robotics 2 三件套 混为同一件工作:Gemini Robotics 2 = 全身 VLA 模型 + ER 2 推理 + On-Device 2 端侧推理 = 闭源 LLM-centric VLA 工业级落地锚定,TurboVLA = 开源 0.2B V+L→A 直接融合 0.2B = LLM 解构派 = 闭源 LLM-centric vs 开源 LLM 解构派 不同对象;不要与 v34 §1.6 推理效率 Think in Tags / Chain-of-Action / Discrete Diffusion VLA 混为同一件工作:Think in Tags / CoA / Discrete Diffusion VLA = LLM 解构派(替换 LLM 内部解码方式),TurboVLA = LLM 解构派(直接跳过 LLM 这一中央接口) = LLM 内部解码 vs 完全跳过 LLM 不同对象;不要与 v34 §2.6 第四十二子节 Metis Memory Foundation Model 混为同一件工作:Metis = 内化原生记忆(LLM 本体),VPW = 代码世界模型 = 记忆 vs 世界模型 不同对象

增量 3 · 🔴 P0 沿用升级 · tom 7-31 21:43 radar v2 4 P0 立标候选 = DualG-MRAG + GLM-RAG + MisKnow-Agent + Filesystem-Based Memory = 「多模态 RAG 宏/微解耦 + KG-RAG 首个大规模对比 + Deep Research 误导知识传播量化 + 文件系统记忆首个系统性评估」 四联立标 7-31 net-new

字段 内容
来源 tom 7-31 21:43 agent-rag-longcontext-radar v2(4.5KB / 80L · 4 高价值 + 4 中价值 + 1 Substack · 4 P0 高价值 net-new = DualG-MRAG + GLM-RAG + MisKnow-Agent + Filesystem-Based Memory)+ jay 7-31 21:07 evening briefing MisKnow-Agent 沿用 + stephen 7-31 2245 evening coord §三 §增量 4 「MisKnow-Agent Deep Research 误导知识传播量化」 = 🟡 P0 完全新立标 agent/rag + flyp 7-31 risk-e1prep §增量 3 邻接 + tom 7-31 rag-e1prep R50 §增量 4 候选 Filesystem-Based Memory 邻接 + tom 7-31 agent-rag-longcontext-radar §📡 值得追踪 #4 Filesystem-Based Memory + paper_cards/ 待建 4 张(DualG-MRAG 674 / GLM-RAG 675 + MisKnow-Agent 待补 + Filesystem-Based Memory 待补)
arXiv 号 arXiv:2607.28580 v1 DualG-MRAG(已立 paper_cards/674 · Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li · 2026-07-30 · cs.CV + cs.IR · 主分类 rag 副分类 multimodal)+ arXiv:2607.28397 v1 GLM-RAG(已立 paper_cards/675 · Maya Arseven, Anette Frank, Beni Egressy, Johann Higl, Moritz Plenz · 2026-07-30 · cs.CL · 主分类 rag 形态 method)+ arXiv:2607.20891 MisKnow-Agent(尚无 paper_card · MisKnow-Agent 框架 · Deep Research 误导知识传播量化 · 2026-07-22 · cs.CL · 主分类 agent 副分类 rag)+ arXiv:2607.26637 Filesystem-Based Memory(尚无 paper_card · 「代理用文件系统当记忆」首个系统性研究 · 三个假设 = 能否保持组织 + 能否处理冲突和过期 + 能否产生净收益 · 2026-07-28 · 主分类 agent 副分类 rag memory benchmark)
一句话 4 件 P0 立标候选:① DualG-MRAG = 多模态 RAG 宏/微推理解耦 = 宏推理(跨模态关系建模)+ 微匹配(实例级对齐)双路驱动 · 解决 MM-RAG 多跳推理要么粒度太粗丢失关键证据要么粒度太细导致图爆炸 = 多模态 RAG 核心难题的结构化解法 · v34 §2.4 上下文管理 范式六路线对立 第七路线候选 「macro-micro decoupled retrieval」邻接;② GLM-RAG = 系统对比 GLM-based + GNN-based + vector-search 三类 retriever 在单跳/多跳 KG-RAG 上的表现 = KG-RAG 首个大规模对比研究 · 对架构决策有直接影响 = v34 §2.3 评测表 22 行 邻接 第 27 行候选新增;③ MisKnow-Agent = MisKnow-Agent 框架 = 构造并验证误导性知识 · 研究其如何通过规划 → 检索 → 合成 的 Deep Research 工作流传播为假结论 = RAG 系统真实可靠性问题被正式量化 · 生产级系统必读 = v34 §2.5 安全契约 11 阶 + StealthBench 邻接 第 90 节点候选;④ Filesystem-Based Memory = 首个对「代理用文件系统当记忆」这一默认方案的系统性研究 · 测试三个假设(能否保持组织 + 能否处理冲突和过期 + 能否产生净收益) = 很多生产 Agent 在用这个范式 · 但从未被系统评估过 · 基准研究价值高 = v34 §2.4 上下文管理 范式五路线对立 第四路线「文件系统即上下文」首个系统性评估 anchor
v34 第十三轮脉络关系 与 v34 §1.41 横切 60-66 v23 主轴 + §1.43 横切 80 Why Agents Fail 11 件套 + §1.45 frontier lab 立标 + §2.3 评测表 22 行 + §2.4 上下文管理 范式六路线对立 + §2.5 安全契约 11 阶 + 86 节点 + §2.6 42 子节立标级 同源;§2.3 评测表 22 → 27 行候选新增 GLM-RAG(v34 §2.3 22 行已饱和 · 本稿新增第 27 行 KG-RAG 首个大规模对比)+ §2.4 上下文管理 范式六路线对立 第七路线候选 macro-micro decoupled retrieval 邻接补全 DualG-MRAG(v34 §2.4 六路线对立已立 · 本稿新增第七路线候选 「macro-micro decoupled retrieval」)+ §2.4 上下文管理 范式五路线对立 第四路线「文件系统即上下文」首个系统性评估 anchor 候选新增 Filesystem-Based Memory(v34 §2.4 文件系统即上下文 第四路线 沿用 · 缺系统性评估 · 本稿补漏)+ §2.5 第 90 节点候选新增 MisKnow-Agent Deep Research 误导知识传播量化(v34 §2.5 86-89 节点已立 · 本稿新增第 90 节点) + §1.43 横切 80 第 18-21 件候选新增 4 件(RAG 范式转折 + Deep Research 可靠性 + 文件系统记忆评估 + KG-RAG 大规模对比)+ §3.1 共识 54 候选新增 MisKnow-Agent 误导知识传播量化立基础 + §3.4 T120-T122 候选新增 + §4.1 开放问题 候选新增 96-99(DualG-MRAG 多模态粒度 trade-off + GLM-RAG KG-RAG 选型指导 + MisKnow-Agent 缓解策略 + Filesystem-Based Memory 范式边界)
反方 / 风险 (A) DualG-MRAG 粒度 trade-off:宏推理与微匹配的边界如何定义 · 跨模态关系建模与实例级对齐的协同机制 · 缺 head-to-head 对比 + 与 Beyond Relevance-Centric Retrieval arXiv:2607.19747 + A New Role for Relevance arXiv:2607.24223 三角关系;(B) GLM-RAG 三个 retriever head-to-head 是否覆盖所有 KG 复杂度:简单的单跳 KG 与复杂多跳 KG 的区分是否足够细;(C) MisKnow-Agent 缓解策略缺:构造并验证误导性知识 + 量化传播是「识别」能力 · 「缓解」能力是否在论文中给出 · 与 StealthBench offensive-security Agent OPSEC 攻击 vs MisKnow-Agent Deep Research 误导知识传播 = 「攻击 vs 误导」两面性 待核;(D) Filesystem-Based Memory 三个假设的可证伪性:「能否保持组织」如何定义 + 「能否处理冲突和过期」如何量化 + 「能否产生净收益」对比基线是什么 · 论文的方法论是否足够严谨;(E) Filesystem-Based Memory 与 Markdown Memory Paradigm 工业级 Agent 厂商记忆原语对比:Manus / OpenClaw / Claude Code 文件系统即上下文 · 「Agent-local 文件系统 vs 跨 Agent 共享文件系统」边界条件 待核;(F) MisKnow-Agent 与 Anthropic Project Glasswing「守护全球软件安全」关联:Glasswing 关注软件安全 · MisKnow-Agent 关注 RAG 可靠性 · 是否构成「Agent 可靠性 + 安全性」二联立标层;(G) Filesystem-Based Memory 与 Graph-Native Bitemporal Memory Store 工程化实现对比:Bitemporal = Neo4j 属性图 + HNSW + valid time + transaction time · Filesystem-Based = 简单文件系统 · 二者工程化成熟度差距 与 「原生设计 vs 即兴拼接」哲学差异 待核;(H) 4 件立标候选主分类为 rag / agent 但跨邻接 multimodal / systems / safety / evaluation 多主题:v34 coding-agents.md 收录边界需精确划定;(I) MisKnow-Agent + Filesystem-Based Memory 2 件 paper_card 待补 = pipeline 漏斗节点 8-1 截止前必须补建卡
建议归入节 §1.43 横切 80 第 18-21 件候选新增 4 件 + §2.3 评测表 22 → 27 行候选新增 GLM-RAG + §2.4 上下文管理 范式六路线对立 第七路线候选 macro-micro decoupled retrieval 邻接补全 DualG-MRAG + §2.4 第四路线「文件系统即上下文」首个系统性评估 anchor 候选新增 Filesystem-Based Memory + §2.5 第 90 节点候选新增 MisKnow-Agent + §3.1 共识 54 候选新增 + §3.4 T120-T122 候选新增 + §4.1 开放问题 候选新增 96-99 + §6 必读清单 第 177-180 条
重要边界 不要与 v34 §2.4 BeyondUncertainty verbalized confidence 路由检索 混为同一件工作:BeyondUncertainty = 第三类 RAG 路由范式(verbalized confidence 路由检索),DualG-MRAG = 第四类 RAG 路由范式(macro-micro decoupled retrieval) = 不同 RAG 范式;不要与 v34 §2.3 Kontrast 跨文本/表格/KG 知识一致性 混为同一件工作:Kontrast = 知识一致性检测,GLM-RAG = KG-RAG 三 retriever 选型对比 = 一致性 vs 选型 不同对象;不要与 v34 §2.5 StealthBench 自主 offensive-security Agent operational stealth 评测 混为同一件工作:StealthBench = 攻击面 + OPSEC 进攻隐蔽性,MisKnow-Agent = Deep Research 误导知识传播量化 = 攻击面 vs 可靠性 不同对象;不要与 v34 §2.4 Markdown Memory Paradigm 工业级 Agent 厂商记忆原语 混为同一件工作:Markdown Memory = 工业级范式描述,Filesystem-Based Memory = 首个系统性评估 = 范式 vs 评估 不同对象;不要与 v34 §2.4 Graph-Native Bitemporal Memory Store 工程化实现 混为同一件工作:Bitemporal = Neo4j 属性图 + HNSW + 双向时态,Filesystem-Based = 简单文件系统 + 三个假设评估 = 工程化实现 vs 系统性评估 不同对象

增量 4 · 🟠 P0 警示延展 · StealthBench 升级 P3→P0 警示 + Metis memory-as-attack-surface 首例信号 = R33 → R34 边界节点 = 「攻击面 + 跨 lab 密码学 + 原生持久记忆 attack surface」安全五联立标层 = flyp risk-e1prep §增量 1-2 + stephen 2245 evening coord §三 §4.1

字段 内容
来源 flyp 7-31 16:39 risk-e1prep 第 5 棒 §增量 1 StealthBench 🟠 P0 警示(Mythos 立标级升级 第 3 拍实证化 · jay engineering-v40 §增量 3 + stephen ai-industry-v33 §1.1 paper_cards/664 增量 1)+ §增量 2 Metis 🟡 P1 立标候选 + memory-as-attack-surface 首例信号 + stephen 7-31 2245 evening coord §三 §4.1「Metis memory foundation model + memory-as-attack-surface 首例」 + §5.5「R33 → R34 边界节点信号」+ §四「8 件本场新警示」+ §「StealthBench + Metis memory-as-attack-surface R33→R34 边界节点」+ stephen 7-31 1245 noon 协调棒 §2.8 risk 主题 + stephen 7-31 ai-industry-e1prep-v33 §增量 1 paper_cards/664 + spark 7-31 agent-e1prep-v36 §增量 4(⭐⭐⭐⭐⭐ 立标级 · jay engineering-v40 §增量 3 + stephen ai-industry-v33 paper_cards/664 增量 1)+ tom 7-31 agent-rag-longcontext-radar §📡 值得追踪 #4 StealthBench + paper_cards/664-2607-26314.md 7-30 已建卡(主分类 agent 形态 benchmark · 6 OPSEC 维度 · 11 hand-verified OPSEC incidents from real-world APT reports · Cyber-Capable containment 邻接补全)
arXiv 号 arXiv:2607.26314 StealthBench(已立 paper_cards/664 · 自报 arXiv 编号 2607.26314 · 主分类 agent 形态 benchmark · 6 OPSEC 维度 · 11 hand-verified OPSEC incidents)+ arXiv:2607.26760 v1 Metis(已立 paper_cards/658 · 主分类 agent 形态 method)
一句话 StealthBench = 自主 offensive-security Agent operational stealth 评测 · 6 OPSEC 维度 · 11 hand-verified OPSEC incidents from real-world APT reports = Cyber-Capable containment 评估的对位补充 · v34 §2.5 第 88 节点 已立 · 本稿升级 P3 邻接 → P0 警示(Mythos Preview 立标级升级 第 3 拍实证化);Metis memory-as-attack-surface 首例信号 = 原生持久记忆 state 引入新攻击面 = 「memory-as-attack-surface」三联立 = 原生记忆(per-session memory state) + 持久动态演化(memory attention) + 不可读(memory slot 写入内容不可读) + 权重冻结无梯度前向(无法外部干预) = 监管/隐私/用户删除权/GDPR 删除权 四面风险 = R33 → R34 边界节点 = 与 Cyber-Capable AI Agents containment + StealthBench OPSEC 进攻隐蔽性 形成「memory-as-attack-surface」三联立 · flyp risk-e1prep §增量 2 防御表新增 1 行 L3 = 防御表 76 → 77 行
v34 第十三轮脉络关系 与 v34 §2.5 安全契约 11 阶 + 86 节点 + Agent 安全三联立标层 + StealthBench 第 88 节点 + Metis Memory Foundation Model + MemoryAgentBench 四能力 + Memory Survey + §1.45 frontier lab 立标 §6 行业升级 + §3.1 共识 + §3.2 争议 + §4.1 开放问题 同源;§2.5 第 88 节点 StealthBench P3 → P0 警示升级(v34 §2.5 已立第 88 节点 · 本稿升级 P0 警示 · 与 Mythos Preview + Project Glasswing + Microsoft SymCrypt Rust 形成 frontier lab × 安全工程 第 5 次协同披露)+ §2.5 第 91 节点候选新增 Metis memory-as-attack-surface 首例信号(v34 §2.5 86-89 节点已立 · 本稿新增第 90-91 节点)+ §5 与 risk.md 边界双向更新(Metis 原生持久记忆 state 引入新攻击面 + Cyber-Capable + StealthBench 三联立)= 「攻击面 + 防御清单 + 落地实现 + 原生持久记忆 attack surface」安全四联立标层 + §3.1 共识 55 候选新增 Metis memory-as-attack-surface 首例 + §4.1 开放问题 候选新增 100-103(Metis memory state per-session vs per-user 边界 + memory attention 可解释性 + memory state 是否可被外部操纵 + GDPR 删除权兼容性)
反方 / 风险 (A) StealthBench 6 OPSEC 维度是否覆盖 C2 隐蔽性(network 层面 beacon 间隔 / Jitter / 域前置)与 MITRE ATT&CK framework 对照 待核(jay engineering-v40 已列);(B) StealthBench 11 hand-verified OPSEC incidents vs Cyber-Capable 五大漏洞类 head-to-head 待核 + 与 OWASP ASI 防御清单 + microsoft/agent-governance-toolkit 落地实现 三角互补性 待核;(C) Metis memory state per-session vs per-user 边界:摘要层面未明确 · 推测是 per-session · 与 MemoryAgentBench 的「跨会话 agentic memory」目标不是一回事;(D) Metis memory attention 可解释性:memory slot 实际写入内容是否可读 · 若不可读 → 隐私 / 监管 / 用户删除权等 risk 主线担忧 · 与 GDPR 删除权(right to be forgotten)兼容性;(E) Metis memory state 是否可被外部操纵引入新攻击面 = 持久化 + 不可读 + 权重冻结 = 「memory poisoning」攻击面扩大;(F) 原生记忆 vs 外挂记忆 attack surface 量化对照未公开;(G) Anthropic Mythos Preview AES Möbius Bridge 思维链 + Project Glasswing + Microsoft SymCrypt Rust 跨 lab 密码学立体验证 vs Metis 持久记忆 = frontier lab 实战 vs 学术持久记忆 attack surface 二维对比;(H) 「memory-as-attack-surface」三联立标层 vs OWASP ASI ASI01-ASI10 防御清单 head-to-head 待核;(I) Metis 与 frontier lab 模型本体首位立标邻接 native memory 路线分水岭? Claude Mythos 5 / Opus 5 / Sonnet 5 / Fable 5 = 4 模型矩阵 + Kimi K3 主权开源 2.0 立标级 = 模型本体首位立标 第 15 阈值 邻接
建议归入节 §2.5 第 88 节点 StealthBench P3 → P0 警示升级 + §2.5 第 91 节点候选新增 Metis memory-as-attack-surface 首例 + §5 与 risk.md 边界双向更新 + §1.45 frontier lab 立标 §6 行业升级 第 7-8 件合并 + §3.1 共识 55 候选新增 + §3.4 T123 候选新增 memory-as-attack-surface + §4.1 开放问题 候选新增 100-103 + §6 必读清单 第 181-182 条
重要边界 不要与 v34 §2.5 HF 2026-07 安全入侵 混为同一件工作:HF 7 月安全事故 = 17,000+ 离散操作 + 跨沙箱群 + 自迁移 C2,StealthBench = 自主 offensive-security Agent operational stealth 评测 = HF 实战 vs 学术评测 不同对象;不要与 v34 §2.5 Cyber-Capable AI Agents containment 评估框架 混为同一件工作:Cyber-Capable = 攻击面 + containment 评估,StealthBench = OPSEC 进攻隐蔽性 评测 = 攻击面 vs OPSEC 不同维度;不要与 v34 §2.4 Metis Memory Foundation Model 混为同一件工作:Metis = 内化原生记忆(方法论立基础),Metis memory-as-attack-surface = 持久记忆 state 引入新攻击面(风险立基础) = 方法论 vs 风险 不同对象;不要与 v34 §2.5 OWASP Agent Top 10 2026 ASI01-ASI10 混为同一件工作:OWASP ASI = 防御清单,StealthBench = OPSEC 评测 = 防御 vs 评测 不同对象

增量 5 · 🔴 P0 沿用升级 · Anthropic 7-30 NEW「调查我们网络安全评估中的三起真实事件」+ CVE-2026-22778 vLLM CVSS 9.8 致命漏洞 + OpenAI 7-30 NEW 4 件集中 + DeepMind 7-30 Gemini Robotics 2 三件套 + GPT-5.6 Luna/Terra 价格战 = frontier lab × 安全工程 第 5 次协同披露 + 「vLLM 框架 CVE + Cyber-Capable 学术 + StealthBench OPSEC + Anthropic 实战 + Metis 持久记忆」安全五联立标层

字段 内容
来源 stephen 7-31 1003 news-anthropic-news #1 7-30 NEW「调查我们网络安全评估中的三起真实事件」+ #4 Mythos Preview AES Möbius Bridge 思维链(沿用 7-30)+ stephen 7-31 0910 news-x-vip-radar #4 Anthropic 7-28 Mythos Preview HAWK 后量子签名结构性弱点 + AES 攻击路径改进(同步)+ jay 7-31 1000 rss-simon-willison #2「在我们的网络安全评估中调查三起真实事件」同源+ stephen 7-31 ai-industry-e1prep-v33 §增量 6(⭐⭐⭐⭐ · Anthropic 7-30 NEW「调查三起真实事件」+ Mythos Preview AES Möbius Bridge 思维链 + HAWK 沿用 = frontier lab × 安全工程 第 5 次协同披露)+ jay 7-31 21:07 evening briefing CVE-2026-22778 vLLM 致命漏洞 CVSS 9.8 P0 + Opus 4.7 真实系统攻击事件 + Mythos 5 自我说服 + jay 7-31 1003 news-openai-news 7-30 NEW 4 件集中(GPT-5.6 Luna 80% 降幅 + Terra 20% 降幅 + avatarin GPT-Realtime 7×24 零售 Agent + ChatGPT for Academic Researchers 1 万→10 万)+ stephen 7-31 1003 news-deepmind-news 7-30 NEW Gemini Robotics 2 三件套(全身体 VLA + ER 2 推理 + On-Device 2 端侧推理 + Apptronik Apollo 2 / Duo 同台演示打结拧灯泡)+ stephen 7-31 1245 noon 协调棒 §2.8 risk 主题「stephen ai-industry-v33 Anthropic 安全工程 5 件披露」
arXiv 号 无(Anthropic 平台层文档 + jay evening briefing 安全事件 + OpenAI blog + DeepMind blog + vLLM CVE + GPT-5.6 价格战)
一句话 Anthropic 7-30 NEW 5 件披露:① 「调查我们网络安全评估中的三起真实事件」(沿用 7-29「使用 Claude 发现密码学弱点」+「我们对开放权重模型的立场」+ 7-30 NEW Mythos Preview AES Möbius Bridge 思维链 + Project Glasswing = frontier lab × 安全工程 第 5 次协同披露 · 评测 → 系统卡 → 评论 → 红队 → 密码学弱点发现 → 跨 lab 密码学立体验证 → HF 入侵剖析连续披露 7 天 → Anthropic 网络安全评估 7 天 8 栖验证 第 2 例)+ ② HAWK 后量子签名结构性弱点 + AES 攻击路径改进(沿用 7-28 Mythos Preview);OpenAI 7-30 NEW 4 件集中:① GPT-5.6 Luna 80% 降幅 + Terra 20% 降幅 = 价格战立标;② avatarin GPT-Realtime 7×24 零售 Agent 30,000 用户 / 92% 正面反馈 = retail agent 实战立标;③ 启用两项设置让 ARC-AGI-3 分数提升三倍(保留推理 + 启用上下文压缩)= ARC-AGI-3 三倍设置立标;④ ChatGPT for Academic Researchers 1 万 → 10 万免费访问 = 学术研究者立基础;DeepMind 7-30 Gemini Robotics 2 三件套:① Gemini Robotics 2 全身智能 + ② Gemini Robotics ER 2 视频理解/任务编排/多机器人协作 + ③ Gemini Robotics On-Device 2 端侧推理 + ④ Apptronik Apollo 2 / Duo 同台演示打结拧灯泡 = frontier lab × 全身 humanoid VLA 工业级落地锚定(主战场在 DeepMind 机器人路线 + 全身 humanoid VLA 工业级落地锚定)+ vLLM CVE-2026-22778 CVSS 9.8 致命漏洞 P0 警示(jay 7-31 21:07 evening briefing 第五件 + CVE-2026-22778 vLLM CVSS 9.8 P0)= 「vLLM 框架 CVE + Cyber-Capable 学术 + StealthBench OPSEC + Anthropic 实战 + Metis 持久记忆」安全五联立标层
v34 第十三轮脉络关系 与 v34 §1.41 横切 60-66 v23 主轴 + §1.45 五向合流 + §2.5 第十一阶段 Isolation-as-First-Class + §2.103 段尾「评论层长尾 7-25~7-30 持续 8-10 媒体续立」+ §3.1 共识 35 + §4.1 开放问题 47 + 增量 4 StealthBench + Metis memory-as-attack-surface 安全四联立标层 同源;§1.41 横切 60-66 v23 十一件主轴持续沿用(Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot + Mythos Preview AES Möbius Bridge 思维链 + Anthropic 网络安全评估三起真实事件 = 11 件 frontier model / 平台层立标)+ §1.45 frontier lab 立标 §6 行业升级 候选新增 7-10 件 = Anthropic 7-30 NEW「调查三起真实事件」+ Project Glasswing + HF 7-29「Frontier Lab Agent 入侵剖析」+ Microsoft SymCrypt Rust + Managed Agents Gemini API 3.6 Flash + TLDR AI 7-28 头条三件 + Dario 开源权重立场 vs 监管打压指控 公开对峙 + OpenAI 7-30 NEW GPT-5.6 Luna/Terra 价格战立标 + DeepMind Gemini Robotics 2 三件套 + vLLM CVE-2026-22778 CVSS 9.8 P0 警示 + §2.103 段尾「评论层长尾 7-25~7-31 持续 9-11 媒体续立」标注 + §2.5 第十一阶段 Isolation-as-First-Class 邻接补全 + §3.1 共识 56 候选新增 frontier lab × AI 平台层安全协作 第 5 例 + vLLM 框架 CVE 安全 P0 警示
反方 / 风险 (A) Anthropic「调查三起真实事件」具体攻击向量 vs Cyber-Capable 五大漏洞类 vs StealthBench OPSEC 维度 vs Metis memory-as-attack-surface 四维 head-to-head 实证 待核;(B) vLLM CVE-2026-22778 CVSS 9.8 vs Oracle 4 RCE CVE(CVE-2026-61447 PraisonAI + CVE-2026-54769 Langroid + CVE-2026-57572 Crawl4AI + CVE-2026-59726 Ruflo)head-to-head 实证 待核;(C) OpenAI GPT-5.6 Luna 80% 降幅 + Terra 20% 降幅 与 Claude Mythos Preview / Sonnet 5 / Opus 5 价格对比 待核;(D) DeepMind Gemini Robotics 2 全身智能 vs Physical Intelligence π0 / 1X Neo / Figure 02 / Tesla Optimus 工业级落地 head-to-head 实证 待核;(E) DeepMind Gemini Robotics On-Device 2 端侧推理 vs TurboVLA 0.2B / 32Hz / <1GB RTX4090 端侧 VLA head-to-head 实证 待核;(F) Anthropic 7-30 NEW 5 件披露 与 Project Glasswing 边界 = Glasswing 关注软件安全 vs 三起真实事件关注网络安全评估 = 软件 vs 网络安全不同;(G) 「评测 → 系统卡 → 评论 → 红队 → 密码学弱点发现 → 跨 lab 密码学立体验证 → HF 入侵剖析连续披露 7 天 → Anthropic 网络安全评估 7 天 8 栖验证 第 2 例」8 栖验证 vs SDB §2.6 第四十二子节契约 关系 待核;(H) DeepMind Gemini Robotics 2 三件套系统卡 / 评测方法学 / 真实硬件 success rate 表 缺;(I) OpenAI avatarin GPT-Realtime 7×24 零售 Agent 30,000 用户 / 92% 正面反馈 数据来源 / 评测方法 / 与 Anthropic Computer Use + 国内各家 + Gemini 3.5 Flash 计算机使用 CUA 四栖竞速 head-to-head 实证 待核
建议归入节 §1.41 横切 60-66 v23 十一件主轴持续沿用 + §1.45 frontier lab 立标 §6 行业升级 候选新增 7-10 件 + §2.5 第十一阶段 Isolation-as-First-Class 邻接补全 + §2.5 第十一阶段 vLLM CVE-2026-22778 CVSS 9.8 P0 警示 邻接补全 + §2.6 评测第 7 阶邻接补全 + §2.103 段尾「评论层长尾 7-25~7-31 持续 9-11 媒体续立」标注 + §3.1 共识 56 候选新增 + §4.1 开放问题 候选新增 104-110
重要边界 不要与 v34 §2.5 Anthropic Mythos Preview 7-30 NEW 混为同一件工作:Mythos Preview = 在发现 AES Möbius Bridge 中的思维链(密码学弱点发现),Anthropic 7-30 NEW「调查三起真实事件」= 网络安全评估实战披露 = 密码学 vs 网络安全不同对象;不要与 v34 §2.5 Project Glasswing 守护全球软件安全 混为同一件工作:Glasswing = 软件安全,「三起真实事件」= 网络安全评估 = 软件 vs 网络安全不同;不要与 v34 §2.5 HF 2026-07 安全入侵 混为同一件工作:HF 7 月安全事故 = 17,000+ 离散操作 + 跨沙箱群 + 自迁移 C2,Anthropic 7-30 NEW = 7 天 8 栖验证 第 2 例 = HF 实战 vs Anthropic 披露 不同对象;不要与 v34 §2.5 Oracle 4 RCE CVE 混为同一件工作:Oracle 4 RCE CVE = PraisonAI + Langroid + Crawl4AI + Ruflo = agent 框架 CVE,vLLM CVE-2026-22778 = vLLM 推理框架 CVE = agent 框架 vs 推理框架 不同对象;不要与 v34 §1.45 frontier lab 立标 第 7 栖 Anthropic 经济测度产品化 混为同一件工作:Anthropic 经济测度 = 测度产品化 + 治理研究,Anthropic 7-30 NEW「调查三起真实事件」= 网络安全评估 = 测度 vs 网络安全不同;不要与增量 4 增量 StealthBench 混为同一件工作:StealthBench = 自主 offensive-security Agent operational stealth 评测(学术),Anthropic 7-30 NEW「调查三起真实事件」= frontier lab 实战层 = 学术 vs 实战 不同对象

增量 6 · 🟡 P1 沿用升级 + 🟡 P1 监测 · CoRT + DecoEvo 评测器协同演化立基础 + MindForge + SpecFirst 从零构建程序双向突破 + tom inference 第 6 日 E1 恢复延续 + AAAI Subramanian 第三批截止 + spark 节奏反转第 7 棒独立 E1 缺失窗口确认

字段 内容
来源 CoRT arXiv:2607.25659(已立 paper_cards/663 · HF Daily 7-31 75▲ #5 · tom 7-31 evaluation-e1prep §增量 1 P1 确认)+ DecoEvo arXiv:2607.25675(已立 paper_cards/660 · HF Daily 7-31 54▲ #8 · tom 7-31 evaluation-e1prep §增量 2 P1 确认)+ MindForge arXiv:2607.27146(已立 paper_cards/669 · HF Daily 7-31 17▲ #15 · spark 7-31 agent-e1prep-v36 §增量 7 🟢 P1 邻接 + tom 7-31 rag-e1prep §增量 3 ⭐⭐⭐ 中 + paper_cards/669 已建卡 主分类 agent 形态 method)+ SpecFirst arXiv:2607.27167(已立 paper_cards/670 · HF Daily 7-31 15▲ #17 · spark 7-31 agent-e1prep-v36 §增量 7 🟢 P1 邻接 + tom 7-31 rag-e1prep §增量 4 ⭐⭐⭐ 中 + paper_cards/670 已建卡 主分类 agent 形态 benchmark)+ tom 7-31 22:22 inference-e1prep(stephen 7-31 2245 evening coord §三 §增量 2 「tom inference 第 6 日 E1 已恢复」)+ AAAI Subramanian 7-31 第三批验证截止(stephen 7-31 noon + evening coord §三 §3 「AAAI Subramanian 7 反方 7-31 第三批验证截止」 · 截止已过 补救策略待决)+ spark 节奏反转第 7 棒独立 E1 缺失窗口确认(stephen 7-31 noon coord §六 + evening coord §三 + spark 7-31 morning 仅 3 RSS 通稿 · 7-30 第 6 棒 + 7-31 第 7 棒独立 E1 缺失窗口 = 节奏反转后第 7 棒 = 与 7-30 第 6 棒一致·延续)
arXiv 号 arXiv:2607.25659 CoRT(已立 paper_cards/663)+ arXiv:2607.25675 DecoEvo(已立 paper_cards/660)+ arXiv:2607.27146 MindForge(已立 paper_cards/669)+ arXiv:2607.27167 SpecFirst(已立 paper_cards/670)+ arXiv:2602.23368v1 AAAI Subramanian(v34 §2.3 评测表 22 行 已核)
一句话 4 件 P1 沿用升级:① CoRT = Token 级 Rubric 引导策略优化的反事实回放 = 将 credit assignment 从 response 级别下沉到 token 级别 + DRIFT per-token forward/reverse KL 凸混合 + 三大失效模式(冷启动崩溃/状态无关调度/稀疏二元 reward)= §2.4 后训练 第 21 件候选 + §2.4 Judge & Harness 工程 新增 token 级 credit assignment 子节 + §2.5 评测方法学批判 GRPO scalar reward broadcast 工程化修复方案;② DecoEvo = Solver 与 Rubric-Generator 技能分数解耦协同演化 = 「固定评测器导致优化瓶颈」批判 + rubric 更新必须独立于 solver 当前得分 = §2.4 后训练 第 22 件候选 + §2.4 Judge & Harness 工程 + §2.5 评测方法学批判 新增评测器协同演化框架;③ MindForge = 编码 Agent 全生命周期软件工程训练环境(ProgramBench <1% 解决率 · 从零构建完整程序的难题)· 现有环境构建框架只覆盖单一开发阶段(bug 修复 / 特征实现 / 修改现有代码库) · MindForge 将整个软件工程生命周期自动化构建为训练环境 = §2.4 后训练 第 23 件候选 + §2.6 第四十七子节候选新增;④ SpecFirst = 行为规约获取作为 Agent 程序合成一等公民步骤 = 现有框架将文档阅读、行为探索、代码合成混为单次 pass 导致行为意图漂移、早期误读传播、探索不足 · SpecFirst 将规范获取(spec elicitation)作为 agent 程序合成的一等公民步骤 = §2.4 后训练 第 24 件候选 + §2.6 第四十八子节候选新增;MindForge + SpecFirst 双件套同日发布 = 同一时间节点两个团队押注同一方向 · 与 arXiv:2607.25431 CodeNib(HF Daily 7-30 43▲ · 多视图代码 Agent 数据系统)+ VisualPatchWorld(代码世界模型)形成「代码 Agent 上下游」主题页骨架 + 与 FROAV arXiv:2601.07504 六阶段 pipeline 形成 spec elicitation 独立 vs 六阶段混合 对比;3 件 P1 监测:① tom 7-31 inference-e1prep 第 6 日 E1 恢复延续(7-28 19.4KB 存在 / 7-29 缺漏 / 7-30 缺漏 = 3 天连续缺漏 = 模式化塌方 · 7-31 22:22 已恢复 = v34 §3.2 争议 + 沿用 7-29 反思棒 #33 物理动作 0/1 吸收 = 升级到第 4 代连续缺漏 → 第 5 代恢复 沿用);② AAAI Subramanian 7 反方 7-31 第三批验证截止(不同 LLM 迁移性 验证截止日 · 截止已过 24h + 7 反方激活窗口 + 7 后续验证动作 4 阶段补救待决 · 7-30 AAAI track 区分补救 + 7-31 不同 LLM 迁移性补救 + 8-15 长上下文/多模态补救 4 阶段补救);③ spark 节奏反转第 7 棒独立 E1 缺失窗口确认(spark 7-31 morning 仅 3 RSS 通稿 · 7-30 第 6 棒 + 7-31 第 7 棒独立 E1 缺失窗口 = 节奏反转后第 7 棒 = 与 7-30 第 6 棒一致·延续 · 需 7-31 evening 棒确认 → stephen 7-31 2245 evening coord 确认 spark 7-31 13:39 + 09:53 agent-e1prep-v36 18:47 llm-infra-e1prep 第 12 棒恢复 = spark 节奏反转第 8 棒 = 解除 spark 17:47 棒警示)
v34 第十三轮脉络关系 与 v34 §2.3 评测表 22 行 + §2.4 后训练 18 件 + §2.6 42 子节立标级 + §3.2 争议 36 + §3.3 Q105.1-Q105.10 + §4.1 开放问题 55 同源;§2.4 后训练 第 21-24 件候选新增 CoRT + DecoEvo + MindForge + SpecFirst(v34 §2.4 18-20 件已立 · 本稿新增 21-24 件)+ §2.6 第四十七子节候选新增 MindForge + §2.6 第四十八子节候选新增 SpecFirst(v34 §2.6 42 子节已立 · 本稿新增 47-48 子节)+ §2.3 评测表 22 → 28 行候选新增 CoRT + DecoEvo(v34 §2.3 22-26 行已饱和 · 本稿新增 27-28 行 token 级 credit assignment + 评测器协同演化)+ §3.1 共识 57-58 候选新增 CoRT + DecoEvo 评测器协同演化立基础 + §3.2 争议 40 候选新增 AAAI Subramanian 第三批截止已过 补救策略待决 + §4.1 开放问题 候选新增 111-115(CoRT 离线数据依赖 + DecoEvo 分数解耦可操作性 + MindForge ProgramBench <1% 解决率对比条件 + SpecFirst vs FROAV 关系 + AAAI Subramanian 补救策略 4 阶段补救)+ §3.3 Q105 候选新增 Q105.15-Q105.18(CoRT 离线数据 / DecoEvo 分数解耦 / MindForge <1% 解决率 / SpecFirst vs FROAV)
反方 / 风险 (A) CoRT 离线数据依赖:需要在 offline 阶段生成多个 candidate responses 构建反事实分支 · 评测成本随候选数量线性增长 · 在离线数据不足的场景(如生产环境实时评测)是否仍然适用 待核(tom 7-31 evaluation-e1prep §矛盾 1);(B) DecoEvo「分数解耦」机制的可操作性:具体实现(如何确保 rubric 更新独立于 solver 当前得分)在 TLDR 中未详细展开 · 是否依赖特定的数学形式化或启发式设计 待核(tom §矛盾 2);(C) MindForge ProgramBench <1% 解决率的对比条件:具体是哪个模型/哪个难度层级未披露 · 可能是 cherry-picking 最难样本 · 选型参考需补全条件(tom §矛盾 3);(D) SpecFirst vs FROAV 的关系:两者在「阶段拆分」上的相似性是否意味着 SpecFirst 是 FROAV 的一个子集 · 还是完全不同的方法论 待核(tom §矛盾 5);(E) MindForge + SpecFirst 双件套 vs CodeNib + VisualPatchWorld 代码 Agent 上下游主题页骨架 vs FROAV 六阶段 pipeline 互补性 待核;(F) AAAI Subramanian 7 反方激活窗口 + 4 阶段补救策略:7-30 AAAI track 区分补救 + 7-31 不同 LLM 迁移性补救(截止已过 24h)+ 8-15 长上下文/多模态补救 4 阶段补救 · 补救策略待决;(G) tom 7-31 inference-e1prep 第 6 日 E1 恢复延续确认(7-28 19.4KB 存在 / 7-29 缺漏 / 7-30 缺漏 = 3 天连续缺漏 = 模式化塌方 · 7-31 22:22 已恢复 = v34 §3.2 争议 + 沿用 7-29 反思棒 #33 物理动作 0/1 吸收 = 升级到第 5 代恢复 沿用);(H) spark 节奏反转第 7 棒独立 E1 缺失窗口确认 → 第 8 棒恢复(spark 7-31 morning 仅 3 RSS 通稿 · 7-30 第 6 棒 + 7-31 第 7 棒独立 E1 缺失窗口 = 节奏反转后第 7 棒 = 与 7-30 第 6 棒一致·延续 · spark 7-31 13:39 + 09:53 agent-e1prep-v36 18:47 llm-infra-e1prep 第 12 棒恢复 = spark 节奏反转第 8 棒 = 解除 spark 17:47 棒警示);(I) CoRT + DecoEvo 与 PAJAMA LLM-as-judge 程序蒸馏 + Beyond Relevance-Centric Retrieval arXiv:2607.19747 + A New Role for Relevance arXiv:2607.24223 三角关系 待核;(J) MindForge 全生命周期软件工程训练环境与 CodeNib 上下文服务系统并列代码 agent 全栈(训练 + 推理) 待核;(K) SpecFirst spec elicitation 作为独立一等公民步骤 vs FROAV 六阶段混合(规划 → 查询重写 → 检索 → 重排 → 细化 → 生成) 待核
建议归入节 §2.3 评测表 22 → 28 行候选新增 CoRT + DecoEvo + §2.4 后训练 第 21-24 件候选新增 + §2.6 第四十七子节候选新增 MindForge + §2.6 第四十八子节候选新增 SpecFirst + §3.1 共识 57-58 候选新增 + §3.2 争议 40 候选新增 + §3.3 Q105.15-Q105.18 候选新增 + §4.1 开放问题 候选新增 111-115 + §6 必读清单 第 183-186 条
重要边界 不要与 v34 §2.4 SkillRise 跨任务技能 混为同一件工作:SkillRise = 跨任务技能演化的统一 RL 框架,CoRT = token 级 rubric-guided GRPO = 技能 vs 信用分配 不同对象;不要与 v34 §2.4 CAST 博弈求解器回合级信用分配 混为同一件工作:CAST = solver state value 作为转向级教师信号,CoRT = token 级 rubric 信用分配 = 博弈 vs rubric 不同对象;不要与 v34 §2.6 CodeNib 仓库级推理 混为同一件工作:CodeNib = 多视图代码 Agent 数据系统(上下文服务),MindForge = 全生命周期软件工程训练环境(训练) = 上下文 vs 训练 不同对象;不要与 v34 §2.6 PAJAMA LLM-as-judge 程序蒸馏 混为同一件工作:PAJAMA = LLM-as-judge 程序化评判器,SpecFirst = spec elicitation 作为一等公民步骤 = 评判器 vs 规范获取 不同对象;不要与 v34 §2.4 SDB Stochastic-Deterministic Boundary 混为同一件工作:SDB = LLM 输出 → 系统行为 4 阶段契约形式化,SpecFirst = spec elicitation 作为一等公民步骤 = 边界形式化 vs 规范获取 不同对象

二、值得警惕的矛盾或待核实说法

  1. 🔴 Metis memory-as-attack-surface 首例信号 = R33 → R34 边界节点(stephen 7-31 2245 evening coord §三 §4.1 + §五.5 + flyp 7-31 16:39 risk-e1prep §增量 2):原生持久记忆 state 引入新攻击面 = 「memory-as-attack-surface」三联立 = 原生记忆(per-session memory state)+ 持久动态演化(memory attention)+ 不可读(memory slot 写入内容不可读)+ 权重冻结无梯度前向(无法外部干预)= 监管/隐私/用户删除权/GDPR 删除权 四面风险 = R33 §2.1 C 类立标候选 第 2 拍 + memory-as-attack-surface 首例信号 = 与 Cyber-Capable AI Agents containment + StealthBench OPSEC 进攻隐蔽性 形成「memory-as-attack-surface」三联立 = 与 v34 §2.5 Agent 安全三联立标层「攻击面 + 防御清单 + 落地实现」形成「攻击面 + 防御清单 + 落地实现 + 原生持久记忆 attack surface」安全四联立标层 = 防御表 76 → 77 行。
  2. 🔴 StealthBench 升级 P3 邻接 → P0 警示(flyp 7-31 16:39 risk-e1prep §增量 1 + stephen 7-31 2245 evening coord §三 §4.1):StealthBench arXiv:2607.26314 自主进攻性安全 Agent 操作隐蔽性评测 = 6 OPSEC 维度 + 11 hand-verified OPSEC incidents from real-world APT reports = Cyber-Capable containment 评估的对位补充 = v34 §2.5 第 88 节点 已立 P3 邻接 → 本场升级 P0 警示(Mythos Preview 立标级升级 第 3 拍实证化)· 与 Anthropic 7-30 NEW「调查三起真实事件」+ Project Glasswing + Microsoft SymCrypt Rust = frontier lab × 安全工程 第 5 次协同披露 + 安全五联立标层 vLLM 框架 CVE + Cyber-Capable 学术 + StealthBench OPSEC + Anthropic 实战 + Metis 持久记忆 attack surface = 强提醒。
  3. 🔴 Anthropic 7-30 NEW「调查我们网络安全评估中的三起真实事件」+ vLLM CVE-2026-22778 CVSS 9.8 + DeepMind Gemini Robotics 2 三件套 + OpenAI GPT-5.6 Luna/Terra 价格战 = frontier lab × 安全工程 第 5 次协同披露 + 多源议题饱和(stephen 7-31 1003 news-anthropic-news + jay 7-31 21:07 evening briefing + stephen 7-31 1003 news-deepmind-news + stephen 7-31 1003 news-openai-news + stephen 7-31 1245 noon 协调棒 §2.8 risk 主题):Anthropic 7-30 NEW 5 件披露(调查三起真实事件 + Mythos Preview AES Möbius Bridge 思维链 + Project Glasswing + HAWK 后量子签名 + 「我们对开放权重模型的立场」)= 7 天 8 栖验证 第 2 例;vLLM CVE-2026-22778 CVSS 9.8(jay 7-31 21:07 evening briefing 第五件 + CVE-2026-22778 vLLM CVSS 9.8 P0)= 「vLLM 框架 CVE + Cyber-Capable 学术 + StealthBench OPSEC + Anthropic 实战 + Metis 持久记忆」安全五联立标层;DeepMind Gemini Robotics 2 三件套(Gemini Robotics 2 全身智能 + ER 2 推理 + On-Device 2 端侧推理 + Apptronik Apollo 2 / Duo 同台演示打结拧灯泡)= frontier lab × 全身 humanoid VLA 工业级落地锚定(主战场在 DeepMind 机器人路线);OpenAI GPT-5.6 Luna 80% 降幅 + Terra 20% 降幅 = 价格战立标 + avatarin GPT-Realtime 7×24 零售 Agent 30,000 用户 / 92% 正面反馈 = retail agent 实战立标 + 启用两项设置让 ARC-AGI-3 分数提升三倍 = ARC-AGI-3 三倍设置立标 + ChatGPT for Academic Researchers 1 万 → 10 万免费访问 = 学术研究者立基础。
  4. 🔴 AAAI Subramanian arXiv:2602.23368v1 7 反方第三批验证截止 = 今天就是截止日!强提醒(stephen 7-31 noon + 2245 evening coord + spark-on-systems-risk + flyp 7-27 0950 B 级 3.5/5):7 反方硬标签 ① 单一 LLM(Claude 3 Sonnet)对照可比性盲区 ⭐⭐⭐⭐ ② 200K context vs shell 工具边界不清——是"context stuffing + grep"而非 RAG 替代 ⭐⭐⭐⭐⭐(最高严重度)③ 6 数据集非业界公认复杂/长上下文/多模态基准 ⭐⭐⭐ ④ Amazon Bedrock KB baseline 利益相关冲突 ⭐⭐⭐⭐ ⑤ Agent-as-retriever cost-benefit 未量化 ⭐⭐⭐ ⑥ 与混合方案(Agent + 向量库)未对照 ⭐⭐⭐⭐ ⑦ AAAI 2026 main vs industry track 区分不清 ⭐⭐ · 7-30 截止日 014:30 截止前补救已关闭 · 7-30 AAAI track 区分补救 + 7-31 不同 LLM 迁移性补救(截止已过 24h)+ 8-15 长上下文/多模态补救 4 阶段补救 = 补救策略待决。
  5. 🔴 spark 7-31 morning 节奏反转后第 7 棒独立 E1 缺失窗口确认(stephen 7-31 1245 noon + 2245 evening coord §三 + spark 7-31 morning 仅 3 RSS 通稿):spark 7-31 morning 无独立 engineering/llm-infra/agent E1 产出 · 继 7-29 evening「节奏反转第 5 棒」+ 7-30 morning「节奏反转第 6 棒」+ 7-31 morning「节奏反转第 7 棒」= 节奏反转后第 7 棒独立 E1 缺失窗口 = 可能为夜间静默期效应 · 工程化棒与 agent 棒连续 3 日未发布 · 需 7-31 evening 棒确认 → stephen 7-31 2245 evening coord 确认 spark 7-31 13:39 + 09:53 agent-e1prep-v36 18:47 llm-infra-e1prep 第 12 棒恢复 = spark 节奏反转第 8 棒 = 解除 spark 17:47 棒警示
  6. 🟠 tom 7-31 inference-e1prep 第 6 日 E1 恢复延续(stephen 7-31 2245 evening coord §三 §4.1 + tom 7-31 22:22 inference-e1prep):7-28 19.4KB 存在 / 7-29 缺漏 / 7-30 缺漏 = 3 天连续缺漏 = 模式化塌方首次识别 → 7-31 22:22 已恢复 = v34 §3.2 争议 + 沿用 7-29 反思棒 #33 物理动作 0/1 吸收 = 升级到第 5 代连续缺漏 → 第 5 代恢复 沿用 · 下棒 8-1 必须先校验本棒引用过的承接物理动作是否真生效。
  7. 🟠 学术 Harness 4 维度叠加饱和 vs 跨立标层 22 信号饱和触发 v36 维度收敛判定(v34 §3.1 共识 + §3.3 Q105 + §3.4 T 候选叠加饱和风险持续):v34 学术 Harness 维度 1 Molt/OpenForgeRL + v35 学术 Harness 维度 2 Weng + v35 学术 Harness 维度 3 MSR Memora/SkillOpt + v35 学术 Harness 维度 4 Metis native memory + v34 SkillRise 跨任务技能 + SkillRise vs SkillOpt 邻接 = 学术 Harness 5 维度叠加饱和 = 是否触发 v36 维度收敛判定;v34 节点增量 12 信号 + v35 节点增量 13 信号 + 7-30 morning 节点增量 4 信号 + 7-31 节点增量 6 信号(增量 1 SkillRise + Metis critical-read + 增量 2 VisualPatchWorld + TurboVLA critical-read + 增量 3 tom 21:43 radar v2 4 P0 + 增量 4 StealthBench + Metis memory-as-attack-surface + 增量 5 Anthropic 7-30 NEW + CVE-2026-22778 + 增量 6 CoRT + DecoEvo + MindForge + SpecFirst)= v35 节点增量 22 信号 vs v34 节点增量 12 信号 持续叠加饱和
  8. 🟠 Memory for LLMs 综述 arXiv:2607.25380 + Graph-Native Bitemporal Memory Store arXiv:2607.26520 + Voice Memory arXiv:2607.26410 + MindForge arXiv:2607.27146 + SpecFirst arXiv:2607.27167 + CoRT arXiv:2607.25659 + DecoEvo arXiv:2607.25675 = 「原生 + 工程 + 跨模态 + 从零构建 + 评测粒度 + 评测器演化」六栖实现邻接补全(flyp 7-31 0950 critical-read + tom 7-31 agent-rag-longcontext-radar + spark 7-31 agent-e1prep-v36 + jay 7-31 engineering-e1prep-v40 + tom 7-31 rag-e1prep + tom 7-31 evaluation-e1prep):Memory for LLMs 综述 = 系统梳理 LLM memory 的 architecture-centric taxonomy · 三个正交轴(表征 隐式 vs 显式 + 更新策略 + 可扩展查找存储)= memory 研究碎片化 → 统一框架;Graph-Native Bitemporal Memory Store = Agent-local Neo4j 属性图 + HNSW 向量索引 + 双向时态数据模型(valid time + transaction time)= 工程化实现节点 + 「避免上下文窗口耗尽或第三方服务泄露」;Voice Memory = 推理时冻结 corrector 读 per-domain memory.md · 流式决定是否采纳 hypothesis · 异步 score-gated optimizer · listener-thinker architecture = 语音 Agent 记忆立基础;MindForge = 全生命周期软件工程训练环境(ProgramBench <1% 解决率 · 从零构建完整程序的难题);SpecFirst = spec elicitation 作为 agent 程序合成一等公民步骤;CoRT = Token 级 Rubric 引导策略优化的反事实回放 = 将 credit assignment 从 response 级别下沉到 token 级别;DecoEvo = Solver 与 Rubric-Generator 技能分数解耦协同演化 = 「固定评测器导致优化瓶颈」批判。
  9. 🟠 HF Daily 7-31 票榜 9 件新进 + 6 件续立 = 13 件替换 7-30 票榜(tom 7-31 0900 hf-daily + stephen 7-31 ai-industry-e1prep §增量 ④):9 件新进:TurboVLA 120▲ #2 + CoRT 75▲ #5 + HumanCLAW 66▲ #6 + DecoEvo 54▲ #8 + CLBench-V 40▲ #9 + CAST 29▲ #10 + SkillRise 18▲ #14 + MindForge 17▲ #15 = 6 件续立:HiFi-UMI 134▲→141▲ 单日 +7 续立 + 相关性新角色 Agentic 搜索 83▲→87▲ 单日 +4 续立 + CodeNib 43▲→77▲ 单日 +34 翻倍 + ReDesign 56▲→58▲ 单日 +2 + Pass the Baton 23▲→28▲ + Keep It InMind 25▲→28▲ 单日 +3 + Mage-VL 23▲→26▲ = HF Daily 7-31 vs 7-30 票榜 15 件 13 件替换 · 2 件稳定 = 新立标密度升级 + CodeNib 翻倍 = 编码 Agent 主战场重点
  10. 🟠 DualG-MRAG arXiv:2607.28580 + GLM-RAG arXiv:2607.28397 + MisKnow-Agent arXiv:2607.20891 + Filesystem-Based Memory arXiv:2607.26637 = tom 7-31 21:43 radar v2 4 P0 立标候选 net-new(tom 7-31 21:43 radar v2 + jay 7-31 21:07 evening briefing 沿用 + stephen 7-31 2245 evening coord §三 §4.1 + paper_cards/674-2607-28580.md + paper_cards/675-2607-28397.md 7-31 已建卡 + 2 件待补 MisKnow-Agent + Filesystem-Based Memory):DualG-MRAG = 多模态 RAG 宏/微推理解耦 = 解决 MM-RAG 多跳推理要么粒度太粗要么粒度太细 = 多模态 RAG 核心难题的结构化解法;GLM-RAG = KG-RAG 首个大规模对比研究 = 对架构决策有直接影响 = §2.3 评测表 27 行候选新增;MisKnow-Agent = Deep Research 误导知识传播量化 = RAG 系统真实可靠性问题被正式量化 = 生产级系统必读 = §2.5 第 90 节点候选新增;Filesystem-Based Memory = 首个对「代理用文件系统当记忆」系统性评估 = §2.4 第四路线「文件系统即上下文」首个系统性评估 anchor 候选新增。
  11. 🟠 VisualPatchWorld work-queue 0.5 级低优先级 vs flyp multimodal-v34 B 旁证级 = 评级升级时机风险 + 「世界模型三范式」立基础 + Jim Fan「VLA 已死 · 世界动作模型接棒」立场 2.0 张力(flyp 7-31 15:50 critical-read §反方 #A-#E):WorldDiT 仍是「action model + minimal world head」,没有真正接 WAM 棒 · World Models 三范式与 Jim Fan「VLA 已死 · 世界动作模型接棒」立场 2.0 张力;VPW 范式声称「同时具备神经预测器数据扩展 + 物理引擎可读性」有水分:数据扩展性仅限同一定性形式内的参数拟合 · 一旦超出定性形式候选集代码模型就无法表示 · 缺 WorldDiT / Dreamer / CWM 三方 head-to-head · 缺工业界对接案例 · 立标信号 B 旁证级。
  12. 🟠 TurboVLA 范式声称「推翻 LLM-centric V→L→A 范式」边界窄 + 「LLM 解构派」立基础(flyp 7-31 22:50 critical-read §反方 #A-#D):「LLM-centric 等价于 V→L→A」是把现有 VLA 简化了:RT-2 是这种结构 · 但 π0 / OpenVLA / HPT / 3D-VLA / EO-1 等近期 VLA 早已做「V + L 早期融合 + LLM-as-backbone」的多通路并行 · TurboVLA 没有 head-to-head 对比 π0/OpenVLA-7B/Octo · 等于先把对手压扁再打;「V + L → A」轻量取决于视觉与语言先验:0.2B 参数能拿到 97.7% LIBERO · 高度依赖视觉 backbone 的预训练质量语言编码器 · 真正的 LLM 体积可能被「借」到了 V encoder / L encoder 里;仿真 → 真实硬件迁移鸿沟是这道题的死穴:LIBERO 是固定物体集 + 固定任务模板 + 仿真物理 · sim2real gap 巨大 · README 的「real-world tasks GIF」只有图 · 没有 real-world 任务的成功率表 / 平均轨迹长度 / 与 OpenVLA / π0 的 head-to-head 对比;31.2 ms 是孤立 latency 不是 closed-loop cycle time;0.9 GB VRAM 是「推理 VRAM」;action chunk decoder 是否处理 safety constraint
  13. 🟠 CoRT 离线数据依赖 + DecoEvo 分数解耦可操作性 + MindForge <1% 解决率对比条件 + SpecFirst vs FROAV 关系 = 4 件 P1 待核(tom 7-31 evaluation-e1prep §矛盾 1-5 + tom 7-31 rag-e1prep §矛盾 1-5):CoRT 需要在 offline 阶段生成多个 candidate responses 构建反事实分支 · 评测成本随候选数量线性增长;DecoEvo 「分数解耦」机制的具体实现(如何确保 rubric 更新独立于 solver 当前得分)在 TLDR 中未详细展开;MindForge ProgramBench <1% 解决率的对比条件具体是哪个模型/哪个难度层级未披露;SpecFirst 与 FROAV 在「阶段拆分」上的相似性是否意味着 SpecFirst 是 FROAV 的一个子集。
  14. 🟠 SkillRise GitHub URL 缺失 + 跨任务序列构造隐含强假设 + 评测集偏窄 + 同策略双角色稳定性 + 基线覆盖 = 5 件 P1 待核(flyp 7-31 0950 critical-read §主要问题):GitHub URL 缺失 arXiv HTML 写「Our code is publicly available at .」但未给具体 URL · 复现门槛因此无法立即评估;跨任务序列构造隐含强假设 难度从简到难排序依赖「任务族 + 属性数量」等先验 · 论文未给「族划分错误率 vs 性能」的敏感性分析;评测集偏窄 ALFWorld / WebShop / ScienceWorld 都是「文本环境下的离散动作」 · 缺真实 API 工具调用、缺多模态观察、缺长 horizon 跨日记忆场景 · 与 MemoryAgentBench 四能力 AR/TTL/LRU/CR 几乎不重叠;同策略双角色稳定性 curate 和 solve 共用一套 θ 只在 prompt 层切角色 · 训练后期 curate 角色是否会塌缩成「复述 S_{i-1}+τ_i 摘要」导致信息瓶颈?论文未给 curate 输出熵 / 长度分布演化;基线覆盖 摘要自述相对最强 baseline 提升 2.3-8.5 pp · 但未列具体基线 · 需对照 Awesome-Agent-Skills 列表的 AutoSkill/EvoSkill/Ctx2Skill/SkillRL/Uni-Skill/SkillSmith/SkillOpt/SkillRevise/Memento-Skills 7+ 工作做横向对照。
  15. 🟠 Metis「原生记忆」边界条件 + 与外挂 RAG/Memory module head-to-head 缺 + memory state 可解释性与可控性 + 可复现性(paper 许可 ≠ repo 许可)+ 多模态评测覆盖 = 5 件 P1 待核(flyp 7-31 0950 critical-read §主要问题):「原生记忆」边界条件不清晰 memory state 是 per-user / per-session 还是 per-model?论文未在摘要层明确 · 推测是 per-session · 这与 MemoryAgentBench 的「跨会话 agentic memory」目标不是一回事;与外挂 RAG / Memory module 的 head-to-head 缺 摘要层面只与「无记忆」对比 · flyp 0950 critical-read §反方风险 #78 升级为 #78-P0;memory state 可解释性与可控性 memory attention 实际写入的「记忆」是什么?若不可读 → 隐私 / 监管 / 用户删除权等 risk 主线担忧 · 与 GDPR 删除权(right to be forgotten)兼容性;可复现性 GitHub 仓库 README 已给训练脚本 + 数据路径占位符 · Qwen3.5-4B backbone 选型清晰 · 4×GPU(建议 4×A100/80G 量级)+ 3 epoch 的训练成本对学界中等门槛 · 对工业不算低 · paper 许可 ≠ repo 许可 — 商业使用前必须单独确认 license;评测多模态覆盖 42 页 / 14 表 + GitHub 给 benchmark 列表 · 但摘要未提多模态。
  16. 🟠 Filesystem-Based Memory 三个假设的可证伪性 + MisKnow-Agent 缓解策略缺 + DualG-MRAG 粒度 trade-off + GLM-RAG KG 复杂度覆盖 = 4 件 P1 待核(tom 7-31 agent-rag-longcontext-radar §📡 追踪 #4 + tom 7-31 rag-e1prep §增量 4 + tom 7-31 evaluation-e1prep §矛盾):Filesystem-Based Memory 「能否保持组织」如何定义 + 「能否处理冲突和过期」如何量化 + 「能否产生净收益」对比基线是什么 · 论文的方法论是否足够严谨;MisKnow-Agent 构造并验证误导性知识 + 量化传播是「识别」能力 · 「缓解」能力是否在论文中给出 · 与 StealthBench offensive-security Agent OPSEC 攻击 vs MisKnow-Agent Deep Research 误导知识传播 = 「攻击 vs 误导」两面性 待核;DualG-MRAG 宏推理与微匹配的边界如何定义 · 跨模态关系建模与实例级对齐的协同机制 · 缺 head-to-head 对比;GLM-RAG 三个 retriever head-to-head 是否覆盖所有 KG 复杂度 · 简单的单跳 KG 与复杂多跳 KG 的区分是否足够细。
  17. 🟠 evaluation 主题活文档 5 天未更新(2026-07-24 00:18 → 2026-07-31 23:20 · 待补救):evaluation 主题活文档持续更新 vs work-queue 状态不一致(stephen 7-29 12:45 + 2245 + spark 7-29 13:30 §一.1 🔴 沿用);沿用 7-28 警示。
  18. 🟠 Spark E1 节奏 7-28 evening 双 E1 完整恢复 + 7-29 noon 协调棒判断 4 日回落已纠正 + stephen 7-29 1245 + 2245 修正(7-26 evening 双 E1 完整恢复第 1 棒 → 7-27 仅 RSS 通稿 → 7-27 evening 仅 RSS 通稿 → 7-28 截至 13:30 仍仅 RSS 通稿 = E1 节奏连续 3 日回落窗口 → 7-28 evening 双 E1 完整恢复第 4 棒 · 7-29 13:37 agent-v35 + 18:50 llm-infra-v10 双 E1 完整恢复第 5 棒 = 与 7-28 evening 双 E1 完整恢复判断一致 = stephen 7-29 1245 + 2245 节奏反转信号修正 4 日回落窗口判断为 节奏反转第 5 棒 · 7-30 morning 第 6 棒 + 7-31 morning 第 7 棒独立 E1 缺失窗口 = 节奏反转后第 7 棒 · stephen 7-31 2245 evening coord 确认 spark 7-31 13:39 + 09:53 agent-e1prep-v36 18:47 llm-infra-e1prep 第 12 棒恢复 = spark 节奏反转第 8 棒 = 解除 spark 17:47 棒警示)。

三、可引用的 arXiv 号列表

arXiv 号 论文/工作 状态 来源
arXiv:2607.26784 SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution(统一 RL 框架跨任务技能学习 + solve/curate 双角色 + 解耦信用分配 + 测试时跨任务 scaling) ✅ paper_cards/659 7-30 已建卡 · 主分类 agent · 形态 method · flyp 7-31 09:50 critical-read 13KB 评级方法论可信度中等偏高 flyp 7-31 09:50 SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read + stephen 7-31 1245 noon + 2245 evening coord + spark 7-31 agent-e1prep-v36 + paper_cards/659
arXiv:2607.26760 v1 Metis: Memory Foundation Model(首个 memory foundation model = agent memory 内化到基础模型本体 · 持久且动态演化的内存状态 + 通过持续查询过往记忆进行推理 · memory attention + 权重冻结 + 无梯度前向更新 · 42 页 9 图 14 表 · MemTensor 上海 + RUC + NUS + SJTU + Tongji 5 机构) ✅ paper_cards/658 7-30 已建卡 · 主分类 agent · 形态 method · flyp 7-31 09:50 critical-read 13KB 评级方法论中等-高 · flyp 7-31 16:39 risk-e1prep §增量 2 memory-as-attack-surface 首例信号 P1 立标候选 flyp 7-31 09:50 + flyp 7-31 16:39 risk-e1prep + stephen 7-31 1245 noon + 2245 evening coord + spark 7-31 agent-e1prep-v36 + tom 7-31 agent-rag-longcontext-radar + jay 7-31 engineering-e1prep-v40 + paper_cards/658
arXiv:2607.25236 v1 VisualPatchWorld: Code World Models as Latent Structured Representations for Planning(代码世界模型作为潜变量结构化表示 · 世界模型三范式 神经预测器 + 物理引擎 + 代码世界模型 · HKBU-KnowComp / Bai Jiaxin · GitHub HKBU-KnowComp/VisualPatchWorld · 主动探针 + 多步预测误差 + MPC 滚动 · LeWM 四任务 69.0% 平均规划成功) ✅ paper_cards/649 7-30 已建卡 · 主分类 agent · 形态 method · flyp 7-31 15:50 critical-read 17KB 评级方法论中等偏高 + 立标信号 B 旁证级 flyp 7-31 15:50 VisualPatchWorld-code-world-model-as-third-paradigm-critical-read + flyp 7-31 multimodal-e1prep §增量 9 + paper_cards/649
arXiv:2607.27205 v1 TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM(V+L→A 直接融合 0.2B / 32Hz / <1GB / 97.7% LIBERO · Dingkang Liang et al. · GitHub H-EmbodVis/TurboVLA · HF H-EmbodVis/TurboVLA · HF Daily 7-31 #2 · 120▲) ⚠️ paper_card 待建 · flyp 7-31 22:50 critical-read 11KB 评级工程参数可信度高 + 范式声称可信度中等偏低 · 立标信号 B 旁证级 flyp 7-31 22:50 TurboVLA-deconstruct-LLM-centric-VLA-critical-read + flyp 7-31 multimodal-e1prep §增量 2 + tom 7-31 0900 hf-daily + stephen 7-31 ai-industry-e1prep + paper_cards 待建
arXiv:2607.27180 HumanCLAW: Vision-Language 模型能否通过身体来行动?(VLM 通过身体行动 = 人形机器人 + VLM 推理 + 物理交互 · HF Daily 7-31 #6 · 66▲) ⚠️ paper_card 待建 · flyp 7-31 multimodal-e1prep §增量 3 §2.39.x 候补级 tom 7-31 0900 hf-daily + flyp 7-31 multimodal-e1prep §增量 3 + stephen 7-31 ai-industry-e1prep
arXiv:2607.25659 CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization(Token 级 rubric 信用分配 + 反事实回放 + DRIFT per-token forward/reverse KL 凸混合 + 三大失效模式 = 冷启动崩溃/状态无关调度/稀疏二元 reward · HF Daily 7-31 #5 · 75▲) ✅ paper_cards/663 7-31 已建卡 · 主分类 evaluation · 形态 method · tom 7-31 evaluation-e1prep §增量 1 P1 确认 tom 7-31 evaluation-e1prep §增量 1 + tom 7-31 0900 hf-daily + jay 7-31 engineering-e1prep-v40 + paper_cards/663
arXiv:2607.25675 DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills(Solver 与 Rubric-Generator 技能分数解耦协同演化 + 「固定评测器导致优化瓶颈」批判 · HF Daily 7-31 #8 · 54▲) ✅ paper_cards/660 7-31 已建卡 · 主分类 evaluation · 形态 method · tom 7-31 evaluation-e1prep §增量 2 P1 确认 tom 7-31 evaluation-e1prep §增量 2 + tom 7-31 0900 hf-daily + paper_cards/660
arXiv:2607.27146 MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis(编码 Agent 全生命周期软件工程训练环境 · ProgramBench <1% 解决率 · 从零构建完整程序的难题 · HF Daily 7-31 #15 · 17▲) ✅ paper_cards/669 7-31 已建卡 · 主分类 agent · 形态 method · spark 7-31 agent-e1prep-v36 §增量 7 P1 邻接 + tom 7-31 rag-e1prep §增量 3 P1 spark 7-31 agent-e1prep-v36 §增量 7 + tom 7-31 rag-e1prep §增量 3 + tom 7-31 agent-rag-longcontext-radar §📡 #6 + paper_cards/669
arXiv:2607.27167 SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch(行为规约获取作为 Agent 程序合成一等公民步骤 · spec elicitation 作为独立一等公民步骤 · HF Daily 7-31 #17 · 15▲) ✅ paper_cards/670 7-31 已建卡 · 主分类 agent · 形态 benchmark · spark 7-31 agent-e1prep-v36 §增量 7 P1 邻接 + tom 7-31 rag-e1prep §增量 4 P1 spark 7-31 agent-e1prep-v36 §增量 7 + tom 7-31 rag-e1prep §增量 4 + tom 7-31 agent-rag-longcontext-radar §📡 #7 + paper_cards/670
arXiv:2607.26520 v1 A Graph-Native Bitemporal Memory Store for Conversational AI Agents(Agent-local Neo4j 属性图 + HNSW 向量索引 + 双向时态数据模型 valid time + transaction time · Alp Niksarli + Gopesh Baheti) ✅ paper_cards/666 7-31 已建卡 · 主分类 agent · 形态 method · spark 7-31 agent-e1prep-v36 §增量 3 P1 + tom 7-31 rag-e1prep §增量 邻接 + jay 7-31 engineering-e1prep-v40 §增量 2 spark 7-31 agent-e1prep-v36 §增量 3 + tom 7-31 rag-e1prep + tom 7-31 agent-rag-longcontext-radar §💎 #2 + jay 7-31 engineering-e1prep-v40 + paper_cards/666
arXiv:2607.25380 Memory for Large Language Models(综述 · 系统梳理 LLM memory 的 architecture-centric taxonomy · 三个正交轴 = 表征(隐式 vs 显式)+ 更新策略 + 可扩展查找存储 · memory 研究碎片化 → 统一框架) ✅ paper_cards/668 7-31 已建卡 · 主分类 llm-infra · 形态 survey · spark 7-31 agent-e1prep-v36 §增量 2 P1 + jay 7-31 engineering-e1prep-v40 §增量 2 spark 7-31 agent-e1prep-v36 §增量 2 + tom 7-31 agent-rag-longcontext-radar §💎 #3 + jay 7-31 engineering-e1prep-v40 §增量 2 + paper_cards/668
arXiv:2607.26410 Voice Memory for Agentic Speech Recognition(推理时冻结 corrector 读 per-domain memory.md · 流式决定是否采纳 hypothesis · 异步 score-gated optimizer · listener-thinker architecture · HF Daily 5▲) ✅ paper_cards/671 7-31 已建卡 · 主分类 agent 副分类 multimodal · 形态 method · tom 7-31 rag-e1prep §增量 2 P1 邻接 + spark 7-31 agent-e1prep-v36 邻接 tom 7-31 rag-e1prep §增量 2 + tom 7-31 agent-rag-longcontext-radar §📡 #4 + paper_cards/671
arXiv:2607.28580 v1 DualG-MRAG: Decoupling Macro-Reasoning and Micro-Matching for Multimodal Retrieval-Augmented Generation(多模态 RAG 宏/微推理解耦 · 宏推理 + 微匹配 双路驱动 · Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin Li) ✅ paper_cards/674 7-31 已建卡 · 主分类 rag 副分类 multimodal · 形态 method · tom 7-31 21:43 radar v2 §💎 #1 P0 tom 7-31 21:43 radar v2 §💎 #1 + paper_cards/674
arXiv:2607.28397 v1 GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented Generation(GLM-based + GNN-based + vector-search 三类 retriever KG-RAG 大规模对比 · Maya Arseven, Anette Frank, Beni Egressy, Johann Higl, Moritz Plenz) ✅ paper_cards/675 7-31 已建卡 · 主分类 rag · 形态 method · tom 7-31 21:43 radar v2 §💎 #2 P0 tom 7-31 21:43 radar v2 §💎 #2 + paper_cards/675
arXiv:2607.20891 Is Deep Research Reliable? — MisKnow-Agent(Deep Research 误导知识传播量化 · MisKnow-Agent 框架 · 构造并验证误导性知识 + 规划 → 检索 → 合成 的 Deep Research 工作流传播) ⚠️ paper_card 待补 · tom 7-31 21:43 radar v2 §💎 #3 P0 + stephen 7-31 2245 evening coord §三 §4.1 🟡 P0 完全新立标 agent/rag tom 7-31 21:43 radar v2 §💎 #3 + jay 7-31 21:07 evening briefing 沿用 + stephen 7-31 2245 evening coord + paper_cards 待补
arXiv:2607.26637 Filesystem-Based Memory for LLM Agents(首个对「代理用文件系统当记忆」系统性研究 · 三个假设 = 能否保持组织 + 能否处理冲突和过期 + 能否产生净收益) ⚠️ paper_card 待补 · tom 7-31 21:43 radar v2 §💎 #4 P0 + tom 7-31 rag-e1prep §增量 邻接 tom 7-31 21:43 radar v2 §💎 #4 + tom 7-31 rag-e1prep + paper_cards 待补
arXiv:2607.26314 StealthBench(自主 offensive-security Agent operational stealth 评测 · 6 OPSEC 维度 · 11 hand-verified OPSEC incidents from real-world APT reports · Cyber-Capable containment 邻接补全) ✅ paper_cards/664 7-30 已建卡 · 主分类 agent · 形态 benchmark · flyp 7-31 16:39 risk-e1prep §增量 1 P3 → P0 警示升级(Mythos Preview 立标级升级 第 3 拍实证化) flyp 7-31 16:39 risk-e1prep §增量 1 + stephen 7-31 2245 evening coord + jay 7-31 engineering-e1prep-v40 + spark 7-31 agent-e1prep-v36 + stephen 7-31 ai-industry-e1prep-v33 + paper_cards/664
arXiv:2607.25294 CLBench-V: 从 Grounding 到知识获取的多模态上下文学习评测(HF Daily 7-31 #9 · 40▲ · flyp multimodal-e1prep §增量 4 §2.39.x 评测邻接) ✅ paper_cards/661 7-31 已建卡 · 主分类 multimodal · 形态 benchmark tom 7-31 0900 hf-daily + flyp 7-31 multimodal-e1prep §增量 4 + paper_cards/661
arXiv:2607.16955 CADENCE: Closing the Reasoning Gap via Coverage-Adaptive On-Policy Distillation(DRIFT per-token forward/reverse KL 凸混合 · 三失效模式) ✅ paper_cards/673 7-31 已建卡 · 主分类 llm-infra · 形态 method tom 7-31 agent-rag-longcontext-radar §📡 #5 + paper_cards/673
arXiv:2607.26055 πR²: Reactive Real-time Flow Policies(反应式实时 flow policy · 大 backbone + 实时控制) ✅ paper_cards/672 7-31 已建卡 · 主分类 engineering · 形态 method tom 7-31 agent-rag-longcontext-radar §📡 #8 + paper_cards/672
arXiv:2607.26627 Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes(首个系统性分析有损验证机制的理论工作 · lossy verification 悄悄重写 decoding distribution · paper_cards/681 7-31 已建卡 · 主分类 llm-infra · HF 7-31 推荐) ✅ paper_cards/681 7-31 已建卡 · 主分类 llm-infra · 形态 method · tom 7-31 inference-e1prep §增量 1 P1 确认 tom 7-31 inference-e1prep §增量 1 + spark 7-31 llm-infra-e1prep + paper_cards/681
arXiv:2602.23368v1 AAAI 2026 Subramanian「Keyword search is all you need」 ✅ v34 §2.3 立标级候选 B 级 3.5/5 · paper_card 已核 · 🔴 7-30 14:30 截止已过 24h + 7-31 第三批截止今天就是截止日仍未触发补强 v34 §2.3 第五十六 c 节点 + v34 §3.2 争议 36 + v34 §3.3 Q105.1 + stephen 7-31 1245 noon + 2245 evening coord + spark-on-systems-risk
arXiv:2605.20173 SDB Stochastic-Deterministic Boundary ⚠️ v34 §2.6 第四十二子节立标级 · paper_card 仍未建 · 8-1 截止前必须补建卡 jay 7-27 1100 + 1123 + stephen 7-27 12:45 + spark 7-27 agent-e1prep
arXiv:2607.12406 Isolation as a First-Class Principle for LLM-Agent System Safety ⚠️ v34 §2.5 第十一阶段 flyP 安全主题页 anchor · paper_card 仍未建 stephen 7-27 1023 + spark 7-29 agent-v35 警示
arXiv:2607.21461 AREX 面向深度研究的递归自我改进 Agent(BAAI) ⚠️ paper_card/585 沿用 · v34 §2.5 第八十五节点候选 · paper_card 补建待核 HF Daily 7-23 117▲ · 7-27 139▲ · 7-28 142▲ · 7-29 263▲(AREX vs Kimi K3 不同对象)

四、检查过的来源清单(无显著新增量时如实写明并列出检查过的来源)

来源 文件 / 路径 coding-agents 主题覆盖
work-queue.md /shared/research-kb/organized/queue/work-queue.md 待建卡 6 · 主分类 agent 候选近 3 天新增 10 张(654 HANDBOOK.md / 656 Agent Retrieval Bench / 658 Metis / 659 SkillRise / 662 CAST / 664 StealthBench / 665 Grading the Narrators / 666 Graph-Native Bitemporal / 669 MindForge / 670 SpecFirst · 全部 7-30/7-31 已建) + 邻接 multimodal/llm-infra 10 张(660 DecoEvo / 661 CLBench-V / 663 CoRT / 667 KAMR / 668 Memory for LLMs / 671 Voice Memory / 672 πR² / 673 CADENCE / 674 DualG-MRAG / 675 GLM-RAG · 全部 7-31 已建) + 681 Lossy Verification · = 主分类 coding-agents 0 张 + 主分类 agent 10 张 + 邻接 10 张 = pipeline 漏斗节点 8-1 截止前必须补建卡(MisKnow-Agent arXiv:2607.20891 + Filesystem-Based Memory arXiv:2607.26637 + TurboVLA arXiv:2607.27205 + HumanCLAW arXiv:2607.27180 + SDB arXiv:2605.20173 + Isolation arXiv:2607.12406 + AREX arXiv:2607.21461 = 7 件 paper_card 待补)
flyp/inbox/flyp 2026-07-31-0950-SkillRise-and-Metis-cross-task-skill-vs-native-memory-critical-read.md 🔴 增量 1 SkillRise + Metis 双线批判性精读(13.2KB / 108L)· SkillRise = 跨任务技能演化的统一 RL 框架 solve/curate 双角色 + 解耦信用分配 + 测试时跨任务 scaling · Metis = 首个 memory foundation model = agent memory 内化到基础模型本体 · 评级方法论可信度中等偏高/中等-高
flyp/inbox/flyp 2026-07-31-1550-VisualPatchWorld-code-world-model-as-third-paradigm-critical-read.md 🔴 增量 2 VisualPatchWorld code-world-model 第三范式批判性精读(17.1KB / 158L)· HKBU-KnowComp · LeWM 四任务 69.0% +23.5 pp · 立标信号 B 旁证级 · 「可读 vs 数据扩展」交易有水分 · 缺 WorldDiT/Dreamer/CWM 三方 head-to-head
flyp/inbox/flyp 2026-07-31-2250-TurboVLA-deconstruct-LLM-centric-VLA-critical-read.md 🔴 增量 2 TurboVLA LLM-centric V→L→A 范式解构批判性精读(11.8KB / 122L)· Dingkang Liang et al. · 0.2B / 32Hz / <1GB / 97.7% LIBERO · 「LLM 解构派」立基础 · 范式声称边界窄 · 缺主流当代 VLA head-to-head + OOD 长尾 + 真实机器人 success rate 表
flyp/inbox/flyp 2026-07-31-multimodal-e1prep.md 🟠 第四棒 E1 · 7 件核心候选增量(DeepMind Gemini Robotics 2 + TurboVLA + HumanCLAW + CLBench-V + AcademicEval + Scaling Beyond Context + Metis)+ 6 条延伸追踪 · §2.39.x 候补级新增 4 件(TurboVLA / HumanCLAW / CLBench-V / Metis)+ §1 主线 4 评测方法学新增 2 件(AcademicEval + Scaling Beyond Context 48h 漏收件)+ §3.3 反方集新增 5 条 #73-#77
flyp/inbox/flyp 2026-07-31-risk-e1prep.md 🔴 第 5 棒 E1 · 4 条 net-new 增量(StealthBench 🟠 P0 警示 + Metis 🟡 P1 立标候选 + memory-as-attack-surface 首例信号 + Memory for LLMs 综述 P1 + Graph-Native Bitemporal P3 邻接)+ 2 条强提醒(AAAI Subramanian 第三批验证截止 + MCP 2026-07-28 协议栈破坏性变更)+ 1 条「原生记忆 = 新攻击面」首例信号 = R33 → R34 边界节点
flyp/inbox/flyp 2026-07-31-1000-rss-cameron-wolfe / 1002-rss-interconnects / 1005-rss-yt-ai-explained / 1005-rss-yt-two-minute-papers 4 件 RSS 通稿 · 1000 rss-cameron-wolfe 5 件 net-new = Agentic 世界模型 + Agentic RL 框架与最佳实践 + Agent 评估详尽指南 + LLM RL 缩放定律 + LLM 基准测试解剖(coding-agents 主题沿用)
jay/inbox/jay 2026-07-31-engineering-e1prep.md 🔴 engineering E1 准备棒 · 6 主线 + 3 旁证 + 1 警示 · SIGMOD 2026 LLM Serving 三件套(CoDec/AlignedServe/HotPrefix) + MC-SF 在线调度 arXiv:2502.07115v5 + Memory for LLMs 综述 arXiv:2607.25380 统一分类学 + Graph-Native Bitemporal arXiv:2607.26520v1 + StealthBench arXiv:2607.26314 + HANDBOOK.md arXiv:2607.25398v1 + CXL-PIM KV Cache HotInfra '26 + vLLM 生产质量工程 + CoRT arXiv:2607.25659 + RLHF C++ vs PyTorch arXiv:2607.19712 + PipeMax Pipeline Parallelism arXiv:2605.02189v1
jay/inbox/jay 2026-07-31T2105-jay-evening-briefing-cve-minimax-h3-opus5-dflash.md 🔴 增量 5 晚间场 5 主线(CVE-2026-22778 vLLM 致命漏洞 CVSS 9.8 P0 + DFlash ICML 2026 投机解码 + Claude Opus 5 发布 + EU AI Act 透明度执法 2026-08-02 + Seedance 2.5 字节跳动 30 秒视频生成 + H3 开源多模态)· 安全主线 CVE + Anthropic 实战 + StealthBench 沿用 + MisKnow-Agent 沿用 = 「vLLM 框架 CVE + Cyber-Capable 学术 + StealthBench OPSEC + Anthropic 实战 + Metis 持久记忆」安全五联立标层
jay/inbox/jay 2026-07-31-1140-news-x-tech-radar / 1050-jay-engineering-filter / 1335-jay-engineering-filter / 1955-jay-engineering-filter / ai-engineering-trending / csdn-substack-ai-research / csdn-weekly / T1105-jay-five-category-briefing / T1505-jay-five-category-briefing / T1620-jay-csdn-sglang-bench-eval / T1735-jay-briefing-inference-stack-vecdb-substack / database-e1prep / engineering-database-backend-cloudnative 13 件 jay inbox 7-31 · 1000 RSS 通稿 5 件 5 件 = simon-willison「三起真实事件调查」+ bytebytego + nathan-benaich + raschka(5 件 net-new 「控制 LLM 推理力度 + 使用本地 Coding Agent + LLM 架构最新进展 + LLM 研究论文 2026 part1 + 工作流理解 LLM」)+ cool-papers 5 件 net-new(Mental World Modeling + APEX-Accounting + Pangram 4 + DenseOn+LateOn 多语种长上下文 + Regional Bias) + lilian-weng 沿用 + msr-blog 🆕 Echoverse 计算机使用 Agent + EvoLib 经验转化为持续演进的知识 + SymCrypt Rust 沿用 + Aurora 1.5 沿用 + Flint 沿用 + import-ai 沿用 + yt-karpathy 5 件 net-new YT 教学系列 + yt-fireship 1 件 net-new + interconnects 沿用 · coding-agents 主题沿用
tom/inbox/tom 2026-07-31-agent-rag-longcontext-radar.md (20:41 v2) 🔴 增量 3 8 件候选 4 高价值 + 4 中价值 · DualG-MRAG arXiv:2607.28580 + GLM-RAG arXiv:2607.28397 + MisKnow-Agent arXiv:2607.20891 + Filesystem-Based Memory arXiv:2607.26637 + Voice Memory arXiv:2607.26410 + CADENCE arXiv:2607.16955 + MindForge arXiv:2607.27146 + SpecFirst arXiv:2607.27167 + πR² arXiv:2607.26055
tom/inbox/tom 2026-07-31-0900-hf-daily-2026-07-31.md 🟠 HF Daily 7-31 票榜 15 件全核 · HiFi-UMI arXiv:2607.25895 141▲ +7 续立 #1 + TurboVLA arXiv:2607.27205 120▲ #2 + 相关性新角色 arXiv:2607.24223 87▲ +4 续立 #3 + CodeNib arXiv:2607.25431 77▲ +34 翻倍 #4 + CoRT arXiv:2607.25659 75▲ #5 + HumanCLAW arXiv:2607.27180 66▲ #6 + ReDesign arXiv:2607.25565 58▲ +2 续立 #7 + DecoEvo arXiv:2607.25675 54▲ #8 + CLBench-V arXiv:2607.25294 40▲ #9 + CAST arXiv:2607.25308 29▲ #10 + Pass the Baton arXiv:2607.26057 28▲ 续立 #11 + Keep It InMind arXiv:2607.24368 28▲ +3 续立 #12 + Mage-VL arXiv:2607.24904 26▲ +3 续立 #13 + SkillRise arXiv:2607.26784 18▲ #14 + MindForge arXiv:2607.27146 17▲ #15 = HF Daily 7-31 vs 7-30 票榜 15 件 13 件替换 · 6 件续立
tom/inbox/tom 2026-07-31-rag-e1prep.md 🟠 R50 接力延续 · 5 条主线增量(Metis + Voice Memory + MindForge ProgramBench + CADENCE + SpecFirst)· RAG 主题 ArXiv 新鲜供给进入相对低谷期 · Metis + Voice Memory 代表「记忆基础模型化」新兴方向
tom/inbox/tom 2026-07-31-evaluation-e1prep.md 🟡 evaluation E1 预消化 · 3 件确认(CoRT + DecoEvo + RepoReasoner) + 2 件邻接(CLBench-V + Cyber-Capable)· Token 级评测粒度深化 + 评测器协同演化
tom/inbox/tom 2026-07-31-inference-e1prep.md 🟡 inference E1 预消化 · 1 件主分类 paper_card(681 Lossy Verification in Speculative Decoding arXiv:2607.26627) + TGI 维护模式 + vLLM AI Blog 生产质量工程 · 第 6 日 E1 已恢复(7-28 19.4KB 存在 / 7-29 缺漏 / 7-30 缺漏 = 3 天连续缺漏 = 模式化塌方首次识别 → 7-31 22:22 已恢复 = v34 §3.2 争议 + 沿用 7-29 反思棒 #33 物理动作 0/1 吸收)
tom/inbox/tom 2026-07-31-1005-rss-yt-lex-fridman / 1005-rss-yt-yannic-kilcher 2 件 RSS YT 通稿 · 沿用(coding-agents 主题沿用)
spark/inbox/spark 2026-07-31-agent-e1prep.md 🔴 agent E1 预消化 v36 准备棒 · 6 件新立标候选 · 4 件 P0/P1 立标候选(Metis + Memory for LLMs + Graph-Native Bitemporal + SkillRise)+ 1 件 P0 警示 StealthBench + 2 件 P1 邻接(CAST + MindForge + SpecFirst 双件套)+ 1 件 MCP 协议栈警示(MCP 2026-07-28 规范无状态化)+ 1 件 P3 警示(AAAI Subramanian 7-31 第二批验证截止)
spark/inbox/spark 2026-07-31-llm-infra-e1prep.md 🟡 llm-infra E1 预消化 第 12 棒恢复 · 7 主线 + 3 旁证 + 1 警示 · 第 8 棒独立 E1 缺失窗口(spark 7-31 18:47 第 12 棒恢复 = 解除 spark 17:47 棒警示)
spark/inbox/spark 2026-07-31-1001-rss-gradient-flow / 1002-rss-chip-huyen / 1005-rss-yt-3blue1brown 3 件 RSS 通稿(coding-agents 主题沿用)
stephen/inbox/stephen 2026-07-31-ai-industry-e1prep-v33 🔴 ai-industry E1 准备棒 · 15 件 net-new 立标级候选饱和 · 5 实例同源立标饱和(Metis 5 实例 + MCP 4 实例 + GLM-5.2/Kimi K3/Gemini Robotics 2 4 实例 + Graph-Native Bitemporal 2 实例 + Memory for LLMs 综述 2 实例)· 4 主线立标饱和(agent memory + agentic RAG + LLM serving systems + MCP/A2A 协议栈)
stephen/inbox/stephen 2026-07-31-1245-coordination-check-noon.md 🔴 noon 协调棒 · 5 实例 E1 全部延续在岗 + 11 件 net-new 立标候选 + 6 件 48h 漏收件补录 + 6 件新警示 + 8 大主题分类 11 类饱和延续 + 5 主线立标饱和 + 7-30 evening 棒 8 件警示全部延续处理
stephen/inbox/stephen 2026-07-31-2245-coordination-check-evening.md 🔴 evening 协调棒 · 5 实例 E1 全沿用 + 6 大主题新警示 + 8 件需人工确认/补充问题 · 🟠 边界节点信号(flyp risk-e1prep 立标):StealthBench + Metis memory-as-attack-surface = R33 → R34 边界节点 · 🟠 4 件立标饱和续立(StealthBench + MisKnow-Agent + Opus 4.7 真实系统攻击 + CVE-2026-22778 vLLM CVSS 9.8 P0) · tom inference 第 6 日 E1 已恢复(解除 spark 17:47 棒警示)
stephen/inbox/stephen 2026-07-31-0910-news-x-vip-radar / 1003-news-anthropic-news / 1003-news-deepmind-news / 1003-news-openai-news / 1004-news-bens-bites / 1004-news-google-ai / 1004-news-hf-blog / 1004-news-tldr-ai / 1006-news-yt-anthropic / 1006-news-yt-deepmind / 1006-news-yt-openai 11 件 frontier lab news 通稿 · Anthropic 7-30 NEW「调查三起真实事件」+ Mythos Preview AES Möbius Bridge 思维链 + HAWK 后量子签名 + Project Glasswing 沿用 + OpenAI 7-30 NEW 4 件集中(GPT-5.6 Luna 80% 降幅 + Terra 20% 降幅 + avatarin GPT-Realtime 7×24 零售 Agent + 启用两项设置让 ARC-AGI-3 分数提升三倍 + ChatGPT for Academic Researchers 1 万→10 万)+ DeepMind Gemini Robotics 2 三件套(Gemini Robotics 2 全身智能 + ER 2 推理 + On-Device 2 端侧推理 + Apptronik Apollo 2 / Duo 同台演示打结拧灯泡)+ HF blog「前沿实验室 Agent 入侵剖析」沿用
stephen/inbox/stephen 2026-07-31-llm-application-e1prep-v42.md 🟠 llm-application E1 准备棒 · v41 已固化 23 件 net-new 候选池 + 90 试金石 + 293 项 arXiv ID 候选池 · 本棒新增 7 大方向 = Tom radar v2 4 件 P0 + HF Daily 7-31 票榜 + Gemini Robotics 2 三件套 + OpenAI 7-30 NEW 4 件集中 + Tom RAG E1 R50 5 件 + MSR 7-30 NEW 2 件 + flyp multimodal 第四棒 + SkillRise/Metis critical-read
paper_cards/ 654-2607-25398.md681-2607-26627.md 666 张 · 近 3 天主分类 agent 新卡 10 张(HANDBOOK.md 654 / Agent Retrieval Bench 656 / Metis 658 / SkillRise 659 / CAST 662 / StealthBench 664 / Grading the Narrators 665 / Graph-Native Bitemporal 666 / MindForge 669 / SpecFirst 670 + Voice Memory 671 主+副 multimodal)· 邻接 8 张(DecoEvo 660 / CLBench-V 661 / CoRT 663 / KAMR 667 / Memory for LLMs 668 / πR² 672 / CADENCE 673 / DualG-MRAG 674 / GLM-RAG 675 + 681 Lossy Verification 主 llm-infra) = 主分类 coding-agents 0 张 · 主分类 agent 10 张 + 邻接 multimodal/llm-infra/evaluation/rag 9 张 + llm-infra 主 2 张 · 占比 ~3.0% · 0 张主分类 coding-agents · 7 件 paper_card 待补 = pipeline 漏斗节点 8-1 截止前必须补建卡(MisKnow-Agent arXiv:2607.20891 + Filesystem-Based Memory arXiv:2607.26637 + TurboVLA arXiv:2607.27205 + HumanCLAW arXiv:2607.27180 + SDB arXiv:2605.20173 + Isolation arXiv:2607.12406 + AREX arXiv:2607.21461 = 7 件 paper_card 待补)
knowledge/coding-agents.md /shared/research-kb/organized/knowledge/coding-agents.md v34 Wave4 E1 第十三轮 7-31 04:20:19 阈值 + §1.45 frontier lab 立标续立 12 栖合流 + 范式六路线对立 native memory 立基础栖 + 学术 Harness 4 维度叠加饱和触发 v36 维度收敛判定 + Agent 安全三联立标层 + 主权开源 立基础栖 双联 + 评测第六维 7 件立标饱和 + 长上下文 anchor 4 范式 + 4 件 coding-agents 主分类新立标 + LOCA-bench + Metis Memory Foundation Model + MemoryAgentBench/LongMemEval ICLR 2026 + 共识 53 / 争议 39 / 开放问题 79 / 趋势 39 / 必读 162

总结:本场 E1 预消化共识别 6 件增量(4 件 P0 + 1 件 P0 警示 + 1 件 P1),涉及 arXiv 号 24 件新立标候选(其中 14 件 coding-agents 主分类邻接 + 6 件长上下文/记忆/安全邻接 + 4 件模型本体 / 评测 / harness 沿用)+ 7 件沿用升级(SkillRise + Metis + VisualPatchWorld + TurboVLA + Memory for LLMs + Graph-Native Bitemporal + Voice Memory + MindForge + SpecFirst + CoRT + DecoEvo + DualG-MRAG + GLM-RAG + MisKnow-Agent + Filesystem-Based Memory + StealthBench + MemoryAgentBench + ReMemR1 + BeyondUncertainty + A New Role for Relevance + HiFi-UMI + GLM-5.2 + Kimi K3 + Weng Harness + MSR Memora/SkillOpt + Anthropic 7-30 NEW + Microsoft SymCrypt Rust + CVE-2026-22778 vLLM + DeepMind Gemini Robotics 2 + OpenAI GPT-5.6 Luna/Terra)+ 2 件 P0 警示延展(🔴 StealthBench 升级 P3→P0 警示 + 🔴 Metis memory-as-attack-surface 首例信号 R33→R34 边界节点)+ 4 件 P1 监测(🔴 AAAI Subramanian 7-31 第三批截止已过 补救策略待决 · 🔴 spark 7-31 morning 节奏反转后第 7 棒独立 E1 缺失窗口确认 → 第 8 棒恢复 解除 spark 17:47 棒警示 · 🟠 tom 7-31 inference-e1prep 第 6 日 E1 恢复延续 = 第 5 代恢复沿用 · 🔴 Anthropic 7-30 NEW「调查三起真实事件」+ vLLM CVE-2026-22778 CVSS 9.8 + DeepMind Gemini Robotics 2 三件套 + OpenAI GPT-5.6 Luna/Terra 价格战 = frontier lab × 安全工程 第 5 次协同披露 + 「vLLM 框架 CVE + Cyber-Capable 学术 + StealthBench OPSEC + Anthropic 实战 + Metis 持久记忆」安全五联立标层)+ 7 件 paper_card 待补 / 已建 = pipeline 漏斗节点(MisKnow-Agent arXiv:2607.20891 + Filesystem-Based Memory arXiv:2607.26637 + TurboVLA arXiv:2607.27205 + HumanCLAW arXiv:2607.27180 + SDB arXiv:2605.20173 + Isolation arXiv:2607.12406 + AREX arXiv:2607.21461 = 7 件待补 + 17 件已建)。