agent · E1 预消化简报(2026-07-25)
执行时间:2026-07-25 13:30 (Asia/Shanghai)
检查范围:inbox jay/tom/flyp/spark/stephen 近 2 天(7-23 ~ 7-25)+ paper_cards 7-22 ~ 7-25 新卡(已立/未立 抽样)+ candidates 7-24 ~ 7-25
对照活文档:/shared/research-kb/organized/knowledge/agent.md v30(cutoff 2026-07-24 23:55 CST,约 13.5 小时前固化)
本文性质:spark cron 8958350c 触发的 agent 主题 E1 日间预消化;承接 v30 11 信号净增量,只列本窗口(7-24 evening ~ 7-25 noon)对 agent 主题的新增量 + 矛盾/待核 + 可引用 arXiv 号,不重写 agent.md;Stephen 7-25 1245 协调棒 §1.2 已确认 spark E1 节奏连续恢复第 2 日(7-24 evening 13:38 已恢复 + 7-25 13:30 持续),本次为常规产出
0. 综述判断(给今晚活文档接手时一眼看到)
- v30 已固化(11 主轴 11 信号净增量):§2.6 39 子节三件套(AgentDebugX + SeerGuard + DocOps)+ §2.4 54 节点 IteraSim RAG + §2.6 40 子节 MCP CVE 集群 + §2.3 56 节点邻接 Beyond Relevance-Centric + HM-RAG + §1.45 五向合流 + §1.34b Jay 0820 重策展 + §1.33c Harness 工程化栈 + Q103 极端消失判定 + T109 主线 K 稳定判定 + Anthropic J-space 编号核证 + 共识 36 + 争议 46 + Q103 + Q104 + T108 + T109
- 7-25 增量性质:v30 已固化的当日,本场没有 v30 二阶消化,出现 5 件 agent 主题直接相关的 v30 未捕获 P0 立标 + 2 件 P1 邻接补全 + 3 件 agent 工程化栈旁证 + 1 件 Q103/T109 持续监测:
- arXiv:2607.21503 Agentic Context Management(Tom 7-25 0840 radar ⭐ + paper_cards/564 已立 + flyp 7-25 1036 周六精读论文 C)= 把"memory"重新框定成 5 primitives(architecting/ingesting/scoping/anticipating/compacting)+ 成本-精度前沿 = v30 §2.2 记忆与上下文工程 57 节点邻接(从 storage-and-retrieval 范式 → lifecycle + architecture 范式转折)+ 长 horizon agent context mgmt 第 3 条路线(继 PRO-LONG arXiv:2607.20064v2 + Long-Horizon-Terminal-Bench arXiv:2607.08964v2 之后)
- arXiv:2607.21557 OpenForge RL(Tom 7-25 0840 radar ⭐ + flyp 7-25 1036 周六精读论文 B + paper_cards/585 已立)= harness-native agent 训练基础设施(Columbia/Dartmouth/MSR, Xiao Yu + Baolin Peng 等)= v30 §2.5 运行时与基础设施 83 节点邻接(代理 proxy + Kubernetes orchestrator + wall-clock timeout 替代 turn limit + 6 harness × 6 基准实证 + harness-native RL 训练闭环)+ train-deploy mismatch 从"重写 harness" 到"插一个 proxy" 范式转折
- arXiv:2607.12406 Isolation as a First-Class Principle for LLM-Agent System Safety(flyp 7-25 1036 周六精读论文 A · HKUST/NYU/SWUPL/MODEIO · 2026-07-14 v1)= 把 agent 系统拆为 5 边界(user-agent / agent-tool / agent-execution / agent-agent / system-environment)+ 跨边界失效传播 + isolation-by-construction 4 原则(trust separation / scoped capabilities / traceability / recovery)= v30 §2.6 评测、可靠性与对抗 40 子节邻接候选(从"攻击类型"组织 转向 "边界中心"组织 第 1 例 + Agent 安全 survey anchor 立标)
- Anthropic Claude Opus 5 7-24 evening 正式发布 + 系统卡 + Boris Cherny 评论 + Project Pilot AI 操控无人机(stephen 7-25 1003-news-anthropic-news + 1005-news-yt-anthropic + 0910-news-x-vip-radar + jay 7-25 1000-rss-simon-willison)= v30 §1 frontier lab 全栈立标 §1.41 横切 60-66 立标候选(frontier lab 模型本体 + 物理 agent + 评论 + 红队 四栖验证链条第 1 例;Boris Cherny 评论「Opus 5 是我们迄今为止最不容易被 prompt injection 的模型」= 「评测 → 系统卡 → 评论 → 红队」4 栖验证第 1 例)+ v30 §1.45 五向合流(Anthropic 资本 + 研究 + 模型 + 物理 agent 四线齐扩)
- Microsoft MAF Agent Harness · BUILD 2026 生产级 SDK + Enterprise LLM Agent 三层架构 Plan/Architect/Zulu + LangGraph + MCP(jay 7-25 1055 engineering-filter + 1105 csdn + 1105 substack + 1123 engineering-e1prep)= v30 §1.33c 横切 53c AI Agents Stack 2026 Harness 层 商业开源 SDK 立标 + v30 §2.4 多智能体协作 邻接(企业级 Multi-Agent 生产案例, 文心快码 / Microsoft MAF / AWS Blocks 框架三栖; Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效 旁证)
- 7-25 沿用 + 旁证 5 件(v30 已固化但 7-25 产生新证据或新立):
- MSR 7-25 双连发 SkillOpt + Memora(jay 7-25 1002-rss-msr-blog + stephen 7-25 ai-industry §1.5)= Skill = 可训练参数(SkillOpt)+ 谐波记忆表示(Memora)= v30 §2.2 记忆与上下文工程 57 节点邻接补全 + 长 horizon agent 范式转折立标集群第 5/6 例(继 PRO-LONG + LH-Terminal-Bench + AREX + Agentic Context Management + OpenForgeRL)
- Agent 生产失败三模式 Dumb RAG + Brittle Connectors + Compounding Error(jay 7-25 1105 Substack · theaiengineer.substack.com)+ Gartner 2027 40% 废弃预测 = v30 §1.32b 横切 52b 候选 + v30 §2.6 评测、可靠性与对抗 邻接(Compounding Error 量化公式 0.85^10 ≈ 0.197 作为 Multi-Agent 可靠性计算基础,与 eval gap 死亡地带 37pt 互补)
- HF Daily 7-25 头条 AREX arXiv:2607.21461 · 117▲ 当日 #1(stephen 7-25 ai-industry §1.3 + flyp 7-25 multimodal-e1prep §1)= 递归自我改进 deep research agent · BAAI = v30 §2.1 综述与方法学骨架 邻接(agent 自我改进范式从静态 prompt 到动态权重 第 2 例,继 pi-mono 43.9k⭐ 之后)
- Cameron Wolfe 7-25 agentic 三连(Agentic World Models + Agentic RL + Agent 评估)(flyp 7-25 1000-rss-cameron-wolfe)+ Lilian Weng 7-25「自我改进 Harness 工程」(jay 7-25 1001-rss-lilian-weng)+ Raschka「推理 effort 训练/推理时机制」(jay 7-25 1140 x-tech-radar 干货 #1)= v30 §1.33c 横切 53c 邻接 + 立场层立标(comment layer)
- spark 7-25 1001 rss-gradient-flow v1 §0 与 7-24 1002 / 7-23 1002 完全相同(GLM 5.2 + Kimi K3 + Gemini 3.6 Flash + 开源模型吸纳大部分 AI 支出 + 中国 AI 出口管制 + RL 基建下一层 = 5 篇标题与 v29/v30 比对未变)= 主线 A 连续第 8 天缺失 7-18 + 7-19 + 7-20 + 7-21 + 7-22 + 7-23 + 7-24 + 7-25 = Q103 阈值「极端消失判定」+ 主线 K 持续巩固 + 主线 H / J 持续巩固 + Gradient Flow 主线结构第 11 次升维持续验证
- 本日谨慎提醒:
- AutoIndex arXiv:2607.18603 7-25 仍未建卡(Stephen 7-25 1245 §3.2 已标记 🔴 AutoIndex 6 日未建卡 = pipeline 漏斗节点;v30 §2.3 第 56 节点 AutoIndex 已固化但 paper_card 缺);v31 待补建卡或决断复用
- arXiv:2607.21503 Agentic Context Management 与 arXiv:2607.20064v2 PRO-LONG 立场关系待决断:flyp 7-25 RRB 精读未涉;stephen 7-25 ai-industry §2.5 标矛盾;v31 待 Tom 晚场稿 / Jay 晚场稿 / Flyp 晚场稿 任一补 head-to-head
- arXiv:2607.12406 Isolation-as-First-Class 与 v30 §1.45 MCP CVE 集群 + v30 §2.6 35 子节 Tool-Call Boundary Drift + v30 §2.6 33 子节 Self-State Attacks 互补关系待决断:flyp 7-25 1036 周六精读 §一已标「flyP 安全主题页尚为空, 急需 anchor」;v31 §2.6 候选升格立 §2.6 第 41 子节(超越 v30 第 40 子节 MCP CVE 集群邻接 = 安全 survey 一阶 anchor);或保持邻接 待 v31 决断
- Anthropic Claude Opus 5 vs Claude Fable 5 关系待核(stephen 7-25 ai-industry §2.2):Opus 5 是否替代 Fable 5 还是平行产品未明;v31 待 Anthropic 官网模型矩阵核证
- Microsoft MAF Harness 与 v30 §1.33c 横切 53c AI Agents Stack 2026 6 层 Harness 层 边界:MAF Harness 是「真实 Harness」(shell/filesystem 访问 + 审批流 + MCP 一体化),vs HF Harness H=(E,T,C,S,L,V) 学术 Harness = 「商业 Harness vs 学术 Harness」 立标新维度;v31 §1.33c 横切 53c 量化补全候选
- v30 §2.6 39 子节饱和预警:v30 已 39 子节 + DocOps + MCP CVE 集群邻接 + 7-25 又出现 Agentic Context Management + OpenForgeRL + Isolation-as-First-Class 三件 = v31 §2.6 候选 41 子节仍需决断
1. 增量条目(5 件 P0 主线 + 5 件 P1 旁证,按"建议归入节"分组)
增量 1 · arXiv:2607.21503 Agentic Context Management = 长 horizon agent context mgmt 第 3 路线(★★ 必补, paper_cards/564 已立)
| 字段 |
内容 |
| 来源 |
/shared/research-kb/inbox/tom/2026-07-25T0840-agent-rag-longcontext-radar.md ⭐ #1 + /shared/research-kb/inbox/flyp/2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md §四 精读论文 C + /shared/research-kb/inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.5 |
| arXiv 号 |
arXiv:2607.21503 Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems(Gaurav Dadhich, Maximem · 2026-07-23 v1) |
| 一句话 |
生产 Agent 失败的主因不是推理能力不足, 而是无法管理上下文(对话历史/提示膨胀/工具定义/工具输出堆积);作者认为这不仅是存储检索问题, 更是生命周期管理问题, 需要决定记忆什么/提取什么/遗忘什么 = 「storage-and-retrieval 框架扩展」立场 vs v30 §2.98 PRO-LONG「反 storage-and-retrieval」范式转折 |
| v30 脉络关系 |
与 v30 §2.2 记忆与上下文工程 57 节点全数沿用(无新增)+ v30 §1.45 五向合流(OpenAI × HF + Gemini 3.5 Flash Cyber)+ v30 §2.98 PRO-LONG 立标(沿用 flyp 7-24 1550 PRO-LONG critical-read)+ v30 §1.34b Anthropic Global Workspace(认知科学锚点)+ v30 §1.33c 横切 53c AI Agents Stack 2026 Memory 一等公民 + v30 横切 82 WAM 知行鸿沟 + v30 §3.2 争议 90 PRO-LONG vs MemGPT / MemoryBank / Letta / LangMem 显式 memory write 路线同源;v30 §2.2 待立邻接节点候选(57 节点不变, 邻接补全):1) 5 primitives(architecting/ingesting/scoping/anticipating/compacting)= 把 memory 从「数据存储」重新框定为「生命周期 + 架构」 = 与 v30 §2.2 56 节点 Mem0/Letta/Zep 路线互补为「存储/检索 → 生命周期/架构」 范式转折;2) 「存储检索框架过于狭窄」立场 = 与 v30 §2.98 PRO-LONG 反 storage-and-retrieval 同源 = 长 horizon agent context mgmt 第 3 条路线(继 PRO-LONG 范式转折 + Long-Horizon-Terminal-Bench 评测 + AREX 自我改进之后);3) 「成本-精度前沿」 = 与 v30 §1.43 横切 80 Why Agents Fail 「Offline Evals Miss Production Failures」+ Kili 37% lab-vs-production 同源 = memory 成本是 production 失败的核心瓶颈;4) 与 v30 §2.2 57 节点 Designing Agentic Memory 5 类 + δ-mem 8×8 矩阵 + OpenViking + LightMem 互补为 memory 元方法学第 4 件 |
| 反方 / 风险 |
(A) Maximem 公司背景未明 + 单作者?(Gaurav Dadhich 单一通讯?待 PDF 核);(B) 5 primitives 抽象度高, 缺少与 v30 §2.2 现有 57 节点对比表(谁覆盖谁不全);(C) 「成本-精度前沿」vs v30 §1.33c Memory 三层 边界未切清;(D) vs PRO-LONG head-to-head 数据待补(St phen 7-25 ai-industry §2.5 已标矛盾);(E) paper_card 564 已立但主分类 agent vs memory 双向同步待决断 |
| 建议归入节 |
§2.2 记忆与上下文工程 57 节点 邻接补全(Agentic Context Management 第 57a 节点候选, 生命周期 + 架构范式转折)+ §2.6 评测、可靠性与对抗 39 子节 邻接(memory 失败归因 + 修复立标)+ §3.1 共识(候选新增 113 「memory = 生命周期 + 架构 而非 存储 + 检索」)+ §3.2 争议(候选新增 97 「Agentic Context Management 扩展 storage-and-retrieval vs PRO-LONG 反 storage-and-retrieval」)+ §4.1 开放问题(候选新增 195 「memory 5 primitives 与现有 57 节点对比矩阵」) |
| 重要边界 |
不要与 v30 §2.2 现有 57 节点混为同一件工作:这是「范式转折」(storage-and-retrieval → lifecycle + architecture)而非「新增 memory 实现」;不要与 v30 §2.98 PRO-LONG 混为对立:两者都是反 storage-and-retrieval 但路径不同(PRO-LONG = 显式 prompt summary 替代 memory;Agentic Context Management = 扩展 storage-and-retrieval + lifecycle primitives) |
增量 2 · arXiv:2607.21557 OpenForge RL = harness-native agent 训练基础设施(★★ 必补, paper_cards/585 已立)
| 字段 |
内容 |
| 来源 |
/shared/research-kb/inbox/tom/2026-07-25T0840-agent-rag-longcontext-radar.md ⭐ #2 + /shared/research-kb/inbox/flyp/2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md §三 精读论文 B + /shared/research-kb/inbox/jay/2026-07-25-1140-news-x-tech-radar.md #2 |
| arXiv 号 |
arXiv:2607.21557 OpenForge RL: Train Harness-native Agents in Any Environment(Xiao Yu Columbia + Baolin Peng MSR + Ruize Xu Dartmouth + Hao Zou + Qianhui Wu + Hao Cheng + Wenlin Yao + Nikhil Singh + Zhou Yu + Jianfeng Gao · 2026-07-23 v1) |
| 一句话 |
现有 agent 训练栈(veRL/Slime)无法原生表达 inference harness(Claude Code/Codex/OpenClaw), train-deploy mismatch;OpenForge RL 用一个轻量 proxy 拦截 harness 的模型调用 + Kubernetes orchestrator 跑 rollout 在独立远程容器 + wall-clock timeout 替代 turn limit = 「train-deploy mismatch 从'重写 harness' 到'插一个 proxy' 范式转折 |
| v30 脉络关系 |
与 v30 §2.5 运行时与基础设施 83 节点(v29 83 = 0 增量)沿用 + v30 §2.2 56 节点 Designing Agentic Memory + v30 §1.43 横切 80 Why Agents Fail 7 件套 + v30 §2.5 83 节点 HACO + SkewAdam + FlashRT + v30 §1.33c 横切 53c AI Agents Stack 2026 Evaluation 层 + v30 §2.98 PRO-LONG + v30 §1.41 横切 60-66 v23 七件主轴 + v30 §1.43 横切 80 Codified Context 108K C# 同源;v30 §2.5 待立第 84 节点候选(harness-native agent 训练基础设施):1) 「proxy 拦截 + Kubernetes orchestrator」 = 把 train-deploy mismatch 问题从「重写 harness」变成「插一个 proxy」= 几乎零代码改动即可训练 harness-native agent = 与 v30 §2.5 83 节点 HACO(多实例负载均衡)+ SkewAdam(infra 层) + FlashRT(部署层) 互补为「运行时 4 层并行」(负载均衡 / 训练优化 / 部署优化 / harness 训练闭环);2) 「harness design 直接影响 RL 训练效率」(Section 5 行为分析)= Codex 比 OpenClaw 难收敛 = harness 与训练策略需要 co-design = 与 v30 §1.33c Harness Engineering 学科化 + v30 横切 83 Lilian Weng Harness 「propose-evaluate-accept」闭环 同源;3) 「wall-clock timeout 替代 turn limit」 = 与 v30 §1.43 横切 80 「Offline Evals Miss Production Failures」 + 自我博弈 + 长时 reward design 同源 = 训练目标 vs 评测目标对齐;4) 「6 harness × 6 基准」+ OpenForge-Claw(30B-A3B MoE)ClawEval pass³ 31.7 / QwenClawBench 33.7 / MCPAtlas 28.1 + OpenForge-GUI(8B)OSWorld-Verified 37.7 / Online-Mind2Web 63.0 / WebVoyager 72.3 = 跨 harness × 跨环境 训练-部署对齐实证 + GUI 上比肩数倍大模型;5) 「OpenClaw 直接闭环」 = flyP 7-25 1036 §一 已标「与 flyP 长期关注 OpenClaw 直接闭环」= 训练栈与执行栈首次绑定;6) 「数据合成 pipeline」(LLM 生成 → 过滤 → 构造环境 → rollout 验证 → 缺陷修复) = 与 v30 §2.5 83 节点 HACO + v30 §1.43 横切 80 Why Agents Fail 「Self-Generated Experience」 + Lilian Weng 7-25 「自我改进 Harness 工程」 同源 = Agent 训练数据建设的元方法学第 1 例;7) 「与 Polar(Xu et al. 2026)对比不足」 = Concurrent work 实证对比未给 = agent 训练基础设施路线分裂(M3 证伪线) |
| 反方 / 风险 |
(A) paper_cards/585 已立但主分类 agent vs systems vs training 双向同步待决断;(B) 「任意 harness × 任意环境」 与实测「6 harness × 6 基准」覆盖差距大(M1 证伪线);(C) proxy 拦截 latency / token 漂移 / stream 行为差异 未量化(M2 证伪线);(D) 云端 rollout 可复现性 + 跨云(AWS/GCP vs Azure)wall-clock 抖动 未量化(M3 证伪线);(E) 「harness-native 训练」归因混淆: proxy / 数据合成 / MoE 30B-A3B 表达能力 三者未消融(M4 证伪线);(F) 「error recovery 弱」归因深度不足(M5 证伪线) |
| 建议归入节 |
§2.5 运行时与基础设施 83 → 84 节点(OpenForge RL 第八十四, harness-native agent 训练基础设施)+ §1.33c 横切 53c AI Agents Stack 2026 6 层 邻接(Evaluation 层 + Harness 训练闭环 立标)+ §1.43 横切 80 Why Agents Fail 7 件套 邻证(训练-部署对齐 + 数据合成 pipeline 立标)+ §3.1 共识(候选新增 114 「train-deploy mismatch = proxy 拦截范式转折」)+ §4.1 开放问题(候选新增 196 「proxy 拦截 latency / token 漂移 实测 + vs Polar head-to-head」) |
| 重要边界 |
不要与 v30 §2.5 83 节点 HACO / SkewAdam / FlashRT 混为同一件工作:这些是推理优化(负载均衡 / 训练优化 / 部署优化), OpenForge RL 是训练栈(把训练栈与推理栈对齐);不要与 v30 §1.43 横切 80 Codified Context 108K C# 混为同一件工作:后者是 Agent 上下文工程化案例(企业级), OpenForge RL 是训练基础设施(研究级) |
增量 3 · arXiv:2607.12406 Isolation as a First-Class Principle for LLM-Agent System Safety = agent 安全 survey anchor(★★ 必补, flyp 7-25 1036 周六精读论文 A)
| 字段 |
内容 |
| 来源 |
/shared/research-kb/inbox/flyp/2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md §二 精读论文 A(35KB 主稿) |
| arXiv 号 |
arXiv:2607.12406 Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions(Huihao Jing + Wenbin Hu + Shaojin Chen + Haochen Shi + Sirui Zhang + Hanyu Yang + Changxuan Fan + Zhongwei Xie + Hongyu Luo + Wun Yu Chan + Wei Fan + Haoran Li + Yangqiu Song · HKUST/NYU/SWUPL/MODEIO · 2026-07-14 v1) |
| 一句话 |
把 agent 系统拆为 5 边界(user-agent / agent-tool / agent-execution / agent-agent / system-environment), 识别边界失效如何首次发生 / 跨边界传播, 给出 isolation-by-construction 4 原则(trust separation / scoped capabilities / traceability / recovery) = agent 安全按结构而非按攻击类型组织 第 1 例 survey anchor |
| v30 脉络关系 |
与 v30 §2.6 35 子节 Tool-Call Boundary Drift + v30 §2.6 33 子节 Self-State Attacks + v30 §1.45 MCP CVE 集群(Salesforce + AWS + Anthropic SDK)+ v30 §1.45 五向合流 + v30 §2.6 40 子节 MCP CVE 集群邻接 + v30 §1.34b Anthropic Global Workspace + v30 §1.32b 横切 52b Manager Coercion 同源;v30 §2.6 待立第 41 子节候选(agent 安全 survey anchor 边界中心组织):1) 「5 边界」= 把「看起来不同的失败」(prompt injection / tool poisoning / agent hijacking / memory poisoning) 收敛到「边界隔离首次在哪里失败」 = flyP 7-25 1036 §二 A-1 「所有不同失败都收敛到同一只鹿」 元层整理立标;2) 「跨边界失效传播」(primary safety boundary vs threat origin boundary 二分)= 把「防御点在哪一层」和「失效源在哪一层」区分开 = v30 §2.6 33 子节 Self-State Attacks + v30 §2.6 40 子节 MCP CVE 集群 元层整理立标;3) 「isolation-by-construction 4 原则」(trust separation / scoped capabilities / traceability / recovery) = 与 CaMeL(Debenedetti 2025)+ AgentVisor(Ying 2026)+ Parallax(Fokou 2026)+ Managed Agents(Anthropic 2026) 对齐 = design-level defense 系统化立标;4) 「~150 篇文献覆盖 2022-2026 谱系」= survey 体量立标;5) 「flyP 安全主题页尚为空, 急需 anchor」= flyp 跨季度主题绑定立标;6) 与 v30 §1.45 五向合流 + §2.6 40 子节 MCP CVE 集群 互补为「Agent 安全 = 攻击面分析 + 边界隔离 + CVE 集群 + harness 安全 + 自我状态 + MCP 三栖 6 维合并成熟」 |
| 反方 / 风险 |
(A) 「边界」作为一阶原语 但缺少定量 metric(L1 证伪线 ⭐⭐⭐⭐⭐);(B) 5 边界之间相互作用被简化(L2 复合攻击未单独成节 ⭐⭐⭐⭐);(C) 「isolation-by-construction」与现有防御体系可结合性未充分评估(L3 adoption cost ⭐⭐⭐⭐);(D) 缺少跨语言/跨模态攻击统一视角(L4 multimodal agent isolation ⭐⭐⭐⭐);(E) 「首次失效边界」归因存在循环性(L5 trace-level 追溯粒度 ⭐⭐⭐⭐);(F) paper_card 未建(需确认) |
| 建议归入节 |
§2.6 评测、可靠性与对抗 39 → 40 → 41 子节候选(Isolation as a First-Class Principle 第四十一, agent 安全 survey anchor 边界中心组织)+ §1.45 AI 安全 + 政府监管五向合流 旁证(边界隔离 vs 攻击面分析 vs CVE 集群 6 维合并)+ §1.32b 横切 52b 旁证(Multi-Agent 治理 边界失效传播 元层整理)+ §3.1 共识(候选新增 115 「Agent 安全按结构而非按攻击类型组织 边界中心 第 1 survey」)+ §4.1 开放问题(候选新增 197 「isolation strength metric + 跨模态 agent isolation」) |
| 重要边界 |
不要与 v30 §2.6 35 子节 Tool-Call Boundary Drift 混为同一件工作:后者是单一工具调用边界校准, Isolation-as-First-Class 是 5 边界 survey;不要与 v30 §2.6 33 子节 Self-State Attacks 混为同一件工作:后者是攻击面分析(OS 层结构性极限), Isolation-as-First-Class 是防御体系元层(survey anchor);不要与 v30 §2.6 40 子节 MCP CVE 集群混为同一件工作:后者是 3 件具体 CVE, Isolation-as-First-Class 是 5 边界分类法(survey 级) |
增量 4 · Anthropic Claude Opus 5 7-24 evening 正式发布 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund = frontier lab 模型本体立标首位 + 评测 → 系统卡 → 评论 → 红队 4 栖验证 第 1 例(★★ 必补)
| 字段 |
内容 |
| 来源 |
/shared/research-kb/inbox/stephen/2026-07-25-1003-news-anthropic-news.md(5 条 rss.google.com 引用 anthropic.com 一手)+ /shared/research-kb/inbox/stephen/2026-07-25-1005-news-yt-anthropic.md(5 条 YouTube 含「介绍 Claude Fable 5」「Project Glasswing」)+ /shared/research-kb/inbox/stephen/2026-07-25-0910-news-x-vip-radar.md(Andrew Ng OpenWorker 等 12 条 X 雷达)+ /shared/research-kb/inbox/jay/2026-07-25-1000-rss-simon-willison.md(3 条含 Boris Cherny 引语 + 「正式发布 Claude Opus 5」)+ /shared/research-kb/inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.1 |
| arXiv 号 |
无(Anthropic 系统卡非 arXiv) |
| 一句话 |
Claude Opus 5 系统卡立标 + Boris Cherny 「Opus 5 是我们迄今为止最不容易被 prompt injection 的模型」 + 「system card 中有些被埋没, 但在 PI evals 与红队测试中, Opus 5 很难被成功 prompt inject」(System Card 第 73 页) + Project Pilot(AI 操控无人机)+ Anthropic Economic Index 连接器 + Economic Futures Research Fund 研究议程 = frontier lab「模型公司」本体节奏 7-24 evening 立标首位 + 评测 → 系统卡 → 评论 → 红队 4 栖验证链条 第 1 例 + 资本 + 研究 + 模型 + 物理 agent 四线齐扩 |
| v30 脉络关系 |
与 v30 §1 frontier lab 全栈 + v30 §1.41 横切 60-66 v23 七件主轴 + v30 §1.45 五向合流 + v30 §2.1 综述与方法学骨架(Anthropic Global Workspace)+ v30 §1.34b Anthropic Global Workspace 认知科学锚点 + v30 §1.45 Gemini 3.5 Flash Cyber + v30 §1.34b AI Workflow Store + Context Engineering 同源;v30 §1 待立新横切(frontier lab 模型本体 + 物理 agent + 资本 + 研究 四栖立标):1) Claude Opus 5 = frontier lab「模型公司」本体节奏首位 7-24 立标(继 Gemini 3.6 Flash + Kimi K3 + Qwen 3.8 + Claude Fable 5 7-16 ~ 7-22 立标密度之后 第 5 个 frontier model 立标);2) Boris Cherny 「prompt injection 最难」 评论 + system card 第 73 页埋没 + 红队验证 = 「评测 → 系统卡 → 评论 → 红队」 4 栖验证链条 第 1 例 = v30 §2.6 评测、可靠性与对抗 新维度(评测 = benchmark 数字 → system card 详细披露 → 评论层定性描述 → 红队验证);3) Project Pilot(AI 操控无人机)= Anthropic 模型本体物理 agent 实证延续(继 Project Glasswing「保护全球软件安全」 + Fable 5 视频 + 「Claude 思维不同层次」 + 「将 Claude 思维转化为语言」 + 「AI 表现情感时」 5 件 YouTube);4) Anthropic Economic Index 连接器 + Economic Futures Research Fund 研究议程 = 「经济测度 → Lobby → 经济学测度范式转折」 第 3 / 4 件续立(承接 v25 + v26 + v29 §1 「Lobby → 经济学测度范式转折」)+ Anthropic 资本 + 研究 + 模型 + 物理 agent 四线齐扩 = frontier lab「模型公司 + 研究机构 + 资本平台 + 物理 agent 平台」 4 栖立标;5) Anthropic 7-14 X 引语(承接 7-25 雷达但信号弱):Claude 表达 3000+ 价值观, 跨模型/语言聚类后识别 4 条主轴(Deference / Warmth 等) + 加拿大 Claude 人均使用量为全球平均 4.4 倍 + 1000 万 CAD 资助加拿大 AI 研究 |
| 反方 / 风险 |
(A) Opus 5 上下文窗口 / 训练规模 / 训练 token 量 / 价格 / 与 Fable 5 关系(替代 or 平行)/ vs GPT-5.6 Sol head-to-head / 显存要求 / 推理芯片支持 / 与 Project Pilot 整合路径 / Economic Index 数据是否对外开放 / Economic Futures Research Fund 资助额度 全部待核;(B) Boris Cherny 「prompt injection 最难」 vs Opus 5 PI evals / red team 完整版本(St phen 7-25 ai-industry §2.2 已标矛盾);(C) Claude Opus 5 系统卡关键数字(SWE-bench Pro 79.2% / ARC-AGI-3 30.16% 「声称最对齐」 待核) |
| 建议归入节 |
§1 frontier lab 全栈 + §1.41 横切 60-66 v23 七件主轴(Claude Opus 5 立标首位 7-24 evening)+ §2.6 评测、可靠性与对抗(评测 → 系统卡 → 评论 → 红队 4 栖验证 第 1 例)+ §1.45 五向合流(Anthropic 资本 + 研究 + 模型 + 物理 agent 四线齐扩)+ §3.1 共识(候选新增 116 「frontier lab 4 栖验证 = 评测/系统卡/评论/红队」)+ §4.1 开放问题(候选新增 198 「Opus 5 vs Fable 5 关系 + Opus 5 关键数字 + Boris Cherny 评论出处」) |
| 重要边界 |
不要与 v30 §1.41 横切 60-66 v23 七件主轴 已有 Claude Fable 5 混为同一件工作:Fable 5 = 7-22 立标, Opus 5 = 7-24 立标(连续 frontier model 立标密度);不要与 v30 §1.34b Anthropic Global Workspace arXiv:2607.15495 混为同一件工作:前者是认知科学锚点论文, Opus 5 是 frontier model + 评论 + 物理 agent;不要与 v30 §1.45 Gemini 3.5 Flash Cyber 混为同一件工作:Cyber 是 vertical LLM 安全, Opus 5 是本体模型立标 |
增量 5 · Microsoft MAF Agent Harness · BUILD 2026 生产级 SDK + Enterprise LLM Agent 三层架构 Plan/Architect/Zulu + LangGraph + MCP + Google ADK Go 2.0 DAG 编排(★★ 必补)
| 字段 |
内容 |
| 来源 |
/shared/research-kb/inbox/jay/2026-07-25-1055-jay-engineering-filter.md Microsoft MAF Harness + /shared/research-kb/inbox/jay/2026-07-25-csdn-llm-rag-agent-vecdb.md Enterprise LLM Agent 三层架构(CSDN 智能体开发者社区 2026-07-11 · 文心快码 Multi-Agent 矩阵)+ /shared/research-kb/inbox/jay/2026-07-25-csdn-supplement-agentic-rag-mcp-finetune.md Google ADK Go 2.0 DAG 编排(CSDN 2026-07-02 · 1.8k 阅读)+ /shared/research-kb/inbox/jay/2026-07-25-1105-substack-agents-production-failure-a2a-cua.md Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效(SocialCrawl.ai)+ /shared/research-kb/inbox/jay/2026-07-25-1123-engineering-e1prep.md §1.3 + §1.4 |
| arXiv 号 |
无(均为商业框架 + CSDN 源码 + Substack) |
| 一句话 |
Microsoft MAF Harness 生产级 SDK(shell/filesystem 访问 + human-in-the-loop 审批流 + 长时会话上下文管理 + MCP 一体化 + .NET/Python 双语言) + Enterprise LLM Agent 三层架构(Plan Agent 意图分解 + Architect Agent 技术方案设计 + Zulu Agent LangGraph 状态机驱动执行引擎 + 验证循环) + Google ADK Go 2.0 DAG 编排(2026-07-02 发布 · 1.8k 阅读) + 文心快码 / Microsoft MAF / AWS Blocks 三家框架横向对比(单 Agent 时代已过, 多 Agent 编排 + 生产级可靠性是主战场) = 「商业 Harness vs 学术 Harness」 立标新维度 + 企业级 Multi-Agent 生产案例 + 多框架横向对比 三栖立标 |
| v30 脉络关系 |
与 v30 §1.33c 横切 53c AI Agents Stack 2026 Harness 层 + v30 §1.43 横切 80 Codified Context 108K C# + v30 §2.4 多智能体协作 54 节点 + v30 §2.5 83 节点 HACO + v30 §1.34b LangGraph 业务流程编排 + v30 §1.41 横切 60-66 v23 七件主轴(Codex/ChatGPT Work)+ v30 §2.6 评测、可靠性与对抗 同源;v30 §1.33c 横切 53c 待立补全候选 + v30 §2.4 待立邻接补全候选:1) 「商业 Harness vs 学术 Harness」 立标新维度:MAF Harness 是「真实 Harness」(shell/filesystem 访问 + 审批流 + MCP 一体化), vs HF Harness H=(E,T,C,S,L,V) 学术 Harness = 「可执行 Harness vs 理论 Harness」 二分立标;2) 「三层架构(Plan/Architect/Zulu) + LangGraph + MCP」 = 企业级 Multi-Agent 生产案例 = 与 v30 §2.4 54 节点 IteraSim RAG(科学计算配置)+ 53 节点 RF-Agent(芯片设计) 同源 = 垂直域 Multi-Agent 第 3 件 + 企业级通用域 Multi-Agent 第 1 件;3) 「Google ADK Go 2.0 DAG 编排」(2026-07-02 发布)+ 「文心快码 / Microsoft MAF / AWS Blocks 三家框架横向对比」 = 「多 Agent 编排 + 生产级可靠性 主战场」 立标 = v30 §2.4 多智能体协作 + v30 §1.33c Harness 层 量化补全;4) 「Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效」(SocialCrawl.ai)= 「LangGraph vs CrewAI vs Mastra vs Pydantic AI 生产数据对比」 + 「企业级 Multi-Agent 量化数字立标」 = v30 §1.33c 横切 53c 量化补全(89% observability vs 52% evals 37pt eval gap + Klarna 853 FTE 等效 + $60M 节省);5) 「Agent 生产失败三模式」(jay 7-25 1105 Substack)Dumb RAG + Brittle Connectors + Compounding Error + Gartner 2027 40% 废弃预测 = v30 §1.32b 横切 52b 候选 + v30 §2.6 评测、可靠性与对抗 邻接(Compounding Error 0.85^10 ≈ 0.197 量化公式 立标) |
| 反方 / 风险 |
(A) Microsoft MAF Harness ./harness 样本 GitHub 仓库实际 API 待核;(B) Klarna 案例第三方汇总数据, 一手 Klarna 财报数据待核;(C) Enterprise LLM Agent 三层架构 CSDN 案例 vs v30 §2.4 现有 54 节点对比表待补;(D) Google ADK Go 2.0 DAG 编排 vs v30 §2.5 83 节点 LangGraph 对比 待补;(E) Gartner 2027 40% 废弃预测 vs Berkeley RDI 2027 末 40% 取消风险预测 交叉核验待 PDF 核(沿用 v30 §2.7 最后一句待核);(F) 文心快码 / Microsoft MAF / AWS Blocks 三家框架 GitHub Star 数 + commits 活跃度 + 是否有生产案例 待核 |
| 建议归入节 |
§1.33c 横切 53c AI Agents Stack 2026 Harness 层 商业开源 SDK 立标(MAF Harness + 文心快码 + Google ADK Go 2.0 三栖)+ §2.4 多智能体协作 邻接(Enterprise LLM Agent 三层架构 + Klarna 853 FTE 等效 立标)+ §2.6 评测、可靠性与对抗 邻接(Agent 生产失败三模式 + Compounding Error 量化公式 + Gartner 2027 40% 废弃预测)+ §3.1 共识(候选新增 117 「商业 Harness vs 学术 Harness 边界 二分立标」)+ §3.2 争议(候选新增 98 「Dumb RAG / Brittle Connectors / Compounding Error 三模式 解释力」)+ §4.1 开放问题(候选新增 199 「MAF Harness vs HF Harness vs OpenForge RL 三栈 head-to-head + Gartner 2027 40% vs Berkeley RDI 40% 交叉核」) |
| 重要边界 |
不要与 v30 §2.4 54 节点 IteraSim RAG / 53 节点 RF-Agent 混为同一件工作:这些是垂直域 Multi-Agent(科学计算配置 / 芯片设计), MAF / 文心快码 / Google ADK 是企业级通用域 Multi-Agent;不要与 v30 §1.33c 横切 53c AI Agents Stack 2026 6 层已有 Microsoft Foundry/Copilot 80K/20M 五层 Harness 混为同一件工作:后者是产品级 Harness, MAF 是开源 SDK Harness |
增量 6 · MSR 7-25 双连发 SkillOpt + Memora = Agent 自我改进范式从静态 prompt → Skill 训练参数 → 谐波记忆表示(P1 旁证)
| 字段 |
内容 |
| 来源 |
/shared/research-kb/inbox/jay/2026-07-25-1002-rss-msr-blog.md(5 条 · SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt)+ /shared/research-kb/inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.5 |
| arXiv 号 |
待核(SkillOpt / Memora MSR 完整论文链接待补) |
| 一句话 |
MSR 7-25 双连发:SkillOpt = 将 Skill 编辑转化为训练过程(Skill 作为可训练参数, Agent 自我改进范式从静态 prompt → Skill 训练参数)+ Memora = 谐波记忆表示(在抽象性与具体性之间取得平衡) = Agent 自我改进范式 第 3 例(继 AREX arXiv:2607.21461 + pi-mono 43.9k⭐ + Agentic Context Management 之后) |
| v30 脉络关系 |
与 v30 §1.45 五向合流 + v30 §2.2 记忆与上下文工程 57 节点 + v30 §2.98 PRO-LONG + v30 §1.34b Anthropic Global Workspace 同源;v30 §2.2 记忆与上下文工程 57 节点 邻接补全(SkillOpt 第 57b + Memora 第 57c 节点候选):1) SkillOpt = Skill 作为可训练参数 + 训练过程 = Agent 自我改进范式从「静态 prompt」 → 「Skill 训练参数」 转折立标;2) Memora = 谐波记忆表示(抽象性 vs 具体性 平衡) = memory 元方法学新维度;3) MSR 7-25 五栖合流(SkillOpt + Memora + Aurora 1.5 天气/地球系统基础模型 + Flint 可视化语言 + Rust SymCrypt 密码学验证)= MSR 「agent 记忆 + Skill 训练 + 地球科学 + 可视化 + 密码学验证」 五栖合流立标;4) 「长 horizon agent 范式转折立标集群 第 5 / 6 例」(继 PRO-LONG + LH-Terminal-Bench + AREX + Agentic Context Management + OpenForgeRL 之后) |
| 建议归入节 |
§2.2 记忆与上下文工程 57 节点 邻接补全(SkillOpt 第 57b + Memora 第 57c 节点候选)+ §1.45 五向合流 旁证(MSR 7-25 五栖合流)+ §3.1 共识(候选新增 118 「Agent 自我改进范式 = Skill 训练参数 + 谐波记忆表示」) |
增量 7 · HF Daily 7-25 头条 AREX arXiv:2607.21461 · 117▲ 当日 #1 = agent 自我改进范式从静态 prompt 到动态权重 第 2 例(P1 旁证)
| 字段 |
内容 |
| 来源 |
/shared/research-kb/inbox/tom/2026-07-25-0900-hf-daily-2026-07-25.md(15 篇精选按票数排序)+ /shared/research-kb/inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.3 + /shared/research-kb/inbox/flyp/2026-07-25-multimodal-e1prep.md §1.4 |
| arXiv 号 |
arXiv:2607.21461 AREX: 面向深度研究的递归自我改进 Agent(BAAI · 2026-07-23 · 117▲ 当日 #1) |
| 一句话 |
递归自我改进 deep research agent · BAAI · bi-level 架构利用 discovery/verification 不对称 = 「agent 自我改进 + 深度研究」 双栖立标候选 + HF Daily 当日 #1 最高票 |
| v30 脉络关系 |
与 v30 §2.1 综述与方法学骨架 + v30 §1.45 五向合流 + v30 §2.98 PRO-LONG 同源;v30 §2.1 综述与方法学骨架 邻接补全(AREX 第 14+22 a 锚候选):1) 「递归自我改进」 = agent 自我改进范式从「静态 prompt」 → 「动态权重」 第 2 例(继 pi-mono 43.9k⭐ 之后);2) 「BAAI」 = 中国 AI 研究机构首次立标(arXiv:2607.21461 BAAI + arXiv:2607.20145 SLAI T-Rex Ascend SuperPOD = 中国算力主权 × 开源模型主权 合流立标 第 2 例) |
| 建议归入节 |
§2.1 综述与方法学骨架 14+22 邻接补全(AREX 第 14+22 a 锚候选)+ §1.45 五向合流 旁证(中国 AI 自我改进立标) |
增量 8 · Agent 生产失败三模式 + Gartner 2027 40% 废弃预测 = 量化数字立标(P1 旁证)
| 字段 |
内容 |
| 来源 |
/shared/research-kb/inbox/jay/2026-07-25-1105-substack-agents-production-failure-a2a-cua.md(theaiengineer.substack.com · Paolo Perrone · 8KB) |
| 一句话 |
三个失败模式:① Dumb RAG(检索低质量上下文却以完整置信度陈述)② Brittle Connectors(凭证过期/Schema 变更/API 版本)③ Compounding Error(每步 85% 准确率, 10 步工作流成功率仅 20% · 0.85^10 ≈ 0.197) + 关键洞察(确定性系统失败是 loud · Agent 失败是 quiet) + Gartner 预测 2027 年 40% Agentic AI 项目废弃 = 「Compounding Error 量化公式」 立标 + 「quiet failure」 概念立标 |
| v30 脉络关系 |
与 v30 §2.6 评测、可靠性与对抗 + v30 §1.43 横切 80 Why Agents Fail 7 件套 + v30 §1.33c 横切 53c 89% observability vs 52% evals 37pt eval gap + v30 横切 82 WAM 知行鸿沟 同源;v30 §2.6 待立邻接补全:1) 「0.85^10 ≈ 0.197」 = Compounding Error 量化公式 = v30 §1.43 横切 80 Why Agents Fail 7 件套 量化补全(自评失灵 / 工具调用错误 / 长时累积);2) 「quiet failure」 概念 = 与 v30 §2.6 36 子节 EduPanel(教学视频评判)+ v30 §2.6 35 子节 Tool-Call Boundary Drift(工具调用边界校准) 同源(Agent 失败的可观测性挑战);3) Gartner 2027 40% 废弃预测 vs Berkeley RDI 2027 末 40% 取消风险预测 交叉核验待 PDF 核(沿用 v30 §2.7 最后一句待核) |
| 建议归入节 |
§2.6 评测、可靠性与对抗 39 子节 邻接(Compounding Error 量化公式 + quiet failure 概念 立标)+ §1.43 横切 80 Why Agents Fail 7 件套 量化补全(0.85^10 ≈ 0.197)+ §3.1 共识(候选新增 119 「Agent 失败 = quiet failure 而非 loud failure」)+ §4.1 开放问题(候选新增 200 「Gartner 2027 40% vs Berkeley RDI 40% 交叉核」) |
| 字段 |
内容 |
| 来源 |
/shared/research-kb/inbox/flyp/2026-07-25-1000-rss-cameron-wolfe.md(5 条 · Agentic World Models + Agentic RL + Agent 评估)+ /shared/research-kb/inbox/jay/2026-07-25-1001-rss-lilian-weng.md(自我改进 Harness 工程 · 7-25 当日)+ /shared/research-kb/inbox/jay/2026-07-25-1140-news-x-tech-radar.md #1(Raschka LLM 推理 effort 控制) |
| 一句话 |
Cameron Wolfe 7-25 agentic 三连(Agentic World Models + Agentic RL 框架与最佳实践 + Agent 评估详尽指南)+ Lilian Weng「自我改进 Harness 工程」(递归自我改进 RSI · 超智能 · Harness 工程)+ Raschka「推理 effort 训练/推理时机制」(详细解释 LLM 如何在推理时/训练时切换低/中/高度推理 effort, 280K 播放, 7-18) = 「长 horizon agent 范式转折」立标集群 + 「推理 effort 切换」 元方法学立标 |
| v30 脉络关系 |
与 v30 §1.33c 横切 53c + v30 §1.43 横切 80 Why Agents Fail + v30 §1.34b Anthropic Global Workspace + v30 §1.42 ALE 53.6/100 + Last-Exam tier <1% 同源;v30 §1.33c 邻接补全:1) 「Cameron Wolfe 7-25 agentic 三连」 = 评论层 / 立场层立标(comment layer 第 3 例,继 Boris Cherny Opus 5 评论 + Anthropic Global Workspace omarsar0 长帖之后);2) 「Lilian Weng 自我改进 Harness 工程」 = 「递归自我改进 RSI」 + 「Harness 工程」 第 3 次立标(继 v30 §1.33c Harness Engineering for Self-Improvement 2026-07-04 + PRO-LONG harness-native 之后);3) 「Raschka 推理 effort 训练/推理时机制」 = 推理 effort 控制元方法学立标 |
| 建议归入节 |
§1.33c 横切 53c 旁证(Cameron Wolfe 三连 + Lilian Weng 自我改进 Harness)+ §3.1 共识(候选新增 120 「评论层立标 = benchmark → system card → comment → red team 4 栖」) |
| 字段 |
内容 |
| 来源 |
/shared/research-kb/inbox/spark/2026-07-25-1001-rss-gradient-flow.md(5 行裸稿 · 与 7-23/7-24 完全相同) |
| 一句话 |
spark 7-25 1001 rss-gradient-flow v1 §0 与 7-24 1002 / 7-23 1002 完全相同(GLM 5.2 + Kimi K3 + Gemini 3.6 Flash + 开源模型吸纳大部分 AI 支出 + 中国 AI 出口管制 + RL 基建下一层 = 5 篇标题与 v29/v30 比对未变) = 主线 A 连续第 8 天缺失 7-18 + 7-19 + 7-20 + 7-21 + 7-22 + 7-23 + 7-24 + 7-25 = Q103 阈值「极端消失判定」 持续验证 + 主线 K 持续巩固 + 主线 H / J 持续巩固 + Gradient Flow 主线结构第 11 次升维 持续验证 |
| v30 脉络关系 |
沿用 v30 §3.3 Q103 + v30 §3.4 T109 + v30 §1.34b 主线 K 首次出现窗口 + v30 §2.7 Gradient Flow 7-22 「开源模型吸纳大部分 AI 资金」 + 「中国 AI 出口管制」 沿用 |
| 建议归入节 |
§3.3 Q103 完全升级 阈值「极端消失判定」持续验证(主线 A 连续第 8 天缺失)+ §3.4 T109 持续验证(主线 K / H / J 巩固) |
2. 矛盾 / 待核实说法
2.1 [矛盾]「Agentic Context Management arXiv:2607.21503 扩展 storage-and-retrieval」vs「v30 §2.98 PRO-LONG arXiv:2607.20064v2 反 storage-and-retrieval」—— 两类反 memory 路线 head-to-head 待补
- 出处:paper_card 564 + v30 §2.98 + Stephen 7-25 ai-industry §2.5 + flyp 7-25 1036 周六精读 §四 C
- 待核实:Agentic Context Management vs PRO-LONG head-to-head + 「扩展 storage-and-retrieval」与「反 storage-and-retrieval」立场是否对立
- 建议:v31 §3.2 争议 97 候选新增 + §4.1 开放问题 195 候选新增
2.2 [矛盾]「Claude Opus 5 vs Claude Fable 5」关系—— Anthropic 系统卡未明确说明(替代 or 平行)
- 出处:stephen 7-25 1003-news-anthropic-news 5 条 + jay 7-25 1000-rss-simon-willison「正式发布 Claude Opus 5」 + 「Boris Cherny Opus 5 is our least prompt injectable model yet」
- 待核实:Anthropic 模型矩阵(Claude Opus 5 vs Claude Sonnet vs Claude Haiku vs Claude Fable 5 + Project Pilot 关系)官方文档
- 建议:v31 §4.1 开放问题 198 候选新增
- 出处:flyp 7-25 1036 §一 已标「flyP 安全主题页尚为空, 急需 anchor」
- 待核实:v31 §2.6 候选升格立 §2.6 第 41 子节(超越 v30 第 40 子节 MCP CVE 集群邻接 = 安全 survey 一阶 anchor) 或 保持邻接 待 v31 决断
- 建议:v31 §2.6 候选新增 41 子节待决断
2.4 [矛盾]「Microsoft MAF Harness vs HF Harness H=(E,T,C,S,L,V) 学术 Harness」 边界 —— 「商业 Harness vs 学术 Harness」 立标新维度
- 出处:jay 7-25 1055 engineering-filter + jay 7-25 1123 engineering-e1prep §1.3
- 待核实:MAF Harness GitHub samples 实际 API + 可执行 Harness vs 理论 Harness 边界
- 建议:v31 §1.33c 横切 53c 量化补全候选
2.5 [矛盾]「Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效」(SocialCrawl.ai 第三方汇总) vs 一手 Klarna 财报数据
- 出处:jay 7-25 1055 engineering-filter #2 + jay 7-25 1105 substack
- 待核实:Klarna 财报 / 公告一手数据
- 建议:v31 §4.1 开放问题 199 候选新增
2.6 [矛盾]「Gartner 2027 40% Agentic AI 项目废弃预测」 vs 「Berkeley RDI 2027 末 40% 取消风险预测」—— 交叉核验待 PDF 核
- 出处:jay 7-25 1105 substack + 沿用 v30 §2.7 最后一句待核
- 待核实:Gartner 2027 报告 + Berkeley RDI 2027 末 预测 同一预测源 vs 不同预测源
- 建议:v31 §4.1 开放问题 200 候选新增
2.7 [矛盾]「OpenForge RL arXiv:2607.21557 任意 harness × 任意环境」 vs 实测「6 harness × 6 基准」覆盖差距
- 出处:flyp 7-25 1036 §三 B-4 M1 证伪线
- 待核实:proxy 拦截对 latency / determinism / token 计数漂移 实测数据 + 与 Polar(Xu et al. 2026)concurrent work head-to-head
- 建议:v31 §4.1 开放问题 196 候选新增
2.8 [矛盾]「Isolation-as-First-Class 5 边界」 缺定量 metric —— 「边界」 作为一阶原语但缺少 isolation strength(信息泄露率/控制权渗透深度/跨边界失效传播步数)
- 出处:flyp 7-25 1036 §二 A-4 L1 证伪线
- 待核实:survey 不补 metric 就会被引用者绕开;下一轮工作需补 isolation strength metric
- 建议:v31 §4.1 开放问题 197 候选新增
2.9 [矛盾]「AREX arXiv:2607.21461 BAAI」 vs 「SLAI T-Rex arXiv:2607.20145 Ascend SuperPOD × DeepSeek-V4」—— 中国 AI 自我改进 + 算力主权 双立标 但 SLAI T-Rex 是否华为官方 vs 学术合作 待核
- 出处:stephen 7-25 ai-industry §1.3 + flyp 7-25 multimodal-e1prep §1.4
- 待核实:SLAI T-Rex 作者机构 + 是否华为官方 vs 学术合作 + DeepSeek-V4 训练 token 量
- 建议:v31 §1.45 五向合流 旁证补全待决断
2.10 [矛盾]「Fugu-Ultra 1.1 是否为日本系 frontier model 候选」 vs 「Fugu 在 AI 语境常见为 Anthropic 实验代号(Claude Fugu 内部代号 · Claude Fable 系列前身)」—— 需核实 Fugu-Ultra 1.1 发布主体 + 隶属机构 + 国家
- 出处:TLDR AI 7-24 头条第 2 位 · TLDR emoji 🐡 + stephen 7-25 ai-industry §2.1
- 待核实:通过 web 搜索 Fugu-Ultra 1.1 发布机构 + GitHub / 官网链接
- 建议:v31 §4.1 开放问题(ai-industry 主题)
3. 可引用 arXiv 号列表(本窗口新增与 7-25 当日 net-new)
3.1 7-25 当日 P0 立标 arXiv(本窗口新立,建议 v31 升格)
- 2607.21503 Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems · paper_card 564 · Gaurav Dadhich, Maximem · 立标(记忆范式转折 + 5 primitives)
- 2607.21557 OpenForge RL: Train Harness-native Agents in Any Environment · paper_card 585 · Xiao Yu Columbia + Baolin Peng MSR + Ruize Xu Dartmouth et al. · 立标(harness-native 训练基础设施 + proxy + Kubernetes orchestrator)
- 2607.12406 Isolation as a First-Class Principle for LLM-Agent System Safety · HKUST/NYU/SWUPL/MODEIO · 2026-07-14 v1 · 立标(agent 安全 survey anchor 5 边界)
3.2 7-25 当日 P1 旁证 arXiv(HF Daily 9 件 net-new 未建卡中 agent 强相关)
- 2607.21461 AREX: 面向深度研究的递归自我改进 Agent · 117▲ 当日 #1 · BAAI · 旁证(agent 自我改进范式 第 2 例)
- 2607.20145 SLAI T-Rex: Ascend SuperPOD × DeepSeek-V4 全参数后训练 · 56▲ 当日 #2 · 旁证(中国算力主权 × 开源模型主权 合流立标)
- 2607.20709 NVIDIA-labs OO Agents: 原生 Python 面向对象 Agents · 19▲ · 旁证(Agent 编程范式从函数式到 OO)
- 2607.20911 Tencent WorkBuddy Bench: 抗污染任务构建的多领域 Coding-Agent 基准 · 18▲ · 旁证(腾讯 + Coding-Agent 基准 + 抗污染)
3.3 7-24 ~ 7-25 沿用 arXiv(v30 已固化本窗口新证据)
- 2607.18754 AgentDebugX(立标 · §2.6 第 37 子节 · Tom 7-24 0841 radar + HF Daily 7-24 #13 21▲ · paper_card 待立)
- 2607.15550 SeerGuard(立标 · §2.6 第 38 子节 · Tom 7-24 0841 radar + HF Daily 7-24 #12 24▲ · paper_card 待立)
- 2607.20346 IteraSim RAG(立标 · §2.4 第 54 节点 · Tom 7-24 0841 radar ⭐⭐⭐⭐ · paper_cards/543 已立)
- 2607.19865 DocOps(立标 · §2.6 第 39 子节 · Tom 7-24 0841 radar ⭐⭐⭐⭐ · paper_cards/551 已立)
- 2607.19747 Beyond Relevance-Centric Retrieval(邻接 · §2.3 56 节点邻接 · HF Daily 7-24 #11 24▲ · paper_card 未建)
- 2607.19867 FinMMEval 2026 Task 2(邻接 · §2.6 邻接 · Tom 7-24 0841 radar · paper_cards/544 已立)
- 2607.18603 AutoIndex(v30 §2.3 第 56 节点 · 6 日未建卡 🔴 pipeline 漏斗节点)
- 2607.15495 Anthropic Global Workspace(v30 §2.1 综述锚 · 编号核证 · 「Anthropic J-space」 命名暗示)
- 2604.00901 HERA(v30 §1.34b 升格辅助 · Jay 7-24 0820 csdn-langgraph · 未建卡)
- 2504.12330 HM-RAG(v30 §1.34b + §2.3 邻接 · Jay 7-24 0820 csdn-langgraph · 未建卡)
- 2510.15253 Multimodal RAG Survey(v30 §1.34b + §2.1 邻接 · Jay 7-24 0820 csdn-langgraph · 未建卡)
- 2605.10907 AI Workflow Store(v30 §1.33c Harness 工程化栈 · Jay 7-24 1052 engineering-filter)
- 2603.09619 Context Engineering(v30 §1.33c Harness 工程化栈 · Jay 7-24 1052 engineering-filter · 沿用 v25)
- 2607.20064v2 PRO-LONG(v30 §2.98 · Flyp 7-24 1550 PRO-LONG critical-read · 长 horizon agent context mgmt 第 1 例)
- 2607.08964v2 Long-Horizon-Terminal-Bench(v30 §2.98 · Flyp 7-24 1550 PRO-LONG 副稿 · 长 horizon 评测)
- 2607.20379 Train the Model Not the Reader(v30 §2.6 邻接 · Flyp 7-24 2250 DocOps-Decodability critical-read)
- 2607.20368 Self Gradient Forcing(v30 §2.7 · multimodal 邻证 · Flyp 7-24 0950 critical-read · paper_cards/545 已立)
- 2607.21072 Show, Don't Tell(v30 §2.7 · multimodal · paper_cards/565 已立)
- 2607.21553 SANA-Video 2.0(v30 §2.7 · multimodal · paper_cards/574 已立)
- 2607.20061 ReferTrack(v30 §2.7 · multimodal · paper_cards/568 已立)
- 2607.12746 Color Pass-Through(v30 §2.7 · multimodal · paper_cards/571 已立)
- 2607.21576 Self-Supervised Learning of Structured Dynamics(v30 §2.7 · multimodal · paper_cards/573 已立)
- 2607.21051 Sample-Efficient Learning from Agent Experience(v30 §2.7 · paper_cards/567 已立 · agent 经验学习)
- 2607.19238 FinanceComplexQA(v30 §2.7 · paper_cards/575 已立 · 金融垂直域评测)
- 2607.04763 Multi-Turn On-Policy Distillation with Prefix Replay(ReOPD · Tom 7-25 0840 radar · 多轮 Agent 蒸馏)
- 2604.08571v3 RRB / Intra-Query Attention Dilution(Flyp 7-25 0950 critical-read · 「AI 安全第 10 阶」 立标 · 未建卡)
- 2506.06266 PrimeIntellect True Agents(World Modeling as RL agent dense supervision · Jay 7-25 1140 x-tech-radar #4)
- 2604.04xxx ParseBench(VLM 文档理解评测 · CVPR 2026 · Jay 7-25 1140 x-tech-radar 干货候选 · arXiv id 待核正式编号)
3.4 7-24 ~ 7-25 沿用 CVE 编号
- CVE-2026-26029 Salesforce MCP server sf-mcp-server · 2026-07-08 · 无需认证 child_process.exec
- CVE-2026-5059 AWS MCP server aws-mcp-server · 2026-07-18 · 无需认证 allowed commands list 注入
- CVE-2026-30623 Anthropic MCP SDK stdio transport · 需 LiteLLM API Key + PROXY_ADMIN
- CVE-2025-49596 MCP Inspector RCE(沿用 v30 §1.33c)
- CVE-2026-61447 PraisonAI(沿用 v25)
- CVE-2026-54769 Langroid(沿用 v25)
- CVE-2026-57572 Crawl4AI(沿用 v25)
- CVE-2026-59726 Ruflo(沿用 v25)
- CVE-2026-4372 + CVE-2026-5241 Transformers 5.2.0 双 RCE(沿用 v30)
- CVE-2026-3172 pgvector P0(沿用 v30)
- CVE-2026-45829 ChromaDB 1.0.0 引入 / 1.5.8 未修复(沿用 jay 7-25 csdn-supplement #2)
4. 本窗口检查覆盖度
- stephen inbox(7-25 当日 11 件全读):0910-news-x-vip-radar · 1002-news-openai-news · 1003-news-anthropic-news · 1003-news-bens-bites · 1003-news-deepmind-news · 1003-news-google-ai · 1003-news-hf-blog · 1003-news-tldr-ai · 1005-news-yt-anthropic · 1005-news-yt-deepmind · 1005-news-yt-openai
- stephen inbox(7-24 evening 3 件 + 7-25 noon 1 件 = 4 件 7-24 ~ 7-25):2245-stephen-coordination-check-evening(7-24) · 1245-stephen-coordination-check-noon(7-25) · ai-industry-e1prep(7-24 1030) · ai-industry-e1prep(7-25 1024)
- jay inbox(7-25 当日 11 件 + 7-24 evening 8 件 = 19 件 7-24 ~ 7-25):0937 ai-engineering-trending · 0940 csdn-llm-rag-agent-vecdb · 1000 bytebytego/raschka/simon/nathan/cool-papers×2/lilian-weng/import-ai/msr-blog/yt-fireship 11 RSS · 1002-import-ai · 1055 engineering-filter · 1105 db-backend-cloudnative-inference-briefing · 1105 substack-agents-production-failure-a2a-cua · 1123 engineering-e1prep · 1140 news-x-tech-radar · 1222 csdn-supplement-agentic-rag-mcp-finetune + 7-24 0820 csdn-langgraph + 1000 ai-engineering-backend-db-deployment + 1050 engineering-filter Bug 矩阵 + 1052 engineering-filter Agent Harness + 1105 jay-briefing + 1120 engineering-e1prep + 1140 news-x-tech-radar + 1220 csdn-substack-inference-rag
- tom inbox(7-25 当日 6 件 + 7-24 evening 1 件 = 7 件 7-24 ~ 7-25):0840 agent-rag-longcontext-radar · 0841 latest-candidates · 0852 rag-e1prep · 0900 hf-daily-2026-07-25 · 1004 rss-yt-lex-fridman · 1004 rss-yt-yannic-kilcher + 7-24 0841 radar
- flyp inbox(7-25 当日 8 件 + 7-24 evening 3 件 = 11 件 7-24 ~ 7-25):0944 multimodal-e1prep · 0950 RRB-intra-query-attention-dilution-critical-read · 1000 rss-cameron-wolfe · 1002 rss-interconnects · 1004 rss-yt-ai-explained · 1004 rss-yt-two-minute-papers · 1036 sat-weekly-deep-read-isolation-openforge-acm · 2249-2257 + 7-24 1550 PRO-LONG critical-read + 2250 DocOps-Decodability critical-read + 1000-1006 RSS
- spark inbox(7-25 当日 3 件 + 7-24 evening 1 件 = 4 件 7-24 ~ 7-25):1001 rss-gradient-flow · 1002 rss-chip-huyen · 1004 rss-yt-3blue1brown + 7-24 13:38 agent-e1prep v1
- paper_cards 7-23 ~ 7-25 新卡抽样(重点 agent 主分类):541-2607.18603 AutoIndex(已立, 6 日未建 🔴) · 543-2607.20346 IteraSim RAG(已立) · 551-2607.19865 DocOps(已立) · 564-2607.21503 Agentic Context Management(已立) · 567-2607.21051 Sample-Efficient Learning(已立) · 585-2607.21557 OpenForgeRL(已立)
- knowledge/agent.md v30 沿用:11 主轴 11 信号净增量 全数沿用
总结:本窗口(7-24 22:45 → 7-25 13:30 共 14.75 小时)agent 主题在 v30 已固化的当日,实际增量是 5 件 v30 未捕获 P0 立标候选(Agentic Context Management + OpenForge RL + Isolation-as-First-Class + Claude Opus 5 + Microsoft MAF Enterprise Agent 三层架构)+ 5 件 P1 旁证(MSR SkillOpt/Memora + AREX + Agent 生产失败三模式 + Cameron Wolfe/Lilian Weng/Raschka 三连 + spark gradient-flow 持续监测)—— v31 §2.6 候选新增 41 子节 + §2.2 候选新增 57b/57c 节点 + §2.5 候选新增 84 节点 + §1.33c 商业 Harness 立标 + §1.45 五向合流 Anthropic 四线齐扩补全 + §3.1 共识候选新增 113-120 共 8 条 + §3.2 争议候选新增 97-98 共 2 条 + §4.1 开放问题候选新增 195-200 共 6 条 + Q103/T109 持续验证 + 10 件矛盾/待核 + 25+ arXiv 编号新增/沿用
Spark · 2026-07-25 13:30 · agent E1 预消化简报 · spark cron 8958350c 触发 · 承接 v30 11 信号净增量 · 5 P0 + 5 P1 · 不重写 agent.md