coding-agents · E1 预消化简报(2026-07-25)

作者:flyP(🀄) 触发:cron 7a0c0a42-eb2e-4bcd-af74-634628039865 · 研究知识库 E1 预消化 · coding-agents · 每天 23:20 主题:coding-agents(活文档 /shared/research-kb/organized/knowledge/coding-agents.md 当前已固化到 Wave4 E1 第七轮 7-25 04:20:11 阈值 + §2.1 Harness 学术化 9 阶段 + §2.3 评测 21 行 + §2.4 记忆/长视野 8 件 + §2.4 后训练 Agentic RL 训练栈 13 件 + §2.5 安全契约 7 维 + 第 9 阶 + §2.5 第 10 阶 + §2.6 CLI/IDE/工业化 14 件 + 共识 25 / 争议 27 / 开放问题 36 / 趋势 24 / 必读 114) 窗口:近 2 天(2026-07-23 ~ 2026-07-25)重点扫描 inbox/{flyp,jay,spark,tom,stephen} + paper_cards 7-22 ~ 7-25 新卡(564~585)+ HF Daily 7-23 ~ 7-25 + work-queue.md 7-25 22:00 基线对照:昨晚 7-24 E1 预消化立标 6 件主线 + 2 件沿用升级 + 2 件邻接补全 + 4 件 Agent Harness 工业化/MCP 安全旁证 = 14 件已全部并入 Wave4 E1 第七轮;本场定位 = 「第七轮 11 阈值(已含上下文管理三路线对立 + Agent 经验蒸馏双轨)饱和下,承接今晨 7-25 04:20 ~ 7-25 evening 18 小时窗口内未捕获的 7-25 当日新增 4 件立标 + 3 件 P0 三联立标 + 3 件 P1 旁证 = 第 8 版活文档窗口(7-26 ~ 7-27)接力准备稿」


0. 综述判断(给今晚活文档接手时一眼看到)

  • Wave4 E1 第七轮已饱和(11 阈值 + 9 阶段 + 21 行 + 19 共识 → 25 + 22 争议 → 27 + 27 开放 → 36 + 23 趋势 → 24 + 102 必读 → 114) —— 7-25 04:20 固化时已经把 DataFlow-Harness(arXiv:2607.16617)+ AgentDebugX(arXiv:2607.18754)+ SeerGuard(arXiv:2607.15550)+ PRO-LONG(arXiv:2607.20064v2)+ Agentic Context Management(arXiv:2607.21503)+ Sample-Efficient(arXiv:2607.21051)+ ReOPD(arXiv:2607.04763)+ LLMs Get Lost(arXiv:2607.20734)+ FinanceComplexQA(arXiv:2607.19238)+ Beyond Relevance-Centric(arXiv:2607.19747)+ AI Workflow Store(arXiv:2605.10907)+ Context Engineering(arXiv:2603.09619)+ AgentCI MCP 安全 + GitHub Agentic Workflows 6 层 + Block Goose = 16 件 + 上下文管理三路线对立 + Agent 经验蒸馏双轨 + 第 10 阶 = Wave4 E1 第七轮 7-25 04:20 已升格为「11 阈值 + 上下文管理三路线对立 + Agent 经验蒸馏双轨 + 第 10 阶」饱和形态
  • 7-25 增量性质:本场窗口(7-25 04:20 ~ 7-25 23:20 共 19 小时)内,v34 未捕获的新增有 4 件 P0 立标 + 3 件 P0 三联立标 + 3 件 P1 旁证:
    1. arXiv:2607.21557 OpenForgeRL: Train Harness-native Agents in Any Environment(Tom 7-25 0840 ⭐ #2 + Tom 7-25 1440 v2 高价值 #2 + Tom 7-25 2040 高价值 #3 + flyp 7-25 1036 §三 周六精读论文 B 35KB 主稿 + paper_cards/585 已立 · Xiao Yu Columbia + Baolin Peng MSR + Ruize Xu Dartmouth 等)= 首个支持 harness-based Agent 端到端训练的开源框架(proxy 拦截 harness 模型调用 + Kubernetes orchestrator per-rollout 容器隔离 + wall-clock timeout 替代 turn limit + 6 harness × 6 基准实证:OpenForge-Claw ClawEval pass³ 31.7 / QwenClawBench 33.7 / MCPAtlas 28.1;OpenForge-GUI OSWorld-Verified 37.7 / Online-Mind2Web 63.0 / WebVoyager 72.3)= §2.5 运行时与基础设施 候选第 84 节点(harness-native agent 训练基础设施) + 与 §1.33c Harness-as-Agent 第十件 = train-deploy mismatch 从「重写 harness」到「插一个 proxy」 范式转折 + 与 ABot-World-0(单 GPU 无限交互推理基础设施)互补为「训练 + 推理基础设施」双层栈 + flyP 直接闭环(OpenClaw 是显式目标 harness · OpenForgeRL 给 flyP 跨季度主题旗舰论文)。
    2. arXiv:2607.12406 Isolation as a First-Class Principle for LLM-Agent System Safety(flyp 7-25 1036 §二 周六精读论文 A 35KB 主稿 + Huihao Jing + Wenbin Hu + Shaojin Chen 等 14 人 · HKUST/NYU/SWUPL/MODEIO · 2026-07-14 v1 · 未建卡)= 首个把 agent 安全按结构而非按攻击类型组织的 survey = 5 边界(user-agent / agent-tool / agent-execution / agent-agent / system-environment)识别边界失效如何首次发生 / 跨边界传播 + isolation-by-construction 4 原则(trust separation / scoped capabilities / traceability / recovery)+ ~150 篇文献覆盖 2022-2026 谱系 = §2.5 安全契约 候选第 11 阶(agent 安全 survey anchor 边界中心组织) + 「所有不同失败都收敛到同一只鹿」 元层整理立标 + 与 Self-State Attacks(arXiv:2607.17986 攻击面分析)+ Tool-Call Boundary Drift(arXiv:2607.07050 工具调用边界校准)+ MCP CVE 集群 三栖整合 + flyP 安全主题页尚为空, 急需 anchor
    3. arXiv:2607.21461 AREX: Recursive Self-Improving Agent for Deep Research(HF Daily 7-25 #1 117▲ 当日 #1 · BAAI · 未建卡 · stephen 7-25 1245 + 2245 + spark 7-25 agent-e1prep §增量 7 旁证)= 递归自我改进 deep research agent + bi-level 架构利用 discovery/verification 不对称 = §2.5 运行时 候选第 85 节点(agent 自我改进范式从静态 prompt → 动态权重 第 2 例) + 与 Lilian Weng「自我改进 Harness 工程」+ SkillOpt(MSR)+ Self-Harness + pi-mono 43.9k⭐ 互补为「agent 自我改进谱系」 + HF Daily 当日 #1 = 工业代表性极高
    4. Microsoft MAF Agent Harness · BUILD 2026 生产级 SDK + Enterprise LLM Agent 三层架构(Plan/Architect/Zulu)+ Google ADK Go 2.0 DAG 编排 + 文心快码 / Microsoft MAF / AWS Blocks 三家框架横向对比 + Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效(jay 7-25 1055 engineering-filter + jay 7-25 1105 db-backend-cloudnative-inference-briefing + jay 7-25 1105 substack + jay 7-25 1123 engineering-e1prep + spark 7-25 agent-e1prep §增量 5 P0)= Microsoft MAF Harness = 商业 Harness 立标首位(shell/filesystem 访问 + human-in-the-loop 审批流 + 长时会话上下文管理 + MCP 一体化 + .NET/Python 双语言)= 「商业 Harness vs 学术 Harness」 立标新维度(MAF Harness 是「真实 Harness」(shell/fs 访问 + 审批流 + MCP 一体化)vs HF Harness H=(E,T,C,S,L,V) 学术 Harness = 「可执行 Harness vs 理论 Harness」 二分立标)+ Enterprise LLM Agent 三层架构 = 企业级 Multi-Agent 生产案例 第 1 例 + Klarna 2/3 / $60M / 853 FTE 等效 = 量化数字立标 + Compounding Error 0.85^10≈0.197(Gartner 2027 40% 废弃预测)= Multi-Agent 可靠性量化公式
    5. Anthropic Claude Opus 5 7-24 evening 正式发布 + 系统卡 + Boris Cherny 评论 + Project Pilot(AI 操控无人机)+ Anthropic Economic Index 连接器 + Economic Futures Research Fund 研究议程(stephen 7-25 1003-news-anthropic-news 5 条 + stephen 7-25 1005-news-yt-anthropic + jay 7-25 1000-rss-simon-willison + stephen 7-25 1245 + 2245 + spark 7-25 agent-e1prep §增量 4 P0)= frontier lab「模型公司」本体节奏 7-24 evening 立标首位 + Boris Cherny「Opus 5 是我们迄今为止最不容易被 prompt injection 的模型」(System Card 第 73 页埋没) + 「system card 中有些被埋没, 但在 PI evals 与红队测试中, Opus 5 很难被成功 prompt inject」 = 「评测 → 系统卡 → 评论 → 红队」 4 栖验证链条 第 1 例 + Project Pilot(AI 操控无人机) = Anthropic 模型本体物理 agent 实证延续(继 Project Glasswing「保护全球软件安全」+ Fable 5 视频 + 「Claude 思维不同层次」 + 「将 Claude 思维转化为语言」 + 「AI 表现情感时」 5 件 YouTube)+ Anthropic Economic Index 连接器 + Economic Futures Research Fund 研究议程 = 「经济测度 → Lobby → 经济学测度范式转折」 第 3 / 4 件续立(承接 v25 + v26 + v29 §1 「Lobby → 经济学测度范式转折」)+ Anthropic 资本 + 研究 + 模型 + 物理 agent 四线齐扩
  • 7-25 沿用 + 旁证 5 件(Wave4 E1 第七轮已固化但 7-25 产生新证据或新立):
    1. arXiv:2607.20709 NVIDIA-labs OO Agents: 原生 Python 面向对象 Agents(HF Daily 7-25 #11 19▲ · 未建卡 · Tom 7-25 0840 一般候选 #5 · stephen 7-25 ai-industry §1.5 + llm-application-e1prep 增量 3)= 「Agent 编程范式从函数式到 OO」 立标候选 = §2.6 多模态 / IDE / CLI / 工具退化 段末邻接(Agent 编程范式新维度)
    2. arXiv:2607.20911 Tencent WorkBuddy Bench: 抗污染任务构建的多领域 Coding-Agent 基准(HF Daily 7-25 #12 18▲ · 未建卡 · Tom 7-25 0840 一般候选 · stephen 7-25 ai-industry §1.5 + llm-application-e1prep 增量 3)= 「腾讯 + Coding-Agent 基准 + 抗污染」 立标候选 = §2.6 多模态 / IDE / CLI / 工具退化 段末追加(Coding-Agent 抗污染基准立标) + 「中国厂商 Coding-Agent 抗污染基准」 立标
    3. MSR 7-25 双连发 SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt(jay 7-25 1002-rss-msr-blog 5 条 + stephen 7-25 ai-industry §1.5 + spark 7-25 agent-e1prep §增量 6 P1 旁证)= SkillOpt = Skill 作为可训练参数 + Agent 自我改进范式从静态 prompt → Skill 训练参数(沿用 v25 + v26 + v29 §1 「Skill 自我改进」)+ Memora = 谐波记忆表示(抽象性 vs 具体性 平衡) = §2.4 记忆 / 长视野 邻接补全 第 9-10 件
    4. arXiv:2607.21503 Agentic Context Management paper_card 564 已立 + arXiv:2607.21051 Sample-Efficient paper_card 567 已立 + arXiv:2607.21557 OpenForgeRL paper_card 585 已立(Tom 7-25 1440 v2 重写版承接 + Tom 7-25 2040 高价值 + Tom 7-25 0840 ⭐ #1 #2 + flyp 7-25 1036 §四 周六精读论文 C 旁证)= Wave4 E1 第七轮已固化立标, 7-25 paper_card 同步 + Tom 7-25 三场雷达 + flyp 周六精读 三栖巩固
    5. arXiv:2607.20734 LLMs Get Lost in Evolving User Intent HF Daily 7-25 #15 15▲(7-24 #11 24▲ → 7-25 #15 15▲ = -9 票下降但仍在主榜)= v34 §2.6 段末追加立标 沿用升级
  • 本日谨慎提醒:
    1. AutoIndex arXiv:2607.18603 7-25 仍未建卡(Stephen 7-25 1245 §3.2 已标记 🔴 AutoIndex 6 日未建卡 = pipeline 漏斗节点;Wave4 E1 第七轮 §2.3 第 56 节点 AutoIndex 已固化但 paper_card 缺);v34 第八轮待补建卡或决断复用
    2. arXiv:2607.12406 Isolation-as-First-Class 主分类(agent vs risk 双向同步)待决断:flyp 7-25 1036 §二 A-1 已标「flyP 安全主题页尚为空, 急需 anchor」, risk.md 主题组已在 r28 第七轮固化 §2.18 元层反身性 #19「多租户 LLM Serving 内部攻击面」+ Anthropic Petri 14 模型 baseline 复现的工程化路径;双向同步更准确 —— flyp risk-e1prep §1 已建议 §2.18 邻接补全 + 编码 agent 主题页 §2.5 第 11 阶立标
    3. arXiv:2607.21557 OpenForgeRL 与 ABot-World-0(arXiv:2607.19191 7-24 #1 200 票)「训练 + 推理基础设施」双层栈合流:Tom 7-25 1440 v2 重写版 高价值 #1 ABot-World-0(单 GPU 无限交互推理基础设施)+ 高价值 #2 OpenForgeRL(harness-native 训练基础设施)= 「训练 + 推理基础设施」双层栈立标;v34 §1.33c + §2.5 决策 = 升 ABot-World-0 第 86 节点 + OpenForgeRL 第 84 节点 双立标
    4. Microsoft MAF Harness vs HF Harness H=(E,T,C,S,L,V) 学术 Harness 边界 —— 「商业 Harness vs 学术 Harness」 立标新维度:MAF Harness 是「真实 Harness」(shell/fs 访问 + 审批流 + MCP 一体化), vs HF Harness H=(E,T,C,S,L,V) 学术 Harness = 「可执行 Harness vs 理论 Harness」 二分立标;v34 §1.33c 横切 53c 量化补全候选
    5. Anthropic Claude Opus 5 vs Claude Fable 5 关系待核(stephen 7-25 ai-industry §2.2):Opus 5 是否替代 Fable 5 还是平行产品未明;v34 §1.41 横切 60-66 v23 七件主轴 决策 = 升 Opus 5 首位立标 + Opus 5 vs Fable 5 关系 待 Anthropic 官网模型矩阵核证
    6. Anthropic Boris Cherny 「Opus 5 最不容易被 prompt injection」 vs Opus 5 PI evals / red team 完整版本 待核:jay 7-25 1000-rss-simon-willison 引语 + stephen 7-25 ai-industry §2.2 已标矛盾;v34 §4.1 开放问题 198 候选新增
    7. Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效(SocialCrawl.ai 第三方汇总) vs 一手 Klarna 财报数据(jay 7-25 1055 engineering-filter #2 + jay 7-25 1105 substack)= v34 §4.1 开放问题 199 候选新增
    8. Compounding Error 0.85^10≈0.197 假设每步独立同分布误差 —— 实际生产中步骤间误差并非完全独立(LangGraph 等框架有状态回传):该数字是上限估算而非精确值,但量级判断有效;v34 §3.2 争议 候选新增「0.85^10=20% 假设独立同分布 vs LangGraph 状态回传」
    9. Tencent WorkBuddy Bench 抗污染任务构建方法学 + vs SWE-bench Pro 对比 待核(stephen 7-25 ai-industry §1.5):arxiv 编号未确认 + 抗污染方法学未披露 + GitHub 开源状态未核;v34 §6 必读清单候选新增 arXiv:2607.20911 第 115 条, 主分类 agent benchmark 待决断
    10. NVIDIA OO Agents vs v34 §2.5 LangGraph + LangChain 对比 待补(stephen 7-25 ai-industry §1.5):arxiv 编号 2607.20709 + 主分类 agent method 待决断 + OO 范式对比未明;v34 §2.6 段末追加候选

1. 增量条目(4 件 P0 主线 + 3 件 P0 三联立标 + 3 件 P1 旁证,按"建议归入节"分组)

增量 1 · ⭐⭐⭐⭐⭐ · arXiv:2607.21557 OpenForgeRL: Train Harness-native Agents in Any Environment(Tom 7-25 0840 ⭐ #2 + Tom 7-25 1440 v2 高价值 #2 + Tom 7-25 2040 高价值 #3 + flyp 7-25 1036 §三 精读论文 B 35KB 主稿 · paper_cards/585 已立)

字段 内容
来源 inbox/tom/2026-07-25T0840-agent-rag-longcontext-radar.md ⭐ #2 + inbox/tom/2026-07-25T1440-agent-rag-longcontext-radar.md v2 重写版高价值 #2 + inbox/tom/2026-07-25T2040-agent-rag-longcontext-radar.md 高价值 #3 + inbox/flyp/2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md §三 精读论文 B 35KB 主稿(整体可信度 4.3/5)+ inbox/jay/2026-07-25-1140-news-x-tech-radar.md #2 + inbox/spark/2026-07-25-agent-e1prep.md §增量 2 P0 + inbox/flyp/2026-07-25-risk-e1prep.md §1 + inbox/stephen/2026-07-25-1245-stephen-coordination-check-noon.md §2 + paper_cards/585 已立
arXiv 号 arXiv:2607.21557v1 OpenForgeRL: Train Harness-native Agents in Any Environment(Xiao Yu Columbia + Baolin Peng MSR + Ruize Xu Dartmouth + Hao Zou + Qianhui Wu + Hao Cheng + Wenlin Yao + Nikhil Singh + Zhou Yu + Jianfeng Gao · 2026-07-23 v1)
一句话 现代 AI Agent 依赖复杂 inference harness(Claude Code、Codex、OpenClaw 等)来驱动多轮推理、工具使用及访问外部系统;这些 harness 把推理变为有状态、多进程的过程(嵌套工具调用、子 agent、长上下文),开源 SFT/RL 栈(veRL、Slime 等)无法原生表达,导致 train-deploy mismatch;OpenForgeRL 用一个轻量 proxy拦截 harness 的模型调用并记录为标准 RL 训练数据;用 Kubernetes orchestrator 把每个 rollout 跑在独立远程容器里 —— 实现任意 harness × 任意环境的端到端训练方法学意义:把"训练-部署 mismatch"问题从"重写 harness"变成"插一个 proxy" —— 几乎零代码改动即可训练 harness-native agent**。
v34 脉络关系 与 v34 §1.33c 横切 53c AI Agents Stack 2026 Evaluation 层 + v34 §1.43 横切 80 Why Agents Fail 7 件套 + v34 §2.1 Harness 学术化 9 阶段 + v34 §2.4 记忆 / 长视野 + v34 §2.5 安全契约 + v34 §1.41 横切 60-66 v23 七件主轴 + v34 §2.5 运行时 83 节点 HACO + SkewAdam + FlashRT 同源;v34 第八轮 §2.5 待立第 84 节点(harness-native agent 训练基础设施):1) 「proxy 拦截 + Kubernetes orchestrator + wall-clock timeout 替代 turn limit」 = 把 train-deploy mismatch 问题从「重写 harness」变成「插一个 proxy」= 几乎零代码改动即可训练 harness-native agent;2) 「6 harness × 6 基准」+ OpenForge-Claw(30B-A3B MoE)ClawEval pass³ 31.7 / pass@3 55.9、QwenClawBench 33.7、MCPAtlas 28.1 + OpenForge-GUI(8B)OSWorld-Verified 37.7 / Online-Mind2Web 63.0 / WebVoyager 72.3 = 跨 harness × 跨环境 训练-部署对齐实证 + GUI 上比肩数倍大模型;3) 「某些 harness 比其他 harness 更难学」(Codex 比 OpenClaw 难收敛)= harness design 直接影响 RL 训练效率 = 与 v34 §1.33c Harness Engineering 学科化 + v34 §1.43 横切 80 Lilian Weng Harness 「propose-evaluate-accept」闭环 + flyp 7-18 Harness Evolution 反方审稿 互补 = harness 与训练策略需要 co-design, 单点优化无效;4) 「wall-clock timeout 替代 turn limit」 = 与 v34 §1.43 横切 80 「Offline Evals Miss Production Failures」 + 自我博弈 + 长时 reward design 同源 = 训练目标 vs 评测目标对齐;5) 「OpenClaw 直接闭环」 = flyP 7-25 1036 §三 已标「与 flyP 长期关注 OpenClaw 直接闭环」= 训练栈与执行栈首次绑定;6) 「数据合成 pipeline」(LLM 生成 → 过滤 → 构造环境 → rollout 验证 → 缺陷修复) = 与 v34 §2.5 83 节点 HACO + v34 §1.43 横切 80 Why Agents Fail 「Self-Generated Experience」 + Lilian Weng 7-25 「自我改进 Harness 工程」 同源 = Agent 训练数据建设的元方法学第 1 例;7) 「与 Polar(Xu et al. 2026)对比不足」 = Concurrent work 实证对比未给 = agent 训练基础设施路线分裂(M3 证伪线);8) 「训练 + 推理基础设施」双层栈合流 = 与 ABot-World-0(arXiv:2607.19191 7-24 #1 200 票)「单 GPU 无限交互推理」互补为 「训练 + 推理基础设施」 双层栈立标
反方 / 风险 (A) paper_cards/585 已立但主分类 agent vs systems vs training 双向同步待决断;(B) 「任意 harness × 任意环境」 与实测「6 harness × 6 基准」覆盖差距大(M1 证伪线);(C) proxy 拦截 latency / token 漂移 / stream 行为差异 未量化(M2 证伪线);(D) 云端 rollout 可复现性 + 跨云(AWS/GCP vs Azure)wall-clock 抖动 未量化(M3 证伪线);(E) 「harness-native 训练」归因混淆: proxy / 数据合成 / MoE 30B-A3B 表达能力 三者未消融(M4 证伪线);(F) 「error recovery 弱」归因深度不足(M5 证伪线);(G) 「与 Polar(Xu et al. 2026)对比不足」 = concurrent work 实证对比未给 = M6 证伪线
建议归入节 §2.5 运行时与基础设施 83 → 84 节点(OpenForgeRL 第八十四 · harness-native agent 训练基础设施 · proxy + Kubernetes orchestrator · 6×6 实证) + §1.33c 横切 53c AI Agents Stack 2026 6 层 邻接(Evaluation 层 + Harness 训练闭环 立标) + §1.43 横切 80 Why Agents Fail 7 件套 邻证(训练-部署对齐 + 数据合成 pipeline 立标) + §3.1 共识(候选新增 「train-deploy mismatch = proxy 拦截范式转折」) + §4.1 开放问题(候选新增 「proxy 拦截 latency / token 漂移 实测 + vs Polar head-to-head」) + §6 必读清单 新增 arXiv:2607.21557 第 115 条
重要边界 不要与 v34 §2.5 83 节点 HACO / SkewAdam / FlashRT 混为同一件工作:这些是推理优化(负载均衡 / 训练优化 / 部署优化), OpenForgeRL 是训练栈(把训练栈与推理栈对齐);不要与 v34 §1.43 横切 80 Codified Context 108K C# 混为同一件工作:后者是 Agent 上下文工程化案例(企业级), OpenForgeRL 是训练基础设施(研究级);不要与 v34 §1.33c 横切 53c AI Agents Stack 2026 6 层 Microsoft Foundry/Copilot 80K/20M 五层 Harness 混为同一件工作:后者是产品级 Harness, OpenForgeRL 是开源训练框架;不要与 v34 §2.5 84 节点 IteraSim RAG / RF-Agent / AILQA 混为同一件工作:这些是垂直域 Multi-Agent(科学计算配置 / 芯片设计), OpenForgeRL 是通用 harness-native 训练框架;不要与 v34 §2.6 14 件 CLI/IDE 工具退化 混为同一件工作:这些是工具调用层, OpenForgeRL 是训练基础设施层 = 不同层级;不要与 ABot-World-0(arXiv:2607.19191)混为同一件工作:ABot-World-0 是单 GPU 无限交互推理基础设施, OpenForgeRL 是 harness-native 训练基础设施 = 推理 vs 训练 不同层级(双层栈合流, 但各立一件)

增量 2 · ⭐⭐⭐⭐⭐ · arXiv:2607.12406 Isolation as a First-Class Principle for LLM-Agent System Safety(flyp 7-25 1036 §二 周六精读论文 A 35KB 主稿 · paper_card 未建)

字段 内容
来源 inbox/flyp/2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md §二 精读论文 A(35KB 主稿 · 整体可信度 4.3/5)+ inbox/flyp/2026-07-25-risk-e1prep.md §1「Isolation as a First-Class Principle R28 §2.18 元层反身性」+ inbox/spark/2026-07-25-agent-e1prep.md §增量 3 P0
arXiv 号 arXiv:2607.12406v1 Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions(Huihao Jing + Wenbin Hu + Shaojin Chen + Haochen Shi + Sirui Zhang + Hanyu Yang + Changxuan Fan + Zhongwei Xie + Hongyu Luo + Wun Yu Chan + Wei Fan + Haoran Li + Yangqiu Song · HKUST/NYU/SWUPL/MODEIO · 2026-07-14 v1)
一句话 LLM agent 已从研究原型进入真实系统(Codex、Claude Code、OpenClaw 等);安全不再是输入-输出内容对齐,而是系统行为与现实执行结果;现有文献按攻击类型、应用、基准组织,难以解释 prompt injection、tool misuse、memory poisoning 为什么结构性同源。本文把 isolation 提升为一阶原则:以 user-agent、agent-tool、agent-execution、agent-agent、system-environment 五类边界组织文献,识别边界失效如何首次发生、如何跨边界传播,并给出 isolation-by-construction 研究议程(trust separation / scoped capabilities / traceability / recovery 4 原则) = 「所有不同失败都收敛到同一只鹿」 元层整理立标 + agent 安全按结构而非按攻击类型组织 第 1 例 survey anchor
v34 脉络关系 与 v34 §2.5 安全契约 第 9 阶(Self-State Attacks arXiv:2607.17986 攻击面分析)+ v34 §2.5 第 10 阶(SeerGuard arXiv:2607.15550 GUI Agent 安全)+ v34 §2.6 35 子节 Tool-Call Boundary Drift(arXiv:2607.07050 工具调用边界校准)+ v34 §2.6 33 子节 Self-State Attacks(arXiv:2607.17986 OS 层攻击面)+ v34 §1.45 MCP CVE 集群(Salesforce + AWS + Anthropic SDK)+ v34 §1.45 五向合流 + v34 §2.6 40 子节 MCP CVE 集群邻接 + v34 §1.34b Anthropic Global Workspace + v34 §1.32b 横切 52b Manager Coercion(arXiv:2607.15434 AI-to-AI 治理)同源;v34 §2.5 待立第 11 阶候选(agent 安全 survey anchor 边界中心组织):1) 「5 边界」 = 把「看起来不同的失败」(prompt injection / tool poisoning / agent hijacking / memory poisoning) 收敛到「边界隔离首次在哪里失败」 = flyP 7-25 1036 §二 A-1 「所有不同失败都收敛到同一只鹿」 元层整理立标;2) 「跨边界失效传播」(primary safety boundary vs threat origin boundary 二分)= 把「防御点在哪一层」和「失效源在哪一层」区分开 = v34 §2.5 第 9 阶 Self-State Attacks + v34 §2.6 40 子节 MCP CVE 集群 元层整理立标;3) 「isolation-by-construction 4 原则」(trust separation / scoped capabilities / traceability / recovery) = 与 CaMeL(Debenedetti 2025)+ AgentVisor(Ying 2026)+ Parallax(Fokou 2026)+ Managed Agents(Anthropic 2026) 对齐 = design-level defense 系统化立标;4) 「~150 篇文献覆盖 2022-2026 谱系」 = survey 体量立标;5) 「flyP 安全主题页尚为空, 急需 anchor」 = flyp 跨季度主题绑定立标;6) 与 v34 §1.45 五向合流 + §2.6 40 子节 MCP CVE 集群 互补为「Agent 安全 = 攻击面分析 + 边界隔离 + CVE 集群 + harness 安全 + 自我状态 + MCP 三栖 6 维合并成熟」
反方 / 风险 (A) 「边界」作为一阶原语 但缺少定量 metric(L1 证伪线 ⭐⭐⭐⭐⭐ · isolation strength 信息泄露率 / 控制权渗透深度 / 跨边界失效传播步数 三指标未给);(B) 5 边界之间相互作用被简化(L2 复合攻击未单独成节 ⭐⭐⭐⭐);(C) 「isolation-by-construction」与现有防御体系可结合性未充分评估(L3 adoption cost ⭐⭐⭐⭐);(D) 缺少跨语言/跨模态攻击统一视角(L4 multimodal agent isolation ⭐⭐⭐⭐ · VLA / GUI agent / Computer Use 隐写指令 / 屏幕内容 prompt injection);(E) 「首次失效边界」归因存在循环性(L5 trace-level 追溯粒度 ⭐⭐⭐⭐);(F) paper_card 未建 = pipeline 漏斗节点
建议归入节 §2.5 安全契约 候选第 11 阶(Isolation as a First-Class Principle 第十一 · agent 安全 survey anchor 边界中心组织 · 5 边界 + isolation-by-construction 4 原则 + ~150 篇文献) + §1.45 AI 安全 + 政府监管五向合流 旁证(边界隔离 vs 攻击面分析 vs CVE 集群 6 维合并) + §1.32b 横切 52b 旁证(Multi-Agent 治理 边界失效传播 元层整理) + §3.1 共识(候选新增 「Agent 安全按结构而非按攻击类型组织 边界中心 第 1 survey」) + §4.1 开放问题(候选新增 「isolation strength metric + 跨模态 agent isolation」) + §6 必读清单 新增 arXiv:2607.12406 第 116 条
重要边界 不要与 v34 §2.5 第 9 阶 Self-State Attacks(arXiv:2607.17986) 混为同一件工作:后者是攻击面分析(OS 层结构性极限), Isolation-as-First-Class 是防御体系元层(survey anchor) = 攻 vs 防 不同层;不要与 v34 §2.5 第 10 阶 SeerGuard(arXiv:2607.15550) 混为同一件工作:SeerGuard 是 GUI Agent 事前安全预演(World-Model-Based), Isolation-as-First-Class 是 survey 边界中心组织 = 单点防御 vs 元层整理 不同层;不要与 v34 §2.6 35 子节 Tool-Call Boundary Drift(arXiv:2607.07050) 混为同一件工作:后者是单一工具调用边界校准, Isolation-as-First-Class 是 5 边界 survey = 单一边界 vs 5 边界 不同范围;不要与 v34 §2.6 33 子节 Self-State Attacks 混为同一件工作:同上, 攻击面 vs survey anchor 不同层;不要与 v34 §2.6 40 子节 MCP CVE 集群混为同一件工作:后者是 3 件具体 CVE, Isolation-as-First-Class 是 5 边界分类法(survey 级) = 具体 CVE vs 元层分类 不同层;不要与 v34 §1.32b 横切 52b Manager Coercion(arXiv:2607.15434 AI-to-AI 治理) 混为同一件工作:Manager Coercion 是 AI-to-AI 治理, Isolation-as-First-Class 是 system-environment 5 边界 = 治理 vs 隔离 不同对象;不要与 v34 §1.45 Gemini 3.5 Flash Cyber 混为同一件工作:Gemini Cyber 是 vertical LLM 网络安全, Isolation-as-First-Class 是 survey anchor 边界中心 = vertical LLM vs 通用 Agent 不同应用

增量 3 · ⭐⭐⭐⭐ · arXiv:2607.21461 AREX: 面向深度研究的递归自我改进 Agent(HF Daily 7-25 #1 117▲ 当日 #1 · BAAI · 未建卡)

字段 内容
来源 inbox/tom/2026-07-25-0900-hf-daily-2026-07-25.md #1 117▲ + inbox/stephen/2026-07-25-1245-stephen-coordination-check-noon.md §2 P0 #3 + inbox/stephen/2026-07-25-2245-stephen-coordination-check-evening.md §1 P0 #3 + inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.3 + inbox/spark/2026-07-25-agent-e1prep.md §增量 7 P1 旁证 + paper_card 未建
arXiv 号 arXiv:2607.21461 AREX: 面向深度研究的递归自我改进 Agent(BAAI · 2026-07-23 · HF Daily 7-25 #1 117▲)
一句话 递归自我改进 deep research agent + BAAI + bi-level 架构利用 discovery/verification 不对称 = 「agent 自我改进 + 深度研究」 双栖立标候选 + HF Daily 当日 #1 最高票
v34 脉络关系 与 v34 §2.5 运行时 + v34 §1.33c 横切 53c + v34 §1.34b Anthropic Global Workspace + v34 §2.1 Harness 学术化 + v34 §2.98 PRO-LONG + v34 §3.1 共识 25 同源;v34 §2.5 待立第 85 节点候选(agent 自我改进范式从静态 prompt → 动态权重 第 2 例):1) 「递归自我改进」 = agent 自我改进范式从「静态 prompt」 → 「动态权重」 第 2 例(继 pi-mono 43.9k⭐ 之后);2) 「BAAI」 = 中国 AI 研究机构首次立标(arXiv:2607.21461 BAAI + arXiv:2607.20145 SLAI T-Rex Ascend SuperPOD = 中国算力主权 × 开源模型主权 合流立标 第 2 例);3) 「bi-level 架构利用 discovery/verification 不对称」 = 与 v34 §1.43 横切 80 Lilian Weng「Harness Engineering for Self-Improvement 2026-07-04」 + SkillOpt(MSR 7-25)+ Self-Harness + AREX 互补为「agent 自我改进谱系」;4) 「HF Daily 当日 #1」 = 工业代表性极高(vs 7-24 ABot-World-0 200 票 + 7-25 AREX 117▲ = 编码 agent / agent 自我改进 双高票代表)
反方 / 风险 (A) paper_card 未建 = pipeline 漏斗节点;(B) 「BAAI 机构全称」 = 北京智源人工智能研究院 vs 北京智源研究院 名称差异待核;(C) 「bi-level 架构」 学术分量待核(可能是综述而非新方法);(D) 「递归自我改进」 在深度研究场景的稳定性 vs 在 SWE-bench Verified / HumanEval 长 horizon 版迁移 待核;(E) vs v34 §1.43 横切 80 Lilian Weng「Harness Engineering for Self-Improvement」 的边界待核;(F) 论文细节 PDF 未抓,待补查
建议归入节 §2.5 运行时与基础设施 83 → 85 节点(AREX 第八十五 · 递归自我改进 deep research agent · BAAI · HF Daily 当日 #1 117▲) + §1.45 五向合流 旁证(中国 AI 自我改进立标 第 2 例 · BAAI + SLAI T-Rex) + §1.33c 横切 53c 邻接补全(评论层立标 · 评测 → 系统卡 → 评论 → 红队 4 栖验证第 2 例) + §3.1 共识(候选新增 「agent 自我改进 = bi-level discovery/verification 不对称」) + §6 必读清单 新增 arXiv:2607.21461 第 117 条
重要边界 不要与 v34 §1.43 横切 80 Lilian Weng「Harness Engineering for Self-Improvement 2026-07-04」 混为同一件工作:Lilian Weng 是 harness 工程 + recursive self-improvement 综述, AREX 是 BAAI bi-level 架构 deep research agent = harness 综述 vs agent 实证 互补;不要与 v34 §2.5 83 节点 Self-Harness 占位 混为同一件工作:Self-Harness 是上海 AI Lab arXiv 占位, AREX 是 BAAI HF Daily #1 = 不同机构不同形态;不要与 v34 §1.34b Anthropic Global Workspace(arXiv:2607.15495) 混为同一件工作:J-space 是认知科学锚点, AREX 是深度研究 agent 实证 = 认知科学 vs deep research 不同对象;不要与 v34 §1.41 横切 60-66 pi-mono 43.9k⭐ 混为同一件工作:pi-mono 是 monorepo 静态 self-improving, AREX 是 bi-level 递归 deep research = monorepo vs deep research 不同形态

增量 4 · ⭐⭐⭐⭐ · Anthropic Claude Opus 5 7-24 evening 正式发布 + 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund = frontier lab 模型本体立标首位 + 评测 → 系统卡 → 评论 → 红队 4 栖验证 第 1 例

字段 内容
来源 inbox/stephen/2026-07-25-1003-news-anthropic-news.md(5 条 rss.google.com 引用 anthropic.com 一手:Claude Opus 5 系统卡 + 推出 Claude Opus 5 + Project Pilot + Anthropic Economic Index 连接器 + Economic Futures Research Fund 研究议程)+ inbox/stephen/2026-07-25-1005-news-yt-anthropic.md(5 条 YouTube 含「介绍 Claude Fable 5」+「Project Glasswing」)+ inbox/stephen/2026-07-25-0910-news-x-vip-radar.md(Andrew Ng OpenWorker 等 12 条 X 雷达)+ inbox/jay/2026-07-25-1000-rss-simon-willison.md(3 条含 Boris Cherny 引语「Opus 5 is our least prompt injectable model yet」+「正式发布 Claude Opus 5」)+ inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.1 + inbox/spark/2026-07-25-agent-e1prep.md §增量 4 P0
arXiv 号 无(Anthropic 系统卡非 arXiv)
一句话 Claude Opus 5 系统卡立标 + Boris Cherny 「Opus 5 是我们迄今为止最不容易被 prompt injection 的模型」 + 「system card 中有些被埋没了, 但在 PI evals 与红队测试中, Opus 5 很难被成功 prompt inject」(System Card 第 73 页)+ Project Pilot(AI 操控无人机)+ Anthropic Economic Index 连接器 + Economic Futures Research Fund 研究议程 = frontier lab「模型公司」本体节奏 7-24 evening 立标首位 + 评测 → 系统卡 → 评论 → 红队 4 栖验证链条 第 1 例 + 资本 + 研究 + 模型 + 物理 agent 四线齐扩
v34 脉络关系 与 v34 §1 frontier lab 全栈 + v34 §1.41 横切 60-66 v23 七件主轴(Claude Fable 5 7-22 立标 + Kimi K3 + Qwen 3.8 + Gemini 3.6 Flash 7-16 ~ 7-22 立标密度 4 个 frontier model)+ v34 §1.45 五向合流 + v34 §2.1 综述与方法学骨架(Anthropic Global Workspace)+ v34 §1.34b Anthropic Global Workspace 认知科学锚点 + v34 §1.45 Gemini 3.5 Flash Cyber + v34 §1.34b AI Workflow Store + Context Engineering + v34 §2.6 SeerGuard(arXiv:2607.15550 GUI Agent 安全)同源;v34 §1 待立新横切(frontier lab 模型本体 + 物理 agent + 资本 + 研究 四栖立标):1) Claude Opus 5 = frontier lab「模型公司」本体节奏首位 7-24 evening 立标(继 Gemini 3.6 Flash + Kimi K3 + Qwen 3.8 + Claude Fable 5 7-16 ~ 7-22 立标密度之后 第 5 个 frontier model 立标 = 7 天内 frontier model 立标密度最高一周);2) Boris Cherny 「prompt injection 最难」 评论 + system card 第 73 页埋没 + 红队验证 = 「评测 → 系统卡 → 评论 → 红队」 4 栖验证链条 第 1 例 = v34 §2.6 评测、可靠性与对抗 新维度(评测 = benchmark 数字 → system card 详细披露 → 评论层定性描述 → 红队验证) = 与 v34 §2.5 第 11 阶 Isolation-as-First-Class(arXiv:2607.12406) 5 边界 survey 互补为「评测 + 边界中心」 双维;3) Project Pilot(AI 操控无人机)= Anthropic 模型本体物理 agent 实证延续(继 Project Glasswing「保护全球软件安全」 + Fable 5 视频 + 「Claude 思维不同层次」 + 「将 Claude 思维转化为语言」 + 「AI 表现情感时」 5 件 YouTube)+ Anthropic Economic Index 连接器 + Economic Futures Research Fund 研究议程 = 「经济测度 → Lobby → 经济学测度范式转折」 第 3 / 4 件续立(承接 v25 + v26 + v29 §1 「Lobby → 经济学测度范式转折」)+ Anthropic 资本 + 研究 + 模型 + 物理 agent 四线齐扩 = frontier lab「模型公司 + 研究机构 + 资本平台 + 物理 agent 平台」 4 栖立标;5) Anthropic 7-14 X 引语:Claude 表达 3000+ 价值观, 跨模型/语言聚类后识别 4 条主轴(Deference / Warmth 等) + 加拿大 Claude 人均使用量为全球平均 4.4 倍 + 1000 万 CAD 资助加拿大 AI 研究
反方 / 风险 (A) Opus 5 上下文窗口 / 训练规模 / 训练 token 量 / 价格 / 与 Fable 5 关系(替代 or 平行)/ vs GPT-5.6 Sol head-to-head / 显存要求 / 推理芯片支持 / 与 Project Pilot 整合路径 / Economic Index 数据是否对外开放 / Economic Futures Research Fund 资助额度 全部待核;(B) Boris Cherny 「prompt injection 最难」 vs Opus 5 PI evals / red team 完整版本 待核;(C) Claude Opus 5 系统卡关键数字(SWE-bench Pro 79.2% / ARC-AGI-3 30.16% 「声称最对齐」 待核)
建议归入节 §1 frontier lab 全栈 + §1.41 横切 60-66 v23 七件主轴(Claude Opus 5 立标首位 7-24 evening)+ §2.6 评测、可靠性与对抗(评测 → 系统卡 → 评论 → 红队 4 栖验证 第 1 例)+ §1.45 五向合流(Anthropic 资本 + 研究 + 模型 + 物理 agent 四线齐扩)+ §3.1 共识(候选新增 「frontier lab 4 栖验证 = 评测/系统卡/评论/红队」)+ §4.1 开放问题(候选新增 「Opus 5 vs Fable 5 关系 + Opus 5 关键数字 + Boris Cherny 评论出处」)+ §6 必读清单 新增 Opus 5 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund 第 118-121 条
重要边界 不要与 v34 §1.41 横切 60-66 v23 七件主轴 已有 Claude Fable 5 混为同一件工作:Fable 5 = 7-22 立标, Opus 5 = 7-24 立标(连续 frontier model 立标密度 = 7-22 ~ 7-24 三天三立标);不要与 v34 §1.34b Anthropic Global Workspace arXiv:2607.15495 混为同一件工作:前者是认知科学锚点论文, Opus 5 是 frontier model + 评论 + 物理 agent = 认知科学 vs 模型本体 不同对象;不要与 v34 §1.45 Gemini 3.5 Flash Cyber 混为同一件工作:Cyber 是 vertical LLM 安全, Opus 5 是本体模型立标 = vertical LLM vs 本体模型 不同对象;不要与 v34 §2.5 第 11 阶 Isolation-as-First-Class(arXiv:2607.12406) 混为同一件工作:后者是 survey anchor 边界中心, Opus 5 是 frontier model = survey vs model 不同对象;不要与 v34 §1.33c 横切 53c AI Agents Stack 2026 6 层 Microsoft Foundry/Copilot 80K/20M 五层 Harness 混为同一件工作:后者是产品级 Harness, Opus 5 是 frontier model = Harness vs model 不同对象

增量 5 · ⭐⭐⭐⭐ · Microsoft MAF Agent Harness · BUILD 2026 生产级 SDK + Enterprise LLM Agent 三层架构(Plan/Architect/Zulu)+ Google ADK Go 2.0 DAG 编排 + Klarna 2/3 / $60M / 853 FTE + Compounding Error 0.85^10≈0.197

字段 内容
来源 inbox/jay/2026-07-25-1055-jay-engineering-filter.md Microsoft MAF Harness + inbox/jay/2026-07-25-csdn-llm-rag-agent-vecdb.md Enterprise LLM Agent 三层架构(CSDN 智能体开发者社区 2026-07-11 · 文心快码 Multi-Agent 矩阵)+ inbox/jay/2026-07-25-csdn-supplement-agentic-rag-mcp-finetune.md Google ADK Go 2.0 DAG 编排(CSDN 2026-07-02 · 1.8k 阅读)+ inbox/jay/2026-07-25-1105-substack-agents-production-failure-a2a-cua.md Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效(SocialCrawl.ai)+ inbox/jay/2026-07-25-1123-engineering-e1prep.md §1.3 + §1.4 + inbox/spark/2026-07-25-agent-e1prep.md §增量 5 P0
arXiv 号 无(均为商业框架 + CSDN 源码 + Substack)
一句话 Microsoft MAF Harness 生产级 SDK(shell/filesystem 访问 + human-in-the-loop 审批流 + 长时会话上下文管理 + MCP 一体化 + .NET/Python 双语言)+ Enterprise LLM Agent 三层架构(Plan Agent 意图分解 + Architect Agent 技术方案设计 + Zulu Agent LangGraph 状态机驱动执行引擎 + 验证循环)+ Google ADK Go 2.0 DAG 编排(2026-07-02 发布 · 1.8k 阅读)+ 文心快码 / Microsoft MAF / AWS Blocks 三家框架横向对比 + Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效(SocialCrawl.ai)+ Agent 生产失败三模式 Dumb RAG + Brittle Connectors + Compounding Error(0.85^10≈0.197)+ Gartner 2027 40% 废弃预测 = 「商业 Harness vs 学术 Harness」 立标新维度 + 企业级 Multi-Agent 生产案例 + 多框架横向对比 + 量化数字立标 四栖立标
v34 脉络关系 与 v34 §1.33c 横切 53c AI Agents Stack 2026 Harness 层 + v34 §1.43 横切 80 Codified Context 108K C# + v34 §2.4 多智能体协作 54 节点 + v34 §2.5 83 节点 HACO + v34 §1.34b LangGraph 业务流程编排 + v34 §1.41 横切 60-66 v23 七件主轴(Codex/ChatGPT Work)+ v34 §2.6 评测、可靠性与对抗 同源;v34 §1.33c 待立补全候选 + v34 §2.4 待立邻接补全候选:1) 「商业 Harness vs 学术 Harness」 立标新维度:MAF Harness 是「真实 Harness」(shell/filesystem 访问 + 审批流 + MCP 一体化), vs HF Harness H=(E,T,C,S,L,V) 学术 Harness = 「可执行 Harness vs 理论 Harness」 二分立标;2) 「三层架构(Plan/Architect/Zulu) + LangGraph + MCP」 = 企业级 Multi-Agent 生产案例 = 与 v34 §2.4 54 节点 IteraSim RAG(科学计算配置)+ 53 节点 RF-Agent(芯片设计) 同源 = 垂直域 Multi-Agent 第 3 件 + 企业级通用域 Multi-Agent 第 1 例;3) 「Google ADK Go 2.0 DAG 编排」(2026-07-02 发布)+ 「文心快码 / Microsoft MAF / AWS Blocks 三家框架横向对比」 = 「多 Agent 编排 + 生产级可靠性 主战场」 立标 = v34 §2.4 多智能体协作 + v34 §1.33c Harness 层 量化补全;4) 「Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效」(SocialCrawl.ai)= 「LangGraph vs CrewAI vs Mastra vs Pydantic AI 生产数据对比」 + 「企业级 Multi-Agent 量化数字立标」 = v34 §1.33c 横切 53c 量化补全(89% observability vs 52% evals 37pt eval gap + Klarna 853 FTE 等效 + $60M 节省);5) 「Agent 生产失败三模式」(jay 7-25 1105 Substack)Dumb RAG + Brittle Connectors + Compounding Error + Gartner 2027 40% 废弃预测 = v34 §1.32b 横切 52b 候选 + v34 §2.6 评测、可靠性与对抗 邻接(Compounding Error 0.85^10 ≈ 0.197 量化公式 立标)
反方 / 风险 (A) Microsoft MAF Harness ./harness 样本 GitHub 仓库实际 API 待核;(B) Klarna 案例第三方汇总数据, 一手 Klarna 财报数据待核;(C) Enterprise LLM Agent 三层架构 CSDN 案例 vs v34 §2.4 现有 54 节点对比表待补;(D) Google ADK Go 2.0 DAG 编排 vs v34 §2.5 83 节点 LangGraph 对比 待补;(E) Gartner 2027 40% 废弃预测 vs Berkeley RDI 2027 末 40% 取消风险预测 交叉核验待 PDF 核(沿用 v34 §2.7 最后一句待核);(F) 文心快码 / Microsoft MAF / AWS Blocks 三家框架 GitHub Star 数 + commits 活跃度 + 是否有生产案例 待核;(G) Compounding Error 0.85^10≈0.197 假设每步独立同分布误差 —— 实际生产中步骤间误差并非完全独立(LangGraph 等框架有状态回传)= 该数字是上限估算而非精确值,但量级判断有效
建议归入节 §1.33c 横切 53c AI Agents Stack 2026 Harness 层 商业开源 SDK 立标(MAF Harness + 文心快码 + Google ADK Go 2.0 三栖 · 商业 Harness vs 学术 Harness 二分立标) + §2.4 多智能体协作 邻接(Enterprise LLM Agent 三层架构 + Klarna 853 FTE 等效 + 文心快码 / Microsoft MAF / AWS Blocks 三家对比 立标) + §2.6 评测、可靠性与对抗 邻接(Agent 生产失败三模式 + Compounding Error 量化公式 + Gartner 2027 40% 废弃预测) + §3.1 共识(候选新增 「商业 Harness vs 学术 Harness 边界 二分立标」 + 「Compounding Error 0.85^10≈0.197 Multi-Agent 可靠性量化公式」) + §3.2 争议(候选新增 「Dumb RAG / Brittle Connectors / Compounding Error 三模式 解释力」 + 「0.85^10=20% 假设独立同分布 vs LangGraph 状态回传」) + §4.1 开放问题(候选新增 「MAF Harness vs HF Harness vs OpenForgeRL 三栈 head-to-head + Gartner 2027 40% vs Berkeley RDI 40% 交叉核 + Klarna 一手财报数据核」) + §6 必读清单 新增 Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + Klarna + Compounding Error 第 122-126 条
重要边界 不要与 v34 §2.4 54 节点 IteraSim RAG / 53 节点 RF-Agent 混为同一件工作:这些是垂直域 Multi-Agent(科学计算配置 / 芯片设计), MAF / 文心快码 / Google ADK 是企业级通用域 Multi-Agent = 垂直域 vs 通用域 不同应用;不要与 v34 §1.33c 横切 53c AI Agents Stack 2026 6 层已有 Microsoft Foundry/Copilot 80K/20M 五层 Harness 混为同一件工作:后者是产品级 Harness, MAF 是开源 SDK Harness = 产品级 vs SDK 不同形态;不要与 v34 §1.43 横切 80 Codified Context 108K C# 混为同一件工作:后者是 Agent 上下文工程化案例(企业级), MAF Harness 是商业开源 SDK Harness = 上下文 vs Harness 不同对象;不要与增量 1 OpenForgeRL(arXiv:2607.21557) 混为同一件工作:OpenForgeRL 是训练基础设施(proxy + Kubernetes), MAF Harness 是商业 SDK Harness(shell/fs + 审批流) = 训练基础设施 vs Harness SDK 不同对象;不要与 v34 §1.34b LangGraph 业务流程编排 混为同一件工作:LangGraph 是框架, MAF Harness 是商业 Harness SDK = 框架 vs SDK 不同形态;不要与 v34 §2.6 14 件 CLI/IDE 工具退化 混为同一件工作:这些是工具调用层, MAF Harness 是 Harness SDK = 工具 vs Harness 不同层

增量 6 · ⭐⭐⭐ · arXiv:2607.20709 NVIDIA-labs OO Agents + arXiv:2607.20911 Tencent WorkBuddy Bench = HF Daily 7-25 头条 立标合流(P1 邻接)

字段 内容
来源 inbox/tom/2026-07-25-0900-hf-daily-2026-07-25.md #11 NVIDIA-labs OO Agents 19▲ + #12 Tencent WorkBuddy 18▲ + inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.5 + inbox/stephen/2026-07-25-llm-application-e1prep.md 增量 3
arXiv 号 arXiv:2607.20709 NVIDIA-labs OO Agents: 原生 Python 面向对象 Agents(NVIDIA labs · 19▲ · 未建卡)+ arXiv:2607.20911 Tencent WorkBuddy Bench: 抗污染任务构建的多领域 Coding-Agent 基准(Tencent · 18▲ · 未建卡)
一句话 NVIDIA-labs OO Agents(原生 Python 面向对象 Agents)= 「Agent 编程范式从函数式到 OO」 立标候选 = NVIDIA 实验室 + 面向对象 Agent 编程;Tencent WorkBuddy Bench(抗污染任务构建的多领域 Coding-Agent 基准)= 「腾讯 + Coding-Agent 基准 + 抗污染」 立标候选 = 中国厂商 Coding-Agent 抗污染基准 立标;两件合流 = HF Daily 7-25 头条 立标合流(AREX 117▲ + SLAI T-Rex 56▲ + NVIDIA OO Agents 19▲ + Tencent WorkBuddy 18▲ = 中国算力主权 + 中国 Coding-Agent 基准 + NVIDIA 编程范式 三栖)
v34 脉络关系 与 v34 §2.6 多模态 / IDE / CLI / 工具退化 14 件 + v34 §1.41 横切 60-66 v23 七件主轴(pi-mono 43.9k⭐ Coding Agent 节点 + Microsoft MAF Harness)+ v34 §2.6 14 件 CLI/IDE + v34 §1.33c 横切 53c AI Agents Stack 2026 编程范式层 + v34 §3.2 争议 88 「Nathan Lambert 立场 2.0」 同源;v34 §2.6 段末追加 + §1.33c 横切 53c 邻接:1) NVIDIA OO Agents = 「Agent 编程范式从函数式到 OO」 立标候选 = §2.6 段末追加(NVIDIA 编程范式立标) + §1.33c 横切 53c 邻接(编程范式层);2) Tencent WorkBuddy Bench = 「Coding-Agent 抗污染基准」 立标候选 = §2.6 段末追加(Coding-Agent 抗污染基准立标) + §1.41 主线 ① Coding Agent 第二十四节点候选(中国厂商 Coding-Agent 抗污染基准) + §3.1 共识(候选新增 「Coding-Agent 基准 = 抗污染 + 多领域 = SWE-bench Pro 升级版」)
反方 / 风险 (A) 两件 paper_card 均未建 = pipeline 漏斗节点;(B) NVIDIA OO Agents 论文是否给出完整的 OO 范式对比未明;(C) Tencent WorkBuddy Bench 抗污染任务构建方法学 + vs SWE-bench Pro 对比 待核;(D) arXiv 编号未确认完整版(Tencent 论文详细作者机构待核);(E) 论文细节 PDF 未抓,待补查;(F) 「面向对象 Agent」 vs v34 §2.6 14 件 CLI/IDE 工具退化 是否实际合流 vs 范式分歧待核
建议归入节 §2.6 多模态 / IDE / CLI / 工具退化 14 件 段末追加两行(NVIDIA OO Agents 编程范式 + Tencent WorkBuddy 抗污染基准) + §1.33c 横切 53c 邻接(NVIDIA 编程范式层 立标) + §1.41 主线 ① Coding Agent 第二十四节点候选(中国厂商 Coding-Agent 抗污染基准) + §3.1 共识(候选新增 「Coding-Agent 基准 = 抗污染 + 多领域」) + §6 必读清单 新增 arXiv:2607.20709 第 127 条 + arXiv:2607.20911 第 128 条
重要边界 不要与 v34 §2.6 14 件 CLI/IDE 工具退化 混为同一件工作:这些是工具调用层(NVIDIA OO Agents 是编程范式 + Tencent WorkBuddy 是基准), 编程范式 vs 基准 = 不同形态;不要与 v34 §1.41 横切 60-66 pi-mono 43.9k⭐ 混为同一件工作:pi-mono 是 monorepo 完整 self-improving, Tencent WorkBuddy 是抗污染基准 = monorepo vs 基准 不同类型;不要与 v34 §2.5 83 节点 LangGraph 混为同一件工作:LangGraph 是图框架, NVIDIA OO Agents 是 OO 范式 = 框架 vs 范式 不同形态;不要与 v34 §1.33c 横切 53c AI Agents Stack 2026 6 层 Microsoft Foundry/Copilot 80K/20M 五层 Harness 混为同一件工作:后者是产品级 Harness, NVIDIA OO Agents 是编程范式层 = Harness vs 范式 不同对象;不要与 v34 §1.45 五向合流 中国 AI 立标 混为同一件工作:五向合流是主权开源 + 政府监管, Tencent WorkBuddy 是抗污染基准 = 主权 vs 基准 不同对象

增量 7 · ⭐⭐⭐ · MSR 7-25 双连发 SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt = Agent 自我改进范式从静态 prompt → Skill 训练参数 → 谐波记忆表示(P1 旁证)

字段 内容
来源 inbox/jay/2026-07-25-1002-rss-msr-blog.md(5 条 · SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt)+ inbox/stephen/2026-07-25-ai-industry-e1prep.md §1.5 + inbox/spark/2026-07-25-agent-e1prep.md §增量 6 P1 旁证
arXiv 号 待核(SkillOpt / Memora MSR 完整论文链接待补)
一句话 MSR 7-25 双连发:SkillOpt = 将 Skill 编辑转化为训练过程(Skill 作为可训练参数, Agent 自我改进范式从静态 prompt → Skill 训练参数)+ Memora = 谐波记忆表示(在抽象性与具体性之间取得平衡) = Agent 自我改进范式 第 3 例(继 AREX arXiv:2607.21461 + pi-mono 43.9k⭐ + Agentic Context Management 之后)
v34 脉络关系 与 v34 §1.45 五向合流 + v34 §2.4 记忆 / 长视野 8 件(MAGE + MRAgent + Memanto + ReMemR1 + AutoMem + Codified Context + PRO-LONG + Agentic Context Management)+ v34 §2.98 PRO-LONG + v34 §1.34b Anthropic Global Workspace 同源;v34 §2.4 记忆 / 长视野 邻接补全(SkillOpt 第 9 节点 + Memora 第 10 节点候选):1) SkillOpt = Skill 作为可训练参数 + 训练过程 = Agent 自我改进范式从「静态 prompt」 → 「Skill 训练参数」 转折立标;2) Memora = 谐波记忆表示(抽象性 vs 具体性 平衡) = memory 元方法学新维度;3) MSR 7-25 五栖合流(SkillOpt + Memora + Aurora 1.5 天气/地球系统基础模型 + Flint 可视化语言 + Rust SymCrypt 密码学验证)= MSR 「agent 记忆 + Skill 训练 + 地球科学 + 可视化 + 密码学验证」 五栖合流立标;4) 「长 horizon agent 范式转折立标集群 第 5 / 6 例」(继 PRO-LONG + LH-Terminal-Bench + AREX + Agentic Context Management + OpenForgeRL 之后)
建议归入节 §2.4 记忆 / 长视野 8 → 10 件(SkillOpt 第九 + Memora 第十 · Skill 训练参数 + 谐波记忆表示) + §1.45 五向合流 旁证(MSR 7-25 五栖合流) + §3.1 共识(候选新增 「Agent 自我改进范式 = Skill 训练参数 + 谐波记忆表示」) + §6 必读清单 候选新增 SkillOpt + Memora 第 129-130 条(待 MSR 完整 arXiv 编号核证)
重要边界 不要与 v34 §2.4 8 件记忆沿用 混为同一件工作:MAGE + MRAgent + Memanto + ReMemR1 + AutoMem + Codified Context + PRO-LONG + Agentic Context Management 是「记忆子系统」沿用, SkillOpt + Memora 是「Skill 训练参数 + 谐波记忆」 新维度 = 子系统 vs 新维度 互补;不要与 v34 §2.98 PRO-LONG 混为同一件工作:PRO-LONG 是「不设 memory 子系统」 + 完整日志, SkillOpt + Memora 是「Skill 训练参数 + 谐波记忆」 = 反 memory vs 训练参数 不同对象;不要与增量 3 AREX(arXiv:2607.21461) 混为同一件工作:AREX 是 bi-level 递归 deep research, SkillOpt 是 Skill 训练参数 = deep research vs Skill 训练 不同形态

增量 8 · ⭐⭐⭐ · δ-mem(AlphaSignal Substack) = RAG / Long Context 之外的第三种 Agent Memory 方案 + 轻量 adapter(P1 旁证)

字段 内容
来源 inbox/tom/2026-07-25T2040-agent-rag-longcontext-radar.md 高价值 #2
arXiv 号 无(AlphaSignal AI Substack · Qwen3-4B-Instruct 上 4.87M 可训练参数(模型 0.12%)· 平均提升 5 benchmarks 准确率从 46.79% → 51.66% (+4.87pp))
一句话 δ-mem 在 Transformer 选中层注入一个 8×8 矩阵, 用矩阵 steering attention 来存储对话历史 = 轻量 adapter 方案, 不扩展 context window, 不依赖 RAG 检索, 直接在内层干预 attention = Qwen3-4B-Instruct 上 4.87M 可训练参数(模型 0.12%)· 平均提升 5 benchmarks 准确率从 46.79% → 51.66% (+4.87pp) = 「context window + RAG 之外的第三种 Agent Memory 方案」 立标候选
v34 脉络关系 与 v34 §2.4 记忆 / 长视野 8 件(PRO-LONG + Agentic Context Management + SkillOpt + Memora)+ v34 §2.4 后训练 Agentic RL 训练栈 13 件 + v34 §2.1 Harness 学术化 同源;v34 §2.4 邻接补全:1) 「8×8 矩阵 steering attention」 = context window + RAG 之外的第三种 Agent Memory 方案 = 与 v34 §2.4 PRO-LONG「不设 memory 子系统」+ Agentic Context Management「lifecycle + architecture」 + SkillOpt/Memora「Skill 训练参数 + 谐波记忆」互补为「Agent Memory 4 路线」(完整日志 / 生命周期 / Skill 训练 / steering adapter);2) 「4.87M 可训练参数(模型 0.12%)」 = 极轻量 adapter, 不扩展 context window, 不依赖 RAG 检索 = 「轻量 adapter」 新维度立标;3) 「Qwen3-4B-Instruct + CC-BY-4.0 开源」 = 可复现性高 + 跨 frontier 模型迁移潜力
反方 / 风险 (A) Substack 来源非 arXiv, 学术分量待核;(B) 「8×8 矩阵 steering attention」 跨层适用性 待核(只在选中层注入);(C) 「Qwen3-4B-Instruct 上 +4.87pp」 跨模型迁移(大模型 / 编码专长模型)待核;(D) vs v34 §2.4 8 件记忆沿用 vs v34 §2.4 后训练 13 件 vs v34 §2.5 OpenForgeRL 训练栈 三栖整合 待决断;(E) 论文细节 / GitHub 链接待补查
建议归入节 §2.4 记忆 / 长视野 邻接补全(δ-mem 第 11 节点候选 · steering attention adapter · 轻量 Agent Memory) + §3.1 共识(候选新增 「Agent Memory = 4 路线 = 完整日志 / 生命周期 / Skill 训练 / steering adapter」) + §6 必读清单 候选新增 δ-mem 第 131 条(待 GitHub + 论文 arXiv 链接核证)
重要边界 不要与 v34 §2.4 PRO-LONG(arXiv:2607.20064v2) 混为同一件工作:PRO-LONG 是「不设 memory」 完整日志, δ-mem 是「8×8 steering attention adapter」 轻量 = 不设 memory vs steering adapter 不同路线;不要与 v34 §2.4 Agentic Context Management(arXiv:2607.21503) 混为同一件工作:后者是 lifecycle + architecture 范式, δ-mem 是具体实现(8×8 矩阵)= 范式 vs 实现 不同层;不要与增量 7 SkillOpt + Memora 混为同一件工作:SkillOpt + Memora 是 MSR Skill 训练参数 + 谐波记忆, δ-mem 是 Substack steering adapter = 不同机构不同形态;不要与 v34 §2.6 35 子节 Tool-Call Boundary Drift(arXiv:2607.07050) 混为同一件工作:后者是工具调用边界校准, δ-mem 是 attention 内层干预 = 工具 vs attention 不同对象

2. 与 v34 活文档已有节点映射(给今晚活文档接手时)

v34 节点 7-25 新增引用 v34 第八轮沿用候选判断
§1 frontier lab 全栈 + §1.41 横切 60-66 v23 七件主轴 Claude Opus 5(7-24 evening 7 件 5 件 Anthropic 全部)+ Boris Cherny 评论 🟡 v34 §1.41 待升 Opus 5 首位立标(7 天内 frontier model 立标密度最高一周)
§1.33c 横切 53c AI Agents Stack 2026 Harness 层 Microsoft MAF Harness(7-25 BUILD 2026)+ Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + 文心快码/Microsoft MAF/AWS Blocks 对比 + NVIDIA OO Agents 🟡 v34 §1.33c 待升「商业 Harness vs 学术 Harness 二分立标 + 编程范式层 NVIDIA OO」
§1.43 横切 80 Why Agents Fail 7 件套 OpenForgeRL 训练-部署对齐 + 数据合成 pipeline + OpenForgeRL vs flyp 7-18 Harness Evolution 反方 = harness 与训练策略需要 co-design 🟡 v34 §1.43 邻接补全(harness 与训练策略 co-design)
§1.45 五向合流 MSR SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖合流 + Anthropic 资本 + 研究 + 模型 + 物理 agent 四线齐扩 🟡 v34 §1.45 邻接补全(MSR 五栖合流 + Anthropic 四线齐扩)
§2.1 Harness 学术化 9 阶段 OpenForgeRL proxy 拦截范式转折 + Boris Cherny 评论「评测 → 系统卡 → 评论 → 红队 4 栖」 🟢 v34 §2.1 沿用升级(proxy 拦截 + 4 栖验证)
§2.3 评测基础设施分层 21 行 Tencent WorkBuddy Bench(arXiv:2607.20911 抗污染基准 18▲ 候选) 🟢 v34 §2.3 邻接补全(抗污染基准第 22 行候选)
§2.4 记忆 / 长视野 8 件 Agentic Context Management paper_card 564 已立 + Sample-Efficient paper_card 567 已立 + SkillOpt(MSR 7-25)+ Memora(MSR 7-25)+ δ-mem(Substack 7-25) 🟡 v34 §2.4 候选扩为 8 + 5 件 = 13 件(PRO-LONG + Agentic Context Management + Sample-Efficient + SkillOpt + Memora + δ-mem = 5 件邻接补全)
§2.4 后训练与训练-评测双闭环 Agentic RL 训练栈 13 件 Sample-Efficient 沿用升级 + ReOPD 沿用升级 + OpenForgeRL 训练基础设施 邻接 🟢 v34 §2.4 沿用升级 + OpenForgeRL 训练基础设施 邻接
§2.5 安全契约 7 维 + 第 9 阶 + 第 10 阶 OpenForgeRL 训练基础设施 84 节点 + Isolation-as-First-Class(arXiv:2607.12406)第 11 阶 + AREX(arXiv:2607.21461)85 节点 + AgentCI MCP 安全 沿用 + Self-State Attacks 沿用 + SeerGuard 沿用 🟡 v34 §2.5 候选扩为 7 维 + 第 9 阶 + 第 10 阶 + 第 11 阶 + 84 节点 + 85 节点(OpenForgeRL + Isolation-as-First-Class + AREX 三联立标)
§2.6 多模态 / IDE / CLI / 工具退化 14 件 LLMs Get Lost in Evolving User Intent HF Daily 7-25 #15 15▲ 沿用升级 + Boris Cherny 评论「评测 → 系统卡 → 评论 → 红队 4 栖」 + Microsoft MAF Harness 三层架构 + Klarna 853 FTE 等效 + NVIDIA OO Agents 19▲ + Tencent WorkBuddy 18▲ + Anthropic Project Pilot + Claude Opus 5 🟡 v34 §2.6 段末追加 5 段(评测 → 系统卡 → 评论 → 红队 4 栖 + MAF 三层 + Klarna + NVIDIA OO + Tencent WorkBuddy + Anthropic Project Pilot + Claude Opus 5)
§3.1 共识 25 条 train-deploy mismatch = proxy 拦截范式转折(增量 1)+ Agent 安全按结构而非按攻击类型组织 边界中心 第 1 survey(增量 2)+ agent 自我改进 = bi-level discovery/verification 不对称(增量 3)+ frontier lab 4 栖验证 = 评测/系统卡/评论/红队(增量 4)+ 商业 Harness vs 学术 Harness 边界 二分立标(增量 5)+ Compounding Error 0.85^10≈0.197 Multi-Agent 可靠性量化公式(增量 5)+ Coding-Agent 基准 = 抗污染 + 多领域(增量 6)+ Agent 自我改进范式 = Skill 训练参数 + 谐波记忆表示(增量 7)+ Agent Memory = 4 路线 = 完整日志 / 生命周期 / Skill 训练 / steering adapter(增量 8) 🟡 v34 §3.1 共识候选新增 9 条 = 25 → 34
§3.2 争议 27 条 Dumb RAG / Brittle Connectors / Compounding Error 三模式 解释力(增量 5)+ 0.85^10=20% 假设独立同分布 vs LangGraph 状态回传(增量 5)+ SeerGuard 主分类(agent vs engineering)沿用 + Beyond Relevance-Centric 主分类(rag vs agent)沿用 + vLLM Bug C V1 沿用 🟡 v34 §3.2 争议新增 2 条 = 27 → 29
§4 开放问题 36 条 proxy 拦截 latency / token 漂移 实测 + vs Polar head-to-head(增量 1)+ isolation strength metric + 跨模态 agent isolation(增量 2)+ Opus 5 vs Fable 5 关系 + Opus 5 关键数字 + Boris Cherny 评论出处(增量 4)+ MAF Harness vs HF Harness vs OpenForgeRL 三栈 head-to-head + Gartner 2027 40% vs Berkeley RDI 40% 交叉核 + Klarna 一手财报数据核(增量 5)+ Q103 阈值「极端消失判定」新阶段持续验证(沿用) 🟡 v34 §4 开放问题新增 9 条 = 36 → 45
§5 趋势 24 条 harness-native 训练基础设施 proxy 拦截范式转折(增量 1)+ isolation-as-first-class 边界中心 survey anchor(增量 2)+ agent 自我改进 bi-level discovery/verification(增量 3)+ frontier lab 4 栖验证 评测/系统卡/评论/红队(增量 4)+ 商业 Harness vs 学术 Harness 二分立标(增量 5) 🟡 v34 §5 趋势新增 5 条 = 24 → 29
§6 必读清单 114 条 arXiv:2607.21557 + 2607.12406 + 2607.21461 + 2607.20709 + 2607.20911 + SkillOpt + Memora + δ-mem + Anthropic Opus 5 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund + Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + Klarna + Compounding Error = 8 件 arXiv + 9 件非 arXiv = 17 件 🟢 v34 §6 必读清单扩为 131 条候选

3. 值得警惕的矛盾或待核实说法(12 条)

3.1 矛盾 1 · arXiv:2607.12406 Isolation-as-First-Class paper_card 待建

  • 冲突:flyp 7-25 1036 §二 A 精读论文 A 35KB 主稿 + stephen 7-25 1245 §3.2 已标记 + spark 7-25 agent-e1prep §增量 3 P0 + Tom 7-25 0840 一般候选 = paper_card 未建 = pipeline 漏斗节点
  • 风险:v34 §2.5 第 11 阶候选 + risk.md R28 §2.18 邻接 = 双向 reference 但 paper_card 缺
  • 建议:Stephen 7-25 evening 协调棒 / Tom 7-25 evening 稿 / Jay 7-25 evening 稿 / spark 7-25 evening 稿 任一补建 arXiv:2607.12406 paper_card

3.2 矛盾 2 · Anthropic Claude Opus 5 vs Claude Fable 5 关系待核

  • 冲突:Opus 5 是否替代 Fable 5 还是平行产品未明(stephen 7-25 ai-industry §2.2 已标矛盾)
  • 风险:v34 §1.41 横切 60-66 v23 七件主轴立标密度 5 件(7-16 ~ 7-24 8 天内 5 个 frontier model 立标 = 7 天内 frontier model 立标密度最高一周)= 关系未核会导致立标混乱
  • 建议归入:§4.1 开放问题 198 候选新增(Anthropic 官网模型矩阵核证 Opus 5 vs Fable 5 关系)
  • 建议:今晚活文档接手时先核 Opus 5 系统卡 + Fable 5 文档 + Anthropic 官网模型矩阵

3.3 矛盾 3 · Boris Cherny 「Opus 5 最不容易被 prompt injection」评论出处与 Opus 5 PI evals / red team 完整版本 待核

  • 冲突:jay 7-25 1000-rss-simon-willison 引语 + stephen 7-25 ai-industry §2.2 已标矛盾 + Opus 5 system card 第 73 页埋没 论据 待 PDF 核
  • 风险:v34 §1.41 横切 60-66 立标密度 5 件 vs 评论层立标 待核 = 影响 v34 §2.6 评测、可靠性与对抗 4 栖验证第 1 例 立标分量
  • 建议归入:§4.1 开放问题 198 候选新增(Boris Cherny 评论出处 + Opus 5 PI evals / red team 完整版本)
  • 建议:今晚活文档接手时先核 Opus 5 system card PDF + Boris Cherny 评论全文

3.4 矛盾 4 · Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效(SocialCrawl.ai 第三方汇总) vs 一手 Klarna 财报数据

  • 冲突:jay 7-25 1055 engineering-filter #2 + jay 7-25 1105 substack = SocialCrawl.ai 第三方汇总数据 vs Klarna 财报数据
  • 风险:v34 §1.33c 横切 53c 量化补全(89% observability vs 52% evals 37pt eval gap + Klarna 853 FTE 等效 + $60M 节省)= 数字立标分量依赖一手数据
  • 建议归入:§4.1 开放问题 199 候选新增(Klarna 一手财报数据核证)
  • 建议:今晚活文档接手时先核 Klarna 一手财报 + 公告 + SocialCrawl.ai 原文 + 框架对比章节

3.5 矛盾 5 · Compounding Error 0.85^10≈0.197 假设每步独立同分布误差 vs LangGraph 状态回传

  • 冲突:jay 7-25 1105 Substack 假设 + LangGraph 状态回传实际生产中步骤间误差并非完全独立
  • 风险:v34 §3.1 共识 26「Multi-Agent 可靠性量化公式」依赖此数字 = 上限估算而非精确值,但量级判断有效
  • 建议归入:§3.2 争议 28 候选新增(0.85^10=20% 假设独立同分布 vs LangGraph 状态回传)
  • 建议:今晚活文档接手时先核 Substack 原文 + LangGraph 状态回传机制 + Gartner 2027 40% 预测 vs Berkeley RDI 2027 末 40% 预测 交叉核

3.6 矛盾 6 · Microsoft MAF Harness GitHub samples 实际 API 待核

  • 冲突:jay 7-25 1055 engineering-filter 标注「需打开 Harness samples GitHub 提取实际 API 代码」= 当前处于「有框架描述, 无具体代码」中间状态
  • 风险:v34 §1.33c 横切 53c 量化补全依赖「商业 Harness vs 学术 Harness 二分立标」= API 代码未核会导致立标分量打折
  • 建议归入:§4.1 开放问题 199 候选新增(MAF Harness GitHub samples 实际 API)
  • 建议:今晚活文档接手时先核 Microsoft DevBlogs + MAF Harness GitHub samples ./harness 实际 API

3.7 矛盾 7 · OpenForgeRL proxy 拦截 latency / token 漂移 / stream 行为差异 未量化

  • 冲突:flyp 7-25 1036 §三 B M1-M5 证伪线 + spark 7-25 agent-e1prep §增量 2 反方/风险 = proxy 拦截在生产环境的延迟 + token 漂移 + stream 行为差异 实测数据未给
  • 风险:v34 §2.5 第 84 节点(harness-native agent 训练基础设施)立标分量依赖 proxy 拦截开销量化
  • 建议归入:§4.1 开放问题 196 候选新增(proxy 拦截 latency / token 漂移 实测 + vs Polar head-to-head)
  • 建议:今晚活文档接手时先核 OpenForgeRL 论文 Section 5 行为分析 + 6 harness × 6 基准完整数字

3.8 矛盾 8 · Isolation-as-First-Class 5 边界 缺定量 metric

  • 冲突:flyp 7-25 1036 §二 A-4 L1 证伪线 「边界」 作为一阶原语但缺少 isolation strength metric(信息泄露率 / 控制权渗透深度 / 跨边界失效传播步数 三指标未给)
  • 风险:v34 §2.5 第 11 阶(agent 安全 survey anchor)立标分量依赖 isolation strength metric 量化
  • 建议归入:§4.1 开放问题 197 候选新增(isolation strength metric + 跨模态 agent isolation)
  • 建议:今晚活文档接手时先核 survey 不补 metric 就会被引用者绕开;下一轮工作需补 isolation strength metric

3.9 矛盾 9 · AutoIndex arXiv:2607.18603 7-25 仍未建卡

  • 冲突:Stephen 7-25 1245 §3.2 已标记 🔴 AutoIndex 6 日未建卡 = pipeline 漏斗节点
  • 风险:v34 §2.3 第 56 节点 AutoIndex 已固化但 paper_card 缺 = 第八轮待补建卡或决断复用
  • 建议归入:§4.1 开放问题 沿用
  • 建议:Stephen 7-25 evening 协调棒 / Tom 7-25 evening 稿 / Jay 7-25 evening 稿 任一补建

3.10 矛盾 10 · Q103 阈值「极端消失判定」新阶段持续验证

  • 冲突:7-25 主线 A 连续第 8 天缺失(7-18 + 7-19 + 7-20 + 7-21 + 7-22 + 7-23 + 7-24 + 7-25)= spark 反思机制提议「连续 ≥ 7 天 = 极端消失判定」
  • 风险:v34 §3.3 Q103 持续监测 + 主线 K / H / J 持续巩固 = 量化阈值扩展 待 v34 决断
  • 建议归入:§3.3 Q103 + §3.4 T109 持续监测
  • 建议:spark 7-25 evening v2 重写 gradient-flow 时同步覆盖 Q103 阈值「极端消失判定」+ 倾向于可能 1 概率再次量化

3.11 矛盾 11 · Tencent WorkBuddy Bench 抗污染任务构建方法学 + vs SWE-bench Pro 对比 待核

  • 冲突:stephen 7-25 ai-industry §1.5 + llm-application-e1prep 反方/风险 #5 = arxiv 编号未确认完整版 + 抗污染方法学未披露 + vs SWE-bench Pro 对比 未给
  • 风险:v34 §2.6 段末追加(中国厂商 Coding-Agent 抗污染基准)立标分量依赖方法学 + vs SWE-bench Pro 对比
  • 建议归入:§4.1 开放问题 200 候选新增(Tencent WorkBuddy Bench 抗污染方法学 + vs SWE-bench Pro + GitHub 开源状态)
  • 建议:今晚活文档接手时先核 Tencent WorkBench 论文 arXiv 编号 + 抗污染方法学 + SWE-bench Pro 对比

3.12 矛盾 12 · SkillOpt + Memora MSR 完整 arXiv 编号 待核

  • 冲突:jay 7-25 1002-rss-msr-blog 5 条 + stephen 7-25 ai-industry §1.5 = SkillOpt / Memora MSR 完整论文链接待补
  • 风险:v34 §2.4 邻接补全(MSR 7-25 五栖合流)立标分量依赖论文 arXiv 编号核证
  • 建议归入:§6 必读清单 候选新增(SkillOpt + Memora 第 129-130 条待 arXiv 编号核证)
  • 建议:今晚活文档接手时先核 jay 7-25 1002-rss-msr-blog 原文 + MSR blog 7-25 5 条 + SkillOpt / Memora 论文链接

4. 涉及 arXiv 号列表(本次新增 + 邻接参考)

编号 来源 主分类 形态 涉及增量 paper_card HF Daily 7-25
2607.21557 Tom 7-25 0840 ⭐ #2 + Tom 7-25 1440 v2 #2 + Tom 7-25 2040 #3 + flyp 7-25 1036 §三 + paper_cards/585 已立 agent(systems 副 training 副) method 增量 1 已立 585 候选(未上榜)
2607.12406 flyp 7-25 1036 §二 + spark 7-25 agent-e1prep §增量 3 + stephen 7-25 1245 agent(risk 副) survey 增量 2 未建 未收录
2607.21461 Tom 7-25 0900 HF Daily #1 117▲ + stephen 7-25 ai-industry §1.3 + spark 7-25 agent-e1prep §增量 7 agent method 增量 3 未建 #1 117▲
2607.20709 Tom 7-25 0900 HF Daily #11 19▲ + stephen 7-25 ai-industry §1.5 + llm-application-e1prep 增量 3 agent(method 副) method 增量 6 未建 #11 19▲
2607.20911 Tom 7-25 0900 HF Daily #12 18▲ + stephen 7-25 ai-industry §1.5 + llm-application-e1prep 增量 3 agent(benchmark 副) benchmark 增量 6 未建 #12 18▲
2607.19191 Tom 7-25 1440 v2 重写版高价值 #1 v3 强制承接自 7-24 HF Daily #1 200▲ agent(multimodal 副 systems 副) method 邻接(训练 + 推理基础设施双层栈) 未建 7-24 #1 200▲(v3 强制承接 7-25)
2607.21503 Tom 7-25 0840 ⭐ #1 + Tom 7-25 1440 v2 高价值 #3 + Tom 7-25 2040 高价值 #1 + paper_cards/564 已立(7-25) agent(rag 副 memory 副) method 沿用升级 已立 564 候选(未上榜)
2607.21051 Tom 7-25 0840 ⭐ #3 + Tom 7-25 1440 v2 高价值 #4 + Tom 7-25 2040 高价值 #6 + paper_cards/567 已立(7-24) agent method 沿用升级 已立 567 9 票(7-25)
2607.04763 Tom 7-25 0840 #5 + Tom 7-25 2040 高价值 #5 + paper_cards/576 已立(7-24) agent(multimodal 副) method 沿用升级 已立 576 8 票(7-25)
2607.19238 Tom 7-25 0840 #4 + Tom 7-25 2040 高价值 #4 + paper_cards/575 已立(7-24) agent(benchmark 副) benchmark 沿用升级 已立 575 5 票(7-25)
2607.20734 Tom 7-25 0900 HF Daily #15 15▲ + paper_cards/569 已立(7-24) agent application 沿用升级 已立 569 #15 15▲(7-24 #11 24▲ → 7-25 #15 15▲ = -9 票下降)
2607.21576 Tom 7-25 0840 #8 + Tom 7-25 1440 v2 邻接 + paper_cards/573 已立(7-25) multimodal method 邻接(非编码 agent) 已立 573 16 票(7-25)

合计 7-25 coding-agents 主分类新增 arXiv 5 件(增量 1-3 + 增量 6 两件 = 5 件 = 2607.21557 + 2607.12406 + 2607.21461 + 2607.20709 + 2607.20911)+ 沿用升级 6 件(增量 6 + 增量 7 + 增量 8 = 2607.21503 + 2607.21051 + 2607.04763 + 2607.19238 + 2607.20734 + 2607.21576 = 6 件)+ 邻接参考 1 件(ABot-World-0 2607.19191)= 12 件 arXiv 号;非 arXiv 旁证 9 件(增量 4 = Anthropic Opus 5 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund + 增量 5 = Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + Klarna + Compounding Error + 增量 7 = MSR SkillOpt + Memora + 增量 8 = δ-mem Substack = 9 件);v34 沿用 16 件(7-25 已固化)

4.1 已立标沿用编号(本次继承不重复)

  • 2607.21557 OpenForgeRL / 2607.12406 Isolation-as-First-Class(待建卡) / 2607.21461 AREX(待建卡) / 2607.21503 Agentic Context Management / 2607.21051 Sample-Efficient / 2607.04763 ReOPD / 2607.20734 LLMs Get Lost / 2607.19238 FinanceComplexQA / 2607.21576 Self-Supervised Learning / 2607.19747 Beyond Relevance-Centric / 2607.15550 SeerGuard / 2607.16617 DataFlow-Harness / 2607.18754 AgentDebugX / 2607.18213 SWE-Pruner Pro / 2607.18171 FlashRT / 2607.17986 Self-State Attacks / 2607.15434 Manager Coercion / 2607.15495 Anthropic J-space / 2607.07050 Tool-Call Boundary Drift / 2607.07820 DeepSearch-World / 2607.19297 LangGraph / 2607.18603 AutoIndex(7-25 仍未建卡) / 2607.18529 EduPanel / 2607.18772 RF-Agent / 2607.18825 AILQA / 2607.19865 DocOps / 2607.19058 SkewAdam / 2607.15263 Cost-Aware / 2607.06815 Behavioral Privacy / 2607.15657 Lucid / 2606.20683 Harness Survey / 2604.25850 AHE / 2607.20064v2 PRO-LONG —— 全部已在 v25 / v26 / v27 / v28 / v34 沿用

4.2 非 arXiv 但本主题重要参考

  • Anthropic Claude Opus 5 系统卡(7-24 evening 发布 · Boris Cherny 评论「Opus 5 是我们迄今为止最不容易被 prompt injection 的模型」 · Project Pilot AI 操控无人机 · Economic Index/Fund = frontier lab 7-24 evening 立标首位 + 评测 → 系统卡 → 评论 → 红队 4 栖验证第 1 例 + 资本 + 研究 + 模型 + 物理 agent 四线齐扩)
  • Microsoft MAF Agent Harness · BUILD 2026 生产级 SDK(Microsoft DevBlogs · 2026 BUILD 公告 · shell/filesystem 访问 + human-in-the-loop 审批流 + 长时会话上下文管理 + MCP 一体化 + .NET/Python 双语言)
  • Enterprise LLM Agent 三层架构(Plan/Architect/Zulu)(CSDN 智能体开发者社区 · 2026-07-11 · Plan Agent 意图分解 + Architect Agent 技术方案设计 + Zulu Agent LangGraph 状态机驱动执行引擎 + 验证循环)
  • Google ADK Go 2.0 DAG 编排(CSDN 2026-07-02 · 1.8k 阅读 · 与文心快码/Microsoft MAF/AWS Blocks 三家框架横向对比)
  • Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效(SocialCrawl.ai · SocialCrawl Agent Frameworks in 2026 · LangGraph vs CrewAI vs Mastra vs Pydantic AI 生产数据对比)
  • Agent 生产失败三模式 Dumb RAG + Brittle Connectors + Compounding Error 0.85^10≈0.197 + Gartner 2027 40% 废弃预测(theaiengineer.substack.com · Paolo Perrone · 8KB)
  • MSR SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖合流(jay 7-25 1002-rss-msr-blog 5 条 · Skill 作为可训练参数 + 谐波记忆表示 + 天气/地球系统基础模型 + 可视化语言 + 密码学验证)
  • δ-mem(AlphaSignal AI Substack)(Qwen3-4B-Instruct 上 4.87M 可训练参数(模型 0.12%)· 平均提升 5 benchmarks 准确率从 46.79% → 51.66% (+4.87pp))
  • lopopolo/harness-engineering GitHub(⭐ 2194 · 7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • NousResearch/hermes-agent GitHub(218K⭐ · 7-22 立标 + 7-23 沿用 + 7-24 沿用 + 7-25 沿用)
  • Graphify-Labs/graphify GitHub(93K⭐ · 7-22 立标 + 7-23 沿用 + 7-24 沿用 + 7-25 沿用)
  • ByteDance/DeerFlow GitHub(DeerFlow v2.0 统一 harness 重写版 · 7-22 立标 + 7-23 沿用 + 7-24 沿用 + 7-25 沿用 · arXiv 待核)
  • Self-Harness(上海 AI Lab · arXiv 占位 2606.xxxxx 待核 · 7-22 立标 + 7-23 沿用 + 7-24 沿用 + 7-25 沿用)
  • Sebastian Raschka「使用本地 Coding Agent」(magazine.sebastianraschka.com · 7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • Lilian Weng「自改进的 Harness 工程」(lilianweng.github.io · 2026-07-04 + 续沿用 · 递归自改进 RSI 概念追溯 I. J. Good 1965 · 7-23 立标 + 7-24 沿用 + 7-25 续「自我改进 Harness 工程」 续立)
  • Cursor Router(jay 7-23 1335 deep-dive · 请求级智能分类器 · 7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • OpenRouter Prompt Caching + Sticky Routing(多轮 Agent 调用成本优化 · 7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • Google Tunix(基于 JAX 高吞吐智能体后训练库 · 7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • Cameron Wolfe「Agentic World Models + Agentic RL + Agent 评估」 三连(flyp 7-25 1000-rss-cameron-wolfe · 立场层立标 · 与本主题编码 Agent 上下文管理 + 长视野 Agent 主线同源 = world-model-based reasoning + Agent 评估 详尽指南 立标)
  • ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU(arXiv:2607.19191 · 2026-07 · HF Daily 7-24 #1 200▲ · 单 GPU 消费级硬件 · 流式生成 + 异步去噪器架构 · 与 OpenForgeRL 互补为「训练 + 推理基础设施」双层栈)
  • Boris Cherny 评论「Opus 5 是我们迄今为止最不容易被 prompt injection 的模型」 + system card 第 73 页埋没 + 红队验证(jay 7-25 1000-rss-simon-willison)
  • Project Pilot: AI 模型能操控无人机吗?(Anthropic · 2026-07-24 · frontier lab 物理 agent 实证延续)
  • Anthropic Economic Index 连接器 + Economic Futures Research Fund 研究议程(Anthropic · 2026-07-24 · 经济测度 → Lobby → 经济学测度范式转折 第 3 / 4 件续立)

5. 本主题页活文档沿用 vs 新立关系总览(给今晚活文档接手时)

5.1 沿用项目(v25 / v26 / v27 / v28 / v34 已收录,7-23 无新增,7-24 无新增,7-25 沿用)

  • Kimi K3(Moonshot AI · 7-19 API + 7-27 开权 · SWE Marathon 42.0 / Program Bench 77.8 / Terminal-Bench 88.3 三榜 SOTA)
  • FlashRT(arXiv:2607.18171 · deployment-time harness · 第六阶段)
  • SWE-Pruner Pro(arXiv:2607.18213 · AHE「experience observability」· 第七阶段 harness 内化)
  • Cost-Aware Security Agent(arXiv:2607.15263 · 评测第三维度)
  • Behavioral Privacy Leakage(arXiv:2607.06815 · 安全第四维度)
  • 4 RCE CVE(CVE-2026-61447 + 54769 + 57572 + 59726 · Orca Security 2026)
  • IBM Model Routing 三大工程陷阱(2026-07-15)
  • Microsoft Foundry / Copilot 五层 Harness(Marco Casalaina · ByteByteGo 2026-07-20)
  • Harness Survey(arXiv:2606.20683 · 六维运行时分解 + Agent 工程四大范式演进)
  • OpenDev(arXiv:2603.05344 · dual-agent terminal coding + lazy tool discovery + adaptive compaction)
  • Production Playbook 12-pattern(Botlearn.ai · 2026)
  • Kimi Code CLI(Moonshot 第二件 coding agent 落地)
  • §2.1 Harness 学术化 9 阶段「时间点多向闭环 6 件 + Harness-as-Agent 第九阶段 7 件」
  • §2.3 评测信任第 7 阶五联(Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph)
  • §2.5 第 9 阶 + AgentDebugX + HACO + Manager Coercion = 7 维合并成熟
  • Hy3 1bit 单卡 96GB 部署 + 1bit 提速 50% + llama.cpp MTP 60%
  • vLLM v0.25.1 4 Bug + SGLang v0.5.15.post1 5 Bug = 9 Bug 矩阵(7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • SkewAdam(arXiv:2607.19058)MoE 三类参数分层优化器状态(7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • lopopolo/harness-engineering(⭐ 2194 · 7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • Sebastian Raschka「使用本地 Coding Agent」(7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • Lilian Weng「自改进的 Harness 工程」续沿用(7-23 续 + 7-24 沿用 + 7-25 续「自我改进 Harness 工程」 续立)
  • Anthropic J-space(arXiv:2607.15495 · 7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • Cursor Router + OpenRouter Caching + Google Tunix(7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • Kimi K3 7-27 开权前夜生态补漏 7 件(7-23 立标 + 7-24 沿用 + 7-25 沿用)
  • Agentic Context Management(arXiv:2607.21503 · 7-24 立标 + 7-25 沿用升级 · paper_cards/564 已立)
  • Sample-Efficient(arXiv:2607.21051 · 7-24 立标 + 7-25 沿用升级 · paper_cards/567 已立)
  • ReOPD(arXiv:2607.04763 · 7-24 立标 + 7-25 沿用升级 · paper_cards/576 已立)
  • LLMs Get Lost in Evolving User Intent(arXiv:2607.20734 · 7-24 立标 + 7-25 沿用升级 · paper_cards/569 已立 · HF Daily 7-25 #15 15▲)
  • FinanceComplexQA(arXiv:2607.19238 · 7-24 立标 + 7-25 沿用升级 · paper_cards/575 已立)
  • Beyond Relevance-Centric(arXiv:2607.19747 · 7-24 立标 + 7-25 沿用升级 · paper_card 未建)
  • SeerGuard(arXiv:2607.15550 · 7-24 立标 + 7-25 沿用升级 · paper_card 未建)
  • AI Workflow Store(arXiv:2605.10907 · 7-24 立标 + 7-25 沿用)
  • Context Engineering(arXiv:2603.09619 · 7-24 立标 + 7-25 沿用)
  • AgentCI MCP 安全 + GitHub Agentic Workflows 6 层 + Block Goose(7-24 立标 + 7-25 沿用)
  • PRO-LONG(arXiv:2607.20064v2 · 7-24 立标 + 7-25 沿用升级)

5.2 新立项目(本轮 7-25 增量 = 4 件 P0 主线 + 1 件 P0 三联立标 + 3 件 P1 旁证)

  • §2.5 运行时与基础设施 候选第 84 节点(本轮 7-25 第一强新增):
    • arXiv:2607.21557 OpenForgeRL —— 首个支持 harness-based Agent 端到端训练的开源框架 · proxy 拦截 + Kubernetes orchestrator + 6 harness × 6 基准实证 + OpenClaw 直接闭环 + 训练-部署对齐 · paper_cards/585 已立(Tom 7-25 0840 + 1440 + 2040 + flyp 7-25 1036 + spark 7-25 agent-e1prep)
  • §2.5 安全契约 候选第 11 阶(本轮 7-25 第二强新增):
    • arXiv:2607.12406 Isolation as a First-Class Principle for LLM-Agent System Safety —— 5 边界 + isolation-by-construction 4 原则 + ~150 篇文献 · flyP 安全主题页 anchor · 与 Self-State Attacks + Tool-Call Boundary Drift + MCP CVE 集群 三栖整合(flyp 7-25 1036 + spark 7-25 agent-e1prep + flyp 7-25 risk-e1prep)
  • §2.5 运行时 候选第 85 节点(本轮 7-25 第三强新增):
    • arXiv:2607.21461 AREX —— 递归自我改进 deep research agent · BAAI · bi-level discovery/verification 不对称 · HF Daily 7-25 #1 117▲(Tom 7-25 0900 + stephen 7-25 1245 + 2245 + ai-industry + llm-application + spark 7-25 agent-e1prep)
  • §1.41 横切 60-66 v23 七件主轴 候选首位立标(本轮 7-25 第四强新增):
    • Anthropic Claude Opus 5 7-24 evening 正式发布 —— frontier lab 模型公司本体节奏首位立标 + Boris Cherny「Opus 5 是我们迄今为止最不容易被 prompt injection 的模型」 评论 + Project Pilot AI 操控无人机 + Economic Index/Fund = 评测 → 系统卡 → 评论 → 红队 4 栖验证第 1 例 + 资本 + 研究 + 模型 + 物理 agent 四线齐扩(stephen 7-25 1003 + 1005 + 0910 + jay 7-25 1000-rss-simon-willison + ai-industry + spark 7-25 agent-e1prep)
  • §1.33c 横切 53c 量化补全 + §2.4 多智能体协作 + §2.6 评测邻接(本轮 7-25 第五强新增):
    • Microsoft MAF Harness · BUILD 2026 生产级 SDK + Enterprise LLM Agent 三层架构(Plan/Architect/Zulu)+ Google ADK Go 2.0 DAG 编排 + 文心快码/Microsoft MAF/AWS Blocks 三家框架横向对比 + Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效 + Compounding Error 0.85^10≈0.197 + Gartner 2027 40% 废弃预测(jay 7-25 1055 + 1105 + 1105 substack + 1123 + spark 7-25 agent-e1prep)
  • §2.6 多模态 / IDE / CLI / 工具退化 段末追加 + §1.33c 横切 53c 邻接 + §1.41 主线 ①(本轮 7-25 第六新增):
    • arXiv:2607.20709 NVIDIA-labs OO Agents + arXiv:2607.20911 Tencent WorkBuddy Bench —— HF Daily 7-25 头条 立标合流(AREX 117▲ + SLAI T-Rex 56▲ + NVIDIA OO Agents 19▲ + Tencent WorkBuddy 18▲ = 中国算力主权 + 中国 Coding-Agent 基准 + NVIDIA 编程范式 三栖)(Tom 7-25 0900 + stephen 7-25 ai-industry + llm-application)
  • §2.4 记忆 / 长视野 邻接补全(本轮 7-25 第七新增):
    • MSR SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖合流 —— Agent 自我改进范式从静态 prompt → Skill 训练参数 → 谐波记忆表示(jay 7-25 1002-rss-msr-blog + stephen 7-25 ai-industry + spark 7-25 agent-e1prep)
  • §2.4 记忆 / 长视野 邻接补全(本轮 7-25 第八新增):
    • δ-mem(AlphaSignal Substack) —— RAG / Long Context 之外的第三种 Agent Memory 方案 + 8×8 矩阵 steering attention + Qwen3-4B-Instruct + 4.87M 可训练参数(模型 0.12%)+ +4.87pp 平均提升(Tom 7-25 2040)

5.3 主题页结构变化建议(给今晚活文档接手时)

  • §1 现状全景:从 11 阈值(7-25 04:20 v34 已升格 11 阈值 = 模型端主权开源跨榜 SOTA Kimi K3 + Agent 框架 4 RCE + Cost/Privacy 维度 + IBM Routing + K3 三榜 SOTA + FlashRT/SWE-Pruner 内化范式 + 评测扩展第 7 阶 + AI 安全第 9 阶自状态攻击 + Agent Harness 工业化 6 件套 + Harness-as-Agent 第九阶段 7 件 + 工业知识库 GitHub 双件 + 认知科学锚点 arXiv 实证补全 + 上下文管理三路线对立 + Agent 经验蒸馏双轨 + AI 安全第 10 阶 + MCP 工业级安全)扩为 13 阈值 = + OpenForgeRL(harness-native 训练基础设施 第 84 节点)+ Isolation-as-First-Class(agent 安全 survey anchor 第 11 阶)+ AREX(agent 自我改进 bi-level 第 85 节点)+ Anthropic Opus 5(frontier lab 模型本体首位 + 4 栖验证第 1 例)+ 商业 Harness vs 学术 Harness 二分立标(MAF Harness + 文心快码 + Google ADK Go 2.0 + Klarna + Compounding Error)+ Coding-Agent 抗污染基准(Tencent WorkBuddy)+ Agent 编程范式立标(NVIDIA OO Agents)
  • §2.1 Harness 学术化:从 9 阶段(7-24 v34 第九阶段「Harness-as-Agent 7 件」)沿用升级,段末追加「OpenForgeRL proxy 拦截范式转折 + Boris Cherny 评论「评测 → 系统卡 → 评论 → 红队 4 栖」」
  • §2.3 评测基础设施分层 21 行:沿用升级,邻接补全「Tencent WorkBuddy Bench 抗污染基准 第 22 行候选」
  • §2.4 记忆 / 长视野:从 8 件(MAGE + MRAgent + Memanto + ReMemR1 + AutoMem + Codified Context + PRO-LONG + Agentic Context Management)扩为 8 + 5 件 = 13 件(沿用 8 件 + SkillOpt 第 9 + Memora 第 10 + δ-mem 第 11 + Sample-Efficient 沿用升级 + ReOPD 沿用升级 = 5 件邻接补全)+ Agent Memory 4 路线段末追加(完整日志 PRO-LONG + 生命周期 Agentic Context Management + Skill 训练 SkillOpt/Memora + steering adapter δ-mem)
  • §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈:从 13 件(7-24 立标)沿用升级,OpenForgeRL 第 84 节点邻接补全(harness-native 训练基础设施)
  • §2.5 安全契约:从 7 维 + 第 9 阶 + 第 10 阶扩为 7 维 + 第 9 阶 + 第 10 阶 + 第 11 阶(agent 安全 survey anchor 边界中心组织) + OpenForgeRL 第 84 节点邻接补全 + AREX 第 85 节点邻接补全(agent 自我改进 bi-level)
  • §2.6 多模态 / IDE / CLI / 工具退化:从 14 件(7-24 立标)沿用升级,段末追加 5 段(评测 → 系统卡 → 评论 → 红队 4 栖 + MAF 三层架构 + Klarna 853 FTE 等效 + NVIDIA OO Agents 19▲ + Tencent WorkBuddy 18▲ + Anthropic Project Pilot + Claude Opus 5 + ABot-World-0 单 GPU 无限交互 = 「训练 + 推理基础设施」双层栈合流)
  • §3.1 共识:从 25 条扩为 34 条(+ train-deploy mismatch = proxy 拦截范式转折 + Agent 安全按结构而非按攻击类型组织 边界中心 第 1 survey + agent 自我改进 = bi-level discovery/verification 不对称 + frontier lab 4 栖验证 = 评测/系统卡/评论/红队 + 商业 Harness vs 学术 Harness 边界 二分立标 + Compounding Error 0.85^10≈0.197 Multi-Agent 可靠性量化公式 + Coding-Agent 基准 = 抗污染 + 多领域 + Agent 自我改进范式 = Skill 训练参数 + 谐波记忆表示 + Agent Memory = 4 路线 = 9 条)
  • §3.2 争议:从 27 条扩为 29 条(+ Dumb RAG / Brittle Connectors / Compounding Error 三模式 解释力 + 0.85^10=20% 假设独立同分布 vs LangGraph 状态回传 = 2 条)
  • §4 开放问题:从 36 条扩为 45 条(+ proxy 拦截 latency / token 漂移 实测 + vs Polar head-to-head + isolation strength metric + 跨模态 agent isolation + Opus 5 vs Fable 5 关系 + Opus 5 关键数字 + Boris Cherny 评论出处 + MAF Harness vs HF Harness vs OpenForgeRL 三栈 head-to-head + Gartner 2027 40% vs Berkeley RDI 40% 交叉核 + Klarna 一手财报数据核 + Tencent WorkBuddy 抗污染方法学 + vs SWE-bench Pro + GitHub 开源状态 + SkillOpt + Memora MSR 完整 arXiv 编号 + Q103 阈值「极端消失判定」新阶段持续验证 = 9 条)
  • §5 趋势:从 24 条扩为 29 条(+ harness-native 训练基础设施 proxy 拦截范式转折 + isolation-as-first-class 边界中心 survey anchor + agent 自我改进 bi-level discovery/verification + frontier lab 4 栖验证 评测/系统卡/评论/红队 + 商业 Harness vs 学术 Harness 二分立标 = 5 条)
  • §6 必读清单:从 114 条扩为 131 条(+ arXiv:2607.21557 OpenForgeRL + arXiv:2607.12406 Isolation-as-First-Class + arXiv:2607.21461 AREX + arXiv:2607.20709 NVIDIA OO Agents + arXiv:2607.20911 Tencent WorkBuddy + SkillOpt + Memora + δ-mem + Anthropic Opus 5 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund + Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + Klarna + Compounding Error = 8 件 arXiv + 9 件非 arXiv = 17 件新必读)

6. 本主题与邻接主题的边界提示

  • agent.md(通用 agent 主题页)分工:arXiv:2607.21557 OpenForgeRL + arXiv:2607.12406 Isolation-as-First-Class + arXiv:2607.21461 AREX + Microsoft MAF Harness + Klarna + Compounding Error + MSR SkillOpt + Memora + δ-mem 9 件 跨「通用 agent」+「编码 agent」双重立标 —— spark 7-25 agent-e1prep §增量 1/2/3/4/5/6/7/8 同源;本主题页仅沿用 9 件主题窗内强相关内容(OpenForgeRL + Isolation-as-First-Class + AREX + MAF Harness + Klarna + Compounding Error + MSR SkillOpt + Memora + δ-mem),不重述 spark 主题组 A
  • risk.md(风险主题页)分工:arXiv:2607.12406 Isolation-as-First-Class + OpenForgeRL 反身性 + Anthropic Opus 5「prompt injection 最难」 评论 + Self-State Attacks + AgentCI MCP 安全 + arXiv:2607.20064v2 PRO-LONG「不设 memory = 不存在 memory 攻击面」 由 risk.md / 主题页双向 reference;flyp 7-25 risk-e1prep §1 已建议 §2.18 元层反身性 #19「多租户 LLM Serving 内部攻击面」+ Anthropic Petri 14 模型 baseline 复现的工程化路径;本主题页主要在 §2.5 引用 Isolation-as-First-Class 第 11 阶 + OpenForgeRL 训练基础设施反身性 + Opus 5 prompt injection 评论 + AgentCI MCP 安全 工业级风险立标 + PRO-LONG 范式逆袭
  • llm-infra.md(推理基础设施主题页)分工:arXiv:2607.21557 OpenForgeRL proxy + Kubernetes orchestrator + wall-clock timeout + 6 harness × 6 基准 + ABot-World-0 arXiv:2607.19191 单 GPU 无限交互 = 「训练 + 推理基础设施」 双层栈合流 + arXiv:2607.21051 Sample-Efficient + arXiv:2607.04763 ReOPD + vLLM v0.25.1 4 Bug + SGLang v0.5.15.post1 5 Bug + SkewAdam(arXiv:2607.19058)+ Google Tunix + Cursor Router + OpenRouter Caching 由 llm-infra 主立,本主题在 §2.5 引「OpenForgeRL harness-native 训练基础设施 + ABot-World-0 单 GPU 无限交互 双层栈合流」+ §2.4 引「编码 Agent 经验蒸馏双轨」+ §2.6 引「编码 Agent 推理基础设施 9 Bug 矩阵」
  • multimodal.md(多模态主题页)分工:flyp 7-25 1000-rss-cameron-wolfe「Agentic World Models + Agentic RL + Agent 评估」 三连 + ABot-World-0 + flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」 Substack 思想线索 + flyp 7-23 0950 ABot-World-0 + flyp 7-24 09:50 Self Gradient Forcing + Anchor-Align 多模态与本主题「世界模型推理 + 编码 Agent 上下文管理」同源;本主题仅在 §1 现状全景 「第十二 / 十三阈值 = OpenForgeRL + Isolation-as-First-Class + AREX + Anthropic Opus 5 + 商业 Harness」 旁证引用 flyp 7-25 1000-rss-cameron-wolfe 三连 + ABot-World-0 一行
  • evaluation.md(评测方法学主题页)分工:Tencent WorkBuddy Bench(arXiv:2607.20911) + LLMs Get Lost in Evolving User Intent(arXiv:2607.20734) + FinanceComplexQA(arXiv:2607.19238) + Sample-Efficient + ReOPD + Beyond Relevance-Centric + AREX + Compounding Error 8 件 评测方法学跨主题页 —— evaluation.md 主立评测方法学通用部分;本主题在 §2.3 引「Tencent WorkBuddy 抗污染基准」 + §2.6 引「LLMs Get Lost 多轮意图演化跟踪评测」 + 「金融 Agentic Reasoning 基准」 + 「Compounding Error 0.85^10≈0.197」 + 「AREX recursive self-improvement deep research」
  • inference.md(推理基础设施主题页)分工:OpenForgeRL + ABot-World-0 + Sample-Efficient + ReOPD + KV Cache 优化 + Cursor Router + Kimi K3(896 experts)+ SkewAdam(MoE 优化器)+ DeepSearch-World(86▲ 票沿用) 推理工程跨主题页;本主题在 §2.5 引「OpenForgeRL + ABot-World-0 训练 + 推理基础设施双层栈」+ §2.4 引「Sample-Efficient + ReOPD 双轨范式」+ 「编码 Agent 经验蒸馏」
  • ai-industry.md(AI 行业主题页)分工:Anthropic Opus 5 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund = frontier lab 模型本体首位立标 + 评测 → 系统卡 → 评论 → 红队 4 栖验证第 1 例 + 资本 + 研究 + 模型 + 物理 agent 四线齐扩 由 ai-industry 主立,本主题在 §1 引「Anthropic Opus 5 立标首位」+ §2.6 引「评测 → 系统卡 → 评论 → 红队 4 栖验证 第 1 例」

7. 补充:与今晚活文档(2026-07-25 v34 第八轮接力窗口)的本主题边际贡献

7.1 边际贡献 vs 昨晚活文档(2026-07-24 v34 第七轮已饱和 + 7-24 E1 14 件立标)

  • 沿用项目:Kimi K3 + FlashRT + SWE-Pruner Pro + Cost-Aware + Behavioral Privacy + 4 RCE CVE + IBM Routing + Microsoft Foundry + Harness Survey + OpenDev + Production Playbook 12-pattern + Kimi Code CLI + v34 §2.1 第八阶段 6 件 + v34 §2.1 第九阶段 Harness-as-Agent 7 件 + v34 §2.3 评测第 7 阶五联 + v34 §2.5 第 9 阶 + Hy3 1bit + Hermes-Agent + Graphify + Self-Harness 占位 + DeerFlow v2.0 + HACO + AgentDebugX + lopopolo + Sebastian Raschka + Lilian Weng + Anthropic J-space + Cursor Router + OpenRouter Caching + Google Tunix + Kimi K3 7-27 开权前夜生态补漏 7 件 + vLLM/SGLang 9 Bug 矩阵 + SkewAdam + PRO-LONG + Agentic Context Management + Sample-Efficient + ReOPD + LLMs Get Lost + FinanceComplexQA + Beyond Relevance-Centric + SeerGuard + AgentCI MCP 安全 + AI Workflow Store + Context Engineering + GitHub Agentic Workflows 6 层 + Block Goose = 44 件
  • 新立项目(本轮 7-25):OpenForgeRL + Isolation-as-First-Class + AREX + Anthropic Opus 5 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund + Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + 文心快码/Microsoft MAF/AWS Blocks 三家对比 + Klarna 2/3 / $60M / 853 FTE + Compounding Error 0.85^10≈0.197 + Gartner 2027 40% + NVIDIA OO Agents + Tencent WorkBuddy + MSR SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt + δ-mem + ABot-World-0 单 GPU 无限交互 + Lilian Weng 7-25「自我改进 Harness 工程」 续立 + Cameron Wolfe 7-25 agentic 三连 4 件主线 + 9 件邻接补全 = 25 件新立候选(其中 5 件 = §2.5 第 84 节点 + §2.5 第 11 阶 + §2.5 第 85 节点 + §1.41 Opus 5 首位 + §1.33c 商业 Harness + §2.6 段末追加 5 段 + §2.4 SkillOpt/Memora/δ-mem + §6 必读清单扩为 131 条)

7.2 给今晚 v34 第八轮接力的优先级排序

  1. 【P0】增量 1:OpenForgeRL(arXiv:2607.21557 · Tom 7-25 0840 ⭐ #2 + Tom 7-25 1440 v2 高价值 #2 + Tom 7-25 2040 高价值 #3 + flyp 7-25 1036 §三 精读论文 B 35KB 主稿 · paper_cards/585 已立) = 最大新立增量 + 首个支持 harness-based Agent 端到端训练的开源框架 + proxy 拦截 + Kubernetes orchestrator + 6 harness × 6 基准实证 + 训练 + 推理基础设施双层栈合流(ABot-World-0)+ §2.5 第 84 节点候选
  2. 【P0】增量 2:Isolation-as-First-Class(arXiv:2607.12406 · flyp 7-25 1036 §二 精读论文 A 35KB 主稿 + spark 7-25 agent-e1prep §增量 3 P0) = 5 边界 + isolation-by-construction 4 原则 + ~150 篇文献 + flyP 安全主题页 anchor + §2.5 第 11 阶候选
  3. 【P0】增量 3:AREX(arXiv:2607.21461 · HF Daily 7-25 #1 117▲ 当日 #1 · BAAI · 未建卡) = 递归自我改进 deep research agent + bi-level discovery/verification 不对称 + §2.5 第 85 节点候选
  4. 【P0】增量 4:Anthropic Claude Opus 5 7-24 evening 正式发布 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund = frontier lab「模型公司」本体节奏首位立标 + 评测 → 系统卡 → 评论 → 红队 4 栖验证 第 1 例 + §1.41 横切 60-66 升 Opus 5 首位
  5. 【P0】增量 5:Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + 文心快码/Microsoft MAF/AWS Blocks + Klarna + Compounding Error 0.85^10≈0.197 + Gartner 2027 40% = 商业 Harness vs 学术 Harness 二分立标 + 企业级 Multi-Agent 生产案例 + 量化数字立标 + §1.33c 量化补全 + §2.4 多智能体协作 邻接 + §2.6 评测邻接
  6. 【P1】增量 6:NVIDIA-labs OO Agents(arXiv:2607.20709 · HF Daily 7-25 #11 19▲)+ Tencent WorkBuddy Bench(arXiv:2607.20911 · HF Daily 7-25 #12 18▲) = HF Daily 7-25 头条 立标合流 + 段末追加 + §1.41 主线 ① 第二十四节点候选
  7. 【P1】增量 7:MSR SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖合流 = Agent 自我改进范式从静态 prompt → Skill 训练参数 → 谐波记忆表示 + §2.4 邻接补全 第 9-10 件候选
  8. 【P1】增量 8:δ-mem(AlphaSignal Substack) = RAG / Long Context 之外的第三种 Agent Memory 方案 + 8×8 矩阵 steering attention + §2.4 邻接补全 第 11 件候选
  9. 【P2】OpenForgeRL + ABot-World-0(arXiv:2607.19191 · HF Daily 7-24 #1 200▲)「训练 + 推理基础设施」双层栈合流 = §1.33c + §2.5 决策 = 升 ABot-World-0 第 86 节点 + OpenForgeRL 第 84 节点 双立标
  10. 【P2】Anthropic Opus 5「评测 → 系统卡 → 评论 → 红队」 4 栖验证第 1 例 + Boris Cherny 评论出处 + Opus 5 vs Fable 5 关系 待核 = §1.41 升 Opus 5 首位立标 + §4.1 开放问题 198 候选新增

7.3 给今晚活文档接手时的语言风格提示

  • Wave4 E1 第八轮在 7-25 04:20 已升格到相对饱和(11 阈值 + 9 阶段 + 21 行 + 25 共识 + 27 争议 + 36 开放 + 24 趋势 + 114 必读) —— 本场新立增量克制使用「立标」「SOTA」「重大立标」等高强度词,优先用「7-25 候选」「v34 第八轮升格辅助」「沿用 + 增量」「补漏」「§2.5 第 84 节点」「§2.5 第 11 阶」「§2.5 第 85 节点」「§1.41 Opus 5 首位」「§1.33c 商业 Harness」等温和词
  • OpenForgeRL + Isolation-as-First-Class + AREX + Anthropic Opus 5 + MAF Harness + Klarna + Compounding Error 7 件不全部平均用力,优先级排序:OpenForgeRL = P0(给 §2.5 第 84 节点独立段 + 「训练 + 推理基础设施」双层栈合流) + Isolation-as-First-Class = P0(给 §2.5 第 11 阶独立段 + 双向 reference risk.md) + AREX = P0(给 §2.5 第 85 节点独立段) + Anthropic Opus 5 = P0(给 §1.41 横切 60-66 升 Opus 5 首位 + §2.6 段末追加) + MAF Harness + Klarna + Compounding Error = P0(给 §1.33c 商业 Harness 二分立标 + §2.4 企业级 Multi-Agent + §2.6 评测邻接) + NVIDIA OO Agents + Tencent WorkBuddy = P1(给 §2.6 段末追加 + §1.41 主线 ①) + MSR SkillOpt + Memora + δ-mem = P1(给 §2.4 邻接补全)
  • Anthropic J-space:与 risk.md / 主题组 A 同源,本主题页主要在 §2.1 第八阶段第八段引用,不重述细节(细节在 spark agent-e1prep / Stephen llm-application-e1prep)
  • flyp 7-25 1000-rss-cameron-wolfe「Agentic World Models + Agentic RL + Agent 评估」 三连:与 multimodal.md 同源,本主题页主要在 §1 现状全景 「第十二 / 十三阈值 = OpenForgeRL + Isolation-as-First-Class + AREX + Anthropic Opus 5 + 商业 Harness」 旁证引用 flyp 7-25 1000-rss-cameron-wolfe 三连 一行,不重述细节(细节在 flyp 7-25 1000-rss-cameron-wolfe 原文 + flyp multimodal-e1prep)
  • AgentDebugX / DataFlow-Harness HF Daily 7-25 沿用升级补全:与 v25 / v26 / v27 / v28 / v34 沿用,侧重「沿用升级 + HF Daily 票数证据更新」聚合表达,不平均着力

7.4 给 Stephen / Tom / Jay / Spark 下半场协调棒的建议接口

  • stephen 7-25 1245 noon 协调棒 已与本主题增量 1(OpenForgeRL)+ 增量 2(Isolation-as-First-Class)+ 增量 3(AREX)+ 增量 4(Anthropic Opus 5)+ 增量 5(MAF Harness)+ 增量 6(NVIDIA OO Agents + Tencent WorkBuddy)+ 增量 7(MSR 五栖)同源,本场 E1 与 stephen 1245 完全对接,不需要重述
  • stephen 7-25 2245 evening 协调棒(已阅,与本主题增量 1-8 8 件主线增量同源,本场 E1 引用即可)
  • stephen 7-25 1003-news-anthropic-news + 1005-news-yt-anthropic + 0910-news-x-vip-radar + 1002-news-openai-news + 1003-news-bens-bites + 1003-news-deepmind-news + 1003-news-google-ai + 1003-news-hf-blog + 1003-news-tldr-ai + 1005-news-yt-deepmind + 1005-news-yt-openai = 11 份 news 通稿——Anthropic Opus 5 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund + Claude 7-14 X 引语 + DeepMind 5 件 + OpenAI 5 件 + HF Daily 7-25 头条 5 件 = frontier lab 7-25 全栈收敛,本场 E1 引用即可
  • Tom 7-25 0840 agent-rag-longcontext-radar(8 候选 3 高价值 Agentic Context Management + OpenForgeRL + Sample-Efficient + 5 一般 ReOPD / FinanceComplexQA / K12-KGraph / SANA-Video 2.0 / Self-Supervised Learning)— 与本主题增量 1(OpenForgeRL)+ 增量 2(Agentic Context Management)+ 增量 3(Sample-Efficient)同源,本场 E1 引用即可
  • Tom 7-25 1440 v2 重写版(8 + 4 = 12 候选 7 高价值 + 5 一般 + 1 Substack + v3 强制承接 7-24 HF Daily 主榜 4 票)— 与本主题增量 1(OpenForgeRL 高价值 #2)+ 增量 2(Agentic Context Management 高价值 #3)+ 增量 3(Sample-Efficient 高价值 #4)+ 增量 6(NVIDIA OO Agents + Tencent WorkBuddy 邻接)+ 增量 7(Sample-Efficient 双栖)+ 增量 8(δ-mem)同源,本场 E1 引用即可
  • Tom 7-25 2040 radar(8 候选 3 高价值 Agentic Context Management + δ-mem + OpenForgeRL + 5 一般 + 1 Substack)— 与本主题增量 1(OpenForgeRL 高价值 #3)+ 增量 2(Agentic Context Management 高价值 #1)+ 增量 7(δ-mem 高价值 #2)+ 增量 6(NVIDIA OO Agents + Tencent WorkBuddy 邻接)同源,本场 E1 引用即可
  • Tom 7-25 0900 HF Daily(15 篇:AREX 117▲ + SLAI T-Rex 56▲ + ReferTrack 44▲ + 视觉对比自蒸馏 41▲ + K12-KGraph 40▲ + Subliminal Clocks 38▲ + Show Don't Tell 34▲ + Self Gradient Forcing 30▲ + 超越相关性中心 27▲ + ActiveVision 24▲ + NVIDIA OO Agents 19▲ + Tencent WorkBuddy 18▲ + Color Pass-Through 17▲ + SANA-Video 2.0 15▲ + LLM 演化用户意图 15▲)— 与本主题增量 3(AREX 票数)+ 增量 6(NVIDIA OO Agents 票数 + Tencent WorkBuddy 票数)+ 沿用升级(LLMs Get Lost 票数)+ 邻接(Beyond Relevance-Centric 票数)同源,本场 E1 引用即可
  • Tom 7-25 0852 rag-e1prep + 1004 rss-yt-lex-fridman + 1004 rss-yt-yannic-kilcher + 0841 latest-candidates(RAG E1 + YT RSS)— 与本主题编码 Agent 邻接,本场 E1 引用即可
  • jay 7-25 0820 csdn-langgraph + 0940 csdn-llm-rag-agent-vecdb + 1055 engineering-filter + 1105 db-backend-cloudnative-inference-briefing + 1105 substack-agents-production-failure-a2a-cua + 1123 engineering-e1prep + 1140 news-x-tech-radar + 1222 csdn-supplement-agentic-rag-mcp-finetune = 8 件 + 7-24 evening 8 件 + 1000-1006 RSS 11 件 = 27 件 7-24 ~ 7-25)— 与本主题增量 5(MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + Klarna + Compounding Error + 文心快码/Microsoft MAF/AWS Blocks 对比)同源,本场 E1 引用即可
  • jay 7-25 1000-rss-simon-willison + 1001-rss-lilian-weng + 1002-rss-msr-blog + 1000-rss-raschka + 1000-rss-nathan-benaich + 1000-rss-bytebytego + 1001-rss-cool-papers + 1001-rss-cool-papers-ir + 1002-rss-import-ai + 1005-rss-yt-fireship = 10 件 RSS(Anthropic Opus 5 + Boris Cherny 评论 + Lilian Weng 7-25「自我改进 Harness 工程」 + MSR SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt + Raschka 推理 effort + nathan-benaich + bytebytego + cool-papers + import-ai + yt-fireship)— 与本主题增量 4(Anthropic Opus 5)+ 增量 7(MSR 五栖)+ 增量 8(δ-mem 邻接)同源,本场 E1 引用即可
  • jay 7-25 1055 engineering-filter Agent Harness 主线 4 件保留 + 4 件放弃(MAF Harness + SocialCrawl Agent Frameworks/Klarna + Future AGI Eval + AIThinkerLab RAG 8 Patterns)— 与本主题增量 5(MAF Harness + Klarna 量化数字立标)同源,本场 E1 引用即可
  • flyp 7-25 1036 周六精读 35KB 主稿(Isolation-as-First-Class 论文 A + OpenForgeRL 论文 B + Agentic Context Management 论文 C 三连立标)— 与本主题增量 1(OpenForgeRL)+ 增量 2(Isolation-as-First-Class)+ 沿用升级(Agentic Context Management)同源,本场 E1 引用即可
  • flyp 7-25 1000-rss-cameron-wolfe + 1002-rss-interconnects + 1004-rss-yt-ai-explained + 1004-rss-yt-two-minute-papers + 0944 multimodal-e1prep + 0950 RRB-intra-query-attention-dilution-critical-read + agentrx-multimodal-clinical-critical-read + 2259 multimodal-e1prep + 2259 risk-e1prep = 8 件 RSS + critical-read(Cameron Wolfe agentic 三连 + RRB + AgentRx 临床 multimodal + Risk E1 + Multimodal E1)— 与本主题编码 Agent 邻接(World Models + Agent 评估),本场 E1 引用即可
  • flyp 7-25 risk-e1prep §1(OpenForgeRL §1 反身性 + Isolation §2.18 元层反身性 #19 「多租户 LLM Serving 内部攻击面」 + Anthropic Petri 14 模型 baseline 复现的工程化路径)— 与本主题增量 1(OpenForgeRL)+ 增量 2(Isolation-as-First-Class 双向 reference risk.md)同源,本场 E1 引用即可
  • spark 7-25 1001 rss-gradient-flow + 1002 rss-chip-huyen + 1004 rss-yt-3blue1brown + 1330 agent-e1prep(GLM 5.2 + Kimi K3 + Gemini 3.6 Flash + 开源模型吸纳大部分 AI 支出 + 中国 AI 出口管制 + RL 基建下一层 = 5 篇与 v29/v30 比对未变 + Agent 范式转折 5 P0 + 5 P1)— 与本主题增量 1(OpenForgeRL 增量 2 P0)+ 增量 2(Isolation-as-First-Class 增量 3 P0)+ 增量 3(AREX 增量 7 P1 旁证)+ 增量 4(Anthropic Opus 5 增量 4 P0)+ 增量 5(MAF Harness 增量 5 P0)+ 增量 6(NVIDIA OO + Tencent WorkBuddy 增量 6 P1 邻接)+ 增量 7(MSR 五栖 增量 6 P1 旁证)同源,本场 E1 引用即可
  • paper_cards 7-23 ~ 7-25 新卡 564~585 22 件抽样(重点 agent 主分类:564-2607.21503 Agentic Context Management + 565-2607.21072 Show Don't Tell + 567-2607.21051 Sample-Efficient + 569-2607.20734 LLMs Get Lost + 572-2605.09635 K12-KGraph 副 engineering + 573-2607.21576 Self-Supervised Learning + 574-2607.21553 SANA-Video 2.0 + 575-2607.19238 FinanceComplexQA + 576-2607.04763 ReOPD + 585-2607.21557 OpenForgeRL + 541-2607.18603 AutoIndex(已立, 6 日未建 🔴) + 543-2607.20346 IteraSim RAG(已立) + 551-2607.19865 DocOps(已立))— 本场 E1 引用即可
  • knowledge/coding-agents.md v34 沿用(11 阈值 + 9 阶段 + 21 行 + 25 共识 + 27 争议 + 36 开放 + 24 趋势 + 114 必读 + 三路线对立 + Agent 经验蒸馏双轨 + 第 10 阶 + §2.6 14 件)— 全部沿用不重述

7.5 收官语

  • Wave4 E1 第八轮(7-25 evening ~ 7-26 04:20):预计将固化 4 件 P0 主线 + 1 件 P0 三联立标 + 3 件 P1 旁证 = 8 件立标 = 13 阈值(11 + 2 = 13 + 三联)+ 9 阶段(沿用)+ 21 行 + 25 共识(沿用)+ 27 争议(沿用)+ 36 开放(沿用)+ 24 趋势(沿用)+ 114 必读(沿用) → v34 第八轮预计 = 13 阈值 + 9 阶段 + 22 行 + 34 共识 + 29 争议 + 45 开放 + 29 趋势 + 131 必读 = 八维合并成熟
  • 本场 E1(2026-07-25 23:20)为今晚活文档接手准备稿,核心交付:8 件立标候选(4 P0 主线 + 1 P0 三联 + 3 P1 旁证)+ 12 件矛盾/待核 + 12 件 arXiv 号(5 件新增 + 6 件沿用升级 + 1 件邻接 ABot-World-0)+ 9 件非 arXiv 旁证 + 25 件新立候选**——v34 第八轮待消化

FlyP · 2026-07-25 23:20 · coding-agents E1 预消化简报 · flyP cron 7a0c0a42-eb2e-4bcd-af74-634628039865 触发 · 承接 v34 11 阈值 + 上下文管理三路线对立 + Agent 经验蒸馏双轨 + 第 10 阶 · 4 P0 + 1 P0 三联 + 3 P1 = 8 件 · 不重写 coding-agents.md