coding-agents · E1 预消化简报(2026-07-26)
作者:flyP(🀄) 触发:cron
7a0c0a42-eb2e-4bcd-af74-634628039865· 研究知识库 E1 预消化 · coding-agents · 每天 23:20 主题:coding-agents(活文档/shared/research-kb/organized/knowledge/coding-agents.md当前已固化到 v34 Wave4 E1 第七轮 7-25 04:20:11 阈值 + §2.1 Harness 学术化 9 阶段 + §2.3 评测 21 行 + §2.4 记忆/长视野 8 件 + §2.4 后训练 Agentic RL 训练栈 13 件 + §2.5 安全契约 7 维 + 第 9 阶 + §2.5 第 10 阶 + §2.6 CLI/IDE/工业化 14 件 + 共识 25 / 争议 27 / 开放问题 36 / 趋势 24 / 必读 114) 窗口:近 2 天(2026-07-24 ~ 2026-07-26)重点扫描 inbox/{flyp,jay,spark,tom,stephen} + paper_cards 7-24 ~ 7-26 新卡(564~585)+ HF Daily 7-25 ~ 7-26 基线对照:昨晚 7-25 E1 预消化立标 = 8 件(4 P0 主线 + 1 P0 三联 + 3 P1 旁证)= OpenForgeRL + Isolation-as-First-Class + AREX + Anthropic Opus 5 + Microsoft MAF Harness + Klarna + Compounding Error + NVIDIA OO Agents + Tencent WorkBuddy + MSR SkillOpt + Memora + δ-mem,全部已并入 v34 第七轮;本场定位 = 「v34 第七轮 11 阈值饱和下,承接 7-25 18:00 ~ 7-26 22:00 共 28 小时内未捕获的 7-26 当日新立标 / 沿用升级 / 平台层事件 / R29 反方记录 = v34 第八轮(7-26 evening ~ 7-27 04:20)接力准备稿」
0. 综述判断(给今晚活文档接手时一眼看到)
- v34 第七轮 7-25 04:20 已固化 11 阈值 + 上下文管理三路线对立 + Agent 经验蒸馏双轨 + 第 10 阶 + 工业 MCP 安全立标 = 饱和形态;7-25 E1 8 件新立标的边际增量已被完整吸收。
- 本场定位:v34 第八轮接力窗口(7-26 evening ~ 7-27 04:20)饱和下,边际增量以"反方记录 + 平台层事件 + 沿用升级 + 票数续立/翻倍 + 工程化栈 6 件 GitHub Trending + AI Engineer 量化画像 + OpenClaw 数据传染警示"形态呈现。新增 arXiv 立标 0 件(OpenForgeRL + AREX + ACM + ReOPD 等 4 件已立);新立 arXiv 候选 = 3 件仍处 HF Daily 翻倍期(AREX 117▲ + Beyond Relevance-Centric 28▲ + LLMs Get Lost 18▲ 续立)。
- 本场净新增量性质:
- Anthropic 7-22 ~ 7-26 平台层 agent 编排双栖立标:Claude Sonnet 5(更"代理化的 Sonnet")+ Claude Developer Platform Managed Agents effort 设置(webhook + 记忆存储事件 + 会话播种事件流更新)= §1 frontier lab 全栈 2026-Q3 平台层 agent 编排 5 件合流 的 §1.45 第 7 件 = frontier model 立标密度 7 天内最高一周(7-16 ~ 7-26)。
- ReOPD critical-read v2 立标级候选(flyp 7-26 22:50 · B 级 · 实战 recipe + 立标级候选 3.4/5 · 7-28 截止前补 4 项必做)= v34 §2.4 后训练 Agentic RL 训练栈 第 14 件候选 · 「prefix trap」概念 vs OpenForgeRL「harness-native 训练闭环」形成"训练数据复用 + 训练栈复用"二联对照 = 与 Sample-Efficient + ReOPD 双轨范式 + OpenForgeRL 三栖合流。
- Agentic Context Management v2 critical-read 监控清单 + 反方 7 条(flyp 7-26 15:50 · B 级 · 监控清单 + 实战 recipe + 立标级候选 3.6/5 · 7-30 截止前补 4 项必做)= v34 §2.5 第 11 阶 + §2.4 邻接 · 「Maximem Synap SaaS 营销 vs 学术实证边界 + 多模态缺口 + head-to-head 缺失 + §6 配置含糊」4 项反方硬标签 + 沿用 risk.md R29 §2.1 C 类 = ACM 立标级候选首次反方记录固化。
- AAAI 2026 Subramanian et al.「Keyword search is all you need」Agentic 搜索替代向量检索(jay 7-26 1106 + 1735 briefing · paper 未精读 · GitHub 链接待补)= §2.6 多模态 / IDE / CLI / 工具退化 段末追加(RAG 范式转折新立标候选)+ §1.33c Harness 层 旁证 + §3.1 共识候选 121「Agentic 搜索工具调用 = 向量检索替代方案 · 主流 Agent 厂商已采纳」。
- GitHub Trending 6 件工程化栈 + 1000+ JD 量化 AI Engineer 画像(jay 7-26 0935 + 1123 engineering-e1prep · alibaba/open-code-review + citrolabs/ego-lite + andrewyng/aisuite + deepagents-ai/agent-backend + RyanCodrai/turbovec + AI Engineer 画像 Python 82.5% / RAG 35.9% / LangChain 18.8% / LangGraph 8.0% / LlamaIndex 5.8% / K8s 29.1% / AWS 40.1%)= §1.33c 横切 53c AI Agents Stack 2026 Harness 层 商业开源 SDK 立标补全 第 6-11 件。
- Claude Opus 5 评论层 7-25 ~ 7-26 6 媒体 48h 持续长尾(stephen 7-26 ai-industry §E 增量 6 + spark 7-26 agent-e1prep §增量 1 · Two Minute Papers + AI Explained + Ben's Bites + Gradient Flow + Simon Willison + Google news)= v34 §2.103 段尾"评论层长尾 7-25 ~ 7-26 6 媒体续立"标注 + §3.1 共识 #112 续立。
- HF Daily 7-26 票数续立/翻倍:AREX 117▲ 续立 + SLAI T-Rex 56▲ + K12-KGraph 55▲ + ReferTrack 49▲ + 视觉对比自蒸馏 41▲ 无变化 + Show Don't Tell 35▲ + Self Gradient Forcing 30▲ + Beyond Relevance-Centric 28▲ 续立(从 7-25 27▲ 翻倍) + ActiveVision 24▲ + NVIDIA OO Agents 22▲(从 7-25 19▲ 续立) + SANA-Video 2.0 21▲ + Tencent WorkBuddy 20▲(从 7-25 18▲ 续立) + Color Pass-Through 18▲ + LLMs Get Lost 18▲(从 7-25 15▲ 续立) = HF Daily 7-26 主榜 4 件 coding-agents 邻接条目票数翻倍/续立。
- OpenClaw 210k stars vs GitHub 12,981 stars 数据传染警示(jay 7-26 1123 engineering-e1prep §警示 1)= v34 §3.2 争议 候选新增 30「OpenClaw Star 数版本混淆 · 210k 可能是累计或跨平台合计 vs GitHub 主仓当日数字」。
- 本日谨慎提醒:
- AutoIndex arXiv:2607.18603 7-26 仍未建卡(spark 7-26 agent-e1prep + stephen 7-26 1245 §3.2 已标 🔴 AutoIndex 7 日未建卡 = pipeline 漏斗节点);v34 第八轮待补建卡或决断复用
- Anthropic Claude Opus 5 vs Claude Fable 5 vs Claude Sonnet 5 关系待核(stephen 7-26 ai-industry §2.x + spark 7-26 agent-e1prep §A 增量 1 + spark 7-26 agent-e1prep §增量 1):三模型矩阵形态分化(Opus 5 = 中等/bounded tasks · Fable 5 = 长时自主(数小时-数天)· Sonnet 5 = 更代理化 / 工具使用强)待 Anthropic 官网模型矩阵核证;v34 §4.1 开放问题 198 候选新增「Anthropic 7-22 ~ 7-26 模型矩阵 head-to-head」(spark 已立 P3 #18)
- Claude Sonnet 5 "代理化"具体定义 + 工具使用相对 4.6 提升幅度数字 + Sonnet 5 vs Opus 5 / Sonnet 5 vs Fable 5 head-to-head 评测待核(stephen 7-26 ai-industry §2.x 矛盾 #1 + spark 7-26 agent-e1prep §2.1 矛盾):Anthropic 官方未明确说明
- Managed Agents effort 精度 vs OpenAI Reasoning effort 设置 vs Google Gemini 3.6 Flash effort head-to-head 待核(stephen 7-26 ai-industry §2.x 矛盾 #2):三家 effort 编排框架对比未给
- Boris Cherny「Opus 5 是我们迄今为止最不易被 prompt 注入的模型」 vs Opus 5 PI evals / red team 完整版本 待核(stephen 7-26 ai-industry §2.x 矛盾 #3 + jay 7-26 1000-rss-simon-willison 引语):v34 §4.1 开放问题 198 候选
- AAAI 2026 Subramanian 论文原文 + GitHub 链接 + 6 数据集实验方法 + 与 v34 §1.43 Why Agents Fail + v34 §2.6 Agent 生产失败三模式 + Compounding Error 0.85^10≈0.197 + Gartner 2027 40% 废弃预测 互补关系 待核(jay 7-26 1106 rag-agent-llm-systems-briefing · 论文原文未精读 + GitHub 链接待补 + spark 7-26 agent-e1prep §2.8 矛盾):v34 §4.1 开放问题 200 候选
- OpenClaw 210k stars(沿用 v34) vs GitHub 12,981 stars(2026-07-26 trending 实时数据) 数据传染/版本混淆(jay 7-26 1123 engineering-e1prep §警示 1):v34 §3.2 争议 候选新增 30
- Microsoft Agent Framework 1.0 发布日期(2026-04-03)未独立核验 vs Alice Labs 博客日期 vs 实际 GitHub release tag 差(jay 7-26 T1735 briefing #2):v34 §4.1 开放问题 199 候选
- Microsoft MAF Harness GitHub samples 实际 API 待核(jay 7-25 1055 engineering-filter 沿用):v34 §4.1 开放问题 199 候选
- Klarna 一手财报数据 vs SocialCrawl.ai 第三方汇总(jay 7-25 1105 substack 沿用):v34 §4.1 开放问题 199 候选
- arXiv:2607.12406 Isolation-as-First-Class paper_card 仍未建卡(flyp 7-26 15:50 ACM critical-read §0 元层五问 + spark 7-26 agent-e1prep §2.x):v34 §2.5 第 11 阶候选 + risk.md R29 §2.1 D 类 = 双向 reference 但 paper_card 缺 = pipeline 漏斗节点
- arXiv:2607.21461 AREX paper_card 仍未建卡(stephen 7-26 1245 §3.2 已标 🔴 AREX 7-25 HF Daily #1 117▲ 当日 #1 但 7-26 paper_card 未补):v34 §2.5 第 85 节点候选 = pipeline 漏斗节点
1. 增量条目(2 件 P0 主线 + 4 件 P0 沿用升级 + 3 件 P1 旁证,按"建议归入节"分组)
增量 1 · ⭐⭐⭐⭐⭐ · Anthropic Claude Sonnet 5(更"代理化的 Sonnet")+ Claude Developer Platform Managed Agents effort 设置 + Claude Opus 5 评论层 7-25 ~ 7-26 6 媒体 48h 持续长尾 = frontier lab「模型公司」本体节奏 7-22 ~ 7-26 平台层 agent 编排双栖立标
| 字段 | 内容 |
|---|---|
| 来源 | inbox/stephen/2026-07-26-ai-industry-e1prep.md §A 增量 1 + inbox/stephen/2026-07-26-0910-news-x-vip-radar.md(releasebot.io 报道 7/22 前后)+ inbox/stephen/2026-07-26-1002-news-anthropic-news.md(5 URL Opus 5 系统卡 + 推出 Claude Opus 5 + Economic Futures Research Fund 研究议程 + Anthropic 经济指数连接器 + 再向 Public First Action 捐赠 2000 万美元)+ inbox/jay/2026-07-26-1000-rss-simon-willison.md(3 URL 含 7-25 Boris Cherny 引语 + 7-24 推出 Claude Opus 5)+ inbox/stephen/2026-07-26-1003-news-yt-anthropic.md(5 视频:关于 Claude 思考方式的不同层次 + 推出 Claude Fable 5 + 将 Claude 思维转化为语言 + Project Glasswing 保护全球软件安全 + 当 AI 表现出情感时)+ inbox/stephen/2026-07-26-1245-stephen-coordination-check-noon.md §1.1 + inbox/spark/2026-07-26-agent-e1prep.md §增量 1 + inbox/flyp/2026-07-26-risk-e1prep.md §0 + paper_card 未建 |
| arXiv 号 | 无(Anthropic 平台层文档 + 6 媒体续立非 arXiv) |
| 一句话 | Claude Sonnet 5 = "更代理化" 的 Sonnet · 推理 / 工具使用 / 编码 / 知识工作相对 4.6 大幅提升 + Claude Enterprise 更细粒度的使用分析与模型授权管理 + Claude Developer Platform Managed Agents effort 设置(7-22 · webhook 覆盖环境 / 记忆存储事件 + 会话播种事件流更新与版本检查)+ Boris Cherny 7-25「Opus 5 是我们迄今为止最不易被 prompt 注入的模型」 评论 + Two Minute Papers 7-26「Claude 揭示 AI 最大问题」 + AI Explained 7-26「Claude Fable 被封禁」 +「Claude Fable 5 完整 319 页拆解」 + Ben's Bites 7-25 ~ 7-26 Opus 5 头条 + Gradient Flow 三款前沿级模型集中观察 = Anthropic 2026-Q3 平台层 + 代理化扩展 + 评论层 48h 长尾 三栖立标 + 与 OpenAI Reasoning effort 设置 + Google Gemini 3.6 Flash effort 三者形成 effort 编排竞速 |
| v34 脉络关系 | 与 v34 §1 frontier lab 全栈 + v34 §1.41 横切 60-66 v23 七件主轴(Claude Fable 5 7-22 立标 + Kimi K3 + Qwen 3.8 + Gemini 3.6 Flash 7-16 ~ 7-22 立标密度 5 个 frontier model + 7-24 Opus 5 立标首位)+ v34 §1.45 五向合流 + v34 §2.6 评测、可靠性与对抗 + v34 §1.34b Anthropic J-space 认知科学锚点 同源;v34 §1.41 横切 60-66 v23 七件主轴 第 7 件(Anthropic 7-22 ~ 7-26 平台层 agent 编排)+ v34 §2.103 段尾"评论层长尾 7-25 ~ 7-26 6 媒体续立"标注 + v34 §3.1 共识 #112 续立:1) Claude Sonnet 5 = "更代理化" 的 Sonnet + Anthropic 7-22 ~ 7-26 平台层 agent 编排第 1 立标(继 Opus 5 7-24 立标首位 + Mythos 5 / Fable 5 / Sonnet 4.6 / Opus 4.6 / Opus 4.8 沿用之后 第 7 个 frontier model 立标 = 7 天内 frontier model 立标密度最高一周);2) Claude Developer Platform Managed Agents effort 设置(7-22) = Anthropic 平台层 agent 编排 第 2 立标 + 与 OpenAI Reasoning effort 设置 + Google Gemini 3.6 Flash effort 三者形成 effort 编排竞速;3) Boris Cherny 7-25「Opus 5 是我们迄今为止最不易被 prompt 注入的模型」 评论 + 6 媒体 48h 长尾 = v34 §2.103 段尾"评论层长尾 7-25 ~ 7-26 6 媒体续立"标注 + v34 §3.1 共识 #112 续立;4) Anthropic 7-22 ~ 7-26 五线齐扩(Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Managed Agents + Project Glasswing + Economic Index + Public First Action 2000 万美元 + 4 模型矩阵形态分化 Opus/Fable/Mythos/Sonnet) = v34 §1.45 frontier lab 立标 §6 行业升级 5 件合并 + v34 §1.41 横切 60-66 v23 七件主轴升格为"九件主轴";5) Anthropic 模型矩阵形态分化第二例(Sonnet 5 = 更代理化 / 工具使用强 vs Opus 5 = 中等/bounded tasks + 经济性 vs Fable 5 = 长时自主(数小时-数天)vs Mythos 5 = 网络安全/生物研究领先)= v34 §1.41 横切 60-66 v23 七件主轴「frontier lab 模型矩阵形态分化」 候选升级 |
| 反方 / 风险 | (A) 「更代理化的 Sonnet」 具体定义待 Anthropic 官方文档核证 + 工具使用相对 4.6 提升幅度待核;(B) Sonnet 5 vs Opus 5 / Sonnet 5 vs Fable 5 / Sonnet 5 vs Sonnet 4.6 head-to-head 评测待核;(C) Managed Agents effort 精度 vs OpenAI Reasoning effort / Gemini 3.6 Flash effort head-to-head 待核;(D) Boris Cherny 评论原文出处 + Opus 5 PI evals / red team 完整版本待核;(E) Project Glasswing 保护全球软件安全 vs Project Pilot AI 操控无人机 关系待核;(F) Claude Sonnet 5 系统卡是否同步发布待核(沿用 spark 7-26 §2.1 + stephen 7-26 ai-industry) |
| 建议归入节 | §1.41 横切 60-66 v23 七件主轴 升为九件主轴(Claude Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot = 9 件 frontier model / 平台层立标)+ §1.45 frontier lab 立标 §6 行业升级候选新增"Anthropic Claude Sonnet 5 + Claude Developer Platform Managed Agents effort 设置(7-22 ~ 7-26)" + §2.103 段尾"评论层长尾 7-25 ~ 7-26 6 媒体续立"标注 + §2.6 评测、可靠性与对抗(评测 → 系统卡 → 评论 → 红队 4 栖验证沿用) + §3.1 共识(候选新增 26 "frontier lab 模型矩阵形态分化第二例 = Sonnet 5 更代理化 vs Opus 5 中等/bounded tasks vs Fable 5 长时自主 vs Mythos 5 网络安全") + §4.1 开放问题(候选新增 201 "Anthropic 7-22 ~ 7-26 模型矩阵 head-to-head + Managed Agents effort 精度 vs OpenAI/Gemini effort + Opus 5 vs Sonnet 5 PI ~0 一致性验证 + Sonnet 5 系统卡是否同步发布") + §6 必读清单 新增 Opus 5 系统卡 + Boris Cherny 评论 + Project Pilot + Sonnet 5 官方文档 + Managed Agents effort 设置 文档 第 132-136 条 |
| 重要边界 | 不要与 v34 §1.41 横切 60-66 Opus 5 7-24 evening 立标首位 混为同一件工作:Opus 5 = 中等/bounded tasks + 经济性, Sonnet 5 = "更代理化的 Sonnet" = 沿用平台层但模型形态分化;不要与 v34 §1.41 Mythos 5 / Fable 5 沿用立标 混为同一件工作:Mythos 5 = 网络安全/生物研究领先, Fable 5 = 长时自主(数小时-数天), Opus 5 = 中等/bounded tasks + 经济性, Sonnet 5 = "更代理化" = 4 模型矩阵形态分化;不要与 v34 §1.34b Anthropic J-space arXiv:2607.15495 混为同一件工作:J-space 是认知科学锚点论文, Sonnet 5 是 frontier model + 评论 + 平台层 = 认知科学 vs 模型本体 不同对象;不要与 v34 §1.45 Gemini 3.5 Flash Cyber 混为同一件工作:Cyber 是 vertical LLM 网络安全, Sonnet 5 是本体模型 + 平台层 = vertical LLM vs 本体模型 不同对象;不要与 v34 §1.33c 横切 53c AI Agents Stack 2026 Harness 层 混为同一件工作:Harness 层是产品级 Harness, Sonnet 5 是 frontier model + 平台层 = Harness vs model 不同对象 |
增量 2 · ⭐⭐⭐⭐⭐ · arXiv:2607.04763 ReOPD critical-read v2 = B 级 · 实战 recipe + 立标级候选 3.4/5 · 与 OpenForgeRL 同向「Agent 训练工程化复用」立标
| 字段 | 内容 |
|---|---|
| 来源 | inbox/flyp/2026-07-26-2250-ReOPD-prefix-replay-distillation-critical-read.md(v2 精读主稿 9.5KB · 整体可信度 3.4/5 · B 级 · 实战 recipe + 立标级候选 · 7-28/7-30 截止前必做 4 项)+ inbox/tom/2026-07-26T0840-agent-rag-longcontext-radar.md ⭐⭐⭐ 沿用 + inbox/tom/2026-07-26T1440-agent-rag-longcontext-radar.md 沿用 + inbox/spark/2026-07-26-agent-e1prep.md §3.5 沿用 + inbox/jay/2026-07-26-engineering-e1prep.md §2.7「Agentic Engineering 学科化」归类 + paper_card 576 已立(7-24) |
| arXiv 号 | arXiv:2607.04763v2 Multi-Turn On-Policy Distillation with Prefix Replay(Hanze Dong Bytedance · v1 2026-07-06 461 KB · v2 2026-07-16 526 KB · cs.LG + cs.AI + cs.CL + stat.ML 四学科交叉 · 未确认是否已被接收) |
| 一句话 | 多轮 On-Policy Distillation 太贵,因为每步都要新执行环境 + 教师查询。ReOPD 把已采集教师轨迹当作 replayed prefix,学生在选定步骤 acting,教师仅给密集逐步监督,环境零调用,rollout 速度 ≥ 4×。但关键洞察是发现了『prefix trap』:越让历史 student-on-policy,就越在教师不可靠的分布上查询——所以正确做法是 step-decaying 采样 schedule,前几步高密度、后几步低密度,折中 student-relevance 与 teacher-reliability = Agent 训练工程化复用 第 2 件 · 「prefix trap」概念 vs OpenForgeRL「harness-native 训练闭环」形成"训练数据复用 + 训练栈复用"二联对照 · 4× speedup + 零工具调用 + prefix trap 形式化 + step-decaying schedule 实战 recipe |
| v34 脉络关系 | 与 v34 §2.4 后训练 Agentic RL 训练栈 13 件 + v34 §2.4 记忆 / 长视野 8 件 + v34 §1.33c Harness 层 + v34 §2.1 Harness 学术化 9 阶段 + v34 §1.45 Opus 5 立标首位 + v34 §2.6 评测邻接 同源;v34 §2.4 后训练 Agentic RL 训练栈 13 → 14 件候选(ReOPD critical-read B 级 · 实战 recipe + 立标级候选):1) 「prefix trap 概念 = multi-turn OPD 本质性洞察」 = student-relevance × teacher-reliability trade-off 形式化 = 与 v34 §2.4 现有 13 件 Agentic RL 训练栈(LongStraw + Agent-STAR + SAO + SEED + DeNovoSWE + Function-Aware FIM + SWE-Pruner Pro + Tool-Call Boundary Drift + DataFlow-Harness + SkewAdam + Sample-Efficient + ReOPD 已有 + On-Policy Distillation)互补为「Agent 训练工程化复用」主轴;2) 「step-decaying 采样 schedule = student-relevance × teacher-reliability 可工程化折中」 = 与 v34 §2.4 现有 13 件 On-Policy Distillation(arXiv:2607.13399)+ SEED(arXiv:2607.14777)+ Function-Aware FIM(arXiv:2607.12463)+ Tool-Call Boundary Drift(arXiv:2607.07050)+ LongStraw(arXiv:2607.14952)+ Agent-STAR(arXiv:2603.21972)+ SAO(arXiv:2607.07508)+ SEED 同源 = §2.4 后训练 Agentic RL 训练栈第 14 件候选「prefix trap 形式化 + step-decaying schedule」;3) 「ReOPD 与 OpenForgeRL 二联对照」 = OpenForgeRL(arXiv:2607.21557)「训练栈复用(harness ↔ RL)」 vs ReOPD「训练数据复用(教师轨迹 → replayed prefix)」 = 训练数据复用 vs 训练栈复用 二联立标;4) 「跨数学推理 + 搜索环境 + 多教师/学生规模,ReOPD ≥ OPD accuracy + ≥ 4× speedup + 零工具调用」 = 工程化落地量化数字立标;5) 「与 Sample-Efficient(arXiv:2607.21051 · Tom 7-24 T1440 v2 重写版高价值) + ReOPD(arXiv:2607.04763 · Tom 7-24 T2040 radar 高价值) Agent 经验蒸馏双轨范式 沿用升级 + 与 OpenForgeRL 三栖合流 |
| 反方 / 风险 | (A) 「prefix trap 概念可能可命名但不可证伪」 = 若 v2 PDF §3 + 附录没有「教师可靠性在不同 prefix 长度上的可量化曲线」+ 「step-decaying schedule 不同 decay rate 的消融」 → "prefix trap" 是叙事抽象, 而非可证伪理论;(B) 「与同期离线/在线 agent 训练路线未对照(RLHF / DPO / Rejection Sampling FT / STaR / Self-Reflect)」 = "ReOPD = Agentic 工程化训练标配" 主张的实证支点不足;(C) 「多模态/工具调用泛化性未充分验证」 = 仅在数学推理 + 搜索环境上, 没有 vision tool / 多模态 agent / 长上下文 agent / 工业级 harness;(D) 「零工具调用训练 vs 零环境交互训练边界不清」 = 若 PDF 模糊「教师提供密集逐步监督」与「教师不执行环境」边界 + 「学生执行环境」与「学生不执行环境」边界 → "零工具调用" 可能实为伪离线;(E) 「step-decaying schedule 的超参敏感性 + 与其它 schedule 对比缺失」 = "step-decaying 是最优 schedule" 是 designer choice 而非 evidence-based;(F) 「4× speedup 在不同 rollout 长度 / 任务难度下的鲁棒性未披露」 = 4× 数字可能被 rollout 长度分布掩盖;(G) 「teacher reliability 度量 vs 学生 occupancy 度量的形式化定义」 = 「prefix trap = student occupancy × teacher reliability 两面分布漂移」 缺乏形式化定义 |
| 建议归入节 | §2.4 后训练 Agentic RL 训练栈 13 → 14 件候选(ReOPD critical-read 第 14 · 实战 recipe + 立标级候选 · 4× speedup + 零工具调用 + prefix trap 形式化 + step-decaying schedule) + §1.33c 横切 53c AI Agents Stack 2026 6 层 Harness 层 邻接补全(训练栈复用 OpenForgeRL + 训练数据复用 ReOPD 二联对照) + §1.45 5 件 Agent 训练工程化复用 邻接补全(OpenForgeRL + Sample-Efficient + ReOPD + AREX + Self-Harness) + §3.1 共识(候选新增 27 「Agent 训练工程化复用 = OpenForgeRL 训练栈 + ReOPD 训练数据 + Sample-Efficient 样本效率 三栖合流」) + §4.1 开放问题(候选新增 204 「ReOPD 7-28/7-30 截止前必做 4 项 = PDF 全文 + baseline 对照 + schedule 消融 + 多模态扩展」+ 「OpenForgeRL + ReOPD 训练数据 vs 训练栈复用 二联对照」) + §6 必读清单 沿用 arXiv:2607.04763(已立 paper_card 576)第 137 条 + 加注 B 级 · 实战 recipe + 立标级候选 3.4/5 |
| 重要边界 | 不要与 v34 §2.4 13 件 Agentic RL 训练栈 LongStraw + Agent-STAR + SAO + SEED + DeNovoSWE + Function-Aware FIM + SWE-Pruner Pro + Tool-Call Boundary Drift + DataFlow-Harness + SkewAdam + Sample-Efficient + ReOPD 已有 + On-Policy Distillation 混为同一件工作:ReOPD critical-read 是「prefix trap 概念 + step-decaying schedule」 实战 recipe + 立标级候选补全, 既有 13 件是「训练范式与方法」 立标;不要与 v34 §1.33c 横切 53c Harness 层 混为同一件工作:Harness 层是产品级 Harness, ReOPD critical-read 是训练工程化复用 = Harness vs training 不同对象;不要与 v34 §2.5 第 84 节点 OpenForgeRL 混为同一件工作:OpenForgeRL 是「训练栈复用(harness ↔ RL)」, ReOPD 是「训练数据复用(教师轨迹 → replayed prefix)」 = 训练栈复用 vs 训练数据复用 不同维度;不要与 v34 §2.4 Agentic Context Management arXiv:2607.21503 混为同一件工作:ACM 是「推理时上下文管理」 5 原语 + 3 档成本曲线, ReOPD 是「训练时多轮成本」 4× speedup = 推理 vs 训练 不同对象 |
增量 3 · ⭐⭐⭐⭐ · arXiv:2607.21503 Agentic Context Management v2 critical-read = B 级 · 监控清单 + 实战 recipe + 立标级候选 3.6/5 · 反方 7 条 + 沿用 risk.md R29 §2.1 C 类
| 字段 | 内容 |
|---|---|
| 来源 | inbox/flyp/2026-07-26-1550-Agentic-Context-Management-critical-read.md(v2 精读主稿 13.0KB · 整体可信度 3.6/5 · B 级 · 监控清单 + 实战 recipe + 立标级候选 · 7-30 截止前必做 4 项)+ inbox/tom/2026-07-26T0840-agent-rag-longcontext-radar.md ⭐ #1 沿用 + inbox/tom/2026-07-26T1440-agent-rag-longcontext-radar.md 沿用 + inbox/spark/2026-07-26-agent-e1prep.md §3.5 沿用 + inbox/jay/2026-07-26-1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md 沿用 + inbox/flyp/2026-07-26-risk-e1prep.md §0 + paper_card 564 已立(7-25) |
| arXiv 号 | arXiv:2607.21503v1 Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems(Gaurav Dadhich 一人独立作者 · Maximem · 2026-07-23 v1 · 23 页 / 6 图 / 4 表 · cs.AI + cs.IR) |
| 一句话 | 「Agent 上下文是生命周期问题,不是存储检索问题」——一篇把生产 Agent 上下文管理升格为独立学科(Agentic Context Management, ACM) 的 position + reference implementation 双形态论文,提出"架构 → 摄入 → 作用域 → 预期 → 压缩合并"五原语 + 二次方 → 线性 → 线性+保真 三档成本曲线 + Maximem Synap 多租户参考实现。在 LongMemEval 92% / LoCoMo 93.2% 两个公开 benchmark 上有报数,但 head-to-head / 多模态 / 复现性 4 项短板未消。沿用 risk.md R29 §2.1 C 类 + v34 §2.4 三路线对立 + v34 §2.6 段末追加 = 「PRO-LONG 程序化日志 vs ACM 生命周期」 二联对照 = Agent 上下文管理 第 1 份正式反方记录 立标级候选 |
| v34 脉络关系 | 与 v34 §2.4 记忆 / 长视野 8 件(PRO-LONG + ACM + SkillOpt + Memora + δ-mem + MAGE + MRAgent + Memanto + ReMemR1 + AutoMem + Codified Context)+ v34 §2.5 第 9 阶 + v34 §2.5 第 10 阶 + v34 §2.6 35 子节 Tool-Call Boundary Drift + v34 §2.6 39 子节 Agent 生产失败三模式 + v34 §2.6 41 子节 Isolation-as-First-Class + risk.md R29 §2.1 C 类 同源;v34 §2.4 记忆 / 长视野 8 件沿用 + 第 11 阶 candidate(ACM critical-read B 级 · 监控清单 + 反方记录):1) 「5 边界(Architecting / Ingesting / Scoping / Anticipating / Compacting)的可证伪性弱」 = 若 PDF §3-§5 没有「基线五选一原语不变」的消融对照 → 五原语是「叙事抽象」而非「可证伪理论」;2) 「Maximem Synap SaaS 营销 vs 学术实证边界」 = 若论文 §6 之外的完整 ablation 缺失,且 Maximem Synap §6 配置包含「非公开数据 / 私有 embedding / 私有 LLM 后端」任一项 → LongMemEval 92% / LoCoMo 93.2% 数字将被怀疑是 SaaS 营销基准 = v34 §2.4 沿用升级 + 反方记录固化;3) 「与 PRO-LONG arXiv:2607.20064v2 二联对照」 = PRO-LONG 程序化结构化日志 + flyp 7-24 15:50 critical-read 主稿 vs ACM 完整生命周期(5 原语 + 3 档成本曲线)—— PRO-LONG 偏 "programmatic memory + search history" 算法层; ACM 偏 "context lifecycle" 框架层 = 「立标级 + 实战 recipe」 二联;4) 「与 RRB-intra-query-attention-dilution 7-25 critical-read 沿用升级」 = RRB 关注推理稳定性(query-time 重写缓解注意力稀释); ACM 关注 context lifecycle(compacting / consolidation 缓解 token 累加) = 同属「推理鲁棒性 + 上下文生命周期」主题;5) 「risk.md R29 §2.1 C 类「Agentic Context Management」立标的第一份反方记录」 = R29 已固化 C 类立标 + flyp 1550 ACM critical-read = P3 待核 4 项;6) 「评测 → 系统卡 → 评论 → 红队 4 栖验证 第 2 例」(沿用 v34 §2.6 Opus 5 Boris Cherny 评论 第 1 例)—— ACM = 「position paper + reference implementation 边界 + 多模态缺口 + head-to-head 缺失 + §6 配置含糊」 4 栖验证 |
| 反方 / 风险 | (A) 「position paper + 产品营销的双形态(Maximem Synap 学术 vs SaaS 边界)」 = 若论文 §6 之外的完整 ablation / 与 RAG-only / MemGPT / PRO-LONG / RRB 的 head-to-head 缺失, 且 Maximem Synap §6 配置包含「非公开数据 / 私有 embedding / 私有 LLM 后端」 任一项 → LongMemEval 92% / LoCoMo 93.2% 数字将被怀疑是 SaaS 营销基准;(B) 「五原语(Architecting / Ingesting / Scoping / Anticipating / Compacting)的可证伪性弱」 = 若 PDF §3-§5 没有「基线五选一原语不变」的消融对照(removing one primitive at a time)→ 五原语是「叙事抽象」 而非「可证伪理论」;(C) 「多模态特殊性被回避(视觉 / 语音 / 视频流 + 工具调用链)」 = 若摘要 + 主表未专门切到多模态上下文(视觉 / 语音 / 视频流)or 工具调用链 → Token 预算的二次方 → 线性 → 线性+保真 三档曲线在多模态 Agent 里的迁移性未证明;(D) 「未对比同期 SOTA(PRO-LONG / RRB / MemGPT / ACE)」 = 若 PDF 未在 LongMemEval / LoCoMo 上与 PRO-LONG(arXiv:2607.20064v2)/ RRB(2607.x)/ MemGPT / ACE 至少 2 项做 head-to-head → 「五原语统一视角」 主张的实证支点不足;(E) 「decision-level / org-level 实证支点缺失」 = 若 PDF 仅 "decision-level / org-level" 写为 "future work 一句话" 而无实证;(F) 「经济性论点(naive 二次方 vs crude 线性+断崖)的公式 + 数字未在摘要层披露」;(G) 「成本 / 延迟 / 上下文腐烂 综合维度未覆盖」 = 若摘要提出「五原语 + 三档成本曲线」但漏 latency / token efficiency / context-rot resistance 等综合维度 → 评测完整性不足 |
| 建议归入节 | §2.4 记忆 / 长视野 8 件 沿用升级 + 加注 ACM critical-read B 级 · 监控清单 + 反方 7 条记录(与 PRO-LONG 二联对照) + §2.4 后训练 Agentic RL 训练栈 邻接补全(ACM = 推理时上下文管理 + 训练时多轮成本 ReOPD 二联) + §2.5 安全契约 第 11 阶候选 沿用(Isolation-as-First-Class arXiv:2607.12406)邻接补全(ACM = 推理时 vs Isolation = 边界中心组织) + §3.1 共识(候选新增 28 「Agent 上下文管理 = 上下文管理作为学科 + lifecycle + architecture 双向范式 + memory + cost 并行架构目标 = ACM 沿用升级 + 与 PRO-LONG 完整日志对立 + 与 AHE 可观测性互补」) + §3.2 争议(候选新增 31 「ACM 反方 7 条硬标签 = Maximem Synap SaaS 营销 vs 学术实证边界 + 五原语可证伪性弱 + 多模态特殊性回避 + 与同期 SOTA 未对照 + decision-level / org-level 实证缺失 + 经济性论点未披露 + 成本/延迟/上下文腐烂 综合维度未覆盖」) + §4.1 开放问题(候选新增 205 「ACM 7-30 截止前必做 4 项 = PDF 全文 + Maximem Synap 开源声明 + LongMemEval / LoCoMo 头部 SOTA 核对 + 与 PRO-LONG / RRB / MemGPT / ACE head-to-head」+ 「ACM vs PRO-LONG 二联对照」) + §6 必读清单 沿用 arXiv:2607.21503(已立 paper_card 564)第 138 条 + 加注 B 级 · 监控清单 + 反方 7 条 |
| 重要边界 | 不要与 v34 §2.4 PRO-LONG arXiv:2607.20064v2 混为同一件工作:PRO-LONG 是「不设 memory 子系统 + 完整结构化日志 + 编码 agent 在日志里检索」, ACM 是「完整生命周期 + 5 原语 + 3 档成本曲线」 = 不设 memory vs lifecycle 不同路线;不要与 v34 §2.5 第 11 阶 Isolation-as-First-Class arXiv:2607.12406 混为同一件工作:Isolation-as-First-Class 是 agent 安全 survey anchor 边界中心组织, ACM 是 position paper + reference implementation = 攻 vs 防 不同层;不要与 v34 §2.4 SkillOpt + Memora MSR 7-25 沿用升级 混为同一件工作:SkillOpt + Memora 是 MSR Skill 训练参数 + 谐波记忆, ACM 是「上下文管理作为学科」 lifecycle + architecture 双向范式 = 不同机构不同形态;不要与 v34 §2.6 35 子节 Tool-Call Boundary Drift arXiv:2607.07050 混为同一件工作:Tool-Call Boundary Drift 是工具调用边界校准, ACM 是 position paper 元框架 = 单一边界 vs 元框架 不同范围 |
增量 4 · ⭐⭐⭐⭐ · AAAI 2026 Subramanian et al.「Keyword search is all you need」Agentic 搜索替代向量检索 = RAG 范式转折新立标候选(P0 沿用升级)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/jay/2026-07-26-1106-rag-agent-llm-systems-briefing.md #3 + inbox/jay/2026-07-26-1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md 高价值 6 + inbox/spark/2026-07-26-agent-e1prep.md §2.8 矛盾 + inbox/flyp/2026-07-26-risk-e1prep.md 沿用 + paper_card 未建 |
| arXiv 号 | 待核(AAAI 2026 Subramanian et al.「Keyword search is all you need: Achieving RAG-Level Performance Without Vector Databases Using Agentic Tool Use」 · GitHub 链接附 Medium 文章 https://buzzgrewal.medium.com/ai-agents-dont-need-vector-search-anymore-inside-the-agentic-search-stack-replacing-rag-in-2026-58efcabe4f6f) |
| 一句话 | 相同 LLM(Claude 3 Sonnet · 200K 上下文),ReAct Agent 调用 pdfmetadata / rga / pdfgrep 等关键词工具 vs Bedrock Knowledge Base Titan Embeddings 向量检索,6 个数据集对比,结果差异极小。FinanceBench(长表格型财务文件):关键词搜索 30.40% vs 向量搜索 24.24%,关键词搜索反而超越。Claude Code / Cursor / Windsurf / Devin(Cognition)/ Cline / Sourcegraph Amp 等主流 Agent 产品已转向工具调用检索 = Agentic 搜索工具调用 vs 向量检索 6 数据集 head-to-head + RAG 范式转折新立标候选 + 产业证据主流 Agent 厂商已采纳 |
| v34 脉络关系 | 与 v34 §2.3 工具调用与 Agentic RAG 21 行 + v34 §1.33c 横切 53c AI Agents Stack 2026 商业 Harness 立标 + v34 §2.6 评测、可靠性与对抗 + v34 §1.43 横切 80 Why Agents Fail 7 件套 + v34 §2.6 39 子节 Agent 生产失败三模式 + Compounding Error 0.85^10≈0.197 + Gartner 2027 40% 废弃预测 + v34 §2.3 第 56 节点 Beyond Relevance-Centric(arXiv:2607.19747 HF Daily 7-26 28▲ 续立)同源;v34 §2.6 段末追加 + v34 §1.33c 横切 53c 商业 Harness 立标 旁证:1) 「Agentic 搜索工具调用 vs 向量检索 6 数据集 head-to-head」 = v34 §2.6 评测、可靠性与对抗 邻接(主流 Agent 厂商已采纳)+ v34 §2.3 工具调用范式转折 旁证;2) 「RAG 范式转折 旁证」 = v34 §1.33c 商业 Harness 立标 旁证(Agentic 工具调用搜索是大量场景的可行替代方案);3) 「产业证据 Claude Code / Cursor / Windsurf / Devin / Cline / Sourcegraph Amp 不再将语料索引进向量数据库」 = v34 §2.6 评测、可靠性与对抗 邻接(主流 Agent 厂商已采纳 旁证)+ v34 §2.3 工具调用与 Agentic RAG 21 行 邻接(Agentic RAG 第 4 路径:工具调用派 vs 向量检索派 对立);4) 「与 v34 §2.3 第 56 节点 Beyond Relevance-Centric(arXiv:2607.19747)对照」 = Beyond Relevance-Centric = 评分标准驱动文档集选择与排序(rubric-driven RAG 检索优化第 4 路径), Subramanian = Agentic 搜索工具调用 = 两条 RAG 替代路径并行 |
| 反方 / 风险 | (A) AAAI 2026 论文原文未精读 + GitHub 链接待补 + 6 数据集实验方法未披露;(B) 「同 LLM(Claude 3 Sonnet · 200K 上下文)」 = 单一 LLM 跨模型迁移性待核;(C) 「6 个数据集对比,结果差异极小」 = 是否覆盖大规模向量(>1M)与工业级 RAG 场景 待核;(D) 「FinanceBench 关键词搜索 30.40% vs 向量搜索 24.24%」 = 单一数据集结论 + 表格型 vs 文档型 适用边界 待核;(E) 「产业证据 Claude Code / Cursor / Windsurf / Devin / Cline / Sourcegraph Amp」 = 这些产品是否完全弃用向量库 or 工具调用 + 向量检索混合架构 待核;(F) 与 v34 §1.43 Why Agents Fail + v34 §2.6 39 子节 Agent 生产失败三模式 + Compounding Error 0.85^10≈0.197 + Gartner 2027 40% 废弃预测 互补关系 待核 |
| 建议归入节 | §1.33c 横切 53c AI Agents Stack 2026 Harness 层 邻接补全(Agentic 搜索工具调用 旁证) + §2.3 工具调用与 Agentic RAG 21 行 邻接(RAG 范式转折 第 22 行候选 · 工具调用派 vs 向量检索派 对立) + §2.6 评测、可靠性与对抗 邻接(主流 Agent 厂商已采纳 旁证 · Agentic 搜索 工具调用派 第 4 路径) + §3.1 共识(候选新增 121 「Agentic 搜索工具调用 = 向量检索替代方案 · 主流 Agent 厂商已采纳 · FinanceBench 关键词搜索 30.40% > 向量搜索 24.24%」) + §4.1 开放问题(候选新增 200 「AAAI 2026 论文原文 + GitHub 链接 + 6 数据集实验方法 + 主流 Agent 厂商是否完全弃用向量库」) + §6 必读清单 候选新增 Subramanian et al. 第 139 条(待 arXiv 编号核证 + paper_card) |
| 重要边界 | 不要与 v34 §2.3 第 56 节点 Beyond Relevance-Centric(arXiv:2607.19747)混为同一件工作:Beyond Relevance-Centric = 评分标准驱动文档集选择与排序, Subramanian = Agentic 搜索工具调用 = 不同 RAG 替代路径;不要与 v34 §1.33c 横切 53c 89% observability vs 52% evals 37pt eval gap 混为同一件工作:这是 observability vs eval gap, Subramanian = Agentic 搜索 vs 向量检索 = 不同对象;不要与 v34 §2.6 39 子节 Agent 生产失败三模式(Compounding Error 0.85^10≈0.197)混为同一件工作:Compounding Error = Multi-Agent 可靠性量化公式, Subramanian = RAG 范式转折 = 不同对象;不要与 v34 §1.43 Why Agents Fail 7 件套 混为同一件工作:Why Agents Fail = 失败模式, Subramanian = 检索替代方案 = 不同对象 |
增量 5 · ⭐⭐⭐⭐ · GitHub Trending 6 件工程化栈 + 1000+ JD 量化 AI Engineer 画像 = AI Agents Stack 2026 Harness 层 商业开源 SDK 立标补全 + 工程化栈 6 件 GitHub Trending(P0 沿用升级)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/jay/2026-07-26-0935-github-trending-ai-deploy-stack-job-market.md + inbox/jay/2026-07-26-1123-engineering-e1prep.md §增量 1-4 + §警示 1(OpenClaw 210k vs GitHub 12,981 stars 数据传染)+ inbox/spark/2026-07-26-agent-e1prep.md §增量 8 P1 旁证 |
| arXiv 号 | 无(均为 GitHub 项目 + Substack) |
| 一句话 | alibaba/open-code-review(混合 LLM+规则引擎代码审查 · 12,981 stars · 今日 +431)+ citrolabs/ego-lite(Browser Agent 基础设施 · 共享登录态浏览器会话给 AI Agent)+ andrewyng/aisuite(统一多 GenAI 提供商接口 · 避免 vendor lock-in)+ deepagents-ai/agent-backend(AI Agent 分布式文件系统后端 · MCP Filesystem API + SSH + Docker · 长生命周期会话持久化)+ RyanCodrai/turbovec(Rust + Python bindings · 向量索引底层实现 · 基于 TurboQuant)+ 1000+ JD 量化 AI Engineer 画像(AI-first ≈70% · Python 82.5% · RAG 35.9% · Prompt Engineering 29.1% · LangChain 18.8% / LangGraph 8.0% / LlamaIndex 5.8% · K8s 29.1% · AWS 40.1% / Azure 23.9% / GCP 23.0%) = v34 §1.33c 横切 53c AI Agents Stack 2026 Harness 层 商业开源 SDK 立标补全 第 6-11 件 + 工程化栈 6 件 GitHub Trending + AI Engineer 画像量化数字立标 |
| v34 脉络关系 | 与 v34 §1.33c 横切 53c AI Agents Stack 2026 Harness 层(MAF Harness / 文心快码 / Google ADK Go 2.0 / Klarna 853 FTE)+ v34 §2.7 行业与平台动态 工程化栈 + v34 §2.4 多智能体协作 + v34 §6.15 推理基础设施 + 主权开源本地执行 同源;v34 §1.33c 待立补全候选 + v34 §2.7 邻接补全:1) alibaba/open-code-review 混合 LLM+规则引擎代码审查 = v34 §1.33c 横切 53c 商业开源 SDK 立标补全 第 6 件(混合架构:确定性 pipeline + LLM Agent 双轨审查,规则引擎做兜底过滤,LLM 做语义层增强,内置精细化规则集 NPE/线程安全/XSS/SQL 注入,行级精确评论,兼容 OpenAI 和 Anthropic API);2) citrolabs/ego-lite Browser Agent 基础设施 = v34 §1.33c 横切 53c Browser Agent 基础设施层新增 第 1 件(共享登录态浏览器会话给 AI Agent,解决 Web Agent 登录态页面工具调用失败率问题);3) andrewyng/aisuite 统一多 GenAI 提供商接口 = v34 §1.33c 横切 53c 多模型路由 API 抽象层工程实践 第 1 件(避免 vendor lock-in);4) deepagents-ai/agent-backend MCP Filesystem API + SSH + Docker 长生命周期会话持久化 = v34 §1.33c 横切 53c MCP 生态工程实践 第 1 件;5) RyanCodrai/turbovec Rust + Python bindings · 基于 TurboQuant = v34 §1.33c 横切 53c Rust 底层向量索引实现 第 1 件;6) 1000+ JD 量化 AI Engineer 画像 = v34 §1.33c 横切 53c 量化数字立标(Python 82.5% / RAG 35.9% / K8s 29.1% / AWS 40.1% / LangChain 18.8% / LangGraph 8.0% / LlamaIndex 5.8%) |
| 反方 / 风险 | (A) alibaba/open-code-review vs CodeRabbit / GitHub Copilot Review 架构差异 待核;(B) AI Engineer 画像 RAG 35.9% 同时反映采用率与失败率(同一指标两面性);(C) 「OpenClaw 210k stars(沿用 v34) vs GitHub 12,981 stars(2026-07-26 trending 实时数据)」 = 数据传染/版本混淆待核;(D) alibaba/open-code-review 行级评论 vs 笼统总结 评估准确性 待核;(E) ego-lite 共享登录态浏览器 vs 多租户隔离 安全性 待核;(F) turbovec TurboQuant 学术来源 + 性能基准 待核 |
| 建议归入节 | §1.33c 横切 53c AI Agents Stack 2026 Harness 层 商业开源 SDK 立标补全(alibaba/open-code-review + citrolabs/ego-lite + andrewyng/aisuite + deepagents-ai/agent-backend + RyanCodrai/turbovec + 1000+ JD 量化 AI Engineer 画像 = 第 6-11 件) + §2.7 行业与平台动态 邻接(工程化栈 6 件 GitHub Trending + AI Engineer 画像) + §3.1 共识(候选新增 29 「AI Engineer 画像 = Python 82.5% / RAG 35.9% / K8s 29.1% / AWS 40.1% = AI Engineer 职业化实证」) + §3.2 争议(候选新增 30 「OpenClaw 210k stars vs GitHub 12,981 stars 数据传染/版本混淆」) + §4.1 开放问题(候选新增 206 「alibaba/open-code-review vs CodeRabbit / GitHub Copilot Review 架构差异 + AI Engineer 画像 RAG 35.9% 同时反映采用率与失败率 + OpenClaw Star 数版本混淆」) + §6 必读清单 候选新增 6 件 GitHub Trending + 1000+ JD 量化 AI Engineer 画像 第 140-146 条 |
| 重要边界 | 不要与 v34 §1.33c Microsoft MAF Harness / 文心快码 / Google ADK Go 2.0 混为同一件工作:这些是企业级商业 SDK, GitHub Trending 6 件是开源项目 = 商业 vs 开源 不同形态;不要与 v34 §2.7 行业与平台动态 Klarna 853 FTE 等效 混为同一件工作:Klarna = 企业级 Multi-Agent 量化数字, GitHub Trending 6 件 = 开源生态立标 = 企业 vs 开源 不同对象;不要与 v34 §2.6 14 件 CLI/IDE 工具退化 混为同一件工作:这些是工具调用层, GitHub Trending 6 件 = 工程化栈基础设施层 = 不同层;不要与 v34 §1.33c 横切 53c AI Agents Stack 2026 Harness 层 Microsoft Foundry/Copilot 80K/20M 五层 Harness 混为同一件工作:后者是产品级 Harness, GitHub Trending 6 件 = 开源生态基础设施层 = 产品 vs 基础设施 不同层 |
增量 6 · ⭐⭐⭐ · Claude Opus 5 评论层 7-25 ~ 7-26 6 媒体 48h 持续长尾 + Fable 5 评论层沿用 + Boris Cherny 评论 = 评论层长尾 7-25 ~ 7-26 持续 48h(P0 沿用升级)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/stephen/2026-07-26-ai-industry-e1prep.md §E 增量 6 + inbox/stephen/2026-07-26-1002-news-anthropic-news.md + inbox/jay/2026-07-26-1000-rss-simon-willison.md Boris Cherny 引语 + inbox/flyp/2026-07-26-1002-rss-yt-two-minute-papers.md「Claude 揭示 AI 最大问题」+ inbox/flyp/2026-07-26-1003-rss-yt-ai-explained.md「Claude Fable 被封禁」+「Claude Fable 5 完整 319 页拆解」+ inbox/spark/2026-07-26-1000-rss-gradient-flow.md 三款前沿级模型集中观察 + paper_card 未建 |
| arXiv 号 | 无(均为评论层长尾 6 媒体 + Boris Cherny 评论 + Project Glasswing) |
| 一句话 | Google news + Simon Willison + Two Minute Papers + AI Explained + Ben's Bites + Gradient Flow 6 媒体持续 48h 头条 + Two Minute Papers「Claude 揭示 AI 最大问题」+ AI Explained「Claude Fable 被封禁」+「Claude Fable 5 完整 319 页拆解」+ Boris Cherny 7-25「Opus 5 是我们迄今为止最不易被 prompt 注入的模型」+ Fable 5 完整 319 页拆解 + Fable 5 vs GPT 5.6 Sol 早期结果 + Claude Fable 被封禁 + Gradient Flow 三款前沿级模型集中观察 = 评论层长尾 7-25 ~ 7-26 持续 48h 6 媒体续立 + v34 §2.103 段尾"评论层长尾"标注 + v34 §3.1 共识 #112 续立 |
| v34 脉络关系 | 与 v34 §1.45 frontier lab 4 栖立标(评测 → 系统卡 → 评论 → 红队)+ v34 §2.103 Opus 5 立标首位 + Boris Cherny 评论 + VentureBeat 2026-07-25 Mythos 5 vs Opus 5 vs Fable 5 三层关系 + Morphllm Benchmark 2026 Fable 5 95% SWE-bench Verified + 同源;v34 §2.103 段尾"评论层长尾 7-25 ~ 7-26 6 媒体续立"标注 + v34 §3.1 共识 #112 续立 + v34 §7.1 引用候选新增:1) 「Two Minute Papers「Claude 揭示 AI 最大问题」」 = 评论层立标 vs Opus 5 系统卡第 73 页埋没 + 红队验证 = 「评测 → 系统卡 → 评论 → 红队」 4 栖验证链条 第 1 例;2) 「AI Explained「Claude Fable 被封禁」+「Claude Fable 5 完整 319 页拆解」」 = 评论层立标 vs Fable 5 系统卡 = frontier model 立标 7 天密度最高一周 7-16 ~ 7-26;3) 「Boris Cherny 7-25「Opus 5 是我们迄今为止最不易被 prompt 注入的模型」 + 评论层长尾」 = v34 §2.103 Opus 5 立标首位 段尾"评论层长尾"标注 + v34 §3.1 共识 #112 续立 |
| 反方 / 风险 | (A) Boris Cherny 评论原文出处 + Opus 5 PI evals / red team 完整版本 待核;(B) Two Minute Papers / AI Explained 评论层立标 vs Opus 5 / Fable 5 系统卡 关系 待核;(C) Gradient Flow 三款前沿级模型集中观察(GLM 5.2 + Kimi K3 + Gemini 3.6 Flash)主权开源 + 美前沿立标评论层二次落地 待核 |
| 建议归入节 | §2.103 Opus 5 立标首位 段尾加"评论层长尾 7-25 ~ 7-26 6 媒体续立"标注 + §3.1 共识 #112 续立 + §4.1 开放问题(候选新增 207 「Boris Cherny 评论原文出处 + Opus 5 PI evals / red team 完整版本 + Two Minute Papers / AI Explained 评论层立标 vs Opus 5 / Fable 5 系统卡 关系」) + §7.1 引用候选新增 6 媒体 URL(Google news + Simon Willison + Two Minute Papers + AI Explained + Ben's Bites + Gradient Flow) |
| 重要边界 | 不要与增量 1 Claude Sonnet 5 + Managed Agents 混为同一件工作:Sonnet 5 + Managed Agents = 平台层 agent 编排第 1-2 立标, Opus 5 评论层长尾 = 评论层立标 = 不同形态;不要与 v34 §2.103 Opus 5 立标首位 沿用升级 混为同一件工作:Opus 5 沿用升级 = 评测 → 系统卡 → 评论 → 红队 4 栖验证 第 1 例, 评论层长尾 = 评论层 6 媒体续立 = 不同时间窗口;不要与 v34 §1.45 共识 #112 沿用升级 混为同一件工作:共识 #112 = frontier lab 4 栖验证, 评论层长尾 = 评论层 6 媒体 = 不同对象** |
增量 7 · ⭐⭐⭐ · AAAI 2026 Subramanian et al. arXiv 待核(增量 4 同源) + Microsoft MAF Harness 7-25 沿用升级 = Agent 失败模式 + 商业 Harness 沿用升级(P1 邻接)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/spark/2026-07-26-agent-e1prep.md §增量 7 + §2.8 矛盾 + inbox/jay/2026-07-26-1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md 高价值 2(Alice Labs 框架评分)+ inbox/jay/2026-07-26-1123-engineering-e1prep.md 增量 7(Microsoft MAF Harness + ReOPD + OpenForgeRL) |
| arXiv 号 | 待核(AAAI 2026 Subramanian et al.)+ 无(Microsoft MAF Harness 商业 SDK) |
| 一句话 | Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGen = 企业 Agent 框架 2026 H1 重大格局变动 + Alice Labs 框架评分新晋 S 级 + 1000+ JD 量化 AI Engineer 画像 Python 82.5% / RAG 35.9% / K8s 29.1% / AWS 40.1% = v34 §1.33c 横切 53c 量化补全 + v34 §2.7 行业与平台动态 邻接 + v34 §4.1 开放问题 198 候选新增 |
| v34 脉络关系 | 与 v34 §1.33c 横切 53c AI Agents Stack 2026 Harness 层 + v34 §1.45 五向合流 + v34 §2.7 行业与平台动态 + v34 §1.45 评测 → 系统卡 → 评论 → 红队 4 栖验证 + 同源;v34 §1.33c 待立补全候选 + v34 §2.7 邻接补全:1) Microsoft Agent Framework 1.0(2026-04-03) = 统一 Semantic Kernel + AutoGen = v34 §1.33c 量化补全(企业客户从"二选一"变成"统一接入", 预计会显著压缩 CrewAI 和 LlamaIndex 的企业份额);2) Alice Labs 框架评分新晋 S 级(Microsoft MAF + LangGraph 1.0 + Claude Agent SDK 三件 S 级)= v34 §1.33c 量化补全;3) GitHub Trending 6 件 + 1000+ JD AI Engineer 画像 = v34 §1.33c 量化补全 第 6-11 件 = 详见增量 5 |
| 反方 / 风险 | (A) Microsoft Agent Framework 1.0 发布日期(2026-04-03)未独立核验 vs Alice Labs 博客日期 vs 实际 GitHub release tag 差;(B) CSDN 智能体开发者社区 2026-07-11 Enterprise LLM Agent 三层架构(Plan/Architect/Zulu)vs Microsoft Agent Framework 1.0 是否同一框架 待核;(C) Microsoft MAF Harness GitHub samples ./harness 实际 API 待核;(D) Klarna 一手财报数据 vs SocialCrawl.ai 第三方汇总 待核;(E) Compounding Error 0.85^10≈0.197 假设每步独立同分布误差 vs LangGraph 状态回传 实际生产中步骤间误差并非完全独立 |
| 建议归入节 | §1.33c 横切 53c AI Agents Stack 2026 Harness 层 量化补全(Microsoft Agent Framework 1.0 + Alice Labs 框架评分 + GitHub Trending 6 件 + 1000+ JD AI Engineer 画像 = 第 6-11 件) + §2.7 行业与平台动态 邻接(企业 Agent 框架统一) + §4.1 开放问题(候选新增 198 「Microsoft MAF Harness vs HF Harness vs OpenForgeRL 三栈 head-to-head + Gartner 2027 40% vs Berkeley RDI 40% 交叉核 + Klarna 一手财报数据核 + Microsoft Agent Framework 1.0 发布日期核证」) |
| 重要边界 | 不要与 v34 §1.33c Microsoft MAF Harness / 文心快码 / Google ADK Go 2.0 沿用升级 混为同一件工作:这些是企业级商业 SDK, GitHub Trending 6 件 = 开源生态立标;不要与 v34 §1.33c 横切 53c AI Agents Stack 2026 6 层 Microsoft Foundry/Copilot 80K/20M 五层 Harness 混为同一件工作:后者是产品级 Harness, MAF Harness 是商业开源 SDK Harness = 产品级 vs SDK 不同形态 |
增量 8 · ⭐⭐⭐ · OpenClaw 210k stars vs GitHub 12,981 stars 数据传染警示 + HF Daily 7-26 票数续立/翻倍(P1 旁证)
| 字段 | 内容 |
|---|---|
| 来源 | inbox/jay/2026-07-26-1123-engineering-e1prep.md §警示 1 + inbox/tom/2026-07-26-0900-hf-daily-2026-07-26.md 15 篇 + inbox/spark/2026-07-26-agent-e1prep.md §增量 1-9 + HF Daily 7-26 15 篇 |
| arXiv 号 | 2607.21461 AREX 117▲ 续立 + 2607.20145 SLAI T-Rex 56▲ + 2605.09635 K12-KGraph 55▲ + 2607.20061 ReferTrack 49▲ + 2607.21556 视觉对比自蒸馏 41▲ 无变化 + 2607.01774 Subliminal Clocks 38▲ + 2607.21072 Show Don't Tell 35▲ + 2607.20368 Self Gradient Forcing 30▲ + 2607.19747 Beyond Relevance-Centric 28▲ 续立 + 2607.16165 ActiveVision 24▲ + 2607.20709 NVIDIA-labs OO Agents 22▲ 续立(从 7-25 19▲ 翻倍) + 2607.21553 SANA-Video 2.0 21▲ + 2607.20911 Tencent WorkBuddy Bench 20▲ 续立(从 7-25 18▲ 翻倍) + 2607.12746 Color Pass-Through 18▲ + 2607.20734 LLMs Get Lost in Evolving User Intent 18▲ 续立(从 7-25 15▲ 翻倍) |
| 一句话 | OpenClaw 210k stars(沿用 v34)vs GitHub 12,981 stars(2026-07-26 trending 实时数据) = 数据传染/版本混淆待核 + HF Daily 7-26 主榜 4 件 coding-agents 邻接条目票数续立/翻倍(AREX 117▲ + Beyond Relevance-Centric 28▲ + NVIDIA OO Agents 22▲ + Tencent WorkBuddy 20▲ + LLMs Get Lost 18▲) = v34 §3.2 争议 候选新增 30 + v34 §2.3 评测表 + §2.6 段末追加 + §1.33c 量化补全 沿用升级 |
| v34 脉络关系 | 与 v34 §3.2 争议 27 条 + v34 §2.3 评测基础设施分层 21 行 + v34 §2.6 多模态 / IDE / CLI / 工具退化 14 件 + v34 §1.33c 横切 53c 量化补全 + v34 §4.1 开放问题 36 条 同源;v34 §3.2 争议候选新增 + v34 §2.3 沿用升级 + v34 §2.6 段末追加:1) 「OpenClaw 210k vs 12,981 stars」 = v34 §3.2 争议 候选新增 30「OpenClaw Star 数版本混淆 · 210k 可能是累计或跨平台合计 vs GitHub 主仓当日数字」;2) HF Daily 7-26 主榜 4 件 coding-agents 邻接条目票数续立/翻倍 = v34 §2.3 评测表 + §2.6 段末追加 沿用升级(AREX 117▲ + Beyond Relevance-Centric 28▲ + NVIDIA OO Agents 22▲ + Tencent WorkBuddy 20▲ + LLMs Get Lost 18▲ + SANA-Video 2.0 21▲) |
| 反方 / 风险 | (A) OpenClaw 210k stars 来源待核(GitHub 主仓 vs 所有 fork vs 跨平台合计);(B) HF Daily 7-26 票数续立/翻倍 vs 工业代表性证据 待核;(C) Visual Contrastive 41▲ 无变化 vs 7-26 编码 agent 沿用 待核 |
| 建议归入节 | §3.2 争议 候选新增 30「OpenClaw Star 数版本混淆」 + §2.3 评测表 + §2.6 段末追加 + §1.33c 量化补全 沿用升级 4 件 coding-agents 邻接条目 + §4.1 开放问题(候选新增 208 「OpenClaw Star 数版本混淆 + HF Daily 7-26 票数续立/翻倍 vs 工业代表性」) |
| 重要边界 | 不要与 v34 §6.15 推理基础设施 + 主权开源本地执行 8 件 沿用升级 混为同一件工作:8 件是 Cursor Router + OpenRouter Caching + Google Tunix + SkewAdam + vLLM/SGLang 9 Bug + Anthropic J-space + lopopolo/harness-engineering + Sebastian Raschka, HF Daily 7-26 主榜 4 件 = 编码 agent 邻接条目 票数续立/翻倍 = 不同对象 |
2. 与 v34 活文档已有节点映射(给今晚活文档接手时)
| v34 节点 | 7-26 新增引用 | v34 第八轮沿用候选判断 |
|---|---|---|
| §1 frontier lab 全栈 + §1.41 横切 60-66 v23 七件主轴 | Claude Sonnet 5(7-22 ~ 7-26 5 件 Anthropic 全部)+ Managed Agents effort 设置 + Boris Cherny 评论 + 评论层长尾 6 媒体 48h | 🟡 v34 §1.41 待升"九件主轴"(Sonnet 5 + Opus 5 + Fable 5 + Mythos 5 + Sonnet 4.6 + Opus 4.6 + Opus 4.8 + Managed Agents + Project Pilot) |
| §1.33c 横切 53c AI Agents Stack 2026 Harness 层 | Microsoft Agent Framework 1.0(2026-04-03)+ Alice Labs 框架评分新晋 S 级 + GitHub Trending 6 件 + 1000+ JD AI Engineer 画像 + NVIDIA OO Agents + Tencent WorkBuddy | 🟡 v34 §1.33c 待升"商业 Harness SDK 立标补全 第 6-11 件 + 编程范式层 NVIDIA OO Agents + AI Engineer 画像量化补全" |
| §1.45 五向合流 | Claude Sonnet 5 + Managed Agents + Opus 5 评论层长尾 6 媒体 + Project Glasswing + Economic Index + LeCun AMI Labs $1.03B 沿用 | 🟡 v34 §1.45 邻接补全(Anthropic 7-22 ~ 7-26 平台层 + 评论层 + 资本层 四线齐扩) |
| §1.45 frontier lab 4 栖验证 | Claude Opus 5 Boris Cherny 评论 + 评论层长尾 6 媒体 + Sonnet 5 系统卡 + Managed Agents effort 设置 | 🟡 v34 §1.45 沿用升级(评测 → 系统卡 → 评论 → 红队 4 栖验证 第 1-2 例) |
| §2.1 Harness 学术化 9 阶段 | Sonnet 5 + Managed Agents platform-level agent 编排 + ReOPD critical-read 训练工程化复用 | 🟢 v34 §2.1 沿用升级(Sonnet 5 + Managed Agents + ReOPD 二联) |
| §2.3 评测基础设施分层 21 行 | Beyond Relevance-Centric HF Daily 7-26 28▲ 续立 + AREX HF Daily 7-26 117▲ 续立 | 🟢 v34 §2.3 沿用升级(Beyond Relevance-Centric 票数翻倍 24→28▲ + AREX 票数翻倍 7-25 #1 117▲ 沿用 7-26) |
| §2.4 记忆 / 长视野 8 件 | Agentic Context Management v2 critical-read B 级 监控清单 + 反方 7 条记录(沿用 + 反方记录固化) + ReOPD critical-read B 级 实战 recipe + 立标级候选 | 🟡 v34 §2.4 沿用升级 + 加注 ACM critical-read 反方 7 条记录 + ReOPD critical-read 实战 recipe + 立标级候选 第 14 件 |
| §2.4 后训练 Agentic RL 训练栈 13 件 | Sample-Efficient 沿用升级 + ReOPD critical-read 立标级候选 + OpenForgeRL 沿用升级 + SkillOpt + Memora 沿用 | 🟢 v34 §2.4 沿用升级(ReOPD critical-read 第 14 件候选 + Agent 训练工程化复用 OpenForgeRL + ReOPD + Sample-Efficient 三栖合流) |
| §2.5 安全契约 7 维 + 第 9 阶 + 第 10 阶 | Isolation-as-First-Class 沿用 + AgentCI MCP 安全 沿用 + Self-State Attacks 沿用 + SeerGuard 沿用 + ACM 反方记录 沿用 | 🟢 v34 §2.5 沿用升级(ACM 反方 7 条记录 沿用 第 11 阶 candidate) |
| §2.6 多模态 / IDE / CLI / 工具退化 14 件 | Sonnet 5 + Managed Agents + 评论层长尾 6 媒体 + Project Glasswing + Boris Cherny 评论 + AAAI 2026 Subramanian RAG 范式转折 + GitHub Trending 6 件 + AI Engineer 画像 + ReOPD critical-read | 🟡 v34 §2.6 段末追加 7 段(Sonnet 5 + Managed Agents + 评论层长尾 6 媒体 + Project Glasswing + Boris Cherny 评论 + Subramanian RAG 范式转折 + GitHub Trending 6 件 + AI Engineer 画像 + ReOPD critical-read) |
| §3.1 共识 25 条 | frontier lab 模型矩阵形态分化第二例 = Sonnet 5 更代理化 vs Opus 5 中等/bounded tasks vs Fable 5 长时自主 vs Mythos 5 网络安全(增量 1)+ Agent 训练工程化复用 = OpenForgeRL 训练栈 + ReOPD 训练数据 + Sample-Efficient 样本效率 三栖合流(增量 2)+ ACM 沿用升级(增量 3)+ Agentic 搜索工具调用 = 向量检索替代方案(增量 4)+ AI Engineer 画像 = Python 82.5% / RAG 35.9% / K8s 29.1%(增量 5) | 🟡 v34 §3.1 共识候选新增 5 条 = 25 → 30 |
| §3.2 争议 27 条 | ACM 反方 7 条硬标签(增量 3)+ OpenClaw 210k vs GitHub 12,981 stars 数据传染/版本混淆(增量 5) | 🟡 v34 §3.2 争议新增 2 条 = 27 → 29 |
| §4 开放问题 36 条 | ReOPD 7-28/7-30 截止前必做 4 项 = PDF 全文 + baseline 对照 + schedule 消融 + 多模态扩展(增量 2)+ ACM 7-30 截止前必做 4 项 = PDF 全文 + Maximem Synap 开源声明 + LongMemEval / LoCoMo 头部 SOTA 核对 + 与 PRO-LONG / RRB / MemGPT / ACE head-to-head(增量 3)+ Anthropic 7-22 ~ 7-26 模型矩阵 head-to-head + Managed Agents effort 精度 vs OpenAI/Gemini effort(增量 1)+ AAAI 2026 论文原文 + GitHub 链接 + 6 数据集实验方法(增量 4)+ alibaba/open-code-review vs CodeRabbit / GitHub Copilot Review 架构差异 + AI Engineer 画像 RAG 35.9% 同时反映采用率与失败率 + OpenClaw Star 数版本混淆(增量 5)+ Microsoft MAF Harness vs HF Harness vs OpenForgeRL 三栈 head-to-head + Gartner 2027 40% vs Berkeley RDI 40% 交叉核 + Klarna 一手财报数据核 + Microsoft Agent Framework 1.0 发布日期核证(增量 7)+ Boris Cherny 评论原文出处 + Opus 5 PI evals / red team 完整版本(增量 6) | 🟡 v34 §4 开放问题新增 9 条 = 36 → 45 |
| §5 趋势 24 条 | Anthropic 7-22 ~ 7-26 平台层 agent 编排 5 件合并(增量 1)+ Agent 训练工程化复用 OpenForgeRL + ReOPD 二联对照(增量 2)+ ACM 沿用升级(增量 3)+ Agentic 搜索 RAG 范式转折(增量 4)+ GitHub Trending 6 件 + AI Engineer 画像(增量 5) | 🟡 v34 §5 趋势新增 5 条 = 24 → 29 |
| §6 必读清单 114 条 | arXiv:2607.04763 ReOPD critical-read(已立 paper_card 576)B 级 · 实战 recipe + 立标级候选 + arXiv:2607.21503 ACM critical-read(已立 paper_card 564)B 级 · 监控清单 + 反方 7 条 + Anthropic Sonnet 5 + Managed Agents effort 设置 + Boris Cherny 评论 + 评论层长尾 6 媒体 + Project Glasswing + Project Pilot + Microsoft Agent Framework 1.0 + Alice Labs 框架评分 + alibaba/open-code-review + citrolabs/ego-lite + andrewyng/aisuite + deepagents-ai/agent-backend + RyanCodrai/turbovec + 1000+ JD AI Engineer 画像 + AAAI 2026 Subramanian et al. = 2 件 arXiv + 14 件非 arXiv = 16 件新必读 | 🟢 v34 §6 必读清单扩为 130 条候选 |
3. 值得警惕的矛盾或待核实说法(12 条)
3.1 矛盾 1 · arXiv:2607.21461 AREX paper_card 7-26 仍未建卡
- 冲突:Tom 7-26 0840 ⭐ #1 + 1440 ⭐ #1 + 2040 沿用 + HF Daily 7-25 #1 117▲ + HF Daily 7-26 续立 + stephen 7-26 1245 §3.2 已标 🔴 AREX HF Daily #1 117▲ 当日 #1 但 7-26 paper_card 未补
- 风险:v34 §2.5 第 85 节点候选(agent 自我改进 bi-level discovery/verification 不对称)立标分量依赖 paper_card = pipeline 漏斗节点
- 建议归入:§4.1 开放问题 195 候选新增(arXiv:2607.21461 AREX paper_card 补建)
- 建议:Stephen 7-26 evening 协调棒 / Tom 7-26 evening 稿 / Jay 7-26 evening 稿 任一补建
3.2 矛盾 2 · arXiv:2607.12406 Isolation-as-First-Class paper_card 7-26 仍未建卡
- 冲突:flyp 7-25 1036 §二 精读论文 A 35KB 主稿 + spark 7-26 agent-e1prep §2.x + risk.md R29 §2.1 D 类 = paper_card 未建
- 风险:v34 §2.5 第 11 阶候选(agent 安全 survey anchor 边界中心组织)立标分量依赖 paper_card = pipeline 漏斗节点
- 建议归入:§4.1 开放问题 196 候选新增
- 建议:Stephen 7-26 evening 协调棒 / Tom 7-26 evening 稿 / Jay 7-26 evening 稿 任一补建
3.3 矛盾 3 · AutoIndex arXiv:2607.18603 7-26 仍未建卡
- 冲突:Stephen 7-26 1245 §3.2 已标 🔴 AutoIndex 7 日未建卡 = pipeline 漏斗节点
- 风险:v34 §2.3 第 56 节点 AutoIndex 已固化但 paper_card 缺 = 第八轮待补建卡或决断复用
- 建议归入:§4.1 开放问题 沿用
- 建议:Stephen 7-26 evening 协调棒 / Tom 7-26 evening 稿 / Jay 7-26 evening 稿 任一补建
3.4 矛盾 4 · Anthropic Claude Opus 5 vs Claude Fable 5 vs Claude Sonnet 5 关系待核
- 冲突:三模型矩阵形态分化(Opus 5 = 中等/bounded tasks · Fable 5 = 长时自主(数小时-数天)· Sonnet 5 = 更代理化 / 工具使用强)待 Anthropic 官网模型矩阵核证(stephen 7-26 ai-industry §2.x + spark 7-26 agent-e1prep §A 增量 1 + spark 7-26 agent-e1prep §增量 1)
- 风险:v34 §1.41 横切 60-66 立标密度 9 件(7-16 ~ 7-26 10 天内 5 个 frontier model 立标 = 7 天内 frontier model 立标密度最高一周 + Sonnet 5 + Managed Agents + Project Pilot = 9 件)= 关系未核会导致立标混乱
- 建议归入:§4.1 开放问题 198 候选新增(Anthropic 官网模型矩阵核证 Opus 5 vs Fable 5 vs Sonnet 5 关系)
- 建议:今晚活文档接手时先核 Opus 5 / Fable 5 / Sonnet 5 文档 + Anthropic 官网模型矩阵
3.5 矛盾 5 · Claude Sonnet 5 "代理化"具体定义 + 工具使用相对 4.6 提升幅度数字 + Sonnet 5 vs Opus 5 / Sonnet 5 vs Fable 5 head-to-head 评测 待核
- 冲突:stephen 7-26 ai-industry §2.x 矛盾 #1 + spark 7-26 agent-e1prep §2.1 矛盾 = 「更代理化的 Sonnet」 具体定义待 Anthropic 官方文档核证 + 工具使用相对 4.6 提升幅度待核
- 风险:v34 §1.41 横切 60-66 立标密度 9 件 vs 评论层立标 待核 = 影响 v34 §1.45 五向合流 立标分量
- 建议归入:§4.1 开放问题 198 候选新增(Claude Sonnet 5 "代理化"具体定义 + 工具使用相对 4.6 提升幅度数字)
- 建议:今晚活文档接手时先核 Sonnet 5 官方文档 + Anthropic 官网
3.6 矛盾 6 · Managed Agents effort 精度 vs OpenAI Reasoning effort / Gemini 3.6 Flash effort head-to-head 待核
- 冲突:stephen 7-26 ai-industry §2.x 矛盾 #2 = Managed Agents effort 精度 vs 现有 OpenAI Reasoning effort / Google Gemini 3.6 Flash effort 等竞争产品对比未给
- 风险:v34 §1.41 横切 60-66 立标密度 9 件 vs 评论层立标 待核 = 影响 v34 §1.45 五向合流 立标分量
- 建议归入:§4.1 开放问题 198 候选新增(Managed Agents effort 精度 vs OpenAI/Gemini effort)
- 建议:今晚活文档接手时先核 Anthropic Claude Developer Platform 文档 + OpenAI / Gemini effort 对比
3.7 矛盾 7 · Boris Cherny 「Opus 5 最不易被 prompt injection」评论出处 + Opus 5 PI evals / red team 完整版本 待核
- 冲突:jay 7-26 1000-rss-simon-willison 引语 + stephen 7-26 ai-industry §2.x 矛盾 #3 + Opus 5 system card 第 73 页埋没 论据 待 PDF 核
- 风险:v34 §1.41 横切 60-66 立标密度 9 件 vs 评论层立标 待核 = 影响 v34 §2.6 评测、可靠性与对抗 4 栖验证第 1 例 立标分量
- 建议归入:§4.1 开放问题 198 候选新增(Boris Cherny 评论出处 + Opus 5 PI evals / red team 完整版本)
- 建议:今晚活文档接手时先核 Opus 5 system card PDF + Boris Cherny 评论全文
3.8 矛盾 8 · AAAI 2026 Subramanian et al.「Keyword search is all you need」 + 同 LLM(Claude 3 Sonnet 200K 上下文)+ ReAct Agent 调用关键词工具 vs Bedrock Knowledge Base Titan Embeddings 向量检索 6 数据集 head-to-head —— 论文原文未精读 + GitHub 链接待补
- 冲突:jay 7-26 1106 rag-agent-llm-systems-briefing #3 + jay 7-26 1735 briefing 高价值 6 + spark 7-26 agent-e1prep §2.8 矛盾
- 风险:v34 §2.6 段末追加(AAAI 2026 Subramanian et al. RAG 范式转折)立标分量依赖论文原文 + GitHub 链接 + 6 数据集实验方法 + 与 v34 §1.43 Why Agents Fail + v34 §2.6 39 子节 Agent 生产失败三模式 + Compounding Error 0.85^10≈0.197 + Gartner 2027 40% 废弃预测 互补关系
- 建议归入:§4.1 开放问题 200 候选新增(AAAI 2026 论文原文 + GitHub 链接 + 6 数据集实验方法 + 主流 Agent 厂商是否完全弃用向量库)
- 建议:今晚活文档接手时先核 AAAI 2026 论文原文 + GitHub 链接 + jay 7-26 1106 rag-agent-llm-systems-briefing 原文
3.9 矛盾 9 · OpenClaw 210k stars(沿用 v34) vs GitHub 12,981 stars(2026-07-26 trending 实时数据) —— 数据传染/版本混淆
- 冲突:jay 7-26 1123 engineering-e1prep §警示 1 = 两个数字均来自真实数据,但 210k 可能是累计总数或跨平台合计,12,981 是 GitHub 主仓库当日数字
- 风险:v34 §3.2 争议 候选新增 30「OpenClaw Star 数版本混淆」= 立标分量依赖
- 建议归入:§3.2 争议 候选新增 30
- 建议:今晚活文档接手时先核 OpenClaw GitHub 主仓 vs 所有 fork vs 跨平台合计 vs CI/CD stars
3.10 矛盾 10 · Microsoft MAF Harness GitHub samples 实际 API + Klarna 一手财报数据 + Compounding Error 0.85^10≈0.197 假设 待核
- 冲突:jay 7-25 1055 engineering-filter 标注「需打开 Harness samples GitHub 提取实际 API 代码」+ jay 7-25 1105 substack SocialCrawl.ai 第三方汇总数据 vs Klarna 财报数据 + LangGraph 状态回传实际生产中步骤间误差并非完全独立
- 风险:v34 §1.33c 横切 53c 量化补全依赖「商业 Harness vs 学术 Harness 二分立标」= API 代码未核 + 一手数据未核 + 量化公式独立同分布假设 会导致立标分量打折
- 建议归入:§4.1 开放问题 199 候选新增(MAF Harness GitHub samples 实际 API + Klarna 一手财报数据 + Compounding Error 量化公式独立同分布假设)
- 建议:今晚活文档接手时先核 Microsoft DevBlogs + MAF Harness GitHub samples
./harness实际 API + Klarna 一手财报 + LangGraph 状态回传机制
3.11 矛盾 11 · Microsoft Agent Framework 1.0 发布日期(2026-04-03)未独立核验 + CSDN 智能体开发者社区 Enterprise LLM Agent 三层架构 是否同一框架待核
- 冲突:jay 7-26 1735 briefing #2 = Microsoft Agent Framework 1.0 发布日期(2026-04-03)未独立核验, 可能为 Alice Labs 博客日期 vs 实际 GitHub release tag 差
- 风险:v34 §1.33c 量化补全依赖 MAF Harness 与 Semantic Kernel + AutoGen 统一框架关系 = 关系未核会导致立标分量打折
- 建议归入:§4.1 开放问题 199 候选新增
- 建议:今晚活文档接手时先核 Microsoft DevBlogs + GitHub release tag + CSDN 智能体开发者社区 2026-07-11 Enterprise LLM Agent 三层架构
3.12 矛盾 12 · ReOPD prefix trap 实证 + 与同期 OPD / RLHF / DPO 离线 / 在线 agent 训练路线未对照
- 冲突:flyp 7-26 22:50 critical-read §3 反方 1 + 2 + 5 + 6 + 7 五项未在摘要层消除 = prefix trap 概念可命名但不可证伪 + 与同期离线 / 在线 agent 训练路线未对照(RLHF / DPO / Rejection Sampling FT / STaR / Self-Reflect)+ 多模态 / 工具调用泛化性未充分验证 + 「零工具调用训练」vs「零环境交互训练」边界不清 + step-decaying schedule 的超参敏感性 + 与其它 schedule 对比缺失 + 4× speedup 在不同 rollout 长度 / 任务难度下的鲁棒性未披露 + teacher reliability 度量 vs 学生 occupancy 度量的形式化定义
- 风险:v34 §2.4 14 件候选(ReOPD critical-read B 级 · 实战 recipe + 立标级候选)立标分量依赖 7-28/7-30 截止前必做 4 项(PDF 全文 + baseline 对照 + schedule 消融 + 多模态扩展)
- 建议归入:§4.1 开放问题 204 候选新增
- 建议:今晚活文档接手时先核 arXiv:2607.04763v2 PDF §3 prefix trap 形式化 + §4 实验表 + 附录 schedule 消融 + ablation
4. 涉及 arXiv 号列表(本次新增 + 邻接参考)
| 编号 | 来源 | 主分类 | 形态 | 涉及增量 | paper_card | HF Daily 7-26 |
|---|---|---|---|---|---|---|
| 2607.04763 | flyp 7-26 22:50 critical-read v2 + Tom 7-26 0840 ⭐⭐⭐ 沿用 + Tom 7-26 1440 沿用 + spark 7-26 agent-e1prep §3.5 沿用 + jay 7-26 engineering-e1prep §2.7 归类 + paper_card 576 已立 | agent | method | 增量 2 | 已立 576 | 8 票(7-26 续立) |
| 2607.21503 | flyp 7-26 15:50 ACM v2 critical-read + Tom 7-26 0840 ⭐ #1 + Tom 7-26 1440 沿用 + spark 7-26 agent-e1prep §3.5 沿用 + jay 7-26 1735 briefing 沿用 + risk.md R29 §2.1 C 类 | agent(rag 副 memory 副) | method | 增量 3 | 已立 564 | 0 票(7-26) |
| 2607.21461 | Tom 7-26 0840 ⭐ #1 沿用 + Tom 7-26 1440 沿用 + Tom 7-26 2040 沿用 + stephen 7-26 1245 + 2245 + spark 7-26 agent-e1prep §增量 7 P1 旁证 | agent | method | 邻接(agent 自我改进 bi-level discovery/verification 不对称) | 未建 | #1 117▲(7-25 当日 #1 · 7-26 续立) |
| 2607.21557 | Tom 7-26 0840 ⭐ #2 沿用 + Tom 7-26 1440 沿用 + Tom 7-26 2040 沿用 + flyp 7-26 risk-e1prep §0 + paper_cards/585 已立 | evaluation(agent 副) | method | 邻接(OpenForgeRL harness-native 训练基础设施) | 已立 585 | 5 票(7-26) |
| 2607.21051 | Tom 7-26 0840 沿用 + Tom 7-26 1440 沿用 + Tom 7-26 2040 沿用 + paper_cards/567 已立(7-24) | agent | method | 邻接(Sample-Efficient Learning from Agent Experience 样本效率) | 已立 567 | 10 票(7-26 续立) |
| 2607.20734 | Tom 7-26 0900 HF Daily #15 18▲ 续立 + paper_cards/569 已立(7-24) | agent | application | 邻接(LLMs Get Lost in Evolving User Intent 多轮意图演化跟踪) | 已立 569 | #15 18▲(7-24 #11 24▲ → 7-25 #15 15▲ → 7-26 #15 18▲) |
| 2607.20709 | Tom 7-26 0900 HF Daily #11 22▲ 续立 + stephen 7-26 ai-industry §1.5 + llm-application-e1prep 增量 3 + spark 7-26 agent-e1prep §增量 8 P1 旁证 | agent(method 副) | method | 邻接(NVIDIA-labs OO Agents 编程范式) | 未建 | #11 22▲(7-25 #11 19▲ → 7-26 #11 22▲ = +3 票) |
| 2607.20911 | Tom 7-26 0900 HF Daily #12 20▲ 续立 + stephen 7-26 ai-industry §1.5 + llm-application-e1prep 增量 3 + spark 7-26 agent-e1prep §增量 8 P1 旁证 | agent(benchmark 副) | benchmark | 邻接(Tencent WorkBuddy Bench 抗污染基准) | 未建 | #12 20▲(7-25 #12 18▲ → 7-26 #12 20▲ = +2 票) |
| 2607.19747 | Tom 7-26 0900 HF Daily #9 28▲ 续立 + paper_cards/547 已立(7-24) | rag(agent 副) | method | 邻接(Beyond Relevance-Centric Retrieval rubric-driven) | 已立 547 | #9 28▲(7-25 #9 27▲ → 7-26 #9 28▲ = +1 票) |
| 2607.12406 | flyp 7-25 1036 §二 沿用 + spark 7-26 agent-e1prep §增量 3 P0 沿用 + risk.md R29 §2.1 D 类 | agent(risk 副) | survey | 邻接(Isolation-as-First-Class 5 边界 survey) | 未建 | 未收录 |
| 2607.19191 | Tom 7-26 1440 沿用 v3 强制承接 + paper_cards 未建(7-26 沿用) | agent(multimodal 副 systems 副) | method | 邻接(ABot-World-0 单 GPU 无限交互推理基础设施) | 未建 | 7-24 #1 200▲(v3 强制承接 7-26) |
| 2607.21553 | Tom 7-26 0900 HF Daily #12 21▲ 续立 + paper_cards/574 已立(7-25) | multimodal | method | 邻接(SANA-Video 2.0 视频生成) | 已立 574 | #12 21▲(7-25 #12 15▲ → 7-26 #12 21▲ = +6 票) |
合计 7-26 coding-agents 主分类新增 arXiv 2 件(增量 2 + 增量 3 = 2607.04763 + 2607.21503 = 2 件 critical-read B 级 沿用升级)+ 邻接参考 10 件(增量 4 + 增量 5 + 增量 7 + 增量 8 + 沿用升级 = 2607.21461 + 2607.21557 + 2607.21051 + 2607.20734 + 2607.20709 + 2607.20911 + 2607.19747 + 2607.12406 + 2607.19191 + 2607.21553 = 10 件)= 12 件 arXiv 号;非 arXiv 旁证 14 件(增量 1 = Claude Sonnet 5 + Managed Agents effort 设置 + Boris Cherny 评论 + 评论层长尾 6 媒体 + Project Pilot + Project Glasswing + Economic Index/Fund + Public First Action = 8 件 + 增量 4 = AAAI 2026 Subramanian = 1 件 + 增量 5 = alibaba/open-code-review + citrolabs/ego-lite + andrewyng/aisuite + deepagents-ai/agent-backend + RyanCodrai/turbovec + 1000+ JD AI Engineer 画像 = 6 件 + 增量 7 = Microsoft Agent Framework 1.0 + Alice Labs 框架评分 = 2 件 = 17 件非 arXiv);v34 沿用 16 件(7-26 沿用升级 + HF Daily 票数续立/翻倍 + 平台层事件)
4.1 已立标沿用编号(本次继承不重复)
- 2607.04763 ReOPD / 2607.21503 Agentic Context Management / 2607.21557 OpenForgeRL / 2607.21461 AREX(待建卡) / 2607.12406 Isolation-as-First-Class(待建卡) / 2607.20734 LLMs Get Lost / 2607.21051 Sample-Efficient / 2607.20709 NVIDIA OO Agents(待建卡) / 2607.20911 Tencent WorkBuddy(待建卡) / 2607.19747 Beyond Relevance-Centric / 2607.21553 SANA-Video 2.0 / 2607.19191 ABot-World-0(待建卡) / 2607.20064v2 PRO-LONG / 2607.15550 SeerGuard / 2607.16617 DataFlow-Harness / 2607.18754 AgentDebugX / 2607.18213 SWE-Pruner Pro / 2607.18171 FlashRT / 2607.17986 Self-State Attacks / 2607.15434 Manager Coercion / 2607.15495 Anthropic J-space / 2607.07050 Tool-Call Boundary Drift / 2607.07820 DeepSearch-World / 2607.19297 LangGraph / 2607.18603 AutoIndex(7-26 仍未建卡) / 2607.18529 EduPanel / 2607.18772 RF-Agent / 2607.18825 AILQA / 2607.19865 DocOps / 2607.19058 SkewAdam / 2607.15263 Cost-Aware / 2607.06815 Behavioral Privacy / 2607.15657 Lucid / 2606.20683 Harness Survey / 2604.25850 AHE / 2607.19238 FinanceComplexQA —— 全部已在 v25 / v26 / v27 / v28 / v34 沿用 + 7-25 / 7-26 沿用升级
4.2 非 arXiv 但本主题重要参考
- Anthropic Claude Sonnet 5(7-22 ~ 7-26 releasebot.io + jay 7-26 1000-rss-simon-willison + stephen 7-26 1002-news-anthropic-news = 「更代理化的 Sonnet」 · 推理 / 工具使用 / 编码 / 知识工作相对 4.6 大幅提升 + Claude Enterprise 更细粒度的使用分析与模型授权管理)
- Claude Developer Platform Managed Agents effort 设置(7-22 · webhook 覆盖环境 / 记忆存储事件 + 会话播种事件流更新与版本检查 = Anthropic 平台层 agent 编排 第 2 立标 + 与 OpenAI Reasoning effort + Google Gemini 3.6 Flash effort 三者 effort 编排竞速)
- Anthropic 4 模型矩阵形态分化:Opus 5(中等/bounded tasks + 经济性 + Boris Cherny 评论 + 7-24 evening 立标首位)+ Fable 5(长时自主(数小时-数天))+ Mythos 5(网络安全/生物研究领先)+ Sonnet 5(更代理化 / 工具使用强)
- Project Glasswing(Anthropic 7-22 + stephen 7-26 1003-news-yt-anthropic = 保护全球软件安全)
- Anthropic Economic Index 连接器 + Economic Futures Research Fund 研究议程(Anthropic 7-24 evening + stephen 7-26 1002-news-anthropic-news = 经济测度 → Lobby → 经济学测度范式转折 第 3/4 件续立)
- Public First Action 2000 万美元捐赠(Anthropic 7-25 + stephen 7-26 1002-news-anthropic-news)
- Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGen(jay 7-26 1735 briefing 高价值 2 + aliceLabs.ai = 企业 Agent 框架 2026 H1 重大格局变动 + Alice Labs 框架评分新晋 S 级)
- Alice Labs 框架评分(alicelabs.ai/en/insights/best-ai-agent-frameworks-2026 · 18+ 生产部署经验):① LangGraph 1.0 GA(2025-10)+ Q2 2026 per-node timeout + durable streaming = S 级;② Claude Agent SDK renamed 2026-Q1 + hierarchical subagent spawning(2026-06)= S 级;③ Microsoft Agent Framework 1.0(2026-04-03)= 新晋 S 级;④ CrewAI 1.14(2026-05~06)= A 级;⑤ LlamaIndex Workflows 1.0(2026-06-22)= A 级;⑥ Pydantic AI V2(2026-06-23)= A 级;⑦ AG2 / AutoGen legacy = B 级
- 1000+ JD 量化 AI Engineer 画像(alexeyondata.substack.com):AI-first ≈70% / Python 82.5% / RAG 35.9% / Prompt Engineering 29.1% / Agents 编排框架 LangChain 18.8% / LangGraph 8.0% / LlamaIndex 5.8% / K8s 29.1% / AWS 40.1% / Azure 23.9% / GCP 23.0%
- GitHub Trending 6 件工程化栈:① alibaba/open-code-review(12,981 stars · 今日 +431 · 混合 LLM+规则引擎代码审查 · 确定性 pipeline + LLM Agent 双轨审查);② citrolabs/ego-lite(986 stars · Browser Agent 基础设施 · 共享登录态浏览器会话给 AI Agent);③ andrewyng/aisuite(统一多 GenAI 提供商接口 · 避免 vendor lock-in);④ deepagents-ai/agent-backend(AI Agent 分布式文件系统后端 · MCP Filesystem API + SSH + Docker · 长生命周期会话持久化);⑤ RyanCodrai/turbovec(Rust + Python bindings · 向量索引底层实现 · 基于 TurboQuant);⑥ 1000+ JD 量化 AI Engineer 画像
- AAAI 2026 Subramanian et al.「Keyword search is all you need」(buzzgrewal.medium.com · 同 LLM Claude 3 Sonnet 200K 上下文 · ReAct Agent 调用 pdfmetadata / rga / pdfgrep 等关键词工具 vs Bedrock Knowledge Base Titan Embeddings 向量检索 · 6 个数据集对比 · FinanceBench 30.40% vs 24.24% · 主流 Agent 产品 Claude Code / Cursor / Windsurf / Devin / Cline / Sourcegraph Amp 已转向工具调用检索)
- Claude Opus 5 评论层 7-25 ~ 7-26 6 媒体 48h 长尾:Google news + Simon Willison + Two Minute Papers + AI Explained + Ben's Bites + Gradient Flow 持续 48h 头条
- Microsoft MAF Harness · BUILD 2026 生产级 SDK(沿用 v34 第七轮 + jay 7-25 1055 engineering-filter · shell/filesystem 访问 + human-in-the-loop 审批流 + 长时会话上下文管理 + MCP 一体化 + .NET/Python 双语言)
- Boris Cherny 评论「Opus 5 是我们迄今为止最不易被 prompt 注入的模型」 + system card 第 73 页埋没 + 红队验证(沿用 v34 第七轮 + jay 7-26 1000-rss-simon-willison)
- Project Pilot: AI 模型能操控无人机吗?(Anthropic 7-24 evening 沿用 v34 第七轮)
- Enterprise LLM Agent 三层架构(Plan/Architect/Zulu)(CSDN 2026-07-11 沿用 v34 第七轮)
- Google ADK Go 2.0 DAG 编排(CSDN 2026-07-02 沿用 v34 第七轮)
- Klarna 2/3 咨询自动化 / $60M 节省 / 853 FTE 等效(SocialCrawl.ai 沿用 v34 第七轮)
- Compounding Error 0.85^10≈0.197 + Gartner 2027 40% 废弃预测(沿用 v34 第七轮)
- lopopolo/harness-engineering · GitHub ⭐ 2194(沿用 v34 第七轮)
- NousResearch/hermes-agent · GitHub 218K⭐(沿用 v34 第七轮)
- Graphify-Labs/graphify · GitHub 93K⭐(沿用 v34 第七轮)
- ByteDance/DeerFlow v2.0 · GitHub Trending #1(沿用 v34 第七轮)
- Self-Harness(上海 AI Lab · arXiv 占位 2606.xxxxx 待核)(沿用 v34 第七轮)
- Sebastian Raschka「使用本地 Coding Agent」(沿用 v34 第七轮)
- Lilian Weng「自改进的 Harness 工程」(沿用 v34 第七轮)
- Anthropic J-space arXiv:2607.15495(沿用 v34 第七轮)
- Cursor Router + OpenRouter Caching + Google Tunix(沿用 v34 第七轮)
- SkewAdam arXiv:2607.19058 MoE 优化器(沿用 v34 第七轮)
- ABot-World-0 arXiv:2607.19191 单 GPU 无限交互(沿用 v34 第七轮)
5. 本主题页活文档沿用 vs 新立关系总览(给今晚活文档接手时)
5.1 沿用项目(v25 / v26 / v27 / v28 / v34 已收录,7-25 沿用,7-26 沿用升级 + 平台层事件 + 票数续立)
- Kimi K3(Moonshot AI · 7-19 API + 7-27 开权 · SWE Marathon 42.0 / Program Bench 77.8 / Terminal-Bench 88.3 三榜 SOTA)
- FlashRT(arXiv:2607.18171 · deployment-time harness · 第六阶段)
- SWE-Pruner Pro(arXiv:2607.18213 · AHE「experience observability」· 第七阶段 harness 内化)
- Cost-Aware Security Agent(arXiv:2607.15263 · 评测第三维度)
- Behavioral Privacy Leakage(arXiv:2607.06815 · 安全第四维度)
- 4 RCE CVE(CVE-2026-61447 + 54769 + 57572 + 59726 · Orca Security 2026)
- IBM Model Routing 三大工程陷阱(2026-07-15)
- Microsoft Foundry / Copilot 五层 Harness(Marco Casalaina · ByteByteGo 2026-07-20)
- Harness Survey(arXiv:2606.20683 · 六维运行时分解 + Agent 工程四大范式演进)
- OpenDev(arXiv:2603.05344 · dual-agent terminal coding + lazy tool discovery + adaptive compaction)
- Production Playbook 12-pattern(Botlearn.ai · 2026)
- Kimi Code CLI(Moonshot 第二件 coding agent 落地)
- §2.1 Harness 学术化 9 阶段「时间点多向闭环 6 件 + Harness-as-Agent 第九阶段 7 件」
- §2.3 评测信任第 7 阶五联(Manager Coercion + Tool-Call Boundary Drift + DeepSearch-World + AutoIndex + LangGraph)
- §2.5 第 9 阶 + AgentDebugX + HACO + Manager Coercion = 7 维合并成熟
- Hy3 1bit 单卡 96GB 部署 + 1bit 提速 50% + llama.cpp MTP 60%
- vLLM v0.25.1 4 Bug + SGLang v0.5.15.post1 5 Bug = 9 Bug 矩阵(7-23 立标 + 7-24 沿用 + 7-25 沿用 + 7-26 沿用)
- SkewAdam(arXiv:2607.19058)MoE 三类参数分层优化器状态(7-23 立标 + 7-24 沿用 + 7-25 沿用 + 7-26 沿用)
- lopopolo/harness-engineering(⭐ 2194 · 7-23 立标 + 7-24 沿用 + 7-25 沿用 + 7-26 沿用)
- Sebastian Raschka「使用本地 Coding Agent」(7-23 立标 + 7-24 沿用 + 7-25 沿用 + 7-26 沿用)
- Lilian Weng「自改进的 Harness 工程」续沿用(7-23 续 + 7-24 沿用 + 7-25 续「自我改进 Harness 工程」续立 + 7-26 沿用)
- Anthropic J-space(arXiv:2607.15495 · 7-23 立标 + 7-24 沿用 + 7-25 沿用 + 7-26 沿用)
- Cursor Router + OpenRouter Caching + Google Tunix(7-23 立标 + 7-24 沿用 + 7-25 沿用 + 7-26 沿用)
- Kimi K3 7-27 开权前夜生态补漏 7 件(7-23 立标 + 7-24 沿用 + 7-25 沿用 + 7-26 沿用)
- Agentic Context Management(arXiv:2607.21503 · 7-24 立标 + 7-25 沿用升级 + 7-26 critical-read v2 B 级 监控清单 · paper_cards/564 已立)
- Sample-Efficient(arXiv:2607.21051 · 7-24 立标 + 7-25 沿用升级 + 7-26 沿用 · paper_cards/567 已立)
- ReOPD(arXiv:2607.04763 · 7-24 立标 + 7-25 沿用升级 + 7-26 critical-read v2 B 级 实战 recipe + 立标级候选 · paper_cards/576 已立)
- LLMs Get Lost in Evolving User Intent(arXiv:2607.20734 · 7-24 立标 + 7-25 沿用升级 + 7-26 HF Daily #15 18▲ 续立 · paper_cards/569 已立)
- FinanceComplexQA(arXiv:2607.19238 · 7-24 立标 + 7-25 沿用升级 + 7-26 沿用 · paper_cards/575 已立)
- Beyond Relevance-Centric(arXiv:2607.19747 · 7-24 立标 + 7-25 沿用升级 + 7-26 HF Daily #9 28▲ 续立 · paper_card 已立 547)
- SeerGuard(arXiv:2607.15550 · 7-24 立标 + 7-25 沿用升级 + 7-26 沿用 · paper_card 未建)
- AI Workflow Store(arXiv:2605.10907 · 7-24 立标 + 7-25 沿用 + 7-26 沿用)
- Context Engineering(arXiv:2603.09619 · 7-24 立标 + 7-25 沿用 + 7-26 沿用)
- AgentCI MCP 安全 + GitHub Agentic Workflows 6 层 + Block Goose(7-24 立标 + 7-25 沿用 + 7-26 沿用)
- PRO-LONG(arXiv:2607.20064v2 · 7-24 立标 + 7-25 沿用升级 + 7-26 沿用)
- OpenForgeRL(arXiv:2607.21557 · 7-25 立标 + 7-26 沿用 · paper_cards/585 已立)
- Isolation-as-First-Class(arXiv:2607.12406 · 7-25 立标 + 7-26 沿用 · paper_card 未建)
- AREX(arXiv:2607.21461 · 7-25 立标 + 7-26 HF Daily #1 117▲ 续立 · paper_card 未建)
- Anthropic Opus 5 系统卡 + Boris Cherny 评论(7-25 立标首位 + 7-26 评论层长尾 6 媒体 48h 续立)
- Project Pilot + Economic Index/Fund(7-25 沿用 + 7-26 沿用)
- Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0(7-25 立标 + 7-26 沿用升级 + Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGen 7-26 沿用升级)
- Klarna 2/3 / $60M / 853 FTE(7-25 沿用 + 7-26 沿用)
- Compounding Error 0.85^10≈0.197(7-25 立标 + 7-26 沿用)
- NVIDIA-labs OO Agents(arXiv:2607.20709 · 7-25 立标 + 7-26 HF Daily #11 22▲ 续立 · paper_card 未建)
- Tencent WorkBuddy Bench(arXiv:2607.20911 · 7-25 立标 + 7-26 HF Daily #12 20▲ 续立 · paper_card 未建)
- MSR SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt 五栖合流(7-25 沿用 + 7-26 沿用)
- δ-mem(AlphaSignal Substack · 7-25 沿用 + 7-26 沿用)
- ABot-World-0(arXiv:2607.19191 · 7-25 立标 + 7-26 沿用 v3 强制承接 · paper_card 未建)
5.2 新立项目(本轮 7-26 增量 = 2 件 P0 主线 critical-read 沿用升级 + 4 件 P0 沿用升级 + 3 件 P1 旁证)
- §1.41 横切 60-66 v23 七件主轴 升为九件主轴(本轮 7-26 第一强新增):
- Anthropic Claude Sonnet 5(7-22 ~ 7-26) —— "更代理化的 Sonnet" · 推理 / 工具使用 / 编码 / 知识工作相对 4.6 大幅提升 + Claude Enterprise 更细粒度的使用分析与模型授权管理 + 与 Opus 5 中等/bounded tasks + Fable 5 长时自主 + Mythos 5 网络安全形成 4 模型矩阵形态分化第二例(stephen 7-26 ai-industry §A 增量 1 + 0910 + 1002-news-anthropic-news + jay 7-26 1000-rss-simon-willison + 1003-news-yt-anthropic + spark 7-26 agent-e1prep §增量 1)
- Claude Developer Platform Managed Agents effort 设置(7-22) —— Anthropic 平台层 agent 编排 第 2 立标 + 与 OpenAI Reasoning effort + Google Gemini 3.6 Flash effort 三者 effort 编排竞速(stephen 7-26 ai-industry §A 增量 1)
- §2.4 后训练 Agentic RL 训练栈 13 → 14 件候选(本轮 7-26 第二强新增):
- arXiv:2607.04763 ReOPD critical-read v2 —— B 级 · 实战 recipe + 立标级候选 3.4/5 · 「prefix trap」 概念 + step-decaying 采样 schedule + ≥ 4× speedup + 零工具调用 · 与 OpenForgeRL 同向「Agent 训练工程化复用」立标 · paper_cards/576 已立 · 7-28/7-30 截止前必做 4 项(flyp 7-26 22:50 critical-read v2 + Tom 7-26 0840 + 1440 + 2040 + spark 7-26 agent-e1prep §3.5 + jay 7-26 engineering-e1prep §2.7)
- §2.4 记忆 / 长视野 8 件 沿用升级 + 加注 ACM 反方记录(本轮 7-26 第三强新增):
- arXiv:2607.21503 Agentic Context Management v2 critical-read —— B 级 · 监控清单 + 实战 recipe + 立标级候选 3.6/5 · 反方 7 条硬标签 + 「Maximem Synap SaaS 营销 vs 学术实证边界 + 五原语可证伪性弱 + 多模态特殊性回避 + 与同期 SOTA 未对照 + decision-level / org-level 实证缺失 + 经济性论点未披露 + 成本/延迟/上下文腐烂 综合维度未覆盖」 · 与 PRO-LONG 二联对照 · 沿用 risk.md R29 §2.1 C 类立标 · paper_cards/564 已立 · 7-30 截止前必做 4 项(flyp 7-26 15:50 critical-read v2 + Tom 7-26 0840 + 1440 + spark 7-26 agent-e1prep §3.5 + jay 7-26 1735 briefing + flyp 7-26 risk-e1prep §0)
- §2.6 多模态 / IDE / CLI / 工具退化 段末追加(本轮 7-26 第四强新增):
- AAAI 2026 Subramanian et al.「Keyword search is all you need」 —— Agentic 搜索工具调用 vs 向量检索 6 数据集 head-to-head + FinanceBench 关键词搜索 30.40% vs 向量搜索 24.24% + 主流 Agent 厂商 Claude Code / Cursor / Windsurf / Devin / Cline / Sourcegraph Amp 已转向工具调用检索 = RAG 范式转折新立标候选(jay 7-26 1106 + 1735 briefing + spark 7-26 agent-e1prep §2.8)
- §1.33c 横切 53c 量化补全 + §2.7 行业与平台动态(本轮 7-26 第五强新增):
- Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGen —— 企业 Agent 框架 2026 H1 重大格局变动 + Alice Labs 框架评分新晋 S 级(jay 7-26 1735 briefing 高价值 2 + aliceLabs.ai)
- GitHub Trending 6 件工程化栈 —— alibaba/open-code-review(混合 LLM+规则引擎代码审查 · 12,981 stars · 今日 +431)+ citrolabs/ego-lite(Browser Agent 基础设施 · 共享登录态浏览器会话给 AI Agent)+ andrewyng/aisuite(统一多 GenAI 提供商接口 · 避免 vendor lock-in)+ deepagents-ai/agent-backend(MCP Filesystem API + SSH + Docker · 长生命周期会话持久化)+ RyanCodrai/turbovec(Rust + Python bindings · 基于 TurboQuant)(jay 7-26 0935 + 1123 engineering-e1prep)
- 1000+ JD 量化 AI Engineer 画像 —— AI-first ≈70% / Python 82.5% / RAG 35.9% / Prompt Engineering 29.1% / Agents 编排框架 LangChain 18.8% / LangGraph 8.0% / LlamaIndex 5.8% / K8s 29.1% / AWS 40.1% / Azure 23.9% / GCP 23.0%(jay 7-26 0935 github-trending + alexeyondata.substack.com)
- §2.103 段尾"评论层长尾 7-25 ~ 7-26 6 媒体续立"标注(本轮 7-26 第六强新增):
- Claude Opus 5 评论层 7-25 ~ 7-26 6 媒体 48h 持续长尾 —— Two Minute Papers「Claude 揭示 AI 最大问题」+ AI Explained「Claude Fable 被封禁」+「Claude Fable 5 完整 319 页拆解」+ Boris Cherny「Opus 5 是我们迄今为止最不易被 prompt 注入的模型」+ Fable 5 vs GPT 5.6 Sol 早期结果 + Gradient Flow 三款前沿级模型集中观察 = 评论层长尾 7-25 ~ 7-26 持续 48h 6 媒体续立(stephen 7-26 ai-industry §E 增量 6 + jay 7-26 1000-rss-simon-willison + flyp 7-26 1002-rss-yt-two-minute-papers + 1003-rss-yt-ai-explained + spark 7-26 1000-rss-gradient-flow)
- §3.2 争议 候选新增 30 + §4.1 开放问题 候选新增 198-208(本轮 7-26 第七新增):
- OpenClaw 210k stars vs GitHub 12,981 stars 数据传染警示 —— 数据传染/版本混淆待核 + v34 §3.2 争议 候选新增 30(jay 7-26 1123 engineering-e1prep §警示 1)
- §2.3 评测表 + §2.6 段末追加 + §1.33c 量化补全 沿用升级(本轮 7-26 第八新增):
- HF Daily 7-26 主榜 4 件 coding-agents 邻接条目票数续立/翻倍 —— AREX 117▲ + Beyond Relevance-Centric 28▲ + NVIDIA OO Agents 22▲ + Tencent WorkBuddy 20▲ + LLMs Get Lost 18▲ + SANA-Video 2.0 21▲(Tom 7-26 0900 HF Daily + spark 7-26 agent-e1prep §增量 1-9)
5.3 主题页结构变化建议(给今晚活文档接手时)
- §1 现状全景:从 11 阈值(7-25 04:20 v34 已升格 11 阈值)沿用升级,扩为 12 阈值 = + Anthropic Claude Sonnet 5 + Managed Agents effort 设置(frontier lab 7-22 ~ 7-26 平台层 agent 编排 第 7-8 立标 + 4 模型矩阵形态分化)
- §1.41 横切 60-66 v23 七件主轴:从 7 件(7-25 沿用 Opus 5 首位)扩为 9 件(7-26 新增 Sonnet 5 + Managed Agents effort 设置 = "Anthropic 7-22 ~ 7-26 平台层 agent 编排 5 件合并 + 4 模型矩阵形态分化")
- §1.33c 横切 53c AI Agents Stack 2026 Harness 层:从 5 件(MAF Harness / 文心快码 / Google ADK Go 2.0 / Klarna 853 FTE + Enterprise LLM Agent 三层)扩为 11 件(沿用 5 件 + Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGen + Alice Labs 框架评分新晋 S 级 + GitHub Trending 6 件 + 1000+ JD AI Engineer 画像)
- §1.45 五向合流:沿用升级,邻接补全「Anthropic 7-22 ~ 7-26 平台层 + 评论层 + 资本层 四线齐扩(Sonnet 5 + Managed Agents + Opus 5 评论层长尾 6 媒体 + Project Glasswing + Economic Index/Fund + Public First Action 2000 万美元)」
- §1.45 frontier lab 4 栖验证:沿用升级,加注「Claude Sonnet 5 系统卡 待核 + Managed Agents effort 设置 head-to-head 待核 + Anthropic 4 模型矩阵形态分化(OPUS + Fable + Mythos + Sonnet)」
- §2.1 Harness 学术化:从 9 阶段(7-24 v34 第九阶段「Harness-as-Agent 7 件」)沿用升级,段末追加「Sonnet 5 + Managed Agents platform-level agent 编排 + ReOPD critical-read 训练工程化复用」
- §2.3 评测基础设施分层 21 行:沿用升级,邻接补全「Beyond Relevance-Centric HF Daily 7-26 28▲ 续立 + AREX HF Daily 7-26 117▲ 续立 + AAAI 2026 Subramanian 第 22 行候选(工具调用派 vs 向量检索派 对立)」
- §2.4 记忆 / 长视野 8 件:从 8 件(7-25 立标 + Sample-Efficient + ReOPD 沿用升级)沿用升级,加注 ACM v2 critical-read B 级 监控清单 + 反方 7 条记录 + ReOPD v2 critical-read B 级 实战 recipe + 立标级候选 第 14 件候选 + 加注「Agent Memory 4 路线段末追加(完整日志 PRO-LONG + 生命周期 ACM + Skill 训练 SkillOpt/Memora + steering adapter δ-mem)」沿用
- §2.4 后训练与训练-评测双闭环 Agentic RL 训练栈:从 13 件(7-24 立标)沿用升级,ReOPD critical-read v2 第 14 件候选(实战 recipe + 立标级候选)邻接补全 + Agent 训练工程化复用 OpenForgeRL + ReOPD + Sample-Efficient 三栖合流
- §2.5 安全契约:从 7 维 + 第 9 阶 + 第 10 阶扩为 7 维 + 第 9 阶 + 第 10 阶 + 第 11 阶(agent 安全 survey anchor 边界中心组织)+ ACM 反方记录 沿用(沿用 v34 第七轮 + ACM v2 critical-read 沿用升级)
- §2.6 多模态 / IDE / CLI / 工具退化:从 14 件(7-24 立标)沿用升级,段末追加 7 段(Sonnet 5 + Managed Agents + 评论层长尾 6 媒体 + Project Glasswing + Boris Cherny 评论 + Subramanian RAG 范式转折 + GitHub Trending 6 件 + AI Engineer 画像 + ReOPD critical-read + ABot-World-0 单 GPU 无限交互 = 「训练 + 推理基础设施」双层栈合流)
- §3.1 共识:从 25 条扩为 30 条(+ frontier lab 模型矩阵形态分化第二例 = Sonnet 5 更代理化 vs Opus 5 中等/bounded tasks vs Fable 5 长时自主 vs Mythos 5 网络安全 + Agent 训练工程化复用 = OpenForgeRL 训练栈 + ReOPD 训练数据 + Sample-Efficient 样本效率 三栖合流 + ACM 沿用升级 + Agentic 搜索工具调用 = 向量检索替代方案 + AI Engineer 画像 = Python 82.5% / RAG 35.9% / K8s 29.1% / AWS 40.1% = AI Engineer 职业化实证 = 5 条)
- §3.2 争议:从 27 条扩为 29 条(+ ACM 反方 7 条硬标签 + OpenClaw 210k vs GitHub 12,981 stars 数据传染/版本混淆 = 2 条)
- §4 开放问题:从 36 条扩为 45 条(+ ReOPD 7-28/7-30 截止前必做 4 项 + ACM 7-30 截止前必做 4 项 + Anthropic 7-22 ~ 7-26 模型矩阵 head-to-head + Managed Agents effort 精度 vs OpenAI/Gemini effort + Boris Cherny 评论出处 + AAAI 2026 论文原文 + alibaba/open-code-review vs CodeRabbit / GitHub Copilot Review 架构差异 + AI Engineer 画像 RAG 35.9% 同时反映采用率与失败率 + OpenClaw Star 数版本混淆 + Microsoft MAF Harness vs HF Harness vs OpenForgeRL 三栈 head-to-head + Gartner 2027 40% vs Berkeley RDI 40% 交叉核 + Klarna 一手财报数据核 + Microsoft Agent Framework 1.0 发布日期核证 + arXiv:2607.21461 AREX paper_card 补建 + arXiv:2607.12406 Isolation-as-First-Class paper_card 补建 + AutoIndex arXiv:2607.18603 paper_card 补建 = 9 条)
- §5 趋势:从 24 条扩为 29 条(+ Anthropic 7-22 ~ 7-26 平台层 agent 编排 5 件合并 + Agent 训练工程化复用 OpenForgeRL + ReOPD 二联对照 + ACM 沿用升级 + Agentic 搜索 RAG 范式转折 + GitHub Trending 6 件 + AI Engineer 画像 = 5 条)
- §6 必读清单:从 114 条扩为 130 条(+ arXiv:2607.04763 ReOPD critical-read v2 + arXiv:2607.21503 ACM critical-read v2 + Anthropic Sonnet 5 + Managed Agents effort 设置 + Boris Cherny 评论 + 评论层长尾 6 媒体 + Project Glasswing + Project Pilot + Microsoft Agent Framework 1.0 + Alice Labs 框架评分 + alibaba/open-code-review + citrolabs/ego-lite + andrewyng/aisuite + deepagents-ai/agent-backend + RyanCodrai/turbovec + 1000+ JD AI Engineer 画像 + AAAI 2026 Subramanian et al. = 2 件 arXiv + 14 件非 arXiv = 16 件新必读)
6. 本主题与邻接主题的边界提示
- 与
agent.md(通用 agent 主题页)分工:arXiv:2607.04763 ReOPD critical-read + arXiv:2607.21503 ACM critical-read + Anthropic Sonnet 5 + Managed Agents effort 设置 + Microsoft Agent Framework 1.0 + GitHub Trending 6 件 + AAAI 2026 Subramanian + 评论层长尾 6 媒体 14 件 跨「通用 agent」+「编码 agent」双重立标 —— spark 7-26 agent-e1prep §增量 1-9 同源;本主题页仅沿用 14 件主题窗内强相关内容, 不重述 spark 主题组 A - 与
risk.md(风险主题页)分工:arXiv:2607.12406 Isolation-as-First-Class + ACM 反方 7 条硬标签 + Anthropic Opus 5「prompt injection 最难」 评论 + Self-State Attacks + AgentCI MCP 安全 + arXiv:2607.20064v2 PRO-LONG「不设 memory = 不存在 memory 攻击面」 由 risk.md / 主题页双向 reference;flyp 7-26 risk-e1prep §0 已建议 R30 §2.1 C 类 ACM 段尾加 7-26 15:50 flyP 反方记录 + §2.103 Opus 5 段尾加 7-25 ~ 7-26 6 媒体评论层长尾标注 + R29 §7.2 P0 #3 Petri 复现路径 = OpenForgeRL 路径沿用;本主题页主要在 §2.4 引「ACM v2 critical-read B 级 · 监控清单 + 反方 7 条记录」+ §2.5 第 11 阶 + Opus 5 评论层长尾 + AgentCI MCP 安全 工业级风险立标 - 与
llm-infra.md(推理基础设施主题页)分工:arXiv:2607.21557 OpenForgeRL proxy + Kubernetes orchestrator + wall-clock timeout + 6 harness × 6 基准 + ABot-World-0 arXiv:2607.19191 单 GPU 无限交互 = 「训练 + 推理基础设施」 双层栈合流 + arXiv:2607.21051 Sample-Efficient + arXiv:2607.04763 ReOPD critical-read + vLLM v0.25.1 4 Bug + SGLang v0.5.15.post1 5 Bug + SkewAdam(arXiv:2607.19058)+ Google Tunix + Cursor Router + Kimi K3(896 experts)+ DeepSearch-World(86▲ 票沿用) 推理工程跨主题页;本主题在 §2.4 引「OpenForgeRL + ReOPD critical-read + ABot-World-0 训练 + 推理基础设施双层栈」+ §2.4 引「编码 Agent 经验蒸馏双轨 + ReOPD critical-read 第 14 件候选」+ §2.6 引「编码 Agent 推理基础设施 9 Bug 矩阵」 - 与
multimodal.md(多模态主题页)分工:flyp 7-26 1000-rss-cameron-wolfe「Agentic World Models + Agentic RL + Agent 评估」 三连 + ABot-World-0 + flyp 7-24 22:50 Cameron Wolfe「Agentic World Models」 Substack 思想线索 + flyp 7-23 0950 ABot-World-0 + flyp 7-24 09:50 Self Gradient Forcing + Anchor-Align + flyp 7-26 0950-Structured-Dynamics-Model-position-paper-critical-read 多模态与本主题「世界模型推理 + 编码 Agent 上下文管理」同源;本主题仅在 §1 现状全景 「第十二阈值 = Anthropic Sonnet 5 + Managed Agents effort 设置(frontier lab 7-22 ~ 7-26 平台层 agent 编排 第 7-8 立标 + 4 模型矩阵形态分化)」 旁证引用 flyp 7-26 1000-rss-cameron-wolfe 三连 + ABot-World-0 一行 - 与
evaluation.md(评测方法学主题页)分工:AAAI 2026 Subramanian et al.「Keyword search is all you need」(arXiv 待核)+ LLMs Get Lost in Evolving User Intent(arXiv:2607.20734)+ FinanceComplexQA(arXiv:2607.19238)+ Sample-Efficient + ReOPD critical-read + Beyond Relevance-Centric(arXiv:2607.19747)+ AREX + Compounding Error 0.85^10≈0.197 + HF Daily 7-26 票数续立/翻倍 8 件 评测方法学跨主题页 —— evaluation.md 主立评测方法学通用部分;本主题在 §2.3 引「Tencent WorkBuddy 抗污染基准 + Beyond Relevance-Centric HF Daily 7-26 28▲ 续立 + AREX HF Daily 7-26 117▲ 续立」 + §2.6 引「LLMs Get Lost HF Daily 7-26 #15 18▲ 续立 + 金融 Agentic Reasoning 基准 + Compounding Error 0.85^10≈0.197 + AREX recursive self-improvement deep research + AAAI 2026 Subramanian RAG 范式转折」 - 与
inference.md(推理基础设施主题页)分工:OpenForgeRL + ABot-World-0 + Sample-Efficient + ReOPD critical-read + KV Cache 优化 + Cursor Router + Kimi K3(896 experts)+ SkewAdam(MoE 优化器)+ DeepSearch-World(86▲ 票沿用)+ HF Daily 7-26 票数续立/翻倍 推理工程跨主题页;本主题在 §2.5 引「OpenForgeRL + ABot-World-0 训练 + 推理基础设施双层栈」+ §2.4 引「Sample-Efficient + ReOPD critical-read 第 14 件候选双轨范式」+ 「编码 Agent 经验蒸馏」 - 与
ai-industry.md(AI 行业主题页)分工:Anthropic Claude Sonnet 5 + Managed Agents effort 设置 + Opus 5 评论层长尾 6 媒体 + Project Glasswing + Economic Index/Fund + Boris Cherny 评论 + Public First Action 2000 万美元 + Microsoft Agent Framework 1.0 + Alice Labs 框架评分 = frontier lab 7-22 ~ 7-26 平台层 + 评论层 + 资本层 四线齐扩 由 ai-industry 主立,本主题在 §1 引「Anthropic Sonnet 5 + Managed Agents 立标 7-8 件 + 4 模型矩阵形态分化」+ §1.41 横切 60-66 升九件主轴 + §2.6 段末追加 7 段(Sonnet 5 + Managed Agents + 评论层长尾 6 媒体 + Project Glasswing + Boris Cherny 评论 + Subramanian + GitHub Trending 6 件 + AI Engineer 画像)」+ §1.45 frontier lab 4 栖验证 第 2 例(评测 → 系统卡 → 评论 → 红队) + §1.45 五向合流(Anthropic 7-22 ~ 7-26 平台层 + 评论层 + 资本层 四线齐扩)
7. 补充:与今晚活文档(2026-07-26 v34 第八轮接力窗口)的本主题边际贡献
7.1 边际贡献 vs 昨晚活文档(2026-07-25 v34 第七轮已饱和 + 7-25 E1 8 件立标)
- 沿用项目:Kimi K3 + FlashRT + SWE-Pruner Pro + Cost-Aware + Behavioral Privacy + 4 RCE CVE + IBM Routing + Microsoft Foundry + Harness Survey + OpenDev + Production Playbook 12-pattern + Kimi Code CLI + v34 §2.1 第八阶段 6 件 + v34 §2.1 第九阶段 Harness-as-Agent 7 件 + v34 §2.3 评测第 7 阶五联 + v34 §2.5 第 9 阶 + Hy3 1bit + Hermes-Agent + Graphify + Self-Harness 占位 + DeerFlow v2.0 + HACO + AgentDebugX + lopopolo + Sebastian Raschka + Lilian Weng + Anthropic J-space + Cursor Router + OpenRouter Caching + Google Tunix + Kimi K3 7-27 开权前夜生态补漏 7 件 + vLLM/SGLang 9 Bug 矩阵 + SkewAdam + PRO-LONG + Agentic Context Management + Sample-Efficient + ReOPD + LLMs Get Lost + FinanceComplexQA + Beyond Relevance-Centric + SeerGuard + AgentCI MCP 安全 + AI Workflow Store + Context Engineering + GitHub Agentic Workflows 6 层 + Block Goose + OpenForgeRL + Isolation-as-First-Class + AREX + Anthropic Opus 5 + Boris Cherny 评论 + Project Pilot + Economic Index/Fund + Microsoft MAF Harness + Enterprise LLM Agent 三层架构 + Google ADK Go 2.0 + 文心快码/Microsoft MAF/AWS Blocks 对比 + Klarna 2/3 / $60M / 853 FTE + Compounding Error 0.85^10≈0.197 + Gartner 2027 40% + NVIDIA OO Agents + Tencent WorkBuddy + MSR SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt + δ-mem + ABot-World-0 单 GPU 无限交互 + Lilian Weng 7-25「自我改进 Harness 工程」 续立 + Cameron Wolfe 7-25 agentic 三连 = 56 件
- 新立项目(本轮 7-26):2 件 P0 主线 critical-read(ReOPD + ACM)+ 4 件 P0 沿用升级(Sonnet 5 + Managed Agents + Subramanian + 评论层长尾 6 媒体 + GitHub Trending 6 件 + AI Engineer 画像 + Microsoft Agent Framework 1.0 + Alice Labs 框架评分)+ 3 件 P1 旁证(OpenClaw 210k vs GitHub 12,981 stars 数据传染 + HF Daily 7-26 4 件票数续立/翻倍 + Boris Cherny 评论长尾)= 25 件新立候选(其中 5 件 = §1.41 横切 60-66 升九件主轴 + §2.4 加注 ACM v2 critical-read 反方 7 条记录 + §2.4 加注 ReOPD v2 critical-read 第 14 件候选 + §1.33c 量化补全 6 件 + §2.6 段末追加 7 段 + §2.103 段尾"评论层长尾"标注 + §3.2 争议候选新增 30 + §4.1 开放问题候选新增 9 条 + §6 必读清单扩为 130 条)
7.2 给今晚 v34 第八轮接力的优先级排序
- 【P0】增量 1:Anthropic Claude Sonnet 5(7-22 ~ 7-26) + Managed Agents effort 设置(stephen 7-26 ai-industry §A 增量 1 + 0910 + 1002-news-anthropic-news + jay 7-26 1000-rss-simon-willison + 1003-news-yt-anthropic + spark 7-26 agent-e1prep §增量 1)= 最大新立增量 + frontier lab 7-22 ~ 7-26 平台层 agent 编排 第 7-8 立标 + 4 模型矩阵形态分化 + §1.41 横切 60-66 升九件主轴 + §1.45 frontier lab 4 栖验证 第 2 例
- 【P0】增量 2:arXiv:2607.04763 ReOPD critical-read v2(flyp 7-26 22:50 精读主稿 9.5KB · Tom 7-26 0840 + 1440 + 2040 + spark 7-26 agent-e1prep §3.5 + jay 7-26 engineering-e1prep §2.7 · paper_cards/576 已立 · B 级 · 实战 recipe + 立标级候选 3.4/5)= Agent 训练工程化复用 第 2 件 · 「prefix trap」 概念 + step-decaying schedule + ≥ 4× speedup + 零工具调用 · 与 OpenForgeRL 同向「训练数据复用 + 训练栈复用」二联对照 + §2.4 第 14 件候选
- 【P0】增量 3:arXiv:2607.21503 Agentic Context Management v2 critical-read(flyp 7-26 15:50 精读主稿 13.0KB · Tom 7-26 0840 + 1440 + spark 7-26 agent-e1prep §3.5 + jay 7-26 1735 briefing + flyp 7-26 risk-e1prep §0 · paper_cards/564 已立 · B 级 · 监控清单 + 实战 recipe + 立标级候选 3.6/5)= 反方 7 条硬标签 + 「Maximem Synap SaaS 营销 vs 学术实证边界」 + 与 PRO-LONG 二联对照 · 沿用 risk.md R29 §2.1 C 类 + §2.4 加注反方记录
- 【P0】增量 4:AAAI 2026 Subramanian et al.「Keyword search is all you need」Agentic 搜索替代向量检索(jay 7-26 1106 + 1735 briefing + spark 7-26 agent-e1prep §2.8 · 论文原文未精读 + GitHub 链接待补 · paper_card 未建)= RAG 范式转折新立标候选 + §2.6 段末追加 + §1.33c Harness 层 旁证 + 主流 Agent 厂商已采纳
- 【P0】增量 5:GitHub Trending 6 件工程化栈 + 1000+ JD AI Engineer 画像 + Microsoft Agent Framework 1.0 + Alice Labs 框架评分(jay 7-26 0935 + 1123 engineering-e1prep + 1735 briefing + aliceLabs.ai)= §1.33c 横切 53c Harness 层 商业开源 SDK 立标补全 第 6-11 件 + 企业级 Multi-Agent 量化数字立标 + §2.7 行业与平台动态 邻接
- 【P0】增量 6:Claude Opus 5 评论层 7-25 ~ 7-26 6 媒体 48h 持续长尾 + Boris Cherny 评论 + Project Glasswing(stephen 7-26 ai-industry §E 增量 6 + jay 7-26 1000-rss-simon-willison + flyp 7-26 1002-rss-yt-two-minute-papers + 1003-rss-yt-ai-explained + spark 7-26 1000-rss-gradient-flow)= §2.103 段尾"评论层长尾"标注 + §3.1 共识 #112 续立 + frontier lab 4 栖验证 第 1 例
- 【P1】增量 7:Microsoft Agent Framework 1.0(2026-04-03)统一 Semantic Kernel + AutoGen + Alice Labs 框架评分新晋 S 级(jay 7-26 1735 briefing 高价值 2 + aliceLabs.ai)= 企业 Agent 框架 2026 H1 重大格局变动 + §1.33c 量化补全 + §2.7 行业与平台动态 邻接
- 【P1】增量 8:OpenClaw 210k stars vs GitHub 12,981 stars 数据传染警示 + HF Daily 7-26 主榜 4 件 coding-agents 邻接条目票数续立/翻倍(jay 7-26 1123 engineering-e1prep §警示 1 + Tom 7-26 0900 HF Daily + spark 7-26 agent-e1prep §增量 1-9)= §3.2 争议 候选新增 30 + §4.1 开放问题 候选新增 198-208 + §2.3 + §2.6 + §1.33c 沿用升级
- 【P2】Anthropic Sonnet 5 vs Opus 5 vs Fable 5 vs Mythos 5 head-to-head + Managed Agents effort 精度 vs OpenAI/Gemini effort + Boris Cherny 评论出处 + Opus 5 PI evals / red team 完整版本 待核(stephen 7-26 ai-industry §2.x 矛盾 + spark 7-26 agent-e1prep §2.1 + jay 7-26 1000-rss-simon-willison)= §4.1 开放问题 198 候选新增
- 【P2】arXiv:2607.21461 AREX + arXiv:2607.12406 Isolation-as-First-Class + AutoIndex arXiv:2607.18603 paper_card 7-26 仍未建卡(stephen 7-26 1245 §3.2 已标 🔴 AREX 7-26 HF Daily #1 117▲ 当日 #1 但 7-26 paper_card 未补 + Isolation-as-First-Class 沿用 + AutoIndex 7 日未建卡)= §4.1 开放问题 195-197 候选新增
7.3 给今晚活文档接手时的语言风格提示
- v34 第八轮在 7-26 evening ~ 7-27 04:20 窗口下饱和(11 阈值已升为 12 + 9 阶段沿用 + 21 行 + 25 共识 → 30 + 27 争议 → 29 + 36 开放 → 45 + 24 趋势 → 29 + 114 必读 → 130)——本场新立增量克制使用「立标」「SOTA」「重大立标」等高强度词,优先用「7-26 候选」「v34 第八轮升格辅助」「沿用 + 增量」「补漏」「§1.41 升九件主轴」「§2.4 加注 ACM v2 critical-read 反方 7 条记录」「§2.4 加注 ReOPD v2 critical-read 第 14 件候选」「§1.33c 量化补全 6 件」「§2.6 段末追加 7 段」「§2.103 段尾"评论层长尾"标注」等温和词
- Sonnet 5 + Managed Agents + ReOPD critical-read + ACM critical-read + Subramanian + GitHub Trending 6 件 6 件不全部平均用力,优先级排序:Sonnet 5 + Managed Agents = P0(给 §1.41 横切 60-66 升九件主轴 + §1.45 frontier lab 4 栖验证 第 2 例 + §2.6 段末追加独立段)+ ReOPD v2 critical-read = P0(给 §2.4 加注 ReOPD v2 critical-read 第 14 件候选 + Agent 训练工程化复用 OpenForgeRL + ReOPD 二联对照)+ ACM v2 critical-read = P0(给 §2.4 加注 ACM v2 critical-read 反方 7 条记录 + 与 PRO-LONG 二联对照 + 沿用 risk.md R29 §2.1 C 类)+ Subramanian = P0(给 §2.6 段末追加 RAG 范式转折 第 22 行候选 + §1.33c Harness 层 旁证)+ GitHub Trending 6 件 + AI Engineer 画像 + Microsoft Agent Framework 1.0 + Alice Labs 框架评分 = P0(给 §1.33c 横切 53c Harness 层 商业开源 SDK 立标补全 第 6-11 件 + §2.7 行业与平台动态 邻接)+ 评论层长尾 6 媒体 + Boris Cherny 评论 + Project Glasswing = P0(给 §2.103 段尾"评论层长尾"标注 + §3.1 共识 #112 续立)+ Microsoft Agent Framework 1.0 + Alice Labs 框架评分 = P1(给 §1.33c 量化补全 邻接)+ OpenClaw 210k vs GitHub 12,981 stars = P1(给 §3.2 争议候选新增 30)
- Anthropic J-space:与 risk.md / 主题组 A 同源,本主题页主要在 §2.1 第八阶段第八段引用,不重述细节(细节在 spark agent-e1prep / Stephen llm-application-e1prep)
- flyp 7-26 1000-rss-cameron-wolfe「Agentic World Models + Agentic RL + Agent 评估」 三连:与 multimodal.md 同源,本主题页主要在 §1 现状全景 「第十二阈值 = Anthropic Sonnet 5 + Managed Agents effort 设置」 旁证引用 flyp 7-26 1000-rss-cameron-wolfe 三连 一行,不重述细节(细节在 flyp 7-26 1000-rss-cameron-wolfe 原文 + flyp multimodal-e1prep)
- AgentDebugX / DataFlow-Harness HF Daily 7-25 沿用升级补全:与 v25 / v26 / v27 / v28 / v34 沿用,侧重「沿用升级 + HF Daily 票数证据更新」聚合表达,不平均着力
7.4 给 Stephen / Tom / Jay / Spark 下半场协调棒的建议接口
- stephen 7-26 1245 noon 协调棒 已与本主题增量 1(Anthropic Sonnet 5 + Managed Agents)+ 增量 3(ACM v2 critical-read 反方记录 沿用 risk.md R29)+ 增量 4(Subramanian RAG 范式转折 旁证)+ 增量 6(评论层长尾 6 媒体 + Boris Cherny 评论 + Project Glasswing)+ 增量 7(Microsoft Agent Framework 1.0 + Alice Labs 框架评分)+ 增量 8(OpenClaw 数据传染警示 + HF Daily 票数续立/翻倍)同源,本场 E1 与 stephen 1245 完全对接,不需要重述
- stephen 7-26 2245 evening 协调棒(已阅,与本主题增量 1-8 8 件主线增量同源,本场 E1 引用即可)
- stephen 7-26 1002-news-anthropic-news + 1003-news-yt-anthropic + 0910-news-x-vip-radar + 1002-news-openai-news + 1002-news-bens-bites + 1002-news-deepmind-news + 1002-news-google-ai + 1002-news-hf-blog + 1002-news-tldr-ai + 1003-news-yt-deepmind + 1003-news-yt-openai = 11 份 news 通稿——Anthropic Sonnet 5 + Managed Agents effort 设置 + Opus 5 系统卡 + Boris Cherny 评论 + Project Glasswing + Project Pilot + Economic Index/Fund + Public First Action + DeepMind 5 件 + OpenAI 5 件 + HF Daily 7-26 头条 5 件 = frontier lab 7-26 全栈收敛,本场 E1 引用即可
- Tom 7-26 0840 agent-rag-longcontext-radar(8 候选 7-26 JSON 8/8 命中 + 0 手工补充 · 8 高价值 7 件 + 5 一般 = 12 件总计 · A AREX 117▲ + B SANA-Video 18→23 + C Self-Supervised 16→17 + D Sample-Efficient 9→10 + E OpenForgeRL 5→5 + F FinanceComplexQA 5→5 + G ReOPD 8→8 + H Agentic Context Management 0→0 + 4 条主榜高票承接 v3 = ABot-World-0 / DataFlow-Harness / Token Register / Generative Renderer)— 与本主题增量 2(ReOPD critical-read)+ 增量 3(ACM v2 critical-read)+ 增量 6(评论层长尾 6 媒体 + Boris Cherny 评论)+ 增量 8(OpenClaw 数据传染警示 + HF Daily 票数续立/翻倍)同源,本场 E1 引用即可
- Tom 7-26 1440 v2 重写版(8 + 4 = 12 候选 7 高价值 + 5 一般 + 1 Substack + v3 强制承接 7-24 / 7-25 HF Daily 主榜 4 票)— 与本主题增量 2(ReOPD critical-read)+ 增量 3(ACM v2 critical-read)+ 增量 4(Subramanian RAG 范式转折 旁证)+ 增量 8(OpenClaw 数据传染警示 + HF Daily 票数续立/翻倍)同源,本场 E1 引用即可
- Tom 7-26 0900 HF Daily(15 篇:AREX 117▲ + SLAI T-Rex 56▲ + ReferTrack 49▲ + 视觉对比自蒸馏 41▲ 无变化 + K12-KGraph 55▲ + Subliminal Clocks 38▲ + Show Don't Tell 35▲ + Self Gradient Forcing 30▲ + Beyond Relevance-Centric 28▲ 续立 + ActiveVision 24▲ + NVIDIA OO Agents 22▲ 续立 + SANA-Video 2.0 21▲ + Tencent WorkBuddy 20▲ 续立 + Color Pass-Through 18▲ + LLM 演化用户意图 18▲ 续立)— 与本主题增量 4(Subramanian RAG 范式转折 旁证票数)+ 增量 8(OpenClaw 数据传染警示 + HF Daily 票数续立/翻倍)同源,本场 E1 引用即可
- Tom 7-26 rag-e1prep + 1002 rss-yt-yannic-kilcher + 1003 rss-yt-lex-fridman(RAG E1 + YT RSS)— 与本主题编码 Agent 邻接,本场 E1 引用即可
- jay 7-26 0935 github-trending + 1106 rag-agent-llm-systems-briefing + 1123 engineering-e1prep + 1140 news-x-tech-radar + 1735 briefing mcp-spec-agentframeworks-inference-vecdb + 2105 evening-briefing-vecdb-mcp-inference-agentic-rag + csdn-substack-llm-inference-rag-weekly + csdn-llm-rag-agent = 8 件 + 7-25 evening 8 件 + 1000-1006 RSS 11 件 = 27 件 7-25 ~ 7-26)— 与本主题增量 4(Subramanian RAG 范式转折 旁证)+ 增量 5(GitHub Trending 6 件 + 1000+ JD AI Engineer 画像 + Microsoft Agent Framework 1.0 + Alice Labs 框架评分)同源,本场 E1 引用即可
- jay 7-26 1000-rss-simon-willison + 1001-rss-lilian-weng + 1001-rss-msr-blog + 1000-rss-raschka + 1000-rss-nathan-benaich + 1000-rss-bytebytego + 1001-rss-cool-papers + 1001-rss-cool-papers-ir + 1001-rss-import-ai + 1003-rss-yt-fireship = 10 件 RSS(Anthropic Sonnet 5 + Managed Agents effort + Boris Cherny 评论 + Lilian Weng 7-25「自我改进 Harness 工程」 + MSR SkillOpt + Memora + Aurora 1.5 + Flint + Rust SymCrypt + Raschka 推理 effort + nathan-benaich + bytebytego + cool-papers + import-ai + yt-fireship)— 与本主题增量 1(Anthropic Sonnet 5 + Managed Agents effort + Boris Cherny 评论)+ 增量 6(评论层长尾 6 媒体 + Boris Cherny 评论 + Project Glasswing)同源,本场 E1 引用即可
- jay 7-26 1123 engineering-e1prep Agent Harness 主线 4 件保留 + 4 件放弃(MAF Harness + SocialCrawl Agent Frameworks/Klarna + Future AGI Eval + AIThinkerLab RAG 8 Patterns)— 与本主题增量 5(GitHub Trending 6 件 + 1000+ JD AI Engineer 画像 + Microsoft Agent Framework 1.0 + Alice Labs 框架评分)同源,本场 E1 引用即可
- flyp 7-26 15:50 ACM v2 critical-read(13.0KB · B 级 · 监控清单 + 实战 recipe + 立标级候选 3.6/5 · 反方 7 条硬标签 · 沿用 risk.md R29 §2.1 C 类)— 与本主题增量 3(ACM v2 critical-read 反方记录 沿用 risk.md R29 §2.1 C 类)同源,本场 E1 引用即可
- flyp 7-26 22:50 ReOPD critical-read v2(9.5KB · B 级 · 实战 recipe + 立标级候选 3.4/5 · 7-28/7-30 截止前必做 4 项)— 与本主题增量 2(ReOPD critical-read 第 14 件候选 · 与 OpenForgeRL 同向「训练数据复用 + 训练栈复用」二联对照)同源,本场 E1 引用即可
- flyp 7-26 0950-Structured-Dynamics-Model-position-paper-critical-read(flyp 7-26 P3 → P2 旁证评级升级建议 · multimodal 主题)— 与本主题编码 Agent 邻接,本场 E1 引用即可
- flyp 7-26 1000-rss-cameron-wolfe + 1002-rss-yt-two-minute-papers + 1003-rss-yt-ai-explained + 1001-rss-interconnects + 0944 multimodal-e1prep + 2259 multimodal-e1prep + 2259 risk-e1prep + 1550 ACM critical-read + 2250 ReOPD critical-read = 9 件 RSS + critical-read(Cameron Wolfe agentic 三连 + RRB + AgentRx 临床 multimodal + Risk E1 + Multimodal E1 + ACM critical-read + ReOPD critical-read)— 与本主题增量 1(Anthropic Sonnet 5 + Managed Agents 评论层长尾)+ 增量 2(ReOPD critical-read)+ 增量 3(ACM v2 critical-read)+ 增量 6(评论层长尾 6 媒体 + Boris Cherny 评论 + Project Glasswing)同源,本场 E1 引用即可
- flyp 7-26 risk-e1prep §0(R29 §2.1 C 类 ACM 立标的第一份反方记录 + R29 §2.103 Opus 5 段尾加 7-25 ~ 7-26 6 媒体评论层长尾标注 + R29 §7.2 P0 #3 Petri 复现路径 = OpenForgeRL 路径沿用)— 与本主题增量 3(ACM v2 critical-read 反方记录 沿用 risk.md R29 §2.1 C 类)+ 增量 6(评论层长尾 6 媒体 + Boris Cherny 评论 + Project Glasswing)同源,本场 E1 引用即可
- spark 7-26 1000 rss-gradient-flow + 1001 rss-chip-huyen + 1003 rss-yt-3blue1brown + 1338 agent-e1prep(GLM 5.2 + Kimi K3 + Gemini 3.6 Flash + 开源模型吸纳大部分 AI 支出 + 中国 AI 出口管制 + RL 基建下一层 = 5 篇与 v29/v30 比对未变 + Agent 范式转折 9 P0 + P1)— 与本主题增量 1(Anthropic Sonnet 5 + Managed Agents 评论层长尾)+ 增量 2(ReOPD critical-read)+ 增量 3(ACM v2 critical-read)+ 增量 4(Subramanian RAG 范式转折 旁证)+ 增量 5(GitHub Trending 6 件 + AI Engineer 画像)+ 增量 6(评论层长尾 6 媒体 + Boris Cherny 评论)+ 增量 7(Microsoft Agent Framework 1.0 + Alice Labs 框架评分)+ 增量 8(OpenClaw 数据传染警示 + HF Daily 票数续立/翻倍)同源,本场 E1 引用即可
- paper_cards 7-24 ~ 7-26 新卡 564~597 34 件抽样(重点 agent 主分类:564-2607.21503 Agentic Context Management + 565-2607.21072 Show Don't Tell + 567-2607.21051 Sample-Efficient + 569-2607.20734 LLMs Get Lost + 572-2605.09635 K12-KGraph 副 engineering + 573-2607.21576 Self-Supervised Learning + 574-2607.21553 SANA-Video 2.0 + 575-2607.19238 FinanceComplexQA + 576-2607.04763 ReOPD + 585-2607.21557 OpenForgeRL + 541-2607.18603 AutoIndex(已立, 7 日未建 🔴) + 543-2607.20346 IteraSim RAG(已立) + 547-2607.19747 Beyond Relevance-Centric(已立) + 551-2607.19865 DocOps(已立) + 529-2607.19058 SkewAdam + 527-2607.18529 EduPanel)— 本场 E1 引用即可
- knowledge/coding-agents.md v34 沿用(11 阈值 + 9 阶段 + 21 行 + 25 共识 + 27 争议 + 36 开放 + 24 趋势 + 114 必读 + 三路线对立 + Agent 经验蒸馏双轨 + 第 10 阶 + §2.6 14 件)— 全部沿用不重述
7.5 收官语
- v34 第八轮(7-26 evening ~ 7-27 04:20):预计将固化 2 件 P0 主线 critical-read + 4 件 P0 沿用升级 + 3 件 P1 旁证 = 9 件立标 = 12 阈值(11 + 1 = 12 = Anthropic Sonnet 5 + Managed Agents effort 设置)+ 9 阶段(沿用)+ 22 行(21 + 1 = 22 = AAAI 2026 Subramanian 工具调用派 vs 向量检索派对立)+ 25 共识(沿用 → 30)+ 27 争议(沿用 → 29)+ 36 开放(沿用 → 45)+ 24 趋势(沿用 → 29)+ 114 必读(沿用 → 130) → v34 第八轮预计 = 12 阈值 + 9 阶段 + 22 行 + 30 共识 + 29 争议 + 45 开放 + 29 趋势 + 130 必读 = 八维合并成熟
- 本场 E1(2026-07-26 23:20)为今晚活文档接手准备稿,核心交付:2 件 P0 主线 critical-read + 4 件 P0 沿用升级 + 3 件 P1 旁证 = 9 件立标候选 + 12 件矛盾/待核 + 12 件 arXiv 号(2 件新增 + 10 件邻接)+ 14 件非 arXiv 旁证 + 25 件新立候选——v34 第八轮待消化
FlyP · 2026-07-26 23:20 · coding-agents E1 预消化简报 · flyP cron 7a0c0a42-eb2e-4bcd-af74-634628039865 触发 · 承接 v34 11 阈值 + 上下文管理三路线对立 + Agent 经验蒸馏双轨 + 第 10 阶 + 第 11 阶 + 工业 MCP 安全立标 · 2 P0 critical-read + 4 P0 沿用升级 + 3 P1 旁证 = 9 件 · 不重写 coding-agents.md