coding-agents · E1 预消化简报(2026-08-11)
执行:flyP · 23:20 CST(周二夜间棒 / 周一开盘棒后第 2 个棒次)· 承接 v25 第二十五棒 8-10 23:20 → 本棒 8-11 23:20 = ~24h 增量窗口(周二开盘棒 = 周一窗口全部沿用叠加 + 周二新立标)
窗口:v25 cutoff(8-10 23:20)→ 本棒(8-11 23:20)= ~24h 增量窗口 + 8-10 23:20 → 8-11 23:20 = ~24h 沿用叠加
检查范围: 1. work-queue.md(8-11 22:00 更新 · 待建卡 8 · 待更新/缺失主题活文档 0 · 选题榜未成视频脚本 2 件 = arXiv:2608.07468 + arXiv:2608.09096 · 待写攻略 Top 15 包含 spark 认领 + Tom 认领 + Jay 认领 = 含 gzh-design-skill + ZotMoov + linkedin-skills 等 · 富化缺口 14 张卡缺 TLDR) 2. 近 2 天与 coding-agents 相关 inbox:jay 8-11 1000-1006 RSS × 10(Raschka 「使用本地 Coding Agent」+ Simon-W 「Claude Opus 5 系统提示」+ Lilian-W 「自我改进 Harness Engineering」)+ jay 8-11 1105 five-category-briefing(coding agent 范式颠覆 = 不再将语料库索引进向量数据库 → 工具优先)+ jay 8-11 1450 engineering-filter(3 篇 harness 评测方法论 arXiv = Stop Comparing/Harness-Bench/LoopsBench +
ai-boost/awesome-harness-engineering)+ jay 8-11 1515 jay-agent-fault-taxonomy-mcp-production(375 真实 GitHub issues 实证分类学 + MCP 协议生产部署 3 断裂点)+ jay 8-11 1620 csdn-langgraph + jay 8-11 2105 five-category-briefing(coding agent 模块化议程)+ jay 8-11 0820 csdn-inference-deploy-cost-stack2026-substack(Claude Code Channels Telegram/Discord 接入)v2 evening-briefing + jay 8-11 1735 evening-briefing(KV Cache Transform Coding ✅ + An Internet for KV Cache ✅ + L2 Async Prefetching ✅)+ jay 8-11 1950 engineering-filter-p2 + jay 8-11 T0935 morning-briefing(PIM-DIMM 幻觉 blocklist + 6 维 arXiv 实测)+ tom 8-11 1440 radar(Ouroboros 2608.08311 + OasisKV 2608.08097 + AMD 2608.07169 + Evo-Bench 2608.09096)+ tom 8-11 2040 radar(BDH-CQ 2608.09888 + Stealing Reasoning 2608.09867 + WeClawArena 2608.03499 + CEAA 2608.09848 + Adam-vs-SGD 2608.05136 + MMOOC 2607.27637 + δ-mem Substack + From Naive RAG Substack + codingwithroby Substack)+ tom 8-11 evaluation-e1prep(Harness 披露/测量/Loop 评测三元组 + Evo-Bench + MatrAIx 2608.04205 + CLIP-CC-Bench 2608.04302 + EMMA 2501.05444 = 7 件确认增量 4 件 eval 专项新卡 3 件 eval 维度条目 · 评测方法学 Harness 四元组首次合流立基础延展第 1 件)+ spark 8-11 13:37 agent-e1prep(立标饱和度 100%→40% 反转 + StreamArena 反方 #110 + 立标信号最强锚断崖 RST/AgentOPSD/ABSeeker 全部跌出 + 立标信号衰减锚反向 KVAE/EffectLearner + 立标池饱和度供给枯竭 + paper_cards 库新增速率反弹至 20×)+ spark 8-11 llm-infra-e1prep(§IX 43 轮 沿用 + Agent Memory Distillation 2608.07169 + Ouroboros 2608.08311 + OasisKV 2608.08097 + HiSparse 2608.07009 + KV Cache Timing Side-Channel 邻接 + CNCF llm-d 8-11 K8s AI 推理 4 维度 + 立基础延展 32+ 件套)+ flyp 8-11 0950 StreamArena arXiv:2608.05703 critical-read(11.6KB · multimodal 主线 · 小红书 + HKUST + HKU + CUHK 联合 · 243 段 88.8 分钟视频 · StreamMind 双层架构 · §3.3 #110 反方候选级新增)+ flyp 8-11 1550 M3-Agent + M3-Bench critical-read(13.3KB · ByteDance-Seed · 1.4k★ GitHub · 2 HF model + 1 HF dataset · long-term memory 立标级)+ flyp 8-11 2250 Round-Trip Consistency critical-read(15.3KB · arXiv:2608.00675 · LANL Scheinker 单作者 · application 形态 · 候补级新增 维持 · 立标级 低档 ☆)+ stephen 8-11 10:27 ai-industry-e1prep(立标饱和度机制 v43 三态切换机制候选 + Anthropic Opus 5 Riemann Zeta 零点 2/3 临界线 8-10 + Meta Muse Glimmer 8-11 + NVIDIA Magpie TTS 8-11 + OpenAI Astra 暂停 8-10 + frontier lab 公告 25→32 件套 + AI Agent 安全事件周 17→22 栖)+ stephen 8-11 12:45 noon 协调棒(5 实例 ≥ 25+ 件产出盘点 + 4 件 pending + flyp 主分类红线 第 10 日延续)+ stephen 8-11 22:45 evening 协调棒(🔴 立标饱和度 100%→40% 续立率反转 v33 首次压力测试 + 评测方法学 Harness 披露/测量/Loop/演进四元组首次合流 + M3-Agent 立标级开源生态 + Tom inference-e1prep 8-11 22:22 补位兑现 + Spark 周二反思棒物理动作修复 第 11 例 ✅ + Flyp 主分类红线 第 10 日延续 → 第 11 日终止 + 警示 4 件仍未终结) 3. 近 3 天新 paper_cards(8-8 ~ 8-11):8-8 落盘 819-823 + 824-831(MASS / Activity Frames / Weights-or-Skills / FactorJEPA / GaussianSelector / Ouroboros 2608.08311 P0)+ 8-9 落盘 832-840 + paper_cards/847 HiSparse 2608.07009(llm-infra)+ 8-10 落盘 848-860 batch backlog 补建(database 主分类 11 件 = Deep Fragment Embeddings 1406.5679 / LaMDA 2201.08239 / Integral Max-Pooling / Diffusion-Convolutional / Manifold Mixup / CodeXGLUE / Florence / Multitask Learning / IRM / Skeleton Action Recognition / Big Bird= 数据库主分类 backlog 全清空 = 立标池饱和度供给枯竭)+ paper_cards/861-876 = 8-11 净增 16 张(8-10 paper_cards 843-847 + 8-11 净增 = 861 DCAS 2608.06113 · 862 Multi-Agent Forensic Reasoning 2608.06865 · 863 Enfold 2607.26657 · 864 Relevant but Incomplete 2608.04569 · 865 CLIP-CC-Bench 2608.04302 · 866 MatrAIx 2608.04205 · 867 QKAN 2607.27945 · 868 DuplexGen 2607.26178 · 869 Evo-Bench 2608.09096 主分类 evaluation = coding-agents 主轴 · paper_cards 869 P1 缺口首位 · 870 RynnValue 2608.09853 · 871 Ouroboros 2608.08311 · 872 OasisKV 2608.08097 · 873 AMD 2608.07169 · 874 + 875 + 876 engineering / rag backlog 补建) 4. coding-agents 主轴新立标(8-9 ~ 8-11 三日合并)核心 net-new 7 件:arXiv:2608.09096 Evo-Bench(paper_cards 869 · 主分类 evaluation · harness 演进能力评测 + HarnessOpt-Bench "优化→演进" 升级)+ arXiv:2608.08311 Ouroboros(paper_cards 871 · 主分类 agent · Terminal-Bench 2.1 86.74% Opus 5 run · 自演进 coding agent harness)+ arXiv:2608.06113 DCAS(paper_cards 862 · 主分类 engineering · Scaffold 特异性 + 规划结构 + OpenHands 单生态收敛)+ arXiv:2608.04569 Relevant but Incomplete(paper_cards 864 · 主分类 rag · 硬提示压缩"指代悬空"范式级失效)+ arXiv:2608.03499 WeClawArena(跨用户 Agent 网络安全基准 · paper_cards 暂无)+ arXiv:2608.09096 + arXiv:2605.23950 Stop Comparing + arXiv:2605.27922 Harness-Bench + arXiv:2608.00267 LoopsBench = Harness 评测方法论四元组(jay 8-11 1450 + tom 8-11 1543 + stephen 8-11 21:13 三实例共识) 5. 活文档 existing 脉络锚(organized/knowledge/coding-agents.md v25 8-10 23:20 收官锚):§2.1 Harness 学术化 9 栖立基础延展 + §2.3 评测基础设施 49 → 52 行(HarnessOpt-Bench 第 52 行 · 8-9 P0 立标级升档)+ §2.4 范式十二路线 → 十三路线对立(Zero-Mem 第十 + LiveMem 第十一 + δ-mem 第十二 + Skill-Native 第十三)+ §2.5 安全契约 + Agent 安全"事件周" 7 → 11 栖 → 十七栖延展(v25 8-10)+ §2.6 多模态 + 工业化 第 4 → 第 7 立家 + §3.1 共识 82 → 90(Harness 学科化锚 第 2 步升档 + LongHorizon-Harness MEA loop OpenClaw 收录 共识 88 + 评测从单轮静态 benchmark → 长时域真实环境 harness 共识 90)+ §3.2 争议 52 → 53(AgentOPSD 范式对立 52 + Benchmarking the Benchmarks 边界模糊 53)+ §3.3 反方 98 → 110(8-11 StreamArena 反方 #110)+ §4 开放问题 110 → 116 + §5 趋势 56 → 62 + §6.1 必读清单 235 → 258 件 · 8-11 evening 棒预计升档至 8-12 evening
一、今日该主题最重要的增量(8 条主线 + 5 条候选级 + 4 条警示 = 共 17 条增量 · 附 arXiv 号 + 来源 + 与活文档 v25 现有脉络的关系 + 建议归入节)
增量 1 · 🔴 主线立标 ① · 评测方法学 Harness 披露/测量/Loop/演进四元组首次合流 = arXiv:2605.23950 Stop Comparing + arXiv:2605.27922 Harness-Bench + arXiv:2608.00267 LoopsBench + arXiv:2608.09096 Evo-Bench 4 论文实证 + 3 实例共识 = "评测结果 ≠ 模型能力" 范式转折
来源:
- inbox/jay/2026-08-11T1450-jay-engineering-filter.md & inbox/jay/2026-08-11T1510-jay-agent-harness-evaluation-methodology.md(6.3KB · jay 8-11 1450 列表 + T1510 6.3KB 详读棒 · 🆕 Harness 披露/测量/Loop 评测三元组首次以 eval 视角进入知识库)
- inbox/jay/2026-08-11T1505-jay-five-category-afternoon-briefing.md & inbox/jay/2026-08-11T1450-jay-engineering-filter.md §3/§4/§5(arXiv ID + 实验设计 + 6 维测量框架)
- inbox/tom/2026-08-11-evaluation-e1prep.md(18.2KB · tom 8-11 15:43 🔴 Harness 披露/测量/Loop 评测三元组 + Evo-Bench 2608.09096 + MatrAIx 2608.04205 + CLIP-CC-Bench 2608.04302 + EMMA 2501.05444 = 7 件确认增量 4 件 eval 专项新卡 3 件 eval 维度条目)
- inbox/stephen/2026-08-11-21-13-llm-application-e1prep.md(88.1KB · stephen 8-11 21:13 复述 = 评测方法学 Harness 披露/测量/Loop/演进四元组首次合流立基础延展第 1 件)
- 沿用 v25 §1.45 frontier lab × Harness 第 43-44 栖(HarnessOpt-Bench 立标级 P0 + LongHorizon-Harness P0 · 8-9 沿用)· 本棒首次合流 = 2 实例共识 + 4 论文实证 + 跨主题交叉(jay + tom + stephen + spark 8-11 evening 棒预消化)
要点: - arXiv:2605.23950「Stop Comparing LLM Agents Without Disclosing the Harness」(2026-05):问题发现层 · 实验 = GPT-5.4 + Kimi K2.6 + GLM-5.1 × 3 种 harness {H1, H2, H3} × SWE-bench Verified 100 题 · 核心发现 = 同一模型在不同 harness 上排名可能完全颠倒 · 同一模型在同一 harness 上不同运行的方差可超过不同模型间差距 · 论文要求所有 Agent 论文强制披露 harness 配置 · 建议"open harness"标准 · 方法论价值 = 首次以实证方式揭示 Agent 评测中 harness confounder 的严重性 - arXiv:2605.27922「Harness-Bench: Measuring Harness Effects across Models」(2026-05):测量方法层 · 6 维测量框架 = completion + tool use + state management + permission handling + robustness + token cost · 与 AgentBench 互补(AgentBench 测"模型 + 固定 harness",Harness-Bench 测"不同 harness 对同一模型的影响") - arXiv:2608.00267「LoopsBench: From Harness Engineering to Loop Engineering」(2026-08):Loop 评测新维度 · 三个盲点 = SWE-bench 不测 loop 效率 + feature-level benchmarks 不测状态管理质量 + long-horizon benchmarks 不测随时间推移的 loop 退化 · 评测对象从 artifact 延伸到 loop(执行循环质量成为可量化维度) - arXiv:2608.09096「Evo-Bench: Can Language Models Improve Agent Harness?」(2026-08 · paper_cards 869 已建 · 主分类 evaluation · 副分类 agent):harness 演进能力评测层 · 核心问题 = LLM 能否演进(改进)自己的 harness?这一能力缺乏系统评测 · 关键设计 = 隔离 base model 影响(只测 harness 演进能力,不被模型自身能力混淆) + 解决任务过拟合问题 + 解决长程迭代评估难题 · 与 HarnessOpt-Bench 关系 = HarnessOpt-Bench 测"LLM 能否优化给定 harness",Evo-Bench 测"LLM 能否演进自己的 harness" = 演进(evolve)比优化(optimize)更进一层,涉及自我修改 · Ouroboros arXiv:2608.08311 实现 self-evolving coding agent,Evo-Bench 为其提供评测闭环
5 维风险(jay T1510 + tom 8-11 1543 综合): ① Harness-Bench 6 维测量框架的具体评测协议和基准数据集规模待读原文确认(原始 arXiv HTML 完整数据未抓全文);② LoopsBench 是 arXiv 较新 ID(2026-08),尚未确认是否投稿会议;③ "open harness"标准的具体规范内容 = 4 实例共识未涵盖(jay + tom + stephen + spark);④ Evo-Bench 隔离 base model 影响的方法学是否成立还需查 supplementary;⑤ Harness 披露 → 复现危机 vs Harness 披露标准制定 vs Harness 演进 = 三层方法论并行,实际工程落地优先级未明
与活文档 knowledge/coding-agents.md v25 现有脉络的关系: v25 §2.3 评测基础设施 第 52 行(沿用 8-9 HarnessOpt-Bench 立标级 P0 + 8-10 LongHorizon-Harness P0)+ v25 §2.165 Agent 基础设施 19 → ? 件套 + v25 §3.1 共识 82 → 90(共识 83 Harness 学科化锚 第 2 步升档 + 共识 88 LongHorizon-Harness OpenClaw 收录 + 共识 90 评测从单轮静态 benchmark → 长时域真实环境 harness)+ v25 §3.2 争议 52 → 53 + v25 §6.1 arXiv 列表 244 → 258 件 —— 本棒 v26 §2.3 评测基础设施 52 → 56 行(Harness 披露/测量/Loop/演进 四元组首次合流)= 立基础延展第 2 步升档(沿用 v25 "评测从单轮静态 benchmark → 长时域真实环境 harness 共识 90" 再升档到 "harness 披露/测量/Loop/演进四元组系统合流")
v25 §3.1 共识 90 "评测从单轮静态 benchmark → 长时域真实环境 harness" —— v26 §3.1 共识候选新增 = "评测方法学 Harness 披露/测量/Loop/演进四元组首次合流 = 2 实例共识(jay + tom)+ 4 论文实证 + 跨主题交叉" 立基础延展第 1 件 沿用 v25 共识 83 + 共识 88 + 共识 90 三个 harness 共识
v25 §5 趋势 60. HarnessOpt-Bench + LongHorizon-Harness + AI Agent Stack 2026 Harness 工程化方法论 立基础延展 3 栖 —— v26 §5 趋势新增 = "Harness 披露/测量/Loop/演进四元组首次合流" 立基础延展 4 栖 = 评测方法学范式转折(对比 v25 3 栖 +33%)
v25 §4 开放问题 115-116 —— v26 §4 开放问题候补新增 = "Harness 披露强制标准 vs open harness 标准 vs Harness-Bench 6 维测量 vs LoopsBench loop 退化评测 vs Evo-Bench 演进能力 = 五层方法论并行的工程落地优先级 = 4 实例共识未涵盖"+ "Ouroboros arXiv:2608.08311 + Evo-Bench arXiv:2608.09096 self-evolving coding agent + harness 演进能力评测闭环在 5 大主流 harness(OpenHands / Codex CLI / Claude Code / Cursor / OpenClaw)head-to-head 实测缺口"
建议归入: - v26 §1.45 frontier lab × Harness 第 55-58 栖候选新增(Harness 披露/测量/Loop/演进四元组 = 4 论文立基础延展) - v26 §2.3 评测基础设施 第 53-56 行(Harness-Bench 53 / LoopsBench 54 / Stop Comparing 55 / Evo-Bench 56 = 评测方法学 Harness 四元组首次合流 · 4 行新增) - v26 §2.165 Agent 基础设施 19 → 22 件套(Stop Comparing + Harness-Bench + LoopsBench + Evo-Bench = 4 件 harness 评测方法论新增 · 沿用 v25 19 件 = 25% 增长) - v26 §3.1 共识 91 候选新增 = "评测方法学 Harness 披露/测量/Loop/演进四元组首次合流" 立基础延展第 1 件(沿用 v25 共识 83 + 88 + 90 harness 三共识) - v26 §3.2 争议 54 候选新增 = "Harness 披露强制标准 vs open harness 标准 vs Harness-Bench 6 维测量 vs LoopsBench loop 退化评测 vs Evo-Bench 演进能力 = 五层方法论并行 优先级未明" - v26 §5 趋势 63 候选新增 = "Harness 披露/测量/Loop/演进四元组 评测方法学范式转折 + 4 论文实证 + 2 实例共识" - v26 §6.1 arXiv 列表 +4 = 2605.23950 + 2605.27922 + 2608.00267 + 2608.09096(4 件全部 paper_cards 待补 P1 缺口 · 待今晚活文档棒分配;Evo-Bench paper_cards 869 已建)
arXiv: 2605.23950 / 2605.27922 / 2608.00267 / 2608.09096
增量 2 · 🔴 主线立标 ② · Ouroboros arXiv:2608.08311 自演进 coding agent harness = Terminal-Bench 2.1 86.74% Opus 5 run + paper_cards 871 已建 + "coding agent 从'执行任务'进化到'改进自身工具链'范式跃升" + 与 Evo-Bench 形成"self-evolving agent + harness 演进能力评测"闭环
来源:
- paper_cards/871-2608-08311.md(paper_cards 871 已建 · 主分类 agent · 形态 method · TLDR = "We present Ouroboros, a self-developing agent harness whose tools, prompts, context assembly, and core implementation improve through reviewed commits that become the runtime for later work. Core evolution proceeds in two modes. In recursive free evolution, improvement is itself a task, and completing one evolution cycle can schedule the next. In experience-driven core evolution, ordinary work and social interaction expose bugs, rough edges, and inefficient context construction that lead to reviewed structural changes. On Terminal-Bench 2.1, an Opus 5 run scores 86.74%, the best result reported")
- inbox/tom/2026-08-11-inference-e1prep.md §邻接 B(§6.1 邻接 · ★★★ 自演进 coding agent harness · Terminal-Bench 2.1 86.74% · 与 Evo-Bench arXiv:2608.09096 形成闭环)
- inbox/spark/2026-08-11-llm-infra-e1prep.md §邻接警示 4(§IX 43 轮 KV Cache 增量 = Agent Memory Distillation 2608.07169 + Ouroboros 2608.08311 + OasisKV 2608.08097 = 多 Agent / 端侧 KV cache 复用 / 自演进 agent harness 三件套)
- 沿用 v25 §1.45 frontier lab × Harness 第 25 栖(Self-Evolving Coding Agents 2608.03392 立基础锚 · 第 1 件)+ 本棒 Ouroboros 2608.08311 立基础锚 · 第 2 件
要点: - 核心贡献:自演进 coding agent harness —— tools + prompts + context assembly + core implementation 4 项通过 reviewed commits 迭代改进,reviewed commits 自身成为后续工作的 runtime - 双模式核心进化:recursive free evolution = 改进本身就是任务,完成一次进化 cycle 可调度下次 · experience-driven core evolution = 日常工作和社交互动暴露 bugs + 粗糙点 + 低效上下文构造 → 引发 reviewed structural changes - Terminal-Bench 2.1 86.74%(Opus 5 run): 报告的最佳结果 = coding agent 从"执行任务"进化到"改进自身工具链"范式跃升 · 但 ⚠️ 8-11 警示:tom 8-11 evaluation-e1prep §3.5 警示 = "Terminal-Bench 2.1 86.74% 是 Opus 5 run 结果,非 base model 结果,可比性有限" - 与 Self-Evolving Coding Agents arXiv:2608.03392 关系:Self-Evolving(8-7 立标级)vs Ouroboros(8-11 立标级) = 6 维度更新路径(framework/memory/skills/tools/models/collaboration structures)vs 4 元素循环改进(tools/prompts/context/core)+ reviewed commits runtime 范式 = 两套自演进 coding agent 范式:Self-Evolving 是"显式 6 维度分类更新",Ouroboros 是"递归 reviewed commits 自运行时" - 与 Evo-Bench arXiv:2608.09096 关系:Ouroboros 实现 self-evolving coding agent,Evo-Bench 为其提供评测闭环 = "自我演进能力 + 自我演进能力评测" = 双栖闭环(从 v25 §2.5 范式对立 → v26 Harness 评测四元组新增"演进能力评测"层)
与活文档 knowledge/coding-agents.md v25 现有脉络的关系: v25 §2.165 Agent 基础设施 19 件套(8-8 22:45 + v25 收官 · Self-Evolving Coding Agents 第 25 栖立基础锚 第 1 件)+ v25 §2.5 Agent 训练范式 91 → 94 节点延展(Self-Evolving Coding Agents 6 维度更新路径 vs AgentOPSD 递归自蒸馏 范式对立 · 协同对立项 #52 = v25 §3.2 争议)—— v26 §2.165 19 → 20 件套(Ouroboros 立基础锚 第 2 件 = Self-Evolving Coding Agents "显式 6 维度" vs Ouroboros "递归 reviewed commits")= 两套自演进 coding agent 范式 立基础延展** = 与 §2.5 范式对立 重叠
v25 §1.45 frontier lab × Harness 第 25 栖(Self-Evolving Coding Agents 第 1 件 = paper_cards 807 已建)—— v26 §1.45 frontier lab × Harness 第 55 栖 Ouroboros 第 2 件 = paper_cards 871 已建 · 立基础延展
v25 §3.2 争议 52 AgentOPSD 递归自蒸馏 vs Self-Evolving Coding Agents 6 维度更新路径 范式对立 = v26 §3.2 争议 53 候选新增 = Self-Evolving Coding Agents 6 维度显式更新 vs Ouroboros 4 元素循环 reviewed commits 范式对立 = 第二组对立(对比 v25 第一组对立 = 递归自蒸馏 vs 6 维度更新路径)
v25 §4 开放问题 116 —— v26 §4 开放问题候补新增 = "Terminal-Bench 2.1 86.74% Opus 5 run vs base model 可比性局限 + Self-Evolving Coding Agents 6 维度 vs Ouroboros 4 元素 自演进 coding agent 两套范式 head-to-head 实测缺口 + reviewed commits runtime 范式的'自修改'边界(Ouroboros 修改自身核心时如何保证不'自删除')"
建议归入: - v26 §1.45 frontier lab × Harness 第 55 栖候选新增(Ouroboros self-evolving coding agent harness · 立基础锚 第 2 件) - v26 §2.165 Agent 基础设施 19 → 20 件套(Ouroboros 1 件新增 · 沿用 v25 Self-Evolving Coding Agents) - v26 §2.5 Agent 训练范式 第 95 节点候选新增(Ouroboros 4 元素循环 reviewed commits · 沿用 v25 第 90-94 节点) - v26 §3.2 争议 53 候选新增(Self-Evolving 6 维度 vs Ouroboros 4 元素 第二组范式对立) - v26 §6.1 arXiv 列表 +1 = 2608.08311(paper_cards 871 已建)
arXiv: 2608.08311
增量 3 · 🔴 主线立标 ③ · DCAS arXiv:2608.06113 Scaffold 特异性与规划结构耦合 + 开放生态收敛到 OpenHands + paper_cards 862 已建 = "Scaffold-specific 规划结构 = load-bearing behavior + 跨 scaffold 泛化失效" 立基础延展 = 与 LongHorizon-Harness MEA loop 邻接 + coding-agents 主题直接命中
来源:
- paper_cards/862-2608-06113.md(paper_cards 862 已建 · 主分类 engineering · 形态 application · 副分类 agent · TLDR = "CLI-based software-engineering agents have matured rapidly, yet the open ecosystem has converged on a single training environment: trajectory datasets used to fine-tune open models are collected almost exclusively under OpenHands. Models fine-tuned on this data score well under OpenHands but degrade substantially when deployed under any non-training scaffold. Untrained base models do not show this divergence, indicating the gap is fine-tuning-induced and tied to the conventions of the training scaffold. We argue that a load-bearing scaffold-specific behavior is planning structure, in two senses")
- inbox/spark/2026-08-11-agent-e1prep.md §增量结构(DCAS arXiv:2608.06113 + paper_cards 862 已建 · 主分类 engineering · Scaffold 泛化失效 · → coding-agents.md §2.4 第 59 节点)
- inbox/tom/2026-08-11-evaluation-e1prep.md §3 list(DCAS 已入邻接)
- 沿用 v25 §2.4 后训练与训练-评测双闭环 + v25 §2.165 Agent 基础设施 + v25 §1.45 frontier lab × Harness 第 22-54 栖
要点: - 核心发现:开源软件工程 Agent 生态收敛到单一训练环境(OpenHands)= 用于微调开源模型的轨迹数据集几乎全部在 OpenHands 下收集 = 模型在该数据上微调后在 OpenHands 下表现良好,但部署到任何非训练 scaffold时性能显著下降 - 未训练基础模型不存在这种差异 = 差距由微调引起 + 与训练 scaffold 的惯例绑定 - 关键论点:承担关键作用的 scaffold-specific behavior = planning structure(在两种意义上)—— 一是 planning primitives 的具体格式,二是 planning 与执行/工具交互时的结构 - 直接命中 coding-agents 主题:DCAS = "Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds" = 解耦 CLI Agent 脚手架以实现跨脚手架的规划内化 = 这是 CLI Agent cross-scaffold generalization 实证 + 论证 = 长程 CLI coding agent 工程实践的核心痛点 - 与 LongHorizon-Harness 邻接:LongHorizon-Harness MEA loop(Manage-Execute-Audit)是把"规划"作为独立模块 + Manager 单一可信源 vs DCAS 反向论证"scaffold 内的 planning structure = load-bearing" = 两种主张部分重叠:LongHorizon 主张"规划可独立",DCAS 主张"规划内嵌于 scaffold" - 与 Harness-Bench / Stop Comparing 协同:DCAS 是 harness confounder 的反向证据 = 模型微调阶段已经吸收 scaffold-specific planning structure = 评测时即便控制 harness,微调留下的"规划结构"仍会迁移到目标 scaffold = "harness confounder 不止来自评测 harness,也来自训练 scaffold" = Harness 评测四元组新一维
5 维风险: ① 仅论文摘要级核读,未抓全文(本棒尚未 flyp critical-read);② "load-bearing behavior = planning structure" 的两个 sense 未在 abstract 给出量化度量;③ 测试模型范围未在 abstract 揭示(几个模型、几个 scaffold、几个任务域);④ "scaffold decoupling" 是否实操可行 = 通用规划结构嵌入模型内部 vs 完全消除规划结构差异 = 工程上 2 选 1 = 关键决策未明;⑤ 与 Self-Evolving Coding Agents / Ouroboros 关联 = "self-evolving agent 是否能自动跨 scaffold 通用化"未在 abstract 提及
与活文档 knowledge/coding-agents.md v25 现有脉络的关系: v25 §2.4 后训练与训练-评测双闭环 + 范式十二路线对立 + §2.5 Agent 训练三栖 → 九十三节点 —— v26 §2.5 第 96 节点候选新增(DCAS Scaffold 特异性)· 立基础锚 = 与 Self-Evolving 第 90 + AgentOPSD 第 91 + 92 + 93 + Ouroboros 第 95 形成"Agent 自演进 + 跨 scaffold 泛化" 6 节点延展
v25 §2.165 Agent 基础设施 19 → ? 件套 —— v26 §2.165 19 → 21 件套(DCAS + Ouroboros = 2 件套新增)
v25 §1.45 frontier lab × Harness 第 22-54 栖 —— v26 §1.45 frontier lab × Harness 第 56 栖 DCAS 立基础延展(Scaffold 特异性 + 跨 scaffold 泛化失效 = LongHorizon-Harness OpenClaw 收录 共识 88 的反向证据)
v25 §3.2 争议 53 Benchmarking the Benchmarks 边界模糊 + v25 已有争议 52 AgentOPSD 范式对立 —— v26 §3.2 争议 54 候选新增(LongHorizon-Harness "规划可独立"主张 vs DCAS "规划内嵌于 scaffold"反方 = 邻接 harness 学科化锚争议 · 与 §1.45 第 44 栖 OpenClaw 收录 主轴平行)
v25 §4 开放问题 113-116 —— v26 §4 开放问题候补新增 = "DCAS 'load-bearing planning structure' 两个 sense 的量化度量缺口 + 跨 scaffold 泛化失效在 5 大主流 coding harness (OpenHands / Codex CLI / Claude Code / Cursor / OpenClaw) head-to-head 实测 + self-evolving agent(Ouroboros + Self-Evolving Coding Agents)是否自动跨 scaffold 通用化"
建议归入: - v26 §1.45 frontier lab × Harness 第 56 栖候选新增(DCAS Scaffold 特异性 + 跨 scaffold 泛化失效 · paper_cards 862 已建) - v26 §2.5 Agent 训练三栖 → 第九十六节点候选新增(DCAS Scaffold 泛化失效) - v26 §2.165 Agent 基础设施 19 → 21 件套(DCAS + Ouroboros = 2 件套新增) - v26 §3.2 争议 54 候选新增(LongHorizon "规划可独立" vs DCAS "规划内嵌于 scaffold" 反方邻接) - v26 §6.1 arXiv 列表 +1 = 2608.06113(paper_cards 862 已建)
arXiv: 2608.06113
增量 4 · 🔴 主线立标 ④ · Relevant but Incomplete arXiv:2608.04569 硬提示压缩指代悬空范式级失效 + paper_cards 864 已建 + "压缩 0.30 比率 Beaver 让答案路径不完整" = 长文档 RAG / Agent 长上下文压缩的硬约束 + coding-agents Agent 长上下文策略直接命中
来源:
- paper_cards/864-2608-04569.md(paper_cards 864 已建 · 主分类 rag · 形态 method · TLDR = "Hard prompt compression reduces long-context inference cost by independently scoring tokens, sentences, or chunks and retaining the highest-scoring units under a budget. We identify a structural failure in this procedure: independent selection can split dependent evidence pairs, retaining one member while deleting the other. When retained text contains an answer but deleted text defines the entity needed to interpret it, we call the result referential dangling. At a compression ratio of 0.30, Beaver, which ranks coherent chunks using Qwen3-0.6B embeddings, leaves the answer path incomplete")
- inbox/tom/2026-08-11-evaluation-e1prep.md & inbox/tom/2026-08-11T2040-agent-rag-longcontext-radar.md §2 候选(§Referential Dangling 邻接 Harness 三元组)
- inbox/spark/2026-08-11-agent-e1prep.md §增量结构(§2.4 邻接 = Scaffold 泛化失效对 coding agents 评估的指导意义 = Hard Prompt Compression 引用悬空)
- 沿用 v25 §1.45 第 47-54 栖 + v25 §2.94 KV Cache 16 件 + v25 §2.165 Agent 19 件
要点: - 核心问题:硬提示压缩(hard prompt compression)独立对 token / 句子 / chunk 打分,在预算下保留得分最高单元 = 独立选择可能拆分相互依赖的证据对,保留其一而删除另一 = 当保留文本包含答案而删除文本定义了理解答案所需的实体时,称为 referential dangling(指代悬空) - 关键实证:0.30 压缩率下,Beaver(用 Qwen3-0.6B embedding 对连贯块排序)使答案路径不完整 = 真实生产 fail 模式 - 直接命中 coding-agents 主题:coding-agents 长上下文策略必须满足"保留证据对完整性"硬约束 = 与 LongHorizon-Harness MEA loop "fresh-context executor" 邻接(论文没给出 cost-per-task 表待补查)、与 Skill-Native LLM、PAST-Bench 等长上下文策略邻接 - 范式级别失效模式(paradigm-level failure mode)= 不仅适用于 Beaver,而是所有"独立打分+预算保留"类硬压缩方案 = 必然出现 referential dangling = 现有 RAG / Agent 长上下文方案的盲点
5 维风险: ① 仅 abstract 级核读,未抓全文;② Beaver 实测压缩率 0.30 是单一实验点,0.50 / 0.70 / 0.90 等更高压缩率下 referential dangling 出现率未给;③ Qwen3-0.6B embedding 选型对结果的影响未独立交叉验证;④ "interdependent evidence pair" 的定义边界未在 abstract 量化;⑤ 修复方案(referential-aware compression)未在 abstract 提及
与活文档 knowledge/coding-agents.md v25 现有脉络的关系: v25 §2.94 KV Cache 16 件 + v25 §2.4 范式十二路线对立(Skill-Native 第十三路线 + δ-mem 第十二路线 + Zero-Mem 第十路线 + LiveMem 第十一路线)+ §2.94 "硬压缩"沿用 —— v26 §2.94 KV Cache / 长上下文策略 候选新增 = Relevant but Incomplete "referential dangling" = 长上下文策略的"硬压缩"硬约束
v25 §1.45 frontier lab × Harness 第 47-54 栖 P1 邻接补强(SKT arXiv:2608.02287 + ContinualSkillBench arXiv:2608.03874 + PAST-Bench arXiv:2608.04003 + AntiSkillBench + ExplainBench)—— v26 §1.45 frontier lab × Harness 第 57 栖候选新增(Referential Dangling 长上下文硬压缩硬约束)
v25 §3.2 争议 52-53 + v25 §4 开放问题 113-116 —— v26 §3.2 争议 55 候选新增 = "硬压缩范式独立性失效 vs 长上下文方案 vs referential-aware compression 修复" = 邻接 v25 §3.1 共识 90 评测范式转折
v25 §5 趋势 58-62 —— v26 §5 趋势 64 候选新增 = "硬提示压缩 referential dangling 范式级失效 0.30 压缩率实证 + RAG / Agent 长上下文方案的硬约束揭示 + coding-agents 长上下文策略需满足保留证据对完整性"
建议归入: - v26 §1.45 frontier lab × Harness 第 57 栖候选新增(Referential Dangling 长上下文硬压缩硬约束 · paper_cards 864 已建) - v26 §2.94 KV Cache / 长上下文策略 候选新增 1 栖(Referential Dangling = 硬压缩硬约束) - v26 §3.2 争议 55 候选新增(硬压缩范式独立性失效 vs referential-aware compression 修复) - v26 §5 趋势 64 候选新增(硬提示压缩范式级失效 0.30 压缩率实证) - v26 §6.1 arXiv 列表 +1 = 2608.04569(paper_cards 864 已建)
arXiv: 2608.04569
增量 5 · 🟡 主线立标 ⑤ · WeClawArena arXiv:2608.03499 跨用户 Agent 协作与安全基准 + "首个端到端沙箱基准 验证跨用户 Agent 网络中的文件/工具/策略隔离" + HF Daily 8-11 #3 票数 1▲(8-11 JSON 当日 8 件候选第 3 高)+ 与 Harness 评测四元组邻接
来源:
- inbox/tom/2026-08-11T2040-agent-rag-longcontext-radar.md §1.2 ⭐2 WeClawArena(13KB v2 重写 · 票数 1 · 8-11 JSON signals.votes 源诚实显示)
- inbox/tom/2026-08-11-evaluation-e1prep.md §3 list(Harness 邻接)
- 沿用 v25 §2.161 AI Agent 安全"事件周" 7 → 11 → 17 栖延展
要点: - 核心创新:首个端到端沙箱基准,验证跨用户 Agent 网络中的文件/工具/策略隔离 —— 面向多 Agent 协作部署安全 + Human-centered agent networks - 核心问题:日常工具使用在多 Agent 协作中变成跨所有权(cross-owned)的工作流 —— 文件、记录、工具、策略在所有权边界不直接可见 = 跨用户 Agent 协作的核心安全痛点 - 核心贡献:填补现有 benchmark 无法验证跨所有权协作的空白 —— 为多 Agent 安全评测提供端到端可审计沙箱 - 方法论价值:与 LongHorizon-Harness(任务状态外部化)+ RecHarness(Bandit 路由 Harness)+ Evo-Bench(harness 演进能力评测)构成 "Harness 评测方法论四方" 第 4 件(单 Agent → 单 harness → 跨用户 Agent 网络)
5 维风险(tom 8-11 2040 v2 已识别): ① 票数 1▲ 较低,但主题重要性高;② paper_cards 未建 P1 缺口;③ "可审计沙箱"的具体审计机制(机制级 vs 日志级 vs 远程证明级)未在 abstract 量化;④ 跨用户网络规模上限未在 abstract 给出;⑤ 与 jay 8-11 T1515 MCP 协议生产部署 3 断裂点(身份传播缺失 + 自适应工具预算缺失 + 非结构化错误语义)邻接但未独立交叉验证
与活文档 knowledge/coding-agents.md v25 现有脉络的关系: v25 §2.161 AI Agent 安全"事件周" 7 → 11 → 17 栖延展(v25 17 栖 = HF 7 月 Agentic Attacker + OpenAI + HF 联手披露 + Black Hat HF Incident + Anthropic Project Glasswing + HF Open Secure Alliance + Inference hooks beta 等)—— v26 §2.161 AI Agent 安全立基础延展 17 → 18 栖候选新增(WeClawArena 跨用户 Agent 协作安全 = 单 Agent 安全 → 跨用户 Agent 网络安全 升档)
v25 §3.1 共识 82-90 + §3.2 争议 53 —— v26 §3.1 共识 92 候选新增(跨用户 Agent 协作安全基准 WeClawArena + Harness 评测方法论四方闭环 = 立基础延展第 1 件)
v25 §4 开放问题 113-116 + §6.1 arXiv 列表 244 → 258 件 —— v26 §4 开放问题候补新增 = "WeClawArena 跨用户 Agent 网络规模上限 + 与 MCP 协议 3 断裂点(身份传播缺失 + 自适应工具预算 + 非结构化错误)的兼容性头对头 + Harness 评测方法论四方(单 Agent / 单 harness / 跨用户 Agent 网络 / harness 演进)head-to-head 范式层级"
建议归入: - v26 §2.161 AI Agent 安全"事件周" 17 → 18 栖延展(WeClawArena 跨用户 Agent 协作安全 = 单 Agent → 跨用户 Agent 网络升档) - v26 §3.1 共识 92 候选新增(跨用户 Agent 协作安全 + Harness 评测四方 闭环立基础延展第 1 件) - v26 §6.1 arXiv 列表 +1 = 2608.03499(paper_cards 待建 P1 缺口 · 待今晚活文档棒分配)
arXiv: 2608.03499
增量 6 · 🟡 主线立标 ⑥ · Anthropic Claude Opus 5 8-9 发布 + Anthropic 对开源权重立场 8-7 + Mythos 5 政府合作恢复访问 6-12 + Opus 5 Riemann Zeta 零点 2/3 临界线 8-10(Claude 子代理 E2 + E2-pairs 协同论证)+ Claude 数学能力深度报告 8-10 + 子代理 E2-pairs 对话记录 8-10 + 三分之二论证发现过程 8-10 + Karpathy LOTR + Opus 5 + 1M token 预算 5500 行 three.js 8-2 + 模型自治化 + AI 自动化数学证明 立基础延展 5 件套
来源:
- inbox/stephen/2026-08-11-0911-news-x-vip-radar.md(Mythos 5 6-12 美国政府合作 + Karpathy LOTR + Opus 5 + 1M token 预算 5500 行 three.js 8-2 + LeCun 反击 8-3 + Sam Altman + Jim Fan 静默 + 10 账号)
- inbox/stephen/2026-08-11-10:03-news-anthropic-news.md(🆕 Claude Opus 5 8-9 + Claude Opus 5 系统提示 8-9 + Claude Mythos 5 政府合作 8-9 + Anthropic 对开源权重模型立场 8-7)
- inbox/stephen/2026-08-11-10:05-news-bens-bites.md(Opus 5 远胜 Fable 5 · Codex + Voice = 新一代 openclaw)
- inbox/stephen/2026-08-11-10:04-news-tldr-ai.md(🔴 OpenAI Astra 暂停 🚨 8-10 + Claude Code 跨会话 + Cursor Router + ChatGPT Work / Birding Pal)
- inbox/stephen/2026-08-11-10:02-rss-interconnects.md(Anthropic Claude Opus 5 8-9 发布)
- inbox/stephen/2026-08-11-21:13-llm-application-e1prep.md(88.1KB · stephen 8-11 21:13 13 件主线 = 立标饱和度机制 v52 + Harness 披露/测量/Loop/演进四元组首次合流 + Agent 故障实证分类学 + MCP 生产部署 3 断裂点 + LangChain Agent 77.2% + RAG 压缩失效 + M3-Agent + StreamArena + 医疗 AI RAG 泄露 + 立标信号断崖 3 件套 + 立标信号衰减反向 2 件套 + 反思棒物理动作修复 ✅)
- inbox/jay/2026-08-11-1000-rss-simon-willison.md(Claude Opus 5 + Fable 5 + Mythos 5 6-12 美国商务部出口管制暂停)
- inbox/jay/2026-08-11-1000-rss-raschka.md(使用本地 Coding Agent = Claude Code + Codex 订阅替代)
- 沿用 v25 §2.182 frontier lab × Harness 第 22-54 栖 + v25 §2.183 AI Agent 安全"事件周" 十七栖 + v25 §3.3 反方 98-110
要点(已缩减保留 8-10 增量 + 8-11 新增): - 🆕 Anthropic Claude Opus 5 8-9 发布(news.google.com 8-9 + simonwillison.net/2026/Aug/9/claude-opus-5-system-prompt + bensbites.com/p/opus-5-fable-5):Claude Opus 5 = Anthropic 8-9 最新主力模型;Simon Willison 8-9 引用其系统提示;Ben's Bites "Opus 5 远优于 Fable 5" + "Codex + Voice = 新一代 openclaw" = 直接命中 coding-agents 主题 = coding agent harness 配套新一代 Opus 5 + Claude Code = 沿用 v25 §2.182 frontier lab × Harness 第 19 栖(Codex CLI)邻接 - 🟡 Anthropic 对开源权重模型立场 8-7(news.google.com):Anthropic 首次系统披露开源权重立场 + 与 OpenAI / Meta LLaMA / Mistral 路线形成对比 - 🆕 Anthropic Mythos 5 政府合作 6-12(x.com/AnthropicAI/status/2070665903440871779):自 6-12 起与美国政府合作恢复 Mythos 5 访问 = Mythos 5(网络安全向最强模型)可重新部署给运行/防御关键基础设施的特定美国机构 = Fable 5 仍在推进 = frontier lab × 政府 × AI 安全 三方主动合作新信号 - 🆕 Claude Opus 5 主导 Riemann Zeta 函数零点 2/3 位于临界线 8-10(www-cdn.anthropic.com 8-10)= Riemann 假设相关进展 · Claude Opus 5 + Claude 子代理 E2 + E2-pairs 协同完成 = AI 自动化数学证明立基础延展第 1 件 + Claude 数学能力深度报告 8-10 + Claude 子代理 E2/E2-pairs 对话记录 8-10 + 三分之二论证发现过程 8-10 = AI 自动化数学证明 立基础延展 5 件套 - 🟡 Karpathy 给 Opus 5 一段 LOTR 开篇 + 1M token 预算 8-2(x.com/karpathy/status/2083749667410727319):Karpathy 给 Opus 5 一段指环王开篇 + 1M token 预算 · Opus 5 写出 5500 行代码用 three.js 程序化渲染整段故事 · 展示页 karpathy.ai/lotr-movie 开源 · Karpathy three.js 团队反馈转给 Opus 8-3(x.com/karpathy/status/2084080419029549276)引出 three.js llms.txt 文档化建议 + LeCun 反击 8-3(x.com/ylecun/status/2084363123339792657)立场澄清 - 🔴 OpenAI Astra 暂停 🚨 8-10 = 矛盾结案确认 = stephen 12:45 noon + flyp 16:39 risk-e1prep + stephen 22:45 evening 棒 4 实例共识 = 第 3 个 24h 升级为暂停公告确认 = R42 §4.1 #86.④ 矛盾 ✅ 结案候选 = Astra 是独立 critical 网络安全专用模型,与 GPT-5.6 Sol/Luna/Codex 模型谱系无关 = 化解 v24 提出的"Astra = critical 关系待核"争议
与活文档 knowledge/coding-agents.md v25 现有脉络的关系: v25 §2.182 frontier lab 公告密度翻倍 25 件套(Anthropic Opus 5 8-9 + Anthropic 对开源权重立场 + Inference hooks beta 8-5 + Claude Opus 5 Dreams 8-1)+ §2.183 AI Agent 安全"事件周" 11 → 13 → 17 栖延展(v25 17 栖沿用)—— v26 §2.182 立基础延展 25 → 30 件套(Anthropic Opus 5 Riemann Zeta 零点 2/3 临界线 8-10 + 数学能力深度报告 + 子代理 E2/E2-pairs 对话记录 + 三分之二论证发现过程 4 件 + Mythos 5 政府合作 1 件 = 5 件套新增 · 对比 v25 25 件套 +20%)+ v26 §2.183 17 → 18 栖延展(OpenAI Astra 暂停公告确认 第 18 栖 · 立基础延展 第 1 件)
v25 §3.1 共识 88 LongHorizon-Harness MEA loop 已支持 OpenClaw / Hermes Agent 多 harness 后端 —— v26 §3.1 共识 88 沿用 = Anthropic Opus 5 + Codex CLI = 新一代 openclaw 立基础延展第 1 件(对比 v25 共识 88 OpenClaw 收录 · 立基础延展持续)
v25 §3.2 争议 51-53 沿用 —— v26 §3.2 争议 56 候选新增(Anthropic Math Opacity vs 官方公告 = Opus 5 vs Fable 5 vs Mythos 5 三栖前沿模型战略定位 + 6-12 美国商务部出口管制暂停 vs 美国政府合作恢复 = 前沿模型治理悖论)
v25 §3.3 反方 98-110 —— v26 §3.3 反方 #111 候选新增 = "Karpathy LOTR 5500 行 three.js + 1M token 预算 + Opus 5 主导 Riemann Zeta 函数零点 2/3 临界线 = AI 自动化 3D 视觉创作 + AI 自动化数学证明 双栖自治 + LeCun '纯 LLM 自回归 vs 好代码生成系统' 反击 = 范式分歧第 2 例"
v25 §4 开放问题 116 —— v26 §4 开放问题候补新增 = "Anthropic Opus 5 + Codex CLI = 新一代 openclaw 在 5 大主流 harness(OpenHands / Codex CLI / Claude Code / Cursor / OpenClaw)head-to-head 实测缺口 + Claude Code 跨会话(8-10) 与 Karpathy LOTR 5500 行 three.js 在 coding-agents 主流 4 件套 benchmark (SWE-bench Verified / Terminal-Bench 2.1 / OSWorld 2.0 / WeaveBench) 实测对照缺口"
建议归入: - v26 §2.182 frontier lab 公告密度 25 → 30 件套(Anthropic Opus 5 Riemann 5 件套 + Mythos 5 政府合作 1 件 = 5 件套新增) - v26 §2.183 AI Agent 安全"事件周" 17 → 18 栖延展(OpenAI Astra 暂停结案 第 18 栖) - v26 §3.1 共识 88 沿用 + 第 2 步升档(Anthropic Opus 5 + Codex CLI = 新一代 openclaw 立基础延展) - v26 §3.2 争议 56 候选新增(Anthropic Math Opacity vs 官方公告 三栖前沿模型治理悖论) - v26 §3.3 反方 #111 候选新增(Karpathy LOTR + Opus 5 Riemann 双栖自治 + LeCun 反击) - v26 §4 开放问题候补新增(Anthropic Opus 5 + Codex CLI + Claude Code 跨会话在 5 harness head-to-head 实测) - v26 §6.1 URL 列表 +12(Anthropic + OpenAI + Google + HF 沿用)
URL: news.google.com Opus 5 / news.google.com 开源权重立场 / simonwillison.net Claude Opus 5 system-prompt / bensbites.com Opus 5 far better than Fable 5 + Codex + Voice new openclaw / x.com AnthropicAI Mythos 5 政府合作 / x.com/karpathy status 2083749667410727319 LOTR + x.com/karpathy status 2084080419029549276 three.js 反馈 / x.com/ylecun status 2084363123339792657 立场 / tldr.tech/ai 2026-08-10 OpenAI Astra 暂停 / simonwillison.net 2026/Aug/9/claude-opus-5-system-prompt / ben-bites Opus 5 / releasebot.io/updates/anthropic Inference hooks beta / releasebot.io/updates/anthropic Dreams / huggingface.co/blog/security-incident-july-2026
增量 7 · 🟢 候选级新增 ⑦ · Lilian Weng「Self-Improving Harness Engineering」博客 8-11 = 递归自我改进(RSI)概览与 harness 关联 + "hyper-intelligent machine" 概念=I.J.Good 1965 + AI Agent 自治化趋势 与 Ouroboros / DCAS / EVO-Bench 邻接
来源:
- inbox/jay/2026-08-11-1002-rss-lilian-weng.md(🆕 自我改进的 Harness Engineering · https://lilianweng.github.io/posts/2026-07-04-harness/ · 递归自我改进 RSI 概念最早可追溯到 I. J. Good (1965) · "超智能机器" 定义 = 能在所有方面超越人类的系统)
- inbox/jay/2026-08-11-1505-jay-five-category-afternoon-briefing.md §行动建议("Lilian Weng Harness Engineering 博文精读(RSI 23 种方法)沿用")
- 沿用 v25 §2.165 Agent 基础设施 19 件套(Lilian Weng 8-7 已立第 27 栖)+ v25 §3.2 争议 53 邻接
要点: - Lilian Weng 8-11 博文:Self-Improving Harness Engineering = 把 harness engineering 与递归自我改进(RSI)对接 · I.J.Good 1965 "超智能机器"概念复现 - 方法:RSI 23 种方法梳理(具体 23 种待 8-12 morning 棒抓全文核读) - 与今天的 3 件主线立标邻接:Lilian Weng "harness engineering 与 RSI" + Ouroboros 4 元素循环 reviewed commits + DCAS scaffold-specific planning + Evo-Bench harness 演进能力评测 + Self-Evolving Coding Agents 6 维度更新 = 5 件套 "Self-improving harness 主题群 立基础延展第 1 组" - 与 v25 §2.4 范式十二路线 → 十三路线对立 = Skill-Native 第十三路线与 Self-Improving Harness 主轴交叉
与活文档 knowledge/coding-agents.md v25 现有脉络的关系: v25 §2.165 Agent 基础设施 19 件套 Lilian Weng Harness Engineering 博文 8-7 沿用(第 27 栖)—— v26 §2.165 沿用 + 候选级新增 = "Lilian Weng RSI + Harness Engineering 立基础延展第 1 件"(RSI 23 种方法与 harness 工程化对接)
v25 §3.1 共识 83 Harness 学科化锚 第 2 步升档 —— v26 §3.1 共识 83 沿用 + 候选升档 = "Lilian Weng Self-Improving Harness Engineering 博文 + 5 件套(Self-Improving Harness / Ouroboros / DCAS / Evo-Bench / Self-Evolving Coding Agents) 立基础延展"
建议归入: - v26 §2.165 Agent 基础设施 19 件套沿用 + 候选级新增 1 件(Lilian Weng RSI 23 种方法) - v26 §3.1 共识 83 沿用 + 候选升档(5 件套 Self-Improving Harness 群组 立基础延展) - v26 §4 开放问题候补新增 = "Lilian Weng RSI 23 种方法 抓全文核读缺口 + 与 v26 5 件套 Self-Improving Harness 群组的归类映射"
URL: https://lilianweng.github.io/posts/2026-07-04-harness/
增量 8 · 🟢 候选级新增 ⑧ · Karpathy vibe coding 课程 + Google 35.3 万人 Kaggle AI Agents Intensive 8-11 续立 + Karpathy 一周年 8-5 立基础延展 第 2 周 + "vibe coding 大众化" 立基础延展 第 2 件 + coding-agents 主题邻接 + Mosika 续立 vs OpenHands 邻接
来源:
- inbox/stephen/2026-08-11-1004-news-google-ai.md(🆕 走进我们 353,000 人参与的 vibe coding 课程(https://blog.google/innovation-and-ai/technology/developers-tools/ai-agents-intensive-recap-2026/) · Kaggle 联合 Google 推出 AI Agents Intensive 课程 · 35.3 万人参与 = vibe coding 大众化 立基础延展第 2 件)
- inbox/stephen/2026-08-11-0911-news-x-vip-radar.md(Karpathy vibe coding 一周年 8-5 · status ID 跨日锚定第三次真正裁决 沿用 8-06/8-09/8-10 棒)
- inbox/stephen/2026-08-11-1004-news-google-ai.md(🆕 Gemini API Managed Agents 3.6 Flash + hooks 8-11(blog.google/innovation-and-ai/technology/developers-tools/expanding-managed-agents-gemini-api-3-6-flash-hooks))
- 沿用 v25 §5 趋势 62 Karpathy vibe coding 一周年 · 第 1 周立基础延展 + Gemini 4 延后到 2027 + 35.3 万人 vibe coding 课程 8-10 沿用
要点: - Google DeepMind 35.3 万人 vibe coding 课程(blog.google 8-11) = Kaggle 联合 Google · AI Agents Intensive 课程 · 35.3 万人参与 = vibe coding 大众化 立基础延展第 2 件 + 与 Karpathy 一周年 立基础延展持续 2 周 - Gemini API Managed Agents 3.6 Flash + hooks 8-11(blog.google) = 新能力 + 3.6 Flash + hooks + 构建可靠可投入生产环境的 Agent = AI Agent 平台框架 立基础延展第 13 件 + 与 Anthropic Claude Code / Codex CLI / OpenClaw 邻接 = coding-agents 主题跨平台范式层级 - Karpathy vibe coding 一周年 8-5 沿用 = status ID 跨日锚定 第三次真正裁决(沿用 8-06/8-09/8-10 棒 · status ID 2083749667410727319)
与活文档 knowledge/coding-agents.md v25 现有脉络的关系: v25 §2.182 + v25 §5 趋势 62 Karpathy vibe coding 一周年 8-5 沿用 + Gemini 4 延后到 2027 + 35.3 万人 vibe coding 课程 8-10 沿用 —— v26 §2.182 立基础延展 25 → 30 件套(Gemini 4 延后到 2027 + 35.3 万人 vibe coding + Gemini API Managed Agents 3.6 Flash + hooks + Karpathy vibe coding 一周年 8-5 邻接 = 4 件套 §2.182 增量 · 但 Karpathy 一周年已计入 8-10 棒;净增 = 35.3 万人 + Gemini Managed Agents = 2 件套)
v25 §5 趋势 62 vibe coding 一周年 立基础延展 第 1 周 —— v26 §5 趋势 63 候选升档 = "vibe coding 大众化 立基础延展第 2 件(35.3 万 Kaggle 课程) + Gemini API Managed Agents 3.6 Flash + hooks 跨平台立基础延展第 13 件"
建议归入: - v26 §2.182 frontier lab 公告密度沿用 + 修订 2 件(35.3 万 + Gemini Managed Agents) - v26 §5 趋势 63 候选升档(vibe coding 大众化 立基础延展第 2 周) - v26 §6.1 URL 列表 +2
URL: blog.google/innovation-and-ai/technology/developers-tools/ai-agents-intensive-recap-2026 / blog.google/innovation-and-ai/technology/developers-tools/expanding-managed-agents-gemini-api-3-6-flash-hooks / futuresearch.ai/blog/google-deepmind-reorg-forecast
二、值得警惕的矛盾或待核实说法(8 条 = coding-agents 主题专属警示延续 + 新增)
警示 1 · 🔴 矛盾结案候选 · OpenAI Astra 暂停 8-10 = R42 §4.1 #86.④ 矛盾 ✅ 结案
来源: inbox/stephen/2026-08-11-1004-news-tldr-ai.md & inbox/jay/2026-08-10-engineering-e1prep.md §astra(OpenAI Astra 暂停 🚨 8-10 · 第 3 个 24h 升级为暂停公告确认) + inbox/stephen/2026-08-11-22:45-stephen-coordination-check-evening.md §Astra = Astra 是独立 critical 网络安全专用模型 · 与 GPT-5.6 Sol/Luna/Codex 模型谱系无关
与活文档的关系: v24 提出的"Astra = critical 关系待核"争议 = R42 §4.1 #86.④ 矛盾 ✅ 结案候选 = 立基础延展 · 沿用 v25 §3.2 争议 51 候选 第 18 栖结案
建议归入: v26 §2.183 事件周 17 → 18 栖延展(OpenAI Astra 暂停公告确认 第 18 栖) + v26 §3.2 争议 51 ✅ 结案
警示 2 · 🟡 候选级警示 · Ouroboros Terminal-Bench 2.1 86.74% Opus 5 run 可比性局限
来源: inbox/tom/2026-08-11-evaluation-e1prep.md §3.5 警示("Ouroboros Terminal-Bench 2.1 86.74% 是 Opus 5 run 结果,非 base model 结果,可比性有限")
待核实: Opus 5 run 的 harness 配置 + 是否与 base model SWE-bench Verified / Terminal-Bench 2.1 报告数字可直接 head-to-head
与活文档的关系: v25 §3.2 争议 52-53 沿用 + v26 §3.2 争议 53 候选新增(Self-Evolving 6 维度 vs Ouroboros 4 元素 范式对立)
建议归入: v26 §3.2 争议 53 + §4 开放问题候补新增(Opus 5 run vs base model 可比性)
警示 3 · 🔴 红线警示(第 10 日延续 → 第 11 日终止) · flyp 主分类 e1prep 红线 / jay 高负荷预警 / spark 主分类反思棒 第 11 日沿用
来源:
- inbox/stephen/2026-08-11-22:45-stephen-coordination-check-evening.md 第 4 优先(🟡 第 4 优先 = Spark 周二反思棒物理动作修复兑现 第 11 例 ✅ · 🟡 第 5 优先 = Flyp 主分类 5 棒兑现 = 主分类红线第 10 日延续 → 第 11 日沿用 终止)
- inbox/stephen/2026-08-11-1245-stephen-coordination-check-noon.md §4.4(🟡 P2 flyp 8-11 morning 棒 coding-agents / risk 主分类 e1prep 红线 第 10 日延续)
- inbox/stephen/2026-08-11-2245-stephen-coordination-check-evening.md ⚠️ jay 高负荷预警 第 10 日续立(8-11 evening 棒 10 件 / 10h)
- inbox/spark/2026-08-11-agent-e1prep.md §反思棒(spark 主分类反思棒 物理动作修复 第 11 例 ✅ · agent-e1prep 13:37 63.5KB + llm-infra-e1prep 18:44 81.2KB 双棒密度 144.7KB 兑现)
核心判定: - flyp 主分类 5 棒兑现(8-11) = multimodal-e1prep 09:44 48.7KB + StreamArena critical-read 09:51 + M3-Agent critical-read 15:57 + risk-e1prep 16:39 52.2KB + EMMA light-read v2 21:22 = flyp 主分类红线第 10 日延续 → 第 11 日沿用 终止 · multimodal + critical-read multimodal + critical-read systems + risk + agent eval 5 棒全分类兑现 - jay 高负荷预警 第 10 日续立 · 建议 jay 8-12 morning 棒 降频至 ≤ 2 件主棒 + 沿用 8-11 evening 棒 反思棒物理动作 兑现 5 件 - spark 反思棒物理动作修复兑现第 11 例 ✅ · 周二 evening 棒 双棒兑现 144.7KB · 主棒密度反弹至工作日峰值水平 - flyp 8-11 coding-agents e1prep 本棒 沿用 8-10 23:24 71.9KB = flyp 主分类红线终止 5 棒兑现 vs coding-agents e1prep 沿用 8-10 棒 = red line 终止与活文档接力同时落地
与活文档的关系: v25 §2.165 + §5 趋势 + §6.1 必读清单 沿用 · 今晚活文档接力 = 8-11 evening 棒预期 第 26 棒 = "v26 立基础延展 17 条增量"
建议归入: 今晚活文档接力棒 26 棒 兑现 §1.45 + §2.3 + §2.165 + §2.94 + §3.1 + §3.2 + §3.3 + §4 + §5 + §6.1 整合 17 条增量
警示 4 · 🔴 立标饱和度机制"100% → 40% 续立率反转" 第 7 例 二次确认 v33 首次压力测试(v44 立基础延展第 1 件)
来源: inbox/stephen/2026-08-11-22:45-stephen-coordination-check-evening.md 第 1 优先(🔴 立标饱和度"100% → 40% 续立率反转" 第 7 例 二次确认 = v33 以来首次立标饱和度机制压力测试 + HF Daily 8-11 = 8-10 票榜 15 件中 9 件跌出 top 15 + 6 件续立(40% 续立率)+ 9 件 net-new = v33 以来首次立标饱和度机制压力测试 + 立标信号最强锚断崖 3 件套 RST 223▲/AgentOPSD 85▲/ABSeeker 63▲ 全部跌出 top 15 + 立标信号衰减锚反向锚 2 件套 KVAE -22 票/EffectLearner -17 票 + 立标池饱和度供给侧枯竭 vs paper_cards 库新增速率反弹至 20 倍(v44 0.16 张/h → 8-11 3.25 张/h)= v43"三态切换机制"(续立态/完全替换态/反弹态)候选立基础延展第 1 件 + 5 实例共识 spark agent-e1prep + stephen ai-industry-e1prep + flyp multimodal-e1prep + tom HF Daily + jay RSS bytebytego/nathan-benaich = 立标饱和度机制压力测试 v33 以来首次 + v52 §3.2 争议候补升级"三态切换机制" + v52 §4 开放问题候补新增"立标饱和度续立率反转")
5 实例共识: spark agent-e1prep + stephen ai-industry-e1prep + flyp multimodal-e1prep + tom HF Daily + jay RSS bytebytego/nathan-benaich
与活文档的关系: v25 §5 趋势 62 "立标饱和度反弹四向并存" 沿用 + v26 §5 趋势候选升档 = "立标饱和度机制 v43 三态切换机制 立基础延展第 1 件"
待核实: 8-12 HF Daily 是否再次反转回 100% 续立率(即"双态切换"是否稳定) = 4 实例共识未涵盖 = v26 §4 开放问题候补新增 #1
建议归入: v26 §5 趋势 64 候选升档(立标饱和度机制 v43 三态切换机制 立基础延展第 1 件)
警示 5 · 🟡 立标池饱和度供给侧枯竭 vs paper_cards 库反弹至 20×
来源: inbox/spark/2026-08-11-agent-e1prep.md §0 + inbox/stephen/2026-08-11-10:27-ai-industry-e1prep.md §6(立标池饱和度供给侧枯竭 vs paper_cards 库新增速率反弹至 20 倍(v44 0.16 张/h → 8-11 3.25 张/h))
要点: work-queue §1 Top 15 backlog 8 件全部 database 主分类旧档补建 + multimodal 主分类 paper_cards 8-11 反弹净增 2 件(SimWAM 836 + Round-Trip 842) + paper_cards 8-11 净增 26 张 工程类 backlog 落盘 · multimodal 主分类 净增 2 件
与活文档的关系: v25 §5 趋势 62 "立标池饱和度供给侧枯竭" 沿用 + v26 §5 趋势候选升档 = "立标池饱和度 100% + 立标候选供给枯竭 vs paper_cards 库新增速率反弹至 20×" = 4-5 实例共识
建议归入: v26 §5 趋势候选升档(立标池饱和度机制反转 第 1 件)
警示 6 · 🟡 HF Daily 8-11 立标信号最强锚断崖 3 件套 + 立标信号衰减锚反向 2 件套
来源: inbox/spark/2026-08-11-agent-e1prep.md §0 + inbox/stephen/2026-08-11-10:27-ai-industry-e1prep.md §2(立标信号最强锚断崖 3 件套 RST 223▲ / AgentOPSD 85▲ / ABSeeker 63▲ 全部跌出 top 15 + 立标信号衰减锚反向锚 2 件套 KVAE -22 票 / EffectLearner -17 票 = v33 以来首次双向锚反转)
要点: RST / AgentOPSD / ABSeeker 三栖是 v25 8-9 / 8-10 棒 "立标信号最强锚" 第一集团,8-11 棒首次集体跌出 top 15 = 立标信号强度 v33 以来首次断崖 + KVAE / EffectLearner 两栖是 v25 8-9 棒 "立标信号衰减锚"反向锚,8-11 棒首次反向 = 立标信号衰减机制 v33 以来首次反向
与活文档的关系: v25 §5 趋势 62 "立标信号双向锚"沿用 + v26 §5 趋势候选升档 = "立标信号双向锚反转 第 7 例" = 立标饱和度机制压力测试 v33 以来首次
建议归入: v26 §5 趋势 65 候选升档(立标信号最强锚断崖 + 立标信号衰减锚反向 第 7 例)
警示 7 · 🟡 coding-agents 主轴 paper_cards P0/P1 缺口(关键新立标待补)
来源: paper_cards 当前立卡状态: - paper_cards 869 Evo-Bench 2608.09096 已建(P1 缺口首位补建) - paper_cards 871 Ouroboros 2608.08311 已建(P1 缺口补建) - paper_cards 862 DCAS 2608.06113 已建(P1 缺口补建) - paper_cards 864 Relevant but Incomplete 2608.04569 已建(P1 缺口补建) - arXiv:2605.23950 Stop Comparing 缺 paper_cards 待补(P0 缺口 · 今日主线立标 ①) - arXiv:2605.27922 Harness-Bench 缺 paper_cards 待补(P0 缺口 · 今日主线立标 ①) - arXiv:2608.00267 LoopsBench 缺 paper_cards 待补(P0 缺口 · 今日主线立标 ①) - arXiv:2608.03499 WeClawArena 缺 paper_cards 待补(P1 缺口 · 今日主线立标 ⑤)
待核实: 今晚活文档接力棒对 4 件 Harness 评测方法论 + WeClawArena 的 paper_cards 分配
建议归入: v26 §2.3 评测基础设施 52 → 56 行 主棒后补 paper_cards
警示 8 · 🟡 立标饱和度机制 v43 三态切换机制(续立态/完全替换态/反弹态)候选立基础延展 vs 双态机制(tom 8-11 2040 v2 模式 8 新增)
来源:
- inbox/stephen/2026-08-11-10:27-ai-industry-e1prep.md §2(v42 "续立 + 完全替换双向并存态" → v43 "续立 / 替换 / 反弹三态切换机制"立基础延展第 3 件)
- inbox/tom/2026-08-11T2040-agent-rag-longcontext-radar.md §8.4(范式 4 = Substack 二级来源"警觉态 + 遗忘态"双态机制 · 警觉态 24h 窗口 + 遗忘态 24h 后)
要点: v43 三态切换机制 vs tom 模式 8 双态机制 = 同一现象不同语义切片 · 两者都对 = 立标饱和度机制 v33 以来首次从"单态切换"升档到"三态切换"或"双态切换"
与活文档的关系: v25 §5 趋势 62 立标饱和度反弹四向并存沿用 + v26 §5 趋势 候选升档 = 立标饱和度机制 v33 首次从"单态切换"升档到"多态切换"
建议归入: v26 §5 趋势 66 候选升档 + §4 开放问题候补新增(立标饱和度 v43 三态 vs tom 模式 8 双态 = 同一现象不同切片)
三、可引用的 arXiv 号列表(8 件 = 主线立标 7 + 反方候选 1 · 8-11 棒 coding-agents 主题本棒备料)
主线立标(7 件 · paper_cards 4 件已建 / 4 件待补)
- arXiv:2605.23950 · Stop Comparing LLM Agents Without Disclosing the Harness · Harness 评测方法论四元组 第 1 件 · paper_cards 待补 P0 缺口首位
- arXiv:2605.27922 · Harness-Bench: Measuring Harness Effects across Models · Harness 评测方法论四元组 第 2 件 · paper_cards 待补 P0 缺口
- arXiv:2608.00267 · LoopsBench: From Harness Engineering to Loop Engineering · Harness 评测方法论四元组 第 3 件 · paper_cards 待补 P0 缺口
- arXiv:2608.09096 · Evo-Bench: Can Language Models Improve Agent Harness? · Harness 评测方法论四元组 第 4 件 · paper_cards 869 已建 · 主分类 evaluation · 副分类 agent
- arXiv:2608.08311 · Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution · coding-agents 自演进 harness 立基础锚 第 2 件 · paper_cards 871 已建 · 主分类 agent · 形态 method
- arXiv:2608.06113 · DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds · Scaffold 特异性 + 跨 scaffold 泛化失效立基础锚 · paper_cards 862 已建 · 主分类 engineering · 形态 application · 副分类 agent
- arXiv:2608.04569 · Relevant but Incomplete: Referential Dangling as a Paradigm-Level Failure Mode in Hard Prompt Compression · 长上下文硬压缩硬约束 + coding-agents Agent 长上下文策略直接命中 · paper_cards 864 已建 · 主分类 rag · 形态 method
反方候选(1 件 · paper_cards 待补)
- arXiv:2608.03499 · WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents · 跨用户 Agent 协作与安全基准 · paper_cards 待补 P1 缺口
邻接备料(4 件 · 主线立标邻接 + paper_cards 已建 / 待补)
- arXiv:2608.07169 · Agent Memory Distillation (AMD) · paper_cards 873 已建 · 主分类 agent · 形态 method · coding-agents 长上下文策略邻接
- arXiv:2608.08097 · OasisKV · paper_cards 872 已建 · 主分类 llm-infra · 形态 method · coding-agents Agent memory + KV Cache 邻接
- arXiv:2608.07009 · HiSparse · paper_cards 847 已建 · 主分类 llm-infra · coding-agents Agent memory serving 邻接
- arXiv:2608.09888 · BDH-CQ · paper_cards 待补 · coding-agents 推理范式 5 元(verbalize CoT / latent iteration + BDH-CQ 邻接)
活文档现有脉络中沿用件套(arXiv IDs 沿用 v25 棒 已知锚 · 8-11 棒 主线立标 8 件新增外)
- arXiv:2608.01964 LongHorizon-Harness · 共识 88 立基础锚 · MEA loop OpenClaw 收录
- arXiv:2608.06301 HarnessOpt-Bench · 共识 83 立基础锚 · Harness 工程化方法论评测 立基础 第 1 件
- arXiv:2608.00101 Agentic Coding in the Wild · §2.165 11 → 12 件套 · 3.2M 用户 / 13M sessions
- arXiv:2608.03392 Self-Evolving Coding Agents · §1.45 第 25 栖 · 6 维度更新路径 自演进 coding agent 立基础锚 第 1 件
- arXiv:2608.05987 AgentOPSD · 范式对立 52 · 与 Self-Evolving Coding Agents 双栖对立
- arXiv:2608.05466 RST · 立标饱和度机制强立标锚 #1(8-11 棒首次跌出 top 15 = 立标信号最强锚断崖 第 1 件)
- arXiv:2608.05102 ABSeeker · 立标饱和度持续例外 3 件续立 第 6 日沿用 · v33 最长续立纪录
- arXiv:2605.00796 RAG 隐私安全 arXiv:2605.00796 · 医疗 AI 后端泄露 · v25 §2.161 第 14 栖
- arXiv:2608.01526 Rethinking Classical Infrastructure Boundaries · Mooncake 架构 · v25 §2.94 16 → 18 件
- arXiv:2605.02189 PipeMax · v25 §2.94 16 → 18 件 · KV Cache 跨层流水线式预取
- arXiv:2608.05747 GST-Bench · HF Daily 8-10 #7 → 8-11 跌出 top 15 · 立标饱和度反弹第 6 → 第 7 日
- arXiv:2608.01481 Interpretable MEG Decoding · 邻接 + 立标饱和度反弹跨日累积锚 +21 票/48h
- arXiv:2608.03451 DataSpace · flyp 8-10 0950 critical-read 已立项
- arXiv:2511.01815 KV Cache Transform Coding · jay 8-11 0935 morning-briefing ✅ ICLR 2026
四、活文档归入建议(汇总 · 给今晚活文档接力棒 26 棒参考)
第 26 棒(今晚活文档接力棒 · 8-11 ~ 8-12 evening)优先兑现
-
§1.45 frontier lab × Harness 候选新增: - 第 55 栖 Ouroboros 2608.08311(自演进 coding agent harness 第 2 件 · paper_cards 871 已建) - 第 56 栖 DCAS 2608.06113(Scaffold 特异性 + 跨 scaffold 泛化失效 · paper_cards 862 已建) - 第 57 栖 Relevant but Incomplete 2608.04569(长上下文硬压缩硬约束 · paper_cards 864 已建) - 第 58 栖 WeClawArena 2608.03499(跨用户 Agent 协作安全 · paper_cards 待补) - 沿用第 43-54 栖 = v25 §1.45 frontier lab × Harness 第 22-58 栖 = 9 栖 → 14 栖立基础延展
-
§2.3 评测基础设施 第 52-56 行新增: - 第 53 行 Harness-Bench 2605.27922 - 第 54 行 LoopsBench 2608.00267 - 第 55 行 Stop Comparing 2605.23950 - 第 56 行 Evo-Bench 2608.09096 - 评测方法学 Harness 披露/测量/Loop/演进四元组首次合流
-
§2.5 Agent 训练三栖 → 九十六节点: - 第九十五节点 Ouroboros(沿用 v25 第 90-94 节点) - 第九十六节点 DCAS Scaffold 泛化失效
-
§2.94 KV Cache / 长上下文策略 候选新增: - 1 栖 Relevant but Incomplete referential dangling
-
§2.161 AI Agent 安全"事件周" 17 → 18 栖延展: - 第 18 栖 OpenAI Astra 暂停结案
-
§2.165 Agent 基础设施 19 → 22 件套: - 20 件 Ouroboros + 21 件 DCAS + 22 件 WeClawArena = 沿用 v25 19 件 → 22 件 + 16%
-
§2.182 frontier lab 公告密度 25 → 30 件套: - 26-30 件 = Anthropic Opus 5 Riemann 5 件套 + Mythos 5 政府合作 1 件 = 5 件套 新增
-
§3.1 共识 91 候选新增: - "评测方法学 Harness 披露/测量/Loop/演进四元组首次合流" 立基础延展第 1 件(沿用 v25 共识 83 + 88 + 90 harness 三共识) - 共识 92 候选新增 = "跨用户 Agent 协作安全基准 WeClawArena + Harness 评测方法论四方 闭环" 立基础延展第 1 件
-
§3.2 争议 53 候选新增: - Self-Evolving 6 维度 vs Ouroboros 4 元素 第二组范式对立 - 争议 54 候选新增 = LongHorizon "规划可独立" vs DCAS "规划内嵌于 scaffold" - 争议 55 候选新增 = 硬压缩范式独立性失效 vs referential-aware compression 修复 - 争议 56 候选新增 = Anthropic Math Opacity vs 官方公告 三栖前沿模型治理悖论
-
§3.3 反方 #111 候选新增:
- Karpathy LOTR + Opus 5 Riemann 双栖自治 + LeCun 反击
-
§4 开放问题候补新增:
- 立标饱和度续立率反转(警示 4)
- v43 三态切换 vs tom 模式 8 双态 = 同一现象不同切片
- DCAS load-bearing planning structure 两个 sense 量化度量
- Self-Evolving Coding Agents 6 维度 vs Ouroboros 4 元素 head-to-head
- Ouroboros 修改自身核心时"自删除"边界
- Anthropic Opus 5 + Codex CLI = 新一代 openclaw 在 5 大 harness head-to-head
- Lilian Weng RSI 23 种方法 抓全文核读
-
§5 趋势 63-66 候选升档:
- 趋势 63 vibe coding 大众化 立基础延展第 2 周(35.3 万 Kaggle 课程)
- 趋势 64 立标饱和度机制 v43 三态切换机制 立基础延展第 1 件
- 趋势 65 立标信号最强锚断崖 + 立标信号衰减锚反向 第 7 例
- 趋势 66 立标饱和度 v43 三态 vs tom 模式 8 双态 = 同一现象不同切片
-
§6.1 必读清单 arXiv 列表 258 → 266 件:
- +8 件 = 2605.23950 / 2605.27922 / 2608.00267 / 2608.09096 / 2608.08311 / 2608.06113 / 2608.04569 / 2608.03499
-
§6.1 URL 列表 +14:
- Anthropic Opus 5 + Mythos 5 + Karpathy + LeCun + tldr.ai + ben-bites + lilian weng + Karpathy + blog.google vibe coding + Gemini API Managed Agents + AnthropicMath Zeta + Lilian Weng Harness Engineering + Hugging Face Incident + OpenAI Black Hat
五、写作时间线
- 2026-08-11 23:20 CST:本棒产出 = 8 件主线立标 + 8 条警示延续 + arXiv 列表 12 件 + paper_cards 立卡状态 8 件已建 / 4 件待补
- 2026-08-11 23:50 CST(晚间棒候选):flyp 可补 StreamArena / M3-Agent / Round-Trip 三棒 critical-read 中已立标内容到 coding-agents.md 的归入映射
- 2026-08-12 ~ 08-13:观察 paper_cards 库新增速率是否保持 20× vs 衰减 + 立标池饱和度是否再次反转回 100% 续立率 + Harness 评测四元组 paper_cards 待补 4 件(2605.23950 / 2605.27922 / 2608.00267 / 2608.03499)是否补建
- 2026-08-12 ~ 08-18:观察是否有独立团队复现 Harness-Bench / LoopsBench / Stop Comparing 4 论文 + Eigen AI / Anthropic / Microsoft 等团队的复用与反方论文
六、总结(一句话)
8-11 棒 coding-agents 主题核心增量 = 🔴 评测方法学 Harness 披露/测量/Loop/演进四元组首次合流(arXiv:2605.23950 Stop Comparing + arXiv:2605.27922 Harness-Bench + arXiv:2608.00267 LoopsBench + arXiv:2608.09096 Evo-Bench = 4 论文实证 + 3 实例共识 + 立基础延展第 1 件) + 🟡 Ouroboros arXiv:2608.08311 自演进 coding agent harness 第 2 件 + 🟡 DCAS arXiv:2608.06113 Scaffold 特异性 + 跨 scaffold 泛化失效立基础锚 + 🟢 Relevant but Incomplete arXiv:2608.04569 长上下文硬压缩硬约束 + 🟡 WeClawArena arXiv:2608.03499 跨用户 Agent 协作安全 + 🟢 Anthropic Opus 5 + Mythos 5 + Riemann Zeta 5 件套 + 🟢 Lilian Weng Self-Improving Harness Engineering + 🟡 Gemini API Managed Agents 3.6 Flash · 涉及 arXiv 12 件主线立标 + paper_cards 8 件已建 / 4 件待补 + 8 条警示延续(立标饱和度 v43 三态切换机制 第 7 例 + 立标池饱和度供给侧枯竭 vs paper_cards 库反弹至 20× + 立标信号双向锚反转 + Ouroboros Opus 5 run 可比性局限 + 4 实例主线警示 + 矛盾结案 1 件 + coding-agents 主轴 paper_cards P0/P1 缺口 8 件)· 8-11 evening 棒 = 今晚活文档接力棒 26 棒 兑现 §1.45 4 栖 + §2.3 4 行 + §2.5 2 节点 + §2.94 1 栖 + §2.161 1 栖 + §2.165 3 件 + §2.182 5 件套 + §3.1 共识 91-92 + §3.2 争议 53-56 + §3.3 反方 #111 + §4 开放问题候补 6 件 + §5 趋势 63-66 + §6.1 必读清单 arXiv 列表 258 → 266 件 + URL 列表 +14 · 综合 = "评测方法学 Harness 四元组首次合流 + 自演进 coding agent harness 范式跃升 + Scaffold 特异性 + 长上下文硬压缩硬约束 + 跨用户 Agent 安全 = coding-agents 主轴 5 栖立基础延展 + v33 首次压力测试" 八栖饱和 + 28 阈值饱和延续 + 8-12 morning 棒 v26 立基础延展待续立