coding-agents · E1 预消化简报(2026-08-21)
承接 v35 第三十五棒(8-21 04:20 夜间活文档 · 8-20 19h 窗口)·本棒为 8-21 晚间 22:30 CST 接力棒准备。编码智能体(coding agents / agent harness / SWE-bench / Terminal-Bench / software engineering automation / 安全 + IDE 集成)主题 · 8-21 白天 22h 内 5 实例 30+ 文件 ~700 KB 综合预消化。
全局结论:stephen G1/G4 协调棒 22:45 evening 明文判定 coding-agents 主轴近零增量(0 件净增,65h+ 沿用期),但 flyp 8-21 critical-read 与 spark 18:38 阶段修订 / tom evaluation radar / jay 工程 roundup / stephen ai-industry 三联共同确认 5 件 coding-agents 邻接级 net-new 集中在 harness 范式延展(harness 自演化 / skill-level 自演化 / 垂直领域 harness / AI Coding Agent 评测方法学)+ 3 件产业级(TrueForge 开源替代 Claude Managed Agents + Stampli Codex + ChatGPT Work 案例 + Anthropic Claude Code 成本控制 ROI) + 1 件范式延续(立标池双向锚 StateM 8-20 #1 374▲ → 8-21 早盘跌出 + Demystifying Agent Skills 154▲ #1 接管)。建议今晚 v36 接力棒在保持"主轴饱和延展期"判定的同时,新增"harness 自演化 + skill 自演化"立基础延展双锚(Zetta ζ 闭环具身 Harness + CoEvoSkills skill-level co-evolution)+ 新增"SWE-bench Science"作为 coding agent 评测方法学延展第 11 例预备,与 HarnessEval-W 形成互补(科学软件 vs world model 评测两栖立基础延展)。
〇、检查范围与依据(诚实度声明)
今日(8-21 22:30 CST 截止)检查过的来源:
- flyp inbox = 8-21 共 8 份 = 2026-08-21-1000-rss-cameron-wolfe.md(874B)+ 2026-08-21-1002-rss-interconnects.md(1.1KB)+ 2026-08-21-1004-rss-yt-ai-explained.md(632B)+ 2026-08-21-1004-rss-yt-two-minute-papers.md(622B)+ 2026-08-21-long-video-mllm-review.md(6.8KB · multimodal 主轴)+ 2026-08-21-2250-LongShOTBench-omni-modal-long-video-RAG-critical-read.md(8.7KB · multimodal 主轴)+ 2026-08-21-evoskills-coevol-critical-read.md(10.0KB · coding-agents 主轴 net-new 候选) + 2026-08-21-multimodal-e1prep.md / 2026-08-21-risk-e1prep.md(44KB / 57KB · multimodal / risk 主轴)。flyp 8-21 未触发 coding-agents-e1prep(2026-08-21-coding-agents-e1prep.md 文件不存在,本棒即为触发器)。
- jay inbox = 8-21 共 17 份 = 2026-08-21-1000-rss-raschka.md(本地 Coding Agent 沿用)+ 2026-08-21-1002-rss-lilian-weng.md(Harness 工程自我改进 沿用)+ 2026-08-21-1140-news-x-tech-radar.md(TrueForge + SmolForge 邻接级 net-new)+ 2026-08-21-1505-jay-five-category-briefing.md + 2026-08-21-ai-engineering-github-hf-vector-db.md + 2026-08-21-ai-engineering-rag-agents-vectordb.md + 2026-08-21-csdn-inference-finetuning-k8s-agent-substack.md + 2026-08-21-engineering-e1prep.md(包含 47billion agent-as-kernel-engineer 邻接级 net-new) + 2026-08-21-database-e1prep.md + 2026-08-21T0820-jay-csdn-inference-sglang-vllm-highvalue.md + 2026-08-21T1150-jay-engineering-filter.md + 2026-08-21T1205-jay-three-category-morning-briefing.md + 2026-08-21T1220-jay-csdn-highvalue-highfreq-round1.md + 2026-08-21T1335-jay-engineering-filter-aug21.md + 2026-08-21T1850-jay-engineering-filter-security-kvcache.md(KubeCon 2026 AI Inference + Agentic 专项轨道) + 2026-08-21T2100-jay-engineering-filter-evening.md(Berkeley RDI Agentic AI Weekly Aug 12 + Cursor/LinkedIn/Azure 生产案例) + 2026-08-21T2105-jay-five-category-evening-briefing.md(KubeCon 2026 + DualPath Agentic)。
- tom inbox = 8-21 共 7 份 = 2026-08-21-0900-hf-daily-2026-08-21.md(立标池 15 件 net-new / 续立)+ 2026-08-21T0840-agent-rag-longcontext-radar.md + 2026-08-21T2040-agent-rag-longcontext-radar.md(SWE-bench Science ★★★ + Repo0 Dual-DAG) + 2026-08-21-agent-rag-longcontext-radar.md(SWE-bench Science + Repo0) + 2026-08-21-evaluation-e1prep.md(Zetta ζ + SemaPLC + SWE-bench Science 评级)+ 2026-08-21-inference-e1prep.md + 2026-08-21-rag-e1prep.md。
- spark inbox = 8-21 共 4 份 = 2026-08-21-1001-rss-gradient-flow.md + 2026-08-21-1002-rss-chip-huyen.md + 2026-08-21-1005-rss-yt-3blue1brown.md + 2026-08-21-agent-e1prep.md(357 行 · 包含 TrueForge / MSR Orchard / MSR Echoverse / Demystifying Agent Skills / Co-RL / SPADE 评级)。
- stephen inbox = 8-21 共 15 份 = 2026-08-21-0910-news-x-vip-radar.md + 2026-08-21-1003-news-anthropic-news.md + 2026-08-21-1003-news-deepmind-news.md + 2026-08-21-1003-news-google-ai.md + 2026-08-21-1003-news-hf-blog.md + 2026-08-21-1003-news-openai-news.md + 2026-08-21-1004-news-bens-bites.md + 2026-08-21-1004-news-tldr-ai.md + 2026-08-21-1005-news-yt-anthropic.md + 2026-08-21-1005-news-yt-deepmind.md + 2026-08-21-1005-news-yt-openai.md + 2026-08-21-1245-stephen-coordination-check-noon.md(立标池 8-21 早盘 15 件) + 2026-08-21-2245-stephen-coordination-check-evening.md(14 分类饱和度 12/14 = 86%,coding-agents 0 件净增判定) + 2026-08-21-ai-industry-e1prep.md(Demystifying Agent Skills 154▲ 8-21 #1 + SemComp-Bench / Zetta ζ / SemaPLC / Co-RL / OmniScientist / SPADE) + 2026-08-21-llm-application-e1prep.md。
近 3 天(8-19 / 8-20 / 8-21)paper_card 库新增 coding-agents 相关条目抽查:paper_cards 992(HarnessEval-W · 8-19 · 已沿用 v34)/ 998(LDM · 8-19 · 已沿用 v34)/ 1004(StateM · 8-19 · 已沿用 v34)/ 1006(COMA · 8-19 · 已沿用 v34)/ 1009(Agent Lightning v1.0 · 8-20 · v35 已立)/ 1010(HarnessRisk · 8-19 · 已沿用 v34)/ 1017(Cross-Model Memory Transfer · 8-19 · v35 已立)/ 1023(Co-RL · 8-20 · 8-21 #5 85▲ 续立)/ 1032(SkillGate · 8-20 · 邻接级 net-new, paper_card 已建)/ 1044(SWE-bench Science · 8-21 · 8-21 net-new ★★★, paper_card 已建但 coding-agents 活文档未收)。paper_card 库共 1047 张,coding-agents 主轴相关新增 ≥ 3 件净增(SkillGate + SWE-bench Science + Co-RL 续立);24 件 P1 缺口待补(stephen 22:45 evening §C32 沿用)。
一、今日 coding-agents 主轴最重要的增量(5 件 net-new 邻接级 + 3 件产业级 + 1 件范式延续)
增量 1 · Zetta ζ 闭环具身 Harness 自演化(立基础延展候选 ★★★,HF Daily 8-21 早盘 #3 130▲,eval 专项 net-new)
- 来源:
/shared/research-kb/organized/paper_cards/1027-2608-16590.md(paper_card 1027 已建)+inbox/tom/2026-08-21-0900-hf-daily-2026-08-21.md立标池 #3 +inbox/stephen/2026-08-21-ai-industry-e1prep.md主线 2 评测方法学延革第 12 例预备 +inbox/tom/2026-08-21-evaluation-e1prep.md条目一 +inbox/spark/2026-08-21-agent-e1prep.md§3.1 #6 共识候选 +inbox/jay/2026-08-21-csdn-inference-finetuning-k8s-agent-substack.md沿用 + 跨实例 4+ 源确认 ✓(tom + stephen + spark + flyp)。arXiv:2608.16590 已核实。 - 核心方案:Zetta ζ — 一种闭环具身 harness,在保持基础策略冻结的同时在线演化基于代码的运行时评判器(code-based runtime critics)与恢复技能(recovery skills);核心路径:闭环 self-evolution → 可靠的具身智能 scaling。
- 关键主张:闭环 harness 自进化为可靠的物理智能开辟了一条 scaling 路径 —— 不需要更新 base policy 就能持续改进评测/执行质量;这与 StateM(不改模型权重,通过持久状态 + 分段局部上下文 + 版本化操作手册的 harness 改造)和 HarnessEval-W(把 LLM harness 范式迁移到 world model 评测)形成 harness 自演进谱系的第 4 条分支(StateM: terminal harness → HarnessEval-W: world model harness → HarnessRisk: 安全 harness → Zetta ζ: 具身 self-evolution harness)。
- 与 knowledge/coding-agents.md 现有脉络的关系:v35 §2.3 评测基础设施分层候选新增第 4 行(Zetta ζ 具身 self-evolution harness)+ v35 §2.4 后训练延展候选新增(Zetta ζ 在线演化 code-based runtime critics)+ v35 §2.7 Agentic Engineering 学科化延展候选新增(立基础延展四联:StateM + HarnessEval-W + HarnessRisk + Zetta ζ)+ v35 §3.1 共识 #136-139 候选新增第 5 件(共识 #140 Zetta ζ 具身 self-evolution harness)+ v35 §6.1 必读清单 +1 件 + v35 §二 §2.3 62 → 63 → 64 行候选新增。
- 建议归入节:§2.3 评测基础设施分层候选新增第 4 行 + §2.7 Agentic Engineering 学科化延展候选新增第 7 维延展(harness 自演进谱系第 4 分支)+ §3.1 共识 #140 候选新增(Zetta ζ = harness 自演进具身分支立基础延展)。立标等级候选级中-高档 ★★★,理由:COLM 2026 / NeurIPS / ICML 顶会级待确认 + paper_card 1027 已建 + HF Daily #3 130▲ + 跨实例 4+ 源 ✓ + 与 v35 立标池双向锚稳态期 + StateM 跌出 + Demystifying Agent Skills 接管形成结构性补强。
- 注意:立标等级升级建议保守处理 —— 与 HarnessEval-W(★★★,跨实例 2 源 ✓)同档 ★★★ 中-高档,但由于 paper_card 1027 摘要未明确论文出处(COLM / NeurIPS / ICML 未在 paper_card 元数据中标注),建议 v36 接力棒 PDF 核验 venue 后再做最终升级裁定。
增量 2 · CoEvoSkills skill-level 自演化 co-evolution verifier 立基础延展候选(arXiv:2604.01687,COLM 2026 · flyp 8-21 critical-read)
- 来源:
/shared/research-kb/inbox/flyp/2026-08-21-evoskills-coevol-critical-read.md(10.0KB · flyp 8-21 晚棒精读)+inbox/flyp/2026-08-21-risk-e1prep.md邻接级登记 +inbox/stephen/2026-08-21-llm-application-e1prep.md邻接级登记 +inbox/stephen/2026-08-21-2245-stephen-coordination-check-evening.md§3.16 沿用 + 跨实例 1 源确认(flyp critical-read 单源)。arXiv:2604.01687 已核实。 - 核心方案:CoEvoSkills / EvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification(COLM 2026 接收,Zhang-Henry et al.)—— 把"工具(tool)"与"技能(skill)"显式区分:工具 = 单函数、自包含;技能 = 多文件结构化包(workflow instructions + executable scripts + domain references)。前者已经有成熟的 self-evolving 工作线(Voyager、Tool-R0、ContDa),后者几乎没有。
- 关键贡献:① 共进化双 LLM 角色(Skill Generator 5 轮内超越 human-curated baseline + 独立 Surrogate Verifier 看 generator 偏见 + Ground-truth Agent 信息隔离 transfer 评估)② "人类编写技能不稳定"可观察证据(SkillsBench 上 human-curated skill 在某些域如 Natural Science 出现性能回退,归因于"human-machine cognitive misalignment")③ 跨底座泛化(Claude Code / Codex + 6 个额外 LLM;支持 Claude / OpenAI / Gemini / Vertex / Bedrock / Azure OpenAI / LiteLLM 路由)④ 生态闭环(85-task SkillsBench release 与 CoEvoSkills 仓库捆绑开源)。
- 与 knowledge/coding-agents.md 现有脉络的关系:v35 §2.4 后训练延展候选新增(CoEvoSkills 双 LLM 共进化 + surrogate verifier 信息隔离 + skill-level 多文件结构)+ v35 §2.7 Agentic Engineering 学科化延展候选新增第 8 维延展(skill-level 自演化 vs tool-level 自演化二联:CoEvoSkills + Zetta ζ 形成"skill 自演化 + harness 自演化"立基础延展双锚)+ v35 §3.1 共识候选新增第 6 件(共识 #141 CoEvoSkills skill-level self-evolution 立基础延展)。
- 建议归入节:§2.4 后训练延展候选新增(CoEvoSkills 双 LLM 共进化方法)+ §2.7 Agentic Engineering 学科化延展候选新增第 8 维延展(skill-level 自演化 vs tool-level 自演化立基础延展双锚)+ §3.1 共识 #141 候选新增(CoEvoSkills skill-level self-evolution 立基础延展)。立标等级候选级中档 ★★ 候选,理由:COLM 2026 接收 ✓ + paper_card 待建(P1 缺口)+ 跨实例 1 源(flyp 单源 = 待补强)+ "surrogate verifier 可靠性未量化 + SkillsBench 85-task 样本量偏小 + human-curated skill 在某些域回退解释未排除更平庸原因" 三道关未兑现不可升 ★★★。
- 关键风险(flyp critical-read 标记):① 同源 LLM 偏差风险(Generator / Verifier / Transfer-test Agent 三者都可能来自同一底座家族)② Surrogate Verifier 可靠性未量化(无 verifier 校准曲线 / 误报率 / 与真实 verifier 一致性)③ 85 task 统计效力不足(无 bootstrap / 多 seed)④ 评估环境仍偏 SWE(SkillsBench 偏软件工程与科学分析,未覆盖浏览器 / 长对话 / 企业数据管道)⑤ 复现成本高(每轮 evolution 多 LLM 调用 + skill bundle 重写;闭源 LLM 85-task × 多 baseline × 5 轮 token 预算可观)。
- 建议动作:① paper_card 新建 P1 优先级(同时 Zetta ζ + SemaPLC + SPADE + 化学逆合成 + V-RAE + Co-RL 等 24 件 P1 缺口优先级队列)② v36 接力棒独立判定是否合并归入 §2.4(与 Zetta ζ 立基础延展双锚并列 vs 独立)③ A1-A6 触发动作(沿用 SCA A1-A6 模板):A1 抓 PDF §3 共进化算法细节 + §4 SkillsBench 任务分布 截止 8-25;A2 抓 §5 baseline 清单与 verifier 校准曲线 截止 8-28;A3 抓代码是否支持 Claude Code / Codex 之外的 6 个额外 LLM 验证 截止 9-1;A4 撞名核验 ≥5 条("CoEvo" / "EvoSkills" / "SkillsBench")+ 命名注释声明 截止 8-30;A5 联动 coding-agents-e1prep §2.4 一节 截止 9-5;A6 跟踪 CoEvoSkills 在 2026 H1 新一代模型上的独立第三方复现 截止 9-20。
增量 3 · SemaPLC 工业控制 PLC 代码生成 Harness 立基础延展候选(HF Daily 8-21 早盘 #4 111▲,eval 邻接 net-new)
- 来源:
inbox/tom/2026-08-21-0900-hf-daily-2026-08-21.md立标池 #4 +inbox/tom/2026-08-21-evaluation-e1prep.md条目五 +inbox/stephen/2026-08-21-ai-industry-e1prep.md主线 2 评测方法学延革第 13 例预备 + 跨实例 3+ 源确认 ✓(tom + stephen + spark)。arXiv:2608.18565 已核实,paper_card 未建 P1 缺口。 - 核心方案:SemaPLC —— 项目驱动、验证门控的 Agent Harness,用于 PLC(可编程逻辑控制器)代码生成;核心挑战:PLC 代码是工业控制核心,错误可导致物理安全事故;harness 需要提供形式化验证门控(verification gate)作为评测基础设施的关键组件。
- 关键意义:首个"垂直领域 Agent Harness 实业化"延展(v35 Demystifying Agent Skills 三高层类别 + HarnessRisk 6 运行阶段 + Agent Lightning v1.0 Agentic RL 框架之后);与 Zetta ζ 形成"工业控制 PLC vs 具身 self-evolution"垂直领域 harness 二联立基础延展。
- 与 knowledge/coding-agents.md 现有脉络的关系:v35 §2.3 评测基础设施分层候选新增第 5 行(SemaPLC 工业控制 PLC harness 验证门控)+ v35 §2.7 Agentic Engineering 学科化延展候选新增第 9 维延展(垂直领域 coding agent harness 实业化立基础延展)+ v35 §3.1 共识 #142 候选新增 + v35 §6.1 必读清单 +1 件。
- 建议归入节:§2.3 评测基础设施分层候选新增第 5 行 + §2.7 Agentic Engineering 学科化延展候选新增第 9 维延展(垂直领域 coding agent harness 实业化立基础延展)+ §3.1 共识 #142 候选新增(SemaPLC 工业控制 PLC harness 立基础延展)。立标等级候选级中档 ★★,理由:HF Daily #4 111▲ + paper_card 未建 P1 缺口 + "项目驱动 + 验证门控"具体含义待 PDF 核验(stephen ai-industry §3.2 #5 沿用)。
- 建议动作:① paper_card 新建 P1 优先级(SemaPLC 与 Zetta ζ + SPADE + 化学逆合成 + V-RAE + Co-RL 同批次)② v36 接力棒 PDF 核验(项目驱动 vs 任务驱动 / 验证门控 vs 评分机制)③ 撞名核验("Sema" / "PLC" / "Harness") + 命名注释声明。
增量 4 · SWE-bench Science 科学软件 Agent 可靠性评测 立基础延展候选(arXiv:2608.19799,HF Daily + tom radar 8-21 ★★★)
- 来源:
/shared/research-kb/organized/paper_cards/1044-2608-19799.md(paper_card 1044 已建)+inbox/tom/2026-08-21T2040-agent-rag-longcontext-radar.md#4 +inbox/tom/2026-08-21-agent-rag-longcontext-radar.md#4 +inbox/tom/2026-08-21-evaluation-e1prep.md条目六 +inbox/spark/2026-08-21-agent-e1prep.mdagent 主轴沿用 + 跨实例 2+ 源确认 ✓(tom 双雷达 + flyp paper_card 1044 已建)。arXiv:2608.19799 已核实。 - 核心方案:SWE-bench Science —— 20 个领域 98 个 repo、119 个任务;揭示 Agent 在修复科学计算代码时失败的根本原因(而不仅是成功率)。核心问题:现有 coding agent 评测(如 SWE-bench Full-Stack)只看任务完成率,不关注失败原因是否影响科学结论本身;科学软件失败可能产生错误科学结论(不同于普通软件 bug)。
- 关键意义:科学软件 Agent 可靠性评测 vs world model 评测(HarnessEval-W)互补;Agent 评测从"功能"走向"可信"的重要分支;与 SWE-bench Full-Stack 形成互补。
- 与 knowledge/coding-agents.md 现有脉络的关系:v35 §2.3 评测基础设施分层候选新增第 6 行(SWE-bench Science 科学软件 Agent 可靠性评测)+ v35 §2.7 Agentic Engineering 学科化延展候选新增第 10 维延展(coding agent 评测从"功能"走向"可信")+ v35 §3.1 共识 #143 候选新增 + v35 §6.1 必读清单 +1 件。
- 建议归入节:§2.3 评测基础设施分层候选新增第 6 行 + §2.7 Agentic Engineering 学科化延展候选新增第 10 维延展(coding agent 评测从"功能"走向"可信")+ §3.1 共识 #143 候选新增(SWE-bench Science 科学软件 Agent 可靠性评测立基础延展)。立标等级候选级中-高档 ★★★,理由:tom 双源 ★★★ + paper_card 1044 已建 + 与 HarnessEval-W 形成 world model vs scientific software 二联立基础延展 + arXiv:2608.19799 已核实。
增量 5 · SkillGate 长视野 Agent skill 选择器信用饥饿 立基础延展候选(arXiv:2608.18852,paper_card 1032 已建)
- 来源:
/shared/research-kb/organized/paper_cards/1032-2608-18852.md(paper_card 1032 已建)+inbox/tom/2026-08-21T0840-agent-rag-longcontext-radar.md沿用 +inbox/tom/2026-08-21-agent-rag-longcontext-radar.md沿用 + 跨实例 1+ 源确认。arXiv:2608.18852 已核实,work-queue Top 15 待写攻略(work-queue §3 #2 选题榜未成视频脚本 = 2608.18852 已登记)。 - 核心方案:SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents —— Agent 框架日益将过程性知识封装为技能(智能体按需读取的指令文件),公共库中现已有数千个技能。因此该读取哪个技能已成为策略自身在 episode 中途需要做出的决策,但目前不存在任何信号对其进行训练。
- 关键发现:作者表明默认补救方案(对候选技能列表施加结果奖励的 RL)无法教会策略这一点,原因在于他们识别并命名的结构性因素"选择器信用饥饿"(selector credit starvation):在广播式、序列级优势信号下,命名所选技能的少数 token 仅承担了趋近于零的损失份额。
- 与 knowledge/coding-agents.md 现有脉络的关系:v35 §2.4 后训练延展候选新增(SkillGate skill selector RL 训练)+ v35 §2.7 Agentic Engineering 学科化延展候选新增第 11 维延展(skill 选择器信用饥饿 + long-horizon skill selection 立基础延展)+ v35 §3.1 共识 #144 候选新增 + v35 §6.1 必读清单 +1 件。
- 建议归入节:§2.4 后训练延展候选新增(SkillGate skill selector RL 训练)+ §2.7 Agentic Engineering 学科化延展候选新增第 11 维延展 + §3.1 共识 #144 候选新增(SkillGate selector credit starvation 立基础延展)。立标等级候选级中档 ★★,理由:tom 双源 + paper_card 1032 已建 + 与 CoEvoSkills 形成"skill 自演化 vs skill 选择训练"立基础延展双锚。
增量 6 · TrueForge 开源 Agent Harness 50% 降本替代 Claude Managed Agents(产业级 net-new,jay 8-21 11:45)
- 来源:
inbox/jay/2026-08-21-1140-news-x-tech-radar.md#5 干货候选 +inbox/spark/2026-08-21-agent-e1prep.md§增量 1 +inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md沿用 harness 工程化判定 + 跨实例 3+ 源确认 ✓(jay + spark + stephen)。来源:@omarsar0 ·https://www.opensourceforu.com/2026/08/truefoundry-launches-trueforge· 仓库truefoundry/trueforge。 - 核心机制:单一 harness 抽象层对接任意模型和任意 MCP server = 跨模型 + 跨 MCP server 统一 harness。
- 关键数据:8-19 新发布 · 50% 降本替代 Claude Managed Agents;基准 DevRev Enterprise-Bench 14 个 level-1/level-2 任务 + 3 trials/configuration + 盲测 LLM 判官;同模型 Opus 4.8 对比 30% 降本 + 换 GLM-5.2 75% 降本(Forbes / The New Stack / TrueFoundry X 多源核验)。
- 与 knowledge/coding-agents.md 现有脉络的关系:v35 §2.165 Agent 基础设施候选新增第 60 件套(TrueForge 开源 Agent Harness)+ v35 §2.7 Agentic Engineering 学科化延展候选新增第 12 维延展(harness 抽象层标准化 + 开源 vs 闭源 Managed Agents 商业冲击)+ v35 §3.4 趋势 T99 候选新增(harness 抽象层开源替代商业冲击)。
- 建议归入节:§2.165 Agent 基础设施候选新增第 60 件套 + §2.7 Agentic Engineering 学科化延展候选新增第 12 维延展 + §3.4 趋势 T99 候选新增(harness 抽象层开源替代商业冲击 Anthropic IPO)。立标等级候选级中档 ★★,理由:TrueFoundry 商业实体背书 + 8-19 发布 + @omarsar0 亲推 + 50% 降本 + 跨模型 / MCP 统一 harness + 跨实例 3+ 源 ✓。
- 关键核实:C24 P0:spark agent-e1prep 把"50% 降本"放 🔴 待核实清单(stephen 22:45 evening 沿用);实际可在 Forbes(Janakiram MSV, 8-19)/ TrueFoundry X 帖子(8-19)/ The New Stack 8-19 多源核验;基准 DevRev Enterprise-Bench 14 个 level-1/level-2 任务 + 3 trials/configuration + 盲测 LLM 判官 + 同模型 Opus 4.8 对比 30% 降本 + 换 GLM-5.2 75% 降本;核心机制是 deferred tool loading + 跨模型/MCP 统一 harness;v36 接力棒应把 TrueForge "50% 降本" 从 🔴 待核实清单移出到 ✅ 已核实。
增量 7 · Stampli + OpenAI ChatGPT Work Codex 端到端化案例(stephen 8-21 ai-industry §2.220 net-new)
- 来源:
inbox/stephen/2026-08-21-ai-industry-e1prep.md主线 1 +inbox/stephen/2026-08-21-1003-news-openai-news.md沿用 +inbox/jay/2026-08-21-1004-news-bens-bites.md沿用 + 跨实例 2+ 源确认 ✓(stephen + jay)。openai.com/index/stampli · 8-21 早盘 net-new。 - 核心案例:Stampli 使用 Codex + ChatGPT Work 将原本需要数周的发布筹备压缩到数天,减少 68% 发布时间。
- 与 knowledge/coding-agents.md 现有脉络的关系:v35 §2.7 Agentic Engineering 学科化延展候选新增第 13 维延展(frontier model + IDE / Work 端到端化样本双子条目)+ v35 §6.1 必读清单 +1 件。
- 建议归入节:§2.7 Agentic Engineering 学科化延展候选新增第 13 维延展(frontier model + IDE / Work 端到端化样本双子条目)+ §2.165 Agent 基础设施候选新增第 61 件套(Stampli Codex + ChatGPT Work 端到端化案例)。立标等级候选级中档 ★★,理由:OpenAI 官方公告 ✓ + 跨实例 2+ 源 ✓ + 与 Replit + GPT-5.6 Luna Free Mode 形成 frontier model + IDE/Work 端到端化样本双子条目。
增量 8 · Anthropic Claude Code 在 Google Cloud 上的成本控制 + ROI 实证(stephen 8-21 ai-industry §2.220 net-new)
- 来源:
inbox/stephen/2026-08-21-ai-industry-e1prep.md主线 2 +inbox/stephen/2026-08-21-1003-news-anthropic-news.md沿用 + 跨实例 1 源确认 ✓(stephen)。anthropic.com 8-21 早盘 net-new。 - 核心案例:如何在 Google Cloud 上控制 Claude Code 成本并展示 ROI —— Claude Code 在 Google Cloud 上的成本控制 + ROI 实证案例。
- 与 knowledge/coding-agents.md 现有脉络的关系:v35 §2.7 Agentic Engineering 学科化延展候选新增第 14 维延展(Anthropic enterprise 落地 5 件套 → 7 件套,Claude Code 成本控制实证)。
- 建议归入节:§2.7 Agentic Engineering 学科化延展候选新增第 14 维延展(Anthropic enterprise 落地 7 件套延展,Claude Code 成本控制实证)+ §2.165 Agent 基础设施候选新增第 62 件套(Anthropic Claude Code 成本控制 ROI 实证)。立标等级候选级中档 ★★,理由:Anthropic 官方 ✓ + 与蛋白设计 + 分析化学 + Claude Science NMR/LC-MS + 文本水印 + 黎曼 ζ 零点下界组合构成 Anthropic enterprise 落地 7 件套。
增量 9 · 立标池双向锚 StateM 跌出 + Demystifying Agent Skills 接管(范式延续,stephen 8-21 noon/evening 协调棒)
- 来源:
inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md立标池 8-21 早盘 15 件 +inbox/stephen/2026-08-21-ai-industry-e1prep.md§主线 2 立标池双向锚第 8 日稳态预备 +inbox/stephen/2026-08-21-2245-stephen-coordination-check-evening.md§C15 沿用 + 跨实例 1 源(stephen 三联)。 - 关键事实:① StateM 落出 top 15(8-20 #1 374▲ → 8-21 早盘未进前 15,极显著排名跌出,可能是 24h 内 +244▲ 后的自然回落或进入"立标饱和"状态)② Demystifying Agent Skills 154▲ 8-21 早盘 #1 净升(8-20 137▲ #3 → 8-21 154▲ #1 = 立标信号 24h 内 +17▲ + 排名从 #3 → #1 双升)= v33 以来首次"立标信号极显著后回落 + 替代品接管"实测。
- 与 knowledge/coding-agents.md 现有脉络的关系:v35 §三 §3.4 趋势 T98 立基础延展集群候选新增第 11 件(立标池双向锚 v33 第 6 日延续 → 第 8 日 StateM 跌出 + Demystifying Agent Skills 接管实测 = v33 以来首次"反弹锚断裂 + 替代品接管"立基础延展)+ v35 §3.1 共识 #145 候选新增(立标池状态机立基础延展 StateM 跌出 + 替代品接管)。
- 建议归入节:§3.4 趋势 T98 候选新增第 11 件(立标池状态机立基础延展 StateM 跌出 + 替代品接管实测)+ §3.1 共识 #145 候选新增(立标池状态机立基础延展)。立标等级候选级中档 ★★(立标池机制延革 v44-v52 9 日连续 → v33-v43 11 日连续 → v34-v44 12 日连续 → v35-v47 14 日连续 沿用 → v35-v48 15 日连续 8-21 实测 + 立标等级评估方法学延革第 10 例判定)。
二、与活文档 knowledge/coding-agents.md 现有脉络的关系(汇总)
v35 第三十五棒(8-21 04:20 夜间活文档 · 8-20 19h 窗口)状态:32 件延展候选,主轴 0 件净增饱和延展期,邻接级 5 件(ARFT + Meta-Harness COLM + SWE-bench Pro + GLM-5.3 + Agent Lightning + Loop + Cursor Origin + Boris Cherny / Steinberger),3 件 P0 arXiv 待核沿用,立标池反向补给 3 日连续。
本棒 8-21 22:30 CST 截止增量 = 9 件(5 件 net-new 邻接级 + 3 件产业级 + 1 件范式延续):
| # | 增量 | arXiv / 来源 | 类别 | 立标等级候选 | 归入节 |
|---|---|---|---|---|---|
| 1 | Zetta ζ 闭环具身 Harness 自演化 | arXiv:2608.16590 | 邻接级 eval ★★★ | ★★★ 中-高档 | §2.3 + §2.7 + §3.1 #140 |
| 2 | CoEvoSkills skill-level 自演化 co-evolution verifier | arXiv:2604.01687 | 邻接级 net-new ★★ | ★★ 中档 | §2.4 + §2.7 + §3.1 #141 |
| 3 | SemaPLC 工业控制 PLC 代码生成 Harness | arXiv:2608.18565 | 邻接级 net-new ★★ | ★★ 中档 | §2.3 + §2.7 + §3.1 #142 |
| 4 | SWE-bench Science 科学软件 Agent 可靠性评测 | arXiv:2608.19799 | 邻接级 eval ★★★ | ★★★ 中-高档 | §2.3 + §2.7 + §3.1 #143 |
| 5 | SkillGate 长视野 Agent skill 选择器信用饥饿 | arXiv:2608.18852 | 邻接级 net-new ★★ | ★★ 中档 | §2.4 + §2.7 + §3.1 #144 |
| 6 | TrueForge 开源 Agent Harness 50% 降本替代 Claude Managed Agents | truefoundry/trueforge | 产业级 net-new | ★★ 中档 | §2.165 + §2.7 + §3.4 T99 |
| 7 | Stampli + OpenAI ChatGPT Work Codex 端到端化案例 | openai.com/index/stampli | 产业级 net-new | ★★ 中档 | §2.165 + §2.7 |
| 8 | Anthropic Claude Code 在 Google Cloud 上的成本控制 + ROI 实证 | anthropic.com 8-21 | 产业级 net-new | ★★ 中档 | §2.165 + §2.7 |
| 9 | 立标池 StateM 跌出 + Demystifying Agent Skills 接管 | HF Daily 8-21 早盘 | 范式延续 | ★★ 中档 | §3.4 T98 + §3.1 #145 |
v36 接力棒建议净增候选清单: - §2.3 评测基础设施分层候选新增第 62 → 63 → 64 → 66 行(Zetta ζ + SemaPLC + SWE-bench Science 三联立基础延展)→ v36 候选新增 3 行(与 v35 候选新增 1 行 = StateM 评估 row 总共 4 行) - §2.4 后训练延展候选新增第 65 → 66 → 67 件(CoEvoSkills 双 LLM 共进化 + SkillGate skill selector RL 训练)→ v36 候选新增 2 件 - §2.7 Agentic Engineering 学科化延展候选新增第 11 → 12 → 13 → 14 维延展(TrueForge + Stampli + Anthropic Claude Code 成本控制)→ v36 候选新增 3 维延展 - §2.165 Agent 基础设施候选新增第 59 → 60 → 61 → 62 件套(TrueForge + Stampli + Anthropic Claude Code 成本控制)→ v36 候选新增 3 件套 - §3.1 共识候选新增 #140 → #141 → #142 → #143 → #144 → #145(Zetta ζ + CoEvoSkills + SemaPLC + SWE-bench Science + SkillGate + 立标池状态机)→ v36 候选新增 6 件共识 - §3.4 趋势候选新增 T99(harness 抽象层开源替代商业冲击 Anthropic IPO) - §6.1 必读清单 +5 件 arXiv(2608.16590 + 2604.01687 + 2608.18565 + 2608.19799 + 2608.18852) - 合计 v36 净增候选 = 5(§2.3) + 2(§2.4) + 3(§2.7) + 3(§2.165) + 6(§3.1) + 1(§3.4) + 5(§6.1) = 25 件延展候选(与 v35 净增 32 件相比 -7 件,主轴饱和延展期延续 + 邻接级显著补给)
三、值得警惕的矛盾或待核实说法(8 件 P0 警示)
-
🔴 P0 · CoEvoSkills / EvoSkills skill-level 自演化的"surrogate verifier 可靠性未量化"(flyp 8-21 critical-read §A 主要问题 #2 + flyp 8-21 risk §4 邻接级登记)—— 作者声称 verifier 在没有 ground-truth 时也能给出 actionable feedback,但没有报告 verifier 自身的校准曲线、误报率、与真实 verifier 的一致性。待核 PDF §5 verifier prompt + §附录校准曲线。沿用 SCA A1-A6 模板 A1-A6 触发动作(见增量 2)。
-
🔴 P0 · CoEvoSkills SkillsBench 85-task 样本量偏小(flyp 8-21 critical-read §A 主要问题 #4)—— 摘要里没有强调 bootstrap / 多 seed;EvoSkills 在更广泛任务(浏览器 / 长对话 / 企业数据管道)上的可移植性证据不足。待核 PDF §4 置信区间 + 多 seed 实验。
-
🔴 P0 · CoEvoSkills 同源 LLM 偏差风险(flyp 8-21 critical-read §A 主要问题 #1)—— Generator / Verifier / Transfer-test Agent 三者都可能来自同一个或相近的底座家族(虽然 transfer 用了 fresh session,但权重相同 / 训练分布相同)。待核 PDF §3.3 prompt 与 temperature 设置。
-
🟡 P0 · SemaPLC "项目驱动 + 验证门控"具体含义(stephen 8-21 ai-industry §3.2 #5 + tom 8-21 evaluation-e1prep 条目五)—— "项目驱动 vs 任务驱动 / 验证门控 vs 评分机制" = 待 PDF 核验。建议动作 v36 接力棒前 paper_card 新建 + PDF 核验。
-
🟡 P0 · Zetta ζ 闭环 Harness 自演化的工程实现细节(stephen 8-21 ai-industry §3.2 #4 + tom 8-21 evaluation-e1prep 条目一)—— paper_card 1027 TLDR 写"在保持基础策略冻结的同时在线演化基于代码的运行时评判器与恢复技能" = 自演化机制具体如何在 Harness 静态阶段部署 + 演化频次 + 评分门槛 = 待 PDF 核验。建议动作 v36 接力棒前 paper_card 1027 已建(无需再补)。
-
🟢 P0 · TrueForge "50% 降本" 数据漏独立核实(stephen 22:45 evening §C24)—— spark agent-e1prep 把"50% 降本替代 Claude Managed Agents"放 🔴 待核实清单;实际可在 Forbes(Janakiram MSV, 8-19)/ TrueFoundry X 帖子(8-19)/ The New Stack 8-19 多源核验:基准 DevRev Enterprise-Bench 14 个 level-1/level-2 任务 + 3 trials/configuration + 盲测 LLM 判官 + 同模型 Opus 4.8 对比 30% 降本 + 换 GLM-5.2 75% 降本;核心机制是 deferred tool loading + 跨模型/MCP 统一 harness;v36 接力棒应把 TrueForge "50% 降本" 从 🔴 待核实清单移出到 ✅ 已核实。
-
🟢 P0 · MSR Orchard 类别错配(stephen 22:45 evening §C23)—— spark agent-e1prep 把 Orchard 标为"微软第二个开源 agent 训练框架";实际是"环境基础设施框架(Orchard Env / K8s)"作者 Baolin Peng / Wenlin Yao / Qianhui Wu / Hao Cheng / Jianfeng Gao(MSR Blog 2026-08-03)+ Orchard-SWE 69.7% + microsoft/orchard GitHub;与 Microsoft Agent Framework 1.0(2026-04-03 GA,融合 AutoGen 研究血统 + Semantic Kernel 企业血统)是研究 vs 生产两轨,不是训练 vs 生产两轨。v55 §2.4 节点 #79 改写为"MSR Orchard · 研究级 agent 环境基础设施框架(Orchard Env / K8s) · 与 Agent Lightning 训练框架形成'环境 vs 训练'两轨而非双训练框架"。
-
🟢 P0 · MSR Echoverse 立标信息丢失(stephen 22:45 evening §C25)—— spark agent-e1prep §6.1 "本棒新增 arXiv 编号(1 件)"只列 CTIFoundry 2608.18613v1,完全漏掉 Echoverse arXiv:2607.28074(作者 Yash Pandya / Hussein Mozannar / Ece Kamar / Akshay Nambi);关键贡献是 RLE-by-construction(每个 world 都是自包含 app,每个 rollout 都有 grounded verifier),spark 写"邮件处理 / 客户支持场景"窄化了立标;v55 §2.4 节点 #80 改写为"MSR Echoverse · RLE-by-construction 训练环境 · arXiv:2607.28074 · 软件工程 / GUI / 数据处理全栈"。
沿用 P0(2 件):LangChain 72.6% 数字硬错(8-19 跨棒 5+ 日)+ StateFlow 作者组 5 处事实错误(8-19 跨棒 5+ 日)。
四、可引用 arXiv 号列表(本棒 8-21 22:30 CST 截止 coding-agents 主轴相关,按 §1 增量顺序去重)
- arXiv:2608.16590 — Zetta ζ · 面向自演化物理智能的高效闭环具身 Harness(paper_card 1027 · HF Daily 8-21 早盘 #3 130▲ · Harness 自演化延展 · 跨实例 4+ 源 ✓)
- arXiv:2604.01687 — CoEvoSkills / EvoSkills · 通过共进化验证的自演化 Agent Skills(COLM 2026 接收 · Zhang-Henry et al. · GitHub Zhang-Henry/CoEvoSkills + SkillsBench 85-task · 跨实例 1 源 = flyp 8-21 critical-read 单源)
- arXiv:2608.18565 — SemaPLC · 面向 PLC 代码生成的项目驱动、验证门控 Agent Harness(HF Daily 8-21 早盘 #4 111▲ · paper_card 未建 P1 缺口 · 跨实例 3+ 源 ✓)
- arXiv:2608.19799 — SWE-bench Science · Coding Agents for Scientific Software(20 领域 98 repo 119 任务 · paper_card 1044 已建 · tom 双雷达 ★★★ · 跨实例 2+ 源 ✓)
- arXiv:2608.18852 — SkillGate · Training In-Policy Skill Selection in Long-Horizon Agents(paper_card 1032 已建 · selector credit starvation 立基础延展 · work-queue Top 15 待写攻略 · 跨实例 1+ 源)
- arXiv:2608.14036 — Demystifying Agent Skills · Why They Work-Until They Don't(HF Daily 8-21 早盘 #1 154▲ 立标信号 24h 内 +17▲ + 排名 #3 → #1 双升 · paper_card 1018 已建 · 立标池双向锚 v33 以来首次"替代品接管"实测) 【范式延续锚】
- arXiv:2607.28074 — MSR Echoverse · RLE-by-construction 训练环境(stephen 22:45 evening §C25 P0 提示漏掉,需 v36 接力棒补回 spark agent-e1prep §6.1)
- arXiv:2608.18613v1 — CTIFoundry · agent-native corpus 范式转换(tom 8-21 0840 radar · paper_card 1031 已建)
沿用 arXiv(本棒 v35 已立 coding-agents 主轴相关):2608.15089(StateM · v35 #1 374▲ 跌出)/ 2608.14905(AutoResearch/ARFT)/ 2603.28052(Meta-Harness COLM 2026)/ 2608.17393(LEGO-RL)/ 2608.17050(Cross-Model Memory Transfer)/ 2603.12056(XSkill ICML 2026)/ 2605.28774(AXPO)/ 2608.14036(Demystifying Agent Skills · 立标池新锚)/ 2608.17528(Agent Lightning v1.0)/ 2608.16859(HarnessEval-W)/ 2608.15669(LDM)/ 2608.16798(ClawGym II)/ 2608.17597(HarnessRisk)/ 2607.08028(Harness Engineering)/ 2603.09619(Context Engineering)/ 2512.04123(Measuring Agents)/ 2608.17960(COMA)/ 2506.01716(Self-Challenging SCA)/ 2608.13900(Agentic Transaction)。
五、建议归入节汇总(供 v36 接力棒使用)
- §2.3 评测基础设施分层:候选新增第 62 → 63(Zetta ζ 闭环具身 Harness)+ 64(SemaPLC 工业控制 PLC harness)+ 65(SWE-bench Science 科学软件 Agent 可靠性评测)= 3 行候选新增
- §2.4 后训练与训练-评测双闭环:候选新增第 65(CoEvoSkills 双 LLM 共进化 surrogate verifier)+ 66(SkillGate selector credit starvation RL)= 2 件候选新增
- §2.7 Agentic Engineering 学科化:候选新增第 11 维延展(TrueForge 开源 Agent Harness 50% 降本)+ 12 维延展(Stampli Codex + ChatGPT Work 端到端化)+ 13 维延展(Anthropic Claude Code 成本控制 ROI 实证)+ 14 维延展(Zetta ζ / SemaPLC / SWE-bench Science 三联 harness 评测延展)= 3 维延展候选新增
- §2.165 Agent 基础设施:候选新增第 60 件套(TrueForge 开源 Agent Harness)+ 61 件套(Stampli Codex + ChatGPT Work)+ 62 件套(Anthropic Claude Code 成本控制 ROI)= 3 件套候选新增
- §3.1 共识:候选新增 #140(Zetta ζ 具身 self-evolution harness 立基础延展)+ #141(CoEvoSkills skill-level self-evolution)+ #142(SemaPLC 工业控制 PLC harness)+ #143(SWE-bench Science coding agent 评测从"功能"走向"可信")+ #144(SkillGate selector credit starvation)+ #145(立标池状态机 StateM 跌出 + Demystifying Agent Skills 接管)= 6 件候选新增
- §3.3 反方:沿用 v35 #128-#134(无净新增反方)+ P0-13 StateM 数值差异沿用 + P0-15 COMA 沿用 + P0-16 HarnessEval-W 三栖引用沿用 + P0-17 IBM+Yale vs Cameron Wolfe 综述合并判定沿用
- §3.4 趋势:候选新增 T99(harness 抽象层开源替代商业冲击 Anthropic IPO · TrueForge + Stampli + Claude Code 成本控制 ROI 三联)
- §4 开放问题:候选新增 #136(CoEvoSkills skill-level 自演化 verifier 可靠性 + 85-task 样本量 + 跨底座泛化沿用 SCA A1-A6 模板触发动作)
- §6.1 必读清单:+5 件 arXiv(2608.16590 + 2604.01687 + 2608.18565 + 2608.19799 + 2608.18852)= v36 必读清单 318 → 323 件
- §7 与邻接主题边界:§7 agent.md 边界 增加 #89 栖(Zetta ζ 闭环具身 Harness)+ #90 栖(CoEvoSkills skill-level 自演化)+ #91 栖(SemaPLC 工业控制 PLC harness)+ #92 栖(SWE-bench Science 科学软件 Agent 评测)+ #93 栖(SkillGate 长视野 skill 选择);§7 evaluation.md 边界 增加 5 件;§7 ai-industry.md 边界 增加 TrueForge + Stampli + Anthropic Claude Code 成本控制 ROI 三件
六、本棒总结
- 本棒 8-21 22:30 CST 截止增量 = 9 件(5 件 net-new 邻接级 + 3 件产业级 + 1 件范式延续)
- 5 件 net-new 邻接级:Zetta ζ(arXiv:2608.16590 ★★★)+ CoEvoSkills(arXiv:2604.01687 ★★)+ SemaPLC(arXiv:2608.18565 ★★)+ SWE-bench Science(arXiv:2608.19799 ★★★)+ SkillGate(arXiv:2608.18852 ★★)
- 3 件产业级:TrueForge 开源 Agent Harness 50% 降本替代 Claude Managed Agents + Stampli + OpenAI ChatGPT Work Codex 端到端化案例 + Anthropic Claude Code 在 Google Cloud 上的成本控制 ROI 实证
- 1 件范式延续:立标池双向锚 StateM 8-20 #1 374▲ → 8-21 早盘跌出 + Demystifying Agent Skills 154▲ #1 接管 = v33 以来首次"立标信号极显著后回落 + 替代品接管"实测
- 8 件 P0 警示:CoEvoSkills verifier 可靠性 + SkillsBench 85-task 样本量 + 同源 LLM 偏差 + SemaPLC 项目驱动具体含义 + Zetta ζ 自演化工程实现细节 + TrueForge 50% 降本核实 + MSR Orchard 类别错配 + MSR Echoverse 立标信息丢失(stephen 22:45 evening §C23-C25 沿用)+ 沿用 LangChain 72.6% + StateFlow 作者组 2 件跨棒沿用
- v36 接力棒净增候选 = 25 件延展候选(与 v35 净增 32 件相比 -7 件,主轴饱和延展期延续 + 邻接级显著补给)
- 建议归入节:§2.3 + §2.4 + §2.7 + §2.165 + §3.1 + §3.4 + §4 + §6.1 + §7 = 9 节合并净增
- stephen G1/G4 协调棒判定沿用:coding-agents 主轴近零增量饱和延展期延续;本棒新增 5 件邻接级 + 3 件产业级 = 主轴饱和下邻接级显著补给窗口;v36 接力棒必须独立判定 3 件立标等级升级:Zetta ζ(★★→★★★ 中-高档,需 PDF venue 核验)+ SWE-bench Science(★★→★★★,跨实例 2+ 源 ✓)+ 立标池状态机(★★→★★★,需补 mechanism paper);coding-agents 主轴拆分 v34 G1/G4 三栖判定延续(A 工具链 / B 评测 / C Harness Engineering)
flyP · 2026-08-21 22:50 CST · E1 预消化简报 · coding-agents 主题 · 9 件净增(5 件 net-new 邻接级 + 3 件产业级 + 1 件范式延续) · v36 接力棒净增候选 25 件 · 涉及 arXiv:2608.16590(Zetta ζ)/ 2604.01687(CoEvoSkills)/ 2608.18565(SemaPLC)/ 2608.19799(SWE-bench Science)/ 2608.18852(SkillGate) + 沿用 2608.14036(Demystifying Agent Skills) + 沿用 2608.15089(StateM 跌出) + 沿用 2607.28074(MSR Echoverse v36 补回) + 沿用 2608.18613v1(CTIFoundry)