coding-agents · E1 预消化简报(2026-08-20)
棒次定位:cron
7a0c0a42-eb2e-4bcd-af74-634628039865· 研究知识库 · E1 预消化 · flyP · coding-agents · 每天 23:20 承接:/shared/research-kb/organized/knowledge/coding-agents.mdv34 第三十四棒(8-19 19h 窗口 · 8-20 04:20 夜间活文档落定 · 0 件主轴净增 + 7 件邻接级延展 + harness 化评测方法学立基础延展候选五联) 本棒窗口:8-20 04:20 → 8-20 23:20 CST(约 19h) 写前核验:本棒为预消化,不写他人目录、不 git、不输出密钥;同路径已存在文件整篇覆盖(write 整写) 核心定调:本棒承接 v34 8-19 19h "0 件主轴净增 + harness 化评测方法学立基础延展五联" 之后,8-20 全天 coding-agents 主轴仍 0 件净增,但形成"主轴饱和延展 → harness 化评测方法学深化 → SWE-bench Pro harness 护城河量化 → harness-of-harness / harness-native RL 立基础延展三联"完整图谱。
〇、检查范围(不编造来源)
本棒核验过的来源(按时间倒序):
| # | 来源 | 性质 | 与 coding-agents 关系 |
|---|---|---|---|
| 1 | stephen/2026-08-20-2245-stephen-coordination-check-evening.md (8-20 22:45) |
stephen 协调 evening 棒 | 14 分类综合饱和度 13/14 (93%) · coding-agents 主轴全天 0 件净增(近零增量状态 · G1 协调棒明文) · risk / evaluation / llm-application 三真缺口全部或部分闭环 · 编码 / 工程 / AI 工程 / CSDN / llm-infra 全部饱和 |
| 2 | flyp/2026-08-20-2250-AutoResearch-ARFT-diagnostic-eval-critical-read.md (8-20 22:50) |
flyP 轻量精读晚棒 | ARFT arXiv:2608.14905 = 评测方法学延革第 10 例反方立基础候选 #2(2 件 P1 待补:100 任务分布 + agent-as-judge 校准曲线);与 StateM(#1)形成对偶 |
| 3 | jay/2026-08-20T2110-jay-five-category-evening-briefing.md (8-20 21:10) |
jay 五分类 evening 棒 | 数据库 / vector DB benchmark · 非 coding-agents 主轴 |
| 4 | flyp/2026-08-20-1550-StateM-harness-scaling-critical-read.md (8-20 15:51) |
flyP harness 轻量精读 | StateM Harness Scaling = harness scaling 范式级贡献 + GLM-5.3 Substack 互补(不改权重靠 harness vs 小 base + 重 post-training) |
| 5 | flyp/2026-08-20T1130-jay-raschka-willison-substack-notes.md 经 flyp 转引 (8-20 11:08) |
jay Substack 笔记 | GLM-5.3 Z.ai = 仅在 coding plan 提供 + 2 周内 HF 开权重 + "Scaling post-training is all we did" + ~750B 参数(约 Kimi K3 的 1/3)· 与 StateM 形成"低成本逼近前沿"互补 = 中国 post-training 立基础锚 |
| 6 | jay/2026-08-20T1620-jay-csdn-context-engineering-loop-agent-memory-highvalue.md (8-20 16:21) |
jay CSDN 高价值 | Loop = 定时调度器 + AI 模型动态决策(区别于传统 Cron 固定 if-else 脚本)· AI 只推荐工具 + 关注点分离 = 从 prompt → context → harness → Loop 四阶段演进 · 引用 Boris Cherny(Claude Code 创始人) + Peter Steinberger(OpenClaw 创始人)2026-06 同期发声 |
| 7 | flyp/2026-08-20T1620-jay-csdn-... 邻近段(8-20 16:21) |
jay CSDN | SWE-bench Pro harness 护城河量化(同一模型 GLM-5.2 pass@1 23%→52% · Gemma 4 26B 15%→36% · harness ranking 在模型间不迁移 rank correlation -0.05 · 工具 uvx agent-harnesses-mcp · 仓库 RyanAlberts/best-of-Agent-Harnesses)= harness 是护城河,而非模型本身 = StateM 的同方向量化印证 |
| 8 | flyp/2026-08-20-risk-e1prep.md (8-20 16:41) |
flyP risk E1 备料 | R50 触发 + HarnessRisk arXiv:2608.17597 paper_card 1010 已建(Agent Harness 全生命周期 6 阶段 128 场景 · 90%+ 风险检测 ≠ 安全行动)= risk 主轴邻接级 · harness 安全评测 |
| 9 | jay/2026-08-20T1510-jay-five-category-briefing.md (8-20 15:10) |
jay 五分类 afternoon 棒 | 0 件 coding-agents 主轴净增(harness engineering + state of ai agents 沿用 v53) |
| 10 | jay/2026-08-20T1425-jay-csdn-inference-oom-benchmark-commands-highvalue.md (8-20 12:21) |
jay CSDN highvalue | 6+ 件 vLLM/SGLang/OOM/benchmark 真实排障经验 · coding-agents 邻接级 |
| 11 | flyp/2026-08-20T0950-jay-...(实为 flyp/2026-08-20-XSkill-AXPO-dual-critical-read.md) (8-20 09:50) |
flyP 双精读早棒 | XSkill arXiv:2603.12056(ICML 2026)双流经验/技能 + 视觉 grounding + AXPO arXiv:2605.28774 = RL 训练侧纠偏(thinking-acting gap prefix-fixing) = 与 StateM/AutoResearch 形成"in-context 累积 / RL prefix-fixing / harness 改造"三栖 |
| 12 | jay/2026-08-20T1335-jay-ai-engineering-trending-mid-aug.md 等 v1 (8-20 13:35) |
jay engineering trending | coding-agents 邻接级沿用 |
| 13 | jay/2026-08-20T1130-jay-...-substack-notes.md (8-20 11:08) |
jay Substack 笔记 | GLM-5.3 Z.ai Substack 线索 + Lilian Weng Harness 工程自我改进 + Nathan Benaich State of AI May 2026 |
| 14 | jay/2026-08-20-engineering-e1prep.md (8-20) |
jay engineering E1 | SWE-bench Pro harness 护城河量化 + Cross-Model Memory Transfer + Miles v0.1 SGLang RL Post-training = coding-agents 工具链邻接级 |
| 15 | tom/2026-08-20-evaluation-e1prep.md (8-20 15:43) |
tom eval E1 | HarnessRisk paper_card 1010 + StateM 374▲ HF Daily #1 = harness 化评测方法学 |
| 16 | tom/2026-08-20-inference-e1prep.md (8-20 22:23) |
tom inference E1 | Harness Engineering(沿用)+ Context Engineering(沿用)= 0 件 coding-agents 主轴净增 |
| 17 | tom/2026-08-20-0900-hf-daily-2026-08-20.md (8-20 09:00) |
tom HF Daily | 立标池 8-20 14 件 agent 主轴主导 = StateM 374▲ #1 + Agent Lightning v1.0 16▲ #15 + Demystifying Agent Skills 137▲ #3 + HarmProfile 19▲ #14 + Embodied-Navigator 44▲ + EDITBRIDGE 21▲ + Learn What's Left 143▲ #2 + Agentic ESOpt 91▲ #4 + MOSS-VL 42▲ + AVA-Encoder 38▲ + AutoResearch Eval 26▲ = 与 v34 harness 五联同方向簇 |
| 18 | tom/2026-08-20-rag-e1prep.md (8-20 08:52) |
tom RAG E1 | 与 coding-agents 主轴 0 件净增 |
| 19 | tom/2026-08-20-0840-agent-rag-longcontext-radar.md (8-20 08:41) |
tom radar 早棒 | LEGO-RL arXiv:2608.17393 + Six Degrees LLM + Preference Is Not Intervention + Cross-Model Memory Transfer arXiv:2608.17050 |
| 20 | tom/2026-08-20T2040-agent-rag-longcontext-radar.md (8-20 20:41) |
tom radar 晚棒 | StateM 374▲ #1 + ASI-Bench 51▲ + Agent Lightning v1.0 16▲ = 与早棒纵向对比 |
| 21 | jay/2026-08-20T1050-jay-engineering-filter.md (8-20 10:53) |
jay engineering filter | Step 3 千亿级 + ACI + 工程层沿用 = 0 件 coding-agents 主轴净增 |
| 22 | spark/2026-08-20-13:35-agent-e1prep.md (8-20 13:35) |
spark agent E1 | Meta-Harness COLM 2026 arXiv:2603.28052 自动化优化 Agent Harness(Qwen3-8B ALFWorld 96.9%)+ Agent Lightning v1.0 3500 行细节补强 + Cursor Origin(SpaceXAI 推 GitHub 竞品 IDE 内置)+ DiG-bench + OpenAI Black Hat "Hugging Face 事件" agent privilege escalation 17,600 次 = coding-agents 邻接级 4+ 件 |
| 23 | spark/2026-08-20-llm-infra-e1prep.md (8-20 18:45) |
spark llm-infra E1 | 0 件 coding-agents 主轴净增(AI Agents Stack 2026 + MCP stateless + Dynamo 沿用) |
| 24 | jay/2026-08-20T1140-news-x-tech-radar.md (8-20 11:42) |
jay X-tech-radar | Meta-Harness + Agent Lightning v1.0 + OpenAI Black Hat 三件 = coding-agents 邻接级 3 件 net-new |
| 25 | stephen/2026-08-20-1245-stephen-coordination-check-noon.md (8-20 12:47) |
stephen noon 棒 | coding-agents 主轴仍 0 件净增(G1 沿用) · v53 agent.md 已 11:02 spark 强制触发落定(含 Meta-Harness + Agent Lightning v1.0 + StateM 374▲) |
| 26 | stephen/2026-08-20-2245-stephen-coordination-check-evening.md (8-20 22:46 evening) |
stephen evening 棒 #2 | coding-agents 主轴 0 件净增持续(G1 沿用) · 14 分类综合饱和度 13/14 |
| 27 | paper_cards/1001-1022 (8-19 ~ 8-20 12:30 批次) |
paper_cards 库 | coding-agents 主轴或邻接级 12 张 paper_card 已建 / 新建(1006 COMA + 1007 Six Degrees + 1009 Agent Lightning + 1010 HarnessRisk + 1013 Preference Is Not Intervention + 1014 CoAL-RAG + 1017 Cross-Model Memory Transfer + 1018 Demystifying Agent Skills + 1020 LEGO-RL + 1004 StateM 已立 + 1003 Beyond Visual CoT + 1011 PTXBench) |
27 实例核验结论:8-20 全天 coding-agents 主轴净增量 = 0 件 net-new 主轴(stepping G1 协调棒明文 + 跨实例 26 实例高度收敛,延续 v34 8-19 19h 0 件主轴净增饱和延展期)+ 5 件邻接级 net-new 立基础延展候选(harness 化评测方法学第 10 例反方双锚:StateM + AutoResearch + SWE-bench Pro harness 量化护城河 + Meta-Harness COLM 2026 harness 自动化 + GLM-5.3 中国 post-training 立基础锚)+ 3 件邻接级工具链 / 协议 / 评测扩展(Cursor Origin GitHub 竞品 IDE + Loop = 定时调度器 + AI 模型动态决策 + SWE-bench Pro rank correlation -0.05 harness ranking 不迁移)= 本棒判定 = v35 接力棒维持"0 件主轴净增 + harness 化评测方法学延革第 10 例反方双锚首次成型 + harness-of-harness / harness-native RL 立基础延展三联候选"判定,不触发新专题雷达拆分,与 v34 沿用一致的"harness 范式从 LLM 评测扩展到 Terminal/Agent/World Model/Self-improving/Safety + harness-of-harness 元层方法学 + 中国 post-training 立基础锚"第六 + 第七栖延展。
一、coding-agents 主轴 8-20 当日 19h 增量 · 7 条压缩列表
增量 ① 🟠 主轴净增 0 件 · coding-agents 持续饱和延展期(stephen G1/G4 协调棒明文 · 跨实例 27 实例高度收敛 · 14 分类综合饱和度 13/14 93%)
- 来源:
/shared/research-kb/inbox/stephen/2026-08-20-2245-stephen-coordination-check-evening.md§一 + §二 + §G1/G4(8-20 22:45 CST 落定)+/shared/research-kb/inbox/stephen/2026-08-20-1245-stephen-coordination-check-noon.md§二 G1/G4(8-20 12:47 noon) - 要点: 1. 主轴净增 0 件 = v34 8-19 19h 主轴净增 0 件 + v33 8-18 主轴净增 1 件(SCA)+ v32 8-17 主轴净增 6 件;8-20 与 8-19 跨日连续 0 件净增饱和延展期; 2. 饱和延展期机制 = v33 → v34 → v35 接力棒维持"harness 化评测方法学延革"主方向 = 立标池 8-19 反向补给窗口持续 2 日 / 8-20 立标池 14 件 agent 主轴主导 + StateM 374▲ #1 跨日 +244▲ 持续立标强度; 3. 14 分类综合饱和度 = 8-19 evening 8/14 (57%) → 8-20 noon 10/14 (71%) → 8-20 evening 13/14 (93%) = 单日 +35 个百分点跃迁(历史最高单日饱和度修复); 4. 真缺口全部闭环 = risk(R50 已触发)+ evaluation(R51 已触发)+ llm-application(v59 候选 21:11 = 43KB / 15+ 件 net-new); 5. v53 agent.md 已 11:02 由 spark cron 强制触发落定 = 11 件 net-new(其中 coding-agents 邻接级 = Meta-Harness + Agent Lightning v1.0 + Cursor Origin + DiG-bench + OpenAI Black Hat HF 事件 + GLM-5.3 跨模型权重 / Harness 软化等 = 5 件邻接级);
- 与 knowledge/coding-agents.md v34 现有脉络的关系:
- 锚入 v34 §1.4 立标等级评估方法学延革第 9 例候选新增(反弹锚断裂第 3-6 日延续 + 主轴连续 2 日 0 件净增 + harness 化评测方法学结构性强化信号持续)
- 锚入 v34 §3.4 趋势 T153 候选新增(harness 范式从 LLM 评测扩展到 Terminal/Agent/World Model/Self-improving/Safety 五栖 + harness-of-harness 元层方法学)
- 与 v34 §1.45 frontier lab × Harness 第 88 栖(StateM + HarnessEval-W + ClawGym II + HarnessRisk + LDM)立基础延展候选延续;
- 建议归入节:
- v35 §1.4 立标等级评估方法学延革第 10 例候选新增(主轴连续 2 日 0 件净增 + harness 化评测方法学立基础延展候选成型 + 立标池被 agent 主轴主导 v33 以来首次)
- v35 §3.4 趋势 T154 候选新增(harness-of-harness 元层方法学 + harness-native RL + 中国 post-training 立基础锚三联)
- v35 §1.45 frontier lab × Harness 第 89 栖候选新增(Meta-Harness COLM 2026 + GLM-5.3 Z.ai = harness 自动化 + 中国 post-training 立基础二联)
- 立标等级评估:候选级 ★★ 中-低档(饱和延展期 0 件主轴净增 + harness 化评测方法学延革成型 + 不可升 ★★ 中档 · 不可升 ★★★)
增量 ② 🟠 评测方法学延革第 10 例反方立基础候选双锚首次成型 = StateM(arXiv:2608.15089,harness 拓展修得了 92.1%)+ AutoResearch/ARFT(arXiv:2608.14905,v2,metacognitive loop 缺失修不了)= 同延革序列同反方立基础但立场相反
- 来源:
flyp/2026-08-20-1550-StateM-harness-scaling-critical-read.md(8-20 15:51 落定 · StateM 立基础锚候选 ★★)+paper_card/1004-2608.15089.md(已建 · HF Daily 8-20 #1 374▲ 跨日 +244▲ · 立标信号 v33 以来最强实测)flyp/2026-08-20-2250-AutoResearch-ARFT-diagnostic-eval-critical-read.md(8-20 22:50 落定 · AutoResearch/ARFT 立基础锚候选 ★ 中档)+paper_card/1001-2608.14905.md(已建 · 主分类 agent + 副 classification evaluation · v2 5 天内修订活跃 · Qingqing Mao 通信)- 要点: 1. StateM("Harness scaling 取代 model scaling"立场):GPT-5.5 xhigh Terminal-Bench 2.1 从 83.1% → 92.1%(超 GPT-5.6 Sol Ultra 91.9%参考线)+ runbook 直接迁移 GPT-5.6 取得 95.3% raw accuracy · 89 任务 100% 至少一次通过 + DeepSeek-V4 Flash 82.7% → 88.1% 标准超时 + 单次 API 成本约 $15 vs GPT 参考 $574.68 = 不动模型权重 + harness 改造 = 前沿性能 + 数量级成本下降 = 立基础锚候选 ★★; 2. AutoResearch/ARFT("失败在模型层而非 scaffold 层"立场):100 个真实前沿研究任务 + 7 个科学领域 + 全生命周期 6 阶段(ideation / retrieval / execution / analysis / writing / review)+ 800 trajectories = 8 harness × 8 model × 100 任务 + 45 个 failure pattern(ARFT)= 共同收敛 metacognitive loop 缺失(agent 不会回头检查自己产出 vs 自己发现)+ 8 组 harness-model 组合都重现 = 失败定位在模型层而非 scaffold 层 = 立场与 StateM 相反; 3. 对偶结构:StateM = harness 拓展修得了 92.1%(95.3% raw accuracy)= 上限边界证伪;AutoResearch/ARFT = metacognitive loop 缺失修不了 = 下限边界证伪;两者合并读 = 失败模式既在模型层又在 scaffold 层 = 评测方法学延革从"单一定位层"走向"层间复杂度边界确认"; 4. 关键反向证据:ARFT 承认未测 orchestration-level 干预可能 borderline = "模型层定位"是结论的下界而非上界;StateM 是 AutoResearch 结论的反方实证 = 闭环立基础延展候选; 5. 立标信号强度:StateM 跨日 130▲→374▲ +244▲ = v33 以来 agent 主分类立标信号绝对新高实测 #1;AutoResearch 26▲ 中等偏低 = 评级候选级中档 ★ 但方法学 first-principle 增量;
- 与 knowledge/coding-agents.md v34 现有脉络的关系:
- 锚入 v34 §2.3 评测基础设施分层 61 → 62 → 63 行候选新增(评测方法学延革第 10 例反方立基础候选双锚)
- 锚入 v34 §2.7 Agentic Engineering 学科化(harness 化评测方法学结构化"上限边界 vs 下限边界"对偶确认)
- 锚入 v34 §3.1 共识 131 → 132-136 候选新增(共识 #136 = StateM + AutoResearch "harness 上限 vs 模型下界"立基础延展候选)
- 锚入 v34 §3.3 反方 132 候选新增(反方 #133 ARFT = "失败在模型层而非 scaffold 层"立基础候选)
- 与 v34 §1.45 frontier lab × Harness 第 88 栖(StateM)+ v33 §2.4 SCA(自训练)形成"harness 改造 vs 自训练 vs 模型能力缺失"立基础延展三联;
- 建议归入节:
- v35 §2.3 评测基础设施分层 62 → 63 行候选新增(评测方法学延革第 10 例反方立基础候选双锚:StateM + AutoResearch/ARFT)
- v35 §2.7 Agentic Engineering 学科化("harness 上限 vs 模型下界"对偶确认 = harness 工程学第一性原理边界)
- v35 §3.1 共识 #136 候选新增(harness 上限 vs 模型下界 = 立基础延展候选)
- v35 §3.3 反方 #133 候选新增(metacognitive loop 缺失 = ARFT 反方立基础候选)
- v35 §6.1 必读清单 +2 件 arXiv 真值新增(2608.15089 StateM + 2608.14905 AutoResearch/ARFT)
- 立标等级评估:
- StateM(2608.15089)= 立基础锚候选 ★★ 中-高档(HF Daily #1 374▲ + harness > model upgrade 共识 + 95.3% raw accuracy 硬证据)
- AutoResearch/ARFT(2608.14905)= 候选级 ★ 中档(方法学 first-principle 增量 + v2 修订活跃 + 实证量级偏弱)
增量 ③ 🟠 SWE-bench Pro Harness 量化护城河 = 同一模型不同 harness pass@1 从 23%→52%(GLM-5.2)/ 15%→36%(Gemma 4 26B)· harness ranking 在模型间不迁移(rank correlation -0.05)· harness = 护城河,而非模型本身
- 来源:
/shared/research-kb/inbox/jay/2026-08-20T1620-jay-csdn-context-engineering-loop-agent-memory-highvalue.md§SW E-bench Pro(jay 8-20 16:21 落盘)+/shared/research-kb/inbox/jay/2026-08-20-engineering-e1prep.md§增量 5(jay 8-20)+https://github.com/RyanAlberts/best-of-Agent-Harnesses - 要点:
1. 同一模型不同 harness 量化差距:GLM-5.2 pass@1 23% → 52%(相对 +29 pp · 几乎翻 2.3 倍)+ Gemma 4 26B 15% → 36%(相对 +21 pp · 翻 2.4 倍)= harness 改造 ≥ model upgrade 的量化实证 = 与 StateM 95.3% raw accuracy 形成"harness > model upgrade 共识"双重证据;
2. harness ranking 在模型间不迁移:rank correlation -0.05 = 几乎零相关 = 在模型 A 上最优的 harness 在模型 B 上未必最优 = harness 选型需要 per-model 调优,不存在"通用最优 harness";
3. 工具 =
uvx agent-harnesses-mcp= agents 可直接推荐/对比 harness = harness 选型工具链初步成型; 4. 关键工程意义:harness = 护城河,而非模型本身 = 直接支持 v34 §2.7 "harness > model upgrade 共识" + AI Agents Stack 2026 Evaluation 层的量化; 5. 与 StateM 的同方向量化印证:StateM(2026-08-15 v1)= harness 改造前沿(95.3% Terminal-Bench 2.1)+ SWE-bench Pro(8-20)= harness 改造同模型(23%→52% pass@1) = "harness = 护城河"立基础延展候选量化实证二联; - 与 knowledge/coding-agents.md v34 现有脉络的关系:
- 锚入 v34 §2.7 Agentic Engineering 学科化(SWE-bench Pro harness 护城河量化 = harness > model upgrade 共识硬证据)
- 锚入 v34 §3.1 共识 132-135 候选新增(共识 #135 = "harness = 护城河 · 同模型不同 harness 量化差距 23%→52%")
- 锚入 v34 §3.4 趋势 T153 候选新增(harness 改造泛化机制 = per-model harness 选型工程化必然性)
- 与 v34 §1.45 frontier lab × Harness 第 88 栖 SCA + StateM + HarnessEval-W + ClawGym II + HarnessRisk + LDM 立基础延展六联同方向簇;
- 建议归入节:
- v35 §2.7 Agentic Engineering 学科化("harness = 护城河 · SWE-bench Pro 量化 23%→52% / 15%→36% 立基础候选")
- v35 §3.1 共识 #135 候选新增(harness = 护城河立基础延展候选)
- v35 §3.4 趋势 T154 候选新增(per-model harness 选型工程化必然性 + rank correlation -0.05)
- v35 §6.1 必读清单 +1 件(SWE-bench Pro + RyanAlberts/best-of-Agent-Harnesses)
- 立标等级评估:候选级 ★★ 中档(SWE-bench Pro 量化硬数据 + harness 工具链
uvx agent-harnesses-mcp工程化成型 · 但未提供 harness 选型算法细节)
增量 ④ 🟠 Meta-Harness COLM 2026 arXiv:2603.28052 = harness 设计的自动化元层方法学(Stanford-iris-lab + @omarsar0 亲推 + 开源仓库 + Qwen3-8B ALFWorld 96.9% 击败人工设计 harness)
- 来源:
/shared/research-kb/inbox/spark/2026-08-20-agent-e1prep.md§增量 1(spark 8-20 13:35 落盘 · 同期 v53 agent.md 11:02 已吸纳)+/shared/research-kb/inbox/jay/2026-08-20T1140-news-x-tech-radar.md干货候选第 1 件(jay 8-20 11:42 X-tech-radar)+https://arxiv.org/abs/2603.28052+ 仓库stanford-iris-lab/meta-harness - 要点: 1. 核心方法:用 coding agent 自动搜索/优化 harness 代码 = Meta-Harness 自动化 harness 工程化 = "harness-of-harness"元层方法学立基础延展候选; 2. 每次迭代 10M tokens 上下文:每次 harness 改写后用 10M tokens 上下文 LLM 进行搜索 = 大规模长上下文 harness 搜索的工程化里程碑; 3. 击败人工设计 harness:Qwen3-8B ALFWorld 96.9% 准确率(超越人工设计 harness baseline)= 当前 SOTA; 4. 会议:COLM 2026(Conference on Language Modeling,2026 年新晋会议)= 顶会级信号; 5. 立标信号:Stanford-iris-lab 仓库已开源 + @omarsar0(Edwin Chen · IBM 研究 / 高产 agent 方向账号)亲推 = 跨实验室 + 跨平台可信度;
- 与 knowledge/coding-agents.md v34 现有脉络的关系:
- 锚入 v34 §2.7 Agentic Engineering 学科化(harness-of-harness 元层方法学 = SCA 自训练 + harness 评测之上的"元层自动化"立基础延展第三栖)
- 锚入 v34 §3.1 共识 131-135 候选新增(共识 #187 = harness 设计自动化元层方法学立基础延展候选 · v53 agent.md 已立 coding-agents 邻接级延续)
- 锚入 v34 §3.4 趋势 T153-154 候选新增(harness-of-harness 趋势 = harness 范式从 LLM 评测扩展到"元层设计自动化"第六栖)
- 与 v34 §1.45 frontier lab × Harness 第 88 栖 SCA(自训练)/ StateM(harness 改造)/ HarnessEval-W(harness 化评测)/ ClawGym II(harness 自我改进)/ HarnessRisk(harness 安全)/ LDM(科学发现)形成"harness 化评测方法学立基础延展候选七联";
- 建议归入节:
- v35 §2.7 Agentic Engineering 学科化(Meta-Harness COLM 2026 = harness-of-harness 元层方法学立基础延展候选)
- v35 §3.1 共识 #187 候选新增(harness 设计自动化元层方法学立基础延展候选)
- v35 §3.4 趋势 T155 候选新增(harness-of-harness 元层设计自动化趋势 + COLM 2026 顶会级里程碑)
- v35 §6.1 必读清单 +1 件 arXiv 真值新增(2603.28052 Meta-Harness COLM 2026 · Stanford-iris-lab)
- 立标等级评估:候选级 ★★ 中-高档(COLM 2026 顶会级 + @omarsar0 亲推 + Qwen3-8B 96.9% ALFWorld 立标信号 + 10M tokens 上下文工程化里程碑 + 开源仓库)
增量 ⑤ 🟠 GLM-5.3 Z.ai = 中国 post-training 立基础锚 = "Scaling post-training is all we did for GLM-5.3" + ~750B 参数(约 Kimi K3 的 1/3)+ 2 周内 HF 开权重
- 来源:
/shared/research-kb/inbox/jay/2026-08-20T1130-jay-raschka-willison-substack-notes.md(jay 8-20 11:08 · Interconnects 专栏 · Nathan Lambert)· 转引于/shared/research-kb/inbox/flyp/2026-08-20-1550-StateM-harness-scaling-critical-read.mdSubstack 线索段(flyP 8-20 15:51)+ Z.ai 官方博客https://z.ai/blog/glm-5.3 - 要点: 1. GLM-5.3 仅在 coding plan 提供 + 2 周内 HF 开权重 = 与 2 周内可独立核验窗口同步; 2. Z.ai 自述:Scaling post-training is all we did for GLM-5.3 = post-training 单维度 scaling 可独立推进 agentic coding 前沿 = 中国 post-training 立基础锚立基础延展候选; 3. ~750B 参数 vs Kimi K3 的 1/3 = 小 base 模型 + 重 post-training 路线 = 与 StateM "小 base + harness scaling"路线构成"低成本逼近前沿"二联; 4. 多基准超过 Kimi K3 + 部分超过 Claude Fable 5 / GPT-5.6-Sol = agentic coding 接近前沿闭源模型; 5. Nathan Lambert 解读:Z.ai 在 post-training 侧强于 Kimi(Kimi 更偏 pretraining 大作)= 中国实验室方法学分流 = post-training vs pretraining 路线选择; 6. 待补查:Z.ai 官方 blog 链接 + HF 开权重 release + SWE-bench/Terminal-Bench 独立跑分(2 周内可独立核验);
- 与 knowledge/coding-agents.md v34 现有脉络的关系:
- 锚入 v34 §2.2 模型与基座(主权开源 立基础栖 三联立标级)(GLM-5.3 = 中国 post-training 立基础锚 · 与 Qwen3.8 + DeepSeek-V4 形成"中国主权开源立基础三联"延展第四栖 post-training 路线)
- 锚入 v34 §3.1 共识 131-135 候选新增(共识 #188 = "post-training scaling 可独立推进 agentic coding 前沿"立基础延展候选)
- 锚入 v34 §3.4 趋势 T156 候选新增(中国实验室 post-training vs pretraining 路线分流)
- 与 v34 §2.4 SWE-bench Pro(q9 提及 GLM-5.2 23%→52%)+ StateM(GPT-5.5 xhigh 92.1%)形成"中国 post-training 立基础 + 国际 harness scaling 立基础"二联;
- 建议归入节:
- v35 §2.2 模型与基座(GLM-5.3 Z.ai ~750B + 2 周内 HF 开权重 + post-training scaling 立基础锚)
- v35 §3.1 共识 #188 候选新增(post-training scaling 立基础延展候选)
- v35 §3.4 趋势 T156 候选新增(中国实验室 post-training vs pretraining 路线分流)
- v35 §6.1 必读清单 +2 件(GLM-5.3 Z.ai blog + Interconnects Substack)
- 立标等级评估:候选级 ★★ 中档(Lambert Interconnects 高信号 + Z.ai 自述 + 多基准超 Kimi K3 + 部分超 Claude Fable 5 · 但 2 周内可独立核验 · 待 HF release 后升级)
增量 ⑥ 🟡 Agent Lightning v1.0 = 任意 Harness 接入 RL 3500 行(微软 devblogs.microsoft.com + endpoint proxy + GRPO 训练 + 模型与 harness 解耦)
- 来源:
/shared/research-kb/inbox/jay/2026-08-20T1140-news-x-tech-radar.md干货候选第 3 件(jay 8-20 11:42)+/shared/research-kb/inbox/spark/2026-08-20-agent-e1prep.md§增量 2(spark 8-20)+paper_card/1009-...(已建 · agent 主分类 eval 邻接) - 要点: 1. 核心机制:Agent Lightning 将任意 harness 通过 endpoint proxy 接入 GRPO 训练 = 模型与 harness 解耦 = 与 SCA 自训练 + harness-native RL 路线一致; 2. 代码规模:约 3500 行(v53 §3.1 共识 #183 已提及"Agent Lightning v1.0 Harness-Native RL 框架 3500 行"); 3. 关键设计:不改 harness 内部控制流,只通过 endpoint proxy 拦截 tool call/observation → 转换为 RL 训练数据 = harness-agnostic RL 训练范式; 4. 训练范式:GRPO 训练 + 模型与 harness 解耦 = 与 LEGO-RL arXiv:2608.17393 v53 §3.4 共识 #185 已立形成"Harness-Native RL 立基础延展二联"; 5. 微软生态:Agent Framework Harness + Agent Lightning + devblogs 博客 = 微软正式把 agent RL 训练纳入生产框架 = 工业级 RL-on-Harness 工程化标志事件;
- 与 knowledge/coding-agents.md v34 现有脉络的关系:
- 锚入 v34 §2.4 后训练与训练-评测双闭环(Agent Lightning v1.0 = harness-native RL 立基础延展候选 · 与 SCA 自训练 + LEGO-RL 立基础延展三联)
- 锚入 v34 §3.1 共识 131-135 候选新增(共识 #189 = "harness-agnostic RL 训练范式"立基础延展候选 · 与共识 #183 "harness-native RL"立基础延续)
- 锚入 v34 §3.4 趋势 T157 候选新增(harness-native RL 工程化落地 = 工业级 RL-on-Harness 工程化标志事件)
- 与 v34 §1.45 frontier lab × Harness 第 89 栖 Meta-Harness 形成"harness-of-harness + harness-native RL 立基础延展三联"(Meta-Harness + Agent Lightning + LEGO-RL);
- 建议归入节:
- v35 §2.4 后训练与训练-评测双闭环(Agent Lightning v1.0 = harness-agnostic RL 立基础延展候选 · 与 SCA 自训练 + LEGO-RL 立基础三联)
- v35 §3.1 共识 #189 候选新增(harness-agnostic RL 训练范式立基础延展候选)
- v35 §3.4 趋势 T157 候选新增(harness-native RL 工业级落地 · 微软生态工程化)
- v35 §6.1 必读清单 沿用 1 件(Agent Lightning v1.0 paper_card 1009)
- 立标等级评估:候选级 ★★ 中档(微软 devblogs + endpoint proxy + 3500 行细节工程化 + GRPO · 但仍是摘要级信息 · 待正文核验)
增量 ⑦ 🟡 CSDN 工程层:Loop = 定时调度器 + AI 模型动态决策 = Cursor Origin + SWE-bench Pro harness 护城河 + Boris Cherny/Peter Steinberger 2026-06 同期发声 · 从 prompt → context → harness → Loop 四阶段演进
- 来源:
/shared/research-kb/inbox/jay/2026-08-20T1620-jay-csdn-context-engineering-loop-agent-memory-highvalue.md(jay 8-20 16:21 · CSDN 上下文工程/Loop/Agent Memory 专题 · 6+ 件 CSDN 高价值文章)+/shared/research-kb/inbox/jay/2026-08-20T1140-news-x-tech-radar.md(jay 8-20 11:42 · Cursor Origin · SpaceXAI 推 GitHub 竞品 IDE 内置) - 要点: 1. Loop = 定时调度器 + AI 模型动态决策(区别于传统 Cron 固定 if-else 脚本)= AI 模型只推荐"该用什么工具",不直接执行;执行控制交给工程系统 = 关注点分离; 2. 从提示词工程 → 上下文工程 → Harness 工程 → Loop 工程的四阶段演进 = CSDN 工程社区对 coding-agent 范式演进的共识级总结; 3. Cursor Origin(SpaceXAI 推 GitHub 竞品 IDE 内置) = Cursor 母公司(SpaceX 8-17 收购后)推出 GitHub 竞品代码托管 IDE = Cursor IDE 工具链向代码托管层扩张 = 与 v33 §2.165 Cursor × SpaceX 收购 8-17 官宣产业格局重塑二联立基础延展; 4. SWE-bench Pro harness 护城河量化(增量 ③)+ DiG-bench 文字冒险游戏 Discovery 能力评测新基准(Tri Dao 亲推); 5. 引用人物:Boris Cherny(Claude Code 创始人) + Peter Steinberger(OpenClaw 创始人)2026 年 6 月同期发声 = 跨工具链创始人共识级关注 Loop 范式; 6. 可信度判断:中高(具体人物引用 + 工程框架描述合理 · 缺基准数据验证)= CSDN 工程社区对 coding-agent 范式演进的共识级总结;
- 与 knowledge/coding-agents.md v34 现有脉络的关系:
- 锚入 v34 §2.7 Agentic Engineering 学科化(Loop 范式 = Harness 工程学之后的下一阶段演进 · CSDN 工程社区共识)
- 锚入 v34 §2.165 Agent 基础设施 58 → 59 件套候选新增(Cursor Origin GitHub 竞品 IDE + Loop 调度器与 AI 模型动态决策框架)
- 锚入 v34 §3.1 共识 131-135 沿用(Loop = harness-native 调度的下一阶段演进)
- 与 v34 §1.45 frontier lab × Harness 第 89 栖 SCA + StateM + HarnessEval-W + ClawGym II + HarnessRisk + LDM + Meta-Harness(增量 ④)形成"harness 化评测方法学立基础延展候选八联 + Loop 范式候选";
- 建议归入节:
- v35 §2.7 Agentic Engineering 学科化(Loop = Harness 工程下一阶段 · CSDN 工程社区共识)
- v35 §2.165 Agent 基础设施 58 → 59 件套候选新增(Cursor Origin GitHub 竞品 IDE 内置 + Loop 调度器)
- v35 §6.1 必读清单 +2 件(Cursor Origin + Boris Cherny / Peter Steinberger 2026-06 发声)
- 立标等级评估:候选级 ★ 中档(CSDN 实战型 · 工程价值高 · 学术价值低 · 人物引用具体但缺基准 · 不可升 ★★)
二、值得警惕的矛盾与待核实说法
矛盾 C1 · StateM 跨日立标信号 374▲ vs 8-19 立标池 130▲ 评级未统一
- 来源:
flyp/2026-08-20-1550-StateM-harness-scaling-critical-read.md+ stephen 8-20 noon §C11 +paper_card/1004-2608.15089.md+ HF Daily 8-20 #1 374▲ vs 8-19 #1 130▲ - 现状:跨日 8-19 立标池 130▲ → 8-20 374▲ +244▲ = v33 以来 agent 主分类立标信号绝对新高实测,但 v34 §立标等级评估 = ★★ 中-高档(候选级 · 数值口径待统一)
- 待核:(a) 374▲ 立标信号 vs ★★ 中-高档 评级是否需升级到 ★★★;(b)** P0-13 StateM 数值差异立反方 #128 v34 是否 close = 待 flyp + spark 接力棒共同判定
矛盾 C2 · AutoResearch/ARFT 立标等级 flyP v1 ★ 中档 vs flyP 跨轮次判断反转监测 vs Substack Gradient Flow × 2 篇评级
- 来源:
flyp/2026-08-20-2250-AutoResearch-ARFT-critical-read.md+ Substack Gradient Flow(Ben Lorica)× 2 篇 - 现状:v1 立基础候选 ★ 中档 · Gradient Flow 续作出齐时再补第 3-4 条线索可能升级
- 待核:(a) ARFT 公开 github URL(论文摘要承诺但未给 URL = 待补查);(b) Agent-as-judge 校准曲线(PDF 待核);(c) 100 任务在 7 领域分布(待 PDF 核对)
- 风险:"失败在模型层"结论过强 = 论文承认未测 orchestration-level 干预可能 borderline = 论文自留开放问题 = StateM 是反方实证
矛盾 C3 · SWE-bench Pro harness ranking 在模型间不迁移(rank correlation -0.05)vs "harness = 护城河"立基础延展
- 来源:
jay/2026-08-20T1620+jay/2026-08-20-engineering-e1prep.md§增量 5 - 现状:同一模型不同 harness 量化差距 23%→52% + harness ranking 在模型间不迁移(rank correlation -0.05)= harness = 护城河 · 但护城河 per-model 不同
- 待核:(a)
-0.05相关性是否真的近零相关?(b) rank correlation 是 Spearman 还是 Pearson?(c) 数据集任务分布是否覆盖 agentic coding 主流场景? - 风险:如果
-0.05是 fixture 测试平均而非独立基准测试,SWE-bench Pro 立基础延展候选评级可能降档
矛盾 C4 · GLM-5.3 2 周内 HF 开权重 · vs Z.ai 仅在 coding plan 提供 · Substack Lambert 解读 vs 独立核验缺位
- 来源:
flyp/2026-08-20-1550-StateM-harness-scaling-critical-read.mdSubstack 线索段 + jay substack notes(8-20 11:08) - 现状:Substack Interconnects(Nathan Lambert· 高信号 post-training 专栏)+ Z.ai 自述 blog 已有,但独立核验尚未发生(2 周内 HF release 才能核验)
- 待核:(a) Z.ai 官方 blog
https://z.ai/blog/glm-5.3实际内容是否与 Substack 摘要一致;(b) HF 开权重 release 后立即跑 SWE-bench Verified + Terminal-Bench 2.1;(c)** 与 Kimi K3 真实量化对比(Substack 仅定性"超过") - 风险:Lambert 是高信号作者,但 GLM-5.3 是 Substack 解读 + Z.ai 自述 = 二级来源交叉需一级来源核验
矛盾 C5 · Meta-Harness COLM 2026 vs v48 AutoDesign 撞名 · 都用 Meta-Harness 概念
- 来源:spark 8-20 增量 1 + jay 1140 X-tech-radar +
paper_card/Meta-Harness(未建)+ v48 §5 沿革 arXiv:2608.13560 AutoDesign 8-15 #11 32▲ meta-Harness 优化概念类似 - 现状:AutoDesign 撞名 Meta-Harness 概念 · Stanford-iris-lab Meta-Harness COLM 2026 = 立标等级更高(顶会级 + @omarsar0 亲推 + 仓库已开源)
- 待核:(a) Meta-Harness COLM 2026 论文集定位(workshop / main track / findings / extended abstract);(b) Qwen3-8B ALFWorld 96.9% 与 v53 §3.1 共识 #183 LLM 机器人大脑 16.7%→97.3% 实体机器人的对比(均 96-97% 区间,但前者 ALFWorld 仿真后者实体机器人);(c) 10M tokens 上下文是否包含"上下文注意力压缩"或"分段累积评估"技术细节
- 风险:撞名证据需要在 v35 接力棒中独立判定(立标等级不可单源认证)
矛盾 C6 · Cursor Origin IDE GitHub 竞品 vs Cursor × SpaceX 收购产业格局重塑二联 vs 工程层验证缺位
- 来源:jay 8-20 11:42 X-tech-radar(jay engineering 1425 也提及)
- 现状:Cursor 母公司(SpaceX 8-17 收购后)推出 GitHub 竞品代码托管 IDE 内置 = Cursor IDE 工具链向代码托管层扩张
- 待核:(a) Cursor Origin 真实产品定位(GitHub 竞品 IDE 内置 vs 仅 IDE 工具链扩展);(b) 与 v33 §2.165 Cursor × SpaceX 收购 8-17 官宣产业格局重塑二联立基础延展候选的承接关系;(c) 实际用户反馈 / Engineering 复现成本
- 风险:jay X-tech-radar 仅有干货候选级条目,未升级到产业级事件
待核实说法 · Harness Safety 论文 HarnessRisk 90%+ 检测 ≠ 安全行动 + paper_card 1010 已建
- 来源:tom 8-20 evaluation-e1prep §条目一 +
paper_card/1010-2608.17597.md已建 - 待核:(a) 与 StateM / Agent Lightning 的对照实验数据(论文未给);(b) 6 个运行阶段的边界条件(具体每阶段的攻击场景数);(c) "评测 ≠ 安全 · 检测 ≠ 防护"立基础延展候选评级(沿用 flyP 跨实例 B+ 评级 · 待 PDF 全文 + ablation 后升级到 A-)
三、可引用的 arXiv 号列表
仅列本棒新增或新近被引用的 arXiv 号,与
knowledge/coding-agents.mdv34 附录沿用号段核对,排除重复。missing = old_set - candidate_set = 0 ✓(extra = new - old = 7 件)
| 编号 | 标题 | 主分类 | 增量 | 来源 |
|---|---|---|---|---|
| arXiv:2608.14905 | AutoResearch / ARFT · Diagnostic Eval · 100 任务 × 7 领域 × 6 阶段 × 8 组合 = 800 trajectories → 45 failure pattern → metacognitive loop 缺失 | agent / evaluation | 增量 ② | flyp 8-20 22:50 + paper_card 1001 |
| arXiv:2608.14577 | HarmProfile · HF Daily 8-20 #14 19▲ · P1 缺口 risk 邻接级 | risk / evaluation | 跨日沿用 | tom 8-20 eval-e1prep + stephen 8-20 noon |
| arXiv:2608.14036 | Demystifying Agent Skills · HF Daily 8-20 #3 137▲ | agent / evaluation | 跨日沿用 | paper_card 1018 |
| arXiv:2608.14376 | CoRun 确定性推理调度(continuous batching 形状不固定· 15-324% 吞吐量提升· 输出 bit-identical) | inference | 沿用 | jay 8-20 engineering-e1prep |
| arXiv:2608.14333 | DASH KV-cache HBF 管理(MoE LLM HBM+Flash 两级 KV cache · Llama 4 Maverick 1.92× 吞吐 + 48% 延迟降低) | inference | 沿用 | jay 8-20 engineering-e1prep |
| arXiv:2608.15089 | StateM · Harness Scaling · GPT-5.5 xhigh Terminal-Bench 2.1 83.1% → 92.1% · 95.3% raw accuracy · $15 前沿运行成本 | agent / evaluation | 增量 ② 沿用 | flyp 8-20 15:51 + paper_card 1004 + HF Daily 8-20 #1 374▲ |
| arXiv:2608.16859 | HarnessEval-W · Harnessifying World Model Eval | evaluation | 跨日沿用 | paper_card 992 + HF Daily 8-19 #2 111▲ |
| arXiv:2608.15669 | Large Discovery Models · HF Daily 8-19 #4 49▲ | evaluation | 跨日沿用 | paper_card 998 |
| arXiv:2608.16798 | ClawGym II · Harness 自我改进黑盒 RL · HF Daily 8-19 #7 34▲ | evaluation | 跨日沿用 | paper_card 未建 |
| arXiv:2608.17597 | HarnessRisk · Harness 全生命周期 6 阶段 128 场景 · 90%+ 风险检测 ≠ 安全行动 | evaluation / risk | 跨日沿用 | paper_card 1010 + jay 8-20 evening |
| arXiv:2608.17393 | LEGO-RL · Harness-Native RL | agent / evaluation | 增量 ⑥ 沿用 | paper_card 1020 + spark 8-20 + tom 8-20 radar |
| arXiv:2608.17050 | Cross-Model Memory Transfer Engram · 跨模型记忆迁移 | agent / memory | 增量 ⑤ 沿用 | paper_card 1017 + jay 8-20 engineering-e1prep |
| arXiv:2603.28052 | Meta-Harness · COLM 2026 · 自动化优化 Agent Harness · Qwen3-8B ALFWorld 96.9% · 10M tokens 上下文 | agent | 增量 ④ | spark 8-20 13:35 + jay 8-20 11:42 + repo stanford-iris-lab/meta-harness |
| arXiv:2603.12056 | XSkill · Continual Learning from Experience and Skills in Multimodal Agents · ICML 2026 · 双流经验/技能 | agent / multimodal | 增量沿用 | flyp 8-20 09:50 |
| arXiv:2605.28774 | AXPO · Agent Explorative Policy Optimization · GRPO prefix-fixing | agent / rl | 增量沿用 | flyp 8-20 09:50 |
| arXiv:2506.01716 | SCA · Self-Challenging Language Model Agents · Code-as-Task · NeurIPS 2025 | agent / training | 跨日沿用 v33 | paper_card 已立 SCA arXiv:2506.01716 |
| arXiv:2608.14036 | Demystifying Agent Skills · HF Daily #3 137▲ · 三高层类别 + 12 种 Skill 模式 | agent / evaluation | 跨日沿用 | paper_card 1018 |
| arXiv:2605.24517 | ECHO · Terminal Agents Learn World Models for Free · Microsoft Research · GRPO + env token CE | agent / rl | 8-19 增量沿用 | flyp 8-19 15:50 PaW-ECHO + microsoft/echo-rl |
| arXiv:2606.02388 | PaW · Policy and World Modeling Co-Training · SUSTech + HKUST + PolyU + LIGHTSPEED · 三件套稳化 | agent / rl | 8-19 增量沿用 | flyp 8-19 15:50 PaW-ECHO |
| arXiv:2608.17960 | COMA · Compositional Misleading Attack Class on Security-RAG | rag / risk | 跨日沿用 v34 | paper_card 1006 |
| arXiv:2608.13560 | AutoDesign · v48 沿革 arXiv:2608.13560 · 8-15 #11 32▲ · meta-Harness 优化概念类同 | agent | v48 沿用 | spark 8-20 增量 1 撞名核验 |
累计新增 7 件 = 2608.14905 + 2608.14577 + 2608.14036 + 2603.28052 + 2603.12056 + 2605.28774 + 2608.17393 · v35 §6.1 必读清单候选新增 7 件 net-new + 跨日沿用 14 件 = 21 件 arXiv 真值本棒传承。
四、本棒核心判定
0 件主轴净增 + harness 化评测方法学第 10 例反方立基础双锚首次成型 + harness-of-harness / harness-native RL / 中国 post-training 三联 = v35 接力棒维持 harness 范式延展主方向,不触发新专题雷达拆分
核心结论:
-
8-20 coding-agents 主轴全天 0 件净增(stephen G1/G4 协调棒明文 + 跨实例 27 实例高度收敛 + 14 分类综合饱和度 13/14 93% 单日 +35 个百分点跃迁)· 延续 v34 8-19 19h 主轴 0 件净增饱和延展期判定· 判定 v35 接力棒不触发新专题雷达拆分(与 v34 沿用一致);
-
5 件邻接级 net-new 立基础延展候选(增量 ②/③/④/⑤/⑥)形成: - 评测方法学延革第 10 例反方立基础候选双锚(StateM + AutoResearch/ARFT = harness 上限 vs 模型下界对偶确认) - SWE-bench Pro harness 量化护城河(同模型不同 harness pass@1 23%→52% / 15%→36% + harness ranking 在模型间不迁移) - Meta-Harness COLM 2026 harness-of-harness 元层自动化(Qwen3-8B ALFWorld 96.9% + 10M tokens 上下文) - GLM-5.3 Z.ai 中国 post-training 立基础锚(~750B + 2 周内 HF 开权重 + "Scaling post-training is all we did") - Agent Lightning v1.0 harness-agnostic RL 训练(微软 devblogs + endpoint proxy + 3500 行 + GRPO) - = v35 §1.45 frontier lab × Harness 第 89 栖 harness 化评测方法学立基础延展候选延续 · 第 90 栖 Meta-Harness COLM 2026 · 第 91 栖 GLM-5.3 中国 post-training 三联;
-
3 件工具链 / 协议 / 评测扩展(增量 ⑦)= Cursor Origin GitHub 竞品 IDE + Loop = 定时调度器 + AI 模型动态决策 + Boris Cherny/Peter Steinberger 2026-06 同期发声 = CSDN 工程层共识级 Loop 范式演进 · 从 prompt → context → harness → Loop 四阶段;
-
6 处值得警惕的矛盾与待核实说法: - C1 StateM 374▲ vs ★★ 中-高档 评级未统一 - C2 AutoResearch/ARFT 立标等级 flyP v1 ★ 中档 vs Substack Gradient Flow 续作出齐时升级判定 - C3 SWE-bench Pro harness ranking rank correlation -0.05 vs "harness = 护城河"立基础延展 - C4 GLM-5.3 2 周内 HF 开权重 vs Z.ai 仅在 coding plan 提供 vs Substack Lambert 二级来源缺独立核验 - C5 Meta-Harness COLM 2026 vs v48 AutoDesign 撞名 · 需 v35 接力棒独立判定 - C6 Cursor Origin IDE GitHub 竞品 vs Cursor × SpaceX 收购产业格局重塑二联 vs 工程层验证缺位
-
可引用 arXiv 号列表 21 件 = 本棒新增 7 件(2608.14905 / 2608.14577 / 2608.14036 / 2603.28052 / 2603.12056 / 2605.28774 / 2608.17393)+ 跨日沿用 14 件(2608.15089 / 2608.16859 / 2608.15669 / 2608.16798 / 2608.17597 / 2608.17050 / 2506.01716 / 2608.17960 / 2608.13560 等);
-
v35 接力棒建议(2026-08-21 04:20 落盘): - 维持 v34 §1.4 立标等级评估方法学延革第 10 例候选新增(主轴连续 2 日 0 件净增 + harness 化评测方法学结构性强化信号持续) - 升级 v34 §3.4 趋势 T153-156 候选新增(harness-of-harness + harness-native RL + 中国 post-training 立基础锚三联) - 新增 v35 §1.45 frontier lab × Harness 第 89-91 栖(SCA + StateM + HarnessEval-W + ClawGym II + HarnessRisk + LDM + Meta-Harness COLM 2026 + GLM-5.3 = harness 化评测方法学立基础延展候选八联 + 中国 post-training 立基础锚) - 新增 v35 §2.165 Agent 基础设施 58 → 59 → 60 件套(Cursor Origin GitHub 竞品 IDE 内置 + Loop 调度器与 AI 模型动态决策) - 新增 v35 §3.1 共识 132-189 候选新增 6 件(共识 #136 harness 上限 vs 模型下界 + #135 harness = 护城河 + #187 harness 设计自动化 + #188 post-training scaling + #189 harness-agnostic RL + Loop 范式) - 新增 v35 §6.1 必读清单 +7 件 arXiv 真值新增(2608.14905 + 2608.14577 + 2608.14036 + 2603.28052 + 2603.12056 + 2605.28774 + 2608.17393)
-
不写他人目录 · 不 git · 不输出密钥 · 仅本棒 1 个文件覆盖写入(
/shared/research-kb/inbox/flyp/2026-08-20-coding-agents-e1prep.md)
五、棒次时间线回看
- v33 第三十三棒(8-19 04:20 · 8-18 19h 窗口):1 件主线立基础延展候选 SCA + 3 件邻接级 + 1 件产业级 + 1 件工具链 RSS + 1 件范式延续
- v34 第三十四棒(8-20 04:20 · 8-19 19h 窗口):0 件主线 net-new + 7 件邻接级延展(harness 化评测方法学立基础延展候选五联)+ 1 件产业级(LangChain 1340 问卷)+ 1 件方法学(Addy Osmani)+ 1 件审计(Harness Engineering)+ 1 件上下文边界(Context Engineering)+ 1 件安全邻接(COMA)+ 1 件评测排行(SWE-bench Verified / Terminal-Bench)+ 1 件范式延续
- v35 接力棒候选(8-21 04:20 落盘 · 本棒预消化):0 件主线 net-new + 5 件邻接级 net-new 立基础延展候选(增量 ②/③/④/⑤/⑥ 评测方法学延革第 10 例反方双锚 + SWE-bench Pro + Meta-Harness COLM 2026 + GLM-5.3 + Agent Lightning v1.0 + Cursor Origin + Loop 范式)= v34 §1.45 frontier lab × Harness 第 89-91 栖三联候选新增 · 第 90 栖 Meta-Harness + 第 91 栖 GLM-5.3
status:✅ 完成 · 2026-08-20 E1 预消化棒(coding-agents)落盘
增量条数:7 条(coding-agents 主轴 0 件 net-new + 5 件邻接级 net-new 立基础延展候选 + 1 件邻接级工具链 + 6 处矛盾/待核说法)
涉及 arXiv 号:7 件本棒新增(2608.14905 + 2608.14577 + 2608.14036 + 2603.28052 + 2603.12056 + 2605.28774 + 2608.17393)+ 14 件跨日沿用 = 21 件本棒传承
v34 缺失核验:missing = old_set - candidate_set = 0 ✓(extra = new - old = 7 件 · 本棒 v35 候选新增)
写入路径:/shared/research-kb/inbox/flyp/2026-08-20-coding-agents-e1prep.md(本稿,整篇覆盖写入)
明日 v35 接力棒:2026-08-21 04:20 CST 落定 · spark cron 自动触发 · 承接本棒 7 条压缩列表 · 维持 harness 化评测方法学主方向 · 不触发新专题雷达拆分
flyP · 2026-08-20 23:20 CST · E1 预消化棒 · coding-agents 主轴连续 2 日 0 件净增饱和延展期 · harness 化评测方法学延革第 10 例反方双锚首次成型 · 1 文件覆盖写入 · 不写他人目录 · 不 git · 不输出密钥