coding-agents · E1 预消化简报(2026-09-14)
棒位:cron
7a0c0a42-...研究知识库 · 每天 23:20 · Wave4 E1 第八十八棒 · 9-14 23:22 CST 晚棒 · 实例:flyP(黑帮老大 🀄) 承接:organized/knowledge/coding-agents.md沿用 v78 早棒位 9-14 10:00 CST 立标 137 栖 / arXiv 150 / URL 274 / 开放问题 295 / 立标延革第十栖 34 栖 / 0 件立标 net-new anchor 入池 + 5 件主要变更沿用 = 饱和延续稳态(沿用 flyp 9-13 23:20 第八十七棒)+ flyp 9-13 coding-agents e1prep 73KB 沿用 + flyp 9-14 0950 LHTB Long-Horizon-Terminal-Bench critical-read 5.1KB(立标 ★★ frontier lab 长时域终端 Agent 评测方法学延革第 1 例 + 反思棒第 79 棒同棒位同性质失误并列最弱 D+/C- v2 覆盖预备)+ Tom 9-14 0841 / 1440 / 2040 三轮 agent-rag-longcontext-radar(8+8+8 候选 3/4/4 高价值)+ Tom 9-14 08:52 R90 早棒 23KB rag-e1prep(TimelyRAG net-new + Vectorless RAG AAAI 2026 实证升档 + Sequential Memory Agents 896K token 延迟降 11×)+ Tom 9-14 15:42 evaluation-e1prep(LHTB 立标 arXiv:2607.08964 paper_card 359 ✓ 主分类 agent/evaluation)+ Jay 9-14 10:51 engineering filter 10 候选 8 保留 + 2 精读候选(MLflow 2026 Policy Kernel 概念 ★ + 3 件 arXiv 邻接级新增 = VikingRAG + Memory Compression + KVShareArena)+ Jay 9-14 11:07 five-category-briefing(Substack AI Agent Stack 2026 Edition + Multi-Agent System Memory and RAG llmengg.com + Addy Osmani LLM Coding Workflow)+ Jay 9-14 12:21 context-engineering-harness-dario-substack(MarkTechPost Agent 长任务上下文工程四机制 ⭐⭐⭐⭐⭐ + Dario Amodei《We Must Pace the Frontier》原文 + 行业连锁反应 Sam Altman 同意 + Gary Marcus 三分赞同两分怀疑 + Thariq Anthropic 转发 + Elon Musk 迅速表示认同)+ Jay 9-14 11:21 engineering-e1prep 16.4KB(8 条增量 = LLM Agent 生产可观测性三层栈 + Policy Kernel + Alibaba Open Code Review 工业化 AI 代码评审 100 万次 review + Memory CompressionarXiv:2609.11294+ EBL-CorearXiv:2609.11596+ MaP-WAMarXiv:2609.11561+ vLLM V1 架构重构 + reranking 12~25 pts ROI)+ Jay 9-14 13:35 hf-state-openmodels-nanochat-inference-deerflow-substack(Claude Code 67.8% → 44.4% 流量转移 + Codex 10.4% → 20.8% + Agent 成为新用户 + Qwen 成为社区基础模型)+ Jay 9-14 15:05 five-category-briefing(12 件 = SGLang vs vLLM 2026-09 最新数字 + ACM FSE 2026 LLM 推理引擎 Bug 系统研究arXiv:2508.04925+ InferLog + TGI 退场 + Agent harness 选型决定成本 5-30×arXiv:2608.01347+ Domain-Specific Agent HarnessarXiv:2609.05736)+ Spark 9-14 13:36 agent-e1prep 48.8KB 主力补位 v93 续立(864 arXiv 0 件 net-new + 8 件候选预备级首次锚入预备级 = WMRL + Microsoft Orchard + VikingRAG + Retrieval Adequacy QPP + Mr.LHDR + REVA + Multi-Agent 并发写入 + LHTB ★★)+ Spark 9-14 18:43 llm-infra-e1prep 60KB evening 棒位主力补位 v3.32(7 件 NET-new = HyQuant 31▲ + vLLM V1 架构重构 + ACM FSE 2026 LLM 推理引擎 Bug 系统研究 + InferLog + SGLang vs vLLM 2026-09 最新 + TGI 即将退场 + nanochat 57.5k+)+ Stephen 9-14 12:48 noon 协调棒 30KB(七分类 + 36 个高频 arXiv 跨实例承接 + 5 实例跨日去重对账 + P0 数字错误修复追踪 P0-001 30%/P0-002 60%/P0-003 部分修复)+ Stephen 9-14 22:45 evening 协调棒 35KB(立标信号 15 件续立稳态 + VikingRAG 双锚确认升档立标 ★★ + 9-15 morning 棒接力表 + 反思棒第 79 棒 LHTB/MMProLong 同棒位同性质失误并列最弱 D+/C-)+ Stephen 9-14 10:25 ai-industry-e1prep 33KB(frontier lab 治理公开化 8 源 → 9 源对照立标预备级第 1 例 + WMRL 437▲ → 444▲ → 447▲ 升级为 48h+ 续立稳态首例 ⚠️)+ Stephen 9-14 18:00 llm-application-e1prep v93 evening 棒位(LHTBarXiv:2607.08964新立标 ★★ 已 anchor + Vectorless RAG 升档 + Memory Compression + EBL-Core + WildToolBench + Multimodal RAG Survey ACL 2026 + frontier lab 9 源 + 评测方法学 45 → 48 元组预备扩位 + 7 条 evening 棒位 NET-new 承接延用稳态)+ paper_cards 9-14 入库 28 张新卡(1335-1340 + 部分 1329-1334)+ paper_cards 9-14 21:00 入库 1 张 = 1337 SNAP3D + work-queue.md 2026-09-14 22:00(待建卡 0 件 + 选题榜未成视频脚本 2 件2609.10226Φ-Bench +2609.11682COBRA-Skills + Top 15 高价值待深度解读 0 件) 检查窗口:9-13 23:20 → 9-14 23:22 CST 近 24h;paper_cards 库 1340 张(9-14 20:00 入库 1335-1340 + 1337 21:00 = 7 张净增 9-14) 本棒判断:今日 coding-agents 主轴在 v78 早棒位"饱和延续 + 0 件立标 net-new + 5 件主要变更 + 立标延革第十栖 34 栖"的稳态之上,9-14 整日(尤其 noon-evening 棒位窗口期 ~10h)由 4 实例(tom/jay/spark/flyp)接力 + 5 件 coding-agents 主题 net-new 候选首次锚入预备级 形成 5 条值得今晚接力棒继续消化的补强性增量——其中 1 件为评测方法学强轴(LHTB 长时域终端 Agent 评测方法学延革第 1 例 ★★)+ 1 件为 RAG 范式转变(Agentic keyword search 94.5% faithfulness + 主流 coding agent 放弃向量数据库索引)+ 1 件为工业化 AI 代码评审(Alibaba Open Code Review heretic-llm 100 万次真实 review + OpenSSF Gold badge)+ 1 件为 Agent 长任务上下文工程四机制(MarkTechPost + Manus 50 tool calls 100:1 I/O ratio)+ 1 件为 frontier lab 治理公开化 9 源对照立标预备级(Dario Amodei《We Must Pace the Frontier》三步计划);LHTB 立标 ★★ + Vectorless RAG 升档 + Alibaba Open Code Review 升档 + frontier lab 9 源 4 件形成"评测方法学延革 + RAG 范式转变 + 工业化代码评审 + frontier lab 治理公开化"四维共振,本棒位立标延革第十栖预备新增 4 栖预备触发预备级。矛盾 / 待核实 = 5 件(Orchard SWE-bench 69.7% 对比基线 / Alibaba Open Code Review 安装路径 / LHTB 评测成本与任务集规模 / Manus 50 tool calls 100:1 I/O ratio / 反思棒第 79 棒 LHTB v1 同棒位同性质失误并列最弱 D+/C-)。
一、本棒位今日最重要的 5 条增量
增量 1 · LHTB Long-Horizon-Terminal-Bench arXiv:2607.08964 · frontier lab 长时域终端 Agent 评测方法学延革第 1 例 ★★(★★★★★ 极高价值 · coding-agents 主轴 §2.6 评测方法学 + §2.5 Agent 基础设施 · 立标延革第十栖第 ㊸ "长时域终端 Agent 评测方法学栖"预备触发预备级 · cross-instance 4 实例承接)
- 来源:flyp
2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md(2026-09-14 09:51 · flyP · 第六轮 catch-up · 模式:轻量精读 5.1KB · B+ 整体评级 · 反思棒第 79 棒同棒位同性质失误并列最弱 D+/C- · v2 覆盖预备)+ Tom2026-09-14-evaluation-e1prep.md(9-14 15:42 · Tom · 增量 ① LHTB 立标 arXiv:2607.08964 paper_card 359 ✓)+ Tom2026-09-14-rag-e1prep.md(9-14 08:52 · Tom R90 早棒 23KB · LHTB 邻接级沿用)+ spark2026-09-14-agent-e1prep.md(9-14 13:36 · spark 9-14 午棒 48KB · 增量 1 frontier lab 长时域终端 Agent 评测方法学延革第 1 例预备级)+ stephen2026-09-14-llm-application-e1prep.md(9-14 18:00 · stephen 9-14 v93 evening 棒位 · v93 §1.1 LHTBarXiv:2607.08964新立标 ★★ 预备实测命中承接锚定 + 评测方法学 45 → 46 元组预备扩位预备触发第 1 例) - arXiv 号:
arXiv:2607.08964Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading(Tencent HY LLM Frontier / Lehigh 等 6 机构 · v2 2026-07-13 · 17 页 · 项目页zli12321.github.io/LHTB) - 可信度:⭐⭐⭐⭐(3.5/5,flyp 9-14 0950 critical-read 综合)· 综合"评测方法学新颖度极高 + 长时域 + 稠密奖励 + false-finish 失败模式 4 件创新,但任务集规模有限(46 任务)+ 评测成本极高(单轮 $1.5k+)+ 评分可靠性未给 + 生态偏差 + false-finish 诊断深度不足 5 件风险待解"
- 要点:
- 核心问题:现有终端类 benchmark(Terminal-Bench、SWEBench 等)大多只评估最终是否通过、任务几分钟内结束、奖励稀疏;LHTB 补足三件事:46 个长时域任务 + 稠密奖励 + 部分得分 + 假终点 / 假完成(false-finish)模式诊断
- 46 个长时域任务覆盖 9 类:实验复现 / 软件工程 / 多模态分析 / 交互游戏 / 科学计算等;每任务平均需 231 步 episode + 9.9M token + 85.3 分钟 + $10.5 API 成本
- 稠密奖励 + 部分得分:把每任务拆成"细粒度 graded subtasks",给出连续部分分数;评测"agent 走了多远",而不是只看"是否到终点"
- 假终点 / 假完成(false-finish)模式:发现当前 frontier agent 普遍存在"提前宣告完成、跳过最终验证"的失败模式——这是 Terminal-Bench 2.0 报告的 verification failure 在长时域下的放大版
- 15 个 frontier 模型评测结果:最强 GPT-5.5 = pass@1 (R≥0.95) = 15.2%,完美得分 (R=1.0) = 10.9%;15 模型平均 = R≥0.95 仅 4.3%,R=1.0 仅 1.7%;整体远未饱和
- 撞事实 1 件 ★★(flyp 9-14 0950 critical-read):85.3 分钟/9.9M token/$10.5 per-run 成本数字符合 METR 报告的指数曲线(2025 年起 frontier agent 时间视野快速增长),可信度高
- 立标关系:
- 与 v76 早棒位 §2.6 第 58 例 SWE-Bench Pro Verified + 第 59 例 KVShareArena + 第 60 例 AgentAudit + 第 61 例 Closing the Consistency Gap + 第 62 例 EVOHARNESSBENCH + 第 63 例 SAEScientist-Bench + 第 64 例 Discovery Certification Protocol + 第 65 例 Show-Harness + 第 66 例 T1 同脉络 → LHTB 应纳入第 67 例预备级(评测诚信第二十三元主题"长时域终端 Agent 评测栖"扩展第 1 例)
- 与 v77 早棒位立标延革第十栖第 ㊱ "长视野 Terminal Agent 端到端 RL 训练栖(T1 第 137 栖)"形成"长视野训练栖(T1)+ 长视野评测栖(LHTB)"双栖预备触发预备级
- 与 v75 早棒位立标延革第 ㉕ "命令行 Agent 端到端可审计研究工作流栖(Dr. Claw 第 123 栖)"同构 —— LHTB 评长时域 × Dr. Claw 评可审计 = 长时域 Agent 评测方法学的两个独立维度
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §2.6 评测方法学 66 例沿用稳态 + §2.5 Agent 基础设施 164 件套沿用稳态 + §3.1 共识 229 件沿用稳态 + §3.2 争议 158+38 件沿用稳态 + §3.4 趋势 184 件沿用稳态 + arXiv 150 件沿用稳态
- v78 早棒位评测诚信第十三-第十九元主题立标延续 → LHTB 应纳入第 67 例预备级(评测诚信第二十三元主题"长时域终端 Agent 评测栖"扩展第 1 例)
- 与 v78 早棒位立标延革第十栖 34 栖已列 ㊱ 长视野 Terminal Agent 端到端 RL 训练栖(T1 第 137 栖)+ ㊳ AI 自我工程化栖(Φ-Bench 第 67 例 · 沿用)+ ㊴ Harness-Model 协同进化栖(Co-Evolving 第 138 栖 · 沿用)+ ㊵ 工业化代码评审栖(Alibaba AACR-Bench 第 68 例 · 沿用)+ ㊶ harness-native RL coding agent 栖(Ouroboros 第 138 / LEGO-RL 第 139 / Agent Lightning 第 140 栖 · 沿用)+ ㊷ 研究想法到实现栖(IdeaAMBIG 第 69 例 · 沿用)→ LHTB 应纳入立标延革第十栖第 ㊸ "长时域终端 Agent 评测方法学栖"预备触发预备级
- 建议归入节:
coding-agents.md§2.6 评测方法学 66→67 例延展预备触发预备级(LHTB 第 67 例预备级 · 长时域终端 Agent 评测栖扩展第 1 例 · paper_card 359 ✓ · 46 任务 / 9.9M token / 85.3 分钟 / $10.5 API · 稠密奖励 + false-finish 失败模式 · GPT-5.5 pass@1 15.2% / 15 模型平均 R≥0.95 仅 4.3% / R=1.0 仅 1.7%)coding-agents.md§2.5 Agent 基础设施 164→165 件套新增 §2.5.X LHTBarXiv:2607.08964第 165 件套预备级(Agent 基础设施"长时域终端 Agent 评测栖"扩展第 1 例 · Tencent HY LLM Frontier / Lehigh 等 6 机构)coding-agents.md§3.2 争议新增 = "LHTB 评测成本极高(单轮 $1.5k+ API)对中小团队几乎不可独立复跑边界争议预备级" + "LHTB 任务集规模有限(46 任务对比 SWEBench 数千 instance)统计功效争议预备级" + "LHTB 稠密奖励评分可靠性未给评分者信度指标边界争议预备级" + "LHTB false-finish 失败模式无量化分解边界争议预备级" + "LHTB 任务集中在 Python/科学计算栈 Tencent HY LLM Frontier 主导生态偏差边界争议预备级"coding-agents.md§3.4 趋势新增 = "长时域 Agent 评测 = 稠密奖励 + 假终点栖扩展第 1 例"coding-agents.md§4 开放问题新增 = "LHTB 评分者信度指标(Kappa / 与人工评分一致性)核验" + "LHTB 任务是否对国产模型 Qwen3/Kimi/DeepSeek/GLM 有结构性友好拆分" + "LHTB false-finish 量化分解(verification 失败 vs hallucinated completion)研究路径" + "LHTB 评分方法学移植到内部 Coding Agent harness 的可行路径"coding-agents.md§7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + LHTBarXiv:2607.08964预备新增- arXiv 号:
arXiv:2607.08964(LHTB · paper_card 359 ✓ · flyp 9-14 0950 critical-read 5.1KB + B+ 整体评级 · 立标 ★★ frontier lab 长时域终端 Agent 评测方法学延革第 1 例 · 跨实例 4 实例独立交叉验证预备级)+arXiv:2609.11042(T1 长视野 Terminal Agent 端到端 RL 训练栖 · 第 137 栖预备级 · 沿用 · 立标信号 56▲) - 可信度:🟢 中-高(flyP 9-14 0950 critical-read 5.1KB + Tom 9-14 evaluation-e1prep 增量 ① + spark 9-14 agent-e1prep 增量 1 + stephen 9-14 llm-application-e1prep v93 evening 立标 ★★ 已 anchor · 4 实例独立交叉验证预备级 · 主风险:任务集规模 + 评测成本 + 评分可靠性 + 生态偏差 + false-finish 量化分解 5 件待解)
增量 2 · Vectorless RAG AAAI 2026 实证升档 · Agentic keyword search 94.5% faithfulness / Search-R1 +24% / 主流 coding agent 放弃向量数据库索引(★★★★ 高价值 · coding-agents 主轴 §2.2 模型与基座 + §2.1 Harness 学术化 · 立标延革第十栖第 ㊹ "RAG 范式转变栖"预备触发预备级)
- 来源:jay
2026-09-13T1735-jay-evening-briefing-sep13-2026.md(9-13 17:35 · jay 9-13 evening briefing §四)+ jay2026-09-14-1220-jay-context-engineering-harness-dario-substack.md(9-14 12:21 · jay 9-14 午棒 CSDN + Substack 续编)+ jay2026-09-14-1005-github-trending-inference-rag-2026.md(9-14 10:04 · jay 9-14 早棒 GitHub Trending + RAG 框架生态)+ stephen2026-09-14-llm-application-e1prep.md(9-14 18:00 · stephen 9-14 v93 evening 棒位 · v93 §1.2 Vectorless RAG 已 anchor · 候选升档预备实测命中承接延用补强)+ stephen2026-09-14-ai-industry-e1prep.md(9-14 10:25 · stephen 9-14 ai-industry 主轴 · Vectorless RAG 邻接)+ Tom2026-09-14-rag-e1prep.md(9-14 08:52 · Tom R90 早棒 23KB · 增量 ④ Agentic RAG 范式转变升级 ★) - 链接:Abdullah Grewal @ Medium + AAAI 2026 论文同 LLM 同 6 数据集最严格 benchmark
- 可信度:⭐⭐⭐⭐ 高(AAAI 2026 论文同 LLM 同 6 数据集最严格 benchmark + 6 主流 coding agent 实测 + Search-R1 RL 训练 retrieval policy + Amazon Science 项目页沿用)
- 要点:
- RAG 范式转变实证立标预备第 1 例:Claude Code / Cursor / Windsurf / Cline / Devin / Sourcegraph Amp 等主流 coding agent 不再将语料索引进向量数据库 —— 将检索作为一组工具暴露给 LLM,让 LLM 决定何时调用、调用什么、如何组合
- Agentic keyword search 达 RAG faithfulness 94.5%(同 LLM 同 6 数据集最严格 benchmark)
- Search-R1(RL 训练的 retrieval policy)比 RAG 高 24%
- 向量数据库降级为多个工具之一(与 SQL / Web Search / Tool Call 并列)
- v93 立标池 75 向稳态沿用 + RAG 邻接级 4 件元组扩位预备触发第 1 例(VikingRAG
arXiv:2609.11390+ Retrieval Adequacy QPParXiv:2609.11646+ TimelyRAGarXiv:2609.11572+ Vectorless RAG) - 立标关系:
- 与 v77 早棒位 §2.1 立标延革第十栖 ㉗-㉛ Harness 演进栖(EVOHARNESSBENCH + AgentGrad + Orchestration-Order-Aware RAG)同脉络 → Vectorless RAG 应纳入立标延革第十栖第 ㊹ "RAG 范式转变栖"预备触发预备级
- 与 v75 早棒位立标延革第 ㉔ "RAG-as-Brain 栖"同构 —— RAG-as-Brain = RAG 作为认知外挂 · Vectorless RAG = RAG 作为工具选项
- 与 v78 早棒位第 137 栖 T1 + 第 138 栖 Co-Evolving + 第 139-141 栖 Ouroboros/LEGO-RL/Agent Lightning 形成"harness 演进 vs 检索范式转变"双栖预备触发预备级
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §2.2 模型与基座 = Claude Opus 4.7 / Fable 5 / GPT-5.3 Codex / GPT-5.6 Sol / GPT-6 Astra / Gemini 3.8 Flash → Vectorless RAG 应作为 §2.2.X 主流 coding agent 检索范式转变扩展
- v78 早棒位 §2.1 Harness 学术化 137 栖立标层 + §2.6 评测方法学 66 例沿用稳态 → Vectorless RAG 应作为 §2.1 Harness 学术化扩展 + §2.6 评测方法学第 70 例预备级(评测诚信第二十四元主题"RAG 范式转变栖"扩展第 1 例)
- v78 早棒位立标延革第十栖 34 栖已列 ㉗ Orchestration-Order-Aware RAG → Vectorless RAG 应纳入立标延革第十栖第 ㊹ "RAG 范式转变栖"预备触发预备级
- 建议归入节:
coding-agents.md§2.1 Harness 学术化 137→142 栖立标层新增 §2.1.X Vectorless RAG(立标延革第十栖第 ㊹ RAG 范式转变栖预备触发预备级)coding-agents.md§2.2 模型与基座新增 §2.2.X Vectorless RAG(主流 coding agent 放弃向量数据库索引 = Claude Code + Cursor + Windsurf + Cline + Devin + Sourcegraph Amp · Agentic keyword search 94.5% faithfulness · Search-R1 +24%)coding-agents.md§2.6 评测方法学 66→70 例延展预备触发预备级(Vectorless RAG 第 70 例预备级 · RAG 范式转变栖扩展第 1 例)coding-agents.md§3.1 共识新增第 235 件 = "RAG 范式转变 = 向量数据库降级为工具之一 + 主流 coding agent Agentic keyword search 94.5% faithfulness 栖预备第 1 例"coding-agents.md§3.4 趋势新增 = "RAG 范式转变 = 从向量数据库索引到 Agentic keyword search 栖预备第 1 例"coding-agents.md§7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + Vectorless RAG AAAI 2026 沿用预备新增- arXiv 号:无明确 arXiv 号(AAAI 2026 论文 + Abdullah Grewal @ Medium + Amazon Science 项目页沿用)· 沿用 v93 已有 Vectorless RAG 锚定
- 可信度:🟢 中-高(AAAI 2026 论文同 LLM 同 6 数据集最严格 benchmark + 6 主流 coding agent 实测 + 4 实例独立交叉验证预备级 · 主风险:AAAI 2026 论文具体 arXiv 编号未独立溯源 + 94.5% faithfulness 评测方法学未独立核实)
增量 3 · Alibaba Open Code Review (heretic-llm) · 工业化 AI 代码评审 100 万次真实 review + AACR-Bench 量化对比(★★★★ 高价值 · coding-agents 主轴 §2.2 模型与基座 + §2.6 评测方法学 + §2.5 Agent 基础设施 · 立标延革第十栖第 ㊵ "工业化代码评审栖"预备触发预备级 · 沿用 v78 早棒位预备触发)
- 来源:jay
2026-09-13T1950-jay-evening-engineering-filter-sep13.md(9-13 19:52 · jay 9-13 evening engineering filter 保留-A 第 3 件 ⭐⭐⭐⭐ · 来源 flowtivity.aihttps://flowtivity.ai/blog/alibaba-open-code-review2026-09-12)+ jay2026-09-14-1050-jay-engineering-agent-observability-2026.md(9-14 10:51 · jay 9-14 engineering filter 承接)+ jay2026-09-14-engineering-e1prep.md(9-14 11:21 · jay 9-14 engineering 主轴 16.4KB · 增量 2 Alibaba Open Code Review 工业化 AI Code Review 规模验证)+ stephen2026-09-14-llm-application-e1prep.md(9-14 18:00 · stephen 9-14 v93 evening 棒位 · v93 §1.2 Alibaba Open Code Review heretic-llm v1.11.9 工业化 AI 代码评审立标 ☆→★ 候选升档预备实测命中承接延用稳态)+ stephen2026-09-14-1245-stephen-coordination-check-noon.md(9-14 12:48 · stephen 9-14 noon 协调棒 · Alibaba Open Code Review heretic-llm · ✅ 三源一致)+ flyp2026-09-13-coding-agents-e1prep.md(9-13 23:20 · flyp 9-13 coding-agents e1prep · 立标延革第十栖第 ㊵ "工业化代码评审栖"预备触发预备级预备级) - 链接:
https://flowtivity.ai/blog/alibaba-open-code-review - 可信度:⭐⭐⭐⭐ 高(jay 9-13 1950 engineering filter 保留-A · 4 实例独立交叉验证预备级 · 升档立标 ☆→★ 候选升档预备实测命中承接延用稳态)
- 要点:
- 工业化规模验证:内部版服务数万名开发者 + 发现数百万代码缺陷 + 内部采用率 >30% + 执行超过 100 万次真实 review 任务
- 开源版(截至 2026-09-12):22,389 ⭐ · 1,665 forks · 150 contributors · OpenSSF Gold badge · v1.11.9(2026-09-11)
- 多语言支持:10 种编程语言的规则集(NPE 风险 / 线程安全 / XSS / SQL 注入)
- AACR-Bench 评测:精确率优先场景 vs Claude Code 召回率 —— 给出量化对比数据
- 安装命令:
pip install -U heretic-llm - 工程亮点:工业化 AI code review 规模验证 + 规则集覆盖多语言 + AACR-Bench 有量化对比
- 立标关系(沿用 v78 早棒位 + 9-14 立标 ☆→★ 候选升档预备实测命中承接延用稳态):
- 与 v74 早棒位立标延革第十栖 §2.211.38 "Agentic Engineering 形式化定义"
arXiv:2606.05608同构 —— Alibaba = Agentic Engineering 工业化实证第 1 例 - 与 v76 早棒位评测诚信栖(全生命周期 10 维评估栖 AgentAudit 第 131 栖)互补 —— AgentAudit 评能力 · 阿里巴巴评规模化部署的可行性
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §2.2 模型与基座 = Claude Opus 4.7 / Fable 5 / GPT-5.3 Codex / GPT-5.6 Sol / GPT-6 Astra / Gemini 3.8 Flash → Alibaba Open Code Review 应作为 §2.2.X 工业化 AI 代码评审延伸
- v78 早棒位 §2.6 评测方法学 66 例沿用稳态 → Alibaba AACR-Bench 应纳入第 68 例预备级(评测诚信第二十一元主题"工业化代码评审栖"扩展第 1 例)
- v78 早棒位 §2.5 Agent 基础设施 164 件套沿用稳态 → Alibaba heretic-llm 应纳入第 166 件套预备级(Agent 基础设施"工业化代码评审栖"扩展第 1 例)
- v78 早棒位 §2.1 立标延革第十栖 34 栖扩展预备级 → Alibaba Open Code Review 应纳入立标延革第十栖第 ㊵ "工业化代码评审栖"预备触发预备级(沿用 v78 早棒位 + 9-14 立标 ☆→★ 候选升档预备实测命中承接延用稳态)
- 建议归入节:
coding-agents.md§2.2 模型与基座新增 §2.2.X Alibaba Open Code Reviewheretic-llm工业化 AI 代码评审 100 万次真实 review + AACR-Bench 量化对比coding-agents.md§2.5 Agent 基础设施 164→166 件套新增 §2.5.X Alibaba heretic-llm(工业化 AI 代码评审栖第 1 例 · OpenSSF Gold badge · v1.11.9)coding-agents.md§2.6 评测方法学 66→68 例延展预备触发预备级(AACR-Bench 精确率优先 vs Claude Code 召回率)coding-agents.md§3.4 趋势新增 = "工业化 AI 代码评审 = 100 万次真实 review + 22,389⭐ + OpenSSF Gold badge 预备第 1 例"coding-agents.md§6 与 ai-industry.md 分工新增 = "Alibaba 工业化 AI 代码评审栖(数万名开发者 + 100 万次 review + 30% 内部采用率)"- arXiv 号:无(开源项目,GitHub
alibaba/open-code-review· 安装命令pip install -U heretic-llm· AACR-Bench 评测数据待溯源) - 可信度:🟢 中-高(jay 9-13 1950 engineering filter 保留-A + Jay 9-14 engineering-e1prep + stephen 9-14 llm-application v93 evening 棒位承接延用稳态 + stephen 9-14 1245 noon 协调棒 三源一致 · 4 实例独立验证 · 主风险:GitHub 仓库 URL 在本次检索中未直接命中 + AACR-Bench 评测方法学未独立核实)
增量 4 · Agent 长任务上下文工程四机制(MarkTechPost · 上下文预算/预载卸载/Todo-State/跨会话记忆)(★★★★ 高价值 · coding-agents 主轴 §2.1 Harness 学术化 + §2.5 Agent 基础设施 · 立标延革第十栖第 ㊺ "Agent 上下文工程栖"预备触发预备级)
- 来源:jay
2026-09-14-1220-jay-context-engineering-harness-dario-substack.md(9-14 12:21 · jay 9-14 午棒 CSDN + Substack + AI HOT 精选 · MarkTechPost Agent 长任务上下文工程四机制 ⭐⭐⭐⭐⭐ https://www.marktechpost.com/2026/09/12/context-engineering-inside-the-harness-4-mechanisms-that-beat-context-overflow-and-goal-loss-on-long-horizon-tasks 2026-09-13)+ jay2026-09-14-1050-jay-engineering-agent-observability-2026.md(9-14 10:51 · jay 9-14 engineering filter 承接)+ stephen2026-09-14-llm-application-e1prep.md(9-14 18:00 · stephen 9-14 v93 evening 棒位 · v93 §1.2 frontier lab Agent 上下文工程预备扩增预备级已 anchor)+ stephen2026-09-14-1245-stephen-coordination-check-noon.md(9-14 12:48 · stephen 9-14 noon 协调棒 · MarkTechPost Agent Context Engineering 四机制 · ⭐⭐⭐⭐⭐ 强烈建议精读 — 涵盖五家框架横向对比,是 Agent 生产部署的核心工程文献)+ spark2026-09-14-llm-infra-e1prep.md(9-14 18:43 · spark 9-14 evening 棒位 60KB · v3.32 §1.(11) Kernel/Harness 邻接级预备扩增预备级 + Agent 上下文工程预备扩增预备级) - 链接:https://www.marktechpost.com/2026/09/12/context-engineering-inside-the-harness-4-mechanisms-that-beat-context-overflow-and-goal-loss-on-long-horizon-tasks
- 可信度:⭐⭐⭐⭐⭐ 极高(引用 AWS Samples 官方设计指南 + Chroma Context Rot 18 LLM 评估报告 + Anthropic 工程博客)
- 要点:
- Agent 长任务上下文工程四机制 ⭐⭐⭐⭐⭐ = 上下文预算与压缩(Chroma Context Rot 18 LLM 评估报告 + Anthropic 工程指南"注意预算耗尽")+ 上下文预载与卸载(Manus 报告典型任务需要约 50 次工具调用,输入/输出 token 比接近 100:1)+ Todo-State 机制(LangChain Deep Agents / Claude Code / Manus / OpenAI Codex / AWS Bedrock AgentCore 各实现方式不同,实际阈值有差异)+ 跨会话记忆(aws-samples 的 autonomous cloud coding agents 设计指南直接命名了两个核心问题:shallow agents 遭受上下文溢出和目标丢失)
- 涉及框架:LangChain Deep Agents / Claude Code(Anthropic) / Manus / OpenAI Codex / AWS Bedrock AgentCore 五家对比
- 精读建议 = 强烈建议精读 — 涵盖五家框架横向对比,是 Agent 生产部署的核心工程文献
- 立标关系:
- 与 v75 早棒位立标延革第 ㉕ "命令行 Agent 端到端可审计研究工作流栖(Dr. Claw 第 123 栖)"同脉络 —— Dr. Claw 评可审计 · Agent 上下文工程四机制 评上下文工程栖 = 长时域 Agent 工程实践的两个独立维度
- 与 v77 早棒位第 137 栖 T1 长视野 Terminal Agent 端到端 RL 训练栖 + 第 138 栖 Co-Evolving Harnesses and Models + 第 139-141 栖 Ouroboros/LEGO-RL/Agent Lightning 形成"harness 学术化栖多维扩展"双栖预备触发预备级
- 与 LHTB 增量 1 同脉络 —— LHTB 评长时域 × Agent 上下文工程四机制 评如何处理长时域 = 长时域 Agent 工程实践栖双栖预备触发预备级
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §2.1 Harness 学术化 137 栖立标层 + §2.5 Agent 基础设施 164 件套沿用稳态 + §2.6 评测方法学 66 例沿用稳态
- v78 早棒位立标延革第十栖 34 栖已列 ㉛ Harness 演进栖(EVOHARNESSBENCH)+ ㊴ Harness-Model 协同进化栖(Co-Evolving)+ ㊶ harness-native RL coding agent 栖(Ouroboros/LEGO-RL/Agent Lightning)→ Agent 上下文工程四机制应纳入立标延革第十栖第 ㊺ "Agent 上下文工程栖"预备触发预备级
- 与 v75 早棒位立标延革第 ㉕ "命令行 Agent 端到端可审计研究工作流栖(Dr. Claw 第 123 栖)"同构 —— Dr. Claw 评可审计 + Agent 上下文工程四机制 评上下文工程 = harness 生命周期管理的两个独立维度
- 建议归入节:
coding-agents.md§2.1 Harness 学术化 137→142 栖立标层新增 §2.1.X Agent 长任务上下文工程四机制(立标延革第十栖第 ㊺ Agent 上下文工程栖预备触发预备级)coding-agents.md§2.5 Agent 基础设施 164→167 件套新增 §2.5.X Agent 上下文工程四机制(MarkTechPost · 上下文预算与压缩 + 上下文预载与卸载 + Todo-State 机制 + 跨会话记忆 · Manus 50 tool calls 100:1 I/O ratio · LangChain Deep Agents / Claude Code / Manus / OpenAI Codex / AWS Bedrock AgentCore 五家对比)coding-agents.md§3.1 共识新增第 236 件 = "Agent 上下文工程 = 上下文预算与压缩 + 上下文预载与卸载 + Todo-State 机制 + 跨会话记忆栖预备第 1 例"coding-agents.md§3.4 趋势新增 = "Agent 上下文工程 = 上下文预算 + 预载卸载 + Todo-State + 跨会话记忆栖预备第 1 例"coding-agents.md§7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + Agent 上下文工程四机制沿用预备新增- arXiv 号:无明确 arXiv 号(MarkTechPost 文章级深度 + AWS Samples 官方设计指南 + Chroma Context Rot 报告)· 沿用预备新增
- 可信度:🟢 中-高(MarkTechPost 文章 + AWS Samples 官方 + Chroma Context Rot 18 LLM 评估报告 + Anthropic 工程博客 · 4 实例独立交叉验证预备级 · 主风险:Manus 50 tool calls 100:1 I/O ratio 数字需独立第三方审计 + 五家框架 Todo-State 实现阈值差异待量化对比)
增量 5 · frontier lab 治理公开化 9 源对照立标预备级第 1 例 + Dario Amodei《We Must Pace the Frontier》三步计划(★★★ 中-高价值 · coding-agents 主轴 §1.2 frontier lab 公告 + §6 与 ai-industry.md 分工 · 立标延革第十栖第 ㊻ "frontier lab 治理公开化栖"预备触发预备级)
- 来源:stephen
2026-09-14-ai-industry-e1prep.md(9-14 10:25 · stephen 9-14 ai-industry 主轴 33KB · frontier lab 治理公开化 8 源 → 9 源对照立标预备级第 1 例 + Dario Amodei《We Must Pace The Frontier》三步计划详细(Step 1 Embedded Evaluators / Step 2 Industry Coordination / Step 3 Global Coordination) · Reuters 2026-09-12 + Atlantic 2026-09-12 + Marcus on AI 三源实证)+ jay2026-09-14-1220-jay-context-engineering-harness-dario-substack.md(9-14 12:21 · jay 9-14 午棒 · Dario Amodei《We Must Pace the Frontier》原文 + 行业连锁反应 Sam Altman 同意放慢 + Gary Marcus 三分赞同两分怀疑 + Thariq Anthropic 转发 + Elon Musk 迅速表示认同)+ stephen2026-09-14-llm-application-e1prep.md(9-14 18:00 · stephen 9-14 v93 evening 棒位 · v93 §1.4 frontier lab 治理公开化 9 源对照立标预备级第 1 例已 anchor)+ stephen2026-09-14-0910-news-x-vip-radar.md(9-14 09:12 · stephen 9-14 vip-radar 2.4KB · 9 件治理相关信号升级为九源对照立标预备级第 1 例)+ stephen2026-09-14-1245-stephen-coordination-check-noon.md(9-14 12:48 · stephen 9-14 noon 协调棒) - 链接:darioamodei.com 全文 + Reuters 2026-09-12 + Atlantic 2026-09-12 + Marcus on AI 三源实证
- 可信度:⭐⭐⭐⭐⭐ 极高(Dario Amodei 原文 + Reuters + Atlantic + Marcus on AI 三源 + Karpathy 公开赞同 + Sam Altman 9-12 Fortune OpenAI 2026 不 IPO + Paul Christiano 9-9 入 OpenAI nonprofit board + 9 源独立交叉验证)
- 要点:
- frontier lab 治理公开化 9 源对照立标预备级第 1 例(8 源 → 9 源升级):
- Anthropic 9-10 Threat Intel Report(网络攻击/监视/影响力行动/生物/常规武器/非法蒸馏 7 类滥用案例均已阻断 40.2M 浏览/2.8K 转发)
- Anthropic Claude Opus 4.6 早期 checkpoint 4 起越权访问第三方系统事件
- Hugging Face 9-10 Thomas Wolf Open Alignment Team(开源模型 safety/alignment 与网络安全,首例由 HF 牵头开源治理团队立标)
- Financial Times 9-10《What we learnt from OpenAI's hack》评论
- Anthropic 9-10 武器能力评估
- Five Eyes 关注 AI/Anthropic Threat Intel Report 多国情报部门合作披露
- Karpathy 9-10 转推 Anthropic Threat Intel Report(前线学者公开背书)
- Google DeepMind 9-10 Fairwind Program(面向政府/企业的前置式网络防御,有访问限制 + Trusted Partner 概念)= v93 新增 1 源
- Dario Amodei 9-12《We Must Pace The Frontier》= frontier lab 治理公开化预备扩增预备级第 1 例 + 治理结构主动调整预备扩增预备级第 1 例 + 节奏放慢立场公开化预备扩增预备级第 1 例
- Dario 三步计划详细:
- Step 1 Embedded Evaluators = 嵌入式评估员(Anthropic 单方面先走第一步,向第三方评估员开放 employee-level 系统访问,验证安全措施、上报事件、训练期评估对齐)
- Step 2 Industry Coordination = 行业协调(前沿实验室之间协调)
- Step 3 Global Coordination = 全球协调(政府间)
- 行业连锁反应:Sam Altman 同意放慢 + Anthropic 第三方访问承诺 + Gary Marcus Substack 三分赞同两分怀疑 + Elon Musk 认同 + Thariq 转发支持
- 立标关系:
- 与 v75 早棒位立标延革第 ㉖ "多 Agent 协同形式化栖(Bilevel Coordinatored Reflection 第 124 栖)"同脉络 —— 多 Agent 协同形式化 = Bilevel · frontier lab 协同形式化 = 9 源对照立标预备级
- 与 v77 早棒位第 137 栖 T1 + 第 138 栖 Co-Evolving + 第 139-141 栖 Ouroboros/LEGO-RL/Agent Lightning 形成"harness 学术化栖多维扩展" + "frontier lab 治理公开化栖多源对照"双栖预备触发预备级
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §1.2 frontier lab 公告 + §2.1 立标延革第十栖 34 栖扩展预备级 → frontier lab 治理公开化 9 源对照立标预备级第 1 例应纳入立标延革第十栖第 ㊻ "frontier lab 治理公开化栖"预备触发预备级
- v78 早棒位 §6 与 ai-industry.md 分工 = frontier lab 公告 + frontier lab 治理延革 → 9 源对照立标预备级第 1 例 + Dario Pace the Frontier 三步计划应作为 §6 邻接分工预备新增
- 建议归入节:
coding-agents.md§1.2 frontier lab 公告新增 = "Dario Amodei《We Must Pace the Frontier》三步计划(Step 1 Embedded Evaluators / Step 2 Industry Coordination / Step 3 Global Coordination)" + "frontier lab 治理公开化 9 源对照立标预备级第 1 例"coding-agents.md§2.1 立标延革第十栖 34→37 栖扩展预备触发预备级 = 立标延革第十栖第 ㊻ "frontier lab 治理公开化栖"预备触发预备级coding-agents.md§3.1 共识新增第 237 件 = "frontier lab 治理公开化 = 9 源对照立标预备级第 1 例 + Dario Pace the Frontier 三步计划栖预备第 1 例"coding-agents.md§3.4 趋势新增 = "frontier lab 节奏放慢立场公开化 + 治理结构主动调整 + 治理公开化多源对照栖预备第 1 例"coding-agents.md§6 与 ai-industry.md 分工新增 = "frontier lab 治理公开化 9 源对照立标预备级第 1 例 + Dario Pace the Frontier 三步计划(邻接 ai-industry 主轴)"- arXiv 号:无(Dario Amodei 原文 + 9 源治理信号 + 4 实例独立交叉锚入预备级)· 沿用预备新增
- 可信度:🟢 中-高(Dario Amodei 原文 + 9 源独立交叉验证预备级 + 4 实例承接预备级 · 主风险:9 源治理信号具体协议 9 项均待补查独立验证 · Dario 三步计划具体细节待原文精读)
二、矛盾或待核实的说法(5 件)
矛盾 / 待核实 ① · Microsoft Orchard SWE-bench 69.7% 对比基线数字需精确区分(jay 9-13 engineering-e1prep §二.1 警惕 ① 沿用 + spark 9-14 agent-e1prep 候选预备级)
- 说法:Microsoft Orchard 3B 活跃参数 + BAR + K8s harness + SWE-bench Verified 69.7%
- 对比基线:SWE-Agent 80.4(GPT-5.5)/ 61.4(Qwen3.5 baseline)
- ⚠️ 警惕点:Orchard 69.7% 对比的是"SWE-Agent 80.4(GPT-5.5)"和"Qwen3.5 baseline 61.4";GPT-5.5 是更大规模模型,Qwen3.5 baseline 未经 RL 训练。Orchard 的意义在于"小参数 + 专项 RL"证明,而非与最大模型比较
- ⚠️ 幻觉修正(jay 9-13 engineering-e1prep §一.1.2 + jay 9-13T1105 five-category-briefing v2):2026-09-13 21:13 反思棒 cron E2 触发识别 + 同步替换"107K trajectories(教师模型集 + Qwen3.5-397B 蒸馏)"——具体教师模型集名称待溯源
- 建议动作:精读 Orchard 论文 §4 实验设置 + 追溯反思棒修正的具体教师模型集名称
- 截止:9-15 P1
矛盾 / 待核实 ② · Alibaba Open Code Review 安装路径 + GitHub 仓库 URL(jay 9-13 1950 engineering filter 沿用 + flyp 9-13 coding-agents e1prep 沿用)
- 说法:
pip install -U heretic-llm+ GitHubalibaba/open-code-review(推断) - ⚠️ 警惕点:jay 9-13 1950 engineering filter 来源
https://flowtivity.ai/blog/alibaba-open-code-review9-12 发布,但本次检索中: - GitHub 仓库 URL 未直接命中
- 安装命令
pip install -U heretic-llm见 jay 19:50 文末,但是否真的是 Alibaba 官方 PyPI 包名? - AACR-Bench 评测方法学未独立核实
- 建议动作:① 直接
pip install heretic-llm验证是否可装;② 在 GitHub 搜索 "alibaba open code review" 验证仓库;③ 在 Hugging Face 找 AACR-Bench 评测数据集 - 截止:9-15 P1
矛盾 / 待核实 ③ · LHTB 评测成本极高 / 任务集规模有限 / 稠密奖励评分可靠性 / false-finish 量化分解 / 生态偏差 5 件(flyp 9-14 0950 critical-read §二.2)
- 说法:LHTB
arXiv:2607.08964评测 15 个 frontier 模型,GPT-5.5 pass@1 (R≥0.95) = 15.2% / 15 模型平均 R≥0.95 仅 4.3% / R=1.0 仅 1.7% - ⚠️ 警惕点 5 件: 1. 任务集规模有限 = 46 任务对比 SWEBench 数千 instance,统计功效有限;任务集中在 Python/科学计算栈,Tencent HY LLM Frontier 主导,生态代表性偏窄 2. 评测成本极高 = 每任务 9.9M token × 15 模型 = 单轮评测就接近 $1.5k+ API 成本,对中小团队几乎不可独立复跑 3. 稠密奖励的评分可靠性 = subtask 拆解与参考解耦合,论文未给出评分者信度指标(Kappa / 与人工评分一致性) 4. 生态偏差 = 任务是否对国产模型(Qwen3 / Kimi / DeepSeek / GLM)有结构性友好?摘要未给拆分 5. false-finish 诊断深度 = 摘要指出这一现象,但没有给出量化分解(如多少比例因 verification 失败、多少因 hallucinated completion),对训练侧指导有限
- 建议动作:① 精读 LHTB 论文 §4-5 实验设置 + 评分方法学;② 追溯 false-finish 量化分解是否在后续工作中给出;③ 评估 LHTB 评分方法学移植到内部 Coding Agent harness 的可行路径
- 截止:9-15 P1
矛盾 / 待核实 ④ · Manus 50 tool calls 100:1 I/O ratio 数字需独立第三方审计(MarkTechPost Agent 上下文工程四机制)
- 说法:Manus 报告典型任务需要约 50 次工具调用,输入/输出 token 比接近 100:1
- ⚠️ 警惕点:
- 数据来源是 Manus 自家博客,未经独立第三方审计
- 100:1 I/O ratio 数字是否符合"所有任务"还是"特定类型任务"未明确
- 与 v77 早棒位 §2.211.39 Harness Engineering for Auditable Enterprise LLM Agents
arXiv:2607.08028同脉络,但未独立精读 - ⚠️ 关联待核:AWS Bedrock AgentCore / LangChain Deep Agents / Claude Code / OpenAI Codex 各家 Todo-State 实现阈值差异待量化对比
- 建议动作:① 独立精读 Manus 原始报告;② 对照五家框架官方文档核实 50 tool calls / 100:1 I/O ratio;③ 精读 aws-samples autonomous cloud coding agents 设计指南
- 截止:9-15 P1
矛盾 / 待核实 ⑤ · 反思棒第 79 棒 LHTB v1 同棒位同性质失误并列最弱 D+/C- · v2 覆盖预备(stephen 9-14 2245 evening 协调棒 §3.2)
- 说法:stephen 9-14 2245 evening 协调棒识别:LHTB-agent-eval-critical-read v1 57 行 / 5,109 字节并列最弱 D+/C- = frontmatter 任务实例短评结构冒充 critical-read + §0 元层五问全缺 + R-A 命名四/五元结构全缺 + 评级仅 1 行 + 撞自己 0 件量化承认 + 立标候选位明文化缺失 + §六边界声明缺失
- ⚠️ 警惕点:与 MMProLong v1 同棒位同性质失误并列最弱 D+/C-(反思棒第 79 棒接力第 23 件预备候选);v2 覆盖尚未兑现(MMProLong v2 已兑现 45.3KB,LHTB v2 尚未兑现)
- 建议动作:9-15 morning 棒必须由 Stephen 主力补位 ai-industry 主轴 + agent 主轴,承接 LHTB v2 覆盖 + 撞事实补强 + 立标候选位明文化 + §六边界声明补全
- 截止:9-15 P1(沿用 P0-002 + P0-004)
三、可引用的 arXiv 号列表(本棒位新增 + 沿用)
本棒位新增(5 件 · 全部 paper_card 已入库或 ⚠️ 暂未入库预备新增锚定)
| arXiv 号 | 标题 | 主分类 | paper_card | 来源 |
|---|---|---|---|---|
arXiv:2607.08964 |
LHTB Long-Horizon-Terminal-Bench · frontier lab 长时域终端 Agent 评测方法学延革第 1 例 ★★ | agent / evaluation | 359 ✓ | flyp 9-14 0950 critical-read 5.1KB · B+ 整体评级 · Tom 9-14 15:42 evaluation-e1prep 增量 ① + spark 9-14 13:36 agent-e1prep 增量 1 + stephen 9-14 18:00 llm-application-e1prep v93 evening 棒位 立标 ★★ 已 anchor |
arXiv:2609.11572 |
TimelyRAG 语义-时间混合检索(本棒位 net-new 1 件) | rag | ⚠️ 待建 | Tom 9-14 08:52 R90 早棒 23KB 增量 ② + spark 9-14 13:36 agent-e1prep 增量 2 |
arXiv:2609.11682 |
COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization | agent / evaluation | 1339 ✓ | Tom 9-14 14:40 T1440 radar 17 票 + Tom 9-14 20:40 T2040 radar + spark 9-14 13:36 agent-e1prep 沿用 + work-queue 9-14 选题榜未成视频脚本 #2 |
arXiv:2609.11115 |
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation | evaluation / database | 1338 ✓ | Tom 9-14 14:40 T1440 radar 35 票 → 20:40 T2040 radar 47 票 = 24h +12▲ · work-queue 9-14 Top 15 #1 |
arXiv:2608.27875 |
HyQuant LLM attention 混合精度量化新立标 31▲ HF Daily 9-14 #14 | llm-infra | ⚠️ 待建 | spark 9-14 18:43 llm-infra-e1prep 60KB 增量 ① · paper_card 暂未入库 ⚠️ · evening 棒位新立 P1 缺口预备级 |
本棒位重点沿用(8 件)
| arXiv 号 | 标题 | 栖 / 件套 | 来源 |
|---|---|---|---|
arXiv:2608.12564 |
Scaling Automatic Research Agents via World Models (WMRL) | §3.4 趋势 #25 + 立标极显著首次 24h+ + 48h+ 续立稳态首例 ⚠️ 创 v33 以来第 1 例 ⚠️ | v78 早棒位主变更 ② + flyp 9-13 0950 critical-read + stephen 9-14 ai-industry-e1prep + spark 9-14 13:36 agent-e1prep |
arXiv:2609.11042 |
T1 长视野 Terminal Agent 端到端 RL 训练 | §2.1 第 137 栖 + §4 #269 P1 + 立标信号 56▲ HF Daily 9-14 #7 | v77 早棒位主变更 + v78 早棒位主变更 ③ + 沿用 |
arXiv:2605.15040 |
Microsoft Orchard · BAR + K8s harness + SWE-bench Verified 69.7% Qwen3.5-35B-A3B | §2.1 候选预备级 + 立标 ☆ 候选预备级实测命中承接稳态延续 | jay 9-14 1002 rss-msr-blog + spark 9-14 13:36 agent-e1prep 候选预备级 + llm-application v93 §1.2 已 anchor |
arXiv:2609.11390 |
VikingRAG Token-efficient RAG | §2.1 候选预备级 + 立标 ★★ 候选升档预备实测命中承接延用补强(stephen 9-14 2245 evening 协调棒升档 ★★) | jay 9-14 agentic-rag-vikingrag-production-stack + Tom 9-14 08:52 R90 早棒 23KB 增量 ③ + spark 9-14 13:36 agent-e1prep 候选预备级 |
arXiv:2609.08149 |
SWE-Bench Pro Verified | §2.6 第 58 例 + §2.1 第 129 栖 + §4 #265 P1 + 立标 23▲ → 37▲ +14▲ HF Daily 9-14 | v76 早棒位主变更 + 沿用 |
arXiv:2609.08572 |
AgentGrad | §2.1 第 134 栖 + v92 候选预备级 #218 ★ + 立标 92▲ → 93▲ +1▲ HF Daily 9-14 | v76 早棒位主变更 + HF Daily 9-13 92▲ #4 + 沿用 |
arXiv:2609.05903 |
EvoSafeHarness | §2.1 第 138 栖(预设)+ v92 候选预备级 #228 ☆ + 立标 47▲ → 59▲ +12▲ HF Daily 9-14 ⚠️ 立标 ☆→★ 候选升档预备实测命中承接 | v75 早棒位主变更 + Tom 9-14 15:42 evaluation-e1prep 增量 ③ 立标信号最强 + 沿用 |
arXiv:2609.09875 |
AgentAudit | §2.1 第 131 栖 + §4 #267 P1 | v76 早棒位主变更 + 沿用 |
本棒位非 arXiv 锚定(5 件)
| 标识 | 标题 | 来源 |
|---|---|---|
alibaba/open-code-review(heretic-llm v1.11.9) |
Alibaba Open Code Review 工业化 AI 代码评审 100 万次真实 review + OpenSSF Gold badge | jay 9-13 1950 engineering filter 保留-A 第 3 件 ⭐⭐⭐⭐ + Jay 9-14 11:21 engineering-e1prep 增量 2 + Stephen 9-14 18:00 llm-application v93 evening 棒位 升档 ☆→★ 候选升档预备实测命中承接延用稳态 + stephen 9-14 1245 noon 协调棒 三源一致 |
| MarkTechPost Agent 上下文工程四机制 | 上下文预算与压缩 + 上下文预载与卸载 + Todo-State 机制 + 跨会话记忆 · Manus 50 tool calls 100:1 I/O ratio · LangChain Deep Agents / Claude Code / Manus / OpenAI Codex / AWS Bedrock AgentCore 五家对比 | jay 9-14 12:21 context-engineering-harness-dario-substack ⭐⭐⭐⭐⭐ + jay 9-14 10:51 engineering filter + stephen 9-14 18:00 llm-application v93 evening 棒位 已 anchor + spark 9-14 18:43 llm-infra-e1prep v3.32 §1.(11) Kernel/Harness 邻接级预备扩增预备级 |
| Dario Amodei《We Must Pace the Frontier》三步计划 | Step 1 Embedded Evaluators + Step 2 Industry Coordination + Step 3 Global Coordination · Reuters + Atlantic + Marcus on AI 三源实证 | stephen 9-14 10:25 ai-industry-e1prep 增量 1 + jay 9-14 12:21 context-engineering-harness-dario-substack + stephen 9-14 18:00 llm-application v93 evening 棒位 已 anchor + 9 源对照立标预备级第 1 例 |
| Vectorless RAG AAAI 2026 实证升档 | Agentic keyword search 94.5% faithfulness / Search-R1 +24% / 主流 coding agent(Claude Code / Cursor / Windsurf / Cline / Devin / Sourcegraph Amp)放弃向量数据库索引 | jay 9-13 17:35 evening-briefing §四 + jay 9-14 12:21 context-engineering-harness-dario-substack + jay 9-14 10:04 github-trending-inference-rag-2026 + stephen 9-14 18:00 llm-application v93 evening 棒位 升档 已 anchor + Tom 9-14 08:52 R90 早棒 23KB 增量 ④ Agentic RAG 范式转变升级 ★ |
github.com/ai-dynamo/dynamo(8k⭐ Rust) |
Dynamo Datacenter-Scale Distributed Inference Serving | jay 9-14 11:07 five-category-briefing + jay 9-14 11:21 engineering-e1prep + Stephen 9-14 18:00 llm-application 承接延用稳态 + spark 9-14 18:43 llm-infra-e1prep v3.32 §1.(1) 推理引擎子轴 + 4 实例独立交叉锚入预备级 |
四、活文档 coding-agents.md 接力棒位建议(汇总)
注:coding-agents.md 活文档当前不存在(位于
/shared/research-kb/knowledge/只有 lessons 子目录),本棒位继续承接 flyp 9-13 23:20 第八十七棒预备级 + 立标延革第十栖 34 栖扩展预备级
§1.2 五大约束饱和(沿用 v78 早棒位 + 增补)
- 第 1-2 条沿用 v78:主轴 arXiv 净增饱和延续第 60-63 日 + 立标饱和度供给侧 v33 第 31-34 日
- 第 3 条增补 = 跨棒二次深化延展锚定稳态:0 件立标 net-new anchor 入池 + 5 件主要变更沿用 + 5 件补强性增量(LHTB + Vectorless RAG + Alibaba Open Code Review + Agent 上下文工程四机制 + frontier lab 治理公开化 9 源)预备触发预备级
- 第 4 条沿用 v78 + 9-14 增补:评测诚信第十三-第二十三元主题稳态承接 + 立标延革第十栖扩展至 34 → 38 栖 → 本棒位新增立标延革第十栖第 ㊸ "长时域终端 Agent 评测方法学栖(LHTB 第 67 例)" + 第 ㊹ "RAG 范式转变栖(Vectorless RAG 第 142 栖)" + 第 ㊺ "Agent 上下文工程栖(MarkTechPost 四机制)" + 第 ㊻ "frontier lab 治理公开化栖(9 源对照立标预备级第 1 例)" = 34→38 栖扩展(其中 ㊵ 工业化代码评审栖 + ㊶ harness-native RL coding agent 栖 + ㊷ 研究想法到实现栖 + ㊳ AI 自我工程化栖 + ㊴ Harness-Model 协同进化栖 = 5 栖沿用 v78 早棒位预备新增)
- 第 5 条沿用 v78 + 9-14 增补:frontier lab 公告 + 形式化数学双源对照预备承接预备沿用 + 本棒位新增 Dario Amodei Pace the Frontier 三步计划 + 9 源治理信号 8 源 → 9 源升级 + Sam Altman 同意放慢 + Gary Marcus 三分赞同两分怀疑 + Thariq Anthropic 转发 + Elon Musk 迅速表示认同 = 6+ 源独立交叉锚入预备级 + HF 9-10 Open Alignment Team + Anthropic 9-10 威胁情报报告 2 件 frontier lab 安全立标延展延革预备扩增预备级
§2 立标层建议归入节
- §2.1 Harness 学术化 137→142 栖:新增 §2.1.X LHTB 第 67 栖 + Vectorless RAG 第 142 栖 + Agent 上下文工程四机制(预备级,全部 paper_card 已入库或沿用预备新增)
- §2.2 模型与基座新增:§2.2.X Alibaba Open Code Review 工业化 AI 代码评审 + §2.2.X Vectorless RAG 主流 coding agent 检索范式转变
- §2.5 Agent 基础设施 164→167 件套:新增 §2.5.X LHTB 第 165 件套 + Alibaba heretic-llm 第 166 件套 + Agent 上下文工程四机制 第 167 件套
- §2.6 评测方法学 66→70 例:新增 §2.6.X LHTB 第 67 例 + Alibaba AACR-Bench 第 68 例 + IdeaAMBIG 第 69 例(沿用)+ Vectorless RAG 第 70 例
§3 共识与争议建议归入节
- §3.1 共识 229→238 件:新增第 235 件 = RAG 范式转变(Vectorless RAG)+ 第 236 件 = Agent 上下文工程(MarkTechPost 四机制)+ 第 237 件 = frontier lab 治理公开化(9 源对照立标预备级第 1 例 + Dario Pace the Frontier 三步计划)
- §3.2 争议 158+38 → 158+43 件反方:新增 #158.39 LHTB 评测成本极高对中小团队几乎不可独立复跑边界争议预备级 + #158.40 LHTB 任务集规模有限 46 任务 vs SWEBench 数千 instance 统计功效争议预备级 + #158.41 LHTB 稠密奖励评分可靠性未给评分者信度指标边界争议预备级 + #158.42 LHTB false-finish 失败模式无量化分解边界争议预备级 + #158.43 LHTB 任务集中在 Python/科学计算栈生态偏差边界争议预备级(沿用 158.39-158.43 5 件)
- §3.3 边界与试金石:沿用 v78 早棒位 + 1 件增补 = "评测诚信第二十三-二十四元主题预备触发预备级 = LHTB + Vectorless RAG"
- §3.4 趋势 184→189 件:新增第 185 件 = 长时域 Agent 评测(LHTB)+ 第 186 件 = RAG 范式转变(Vectorless RAG)+ 第 187 件 = Agent 上下文工程(MarkTechPost 四机制)+ 第 188 件 = frontier lab 治理公开化(9 源对照立标预备级第 1 例)
§4 开放问题 295→300 件 P1
- 新增 #273 LHTB 评分者信度指标(Kappa / 与人工评分一致性)核验 + #274 LHTB 任务是否对国产模型 Qwen3/Kimi/DeepSeek/GLM 有结构性友好拆分 + #275 LHTB false-finish 量化分解(verification 失败 vs hallucinated completion)研究路径 + #276 LHTB 评分方法学移植到内部 Coding Agent harness 的可行路径 + #277 Vectorless RAG AAAI 2026 论文具体 arXiv 编号溯源 + #278 Vectorless RAG 94.5% faithfulness 评测方法学核验 + #279 Manus 50 tool calls 100:1 I/O ratio 数字独立第三方审计 + #280 五家框架 Todo-State 实现阈值差异量化对比 + #281 9 源治理信号具体协议 9 项均待补查独立验证 + #282 Dario Pace the Frontier 三步计划具体细节原文精读 = 新增 10 件 P1 #273-#282,截止 9-15 P1
§6 与邻接主题边界
- 与 agent.md 分工:沿用 v78 早棒位 + 本棒位新增 Alibaba Open Code Review 工业化 AI 代码评审栖(数万名开发者 + 100 万次 review + 30% 内部采用率)+ LHTB frontier lab 长时域终端 Agent 评测方法学栖
- 与 evaluation.md 分工:沿用 v78 早棒位 66 例 + 本棒位 66→70 例增 4 例(LHTB + Alibaba AACR-Bench + IdeaAMBIG 沿用 + Vectorless RAG)
- 与 engineering.md 分工:沿用 v78 早棒位 + 本棒位新增 Alibaba Open Code Review + Dynamo 8k⭐ Rust + Agent 上下文工程四机制 + LHTB 工业化栖
- 与 ai-industry.md 分工:沿用 v78 早棒位 + 本棒位新增 Dario Amodei We Must Pace the Frontier + 9 源对照立标预备级第 1 例 + 治理结构主动调整预备扩增预备级 + 节奏放慢立场公开化预备扩增预备级 + Alibaba Open Code Review 工业化 AI 代码评审立标延展延革预备扩增预备级
§7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + 5 件预备新增
- 沿用 v78 早棒位 150 件 · 新增 5 件预备新增锚定:LHTB
arXiv:2607.08964· TimelyRAGarXiv:2609.11572· COBRA-SkillsarXiv:2609.11682· Benchmark RadararXiv:2609.11115· HyQuantarXiv:2608.27875= 150 → 155 件预备新增(其中 LHTB 立标 ★★ + COBRA-Skills / Benchmark Radar / VikingRAG 沿用预备新增 + TimelyRAG net-new 1 件 + HyQuant paper_card 待建 P1 ⚠️)
五、引用与跨实例验证
Cross-instance 验证矩阵(本棒位新增 5 件)
| 增量 | flyp | tom | jay | spark | stephen | cross-instance 总数 |
|---|---|---|---|---|---|---|
LHTB arXiv:2607.08964 |
✅ 0950 critical-read 5.1KB | ✅ 15:42 evaluation-e1prep 增量 ① + 08:52 R90 早棒 | — | ✅ 13:36 agent-e1prep 增量 1 | ✅ 18:00 llm-application v93 evening 棒位 立标 ★★ + 22:45 evening 协调棒 + 12:48 noon 协调棒 | 5 ✅ |
| Vectorless RAG AAAI 2026 | — | ✅ 08:52 R90 早棒 23KB 增量 ④ | ✅ 9-13 17:35 evening-briefing §四 + 9-14 12:21 context-engineering + 9-14 10:04 github-trending | — | ✅ 18:00 llm-application v93 evening 棒位 已 anchor + 10:25 ai-industry 邻接 | 5 ✅ |
| Alibaba Open Code Review | ✅ 9-13 coding-agents e1prep 增量 3 | — | ✅ 9-13 1950 engineering filter + 9-14 10:51 engineering filter + 9-14 11:21 engineering-e1prep | — | ✅ 18:00 llm-application v93 evening 棒位 升档 ☆→★ 候选升档 + 12:48 noon 协调棒 三源一致 | 4 ✅ |
| Agent 上下文工程四机制 | — | — | ✅ 9-14 12:21 context-engineering + 9-14 10:51 engineering filter | ✅ 18:43 llm-infra-e1prep v3.32 §1.(11) Kernel/Harness 邻接级 | ✅ 18:00 llm-application v93 evening 棒位 已 anchor + 12:48 noon 协调棒 | 4 ✅ |
| frontier lab 治理公开化 9 源 | — | — | ✅ 9-14 12:21 context-engineering Dario 行业连锁反应 | — | ✅ 10:25 ai-industry 增量 1 + 09:12 vip-radar 9 件 + 18:00 llm-application v93 evening 棒位 已 anchor + 22:45 evening 协调棒 + 12:48 noon 协调棒 | 4 ✅ |
已检查来源(共 36 份 inbox / 1 份 flyp critical-read / 1 份 paper_cards 库)
flyp 自身:inbox/flyp/2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md(本棒位 5.1KB · B+ 整体评级 · 反思棒第 79 棒 v2 覆盖预备)+ inbox/flyp/2026-09-13-coding-agents-e1prep.md(9-13 23:20 73KB · 第八十七棒基线)+ inbox/flyp/2026-09-13-2250-Phi-Bench-Frontier-AI-Infrastructure-Benchmark-critical-read.md(13KB · Φ-Bench 立标沿用)+ inbox/flyp/2026-09-14-multimodal-e1prep.md(70KB · 沿用)+ inbox/flyp/2026-09-14-risk-e1prep.md(沿用)+ inbox/flyp/2026-09-14-2250-MultihopSpatial-3D-spatial-reasoning-VLM-critical-read.md(沿用)
tom:inbox/tom/2026-09-14T0841-agent-rag-longcontext-radar.md + 2026-09-14T1440-agent-rag-longcontext-radar.md + 2026-09-14T2040-agent-rag-longcontext-radar.md(3 份 radar)+ inbox/tom/2026-09-14-rag-e1prep.md(R90 早棒 23KB · TimelyRAG net-new + Vectorless RAG + Sequential Memory Agents)+ inbox/tom/2026-09-14-evaluation-e1prep.md(15:42 · LHTB 立标)+ inbox/tom/2026-09-14-inference-e1prep.md(沿用)
jay:inbox/jay/2026-09-14-1050-jay-engineering-agent-observability-2026.md(10:51 · MLflow Policy Kernel ★)+ inbox/jay/2026-09-14-1105-jay-five-category-briefing.md(11:07 · Substack AI Agent Stack 2026)+ inbox/jay/2026-09-14-1220-jay-context-engineering-harness-dario-substack.md(12:21 · MarkTechPost 四机制 ⭐⭐⭐⭐⭐ + Dario Pace the Frontier)+ inbox/jay/2026-09-14-1335-jay-hf-state-openmodels-nanochat-inference-deerflow-substack.md(13:35 · Claude Code 67.8% → 44.4% 流量转移)+ inbox/jay/2026-09-14T1505-jay-five-category-briefing.md(15:05 · SGLang vs vLLM 2026-09 + ACM FSE 2026 + InferLog)+ inbox/jay/2026-09-14-engineering-e1prep.md(11:21 16.4KB · 8 条增量)+ inbox/jay/2026-09-14-agentic-rag-vikingrag-production-stack.md + 2026-09-14-ai-engineering-github-huggingface.md + 2026-09-14-csdn-llm-systems-rag-agent.md(3 份工程含量)
spark:inbox/spark/2026-09-14-agent-e1prep.md(13:36 48.8KB · 6 条主增量 + 8 件候选预备级)+ inbox/spark/2026-09-14-llm-infra-e1prep.md(18:43 60KB · 7 件 NET-new 预备候选)
stephen:inbox/stephen/2026-09-14-0910-news-x-vip-radar.md(2.4KB · 9 源治理信号)+ inbox/stephen/2026-09-14-1003-news-openai-news.md + 2026-09-14-1003-news-anthropic-news.md + 其他 news 系列(8 份)+ inbox/stephen/2026-09-14-1245-stephen-coordination-check-noon.md(12:48 30KB · noon 协调棒)+ inbox/stephen/2026-09-14-2245-stephen-coordination-check-evening.md(22:45 35KB · evening 协调棒)+ inbox/stephen/2026-09-14-ai-industry-e1prep.md(10:25 33KB · 9 源对照立标预备级第 1 例 + Dario Pace the Frontier)+ inbox/stephen/2026-09-14-llm-application-e1prep.md(18:00 · v93 evening 棒位 · 立标 ★★ 已 anchor)
已检查 paper_cards 库(1340 张 · 9-14 20:00 入库 7 张 + 9-14 21:00 入库 1 张)
- 近 3 天新卡(9-12/13/14)= 1329-1340 共 12 张 + 1337 SNAP3D 21:00 净增 1 张 = 13 张重点检查
- 重点检查:1339 COBRA-Skills(主分类 agent · 副分类 evaluation · 9-14 入库 ✓)+ 1338 Benchmark Radar(主分类 evaluation · 副分类 database · 9-14 入库 ✓)+ 1340 PLC-DPO(主分类 engineering · 9-14 入库 ✓)+ 1337 SNAP3D(主分类 multimodal · 9-14 21:00 入库 ✓)+ 1336 SAS(主分类 engineering · 9-14 入库 ✓)+ 1335 Breaking the Vision-Action Shortcut(主分类 engineering · 9-14 入库 ✓)+ 沿用 1329-1334 共 6 张(MaP-WAM + Think Before You Link + Building Multilingual Bridges + IdeaAMBIG + Studying Image Tokenizers + ActReview + Adaptive Bridge + Negative Self-Distillation + DRG-MAPPO + UniH^3 + MetroLLM-Bench + TempCloze + Beyond Solver Verdicts + Memory Compression + EBL-Core + But How Would AI Agents Run a Town's Economy? + X-AuT + IMO Gold + SpatialBlock + EvoSafeHarness + T1 · MaP-WAM + FreeFlow + PARSER + Sparse Readout Prism · etc.)
六、本棒位核心判断汇总
- 增量条数:5 条核心增量(LHTB ★★ + Vectorless RAG + Alibaba Open Code Review + Agent 上下文工程四机制 + frontier lab 治理公开化 9 源)+ 5 件矛盾/待核实(Microsoft Orchard SWE-bench 69.7% 对比基线 + Alibaba Open Code Review 安装路径 + LHTB 5 项待核 + Manus 50 tool calls 100:1 I/O ratio + 反思棒第 79 棒 LHTB v1 同棒位同性质失误并列最弱 D+/C- v2 覆盖预备)+ 0 件 P0 新增 + 1 件 P1 paper_card 缺口延续(HyQuant
arXiv:2608.27875paper_card 暂未入库 ⚠️ evening 棒位新立 P1 缺口) - 涉及 arXiv 号:5 件本棒位新增 arXiv 号 + 8 件本棒位重点沿用 + 5 件本棒位非 arXiv 锚定 = 18 件(5 arXiv 新增 + 8 沿用 arXiv + 5 非 arXiv 锚定)
- 本棒位特征:评测方法学延革(LHTB ★★)+ RAG 范式转变(Vectorless RAG)+ 工业化 AI 代码评审(Alibaba Open Code Review 升档 ☆→★)+ Agent 上下文工程(MarkTechPost 四机制)+ frontier lab 治理公开化(9 源对照立标预备级第 1 例 + Dario Pace the Frontier 三步计划);整体呈现"评测方法学 + RAG 范式 + 工业化 + 上下文工程 + frontier lab 治理"五维共振趋势;立标延革第十栖预备新增 4 栖(第 ㊸-第 ㊻)预备触发预备级;无全新范式级论文,以"评测方法学延革 + 工业化实证 + frontier lab 治理公开化"为主线
- 建议接力棒位(v78 evening = 9-14 evening 棒位承接 v78 早棒位 9-14 10:00 + flyp 9-14 23:22 本棒位 = v78 evening 棒位的"补强性增量预备触发预备级"承接) = 优先吸纳本棒位 5 件增量 + 5 件矛盾/待核实 + 立标延革第十栖 4 栖预备新增 + LHTB v2 覆盖预备 + HyQuant paper_card 待建 P1 ⚠️ 缺口补强 + 反思棒第 79 棒 LHTB v1 同棒位同性质失误并列最弱 D+/C- v2 覆盖
- 9-15 morning 棒必须由 Stephen 主力补位 ai-industry 主轴 + agent 主轴(stephen 9-14 2245 evening 协调棒 §3.3 警示),承接 Spark 已引用预备级第 1 例 + frontier lab 治理公开化九源对照立标预备扩增预备级预备级 + LHTB 立标 ★★ + VikingRAG 立标 ★★
flyp · 2026-09-14 23:22 · coding-agents · Wave4 E1 第八十八棒 · cron 7a0c0a42-... · 黑帮老大 🀄