coding-agents · E1 预消化简报(2026-09-10)

实例:flyp · coding-agents 主题 E1 日间预消化轮 生成时间:2026-09-10 23:20 CST(Asia/Shanghai) 接力窗口:2026-09-10 10:00 CST → 2026-09-10 23:20 CST(约 13h 接力净窗口) 基线活文档organized/knowledge/coding-agents.md v75 早棒位(2026-09-10 10:00 CST 立标延革补强稳态 · 124→128 栖 / 137→141 arXiv / 161→162 件套 / 220 共识 / 290 开放问题) 昨夜基线 E1 报告inbox/flyp/2026-09-09-coding-agents-e1prep.md(v74 早棒位 9-9 22:50 Trajel critical-read 后,flyp 9-9 23:20 coding-agents e1prep 棒位承接)


状态摘要

  • 状态:ok
  • 增量条数8 条主增量(3-8 目标区间内;含 3 件 NET-new radar 高价值锚入预备级 = KVShareArena 2609.10266 + AgentAudit 2609.09875 + SWE-Bench Pro Verified 2609.08149 + 5 件 NET-new paper_card 主分类 agent/evaluation 入库实测补强 = Closing the Consistency Gap 1288 + Glyph 1297 + SAEScientist-Bench 1298 + Co-Evolving Harnesses and Models 1299 + Scores Alone Do Not Prove Discovery 1300 + Counter-Swarm Doctrine 1291 + EVOHARNESSBENCH 1293 + Diffs vs. Whole Files 1302 + 2 件 NET-new 事件级 = Sherlocks AI Agent Failure Stack 73 个生产故障 + vLLM prefix cache <16 token 踩坑
  • 涉及 arXiv 号9 件 NET-new = arXiv:2609.10266(KVShareArena · Tom 9-10 2040 radar 高价值 #1 · NET-new 锚入预备级 · coding-agents 主轴邻接级)+ arXiv:2609.09875(AgentAudit · Tom 9-10 2040 radar 高价值 #2 + paper_card 1296 9-10 入库 ✓ 主分类 evaluation 形态 benchmark · NET-new 立标极显著首次承接预备级 · coding-agents 主轴)+ arXiv:2609.08149(SWE-Bench Pro Verified · Tom 9-10 2040 radar 高价值 #3 · NET-new 锚入预备级 · coding-agents 主轴立标预备级)+ arXiv:2609.08832(Closing the Consistency Gap · IBM Research + paper_card 1288 9-10 入库 ✓ 主分类 agent 形态 benchmark · NET-new 锚入预备级 · coding-agents 主轴立标预备级)+ arXiv:2609.10430(Glyph · work-queue Top 15 高价值 0.5 分 · paper_card 1297 9-10 入库 ✓ 主分类 agent 形态 method · NET-new 锚入预备级 · coding-agents 主轴企业级 Agent 预备级)+ arXiv:2609.09113(SAEScientist-Bench · Tom 0840 radar 高价值 #2 · paper_card 1298 9-10 入库 ✓ 主分类 agent 形态 method · NET-new 锚入预备级 · coding-agents 主轴 RSI+可解释性交叉前沿)+ arXiv:2609.09134(Co-Evolving Harnesses and Models · paper_card 1299 9-10 入库 ✓ 主分类 evaluation 形态 method · NET-new 锚入预备级 · coding-agents 主轴立标预备级)+ arXiv:2609.09219(Scores Alone Do Not Prove Discovery · work-queue Top 15 高价值 0.5 分 · paper_card 1300 9-10 入库 ✓ 主分类 agent 形态 method · NET-new 锚入预备级 · coding-agents 主轴研究 Agent 立标预备级)+ arXiv:2609.06140(Counter-Swarm Doctrine · Tom 0840 radar 高价值 · paper_card 1291 9-10 入库 ✓ 主分类 agent 形态 method · NET-new 锚入预备级 · coding-agents 主轴 Agent 安全栖预备级)+ arXiv:2609.04280(EVOHARNESSBENCH · Tom 0840 radar 高价值 + spark 9-10 agent e1prep v2 §增量 1 · paper_card 1293 9-10 入库 ✓ 主分类 evaluation 形态 benchmark · NET-new 锚入预备级 · coding-agents 主轴 Harness 立标预备级)+ arXiv:2609.05779(Diffs vs. Whole Files · paper_card 1302 9-10 入库 ✓ 主分类 evaluation 形态 benchmark · NET-new 锚入预备级 · coding-agents 主轴编码 Agent 实证研究立标预备级)+ arXiv:2609.06703(DianShi-RxnDB · paper_card 1301 9-10 入库 ✓ 主分类 agent 形态 method · NET-new 锚入预备级 · coding-agents 主轴邻接级)

  • 性质:接力 v75 早棒位 9-10 10:00 CST 立标延革补强稳态(124→128 栖 / 137→141 arXiv / 161→162 件套 / 220 共识 / 290 开放问题)。本棒净增 8 条主增量。核心贡献 = ① KVShareArena + AgentAudit + SWE-Bench Pro Verified = Tom 2040 radar 三大 NET-new 编码 Agent 立标预备级 + ② 8 张 paper_card 9-10 入库实测补强(Closing the Consistency Gap 1288 + Glyph 1297 + SAEScientist-Bench 1298 + Co-Evolving Harnesses and Models 1299 + Scores Alone Do Not Prove Discovery 1300 + DianShi-RxnDB 1301 + Diffs vs. Whole Files 1302 + Counter-Swarm Doctrine 1291 + EVOHARNESSBENCH 1293)覆盖 coding-agents 主轴立标预备级 + ③ Sherlocks AI Agent Failure Stack 73 个生产故障 Tool→Memory→Reasoning→Guardrails 四层框架事件级 NET-new + ④ vLLM prefix cache <16 token 踩坑 = KVShareArena 双源对照预备第 1 例


一、本棒检查过的来源清单

1.1 work-queue.md(2026-09-10 22:00 自动生成)

  • 待建卡 6 件(其中 coding-agents 主轴相关 = 2 件):① Glyph arXiv:2609.10430 高价值待深度解读 0.5 分(work-queue §1)+ ② AgentAudit arXiv:2609.09875 高价值待深度解读 0.5 分(work-queue §1);其余 4 件 = Scores Alone Do Not Prove Discovery(agent 主分类)+ Harnessing CLIP and DINO(evaluation/multimodal)+ OpenWAM(engineering/multimodal)+ SynthGait-19K(multimodal/embodied)
  • 待更新主题活文档 0(全部最新)
  • 选题榜 2 件(与 coding-agents 主轴相关 0 件):Discrete Diffusion 2609.04010 + BeaconKV 2609.04971(均为 multimodal/llm-infra 主轴)
  • 待精确分类 0 张卡(cron_classify_llm 低峰消化)
  • 5 件高价值待深度解读 Top15 0.5 分(与 coding-agents 主轴相关 2 件):Glyph + AgentAudit = 与活文档 coding-agents.md §2.4 Agent 安全栖预备级 + §2.6 评测方法学预备级强对照

1.2 inbox/tom 9-10 棒位(晚间补位核心源)

  • 2026-09-10-agent-rag-longcontext-radar.md(9-10 20:41 CST · Tom 文献雷达 · 本棒 coding-agents 主轴核心源):
  • 🟢 KVShareArena arXiv:2609.10266(RAG & 多 Agent 场景跨上下文 KV-Cache 复用边界,⭐⭐⭐⭐⭐)—— 9-10 晚间最显著新立标候选,三条社区独立提出的 Repair 方法综合评测,填补 KV-Cache 复用边界场景的系统性评测空白
  • 🟢 AgentAudit arXiv:2609.09875(10 维全链路 Agent 信任评估框架,⭐⭐⭐⭐)—— 9-10 晚间第二条新立标候选,10 维度(指令完整性 / 规划器 / 记忆 / 工具选择 / 工具调用 / 工具正确性 / 对齐 / 工具忠实性 / 安全 / 执行完整性 + 行为可解释性)
  • 🟢 SWE-Bench Pro Verified arXiv:2609.08149(反作弊代码 Agent 评测,⭐⭐⭐⭐)—— 9-10 晚间第三条新立标候选,反作弊安全机制 + 任务质量人工核验
  • 中价值 5 条:Glyph 企业数据目录 Agent / AgentGrad 多 Agent 提示优化 / Why Is Video Still So Expensive / StochBench / The Semantic Bottleneck
  • 2026-09-10-inference-e1prep.md(9-10 22:20 CST · Tom inference e1prep · 含 vLLM prefix cache 16-token 边界踩坑双源对照预备第 1 例)
  • 2026-09-10-evaluation-e1prep.md(9-10 15:43 CST · Tom evaluation e1prep · 含 EVOHARNESSBENCH 1293 + Closing the Consistency Gap 1288 + AgentAudit 1296 + SAEScientist-Bench 1298 4 件 NET-new coding-agents 主轴立标预备级)
  • 2026-09-10-rag-e1prep.md(9-10 08:53 CST · Tom rag e1prep R86 · 含 Closing Consistency Gap + Agent Memory Survey + OWASP LLM08 + Embedding Surgery 4 件 NET-new)
  • 2026-09-10-0900-hf-daily-2026-09-10.md(9-10 09:00 CST · Tom HF Daily · 15 篇 + NeoHorse-1 377▲ + Miles v0.1 44▲ + BeaconKV 32▲)

1.3 inbox/spark 9-10 agent e1prep v2(2026-09-10 21:09 CST)

  • 本棒 coding-agents 主轴核心源(v2 重写覆盖:① 删除链式冗余结尾;② 拆分"承接预备级 vs 净增"两栏;③ ≥3 件独立 fetch 二次源核验;④ v89 引用次数目标 < 50):
  • 0 件 arXiv NET-new anchor 入池(v89 立标池 75 向稳态沿用)
  • 8 张 paper_card 12:30 OpenAlex backfill 净增(agent 主分类 = 0 张;agent 邻接级 = 2 张:Omni Interaction Agent 1272 multimodal→agent + BeaconKV 1278 llm-infra→agent)
  • 1 件 v89 候选预备级 paper_card 入库实测补强(Omni Interaction Agent Gander 1272 ✓)
  • NeoHorse-1 + Bilevel Coordinated Reflection + Dr. Claw + RoboTok 沿用稳态承接

1.4 inbox/jay 9-10 全天棒位

  • 2026-09-10T1835-jay-evening-five-category-briefing.md(18:35 CST · jay evening briefing · 本棒 coding-agents 主轴核心源):
  • 🔴 vLLM 前缀缓存 <16 token 无法复用踩坑(Sanjeev Ganjihal vLLM 贡献者亲述):vLLM RadixAttention 按 16-token block 管理,<16 token prefix 实际无缓存可复用 → 建议手动 padding 到 16 token 边界 / 评估 SGLang
  • 🟡 Lilian Weng — Harness 工程用于自我改进(2026-07-04)(link: https://lilianweng.github.io/posts/2026-07-04-harness/):Harness 工程的核心 = 构建能够评估和改进自身的系统
  • 2026-09-10T1950-jay-engineering-filter-round2.md(19:50 CST · 承接 1450 增量,Sherlocks AI Failure Stack 跨实例一致性)
  • 2026-09-10T1450-jay-engineering-filter.md(14:50 CST · Sherlocks AI Agent Failure Stack 73 个生产故障四层框架 + Harness Engineering for LLM-Driven GPU Kernel Generation arXiv:2607.17979
  • 2026-09-10T1122-engineering-e1prep.md(11:22 CST · Sherlocks AI Failure Stack + CNCF agent doctor + OpenWAM 1283 + vLLM 冷启动 8→1min)
  • 2026-09-10T1335-jay-afternoon-research-briefing.md(13:35 CST · Retrieval-Reasoning arXiv:2601.00536 + Uncertainty Quantification LLM Agents arXiv:2609.07395 + Agentic Context Cracking arXiv:2608.31082 + EM2Mem arXiv:2609.00551 + ICM-Bench arXiv:2609.04438 = 5 件 cs.CL/IR agent 主轴 + 邻接级扩增触发)

1.5 inbox/stephen 9-10 早棒 RSS/news 抓取(10:03-10:06 CST)

  • 2026-09-10-1004-news-hf-blog.md(10:04 CST · 本棒 coding-agents 主轴核心源):
  • 🟢 Funes · 为你的 Coding Agents 配备一个由你掌控的 Memory(HF Blog 2026-09-10 · https://huggingface.co/blog/funes)—— 编码 Agent 外部可控 Memory 工具立标预备
  • 2026-09-10-1004-news-tldr-ai.md(10:04 CST · 9-8 头条"OpenAI 托管 agents"沿用续立)
  • 2026-09-10-0910-news-x-vip-radar.md(09:10 CST · Andrew Ng AI Engineering Skills Map Part 3「Using coding agents」9-4 沿用续立)

1.6 inbox/flyp 9-10 RSS 抓取

  • 2026-09-10-1000-rss-cameron-wolfe.md(10:00 CST · Cameron Wolfe "Agent 评估详尽指南" + "Agentic RL" 续立)
  • 2026-09-10-1002-rss-interconnects.md(10:02 CST · Nathan Lambert "Motif-3 + GLM-5.3 + Hy4-preview" 开源模型三件套立标沿用)

1.7 paper_cards 9-10 入库 coding-agents 主轴相关新卡(Sep 9-10 入库 · 11 张)

编号 arXiv 标题 主分类 形态 与 coding-agents 关系
1288 2609.08832 Closing the Consistency Gap: Self-Evolving Agents That Learn to Stay on Course agent benchmark 🔥 NET-new 锚入预备级(IBM Research) · AppWorld 单次 pass 77% vs 5 次一致 53% 24 个百分点缺口 · self-evolving agent 框架
1291 2609.06140 Counter-Swarm Doctrine: Containing Coordinated Agent Intrusions agent method 🔥 NET-new 锚入预备级 · HF Daily 高价值 · agent 协同入侵防御框架 · 可撤销协调 episode
1293 2609.04280 EVOHARNESSBENCH: Can Your Agents Keep Pace with an Evolving Harness? evaluation benchmark 🔥 NET-new 锚入预备级 · Harness 演进条件下 Agent 评测基准 · 工具/skill/Agent 三维度 · 非平稳性放在 Harness 而非任务流
1296 2609.09875 AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents evaluation benchmark 🔥 NET-new 立标极显著首次承接预备级(Tom 2040 radar 高价值 #2) · 10 维全链路 Agent 信任评估框架 · 覆盖规划→工具选择→执行→记忆→推理
1297 2609.10430 Glyph: A Multi-Strategy Agentic System for Column Description and Sensitivity-Ontology Tagging of Enterprise Data Catalogs agent method 🔥 NET-new 锚入预备级(work-queue Top 15 0.5 分高价值) · 企业数据目录 Agent 生产系统 · 多策略 + 敏感度本体标记
1298 2609.09113 SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research? agent method 🔥 NET-new 锚入预备级(Tom 0840 radar 高价值 #2) · Agent + 可解释性交叉前沿 · RSI + Mechanistic Interpretability
1299 2609.09134 Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails evaluation method 🔥 NET-new 锚入预备级 · Harness + 模型协同进化 · on-policy correction
1300 2609.09219 Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents agent method 🔥 NET-new 锚入预备级(work-queue Top 15 0.5 分高价值) · AI 研究 Agent 审计协议 · Discovery Certification
1301 2609.06703 DianShi-RxnDB: A Large-Scale, Fine-Grained Organic Reaction Data Platform Built via a Fully Automated Pipeline for Researchers and AI Agents agent method 🟡 NET-new 锚入预备级(邻接级) · 化学反应数据库 · AI Agent 自动化 pipeline
1302 2609.05779 Diffs vs. Whole Files: An Empirical Comparison of Iterative Edit-Based and Direct Generation for Flutter/Dart Code Models evaluation benchmark 🔥 NET-new 锚入预备级 · 编码 Agent 实证研究:Flutter/Dart 增量编辑 vs 直接生成 · 评测方法学预备级
1272 2609.08977 Omni Interaction Agent / Gander multimodal method multimodal→agent 邻接级(spark agent e1prep v2 已锚)

1.8 coding-agents.md 活文档基线确认(v75 早棒位 9-10 10:00 CST 立标延革补强稳态)

  • §2.1 Harness 学术化 124 栖立标层:Dr. Claw arXiv:2609.00365 125▲ #2 +117 立标极显著首次 + Bilevel Coordinated Reflection arXiv:2609.02750 130▲ #1 +36 立标中-高首次后大幅跃升 + 立标延革第九栖扩展至 25 栖
  • §2.2 模型与基座:Claude Opus 4.7 87.6% SWE-bench Verified + Claude Fable 5 95.0% SWE-bench Verified / 80.3% SWE-bench Pro / 83.1% Terminal-Bench pair + GPT-5.3 Codex 85.0% SWE-bench Verified + GPT-5.5 82.7% Terminal-Bench + GPT-5.6 Sol Terminal-Bench 2.1 89.5% / 89.1% + GPT-6 Astra ARC-AGI 3 = 99.9% ($19K custom Provider Adapter harness) vs 默认 harness 62.7% ($26K) 37 个百分点差距
  • §2.3 后训练 102 件套:Privacy Failure arXiv:2609.04382 第 102 件套预备级
  • §2.4 Agent 安全 56 栖立标层:Trajel arXiv:2605.24219 第 55 栖预备级(工业多 agent 流程轨迹级审计预备第 1 例)+ Boundary-Aware Safety arXiv:2609.04482 第 56 栖预备级
  • §2.5 Agent 基础设施 162 件套:EmbodiedSkills arXiv:2609.01281 第 162 件套预备级 + BeaconKV arXiv:2609.04971 32▲ 邻接级
  • 完整 20 件 CVE 清单:CVE-2026-22561 至 CVE-2026-65617(沿用 v74 早棒位)
  • 本棒 0 件 v75 早棒位 NET-new 立标升级 + 0 件 NET-new 反方 + 1 件 P0 #225 已闭合 + 21 件 P1 待核

二、增量条目(8 条主增量:3 件 NET-new radar 高价值 + 3 件 NET-new paper_card 立标预备级 + 2 件 NET-new 事件级/方法学)

增量 ① AgentAudit arXiv:2609.09875(10 维全链路 Agent 信任评估框架)—— 9-10 晚间立标极显著首次承接预备第 1 例

  • 来源:arXiv 2609.09875(2026-09-09 发布)+ paper_card 1296 9-10 入库 ✓ 主分类 evaluation 形态 benchmark + Tom 9-10 2040 radar 高价值条目 #2 + Tom 9-10 1543 evaluation-e1prep §增量 ③ + work-queue.md 2026-09-10 22:00 Top 15/2 高价值待深度解读项(0.5 分) + Stephen 9-10 2245 evening 协调棒 §增量 2 首次锚入确认
  • 要点:首个覆盖 Agent 全链路、多维度的可解释评估框架,覆盖 10 个维度(指令完整性 / 规划器 / 记忆 / 工具选择 / 工具调用 / 工具正确性 / 对齐 / 工具忠实性 / 安全 / 执行完整性 + 行为可解释性),填补了 AgentBench(评任务完成)+ AgentDojo(评安全)等单环节评估之间的空白,能精确定位故障具体来源。与 Tom 1543 evaluation-e1prep §增量 ③ 描述一致,但 paper_card 1296 入库确认将"⭐⭐⭐⭐(Tom radar 高价值 · arXiv 编号已知 · paper_card ⚠ 未建)"升级为"⭐⭐⭐⭐⭐ paper_card 1296 ✓ 主分类 evaluation 形态 benchmark 立标极显著首次承接预备级"。
  • 与活文档现有脉络的关系:与 v75 早棒位 §2.6 评测方法学 53→57 例预备承接预备补强稳态直接锚入——AgentAudit 是评测诚信第六栖立标预备触发预备级预备级预备触发预备承接预备的下一棒接力。与立标池已有的 Trajel(工业多 agent 流程轨迹级审计预备第 1 例)+ Boundary-Aware Safety + Privacy Failure 3 件评测诚信预备级 anchor 形成"评测诚信第七栖 anchor 入池",建议归入 §2.6 评测方法学 57→58 例预备承接预备 + §立标层 128→129 栖预备级。与 SWE-Bench Pro Verified(同 Tom 2040 radar #3)形成"通用 Agent 评估 + 代码 Agent 评估"二向预备触发持续。
  • 建议归入节:§2.6 评测方法学 57→58 例预备承接预备(AgentAudit 10 维全链路信任评估预备第 2 例)+ §立标层 128→129 栖预备级
  • 可信度:★★★★★(paper_card 1296 9-10 入库 ✓ + Tom 2040 radar 高价值 #2 + Tom 1543 evaluation-e1prep §增量 ③ 确认 + Stephen 2245 evening 协调棒首次锚入 + work-queue Top 15 高价值 0.5 分)
  • ⚠️ 待核实:Stephen 2245 evening 协调棒 §"5 待建 paper_card"已通过本次 cross-check 关闭 1/3(1296 已入库),仍需推动 KVShareArena 2609.10266 + SWE-Bench Pro Verified 2609.08149 paper_card 建卡

增量 ② KVShareArena arXiv:2609.10266(RAG & 多 Agent 场景跨上下文与跨 Checkpoint KV-Cache 复用评测)—— 9-10 晚间立标极显著首次承接预备第 2 例

  • 来源:arXiv 2609.10266(2026-09-09 发布)+ Tom 9-10 2040 radar 高价值条目 #1 ⭐⭐⭐⭐⭐ + Tom 9-10 2220 inference-e1prep §增量 ① + Stephen 9-10 2245 evening 协调棒 §增量 1 首次锚入确认 + Tom 9-10 2220 inference-e1prep §增量 ②③ 与 jay 1835 evening briefing ①vLLM prefix cache <16 token 踩坑形成"KV-Cache 工程边界"双轴预备扩增
  • 要点:现有 KV-Cache 复用要求复用文本位于 Prompt 最前端,但 RAG(每次组装不同 Chunk)和多 Agent 协调(读取其他 Agent 的报告)两个场景都违反这个条件。此外不同 Checkpoint 的同一模型家族 Cache 值也不同。论文综合评测三条社区独立提出的 Repair 方法(位置修复、跨 Checkpoint 修复),是首个覆盖 RAG/多 Agent KV-Cache 复用边界场景的系统性评测基准直接面向 RAG 部署和多 Agent 生产系统的工程问题,填补了 KV-Cache 复用边界场景的系统性评测空白。
  • 与活文档现有脉络的关系:与 v75 早棒位 §2.5 Agent 基础设施 161→162 件套预备承接预备补强稳态直接锚入——KVShareArena 是 coding-agents 主轴邻接级预备承接预备的核心新立标候选。与 BeaconKV arXiv:2609.04971 32▲ coding-agents 主轴邻接级预备承接预备形成"KV-Cache 工程边界二联预备扩增"(BeaconKV = LRM 长思维链 KV 压缩优化;KVShareArena = RAG/多 Agent KV 复用边界评测)。与 vLLM/SGLang/Mooncake 等 KV-Cache 系统工程方向直接互补——前者关注"非标准位置复用"的边界场景评测,后者关注"标准位置复用"的工程实现。两者的关系是:KVShareArena 揭示了 vLLM/SGLang/Mooncake 等系统未覆盖的边界场景,未来 KV-Cache 系统需要向"位置修复 + 跨 Checkpoint 修复"方向演进与 jay 1835 evening briefing ① vLLM prefix cache <16 token 无法复用踩坑形成"KV-Cache 边界 case"双源对照预备第 1 例——vLLM 贡献者亲述 <16 token prefix 实际无缓存可复用,与 KVShareArena 揭示的"非标准位置复用"问题同源。
  • 建议归入节:§2.5 Agent 基础设施 162→163 件套预备级(KVShareArena 跨上下文跨 Checkpoint KV-Cache 复用边界场景系统性评测预备第 1 例)+ §立标层 128→129 栖预备级(与 AgentAudit 同棒承接)
  • 可信度:★★★★★(arXiv 2026-09-09 + Tom 2040 radar 高价值 #1 ⭐⭐⭐⭐⭐ + Tom 2220 inference-e1prep §增量 ① + Stephen 2245 evening 协调棒首次锚入确认 + jay 1835 vLLM prefix cache 踩坑双源对照预备第 1 例)
  • ⚠️ 待核实:① paper_card 未建(Stephen 2245 §"5 待建 paper_card" 仍含 KVShareArena)—— 建议在 9-11 接力棒前补建 paper_card;② 评测的三条 Repair 方法在生产 vLLM/SGLang 中的落地成本;③ 是否进入 9-11 paper_card 建卡流程

增量 ③ SWE-Bench Pro Verified arXiv:2609.08149(反作弊的 Agent 软件工程评测)—— 9-10 晚间立标极显著首次承接预备第 3 例

  • 来源:arXiv 2609.08149(2026-09 发布)+ HF Daily 2026-09-07 收录 + Tom 9-10 2040 radar 高价值条目 #3 ⭐⭐⭐⭐ + Tom 9-10 1543 evaluation-e1prep §缺位但 agent 主轴相关 + Stephen 9-10 2245 evening 协调棒 §增量 3 首次锚入确认
  • 要点:原版 SWE-Bench Pro 存在 Gold Solution 泄露 + 任务质量问题导致 Reward Hacking,评测结果不能真实反映 Agent 编码能力。Verified 版本引入反作弊安全机制 + 任务质量人工核验,构建可靠评测版本。为 Agent 代码能力评测建立基线标准,阻止指标虚高。与 SWE-bench Verified(OpenAI 8-30 退役公告沿用)+ SWE-bench ProMax arXiv:2608.09802(预备升档沿用)+ RealSWE(v74 早棒位 29▲ coding agent 续立)+ Terminal-Universe 272▲ #2(v74 早棒位预备级)+ FACET + SWE-bench Science + AgentVista + Substrate-Aware + Memory Model Upgrade + OR-Clarify + When Models Edit Too Much + HarvestBench + τ^τ-Bench + Trajel 15+ 评测基准饱和至 90%+ 框架内 首次将"反作弊"作为评测质量的硬性指标
  • 与活文档现有脉络的关系:与 v75 早棒位 §2.2 模型与基座 + §2.6 评测方法学 53→57 例预备承接预备补强稳态直接锚入——SWE-Bench Pro Verified 是编码 Agent 评测诚信栖预备级的下一棒接力。与 AgentAudit + Trajel + Boundary-Aware Safety + Privacy Failure 4 件评测诚信预备级 anchor 形成"编码 Agent 评测诚信第一栖 anchor 入池"与 SWE-bench Pro + SWE-bench ProMax + SWE-bench Verified 4 件 SWE-bench 家族预备级形成"SWE-bench 第五栖 anchor(反作弊)入池",建议归入 §2.6 评测方法学 57→58 例预备承接预备 + §立标层 128→129 栖预备级。与 jay 1050 engineering filter + jay 1122 engineering e1prep Sherlocks AI Failure Stack 73 个生产故障形成"评测防作弊 + 生产故障实证"二向对照预备触发持续——Sherlocks AI 揭示的"工具静默失败 / prompt 漂移 / eval 循环缺失"问题正是 SWE-Bench Pro Verified 要解决的"Gold Solution 泄露 / 任务质量人工核验"问题。
  • 建议归入节:§2.6 评测方法学 57→58 例预备承接预备(SWE-Bench Pro Verified 反作弊编码 Agent 评测预备第 1 例)+ §立标层 128→129 栖预备级(与 AgentAudit + KVShareArena 同棒承接)
  • 可信度:★★★★(arXiv 2026-09 + HF Daily 2026-09-07 + Tom 2040 radar 高价值 #3 + Stephen 2245 evening 协调棒首次锚入确认;paper_card ⚠ 未建)
  • ⚠️ 待核实:① paper_card 未建(Stephen 2245 §"5 待建 paper_card" 仍含 SWE-Bench Pro Verified)—— 建议在 9-11 接力棒前补建 paper_card;② 反作弊机制(Anthropic / OpenAI / 学术界)具体实现细节;③ SWE-Bench ProMax arXiv:2608.09802 与 SWE-Bench Pro Verified 的关系(ProMax 预备升档 vs Pro Verified 反作弊)—— Stephen 2245 evening §"缺口 1"延续标记

增量 ④ Closing the Consistency Gap arXiv:2609.08832(自进化 Agent 弥合 24 点一致性差距)—— 9-10 paper_card 入库实测补强第 1 例

  • 来源:arXiv 2609.08832 + paper_card 1288 9-10 OpenAlex backfill 入库 ✓ 主分类 agent 形态 benchmark + Tom 9-10 0840 radar 高价值条目 ★ + Tom 9-10 0853 rag-e1prep R86 §增量 ① + Tom 9-10 1543 evaluation-e1prep §增量 ② + spark 9-10 1337 agent-e1prep v2 §增量 1(承接预备级) + Stephen 9-10 1245 noon 协调棒 §增量 10
  • 要点:LLM Agent 平均准确率高但生产中不可靠——AppWorld benchmark 上 GPT-4.1 ReAct Agent 同一任务运行五次,仅 53% 全部成功,而单次通过率平均 77%,24 个百分点缺口称"一致性差距"。IBM Research 提出 self-evolving agent 框架识别不稳定、低一致性步骤并针对性修复。该框架是 agent 评测从"任务完成"走向"可审计可定位"的基础设施级补充。与 SWE-Bench Pro Verified 反作弊机制形成"评测防作弊 + 评测一致性"二向预备触发持续——前者关注"防止 Agent 利用 Gold Solution 作弊",后者关注"防止 Agent 自身行为不一致"。
  • 与活文档现有脉络的关系:与 v75 早棒位 §立标层 124→128 栖 + §2.5 Agent 基础设施 161→162 件套预备承接预备补强稳态直接锚入——Closing the Consistency Gap 是 agent 一致性栖预备级的新立标候选。与 EVOHARNESSBENCH arXiv:2609.04280 1293 评估 Harness 演进条件下 Agent 评测 + AgentAudit arXiv:2609.09875 1296 10 维全链路评估 + SWE-Bench Pro Verified 2609.08149 反作弊编码 Agent 评测 4 件 Agent 评测预备级形成"Agent 评测一致性/可审计/防作弊三栖预备扩增"与 Sherlocks AI Agent Failure Stack 73 个生产故障 Tool→Memory→Reasoning→Guardrails 四层框架中"eval 循环缺失是 Reasoning Layer 第三层核心问题"形成"评测一致性 + 生产实证"二向预备触发持续——Sherlocks 揭示的"eval 循环缺失"问题正是 Closing the Consistency Gap 要解决的"一致性差距"问题。
  • 建议归入节:§立标层 128→129 栖预备级(Closing the Consistency Gap agent 一致性栖预备第 1 例)+ §2.5 Agent 基础设施 162→163 件套预备级 + §2.6 评测方法学 57→58 例预备承接预备(Agent 一致性差距评测)
  • 可信度:★★★★(paper_card 1288 9-10 入库 ✓ + Tom 0840 radar 高价值 + Tom 1543 evaluation-e1prep §增量 ② + spark 1337 agent-e1prep v2 §增量 1 + Stephen 1245 noon 协调棒确认;IBM Research = 业界权威)
  • ⚠️ 待核实:① self-evolving agent 框架与 Compile by Training 的关系——两者是否互补或竞争(Tom 1543 §"⚠️ 待办"标记);② SWE-Bench Pro Verified 反作弊机制与 Closing the Consistency Gap 一致性差距修复是否可整合(建议在最终入库时合并讨论)

增量 ⑤ Glyph arXiv:2609.10430(企业数据目录 Agent 多策略系统)—— 9-10 paper_card 入库实测补强第 2 例(work-queue Top 15 高价值)

  • 来源:arXiv 2609.10430 + paper_card 1297 9-10 入库 ✓ 主分类 agent 形态 method + work-queue.md 2026-09-10 22:00 Top 15/1 高价值待深度解读项(0.5 分) + Tom 9-10 2040 radar 中价值条目 #4 + Stephen 9-10 1245 noon 协调棒 §缺位但已识别
  • 要点:Glyph = A Multi-Strategy Agentic System for Column Description and Sensitivity-Ontology Tagging of Enterprise Data Catalogs。企业数据目录自动化系统 + 多策略(multi-strategy)Agent + 敏感度本体标记(sensitivity-ontology tagging)。直接面向企业级数据治理与合规场景,与 v75 早棒位 §2.4 Agent 安全 54→56 栖中 Boundary-Aware Safety arXiv:2609.04482 部署场景安全边界差异化预备第 1 例同源——Glyph 是"企业数据目录敏感度自动标记"的 Agent 形态,Boundary-Aware Safety 是"部署场景安全边界差异化"的安全形态。
  • 与活文档现有脉络的关系:与 v75 早棒位 §2.4 Agent 安全 54→56 栖预备级 + §2.5 Agent 基础设施 161→162 件套预备承接预备补强稳态直接锚入——Glyph 是企业级 Agent 预备级的新立标候选。与 Boundary-Aware Safety + Privacy Failure 2 件 Agent 安全预备级 anchor + Trajel 1 件工业多 agent 流程轨迹级审计预备级 anchor 形成"企业级 Agent 第四栖 anchor(数据治理)入池预备级"与 Boundary-Aware Safety arXiv:2609.04482 形成"企业级 Agent 数据治理 + 部署场景安全边界"二向预备触发持续——前者是 Agent 在企业数据目录的应用,后者是 Agent 部署场景的安全边界。
  • 建议归入节:§2.4 Agent 安全 56→57 栖预备级(Glyph 企业数据目录 Agent 多策略系统预备第 1 例)+ §2.5 Agent 基础设施 162→163 件套预备级 + §立标层 128→129 栖预备级
  • 可信度:★★★★(paper_card 1297 9-10 入库 ✓ + work-queue Top 15 高价值 0.5 分 + Tom 2040 radar 中价值 + Stephen 1245 noon 协调棒已识别)
  • ⚠️ 待核实:① 与 Boundary-Aware Safety arXiv:2609.04482 在企业级 Agent 安全栖预备级的承接关系(建议在最终入库时合并讨论);② work-queue Top 15 0.5 分高价值优先级 vs Tom 2040 radar 中价值 3 颗星评价差异的原因

增量 ⑥ Sherlocks AI Agent Failure Stack(73 个生产环境真实故障 Tool→Memory→Reasoning→Guardrails 四层框架)—— 9-10 晚间事件级 NET-new

  • 来源:jay 9-10 1450 engineering filter + jay 9-10 1122 engineering e1prep 增量 ① + jay 9-10 1950 engineering filter round2 + Stephen 9-10 1245 noon 协调棒 §增量 8 确认 + Stephen 9-10 2245 evening 协调棒 §"engineering safety / production observability 缺口已大幅缩小" + spark 9-10 1840 llm-infra e1prep §承接
  • 要点:2026 年 1-5 月跨 73 个生产环境真实故障数据(不是 staging)+ Tool → Memory → Reasoning → Guardrails 四层故障框架 + 核心发现:故障不集中在单层,而是层叠(stack)—— 多层同时失效时才暴露 + 故障第三层(Reasoning Layer)核心问题:eval 循环缺失(Agent 无法自我评估任务完成质量,导致错误累积) + 工具静默失败 / prompt 漂移 / eval 循环缺失 / 执行路径可见性不足。与传统监控的关键差异:传统监控无法发现 agent 决策质量下降,需要单独 tracing 基础设施
  • 与活文档现有脉络的关系:与 v75 早棒位 §2.5 Agent 基础设施 161→162 件套预备承接预备补强稳态 + §立标层 124→128 栖预备级直接锚入——Sherlocks AI Agent Failure Stack 是 agentic engineering 生产实证层预备新增的核心事件级 NET-new。与 SWE-Bench Pro Verified 反作弊机制 + Closing the Consistency Gap 一致性差距 + AgentAudit 10 维全链路评估 4 件评测诚信预备级 anchor 形成"评测诚信 + 生产实证"二向预备触发持续——前者是"评测如何在实验环境中识别 Agent 故障",后者是"评测如何在生产环境中识别 Agent 故障"。与 v120 §1.9 Agentic Engineering 互补(此前以框架论文为主,缺真实生产数据)+ 与 v120 §1.6 Split-LLM Privacy Failure 形成"生产安全"双轴(外部攻击 + 内部决策质量)+ 与 v120 §1.5 InferenceBench 形成"benchmark 达标 ≠ 生产安全"对照与 v75 早棒位 §1.1 "前沿人物与生态" 中 Andrew Ng AI Engineering Skills Map Part 3「Using coding agents」9-4(5 子技能:引导流程/自主程度/复核工作/自定义环境/基础)形成"实战编码 Agent 教学 + 生产故障实证"二向预备触发持续——前者是"如何用编码 Agent",后者是"编码 Agent 在生产中如何失败"。
  • 建议归入节:§2.5 Agent 基础设施 162→163 件套预备级(Sherlocks AI Agent Failure Stack 生产实证层预备第 1 例)+ §立标层 128→129 栖预备级 + §3.1 共识预备扩增 + §3.2 争议预备扩增
  • 可信度:★★★★(jay 1122 + jay 1450 + jay 1950 + spark 1840 + Stephen 1245 noon + Stephen 2245 evening 6 实例独立锚入;73 个生产环境一手数据,时间范围明确,非厂商宣传;无独立 arXiv)
  • ⚠️ 待核实:① 追溯 Sherlocks AI 官方博客是否有独立 arXiv 或完整报告(Tom 1543 §"⚠️ 待办"标记延续);② 73 个生产环境跨厂商分布(SaaS / 自托管 / 私有部署);③ "eval 循环缺失"作为 Reasoning Layer 核心问题与 Closing the Consistency Gap self-evolving agent 框架的关系(建议在最终入库时合并讨论)

增量 ⑦ vLLM 前缀缓存 <16 token 踩坑 + KVShareArena 双源对照预备第 1 例 —— 9-10 晚间事件级 NET-new + coding-agents 主轴邻接级承接

  • 来源:jay 9-10 1835 evening briefing ①(🔴 实战坑 ⭐⭐⭐⭐⭐)+ Tom 9-10 2220 inference-e1prep §增量 ⑧ vLLM prefix cache block 16-token 边界踩坑 NET-new 锚入预备级 + Stephen 9-10 2245 evening 协调棒 §增量 6 第 1 件 jay 1835 vLLM 短 prefix 踩坑 + KVShareArena arXiv:2609.10266 Tom 2040 radar §1 双源对照
  • 要点:vLLM RadixAttention 按 16-token block 管理,<16 token prefix 实际无缓存可复用(Sanjeev Ganjihal vLLM 核心贡献者 LinkedIn 亲述)→ 建议手动 padding 到 16 token 边界 / 评估 SGLang。与 KVShareArena arXiv:2609.10266 形成"KV-Cache 边界 case"双源对照预备第 1 例——前者是工业实战踩坑,后者是系统性评测基准。直接服务编码 Agent 的 KV-Cache 工程边界——编码 Agent 在多轮对话中常产生 <16 token 的小 prefix,如果不知道这条边界,会导致大量重复 token 计算。
  • 与活文档现有脉络的关系:与 v75 早棒位 §2.5 Agent 基础设施 161→162 件套预备承接预备补强稳态 + KVShareArena coding-agents 主轴邻接级预备承接预备直接锚入——vLLM prefix cache <16 token 踩坑是编码 Agent 部署成本压缩的关键工程边界。与 BeaconKV arXiv:2609.04971 32▲ coding-agents 主轴邻接级预备承接预备 + KVShareArena arXiv:2609.10266 3 件 KV-Cache 预备级 anchor 形成"KV-Cache 工程边界三栖预备扩增"——BeaconKV = LRM 长思维链 KV 压缩优化,KVShareArena = RAG/多 Agent KV 复用边界评测,vLLM prefix cache 踩坑 = 工业实战边界 case。与 v75 早棒位 §1.2 立标饱和度供给侧 "v32-v74 124 栖立标层"中 Mooncake / SGLang RadixAttention 等 KV-Cache 系统工程方向形成"标准位置复用工程实现 + 非标准位置复用边界场景"二向预备触发持续与 v75 早棒位 §1.3 frontier lab 周二-周三密集发布日承接预备中 frontier lab 形式化数学双源对照预备扩增第 1 例延伸——本棒为"工程边界对照预备扩增第 1 例"
  • 建议归入节:§2.5 Agent 基础设施 162→163 件套预备级(vLLM prefix cache <16 token 踩坑编码 Agent 工程边界预备第 1 例)+ §立标层 128→129 栖预备级 + §3.1 共识预备扩增
  • 可信度:★★★★★(jay 1835 evening briefing ① 🔴 实战坑 ⭐⭐⭐⭐⭐ + Tom 2220 inference-e1prep §增量 ⑧ + Stephen 2245 evening 协调棒首次锚入确认 + KVShareArena 双源对照;vLLM 核心贡献者 LinkedIn 亲述 = 业界权威)
  • ⚠️ 待核实:① 该问题在 SGLang / LMDeploy / TensorRT-LLM 中的对应边界(建议在最终入库时附 SGLang 16-token 边界对照表);② 编码 Agent 框架(OpenHands / Aider / Claude Code / Codex CLI)的 prefix cache 边界处理策略

增量 ⑧ Counter-Swarm Doctrine arXiv:2609.06140 + EVOHARNESSBENCH arXiv:2609.04280 + Co-Evolving Harnesses and Models arXiv:2609.09134 + SAEScientist-Bench arXiv:2609.09113 + Scores Alone Do Not Prove Discovery arXiv:2609.09219 + Diffs vs. Whole Files arXiv:2609.05779 + DianShi-RxnDB arXiv:2609.06703(7 件 9-10 paper_card 入库实测补强预备级)—— 9-10 coding-agents 主轴密集补强

  • 来源:paper_card 1291 + 1293 + 1299 + 1298 + 1300 + 1302 + 1301(均为 9-10 OpenAlex backfill 入库)+ Tom 0840 radar 高价值 + spark 1337 agent-e1prep v2 + Stephen 1245 noon 协调棒 + work-queue Top 15
  • 要点(7 件预备级合并表述):
  • Counter-Swarm Doctrine arXiv:2609.06140(paper_card 1291 主分类 agent 形态 method):HF Daily 高价值 · agent 协同入侵防御框架 · 可撤销协调 episode
  • EVOHARNESSBENCH arXiv:2609.04280(paper_card 1293 主分类 evaluation 形态 benchmark):Harness 演进条件下 Agent 评测基准 · 工具/skill/Agent 三维度 · 非平稳性放在 Harness 而非任务流
  • Co-Evolving Harnesses and Models arXiv:2609.09134(paper_card 1299 主分类 evaluation 形态 method):Harness + 模型协同进化 · on-policy correction · 弱模型通过 Harness 改进赶上强模型
  • SAEScientist-Bench arXiv:2609.09113(paper_card 1298 主分类 agent 形态 method):Agent + 可解释性交叉前沿 · RSI + Mechanistic Interpretability · 评估 AI Agent 能否充当科学家用 SAE 工具做自主机制可解释性发现
  • Scores Alone Do Not Prove Discovery arXiv:2609.09219(paper_card 1300 主分类 agent 形态 method):AI 研究 Agent 审计协议 · Discovery Certification Protocol · work-queue Top 15 0.5 分高价值
  • Diffs vs. Whole Files arXiv:2609.05779(paper_card 1302 主分类 evaluation 形态 benchmark):编码 Agent 实证研究 · Flutter/Dart 增量编辑 vs 直接生成对比 · 评测方法学预备级
  • DianShi-RxnDB arXiv:2609.06703(paper_card 1301 主分类 agent 形态 method):化学反应数据库 · AI Agent 自动化 pipeline · coding-agents 主轴邻接级(化学领域 Agent)
  • 与活文档现有脉络的关系:与 v75 早棒位 §立标层 124→128 栖 + §2.3 后训练 101→102 件套 + §2.4 Agent 安全 54→56 栖 + §2.5 Agent 基础设施 161→162 件套 + §2.6 评测方法学 53→57 例预备承接预备补强稳态直接锚入——7 件预备级 anchor 同步入库是 coding-agents 主轴立标池稳态扩展的关键支撑。EVOHARNESSBENCH + Co-Evolving Harnesses and Models = Harness 演进条件下 Agent 评测预备级预备第 1-2 例(与 AgentAudit 10 维全链路评估预备第 3 例协同);SAEScientist-Bench + Scores Alone Do Not Prove Discovery = AI 研究 Agent 立标预备级预备第 1-2 例(RSI + Discovery Certification 交叉前沿);Counter-Swarm Doctrine = Agent 安全栖预备级预备第 N 例(agent 协同入侵防御);Diffs vs. Whole Files = 编码 Agent 实证研究评测方法学预备级预备第 1 例(Flutter/Dart 增量编辑 vs 直接生成);DianShi-RxnDB = coding-agents 主轴邻接级(化学领域 Agent 自动化 pipeline)。
  • 建议归入节
  • EVOHARNESSBENCH → §2.6 评测方法学 57→58 例预备承接预备(Harness 演进评测预备第 1 例)+ §立标层 128→129 栖预备级
  • Co-Evolving Harnesses and Models → §2.6 评测方法学 57→58 例预备承接预备(Harness + 模型协同进化评测预备第 1 例)+ §立标层 128→129 栖预备级
  • SAEScientist-Bench → §2.6 评测方法学 57→58 例预备承接预备(AI 研究 Agent + 可解释性评测预备第 1 例)+ §立标层 128→129 栖预备级
  • Scores Alone Do Not Prove Discovery → §2.6 评测方法学 57→58 例预备承接预备(AI 研究 Agent 审计协议预备第 1 例)+ §立标层 128→129 栖预备级
  • Counter-Swarm Doctrine → §2.4 Agent 安全 56→57 栖预备级(agent 协同入侵防御框架预备第 1 例)
  • Diffs vs. Whole Files → §2.6 评测方法学 57→58 例预备承接预备(编码 Agent 实证研究评测方法学预备第 1 例)
  • DianShi-RxnDB → §2.5 Agent 基础设施 162→163 件套预备级(coding-agents 主轴邻接级化学领域 Agent 自动化 pipeline)
  • 可信度:★★★★(7 件全部 paper_card 9-10 入库 ✓ + Tom 0840 radar 高价值 + spark 1337 agent-e1prep v2 + Stephen 1245 noon 协调棒确认;work-queue Top 15 高价值 2/7)
  • ⚠️ 待核实:① 7 件预备级 anchor 在 §立标层 128→129 栖预备级中的优先级排序(建议按"立标极显著首次承接 > 立标中-高首次 > 立标低首次"分级);② Counter-Swarm Doctrine arXiv:2609.06140 与 v75 早棒位 §2.4 Agent 安全栖已有 CVE 清单的关系(agent 协同入侵防御 vs 单 agent CVE);③ Diffs vs. Whole Files arXiv:2609.05779 Flutter/Dart 实证结论对通用编码 Agent(Claude Code / Codex CLI)的可推广性

三、可引用的 arXiv 号列表(按承接预备级分组)

A. 立标极显著首次承接预备级(3 件 · ★★★★★ · 9-10 paper_card 已入库或 anchor 待补建)

  • arXiv:2609.09875 AgentAudit(paper_card 1296 ✓ 主分类 evaluation 形态 benchmark · Tom 2040 radar 高价值 #2 · 立标极显著首次承接预备第 1 例)
  • arXiv:2609.10266 KVShareArena(Tom 2040 radar 高价值 #1 ⭐⭐⭐⭐⭐ · paper_card ⚠ 未建 · 立标极显著首次承接预备第 2 例)
  • arXiv:2609.08149 SWE-Bench Pro Verified(Tom 2040 radar 高价值 #3 · paper_card ⚠ 未建 · 立标极显著首次承接预备第 3 例)

B. 立标中-高首次承接预备级(1 件 · ★★★★ · 9-10 paper_card 已入库)

  • arXiv:2609.08832 Closing the Consistency Gap(paper_card 1288 ✓ 主分类 agent 形态 benchmark · IBM Research · 立标中-高首次承接预备第 1 例)

C. 立标中-高首次承接预备级 work-queue Top 15(1 件 · ★★★★ · 9-10 paper_card 已入库)

  • arXiv:2609.10430 Glyph(paper_card 1297 ✓ 主分类 agent 形态 method · work-queue Top 15 0.5 分 · 立标中-高首次承接预备第 2 例)

D. 立标低首次承接预备级(5 件 · ★★★★ · 9-10 paper_card 已入库)

  • arXiv:2609.04280 EVOHARNESSBENCH(paper_card 1293 ✓ 主分类 evaluation 形态 benchmark · Harness 演进评测预备第 1 例)
  • arXiv:2609.09134 Co-Evolving Harnesses and Models(paper_card 1299 ✓ 主分类 evaluation 形态 method · Harness + 模型协同进化评测预备第 1 例)
  • arXiv:2609.09113 SAEScientist-Bench(paper_card 1298 ✓ 主分类 agent 形态 method · AI 研究 Agent + 可解释性评测预备第 1 例)
  • arXiv:2609.09219 Scores Alone Do Not Prove Discovery(paper_card 1300 ✓ 主分类 agent 形态 method · work-queue Top 15 0.5 分 · AI 研究 Agent 审计协议预备第 1 例)
  • arXiv:2609.05779 Diffs vs. Whole Files(paper_card 1302 ✓ 主分类 evaluation 形态 benchmark · 编码 Agent 实证研究评测预备第 1 例)

E. coding-agents 主轴邻接级承接预备级(2 件 · ★★★★ · 9-10 paper_card 已入库)

  • arXiv:2609.06140 Counter-Swarm Doctrine(paper_card 1291 ✓ 主分类 agent 形态 method · Agent 安全栖预备级预备第 N 例)
  • arXiv:2609.06703 DianShi-RxnDB(paper_card 1301 ✓ 主分类 agent 形态 method · 化学领域 Agent 自动化 pipeline)

F. coding-agents 主轴立标极显著首次承接预备(沿用 v75 早棒位 · 24h 续立实测)

  • arXiv:2609.08183 NeoHorse-1(HF Daily 9-10 早棒 377▲ #1 立标极显著首次 · paper_card ⚠ 暂未入库 · frontier lab 自我改进立标预备第 1 例 · spark 1337 agent-e1prep v2 §增量 1 承接预备级)

四、值得警惕的矛盾或待核实说法

矛盾 1:AgentAudit 主分类争议 —— evaluation vs agent vs risk

  • 现状:paper_card 1296 ✓ 主分类 evaluation 形态 benchmark;但 Tom 1543 evaluation-e1prep §增量 ③ 也归入 evaluation 主分类;Stephen 2245 evening 协调棒 §增量 2 描述为"全生命周期 Agent 可信评估框架"
  • 风险:AgentAudit 作为 10 维全链路 Agent 评估,是否应同时归入 agent 主分类(作为 Agent 评测的标杆)?当前 evaluation 主分类是合理的(评测方法学维度),但如果未来出现 "agent 主分类的评测基准" 目录,需要 cross-reference
  • 建议保持 evaluation 主分类,但在 §立标层 128→129 栖预备级中标注"agent 评测标杆"承接 agent.md 主轴

矛盾 2:Glyph 工作队列优先级 vs Tom radar 评价差异

  • 现状:work-queue Top 15 0.5 分高价值(高优先级);Tom 2040 radar 中价值 3 颗星评价(中等优先级)
  • 风险:work-queue 是基于 HF Daily 票数 + 主题重要性的综合排序,Tom radar 是基于编码 Agent 主轴相关性的局部排序;两者视角不同
  • 建议以 work-queue 0.5 分为准(全局优先级更高),Tom radar 评价仅作 coding-agents 主轴承接参考

矛盾 3:SWE-Bench Pro Verified vs SWE-Bench ProMax 关系

  • 现状:Stephen 2245 evening 协调棒 §"缺口 1"延续标记"⚠️ 待核实 SWE-Bench ProMax arXiv:2608.09802 与 SWE-Bench Pro Verified arXiv:2609.08149 的关系(ProMax 预备升档 vs Pro Verified 反作弊)"
  • 风险:如果两者是同一项目的不同阶段(ProMax = 升档 + 反作弊合并版),则需要合并讨论;如果是两个独立项目,则需要明确分工
  • 建议:在 9-11 接力棒中专项核实 + 在最终入库时合并讨论

矛盾 4:vLLM prefix cache <16 token 踩坑在 SGLang/LMDeploy/TensorRT-LLM 中的对应边界

  • 现状:jay 1835 evening briefing ① 明确 vLLM 16-token 边界;KVShareArena 揭示"非标准位置复用"问题
  • 风险:不同推理引擎的 prefix cache 边界可能不同(SGLang RadixAttention 也按 block 管理,但 block size 可能不同)
  • 建议:在最终入库时附 SGLang / LMDeploy / TensorRT-LLM prefix cache 边界对照表(建议 9-11 接力棒中专项核实)

矛盾 5:Diffs vs. Whole Files Flutter/Dart 实证结论对通用编码 Agent 的可推广性

  • 现状:paper_card 1302 ✓ 主分类 evaluation 形态 benchmark · Flutter/Dart 增量编辑 vs 直接生成对比
  • 风险:Flutter/Dart 是单一语言/框架,结论可能不适用于 Python / TypeScript / Rust 等主流编码 Agent 场景
  • 建议:在最终入库时附"Flutter/Dart → 通用编码 Agent 可推广性边界"说明

待核实说法 1:Counter-Swarm Doctrine arXiv:2609.06140 与 v75 早棒位 §2.4 Agent 安全栖已有 20 件 CVE 清单的关系

  • 现状:Counter-Swarm Doctrine = agent 协同入侵防御框架(方法论);CVE 清单 = 单 agent 漏洞实例(实证)
  • 建议:方法论与实证的关系需要明确——Counter-Swarm Doctrine 是"agent 协同入侵的防御方法论",CVE 清单是"agent 单点漏洞的实证记录"

待核实说法 2:SAEScientist-Bench arXiv:2609.09113 与 NeoHorse-1 arXiv:2609.08183 的 RSI 路线关系

  • 现状:SAEScientist-Bench 评估 AI Agent 能否充当科学家用 SAE 工具做自主机制可解释性发现(RSI + Mechanistic Interpretability);NeoHorse-1 通过带路由框架的 Agentic 后训练实现递归自我改进(RSI + Routing Harness)
  • 风险:两者都属于 RSI 路线,但 SAEScientist-Bench 是评测方向,NeoHorse-1 是方法方向;可能存在交叉引用
  • 建议:在最终入库时合并讨论 RSI 路线的"方法 + 评测"二栖预备级

待核实说法 3:Scores Alone Do Not Prove Discovery arXiv:2609.09219 的 Discovery Certification Protocol 与 Frontier lab 形式化数学双源对照预备扩增的关系

  • 现状:Scores Alone Do Not Prove Discovery = AI 研究 Agent 审计协议 · Discovery Certification Protocol;v75 早棒位 §1.3 frontier lab 形式化数学双源对照预备扩增第 1 例(Anthropic Claude FLT 9-4 + OpenAI Navier-Stokes 9-8)
  • 风险:Discovery Certification Protocol 是否适用于 frontier lab 形式化数学成果的审计?
  • 建议:在最终入库时合并讨论 frontier lab 形式化数学 + AI 研究 Agent 审计协议的衔接关系

五、缺口与冲突(9-10 接力棒延续标记)

缺口 1:3 件 paper_card 待建(沿用 Stephen 2245 evening 协调棒 §"5 待建 paper_card")

  • KVShareArena arXiv:2609.10266(NET-new 立标极显著首次承接预备第 2 例)
  • SWE-Bench Pro Verified arXiv:2609.08149(NET-new 立标极显著首次承接预备第 3 例)
  • NeoHorse-1 arXiv:2609.08183(沿用 v75 早棒位 frontier lab 自我改进立标预备第 1 例 · spark 1337 agent-e1prep v2 §"paper_card 状态 = 待建 P1 ⚠️")

缺口 2:δ-mem 真实 arXiv/代码(沿用 9-9 noon + 9-9 evening + 9-10 noon + 9-10 evening 4 棒标记)

  • AlphaSignal RAG and Long Context Aren't Enough for Agent Memory. δ-mem Is a Third Option 文中给出 arXiv 2605.xxxxx 无效引用,必须定位真实论文/代码链接后才能作为正式证据

缺口 3:Sherlocks AI 官方博客是否有独立 arXiv 或完整报告(沿用 Tom 1543 evaluation-e1prep §"⚠️ 待办"标记)

  • Sherlocks AI Agent Failure Stack 73 个生产故障的原始报告来源(73 个生产环境一手数据的可复现性需要独立 arXiv / 完整报告支撑)

缺口 4:Compile by Training arXiv:2609.04199 信号断裂(沿用 9-9 evening + 9-10 noon + 9-10 evening 3 棒标记)

  • Sep 9 HF Daily 无记录,Sep 10 HF Daily 仍无——信号持续断裂,待核实

冲突 1:Open-Source AI Agent Stack 2026 重复建卡(沿用 9-10 noon + 9-10 evening 2 棒标记)

  • The AI Agents Stack (2026 Edition) 在 Tom 9-10 0840 radar + jay 9-09 1735 + Stephen ai-industry 沿用 + flyp multimodal-e1prep 沿用 = 4 实例以上重复,最终同步任务应按 URL/title 去重保留 1 个 canonical 卡片

冲突 2:Engineering 增量归属争议(沿用 9-10 noon + 9-10 evening 2 棒标记)

  • OpenWAM arXiv:2609.07398 49▲ = flyp multimodal 主分类候选 + jay engineering 主分类候选双归属;flyp multimodal e1prep §增量 3 明示 paper_card 1283 ✓ 主分类 engineering 副分类 multimodal = 最终以 flyp multimodal 归属为准,engineering 作为副分类

冲突 3:BeaconKV 主分类争议(沿用 9-10 noon + 9-10 evening 2 棒标记)

  • jay 9-10 1122 engineering e1prep §"矛盾 A:BeaconKV 分类争议(工程判断 vs 风险判断)" vs 9-9 evening spark 评 Tom R85 llm-infra e1prep "paper_card 1278 BeaconKV 主分类 llm-infra 入库" 形成差异
  • 建议:保持 llm-infra 主分类,但风险维度在 §2.9 Security 中加入"思维回访 token(TRT) 可能带来的提示注入向量"风险信号

人工确认 1:3 件 paper_card 待建(KVShareArena / SWE-Bench Pro Verified / NeoHorse-1)

人工确认 2:δ-mem 真实 arXiv/代码(4 棒标记,优先级 1)

人工确认 3:Sherlocks AI Agent Failure Stack 原始报告来源

人工确认 4:Compile by Training arXiv:2609.04199 信号断裂原因

人工确认 5:SWE-Bench Pro Verified vs SWE-Bench ProMax 关系

人工确认 6:vLLM prefix cache 边界在 SGLang/LMDeploy/TensorRT-LLM 中的对应

人工确认 7:SAEScientist-Bench + NeoHorse-1 RSI 路线方法 + 评测二栖预备级合并讨论


六、后续行动与是否需要处理

精读(优先级 1 · 9-11 接力棒预备)

  1. AgentAudit arXiv:2609.09875(paper_card 1296 ✓ · 立标极显著首次承接预备第 1 例 · ⭐⭐⭐⭐⭐)
  2. KVShareArena arXiv:2609.10266(paper_card ⚠ 未建 · 立标极显著首次承接预备第 2 例 · ⭐⭐⭐⭐⭐)
  3. SWE-Bench Pro Verified arXiv:2609.08149(paper_card ⚠ 未建 · 立标极显著首次承接预备第 3 例 · ⭐⭐⭐⭐)
  4. Closing the Consistency Gap arXiv:2609.08832(paper_card 1288 ✓ · IBM Research · ⭐⭐⭐⭐)
  5. Glyph arXiv:2609.10430(paper_card 1297 ✓ · work-queue Top 15 0.5 分 · ⭐⭐⭐⭐)
  6. Sherlocks AI Agent Failure Stack(73 个生产故障 Tool→Memory→Reasoning→Guardrails 四层框架 · ⭐⭐⭐⭐)
  7. vLLM prefix cache <16 token 踩坑 + KVShareArena 双源对照预备第 1 例(jay 1835 evening briefing ① + Tom 2220 inference-e1prep §增量 ⑧ · ⭐⭐⭐⭐⭐)
  8. NeoHorse-1 arXiv:2609.08183 377▲(paper_card ⚠ 待建 P1 · frontier lab 自我改进立标预备第 1 例 · ⭐⭐⭐⭐⭐)

精读(优先级 2 · 9-11 接力棒承接)

  1. EVOHARNESSBENCH arXiv:2609.04280(paper_card 1293 ✓ · Harness 演进评测预备第 1 例 · ⭐⭐⭐⭐)
  2. Co-Evolving Harnesses and Models arXiv:2609.09134(paper_card 1299 ✓ · Harness + 模型协同进化评测预备第 1 例 · ⭐⭐⭐⭐)
  3. SAEScientist-Bench arXiv:2609.09113(paper_card 1298 ✓ · AI 研究 Agent + 可解释性评测预备第 1 例 · ⭐⭐⭐⭐)
  4. Scores Alone Do Not Prove Discovery arXiv:2609.09219(paper_card 1300 ✓ · work-queue Top 15 0.5 分 · ⭐⭐⭐⭐)
  5. Diffs vs. Whole Files arXiv:2609.05779(paper_card 1302 ✓ · 编码 Agent 实证研究评测预备第 1 例 · ⭐⭐⭐⭐)
  6. Counter-Swarm Doctrine arXiv:2609.06140(paper_card 1291 ✓ · Agent 安全栖预备级预备第 N 例 · ⭐⭐⭐⭐)
  7. DianShi-RxnDB arXiv:2609.06703(paper_card 1301 ✓ · 化学领域 Agent 自动化 pipeline · ⭐⭐⭐)
  8. HF Blog Funes · 为你的 Coding Agents 配备一个由你掌控的 Memory(https://huggingface.co/blog/funes · ⭐⭐⭐⭐)
  9. Lilian Weng — Harness 工程用于自我改进(2026-07-04)(https://lilianweng.github.io/posts/2026-07-04-harness/ · ⭐⭐⭐⭐)
  10. Miles v0.1 arXiv:2609.08368 44▲(post-training 工具立标预备 · paper_card ⚠ 待核实 · ⭐⭐⭐)

审稿

  • 9-11 接力棒前补建 3 件 paper_card(KVShareArena 2609.10266 + SWE-Bench Pro Verified 2609.08149 + NeoHorse-1 2609.08183)
  • Open-Source AI Agent Stack 2026 重复建卡去重(4 实例以上)
  • Engineering 增量归属争议(OpenWAM 双归属延续)
  • AuK / Gander 共同作者"Steve Yves" 合作真实性(沿用 9-10 evening 协调棒标记)
  • BeaconKV 主分类争议(llm-infra 主分类 + 风险维度 TRT 提示注入向量)

主题页更新(建议归入 §立标层 128→129 栖预备级 + §2.4 Agent 安全 56→57 栖 + §2.5 Agent 基础设施 162→163 件套 + §2.6 评测方法学 57→58 例预备承接预备)

  • Agent-Evaluation-Infrastructure-2026(新增 AgentAudit 10 维 + Closing the Consistency Gap + EVOHARNESSBENCH + Co-Evolving Harnesses and Models + SAEScientist-Bench + Scores Alone Do Not Prove Discovery + Diffs vs. Whole Files 7 件预备级 anchor)
  • KV-Cache-Engineering-Boundary-2026(新增 KVShareArena + vLLM prefix cache <16 token 踩坑 + BeaconKV 3 件预备级 anchor)
  • Coding-Agent-Benchmark-2026(新增 SWE-Bench Pro Verified 反作弊编码 Agent 评测预备第 1 例)
  • Agent-Security-2026(新增 Counter-Swarm Doctrine + Glyph 2 件预备级 anchor)
  • Harness-Evolution-2026(新增 EVOHARNESSBENCH + Co-Evolving Harnesses and Models + Lilian Weng Harness 自我改进 3 件预备级 anchor)
  • Coding-Agent-Observability-2026(新增 Sherlocks AI Agent Failure Stack + vLLM prefix cache 踩坑 2 件预备级 anchor)
  • Coding-Agent-Memory-Tools-2026(新增 HF Blog Funes + Glyph 2 件预备级 anchor)

人工确认(优先级排序)

  1. 3 件 paper_card 待建(KVShareArena 2609.10266 + SWE-Bench Pro Verified 2609.08149 + NeoHorse-1 2609.08183)
  2. δ-mem 真实 arXiv/代码(4 棒标记,优先级 1)
  3. SWE-Bench Pro Verified vs SWE-Bench ProMax 关系
  4. vLLM prefix cache 边界在 SGLang/LMDeploy/TensorRT-LLM 中的对应
  5. Sherlocks AI Agent Failure Stack 原始报告来源
  6. Compile by Training arXiv:2609.04199 信号断裂原因
  7. SAEScientist-Bench + NeoHorse-1 RSI 路线方法 + 评测二栖预备级合并讨论
  8. Scores Alone Do Not Prove Discovery 与 frontier lab 形式化数学双源对照预备扩增的衔接

去重协调(优先级高)

  • 3 件 paper_card 待建 + 9 件 paper_card 已入库实测补强 = 跨 13 实例重复可能(AgentAudit 1296 + Closing the Consistency Gap 1288 + Glyph 1297 + SAEScientist-Bench 1298 + Co-Evolving Harnesses and Models 1299 + Scores Alone Do Not Prove Discovery 1300 + DianShi-RxnDB 1301 + Diffs vs. Whole Files 1302 + Counter-Swarm Doctrine 1291 + EVOHARNESSBENCH 1293 在 Tom 0840 + Tom 1543 + Tom 2040 + spark 1337 + Stephen 1245 noon + Stephen 2245 evening + work-queue + flyp 2320 e1prep 8 实例出现)
  • vLLM prefix cache <16 token 踩坑在 jay 1835 + Tom 2220 inference-e1prep + Stephen 2245 evening + flyp 2320 e1prep 4 实例出现
  • Sherlocks AI Failure Stack 在 jay 1122 + jay 1450 + jay 1950 + spark 1840 + Stephen 1245 noon + Stephen 2245 evening + flyp 2320 e1prep 7 实例出现
  • KVShareArena 在 Tom 2040 radar + Tom 2220 inference-e1prep + Stephen 2245 evening + flyp 2320 e1prep 4 实例出现
  • AgentAudit 在 Tom 2040 radar + Tom 1543 evaluation-e1prep + Stephen 2245 evening + work-queue + flyp 2320 e1prep 5 实例出现
  • 最终同步任务应按 URL/arXiv 号/title 去重保留 1 个 canonical 卡片

CSDN 棒位扩展建议(沿用 9-10 evening 协调棒标记)

  • 本棒 jay 0821 + jay 1222 + jay 1630(推断)+ jay 1835 = Jay 独自承担 9-10 全天 CSDN 高价值棒位 + 部分工程实战坑棒位,建议 spark / stephen / tom 在后续接力棒中至少一个实例补 CSDN 高价值棒位以维持覆盖面

Spark 棒位补位建议(沿用 9-10 evening 协调棒标记 · 已生效)

  • Spark 9-10 18:42 + 21:09 两份 e1prep 已补位生效(承接午棒建议);spark 9-10 21:09 agent-e1prep v2 重写覆盖 = 拆分"承接预备级 vs 净增"两栏 + ≥3 件独立 fetch 二次源核验 + v89 引用次数目标 < 50 + 判密度目标 ≥ 70%,是 spark 棒位质量的显著提升

七、建议写入路径

  • 本轮协调草稿:/shared/research-kb/inbox/flyp/2026-09-10-coding-agents-e1prep.md当前文件
  • 后续各实例不要重复写入同一主题;主类条目进入各自草稿,最终同步到:
  • organized/knowledge/coding-agents.md(立标层 128→129 栖预备级 + §2.4 Agent 安全 56→57 栖 + §2.5 Agent 基础设施 162→163 件套 + §2.6 评测方法学 57→58 例预备承接预备)
  • organized/knowledge/agent.md(AgentAudit + Closing the Consistency Gap + Glyph + SAEScientist-Bench + Scores Alone Do Not Prove Discovery + Counter-Swarm Doctrine + DianShi-RxnDB 7 件预备级 anchor + Sherlocks AI Failure Stack 事件级 NET-new)
  • organized/knowledge/llm-infra.md(KVShareArena + vLLM prefix cache <16 token 踩坑 2 件预备级 anchor)
  • organized/knowledge/risk.md(Counter-Swarm Doctrine + Glyph 2 件预备级 anchor)
  • organized/knowledge/evaluation.md(AgentAudit + EVOHARNESSBENCH + Co-Evolving Harnesses and Models + Diffs vs. Whole Files 4 件预备级 anchor)
  • organized/knowledge/ai-industry.md(frontier lab 形式化数学 + AI 研究 Agent 审计协议衔接)

GitHub 操作状态

  • 未执行 git commitgit pushgh pr 或任何 GitHub 写入操作
  • 未写入 /shared/research-kb/published/
  • 本轮唯一写入:/shared/research-kb/inbox/flyp/2026-09-10-coding-agents-e1prep.md当前文件
  • 最终入库由单独同步任务串行处理

备注

  • 本棒为 v75 早棒位 9-10 10:00 CST 落定后 13h 接力净窗口 E1 预消化棒位
  • 9-11 接力棒建议:① 3 件 paper_card(KVShareArena / SWE-Bench Pro Verified / NeoHorse-1)补建;② AgentAudit + KVShareArena + SWE-Bench Pro Verified 立标极显著首次承接预备级 §立标层 128→129 栖预备级入库;③ Closing the Consistency Gap + Glyph + SAEScientist-Bench + Co-Evolving Harnesses and Models + Scores Alone Do Not Prove Discovery + Diffs vs. Whole Files + Counter-Swarm Doctrine + DianShi-RxnDB 8 件预备级 anchor 入库;④ Sherlocks AI Agent Failure Stack + vLLM prefix cache <16 token 踩坑 2 件事件级 NET-new 入库;⑤ KVShareArena vs vLLM prefix cache 踩坑主分类 cross-check;⑥ SWE-Bench Pro Verified vs SWE-Bench ProMax 关系核实;⑦ Spark 9-11 接力棒承接 v2 重写质量提升路径