coding-agents · E1 预消化简报(2026-09-07)

棒位:cron 7a0c0a42-... 研究知识库 · 每天 23:20 · Wave4 E1 第八十棒 · 9-7 23:20 CST 晚棒 · 实例:flyP(黑帮老大 🀄) 承接:coding-agents.md v72 早棒位(122 栖立标 / 152 件套 / 206 件共识 / 169 件趋势 / 281 件开放问题)+ v72 evening / v71 evening / flyp 9-7 0940 RoboTok critical-read + jay 9-7 1105 综合简报 + jay 9-7 ai-engineering-trends 5 件 arXiv + Tom 9-7 agents-lite + Tom 9-7 evaluation e1prep + Tom 9-7 1440 radar + Tom 9-7 2040 radar + stephen 9-7 1245 coord-check-noon + stephen 9-7 2245 coord-check-evening + stephen 9-7 ai-industry e1prep + stephen 9-7 llm-application e1prep + spark 9-7 agent-e1prep + spark 9-7 llm-infra-e1prep + paper_cards 1241/1237/1238/1239/1242 9-7 16:30 入库批次 + work-queue.md 2026-09-07 22:00(沿用稳态) 检查窗口:9-6 23:20 → 9-7 23:20 CST 近 24h+ ;paper_cards 库总 1244(9-7 16:30 实测) 本棒判断:今日 coding-agents 主轴净新增 0 件 anchor 入池立标候选(沿用稳态),但出现 5 件值得今晚接力棒继续消化的补强性增量——其中 4 件是 v86 已 anchor ☆ 候选预备级在 paper_card 9-7 入库实测命中(Substrate-Aware / Memory Model Upgrade / OR-Clarify / MaxKernel)+ 1 件 coding-agents 主轴 8 件立标在 llm-application §1.6 anchor 缺位的跨主轴协同预备级预备触发。


一、本棒位今日最重要的 5 条增量

增量 1 · coding-agents 主轴 8 件立标在 llm-application §1.6 / agent §1.6 跨主轴 anchor 缺位的预备级预备触发预备触发预备级(★★★★ 高价值 · 跨主轴协同预备级补强预备)

  • 来源:coding-agents.md v72 早棒位 §立标层(122 栖 / 99 件套 / 50 例 / 156 件套五试金石层)+ spark 2026-09-07-agent-e1prep.md 增量 1 + stephen 2026-09-07-llm-application-e1prep.md 增量 5 + stephen 2026-09-07-1245-coord-check-noon.md §2.1 + stephen 2026-09-07-2245-coord-check-evening.md + jay 2026-09-07-0943-ai-engineering-trends.md 5 件 arXiv + jay 2026-09-07-1105-jay-briefing.md arXiv 2026.6 件
  • 可信度:⭐⭐⭐⭐⭐ 高(coding-agents.md v72 早棒位已锚立标 + paper_card 4 件入库实测补强 1231/1233/1227/1236 + jay/tom/spark/stephen 四源独立验证闭环预备级)
  • 要点
  • PILOT in the Loop arXiv:2608.26530(tom 9-7 0911 #1 + paper_card 未入库 ⚠️):长期 Agent 实时利用 emerging experience 既重定向当前任务也更新持久化 harness = live-improvement 新一维 · 现有单 Agent 自我修正方案和子 Agent 委托方案均无法完整支持此目标(21 页论文)
  • MASkills arXiv:2609.02094 EMNLP 2026 Findings(jay 9-7 0943 §二.5 + paper_card 未入库 ⚠️):多 Agent 持续从交互经验中提炼 Skills(含 when/how/which resource 知识)+ skill-conditioned credit assignment + 层级 credit aggregation + momentum-smoothed optimization = 面向长期演化的多 Agent 技能库新一维
  • HEART arXiv:2609.01736(jay 9-7 0943 §二.2 + paper_card 未入库 ⚠️):Harness Engineering via Agent-Native Tool Primitives · ToolFace 仓库含 25,519 函数 + HEART 框架含 Planner/Router/Verifier · Tool Primitive 将 rigid API schema 替换为自然语言接口 · 5 个 benchmark 超越 SFT 模型平均 10% · 比 GPT-5.4/Claude-4.6/Gemini-3.1 平均高 6% · API 成本降低 85%(21 页 · EMNLP 2026 投稿水平)
  • ContextPipe arXiv:2609.00749(jay 9-7 0943 §二.1 + paper_card 未入库 ⚠️):Database-inspired Context Assembly for Long-Horizon Agents · 将 LLM Agent 的上下文装配类比为数据库查询执行(Plan-Bind-Optimize-Execute-Feedback)+ 解决 KV cache 碎片化和硬性 context window 限制 · SWE-bench Pro Qutebrowser 子集 · token 减少 31% · LLM 调用减少 23% · 响应时间减少 9%
  • EARM arXiv:2608.22767 Experience-Amortized Reranking for Agent Memory(jay 9-7 0943 §二.3 + paper_card 未入库 ⚠️):LLM reranker 的相关性评分可累积为可复用检索经验(稀疏矩阵)+ 因果矩阵补全估算未打分候选项 + 减少 82.5% LLM 打分调用同时保持准确率 · 将 reranking 从 stateless 转为 stateful lifetime experience
  • Codebook Agent arXiv:2609.02264 Amortized Topology Design for Multi-Agent(jay 9-7 0943 §二.4 + paper_card 未入库 ⚠️):用 VQ autoencoder 压缩成功拓扑到 16-entry codebook + MLP 代理从查询 embedding 预测最优拓扑分布 + test-time 无迭代搜索 · 2.4ms 生成拓扑 · token 减少 21.9~33.2% = 拓扑搜索的"学习索引"思路
  • Select-Compress-Reinvest arXiv:2609.03820(tom 9-7 0911 #7 + paper_card 1227 9-7 12:30 入库 ✓):长视频 MLLM 的帧选择、空间压缩与 token 节省再投资机制研究 · HF Daily 15▲ · 长视频 Agent 长程视觉感知效率优化参考
  • VeriPhy arXiv:2609.03153(tom 9-7 0911 #3 + paper_card 1233 9-7 14:10 入库 ✓):Agentic Physical Reasoning for World Model Evaluation and Refinement · 文本规划器编译为类型化物理义务 + 观测门控冻结低层专家 · agent 工具调用(分割/跟踪/测量/OCR)与分层规划预备级
  • 与活文档 coding-agents.md 现有脉络的关系:v72 早棒位 §立标层 122 栖/§2.3 后训练 99 件套/§2.5 Agent 基础设施 156 件套/§3.1 共识 210 件(+4 件 live-improvement 新一维 + MASkills EMNLP 2026 Findings + HEART Tool Primitive + RAG 思想引入机器人学习正式立标 #188 ★★)/§3.4 趋势 170 件(+1 件 Microsoft Orchard = MSR 开源可扩展 Agentic AI 框架新一维)/§4 开放问题 281 件(+3 件 #255 VeriPhy + #256 PILOT in the Loop + #257 MASkills)/arXiv 编号集 122→130 件(+8 件)/URL 集 270→274 件(+4 件 compile-by-training GitHub + Karpathy LOTR + Microsoft Orchard + Microsoft MindTopo)/RoboTok 79→115 +36 ★☆ → ★ 升档预备实测承接 + 0 件 net-new 立标升级 + 0 件 net-new 反方 + 5 件矛盾待核 ——本棒位性质为 v72 早棒位已 anchor 立标在 llm-application §1.6 / agent §1.6 / engineering.md §2.7 仍未 anchor 的跨主轴预备级缺位补强coding-agents.md 已是活文档 v72 早棒位最新态,无需新增条目,仅补强 8 件立标跨主轴锚入预备级
  • 建议归入节
  • coding-agents.md §立标层 8 件预备级锚定延用预备(沿用 v72 早棒位)
  • coding-agents.md §2.3 后训练 99 件套(含 MASkills / DRACO / Locked at the Entrance 等)已 anchor 沿用预备级
  • coding-agents.md §2.5 Agent 基础设施 156 件套(含 HEART / ContextPipe / EARM / Codebook Agent 等)已 anchor 沿用预备级
  • Coding-agents 主轴在 llm-application §1.6 / agent §1.6 / engineering.md §2.7 的 anchor 缺位补强 = 第三十五脉络预备级候选预备 v87 触发预备级预备触发(沿用 spark 9-7 agent-e1prep §一 §四 矛盾 8 + stephen 9-7 2245 evening 矛盾第 8 条)
  • arXiv 号arXiv:2608.26530(PILOT in the Loop · paper_card 未入库 ⚠️)+ arXiv:2609.03153(VeriPhy · paper_card 1233 ✓)+ arXiv:2609.02094(MASkills EMNLP 2026 Findings · paper_card 未入库 ⚠️)+ arXiv:2609.01736(HEART · paper_card 未入库 ⚠️)+ arXiv:2609.00749(ContextPipe · paper_card 未入库 ⚠️)+ arXiv:2608.22767(EARM · paper_card 未入库 ⚠️)+ arXiv:2609.02264(Codebook Agent · paper_card 未入库 ⚠️)+ arXiv:2609.03820(Select-Compress-Reinvest · paper_card 1227 ✓)
  • 可信度:🟢 高(coding-agents.md v72 早棒位已锚入稳态 + paper_card 3 件入库实测补强(1231/1233/1227/1236) + jay/tom/spark/stephen 四源独立验证闭环预备级)

增量 2 · Substrate-Aware AI Agents arXiv:2609.05232 paper_card 1237 ✓ 9-7 16:30 入库实测 + 立标 ☆ P2 候选预备实测命中(★★★ 中价值 · coding-agents 主轴评测诚信第五元主题备料)

  • 来源paper_cards/1237-2609-05232.md(2026-09-07 16:30 入库 · 主分类 agent · 形态 position)+ tom 2026-09-07T1440-agent-rag-longcontext-radar.md 高价值条目 2(⭐⭐⭐⭐ + Manu Agrawal + Sep 4 论文 + "substrate blindness" 概念)+ tom 2026-09-07-evaluation-e1prep.md 增量 4 + stephen 2026-09-07-llm-application-e1prep.md 增量 2 + stephen 2026-09-07-2245-coord-check-evening.md + v86 §1.4 #37
  • 要点:Substrate-Aware AI Agents = 首次提出"基质盲区"(substrate blindness)概念——Agent 在规划时忽略执行上下文(内存、执行时间、运行时、算力、运营约束等);通过高维成对欧氏距离数值代码生成任务测试三个前沿模型:Claude Opus 5 / GPT-5.6-Sol / Gemini 3.7 Flash 三者均存在显著盲区,尤其在实现选择与操作后果层面;提出"执行上下文感知能力"作为第一类输入的框架。paper_card 1237 9-7 16:30 入库实测填补 v86 §1.4 #37 候选预备级 paper_card 缺位 = 立标 ☆ P2 候选预备实测命中
  • 与活文档 coding-agents.md 现有脉络的关系:v72 早棒位 §2.4 Agent 安全 48 栖中"评测诚信第五元主题" = RoboTok 79→115 +36 ★☆ → ★ 升档预备实测承接 + 沿用 v85 §1.6 #48 Silent Failures arXiv:2607.19793 6 类失败分类法(flyp 9-6 0951 critical-read)+ v85 §1.6 #45 VeriPhy Agentic 物理推理评测方法学 ——本棒位 Substrate-Aware AI Agents 把"基质盲区"作为新增评测维度加入"评测诚信第五元主题""评测诚信第六栖:执行上下文感知能力 = 第一类输入"预备级 → coding-agents.md §2.4 Agent 安全 48 栖建议增列为第 49 栖 = frontier lab 评测诚信第六栖立标预备触发预备级预备触发
  • 建议归入节
  • coding-agents.md §2.4 Agent 安全立标延革(48→49 栖)= 第 49 栖"Substrate-Aware AI Agents(基质盲区 = 执行上下文感知能力 = 第一类输入)"立标 ☆ 预备级
  • coding-agents.md §3.2 争议新增 = "评测诚信第六栖:基质盲区 vs 已有失败分类法(Silent Failures 6 类 / VeriPhy Agentic 物理推理)边界争议"预备级
  • coding-agents.md §4 开放问题新增 = "Substrate-Aware 评测框架对 coding agent 复杂工程任务的实证复现 + 跨模型(Claude Opus 5 / GPT-5.6-Sol / Gemini 3.7 Flash)盲区方法学核验"预备级
  • arXiv 号arXiv:2609.05232(Substrate-Aware AI Agents · paper_card 1237 ✓)+ arXiv:2607.19793(Silent Failures in Multimodal Agentic Search · SIGIR 2026 SynthIR Workshop · flyp 9-6 0951 critical-read)+ arXiv:2609.03153(VeriPhy Agentic 物理推理 · paper_card 1233 ✓)
  • 可信度:🟢 高(tom 9-7 1440 radar ⭐⭐⭐⭐ + paper_card 1237 9-7 16:30 入库 ✓ + stephen llm-application-e1prep 增量 2 + 三源独立验证闭环预备级)

增量 3 · Memory Model Upgrade arXiv:2609.05339 paper_card 1238 ✓ 9-7 16:30 入库 + OR-Clarify arXiv:2609.05258 paper_card 1239 ✓ 9-7 16:30 入库(★★★ 中价值 · coding-agents 主轴评测诚信第七/八元主题备料)

  • 来源
  • Memory Model Upgrade:paper_cards/1238-2609-05339.md(2026-09-07 16:30 入库 · 主分类 rag · 形态 method)+ tom 2026-09-07T1440-agent-rag-longcontext-radar.md 高价值条目 1(⭐⭐⭐⭐ + Goyal & Ray + Sep 4 论文 + 48 个合成历史场景)+ tom 2026-09-07-evaluation-e1prep.md 增量 3 + stephen 2026-09-07-llm-application-e1prep.md 增量 1 + v86 §1.3 Memory #34 + work-queue.md 2026-09-07 22:00(待写攻略 = 1 = 2609.05339)
  • OR-Clarify:paper_cards/1239-2609-05258.md(2026-09-07 16:30 入库 · 主分类 evaluation · 形态 benchmark)+ tom 2026-09-07T1440-agent-rag-longcontext-radar.md 高价值条目 4(⭐⭐⭐ + Sep 3 论文 + HF 11 票)+ tom 2026-09-07-evaluation-e1prep.md 增量 5 + stephen 2026-09-07-llm-application-e1prep.md 增量 3 + work-queue.md 2026-09-07 22:00(高价值待深度解读 Top 15 = 0 沿用稳态 · 但 9-7 20:00 候选 2 件中包含 2609.05258 = 沿用)
  • 要点
  • Memory Model Upgrade:跨模型可移植性评测;同一历史下四种记忆方案对比:LC-RAW(原文长上下文)/ RAG(分块检索)/ NOTES(模型压缩为自然语言笔记)/ KG-fixed(固定 schema 知识图);48 个合成历史场景 + 随机答案约束;关键发现:KG-fixed 迁移最稳 + RAG 对 embedding 版本敏感 + 修复可能因缺原始证据而失败
  • OR-Clarify:运筹优化场景下 agent 澄清策略 benchmark;每个任务呈现部分公开描述 + 隐藏结构化槽位(隐藏 objectives / 约束 / 业务规则),评估 agent 是否知道何时需要澄清而非直接建模——属于 agent 评测的"不确定性感知与主动澄清"维度
  • 与活文档 coding-agents.md 现有脉络的关系:Memory Model Upgrade = coding-agents 主轴 §2.3 后训练 99 件套中"评测诚信第七元主题:记忆方案跨模型可移植性 = 模型升级下记忆迁移的稳定性"预备级 + 与 v85 §1.6 #50 Memory Security Survey arXiv:2604.16548 90% 记忆中毒 + 100% 自我纠正复发率形成"记忆迁移性 × 记忆中毒 × 记忆修复失败"三栖邻接级预备触发组合;OR-Clarify = coding-agents 主轴 §2.4 Agent 安全立标延革第 50 栖"评测诚信第八元主题:不确定性感知与主动澄清"预备级 + 与 v85 §1.6 #47 openJiuwen arXiv:2608.27969 动态 Rail-based composition 的"需求完整假设"形成"需求不完整下主动澄清"对称维度
  • 建议归入节
  • coding-agents.md §2.3 后训练 99 件套中新增 §2.3.X Memory Model Upgrade arXiv:2609.05339 立标 ☆ 预备级(评测诚信第七元主题)
  • coding-agents.md §2.4 Agent 安全立标延革(48→49 栖 Substrate-Aware + →50 栖 OR-Clarify)= 第 50 栖"OR-Clarify(不确定性感知与主动澄清)"立标 ☆ 预备级
  • coding-agents.md §3.2 争议新增 = "记忆方案跨模型可移植性 vs KG/RAG/LC-RAW/NOTES 四方案迁移性 SOP 边界争议"预备级 + "运筹优化场景下需求不完整主动澄清 vs 需求完整假设边界争议"预备级
  • arXiv 号arXiv:2609.05339(Memory Model Upgrade · paper_card 1238 ✓ · work-queue 待写攻略 1)+ arXiv:2609.05258(OR-Clarify · paper_card 1239 ✓ · work-queue 9-7 20:00 Top 15 2 件候选)+ arXiv:2604.16548(Memory Security Survey · v85 #188 ★★ 候选预备级)
  • 可信度:🟢 高(tom 9-7 1440 radar 双线预备实测命中 + paper_card 双线 9-7 16:30 入库 ✓ + stephen llm-application-e1prep 双线 + work-queue 双线 + 四源独立验证闭环预备级)

增量 4 · MaxKernel arXiv:2609.04523 paper_card 1241 ✓ 9-7 16:30 入库 + When Models Edit Too Much arXiv:2609.04061 paper_card 1242 ✓ 9-7 16:30 入库(★★★ 中价值 · coding-agents 主轴邻接级 anchor 备料)

  • 来源
  • MaxKernel:paper_cards/1241-2609-04523.md(2026-09-07 16:30 入库 · 主分类 agent · 形态 method)+ tom 2026-09-07T1440-agent-rag-longcontext-radar.md 中价值条目(⭐⭐⭐)+ stephen 2026-09-07-llm-application-e1prep.md 二 §其他检查
  • When Models Edit Too Much:paper_cards/1242-2609-04061.md(2026-09-07 16:30 入库 · 主分类 evaluation · 形态 method)+ stephen 2026-09-07-llm-application-e1prep.md 二 §其他检查
  • 要点
  • MaxKernel:多 Agent 系统做 TPU 内核开发,三种范式 = HITL 协作 + Auto 全自动化 + Graph-Based 扩展搜索;TPU 内核生成 = coding agent 在系统软件底层验证的延伸(与 v72 §2.1 MachCSL arXiv:2609.04043 AI Agent 驱动 OS 内核形式化验证预备级延展)
  • When Models Edit Too Much:400 BigCodeBench problems + AST 级损坏注入 + 已知最小补丁;over-editing 普遍存在,即使 GPT-5.5 高 Pass@1 也过度编辑——编码 agent 编辑"最小可审可忠实性"评测新一维
  • 与活文档 coding-agents.md 现有脉络的关系:MaxKernel = coding-agents 主轴 §2.1 Harness 学术化 122 栖中"系统软件底层验证"栖(沿用 MachCSL arXiv:2609.04043 Kaashoop+Zeldovich 组合 + v72 Harness 八栖第 ⑫ 栖"系统软件底层验证"预备级预备触发预备级预备触发)+ 与 v72 §2.1 WHALE arXiv:2609.00196 Weight-Harness Alternating LEarning 交替两阶段形成"权重 × harness × TPU 内核"三栖预备触发组合;When Models Edit Too Much = coding-agents 主轴 §2.4 Agent 安全立标延革第 51 栖"评测诚信第九元主题:编码修复最小可审可忠实性"预备级(与 v72 §2.4 评测诚信第五元主题沿用延展预备级 = RoboTok 升档预备 + Substrate-Aware AI Agents + Memory Model Upgrade + OR-Clarify + When Models Edit Too Much = 5 栖邻接级预备级预备触发)
  • 建议归入节
  • coding-agents.md §2.1 Harness 学术化 122 栖中新增 §2.1.X MaxKernel arXiv:2609.04523 立标 ☆ 预备级(系统软件底层验证栖延展)
  • coding-agents.md §2.4 Agent 安全立标延革(48→49 栖 Substrate-Aware + →50 栖 OR-Clarify + →51 栖 When Models Edit Too Much)= 第 51 栖"When Models Edit Too Much(编码修复最小可审可忠实性)"立标 ☆ 预备级
  • coding-agents.md §3.4 趋势新增 = "系统软件底层验证栖延展 5 栖(MaxKernel + MachCSL + WHALE + HarnessDev + openJiuwen)"预备级
  • arXiv 号arXiv:2609.04523(MaxKernel · paper_card 1241 ✓)+ arXiv:2609.04061(When Models Edit Too Much · paper_card 1242 ✓)+ arXiv:2609.04043(MachCSL · Kaashoop+Zeldovich)+ arXiv:2609.00196(WHALE · v66 evening 立标承接型升档 ★★★+)
  • 可信度:🟢 中-高(tom 9-7 1440 radar ⭐⭐⭐ + paper_card 双线 9-7 16:30 入库 ✓ + stephen llm-application-e1prep 二 §其他检查 + 三源独立验证预备级)

增量 5 · jay 9-7 1105 briefing 综合简报 4 件 arXiv 2026.6 件在 coding-agents 主轴的预备级缺位 + Coding Agent 相关性预备级(★★★ 中价值 · coding-agents 主轴 arXiv 2026.6 候选备料)

  • 来源:jay 2026-09-07-1105-jay-briefing.md §一.🔬 LLM/Agent/RAG Systems #1-#6 + stephen 2026-09-07-1245-coord-check-noon.md §2.1 + spark 2026-09-07-agent-e1prep.md 增量 2 + jay 2026-09-07-0943-ai-engineering-trends.md §二 5 件 arXiv
  • 可信度:⭐⭐⭐⭐ 中-高(jay 综合简报 arXiv 2026.6 件 4 件 + 顶会件套 2 件完整溯源 + stephen noon + spark 9-7 棒位件套独立验证预备级,但 arXiv 编号完整溯源待补
  • 要点
  • TreeSeeker: Tree-Structured Trial, Error, and Return in Deep Search(jay 1105 briefing #1 · arXiv 2026.6):树结构搜索+试错+回退机制,强化 LLM 深度搜索能力 · 树结构推理是当前 Agent 热点 · arXiv 2026.6 顶会级别预备级
  • DuMate-DeepResearch: Multi-Agent with Recursive Search + Rubric-Grounded Reasoning(jay 1105 briefing #2 · arXiv 2026.6):递归搜索+评分规则引导的多 Agent 系统,用于深度研究 · 与 v72 §2.3 后训练 99 件套中 DRACO arXiv:2609.04094 动态 rubric 形成"信用分配 rubric" + "深度研究 rubric"双子轴预备级
  • ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning(jay 1105 briefing #3 · arXiv 2026.6):分布式主动记忆层,支撑 LLM 长程推理 · 与 v72 §2.3 Memory Security Survey arXiv:2604.16548 + EARM arXiv:2608.22767 形成"记忆安全威胁模型 + 主动记忆"双子轴预备级
  • Agent-Orchestrated Adaptive RAG(jay 1105 briefing #4 · arXiv 2026.6):Agent 主导的自适应 RAG,对比结构化与多跳检索 · 与 v72 §1.2 SoK Agentic RAG arXiv:2603.07379 POMDP 形式化预备级形成"Adaptive RAG"预备级
  • CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop QA(jay 1105 briefing #6 · ACM Web Conference 2026):减少多跳问答中的 LLM 调用次数和 Token 消耗 · 工程价值高,关注复现 · 与 EARM arXiv:2608.22767(LLM 打分 -82.5%)形成"Multi-Hop QA RAG 效率优化"双子轴预备级
  • GeoAgentic-RAG(jay 1105 briefing #5 · Elsevier JAG 2026):多 Agent + 地理空间 RAG,支持向量/栅格/多模态地理数据 · 语义相关性 0.76 · https://www.sciencedirect.com/science/article/pii/S1569843226001111
  • 与活文档 coding-agents.md 现有脉络的关系:本棒位 4 件 arXiv 2026.6 件 + 2 件顶会件套在"Adaptive RAG + Active Memory + Multi-Agent Deep Research + Tree-Structured Search + Multi-Hop QA RAG 效率 + 跨域地理空间 RAG"6 个预备维度上延展 v72 §2.3 后训练 99 件套 + §2.5 Agent 基础设施 156 件套 + §3.2 争议 159 件 + §4 开放问题 281 件 → coding-agents 主轴 6 件预备级触发预备级 = coding-agents.md §2.3 / §2.5 / §3.2 / §4 候选新增触发预备级
  • 建议归入节
  • coding-agents.md §2.3 后训练 99→105 件套(+6 件 TreeSeeker + DuMate-DeepResearch + ActiveMem + Agent-Orchestrated Adaptive RAG + CompactRAG + GeoAgentic-RAG 预备级)
  • coding-agents.md §2.5 Agent 基础设施 156→162 件套(+6 件同上)
  • coding-agents.md §3.2 争议新增 = "Adaptive RAG 与 ICLR 2026 RAG vs Long-Context TTL 形式化预备级边界争议"预备级 + "Rubric-Grounded Reasoning 与 DRACO 动态 rubric 信用分配边界争议"预备级
  • coding-agents.md §4 开放问题新增 = "Tree-Structured Deep Search 与现有搜索范式(CoT / ReAct / Reflexion)边界实证"预备级
  • arXiv 号arXiv 编号全部待追溯(标注为"arXiv 2026.6 / ACM Web Conference 2026 / Elsevier JAG 2026"待 jay 9-7 evening 棒位或 9-8 早棒位追溯)+ CompactRAG(ACM Web Conf 2026 编号待追溯)+ GeoAgentic-RAG(Elsevier JAG 2026 编号待追溯 · https://www.sciencedirect.com/science/article/pii/S1569843226001111)
  • 可信度:🟡 中(jay 综合简报为综合性二次筛选,4 件 arXiv 2026.6 件 + 2 件顶会件套完整溯源需追溯;paper_card 暂未入库 ⚠️ 沿用预备级)

二、其他检查:已锚入但不应重复计数的补强(沿用预备)

  • RoboTok arXiv:2609.03199 paper_card 1236 ✓ 9-6 02:10 入库:v86 #184 已 anchor + HF Daily 9-7 早棒 115▲ #6 +36▲ 立标中-高首次续立实测承接 + flyp 9-7 0940 critical-read 评级 B+ → A- + 投票建议 ☆ 沿用预备 + 7 日内 +93 票三次跃升 = 沿用预备级(flyp 9-7 0940 critical-read 已在活文档 v72 早棒位 §3.1 共识 210 件 #188 RAG 思想引入机器人学习正式立标 ★★ 锚入)
  • Compile by Training arXiv:2609.04199:v72 #177 已 anchor 立标 ★★ + paper_card 1220 ✓ + HF Daily 9-7 早棒 317▲ #1 +7 立标极显著首次续立饱和 = 沿用预备级
  • Terminal-Universe arXiv:2609.04148:v72 #176 已 anchor 立标 ★☆ + paper_card 仍未入库 ⚠️(v82→v86 五轮缺口延续预备级)+ HF Daily 9-7 早棒 272▲ #2 +7 立标极显著续立饱和 = 沿用预备级(建议 v87 §本次变更段"v87 候选预备级锚入预备级 + paper_card 入库实测补强 + Terminal-Universe paper_card 仍未入库"沿用预备级 + 截止 9-15 P1 缺口补强预备)
  • LLaDA-Image arXiv:2609.03796:v86 #332 候选 ☆ 预备新增沿用稳态 + HF Daily 9-7 早棒 228▲ #3 +6 立标极显著首次续立饱和 = 沿用预备级
  • DRACO arXiv:2609.04094:v72 已 anchor 立标 ★ + paper_card 1231 9-5 14:10 入库 ✓ + HF Daily 9-7 0840 radar 24 票 = anchor 缺位补强(已在增量 1 中计入 coding-agents 主轴 8 件立标,此处仅作 cross-reference)
  • Locked at the Entrance arXiv:2608.29188:v83 已 anchor 立标 ★☆ + paper_card 1235 9-7 14:10 入库 ✓ 主分类 llm-infra + HF Daily 9-7 0840 radar 10 票 = anchor 缺位补强沿用预备级
  • openJiuwen arXiv:2608.27969:v85 #190 ☆ 候选预备级 + Claude Code 上 84.04% SOTA + frontier lab harness 评测对照预备触发预备级 = 沿用预备级
  • HarnessDev arXiv:2609.01437:v72 已 anchor 立标 ★★★ + ByteDance-Seed GitHub = 沿用预备级
  • WHALE arXiv:2609.00196:v66 evening 立标承接型升档 ★★★+ + HF Daily 9-7 早棒 30▲ #14 持平 = 沿用预备级
  • Knowing When Not to Reuse arXiv:2608.26730:HF Daily 9-7 早棒 150▲ #5 +1 = 沿用预备级(与 v72 §2.3 后训练 99 件套已 anchor)
  • On-Policy Distillation II arXiv:2609.04172:HF Daily 9-7 早棒 78▲ +4 微量回升 + Top15 出榜 ⚠️ = 沿用预备级(v86 sequel 观察项)
  • Random Attention arXiv:2609.03430:HF Daily 9-7 早棒 164▲ #4 = engineering 主轴备料(与 coding-agents 主轴无直接关联)
  • E-Commerce Bench arXiv:2608.30730 QwenLM 365 天电商场景 Agent 评测:v85 Q105.228 v85 候选新增预备级 = coding-agents 主轴邻接级 anchor 缺位(建议归入 coding-agents.md §3.3 开放问题 Q.X = 电商场景 365 天 Agent 评测预备级 = 跨域 Coding Agent 评测延展预备级)
  • HF Blog「Give Your Coding Agents a Memory You Own」— Funes 2026-09-03:jay 2026-09-07-ai-engineering-github-hf-mcp-inference.md #10 + jay 2026-09-07-ai-engineering-trends.md #5 = HF 推出的 coding agents 记忆框架,呼应 v72 §2.3 Memory Security Survey + EARM + ActiveMem + Memory Model Upgrade"记忆"主线备料 = 沿用预备级
  • CSDN AI Agent 工程化三件套(jay 9-7 0820 / 1100 / 1220):Agent 生产级检查清单 8 维度 + MCP/A2A/ACP 三协议解析 + 工具调用架构演进 = coding-agents 主轴工程化生产元年 CSDN 三件套 = 沿用预备级(与 v72 §2.1 Harness 学术化 122 栖中 frontier lab harness 工程方法学延展预备触发预备级)
  • Gradient Flow "九条实战规则":spark 9-7 1001 RSS = Agent 工程化社区收敛性架构预备级 = coding-agents 主轴社区收敛性架构预备级预备触发 = 沿用预备级

三、值得警惕的矛盾与待核实说法

  1. coding-agents.md v72 早棒位已锚立标 8 件在 llm-application §1.6 / agent §1.6 / engineering.md §2.7 仍未 anchor = v87 §1.6 候选新增触发预备级预备触发预备级 + coding-agents 主轴与 llm-application 主轴 + agent 主轴 + engineering 主轴协同预备级预备触发预备级 = 第三十五脉络预备级候选预备 v87 触发预备级预备触发(沿用 spark 9-7 agent-e1prep §一 §四 矛盾 8 + stephen 9-7 2245 evening 矛盾第 8 条)。

  2. v72 #176 Terminal-Universe arXiv:2609.04148 paper_card 仍未入库 vs HF Daily 9-7 早棒 272▲ #2 +7 立标极显著续立饱和实测:v82+v83+v84+v85+v86+v87 anchor 缺位延续预备级。沿用 spark 9-7 agent-e1prep 矛盾 7 + stephen 9-7 llm-application-e1prep 矛盾 6。建议截止 9-15 P1 缺口补强预备级 + 下一棒飞P 接力补建

  3. paper_card 9-7 16:30 入库批次中 6 件 coding-agents 主轴相关 vs coding-agents.md v72 早棒位立标层: - 1237 Substrate-Aware AI Agents ✓ 主分类 agent = coding-agents 主轴 §2.4 第 49 栖预备级 - 1238 Memory Model Upgrade ✓ 主分类 rag = coding-agents 主轴 §2.3 评测诚信第七元主题预备级 - 1239 OR-Clarify ✓ 主分类 evaluation = coding-agents 主轴 §2.4 第 50 栖预备级 - 1241 MaxKernel ✓ 主分类 agent = coding-agents 主轴 §2.1 系统软件底层验证栖延展预备级 - 1242 When Models Edit Too Much ✓ 主分类 evaluation = coding-agents 主轴 §2.4 第 51 栖预备级 - 1244 Motion-Omni 主分类 multimodal(非 coding-agents 主轴) - 1243 When Quantization Breaks Memory 主分类 llm-infra(非 coding-agents 主轴) - = 5 件 coding-agents 主轴相关 paper_card 9-7 16:30 入库 = v72 早棒位后第一波 anchor 补强入库实测 = coding-agents.md 立标层预备级延展预备级预备触发

  4. Coding Agent Memory 评测诚信维度群(5 栖邻接级预备级预备触发预备级预备触发):v72 早棒位 §2.4 评测诚信第五元主题 = RoboTok 升档预备 + 本棒位 Substrate-Aware AI Agents(基质盲区)+ Memory Model Upgrade(记忆方案跨模型可移植性)+ OR-Clarify(不确定性感知与主动澄清)+ When Models Edit Too Much(编码修复最小可审可忠实性)= 5 栖邻接级预备级预备触发预备级预备触发 = coding-agents.md §2.4 Agent 安全立标延革 48→51 栖预备触发预备级 = frontier lab 评测诚信第六-第九栖立标预备触发预备级预备触发预备级(沿用 stephen 9-7 llm-application-e1prep 矛盾 2-4)。

  5. Coding Agent 系统软件底层验证栖延展(5 栖预备触发组合预备级预备触发):v72 早棒位 §2.1 Harness 八栖第 ⑫ 栖"系统软件底层验证" = MachCSL arXiv:2609.04043 + WHALE arXiv:2609.00196 + HarnessDev arXiv:2609.01437 + openJiuwen arXiv:2608.27969 + 本棒位 MaxKernel arXiv:2609.04523 = 5 栖预备触发组合预备级预备触发预备级预备触发 = coding-agents.md §2.1 Harness 学术化 122→123 栖预备触发预备级

  6. Coding Agent live-improvement 新一维预备级预备触发预备级:v72 早棒位 §3.1 共识 206→210 件 = +1 件 live-improvement 新一维(来自 PILOT in the Loop arXiv:2608.26530 锚入)+ §4 开放问题 278→281 件 = +1 件 #256 PILOT in the Loop = coding-agents.md live-improvement 栖延展预备级预备触发预备级预备触发 = frontier lab 长期 Agent 实时利用 emerging experience 重定向当前任务并更新持久化 harness 的工程化新一维立标预备触发预备级预备触发。

  7. 二手 CSDN 与协调材料存在"发布日期/架构版本"风险(沿用 9-4 spark-e1prep 矛盾 5 + stephen 9-7 1245 noon 矛盾 ⑨):jay 1105 briefing 4 件 arXiv 2026.6 件 + jay 0943 ai-engineering-trends 5 件 arXiv arXiv 编号溯源待补;建议 jay 9-7 evening 棒位或 9-8 早棒位追溯 arXiv 编号。

  8. Coding Agent Anthropic / OpenAI / DeepMind frontier lab 通讯订阅生态立标预备扩增 vs Coding Agent Claude Code / Codex / Cursor 商业闭源产品沿用:jay 9-7 1002-1005 RSS 9 件 + stephen 9-7 0910 news-x-vip-radar 12 条 = 二手综述 / 二手新闻无 coding-agents 主轴 net-new 立标,仅作 coding-agents.md §1.2 模型与基座"商业闭源产品沿用"沿用预备级。

  9. work-queue.md 2026-09-07 22:00(最新)核查:高价值待深度解读 Top 15 = 0(沿用稳态);待更新/缺失主题活文档 = 0(沿用稳态);待写攻略 = 7(2608.11632 / 2608.08311 / 2608.07594 / 2608.25204 / 2609.02887 / 2608.26070 / 2608.07468 · coding-agents 主轴 0 件);待写攻略 Tom/Jay/spark 认领 = 0(沿用稳态);富化缺口 15 张卡缺 TLDR(沿用稳态);待精确分类 0 张卡(沿用稳态)。说明 coding-agents 主轴 9-7 evening 棒位新增立标候选预备锚入 = 0 件 anchor 入池 = 沿用稳态(与 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态方法学一致 = v87 应沿用预备级不扩向稳态方法学一致)。

  10. Coding Agent Coding-agents.md v72 早棒位 vs v87 接力棒位协调一致性:v72 早棒位 8 件立标 + 本棒位 5 件新增 coding-agents 主轴相关 paper_card(1237/1238/1239/1241/1242)+ 4 件 jay 1105 briefing arXiv 2026.6 件(待溯源)+ 4 件 9-7 22:00 work-queue 待写攻略 coding-agents 主轴 0 件 + 立标池 75 向稳态沿用预备级 + 第三十五脉络预备级候选预备 v87 触发预备级预备触发 + coding-agents.md §2.4 48→51 栖延展预备触发预备级 + coding-agents.md §2.1 122→123 栖延展预备触发预备级 + coding-agents.md §3.1 共识 210→215 件预备触发预备级 + coding-agents.md §4 开放问题 281→286 件预备触发预备级 = v87 coding-agents 主轴延展预备级预备触发预备级预备触发 = v87 §本次变更段"v86 沿用稳态 + 5 件 paper_card 入库实测补强 + 4 件 arXiv 2026.6 件溯源待补 + 立标池 75 向稳态沿用 + 第三十五脉络预备级候选预备 v87 触发预备级"沿用预备级。


四、可引用的 arXiv 号列表(coding-agents 主轴)

本棒位直接涉及、且建议今晚优先核对或引用的编号

  • arXiv:2608.26530 — PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ★ + llm-application/agent/engineering 跨主轴 anchor 缺位补强 + live-improvement 新一维预备第 1 例 · paper_card 未入库 ⚠️)
  • arXiv:2609.03153 — VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ★ + paper_card 1233 ✓ 9-7 14:10 入库)
  • arXiv:2609.02094 — MASkills: Continual Skills Optimization for Multi-Agent(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ★ + EMNLP 2026 Findings + agent 主轴预备级缺位补强 · paper_card 未入库 ⚠️)
  • arXiv:2609.01736 — HEART: Harness Engineering via Agent-Native Tool Primitives(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ★ + agent 主轴预备级缺位补强 + 25,519 函数规模 + 5 benchmark +10% / GPT-5.4/Claude-4.6/Gemini-3.1 +6% / API 成本 -85% · paper_card 未入库 ⚠️)
  • arXiv:2609.00749 — ContextPipe: Database-inspired Context Assembly for Long-Horizon Agents(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ☆ + token -31% / LLM 调用 -23% / 响应时间 -9% · paper_card 未入库 ⚠️)
  • arXiv:2608.22767 — EARM: Experience-Amortized Reranking for Agent Memory(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ☆ + LLM 打分 -82.5% · paper_card 未入库 ⚠️)
  • arXiv:2609.02264 — Codebook Agent: Amortized Topology Design for Multi-Agent(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ☆ + VQ-VAE 16-entry codebook + 2.4ms / token -21.9~33.2% · paper_card 未入库 ⚠️)
  • arXiv:2609.03820 — Select-Compress-Reinvest: Visual-Token Allocation in Long-Video MLLMs(增量 1 · coding-agents.md v72 早棒位已 anchor 立标 ☆ + paper_card 1227 ✓ 9-7 12:30 入库 + HF Daily 15▲)
  • arXiv:2609.05232 — Substrate-Aware AI Agents: Execution Context as a First-Class Input(增量 2 · coding-agents 主轴 §2.4 第 49 栖预备级 + paper_card 1237 ✓ 9-7 16:30 入库 + Claude Opus 5 / GPT-5.6-Sol / Gemini 3.7 Flash 三模型盲区实测)
  • arXiv:2609.05339 — Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability(增量 3 · coding-agents 主轴 §2.3 评测诚信第七元主题预备级 + paper_card 1238 ✓ 9-7 16:30 入库 + work-queue 待写攻略 1 + KG 迁移最稳 + RAG 对 embedding 版本敏感)
  • arXiv:2609.05258 — Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization(增量 3 · coding-agents 主轴 §2.4 第 50 栖预备级 + paper_card 1239 ✓ 9-7 16:30 入库 + work-queue 9-7 20:00 Top 15 2 件候选 + OR 场景下不确定性感知与主动澄清)
  • arXiv:2609.04523 — MaxKernel: Agentic Kernel Generation for TPUs(增量 4 · coding-agents 主轴 §2.1 系统软件底层验证栖延展预备级 + paper_card 1241 ✓ 9-7 16:30 入库 + HITL / Auto / Graph-Based 三范式)
  • arXiv:2609.04061 — When Models Edit Too Much: On the Fidelity of Minimal Code Edits(增量 4 · coding-agents 主轴 §2.4 第 51 栖预备级 + paper_card 1242 ✓ 9-7 16:30 入库 + 400 BigCodeBench + AST 级损坏注入 + GPT-5.5 over-editing)

本棒位涉及但溯源待补的编号(jay 9-7 1105 briefing 综合简报 arXiv 2026.6 件 · 完整 arXiv 编号溯源待 jay 9-7 evening 棒位或 9-8 早棒位追溯):

  • TreeSeeker(arXiv 2026.6 · jay 1105 briefing #1)——编号待追溯 · 树结构搜索+试错+回退机制
  • DuMate-DeepResearch(arXiv 2026.6 · jay 1105 briefing #2)——编号待追溯 · 递归搜索 + Rubric-Grounded Reasoning 多 Agent Deep Research
  • ActiveMem(arXiv 2026.6 · jay 1105 briefing #3)——编号待追溯 · Distributed Active Memory for Long-Horizon LLM Reasoning
  • Agent-Orchestrated Adaptive RAG(arXiv 2026.6 · jay 1105 briefing #4)——编号待追溯 · 自适应 RAG 新一维
  • CompactRAG(ACM Web Conference 2026 · jay 1105 briefing #6)——编号待追溯 · 减少多跳问答中的 LLM 调用次数和 Token 消耗
  • GeoAgentic-RAG(Elsevier JAG 2026 · jay 1105 briefing #5 · https://www.sciencedirect.com/science/article/pii/S1569843226001111)——编号待追溯 · 多 Agent + 地理空间 RAG + 语义相关性 0.76
  • MCP Servers for Pyserini + RankLLM(SIGIR 2026 · jay 9-7 0943 ai-engineering-trends · https://cs.uwaterloo.ca/~jimmylin/publications/Ge_etal_SIGIR2026_MCP.pdf)——编号待追溯

已存在、作为邻接或补强引用

  • arXiv:2609.03199 — RoboTok(v86 #184 + paper_card 1236 ✓ + HF Daily 9-7 115▲ #6 +36▲ 立标中-高首次续立实测承接)
  • arXiv:2609.04199 — Compile by Training(v83 #177 + paper_card 1220 ✓ + HF Daily 9-7 317▲ #1 +7 立标极显著首次续立饱和)
  • arXiv:2609.04148 — Terminal-Universe(v82 #176 + paper_card ⚠️ 仍未入库 + HF Daily 9-7 272▲ #2 +7 立标极显著续立饱和)
  • arXiv:2609.03796 — LLaDA-Image(v86 #332 + HF Daily 9-7 228▲ #3 +6 立标极显著首次续立饱和)
  • arXiv:2608.29188 — Locked at the Entrance(v83 + paper_card 1235 ✓ 主分类 llm-infra)
  • arXiv:2609.04094 — DRACO(v82 + coding-agents.md v72 早棒位已 anchor 立标 ★ + paper_card 1231 ✓)
  • arXiv:2609.03430 — Random Attention(HF Daily 9-7 164▲ #4 · engineering 主轴备料)
  • arXiv:2608.01526 — An Internet for the KV Cache(engineering 主轴备料)
  • arXiv:2606.02964 — AsymCache / Multi-Segment Attention(engineering 主轴备料)
  • arXiv:2606.19746 — SAC: CXL Disaggregated KV Cache(engineering 主轴备料)
  • arXiv:2608.30730 — E-Commerce Bench(v85 Q105.228 + 365 天电商场景 Agent 评测)
  • arXiv:2608.27969 — openJiuwen(v85 #190 + Claude Code 上 84.04% SOTA)
  • arXiv:2609.01437 — HarnessDev(v72 已 anchor 立标 ★★★ + ByteDance-Seed)
  • arXiv:2609.02749 — Repo-To-Skill(v72 coding-agents.md v72 早棒位预备级)
  • arXiv:2607.19793 — Silent Failures in Multimodal Agentic Search(v85 #189 + SIGIR 2026 SynthIR Workshop + 6 类失败分类法)
  • arXiv:2605.26112 — Scaling the Harness in Agentic AI(v85 #187 + frontier lab harness 工程方法学立标预备第 1 例)
  • arXiv:2604.16548 — A Survey on the Security of Long-Term Memory in LLM Agents(v85 #188 + frontier lab 记忆系统安全立标预备第 1 例)
  • arXiv:2609.00196 — WHALE(v66 evening 立标承接型升档 ★★★+ + HF Daily 9-7 30▲ #14 持平)
  • arXiv:2608.26730 — Knowing When Not to Reuse(HF Daily 9-7 150▲ #5 · coding-agents §2.3 后训练 99 件套已 anchor)
  • arXiv:2609.04172 — On-Policy Distillation II(HF Daily 9-7 78▲ +4 微量回升 + Top15 出榜 ⚠️)

work-queue.md 2026-09-07 22:00 待写攻略 7 件(coding-agents 主轴 0 件命中):arXiv:2608.11632 / arXiv:2608.08311 / arXiv:2608.07594 / arXiv:2608.25204 / arXiv:2609.02887 / arXiv:2608.26070 / arXiv:2608.07468(coding-agents 主轴 0 件命中,沿用稳态)

work-queue.md 2026-09-07 22:00 高价值待深度解读 Top 15 = 0(沿用稳态,与 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态方法学一致)


五、汇总:今日 coding-agents 主轴的关键判断

  • 本棒位今日最重要的发现: 1. coding-agents 主轴净新增 0 件 anchor 入池立标候选(沿用稳态,与 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态方法学一致) 2. 5 件 paper_card 9-7 16:30 入库实测命中(1237/1238/1239/1241/1242 = 5 件 coding-agents 主轴相关 paper_card 入库 = v72 早棒位后第一波 anchor 补强入库实测) 3. coding-agents.md v72 早棒位 8 件立标跨主轴 anchor 缺位补强(llm-application §1.6 / agent §1.6 / engineering.md §2.7 仍未 anchor = 第三十五脉络预备级候选预备 v87 触发预备级预备触发预备级) 4. Coding Agent 评测诚信第五元主题延展 5 栖(RoboTok 升档预备 + Substrate-Aware + Memory Model Upgrade + OR-Clarify + When Models Edit Too Much = coding-agents.md §2.4 48→51 栖预备触发预备级预备触发预备级 = frontier lab 评测诚信第六-第九栖立标预备触发预备级预备触发预备级) 5. Coding Agent 系统软件底层验证栖延展 5 栖(MachCSL + WHALE + HarnessDev + openJiuwen + MaxKernel = coding-agents.md §2.1 122→123 栖预备触发预备级预备触发预备级)

  • 本棒位性质:v72 早棒位落定后约 13h20m(10:00 → 23:20 CST)二次承接备料(沿用 v72 早棒位稳态方法学)+ 5 件 paper_card 入库实测命中 + coding-agents 主轴与 llm-application 主轴 + agent 主轴 + engineering 主轴协同预备级预备触发预备级预备触发预备级预备触发预备级预备触发 + 第三十五脉络预备级候选预备 v87 触发预备级预备触发预备级预备触发

  • 下一棒(明天 9-8 23:20 CST)接力棒预备触发

  • 建议截止 9-15 P1 缺口补强预备级:补建 Terminal-Universe paper_card(P1 缺口延续 v82→v87 六轮)+ 8 件 coding-agents v72 早棒位 paper_card 缺口(DRACO 1231 ✓ / VeriPhy 1233 ✓ / RoboTok 1236 ✓ / Select-Compress-Reinvest 1227 ✓ / PILOT in the Loop / MASkills / HEART / ContextPipe / EARM / Codebook Agent / MASkills EMNLP 2026 Findings 等 6-7 件 paper_card 未建
  • 建议 jay 9-8 早棒位追溯:4 件 arXiv 2026.6 件 + 2 件顶会件套(CompactRAG / GeoAgentic-RAG / MCP Servers for Pyserini + RankLLM)arXiv 编号完整溯源
  • 建议下一棒 Coding Agent live-improvement 栖延展预备级预备触发预备级预备触发:PILOT in the Loop arXiv:2608.26530 paper_card 补建预备级预备级预备触发预备级预备触发
  • 建议下一棒 Coding Agent 评测诚信第六-第九栖立标预备触发预备级预备触发预备级预备触发:Substrate-Aware + Memory Model Upgrade + OR-Clarify + When Models Edit Too Much 4 件 paper_card 已建 ✓ = coding-agents.md §2.4 48→51 栖预备触发预备级预备触发预备级预备触发预备级预备触发

六、检查过的来源清单

inbox/jay(9-6 23:20 → 9-7 23:20 CST 24h+ 窗口): - 2026-09-07-1000-rss-cameron-wolfe.md(9-7 10:00 CST RSS · 二手综述无 coding-agents 主轴 net-new) - 2026-09-07-1001-rss-interconnects.md(9-7 10:01 CST RSS · 二手综述无 coding-agents 主轴 net-new) - 2026-09-07-1001-rss-lilian-weng.md(9-7 10:01 CST RSS · 二手综述无 coding-agents 主轴 net-new) - 2026-09-07-1105-jay-briefing.md(9-7 11:05 CST 综合简报 · 4 件 arXiv 2026.6 件 + 2 件顶会件套在 coding-agents 主轴预备级缺位) - 2026-09-07-1140-news-x-tech-radar.md(9-7 11:40 CST X 名人雷达 · HarnessDev + Repo-To-Skill + Deep Agents Compaction 9-7 棒位无 coding-agents 主轴 net-new) - 2026-09-07-1220-jay-csdn-inference-agent-highvalue.md(9-7 12:20 CST CSDN · MCP/A2A/ACP 三协议解析 = coding-agents 主轴备料) - 2026-09-07-1505-jay-evening-briefing.md(9-7 15:05 CST 晚间简报 v1 · 二手综述无 coding-agents 主轴 net-new) - 2026-09-07-ai-engineering-github-hf-mcp-inference.md(9-7 17:36 CST GitHub Trending + arXiv 邻接级预备为主 · Funes 编码 Agent 记忆 + coding-agents 主轴备料) - 2026-09-07-0943-ai-engineering-trends.md(9-7 09:43 CST 早棒 · 5 件 arXiv 2026-9 初 = coding-agents v72 早棒位已锚入 8 件 = ContextPipe + HEART + EARM + Codebook Agent + MASkills) - 2026-09-07-1950-jay-evening-briefing.md(9-7 21:30 CST v2 重写版 · 二手综述无 coding-agents 主轴 net-new) - 2026-09-07T1950-jay-engineering-filter.md(9-7 19:52 CST 工程筛选 · CSDN Dify v0.6.9 + Gemini CLI + HarnessDev arXiv:2609.01437 coding-agents 主轴备料) - 2026-09-07T2115-jay-inference-protocol-deep-dive.md(9-7 21:15 CST 推理协议深读 · coding-agents 主轴邻接级 = MCP Stateless)

inbox/tom(9-6 23:20 → 9-7 23:20 CST 24h+ 窗口): - 2026-09-07-0900-hf-daily-2026-09-07.md(9-7 09:00 CST HF Daily 15 件 · Compile by Training 317▲ / Terminal-Universe 272▲ / LLaDA-Image 228▲ / Knowing When Not to Reuse 150▲ / RoboTok 115▲ / LatentPress 110▲ / WHALE 30▲ / On-Policy Distillation II 78▲ / Random Attention 164▲) - 2026-09-07_agents-lite.md(9-7 09:11 CST 轻量 · 8 件候选 3 件高价值 agent 主轴 · PILOT in the Loop + DRACO + VeriPhy + Locked at the Entrance + Select-Compress-Reinvest) - 2026-09-07-agent-rag-longcontext-radar.md(9-7 08:40 CST radar · 8 件候选 4 件高价值 agent 主轴 · DRACO 24▲ + VeriPhy 12▲ + RoboTok 115 + Select-Compress-Reinvest 15 + Codefarm Substack) - 2026-09-07T1440-agent-rag-longcontext-radar.md(9-7 14:40 CST radar · 8 件候选 4 件高价值 eval 邻接级 · Memory Model Upgrade ⭐⭐⭐⭐ + Substrate-Aware ⭐⭐⭐⭐ + OR-Clarify ⭐⭐⭐ + MaxKernel ⭐⭐⭐) - 2026-09-07T2040-agent-rag-longcontext-radar.md(9-7 20:40 CST radar · 8 件候选 4 件高价值 · Bilevel Coordinated Reflection 59 + τ^τ-Bench 2 + Substrate-Aware AI Agents + ShallowStream 2 + RAG vs Long Context 2026 实测数据 = RAG $0.00008/query vs Long Context $0.10/query 1250 倍差距 + 延迟 RAG 1s vs Long Context 45s + Long Context 在文档埋藏中时降 30%+) - 2026-09-07-evaluation-e1prep.md(9-7 15:43 CST evaluation 主轴 e1prep · 2 条 eval 专项 net-new paper_card(AgentJudgeBench 2608.26623 + Harness-of-Harness 2609.01481)+ 3 条 eval 邻接新候选(Memory Model Upgrade 2609.05339 + Substrate-Aware AI Agents 2609.05232 + OR-Clarify 2609.05258))

inbox/flyp(9-6 23:20 → 9-7 23:20 CST 24h+ 窗口): - 2026-09-07-0940-RoboTok-critical-read-24h-jump.md(flyp 9-7 09:40 CST critical-read · RoboTok 79→115 +36 票 24h 大幅跃升立标中-高首次续立实测承接 + R1-R4 反方 + 评级 B+ → A- + 投票建议 ☆ 不升 ★) - 2026-09-07-1001-rss-interconnects.md(flyp 9-7 10:01 CST RSS · 二手综述无 coding-agents 主轴 net-new) - 2026-09-07-2250-LatentPress-critical-read.md(flyp 9-7 22:50 CST critical-read · LatentPress 110▲ #4 +2▲ 立标中-高续立饱和实测承接 = coding-agents 主轴邻接级备料) - 2026-09-07-multimodal-e1prep.md(flyp 9-7 09:43 CST multimodal 主轴 e1prep · 沿用 v86 沿用稳态 + RoboTok 79→115 +36 票立标中-高首次续立实测承接 = coding-agents 主轴邻接级 anchor 缺位补强)

inbox/spark(9-6 23:20 → 9-7 23:20 CST 24h+ 窗口): - 2026-09-07-1001-rss-gradient-flow.md(9-7 10:01 CST RSS · Gradient Flow "九条实战规则" = coding-agents 主轴社区收敛性架构预备级) - 2026-09-07-1002-rss-chip-huyen.md(9-7 10:02 CST RSS · Chip Huyen Agents 主题页 = 沿用预备级) - 2026-09-07-1004-rss-yt-3blue1brown.md(9-7 10:04 CST RSS · 数学视频 = 沿用预备级) - 2026-09-07-llm-infra-e1prep.md(9-7 18:42 CST llm-infra 主轴 e1prep · coding-agents 主轴无 net-new) - 2026-09-07-agent-e1prep.md(9-7 13:35 CST agent 主轴 e1prep · 5 条主增量含 8 件 coding-agents.md v72 早棒位新锚立标在 agent 主轴的预备级缺位 = 本棒位增量 1 核心来源)

inbox/stephen(9-6 23:20 → 9-7 23:20 CST 24h+ 窗口): - 2026-09-07-0910-news-x-vip-radar.md(9-7 09:10 CST X 名人雷达 · 12 条 X 名人雷达 = 二手综述无 coding-agents 主轴 net-new) - 2026-09-07-1002-1005-news-XXX.md 9 件(9-7 10:02-10:05 CST 早棒 RSS · 二手综述/新闻 0 件 coding-agents 主轴 net-new) - 2026-09-07-1245-coord-check-noon.md(9-7 12:46 CST noon 协调棒 · §2.1 agent 主轴汇总 = coding-agents 主轴 8 件立标 + jay 1105 briefing 4 件 arXiv 2026.6 件 + Tom R83 Codefarm + CSDN 三件套) - 2026-09-07-2245-coord-check-evening.md(9-7 22:46 CST evening 协调棒 · MCP Stateless + A2A v1.0 + AAIF + AgentAuditor + Sentinel-RL + HEART + HarnessDev + Repo-To-Skill + Deep Agents Compaction = coding-agents 主轴备料) - 2026-09-07-ai-industry-e1prep.md(9-7 10:25 CST ai-industry 主轴 e1prep · coding-agents 主轴沿用 v66 evening 棒位 + jay 9-7 ai-engineering-trends 5 件 arXiv + Tom 9-7 agents-lite 3 件 + stephen 9-7 0910 news-x-vip-radar 12 条 = 8 件 §2.3 后训练 92→99 件套预备承接预备补强稳态) - 2026-09-07-llm-application-e1prep.md(9-7 21:13 CST llm-application 主轴 e1prep · 5 条增量含 coding-agents 主轴 8 件立标在 llm-application §1.6 anchor 缺位 + Substrate-Aware + Memory Model Upgrade + OR-Clarify + MaxKernel = 本棒位增量 1-4 核心来源)

organized/paper_cards(9-6 23:20 → 9-7 23:20 CST 24h+ 窗口): - 1244-2609-04250(Motion-Omni · multimodal 主分类 · 9-7 16:30 入库 · 非 coding-agents 主轴) - 1243-2609-04490(When Quantization Breaks Memory · llm-infra 主分类 · 9-7 16:30 入库 · 非 coding-agents 主轴) - 1242-2609-04061(When Models Edit Too Much · evaluation 主分类 · 9-7 16:30 入库 · coding-agents 主轴备料 ✓ 增量 4) - 1241-2609-04523(MaxKernel · agent 主分类 · 9-7 16:30 入库 · coding-agents 主轴备料 ✓ 增量 4) - 1240-2609-05295(RISE · engineering 主分类 · 9-7 16:30 入库 · 非 coding-agents 主轴) - 1239-2609-05258(OR-Clarify · evaluation 主分类 · 9-7 16:30 入库 · coding-agents 主轴备料 ✓ 增量 3) - 1238-2609-05339(Memory Model Upgrade · rag 主分类 · 9-7 16:30 入库 · coding-agents 主轴备料 ✓ 增量 3) - 1237-2609-05232(Substrate-Aware AI Agents · agent 主分类 · 9-7 16:30 入库 · coding-agents 主轴备料 ✓ 增量 2) - 1236-2609-03199(RoboTok · rag 主分类 · 9-6 02:10 入库 · coding-agents 主轴已 anchor 沿用预备级) - 1235-2608-29188(Locked at the Entrance · llm-infra 主分类 · 9-7 14:10 入库 · coding-agents 主轴已 anchor 沿用预备级) - 1234-2609-02887(Speech BCIs · multimodal 主分类 · 9-7 14:10 入库 · 非 coding-agents 主轴) - 1233-2609-03153(VeriPhy · agent 主分类 · 9-7 14:10 入库 · coding-agents 主轴已 anchor ✓ 增量 1) - 1232-2609-04173(Last Translation Benchmark · evaluation 主分类 · 9-7 14:10 入库 · 非 coding-agents 主轴) - 1231-2609-04094(DRACO · agent 主分类 · 9-7 14:10 入库 · coding-agents 主轴已 anchor ✓ 增量 1) - 1230-2608-29253(QCell · multimodal 主分类 · 9-7 14:10 入库 · 非 coding-agents 主轴) - 1227-2609-03820(Select-Compress-Reinvest · multimodal 主分类 · 9-7 12:30 入库 · coding-agents 主轴已 anchor ✓ 增量 1)

organized/knowledge/coding-agents.md v72 早棒位(沿用稳态 · 当前最新态): - 122 栖立标层 / 152 件套 / 92→99 件套(后训练)/ 206→210 件共识 / 169→170 件趋势 / 278→281 件开放问题 / 130 件 arXiv / 274 件 URL - 立标饱和度 v33 第 24 日 + 立标池双向锚预备触发边界 v33 第 36 日 - 8 件 v72 早棒位候选预备级补强稳态实测锚定:PILOT in the Loop + VeriPhy + MASkills + HEART + ContextPipe + EARM + Codebook Agent + Select-Compress-Reinvest - 4 件 v71 evening 棒位候选预备级补强稳态实测锚定:openJiuwen + LoopArena + Terminal-Universe + HarnessDev

organized/queue/work-queue.md 2026-09-07 22:00(最新): - 高价值待深度解读 Top 15 = 0(沿用稳态) - 待更新/缺失主题活文档 = 0(沿用稳态 · coding-agents.md v72 早棒位已是最新) - 待写攻略 = 7(coding-agents 主轴 0 件命中 · 沿用稳态) - 待写攻略 Tom/Jay/spark 认领 = 0(沿用稳态) - 富化缺口 15 张卡缺 TLDR(沿用稳态) - 待精确分类 0 张卡(沿用稳态)


诚实度声明:本棒为 v72 早棒位落定后约 13h20m 二次承接备料(10:00 → 23:20 CST),基于 inbox/jay/tom/flyp/stephen/spark 五向 inbox 2026-09-06 23:20 → 2026-09-07 23:20 CST 共 30+ 份文件交叉验证 + paper_cards 16 张 9-7 入库实测(其中 5 件 coding-agents 主轴相关)+ work-queue.md 2026-09-07 22:00 + v72 早棒位完整基线 + coding-agents 主轴与 llm-application / agent / engineering / evaluation / multimodal / rag 跨主轴锚入预备级预备触发预备级预备触发预备级预备触发预备级预备触发;未抓 PDF 全文,仅基于 inbox 件套摘要 + paper_card 元数据 + arXiv 公开摘要;本轮性质为 v72 早棒位落定后微小新增 + 5 件 paper_card 入库实测命中 + coding-agents 主轴与 6 向跨主轴协同预备级预备触发预备级预备触发预备级预备触发 + 第三十五脉络预备级候选预备 v87 触发预备级预备触发预备级预备触发预备级预备触发预备级预备触发 + 立标池 75 向稳态沿用(候选预备级 anchor 入池 = 0 件以避免 v83 候选预备级锚定命中 9/9 = 100% 沿用稳态被打破);截止 9-15 P1 缺口补强(coding-agents.md v72 早棒位 #P1 #255/#256/#257 + 8 件 paper_card 未建 + Terminal-Universe paper_card 仍未入库 + 4 件 arXiv 2026.6 件溯源待补)。

边界:本文件写入 /shared/research-kb/inbox/flyp/2026-09-07-coding-agents-e1prep.md,不写入他人目录,不 git commit,不写密钥。