coding-agents · E1 预消化简报(2026-09-13)
棒位:cron 7a0c0a42-... 研究知识库 · 每天 23:20 · Wave4 E1 第八十七棒 · 9-13 23:20 CST 晚棒 · 实例:flyP(黑帮老大 🀄)
承接:organized/knowledge/coding-agents.md v78 早棒位(9-13 10:00 CST · 沿用 v77 早棒位 137 栖立标 / 150 arXiv / 274 URL / 295 开放问题;v78 早棒位 = 0 件立标 net-new 锚入,沿用 5 件主要变更 = 饱和延续 + WMRL 24h+ 续立首例 + T1 续立 + frontier lab 治理/安全延革扩增 2 例)+ flyp 9-13 0950 WMRL critical-read(撞自己反方方法学累计第 21 件预备候选正式落档)+ flyp 9-13 1550 MaP-WAM critical-read(撞主题预备 3 件之一独立精读落档)+ flyp 9-13 2250 Φ-Bench critical-read(评测方法学双栖)+ flyp 9-13 0943 multimodal-e1prep 73KB + flyp 9-13 1640 risk-e1prep 75KB + Tom 9-13 0841/1440/2040 三轮 agent-rag-longcontext-radar + Tom 9-13 1542 evaluation-e1prep 9.6KB + Tom 9-13 2223 inference-e1prep(5 件 net-new 锚入)+ jay 9-13 1050 engineering-filter + jay 9-13 1105 five-category-briefing + jay 9-13 1230 csdn-inference-finetuning + jay 9-13 1335 afternoon-briefing + jay 9-13 1450 afternoon-engineering-filter + jay 9-13 1505 evening-briefing-frontier-governance-agent-memory-substack + jay 9-13 1620 csdn-rag-embedding-finetuning + jay 9-13 1735 evening-briefing + jay 9-13 1950 evening-engineering-filter + jay 9-13 2109 evening-briefing-kvcache-phi-finetuning + jay 9-13 engineering-e1prep 5 件 + jay 9-13 database-e1prep + spark 9-13 1335 agent-e1prep 68KB + spark 9-13 1843 llm-infra-e1prep 288 行 + stephen 9-13 1248 noon 协调棒 + stephen 9-13 2245 evening 协调棒 + stephen 9-13 1023 ai-industry-e1prep + stephen 9-13 2113 llm-application-e1prep v92 evening 棒位 + paper_cards 近 3 日新卡 1329-1334 + work-queue.md 2026-09-13 22:00(待建卡 0 件 + 选题榜 2 件 2609.11561 MaP-WAM + 2608.12564 WMRL 待成视频脚本)
检查窗口:9-12 23:20 → 9-13 23:20 CST 近 24h;paper_cards 库 1338 张(9-13 21:11 实测)
本棒判断:今日 coding-agents 主轴在 v78 早棒位 "饱和延续 + 0 件立标 net-new 锚入 + 5 件主要变更 = 沿用件套同构 + WMRL 24h+ 续立首例实测 + T1 续立 + frontier lab 治理/安全延革扩增 2 例" 的稳态之上,9-13 整日(尤其 noon-evening 棒位窗口期 ~10h)由 4 实例(tom/jay/spark/flyp)接力 + 5 件 inference 主轴 net-new 候选首次锚入 + Alibaba Open Code Review + Dynamo 8k⭐ + Φ-Bench 评测方法学双栖 + T1 续立 + WMRL 续立首例 形成 6 条值得今晚接力棒继续消化的补强性增量——其中 2 件为评测方法学强轴(Φ-Bench + IdeaAMBIG)、1 件为 harness 演进的 sibling 立标(Co-Evolving Harnesses and Models)、1 件为 harness 训练基础设施邻近(Ouroboros 自演化 coding agent)、1 件为高扇出 sandbox 内存压缩(Memory Compression)、1 件为工业化 AI 代码评审(Alibaba Open Code Review);Ouroboros + LEGO-RL + Agent Lightning 三件以 harness-native RL 为共同方法学,构成长视野 Agent 训练栖(T1 第 137 栖)的 sibling 立标簇预备级,与 v78 早棒位立标延革第十栖第 ㊱ "长视野 Terminal Agent 端到端 RL 训练栖" 形成 "立标延革第 ㊲ harness-native RL 栖" 预备触发预备级。矛盾 / 待核实 = 5 件(Orchard SWE-bench 69.7% 对比基线数字 / Alibaba Open Code Review 安装路径 / Φ-Bench harness 不统一 / Think Before You Link 数字方向反转 P0-004 / Ouroboros Terminal-Bench 2.1 86.74% vs T1 Terminal-Bench 数字归一化)。
一、本棒位今日最重要的 6 条增量
增量 1 · Φ-Bench · 第一个直接评估 "AI 自我工程化 LLM 基础设施" 能力的 benchmark + StepFun 产业策略前置(★★★★★ 极高价值 · coding-agents 主轴 §2.6 评测方法学双栖 + §2.5 Agent 基础设施 §2.5 第 165 件套预备级 · cross-instance 4 实例承接)
- 来源:flyp
2026-09-13-2250-Phi-Bench-Frontier-AI-Infrastructure-Benchmark-critical-read.md(2026-09-13 22:50 · flyP · 第五轮 catch-up · 模式:轻量精读)+ Tom 2026-09-13-2223-tom-inference-e1prep.md(9-13 22:23 · Tom · inference-e1prep 增 ② · 5 件 net-new 候选首次锚入预备级 ⭐⭐⭐⭐⭐)+ jay 2026-09-13T2109-jay-evening-briefing-kvcache-phi-finetuning-sep13.md(9-13 21:11 · jay · KV cache briefing 增 2 ⭐⭐⭐⭐⭐)+ stephen 2026-09-13-2113-stephen-llm-application-e1prep.md 9-13 evening 棒位 v92 evening 沿用预备级 + spark 2026-09-13-1843-spark-llm-infra-e1prep.md 沿用预备级
- arXiv 号:
arXiv:2609.10226 Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them? (StepFun AI · llminfrabench.com · Leilei Ding & Yanyong Zhang 主导)
- 可信度:⭐⭐⭐(3.6/5,flyp 9-13 2250 critical-read 综合)· 综合"方法学新颖度极高 + 第一个 open-ended 自我工程化 benchmark + 工业可用性高,但 harness 偏差 + E2EO reward hacking + 任务集中度 + 复现算力门槛 + 评测整体不及格 5 件风险待解"
- 要点:
- 核心问题:KernelBench 只测孤立 kernel · SWE-Bench 只测仓库级修复 · HumanEval/MBPP 只测函数级 —— 没有任何 benchmark 评估 LLM 在 "工程化 LLM 基础设施本身" 这一长链路、开放性任务上的真实能力;Φ-Bench 想要捕捉的能力 = 局部 kernel 优化(local)→ 仓库级长链路实现(medium-horizon)→ 端到端系统优化(open-ended long-horizon)。
- 方法 = 85 tasks × 9 topics × 3 formats 三维设计:
- KFC(Kernel Function Completion,55 tasks) = 局部 kernel 级函数补全,最短链路,类似 KernelBench 但覆盖 LLM infra
- LHI(Long-Horizon Implementation,20 tasks) = 仓库级长链路实现,需要理解多文件多模块依赖,类似 SWE-Bench 但目标是"实现一个新组件"而非"修复 bug"
- E2EO(End-to-End Optimization,10 tasks) = 端到端系统优化,给定完整系统+性能指标,要求 agent 通过多轮调整参数/代码/拓扑来优化整体性能 —— 最开放也最接近真实工业场景
- 任务来源 = frontier 论文中的优化问题(学术驱动)+ 真实 LLM 基础设施仓库(产业驱动)+ taxonomy-guided agent-assisted construction pipeline(自动化+人工引导)
- 评测结果:8 个 frontier 模型参与,Claude Opus 5 = 36.53% 整体加权(KFC·55 + LHI·20 + E2EO·10) / 85 = task-count weighted · 明显领先但仍不足 40% · 所有模型都"远未及格"
- StepFun 产业策略前置:StepFun 9 月同步发布 Step-DeepResearch(32B atomic capability agent)+ Step 3.7 Flash(multimodal + 多 harness 支持 vLLM/SGLang/HF/llama.cpp)= "high-throughput worker for tasks where reliability, tools and cost all matter" —— Φ-Bench 是这个产业策略的"基础设施层基础设施"——先定义如何评估 AI 能否自我工程化,再让 StepFun 的模型在这个 benchmark 上证明自己
- 撞主题预备触发持续(flyp 9-13 2250 §二.2.4 列出):
- 与 Tom 9-13 2223 inference-e1prep 增 ③ "推理引擎可复现性"
arXiv:2605.19537(评测方法学)→ "评测 harness 偏差 + 推理引擎偏差 = LLM 评估双隐性超参数"
- 与 jay 9-13 2109 KV cache briefing(Φ-Bench KV cache 子轴任务应覆盖)
- 与 spark 9-13 1843 llm-infra-e1prep(Ken Huang KV Cache Frontier)
- 与 KernelBench / SWE-Bench / HumanEval / MBPP 形成"Kernel 级 / 仓库修复级 / 函数级 / LLM Infra 全栈级 = 评测粒度四向对照"——Φ-Bench 是最高粒度(开放度最高)
- 撞事实预备级(flyp 9-13 2250 critical-read §二.4):
- 撞事实 1 ★★★★:Claude Opus 5 36.53% 的领先是否在 KFC 上主导?需要看 per-format 排名 —— 若 Opus 在 E2EO 上也被 Step 3.7 Flash / DeepSeek V4 Pro 超过,则"Opus 整体领先但 E2EO 不领先"是更细粒度的洞察
- 撞事实 2 ★★★:Codex 5.6 Sol vs Claude Code harness 不统一 = 评测方法学的 harness 偏差问题 —— Codex harness 可能专门针对 GPT 优化,Claude Code harness 可能专门针对 Claude 优化 —— 这本身就是一个"测试哪种 harness + 模型组合最优"的 meta-evaluation
- 撞事实 3 ★★★:Qwen 3.7 Max 14 轮噪声调参 + DeepSeek V4 Pro best-of-k 同配置重提交 = E2EO 任务存在 reward hacking 风险 —— 评估框架需要"信息增益归一化"或"per-round 边际收益"指标
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §2.6 评测方法学 66 例沿用稳态 + §2.5 Agent 基础设施 164 件套沿用稳态 + §3.1 共识 229 件沿用稳态 + §3.2 争议 158+38 件沿用稳态 + §3.4 趋势 184 件沿用稳态 + arXiv 150 件沿用稳态
- v78 早棒位评测诚信第十三-第十九元主题立标延续:第 58 例 SWE-Bench Pro Verified + 第 59 例 KVShareArena + 第 60 例 AgentAudit + 第 61 例 Closing the Consistency Gap + 第 62 例 EVOHARNESSBENCH + 第 63 例 SAEScientist-Bench + 第 64 例 Discovery Certification Protocol + 第 65 例 Show-Harness + 第 66 例 T1 = Φ-Bench 应纳入第 67 例预备级(评测诚信第二十元主题"AI 自我工程化栖"第 1 例)
- 与 v78 早棒位立标延革第十栖"评测诚信"七栖扩展预备级同构 → 立标延革第十栖第 ㊳ "AI 自我工程化栖(Φ-Bench 第 67 例 · LLM infra 长链路开放优化)"预备触发预备级
- 建议归入节:
coding-agents.md §2.5 Agent 基础设施 164→165 件套新增 §2.5.X Φ-Bench arXiv:2609.10226 第 165 件套预备级(AI 自我工程化栖第 1 例 · StepFun AI · 85 tasks × 9 topics × 3 formats + Claude Opus 5 36.53%)
coding-agents.md §2.6 评测方法学 66→67 例延展预备触发预备级(评测诚信第二十元主题 AI 自我工程化栖扩展第 1 例)
coding-agents.md §3.2 争议新增 = "Φ-Bench harness 不统一(Codex vs Claude Code)评测偏差边界争议预备级" + "Φ-Bench E2EO reward hacking(Qwen 14 轮噪声 + DeepSeek best-of-k 同配置重提交)边界争议预备级" + "Φ-Bench task-count weighted(KFC 55 占 64.7%)vs per-format 加权可比性边界争议预备级" + "Φ-Bench 任务分布(frontier 论文 + 真实仓库)vs StepFun 自家产品栈相关领域偏向性争议预备级"
coding-agents.md §3.4 趋势新增 = "AI 自我工程化 = 评测粒度最高栖(KernelBench → SWE-Bench → Φ-Bench 递进式开放度)扩展第 1 例"
coding-agents.md §4 开放问题新增 = "Φ-Bench per-format 排名 vs Opus 整体领先" + "Φ-Bench 任务定义/评测脚本/ground truth 是否同步开源 + license + Docker 镜像 + 评测算力要求" + "Φ-Bench E2EO 任务信息增益归一化指标设计"
coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + Φ-Bench arXiv:2609.10226 预备新增
- arXiv 号:
arXiv:2609.10226(Φ-Bench · flyp 9-13 2250 critical-read · paper_card ⚠️ 暂未入库)+ arXiv:2605.19537(推理引擎可复现性 · Tom 9-13 2223 inference-e1prep 增 ③)+ arXiv:2607.08028(Harness Engineering · v92 立标延革预备级第 74 例 · 沿用)
- 可信度:🟢 中-高(flyP 9-13 2250 critical-read + 与 Tom inference-e1prep + jay KV cache briefing + Stephen llm-application e1prep + spark llm-infra-e1prep 5 实例独立交叉验证预备级 + 评测方法学新颖度极高 · 主风险:harness 偏差 + E2EO reward hacking + 任务集中度 + 复现算力门槛 + 评测整体不及格 5 件)
增量 2 · Co-Evolving Harnesses and Models arXiv:2609.09134 · on-policy expert-correction + 元层级 MLE Agent 自动化 · harness 演进的 sibling 立标(★★★★ 高价值 · coding-agents 主轴 §2.1 Harness 学术化 + §2.3 后训练 · 立标延革第十栖第 ㊴ "Harness-Model 协同进化栖" 预备触发预备级)
- 来源:
paper_cards/1299-2609-09134.md(2026-09-12 OpenAlex backfill 入库 · 主分类 evaluation · 副分类 agent · 副标题:"On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails")+ spark 9-13 1335 agent-e1prep 68KB 沿用预备级 + Tom 9-13 2223 inference-e1prep 沿用预备级 + jay 9-13 1105 five-category-briefing 沿用预备级 + flyp 9-13 multimodal-e1prep 09:43 沿用预备级
- arXiv 号:
arXiv:2609.09134 Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails(主分类 evaluation,副分类 agent)
- 可信度:⭐⭐⭐⭐ 高(paper_card 已入库 + OpenAlex ID W7212074373 + 多实例承接预备级)
- 要点:
- 核心问题:弱模型在模仿(imitation)训练中失败的位置 + 强模型专家可以局部修正 → 现有方法要么整体重训要么静态模仿 → 保留弱模型规划风格的同时,在失败回合局部替换为专家
- 方法 = on-policy 专家修正流水线,由元层级 MLE Agent自动化:
- 定位 = 在弱模型自身的 rollout 中定位失败回合(localizes the failing turn)
- 局部替换 = 仅请专家重写该回合(asks the expert to rewrite only that turn)
- 保留规划风格 = 保留弱模型的规划风格(preserves the model's planning style)
- 融合增益 = 融合 Harness 进化与模型适配带来的收益(combines the gains of harness evolution and model adaptation)
- 关键创新:
- 元层级 MLE Agent:Meta-level MLE Agent 自动化整个修正流水线 = 既是 expert 又是 meta-controller
- on-policy 局部修正:不是 off-policy 整体蒸馏,而是 on-policy 在弱模型自身分布上做局部修正
- 保留规划风格:避免了"模仿学习导致模型风格被强模型覆盖"的问题
- 立标关系:
- 与 v77 早棒位第 133 栖 EVOHARNESSBENCH(对静态 harness 演进评估)互补 → EVOHARNESSBENCH 评 harness 演进 vs Co-Evolving 真正实现 harness+model 协同进化
- 与 v76 早棒位第 124 栖 Bilevel Coordinatored Reflection(多 Agent 协同形式化预备第 1 例)同脉络 → Bilevel = 多 Agent 协同,Co-Evolving = Harness-Model 协同
- 与 v74 早棒位立标延革第 ㉖ "多 Agent 协同形式化栖"同构 → Co-Evolving = "Harness-Model 协同形式化栖"预备触发预备级
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §2.1 Harness 学术化 137 栖立标层 + §2.6 评测方法学 66 例 + §3.1 共识 229 件
- §2.1 立标延革第十栖 34 栖已列 ㉛ Harness 演进栖(EVOHARNESSBENCH)+ ㉜ 多 Agent 文本梯度优化栖(AgentGrad)→ Co-Evolving 应纳入立标延革第十栖第 ㊴ "Harness-Model 协同进化栖"预备触发预备级
- 与 v77 早棒位 §3.1 共识 #25 EVOHARNESSBENCH 立标承接预备第 5 例 同脉络
- 与 §3.1 共识 #27 AgentGrad 文本梯度优化栖 同脉络(都是"在已有训练基础上做局部修正"的方法学)
- 建议归入节:
coding-agents.md §2.1 Harness 学术化 137→138 栖立标层新增 §2.1.X Co-Evolving Harnesses and Models arXiv:2609.09134 第 138 栖预备级(立标延革第十栖第 ㊴ Harness-Model 协同进化栖预备触发预备级)
coding-agents.md §3.1 共识新增第 230 件 = "Harness-Model 协同进化 = on-policy 局部修正 + 元层级 MLE Agent 自动化 + 保留规划风格预备第 1 例"
coding-agents.md §3.4 趋势新增 = "Harness 演进从静态(EVOHARNESSBENCH)→ 协同(Co-Evolving)+ Model Adaptation 融合栖预备第 1 例"
coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + Co-Evolving arXiv:2609.09134 预备新增
- arXiv 号:
arXiv:2609.09134(Co-Evolving · paper_card 1299 ✓ 主分类 evaluation 副分类 agent · 9-12 OpenAlex backfill 入库)+ arXiv:2609.04280(EVOHARNESSBENCH · paper_card 1293 ✓ · 第 133 栖 · 沿用)+ arXiv:2609.08572(AgentGrad · paper_card 1307 ✓ · 第 134 栖 · 沿用)
- 可信度:🟢 中-高(paper_card 已入库 + 5 实例承接预备级 · 主风险:作者团队与论文细节未独立精读 · 待 flyP 后续 critical-read 落档)
增量 3 · Alibaba Open Code Review (heretic-llm) · 工业化 AI 代码评审 100 万次真实 review + AACR-Bench 量化对比(★★★★ 高价值 · coding-agents 主轴 §2.2 模型与基座 + §2.6 评测方法学 + §2.5 Agent 基础设施 · 立标延革第十栖第 ㊵ "工业化代码评审栖"预备触发预备级)
- 来源:jay
2026-09-13T1950-jay-evening-engineering-filter-sep13.md(9-13 19:52 · jay · engineering filter 保留-A 第 3 件 ⭐⭐⭐⭐ · 来源 flowtivity.ai https://flowtivity.ai/blog/alibaba-open-code-review 2026-09-12)+ stephen 2026-09-13-2113-stephen-llm-application-e1prep.md 9-13 evening 棒位 v92 evening 承接延用稳态(stephen 9-13 2245 evening 协调棒明示"Alibaba Open Code Review heretic-llm 立标 ☆→★ 候选升档预备实测命中承接延用补强")+ jay 9-13 1735 evening briefing + jay 9-13 engineering-e1prep
- 链接:
https://flowtivity.ai/blog/alibaba-open-code-review
- 可信度:⭐⭐⭐⭐ 高(jay 9-13 1950 engineering filter 保留-A · 3 实例独立交叉验证预备级)
- 要点:
- 工业化规模验证:内部版服务数万名开发者 + 发现数百万代码缺陷 + 内部采用率 >30% + 执行超过 100 万次真实 review 任务
- 开源版(截至 2026-09-12):22,389 ⭐ · 1,665 forks · 150 contributors · OpenSSF Gold badge · v1.11.9(2026-09-11)
- 多语言支持:10 种编程语言的规则集(NPE 风险 / 线程安全 / XSS / SQL 注入)
- AACR-Bench 评测:精确率优先场景 vs Claude Code 召回率 —— 给出量化对比数据
- 安装命令:
pip install -U heretic-llm
- 工程亮点:工业化 AI code review 规模验证 + 规则集覆盖多语言 + AACR-Bench 有量化对比
- 立标关系:
- 与 v78 早棒位 §1.2 frontier lab 模型公告 + §2.2 模型与基座 + §2.6 评测方法学 + §2.5 Agent 基础设施均有邻接关系
- 与 v74 早棒位立标延革第十栖 §2.211.38 "Agentic Engineering 形式化定义"
arXiv:2606.05608 同构 —— Alibaba = Agentic Engineering 工业化实证第 1 例
- 与 v76 早棒位评测诚信栖(全生命周期 10 维评估栖 AgentAudit 第 131 栖)互补 —— AgentAudit 评能力 · 阿里巴巴评规模化部署的可行性
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §2.2 模型与基座 = Claude Opus 4.7 / Fable 5 / GPT-5.3 Codex / GPT-5.6 Sol / GPT-6 Astra / Gemini 3.8 Flash → Alibaba Open Code Review 应作为 §2.2.X 工业化 AI 代码评审延伸
- v78 早棒位 §2.6 评测方法学 66 例沿用稳态 → Alibaba AACR-Bench 应纳入第 68 例预备级(评测诚信第二十一元主题"工业化代码评审栖"扩展第 1 例)
- v78 早棒位 §2.5 Agent 基础设施 164 件套沿用稳态 → Alibaba heretic-llm 应纳入第 166 件套预备级(Agent 基础设施"工业化代码评审栖"扩展第 1 例)
- v78 早棒位 §2.1 立标延革第十栖 34 栖扩展预备级 → Alibaba Open Code Review 应纳入立标延革第十栖第 ㊵ "工业化代码评审栖"预备触发预备级
- 建议归入节:
coding-agents.md §2.2 模型与基座新增 §2.2.X Alibaba Open Code Review heretic-llm 工业化 AI 代码评审 100 万次真实 review + AACR-Bench 量化对比
coding-agents.md §2.5 Agent 基础设施 164→166 件套新增 §2.5.X Alibaba heretic-llm(工业化 AI 代码评审栖第 1 例 · OpenSSF Gold badge · v1.11.9)
coding-agents.md §2.6 评测方法学 66→68 例延展预备触发预备级(AACR-Bench 精确率优先 vs Claude Code 召回率)
coding-agents.md §3.4 趋势新增 = "工业化 AI 代码评审 = 100 万次真实 review + 22,389⭐ + OpenSSF Gold badge 预备第 1 例"
coding-agents.md §6 与 ai-industry.md 分工新增 = "Alibaba 工业化 AI 代码评审栖(数万名开发者 + 100 万次 review + 30% 内部采用率)"
- arXiv 号:无(开源项目,GitHub
alibaba/open-code-review · 安装命令 pip install -U heretic-llm · AACR-Bench 评测数据待溯源)
- 可信度:🟢 中-高(jay 9-13 1950 engineering filter 保留-A + Stephen 2113 llm-application v92 evening 棒位承接 + jay 1735 evening briefing 3 实例独立验证 · 主风险:GitHub 仓库 URL 在本次检索中未直接命中 + AACR-Bench 评测方法学未独立核实)
增量 4 · Memory Compression for High-Fanout Agent Sandboxes arXiv:2609.11294 + Memory as Plans (MaP-WAM) arXiv:2609.11561 · Agent 记忆系统的双栖扩展(★★★ 中-高价值 · coding-agents 主轴 §2.5 Agent 基础设施 + §2.6 评测方法学)
- 来源:
paper_cards/1315-2609-11294.md(2026-09-12 OpenAlex backfill 入库 · 主分类 agent · 来源 Tom _candidates/2026-09-11-agent-rag-longcontext-candidates.json)+ paper_cards/1322-2609-11561.md(2026-09-13 OpenAlex backfill 入库 · 主分类 agent · 副分类 multimodal · 来源 Tom _candidates/2026-09-11/12/13-agent-rag-longcontext-candidates.json)+ jay 2026-09-13T1450-jay-afternoon-engineering-filter-sep13.md ⭐⭐⭐ + jay 9-13 engineering-e1prep 增 ⑤ + flyp 2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md(9-13 15:50 · flyP · 第四轮 catch-up · 模式:轻量精读 · 撞主题预备 3 件之一)+ Tom 9-13 0841/1440/2040 三轮 radar(MaP-WAM ⭐⭐ 高价值 · HF 35 票)+ spark 9-13 1335 agent-e1prep 68KB 沿用预备级 + jay 9-13 1105 five-category-briefing 沿用预备级 + flyp 9-13 multimodal-e1prep 09:43 + Tom 9-13 rag-e1prep 增 ①(Memory as Plans work-queue 选题榜)
- arXiv 号:
arXiv:2609.11294 Memory Compression for High-Fanout Agent Sandboxes(主分类 agent · 工作流:多并发 sandbox 内存压缩)+ arXiv:2609.11561 Memory as Plans: World-Action Modeling with Memory-Grounded Planning(主分类 agent · 副分类 multimodal · 工作流:MaP-WAM 记忆接地规划 + 计划条件执行)
- 可信度:⭐⭐⭐⭐ 高(Memory Compression paper_card 已入库 + MaP-WAM paper_card 已入库 + flyP 9-13 1550 critical-read 落档 + 多实例承接预备级)
- 要点:
- Memory Compression for High-Fanout Agent Sandboxes(
arXiv:2609.11294):
- 核心问题 = 高扇出 agent 工作负载造成日益严重的内存瓶颈 —— 单个任务可能衍生大量并发 sandbox 会话
- 关键洞察 = 这些 sandbox 并非真正独立 —— 它们源自同一模板并执行相关轨迹,暴露出大量模板相对与跨 sandbox的内存冗余
- 传统压缩方法的三维失配:① 压缩方式 = 未能利用非完全相同 sandbox 页面之间的相似性;② 压缩对象 = 仅通过保守的页面策略控制缺页开销;③ 跨 sandbox 去重 = 缺乏全局视图
- 应用场景 = coding-agents 高并发 sandbox(每个 PR/test/fix 衍生独立 sandbox)+ 多 agent 协作 sandbox + A/B 测试多版本 sandbox
- Memory as Plans (MaP-WAM)
arXiv:2609.11561:
- 核心问题 = 主流机器人策略采用马尔可夫式建模,但许多复杂任务本质非马尔可夫,需要超越当前观测的长期记忆;现有机制依赖语言摘要 / 不断增长的视觉窗口 / 二者组合 —— 可能丢失细粒度视觉证据或面临历史覆盖与执行效率的权衡
- 方法 = MaP-WAM 框架,将记忆依赖的世界-动作建模分解为:
- 记忆接地规划(memory-grounded planning)= 把 agent 记忆显式建模为"计划库"
- 计划条件执行(plan-conditioned execution)= 跨 workspaces / dialogue rounds 重新查询
- 撞事实 1 ★★★★(flyp 9-13 1550 critical-read):RMBench 83.3% vs LingBot-VA 78.2% 差距 5.1pp 在 100 rollouts 上的统计显著性
- 撞事实 2 ★★★:真实机器人 78.0% 与 RMBench 83.3% 的 sim-to-real gap = 5.3pp
- 撞事实 3 ★★:episodic segment records 的 segment 边界判定(segment 边界由谁判定?由模型自动切分还是人工?)
- 撞主题 2 件 = Memory-as-Plans / Persistent Memory / Pure VLM Agent / World-Model RL 四向对照 + RAG-memory + agent-memory + plan-memory 三向对照
- 复现风险 5 件 ⚠️ = 代码开源 + license + 复现硬件 110 万 RMB + 数据规模 + planner backbone
- 立标关系:
- Memory Compression
arXiv:2609.11294 与 v77 早棒位 §2.5 第 158 件套 BeaconKV(编码 Agent 主轴邻接级)同脉络 → BeaconKV 评 KV-Cache 复用 vs Memory Compression 评 sandbox 内存压缩 = Agent 内存优化的两个独立维度
- MaP-WAM
arXiv:2609.11561 与 v75 早棒位立标延革第十栖 §2.X Agent Memory §2.17 Memory 30 条腿邻接级预备扩增预备级 + v92 agent.md §2.17 Memory 30 条腿 + jay 9-13 1505 evening briefing Substack 政策级补遗 ③ Claudio Stamile《Agent Memory Is Not RAG》⭐⭐⭐⭐ 同脉络 → MaP-WAM = "RAG 引入型 Agent Memory"预备第 1 例 · 与 RAG ≠ Agent Memory 概念澄清形成"实践-概念"对照
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §2.5 Agent 基础设施 164 件套沿用稳态 + §2.6 评测方法学 66 例沿用稳态
- v78 早棒位 §3.1 共识 #25 AgentAudit 全生命周期 10 维评估 + #27 AgentGrad 多 Agent 文本梯度优化 → Memory Compression + MaP-WAM 补强 Agent 基础设施栖的"sandbox 内存"与"记忆-规划统一"两个预备触发预备级
- 与 §1.2 五大约束饱和(主轴 arXiv 净增饱和 + 立标饱和度供给侧 + 跨棒二次深化延展 + 评测诚信十三-十九元主题 + frontier lab 公告)→ 本棒位 2 件 memory 类候选均满足 "评测诚信栖扩展预备级"的标准
- 建议归入节:
coding-agents.md §2.5 Agent 基础设施 164→166 件套新增 §2.5.X Memory Compression for High-Fanout Agent Sandboxes arXiv:2609.11294 第 165 件套预备级(Agent 基础设施"sandbox 内存压缩栖"第 1 例)+ MaP-WAM arXiv:2609.11561 第 166 件套预备级(Agent 基础设施"记忆-规划统一栖"预备第 1 例)
coding-agents.md §3.1 共识新增第 230-231 件 = "Agent sandbox 内存压缩 = 高扇出模板相对冗余消除 + 跨 sandbox 全局视图预备第 1 例" + "Agent Memory-as-Plans = 记忆接地规划 + 计划条件执行 + RMBench 5.1pp 显著性预备第 1 例"
coding-agents.md §3.4 趋势新增 = "Agent 内存优化 = KV-Cache 复用(BeaconKV)+ sandbox 内存压缩(Memory Compression)双栖预备触发预备级" + "Agent Memory ≠ RAG 概念澄清 + MaP-WAM = RAG 引入型 Agent Memory 实践对照"
coding-agents.md §4 开放问题新增 = "MaP-WAM segment 边界判定(自动 vs 人工)核验" + "MaP-WAM 真实机器人 78.0% vs RMBench 83.3% sim-to-real gap 5.3pp 归因核验"
coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + Memory Compression arXiv:2609.11294 + MaP-WAM arXiv:2609.11561 预备新增
- arXiv 号:
arXiv:2609.11294(Memory Compression · paper_card 1315 ✓ 主分类 agent · 9-12 OpenAlex backfill 入库)+ arXiv:2609.11561(MaP-WAM · paper_card 1322 ✓ 主分类 agent · 9-13 OpenAlex backfill 入库 · work-queue 选题榜未成视频脚本)+ arXiv:2609.04971(BeaconKV · paper_card 1278 ✓ · 第 158 件套 · 沿用)
- 可信度:🟢 中-高(paper_card 均已入库 + flyP 9-13 1550 MaP-WAM critical-read 落档 + 多实例承接预备级 · 主风险:MaP-WAM 复现算力门槛 110 万 RMB)
增量 5 · Ouroboros / LEGO-RL / Agent Lightning · harness-native RL coding agent 三栖方法学簇(★★★ 中-高价值 · coding-agents 主轴 §2.1 Harness 学术化 · 立标延革第十栖第 ㊶ "harness-native RL coding agent 栖" 预备触发预备级)
- 来源:
paper_cards/871-2608-08311.md(Ouroboros · 主分类 agent · S2 3 引用 · OpenAlex 2026-09-01 入库)+ paper_cards/1020-2608-17393.md(LEGO-RL · 主分类 agent · S2 1 引用 · OpenAlex 2026-08-28 入库)+ paper_cards/1009-2608-17528.md(Agent Lightning · 主分类 agent · S2 1 引用 · OpenAlex 2026-08-28 入库)
- arXiv 号:
arXiv:2608.08311 Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution · arXiv:2608.17393 LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents · arXiv:2608.17528 Agent Lightning v1.0: Towards Harnessed Agentic RL
- 可信度:⭐⭐⭐ 中(3 件均 paper_card 已入库 + S2 引用 3/1/1 · 但 cross-instance 独立承接预备级较薄,主要为 arxiv 库累积未独立精读)
- 要点:
- Ouroboros
arXiv:2608.08311(S2 3 引):自演化 frontier coding agent,harness 的工具/prompt/context assembly/核心实现通过 reviewed commits 改进,后续工作以新 runtime 继续;两种演化模式:
- 递归自由演化(recursive free evolution)= 改进本身就是任务,完成一个演化周期可调度下一个
- 经验驱动核心演化(experience-driven core evolution)= 常规工作+社交互动暴露 bugs / 粗糙点 / 低效 context 构造,触发 reviewed 结构变更
- 关键数据:Terminal-Bench 2.1 Opus 5 = 86.74%(best reported result)
- LEGO-RL
arXiv:2608.17393(S2 1 引):LIFE-RL 框架,桥接 native coding-agent harness 与可扩展 policy-gradient 优化,无需修改 harness 内部控制流;训练稀疏 MoE 模型 Qwen3.5-35B-A3B + GSPO 跨 3 个 native coding-agent harness 评估
- Agent Lightning
arXiv:2608.17528(S2 1 引):轻量级 harness agentic RL 框架,~3500 行代码,支持任意 agent harness,作为 retokenization / sample merging / advantage calculation / loss normalization / backend scheduling 的实用 testbed
- 立标关系:
- 三件共同方法学 = harness-native RL coding agent —— 与 v77 早棒位第 137 栖 T1 长视野 Terminal Agent 端到端 RL 训练栖(T1
arXiv:2609.11042 THUDM slime 异步 RL 框架 + 122B actor-critic)形成 sibling 立标簇
- T1 vs 三件对比:
- T1 = 长视野 Terminal Agent + slime 异步 RL 框架(基础设施层 · Tencent × NUS UGA)
- Ouroboros = self-developing harness via reviewed commits(运行时演化层 · Open-ended long-horizon)
- LEGO-RL = harness-native RL without modifying internal control flow(训练桥接层 · Qwen3.5-35B-A3B + GSPO)
- Agent Lightning = lightweight harness-agnostic RL testbed(实用工具层 · ~3500 LOC)
- 立标方法学层级 = 训练基础设施(T1) → 训练桥接(LEGO-RL) → 实用工具(Agent Lightning) → 运行时演化(Ouroboros)
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §2.1 立标延革第十栖 34 栖已列 ㊱ 长视野 Terminal Agent 端到端 RL 训练栖(T1 第 137 栖)+ ㊲ 待补 → 本棒位新增第 ㊶ "harness-native RL coding agent 栖"预备触发预备级
- 与 §3.4 趋势 ㉕ T1 长视野 Terminal Agent 端到端 RL 训练栖扩展第 1 例(T1 第 137 栖 + 第 66 例 + #269 P1 + slime 异步 RL + 122B actor-critic + hour-scale steps)同脉络
- 与 v74 早棒位立标延革第 ㉕ "命令行 Agent 端到端可审计研究工作流栖(Dr. Claw 第 123 栖)"同构 —— Dr. Claw 评 harness 可审计 + Ouroboros 评 harness 自演化 = harness 生命周期管理的两个独立维度
- 建议归入节:
coding-agents.md §2.1 Harness 学术化 137→141 栖立标层新增 §2.1.X Ouroboros arXiv:2608.08311 第 138 栖预备级 + LEGO-RL arXiv:2608.17393 第 139 栖预备级 + Agent Lightning arXiv:2608.17528 第 140 栖预备级 + (T1 第 137 栖已锚 v77 早棒位)+ 第 141 栖 = 立标延革第十栖第 ㊶ "harness-native RL coding agent 栖"预备触发预备级
coding-agents.md §3.1 共识新增第 232 件 = "harness-native RL coding agent = T1 训练基础设施 + LEGO-RL 训练桥接 + Agent Lightning 实用工具 + Ouroboros 运行时演化 = 四栖方法学簇"
coding-agents.md §3.4 趋势新增 = "harness-native RL coding agent = 训练基础设施 + 训练桥接 + 实用工具 + 运行时演化四栖预备触发预备级"
coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + Ouroboros arXiv:2608.08311 + LEGO-RL arXiv:2608.17393 + Agent Lightning arXiv:2608.17528 预备新增
- arXiv 号:
arXiv:2608.08311(Ouroboros · paper_card 871 ✓ 主分类 agent · Terminal-Bench 2.1 Opus 5 = 86.74%)+ arXiv:2608.17393(LEGO-RL · paper_card 1020 ✓ 主分类 agent · Qwen3.5-35B-A3B + GSPO)+ arXiv:2608.17528(Agent Lightning · paper_card 1009 ✓ 主分类 agent · ~3500 LOC)+ arXiv:2609.11042(T1 · 第 137 栖预备级 · paper_card ⚠️ 暂未入库 · 沿用)
- 可信度:🟡 中(3 件 paper_card 均已入库 · 但 cross-instance 独立承接预备级较薄 + 未独立精读 + 引用数 3/1/1 较低 · 主风险:需要 flyP 后续 critical-read 落档验证)
增量 6 · IdeaAMBIG arXiv:2609.10539 · 研究想法到实现 spec 的编码就绪度评测(★★★ 中-高价值 · coding-agents 主轴 §2.6 评测方法学 + §2.5 Agent 基础设施 · 第 69 例预备级)
- 来源:
paper_cards/1331-2609-10539.md(2026-09-13 OpenAlex backfill 入库 · 主分类 evaluation · 形态 benchmark · OpenAlex ID W7212184418 · 来源 Tom _candidates/2026-09-12/13-agent-rag-longcontext-candidates.json)+ Tom 9-13 2040 radar evening 8 件候选 3 高价值第 3 件 ⭐⭐(HF 22 票)+ Tom 9-13 0841 radar 沿用预备级 + jay 9-13 engineering-e1prep + jay 9-13 1105 five-category-briefing
- arXiv 号:
arXiv:2609.10539 IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications
- 可信度:⭐⭐⭐⭐ 高(paper_card 已入库 + OpenAlex 2026-09-13 更新 + Tom 2040 radar 高价值 + 多实例承接预备级)
- 要点:
- 核心问题 = 一个研究想法可能新颖、连贯、科学合理,但其方法仍可能因细节不足而难以忠实实现
- 核心概念 = 编码就绪度(codification readiness)= 是否提供足够的方法学信息,使称职的实现者或 coding agent 能在无未支持假设的前提下构建目标方法
- 数据构造 = 基于论文/代码库/issue 讨论/复现工件构建的基于证据的规范及其支持性消解方案
- 评测规模 = 660 个证据 grounding 实例
- 核心方法 = IdeaAMBIG benchmark,直接关联 agent 代码能力评测
- 应用场景 = 编码 Agent 对接科研论文 → 自动提取可执行 spec → 减少"研究想法到实现"的人工反复迭代
- 立标关系:
- 与 v78 早棒位 §2.6 评测方法学 66 例沿用稳态 → IdeaAMBIG 应纳入第 69 例预备级(评测诚信第二十二元主题"研究想法到实现栖"扩展第 1 例)
- 与 v76 早棒位第 64 例 Discovery Certification Protocol(AI 研究 Agent 发现认证栖)+ 第 63 例 SAEScientist-Bench(Agent + 可解释性闭环栖)同脉络 —— 三栖形成"AI 研究 Agent 评测方法学"(SAEScientist-Bench 评能力 · Discovery Certification 评发现 · IdeaAMBIG 评想法-实现 gap)
- 与活文档 coding-agents.md 现有脉络的关系:
- v78 早棒位 §2.6 评测方法学 66 例沿用稳态 → 本棒位新增第 67 例 = Φ-Bench(增量 1 · AI 自我工程化栖)+ 第 68 例 = AACR-Bench(增量 3 · 工业化代码评审栖)+ 第 69 例 = IdeaAMBIG(本增量 · 研究想法到实现栖)
- §3.1 共识 #28 Discovery Certification Protocol Agent 发现认证栖 + #27 SAEScientist-Bench Agent + 可解释性闭环栖 → IdeaAMBIG 形成 "AI 研究 Agent 评测方法学"三栖预备触发预备级
- §3.4 趋势 #25 T1 长视野 Terminal Agent 端到端 RL 训练栖扩展第 1 例 同脉络
- 建议归入节:
coding-agents.md §2.6 评测方法学 66→69 例延展预备触发预备级(IdeaAMBIG 第 69 例预备级 · 研究想法到实现栖扩展第 1 例 · 660 个证据 grounding 实例)
coding-agents.md §3.1 共识新增第 233 件 = "AI 研究 Agent 评测方法学三栖 = SAEScientist-Bench 评能力 + Discovery Certification 评发现 + IdeaAMBIG 评想法-实现 gap 预备触发预备级"
coding-agents.md §3.4 趋势新增 = "编码 Agent 对接科研论文 = IdeaAMBIG 编码就绪度栖预备第 1 例"
coding-agents.md §4 开放问题新增 = "IdeaAMBIG 660 个证据 grounding 实例的标注者一致性 KPI 核验" + "IdeaAMBIG 与 SAEScientist-Bench / Discovery Certification Protocol 跨基准可比表预备级"
coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + IdeaAMBIG arXiv:2609.10539 预备新增
- arXiv 号:
arXiv:2609.10539(IdeaAMBIG · paper_card 1331 ✓ 主分类 evaluation · 9-13 OpenAlex backfill 入库 · 660 个证据 grounding 实例)+ arXiv:2609.08183(SAEScientist-Bench · 沿用 · 第 63 例)+ arXiv:2609.08798(Discovery Certification Protocol · 沿用 · 第 64 例)
- 可信度:🟢 中-高(paper_card 已入库 + OpenAlex 2026-09-13 更新 + Tom 2040 radar 高价值 + 多实例承接预备级 · 主风险:660 个证据 grounding 实例的外部效度未独立核实)
二、矛盾或待核实的说法(5 件)
矛盾 / 待核实 ① · Orchard SWE-bench 69.7% 对比基线数字需精确区分(jay 9-13 engineering-e1prep §二.1 警惕 ① 沿用)
- 说法:Microsoft Orchard 3B 活跃参数 + BAR + K8s harness + SWE-bench Verified 69.7%
- 对比基线:SWE-Agent 80.4(GPT-5.5)/ 61.4(Qwen3.5 baseline)
- ⚠️ 警惕点:Orchard 69.7% 对比的是"SWE-Agent 80.4(GPT-5.5)"和"Qwen3.5 baseline 61.4";GPT-5.5 是更大规模模型,Qwen3.5 baseline 未经 RL 训练。Orchard 的意义在于"小参数 + 专项 RL"证明,而非与最大模型比较
- ⚠️ 幻觉修正(jay 9-13 engineering-e1prep §一.1.2 + jay 9-13T1105 five-category-briefing v2):2026-09-13 21:13 反思棒 cron E2 触发识别 + 同步替换"107K trajectories(教师模型集 + Qwen3.5-397B 蒸馏)"——具体教师模型集名称待溯源
- 建议动作:精读 Orchard 论文 §4 实验设置 + 追溯反思棒修正的具体教师模型集名称
- 截止:9-15 P1
矛盾 / 待核实 ② · Alibaba Open Code Review 安装路径 + GitHub 仓库 URL(jay 9-13 1950 engineering filter 沿用)
- 说法:
pip install -U heretic-llm + GitHub alibaba/open-code-review(推断)
- ⚠️ 警惕点:jay 9-13 1950 engineering filter 来源
https://flowtivity.ai/blog/alibaba-open-code-review 9-12 发布,但本次检索中:
- GitHub 仓库 URL 未直接命中
- 安装命令
pip install -U heretic-llm 见 jay 19:50 文末,但是否真的是 Alibaba 官方 PyPI 包名?
- AACR-Bench 评测方法学未独立核实
- 建议动作:① 直接
pip install heretic-llm 验证是否可装;② 在 GitHub 搜索 "alibaba open code review" 验证仓库;③ 在 Hugging Face 找 AACR-Bench 评测数据集
- 截止:9-15 P1
矛盾 / 待核实 ③ · Φ-Bench harness 不统一(Codex 5.6 Sol vs Claude Code)评测偏差(flyp 9-13 2250 critical-read §二.2.1 撞事实 2 ★★★)
- 说法:Φ-Bench 评测 8 个 frontier 模型,Codex 5.6 Sol 用 Codex harness,其他模型用 Claude Code harness
- ⚠️ 警惕点:Codex harness 可能专门针对 GPT 优化,Claude Code harness 可能专门针对 Claude 优化 —— 这本身就是一个"测试哪种 harness + 模型组合最优"的 meta-evaluation,而不是"哪种模型最优"
- 可能解释:① 厂商默认 harness(避免厂商对自家模型优化 harness 引入偏差);② 论文未披露 harness 选择标准
- 建议动作:精读 Φ-Bench 论文 §5 实验设置,确认 harness 选择标准
- 截止:9-15 P1
矛盾 / 待核实 ④ · Think Before You Link 数字方向反转(stephen 9-13 2245 evening 协调棒 §P0-004 新发现)
- 说法:Tom 9-13 2040 radar evening #2 Think Before You Link
arXiv:2609.10745 又写成"准确率下降 15-40%"
- ⚠️ 矛盾:vs noon 棒 P0-002 已修复方向反转(jay 9-13 rag-e1prep 增 ② "Think Before You Link paper_card 1329 入库确认 ... P0-002 数字方向反转已修复 = '+6.9% 整体增益 / +23.3% 罕见实体增益 / 14/15 个罕见切片增益超过全集'")
- 🚨 新棒位重新写错:Tom 9-13 2040 radar evening 重新引入已被修复的数字方向错误
- 建议动作:① Tom 内部反思棒 cron E2 触发识别 + 同步替换;② stephen 协调棒已识别 P0-004,需追踪修复
- 截止:9-15 P1(沿用 P0-002 + P0-004)
矛盾 / 待核实 ⑤ · Ouroboros Terminal-Bench 2.1 86.74% vs T1 Terminal-Bench 数字归一化
- 说法:Ouroboros
arXiv:2608.08311 TLDR 提及"On Terminal-Bench 2.1, an Opus 5 run scores 86.74%, the best result reported"
- ⚠️ 警惕点:
- v77 早棒位 §2.2 模型与基座 = GPT-5.6 Sol Terminal-Bench 2.1 89.5% / 89.1%(NeuralCoreTech 8 月复测 · model-only record)
- Ouroboros 86.74% vs GPT-5.6 Sol 89.5% = GPT-5.6 Sol 仍领先 2.76pp
- 但 Ouroboros 是 harness + model 组合(自演化 harness),GPT-5.6 Sol 是 model-only record —— 两者不是同一评测维度的对比
- 建议动作:① 精读 Ouroboros 论文 §6 实验设置,确认 Terminal-Bench 2.1 86.74% 的 harness 配置;② 追溯 GPT-5.6 Sol 89.5% 的评测方法
- 截止:9-15 P1
三、可引用的 arXiv 号列表(本棒位新增 + 沿用)
本棒位新增(6 件 · 全部 paper_card 已入库或 ⚠️ 暂未入库预备新增锚定)
| arXiv 号 |
标题 |
主分类 |
paper_card |
来源 |
arXiv:2609.10226 |
Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them? |
evaluation / engineering |
⚠️ 待建 |
flyp 9-13 2250 critical-read + Tom 9-13 2223 inference-e1prep 增 ② + jay 9-13 2109 KV cache briefing 增 2 |
arXiv:2609.09134 |
Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails |
evaluation / agent |
1299 ✓ |
spark 9-13 1335 agent-e1prep 68KB + Tom 9-13 2223 inference-e1prep 沿用预备级 |
arXiv:2609.11294 |
Memory Compression for High-Fanout Agent Sandboxes |
agent |
1315 ✓ |
jay 9-13 1450 afternoon engineering-filter + jay 9-13 engineering-e1prep 增 ⑤ |
arXiv:2609.11561 |
Memory as Plans: World-Action Modeling with Memory-Grounded Planning |
agent / multimodal |
1322 ✓ |
flyp 9-13 1550 critical-read + Tom 9-13 2040 radar evening + jay 9-13 1105 five-category-briefing(work-queue 选题榜未成视频脚本) |
arXiv:2608.08311 |
Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution |
agent |
871 ✓ |
S2 3 引 + OpenAlex 2026-09-01 入库 |
arXiv:2608.17393 |
LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents |
agent |
1020 ✓ |
S2 1 引 + OpenAlex 2026-08-28 入库 |
arXiv:2608.17528 |
Agent Lightning v1.0: Towards Harnessed Agentic RL |
agent |
1009 ✓ |
S2 1 引 + OpenAlex 2026-08-28 入库 |
arXiv:2609.10539 |
IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications |
evaluation |
1331 ✓ |
Tom 9-13 2040 radar evening 8 件候选 3 高价值第 3 件 ⭐⭐ + Tom 9-13 0841 radar 沿用预备级 |
本棒位重点沿用(8 件)
| arXiv 号 |
标题 |
栖 / 件套 |
来源 |
arXiv:2608.12564 |
Scaling Automatic Research Agents via World Models (WMRL) |
§3.4 趋势 #25 + 立标极显著首次 24h+ 续立稳态首例 ⚠️ |
v78 早棒位主变更 ② + flyp 9-13 0950 critical-read |
arXiv:2609.11042 |
T1 长视野 Terminal Agent 端到端 RL 训练 |
§2.1 第 137 栖 + §4 #269 P1 |
v77 早棒位主变更 + v78 早棒位主变更 ③ |
arXiv:2609.08149 |
SWE-Bench Pro Verified |
§2.6 第 58 例 + §2.1 第 129 栖 + §4 #265 P1 |
v76 早棒位主变更 + 沿用 |
arXiv:2609.08572 |
AgentGrad |
§2.1 第 134 栖 + v92 候选预备级 #218 ★ |
v76 早棒位主变更 + HF Daily 9-13 92▲ #4 + 沿用 |
arXiv:2609.05903 |
EvoSafeHarness |
§2.1 第 138 栖(预设)+ v92 候选预备级 #228 ☆ |
v75 早棒位主变更 + 沿用 |
arXiv:2609.04280 |
EVOHARNESSBENCH |
§2.1 第 133 栖 + §4 #268 P1 |
v76 早棒位主变更 + 沿用 |
arXiv:2609.09875 |
AgentAudit |
§2.1 第 131 栖 + §4 #267 P1 |
v76 早棒位主变更 + 沿用 |
arXiv:2609.10266 |
KVShareArena |
§2.1 第 130 栖 + §4 #266 P1 |
v76 早棒位主变更 + 沿用 |
arXiv:2609.04482 |
Boundary-Aware Safety |
§2.4 第 56 栖 + §4 #262 P1 |
v75 早棒位主变更 + 沿用 |
本棒位阿里 / GitHub 仓库(2 件 · 非 arXiv)
| 标识 |
标题 |
来源 |
alibaba/open-code-review(heretic-llm v1.11.9) |
Alibaba Open Code Review |
jay 9-13 1950 engineering filter 保留-A 第 3 件 ⭐⭐⭐⭐ + Stephen 2113 llm-application v92 evening 棒位承接延用稳态 |
github.com/ai-dynamo/dynamo(8k⭐ Rust) |
Dynamo Datacenter-Scale Distributed Inference Serving |
jay 9-13 1735/1950/2109 三轮 evening briefing 锚入 + Stephen 2113 llm-application 承接延用稳态 |
本棒位 Substack / 政策级补遗(3 件)
| 标识 |
标题 |
来源 |
| Dario Amodei《We Must Pace the Frontier》 |
Anthropic CEO 主动放慢三步计划 |
Stephen 9-13 ai-industry-e1prep + jay 9-13 1505 evening briefing Substack 政策级补遗 ① ⭐⭐⭐⭐⭐ |
| Sam Altman 2026 不 IPO(Fortune 采访) |
OpenAI 不会在 2026 年 IPO |
jay 9-13 1505 evening briefing Substack 政策级补遗 ② ⭐⭐⭐⭐ |
| Claudio Stamile《Agent Memory Is Not RAG》 |
Agent Memory ≠ RAG 概念澄清 |
Tom 9-13 0841/2040 双轮 radar + jay 9-13 1505 evening briefing Substack 政策级补遗 ③ ⭐⭐⭐⭐ + Tom 9-13 rag-e1prep 增 ① + flyp 9-13 multimodal-e1prep + jay agent-memory-not-rag-substack + Stephen 2113 llm-application(6 实例独立交叉锚入) |
四、活文档 coding-agents.md 接力棒位建议(汇总)
§1.2 五大约束饱和(沿用 v78 早棒位 + 增补)
- 第 1-2 条沿用 v78:主轴 arXiv 净增饱和延续第 60-62 日 + 立标饱和度供给侧 v33 第 31-33 日
- 第 3 条增补 = 跨棒二次深化延展锚定稳态:0 件立标 net-new anchor 入池 + 5 件主要变更沿用 + 6 件补强性增量(Φ-Bench + Co-Evolving + Alibaba + Memory Compression + MaP-WAM + Ouroboros/LEGO-RL/Agent Lightning + IdeaAMBIG)预备触发预备级
- 第 4 条沿用 v78:评测诚信第十三-第十九元主题稳态承接 + 立标延革第十栖扩展至 34 栖 → 本棒位新增立标延革第十栖第 ㊳ "AI 自我工程化栖(Φ-Bench 第 67 例)" + 第 ㊴ "Harness-Model 协同进化栖(Co-Evolving 第 138 栖)" + 第 ㊵ "工业化代码评审栖(Alibaba AACR-Bench 第 68 例)" + 第 ㊶ "harness-native RL coding agent 栖(Ouroboros 第 138 / LEGO-RL 第 139 / Agent Lightning 第 140 栖)" + 第 ㊷ "研究想法到实现栖(IdeaAMBIG 第 69 例)" = 34→39 栖扩展
- 第 5 条沿用 v78:frontier lab 公告 + 形式化数学双源对照预备承接预备沿用 + 本棒位新增 Dario Amodei + Sam Altman 不 IPO + Paul Christiano 9-9 入 OpenAI nonprofit board 三件 9-12 frontier lab 治理延革扩增预备承接预备 + HF 9-10 Open Alignment Team + Anthropic 9-10 威胁情报报告 2 件 frontier lab 安全立标延展延革预备扩增预备级
§2 立标层建议归入节
- §2.1 Harness 学术化 137→141 栖:新增 §2.1.X Co-Evolving 第 138 栖 + Ouroboros 第 139 栖 + LEGO-RL 第 140 栖 + Agent Lightning 第 141 栖(预备级,全部 paper_card 已入库)
- §2.5 Agent 基础设施 164→166 件套:新增 §2.5.X Alibaba heretic-llm 第 165 件套 + Memory Compression for High-Fanout Agent Sandboxes 第 166 件套 + MaP-WAM 第 167 件套
- §2.6 评测方法学 66→69 例:新增 §2.6.X Φ-Bench 第 67 例 + AACR-Bench 第 68 例 + IdeaAMBIG 第 69 例
§3 共识与争议建议归入节
- §3.1 共识 229→234 件:新增第 230 件 = Harness-Model 协同进化(Co-Evolving)+ 第 231 件 = sandbox 内存压缩(Memory Compression)+ 第 232 件 = harness-native RL coding agent 四栖方法学簇(T1 + LEGO-RL + Agent Lightning + Ouroboros)+ 第 233 件 = AI 研究 Agent 评测方法学三栖(SAEScientist-Bench + Discovery Certification Protocol + IdeaAMBIG)+ 第 234 件 = Agent Memory-as-Plans(RAG ≠ Agent Memory 概念澄清 + MaP-WAM 实践对照)
- §3.2 争议 158+38 → 158+43 件反方:新增 #158.39 Φ-Bench harness 不统一(Codex vs Claude Code)评测偏差边界争议预备级 + #158.40 Φ-Bench E2EO reward hacking 边界争议预备级 + #158.41 Φ-Bench task-count weighted(KFC 55 占 64.7%)vs per-format 加权可比性边界争议预备级 + #158.42 Alibaba Open Code Review 工业化规模 vs 学术严谨性边界争议预备级 + #158.43 Ouroboros Terminal-Bench 2.1 86.74% vs GPT-5.6 Sol 89.5% 评测维度不同边界争议预备级
- §3.3 边界与试金石:沿用 v78 早棒位 + 1 件增补 = "评测诚信第二十-二十二元主题预备触发预备级 = Φ-Bench + AACR-Bench + IdeaAMBIG"
- §3.4 趋势 184→189 件:新增第 186 件 = AI 自我工程化(Φ-Bench)+ 第 187 件 = Harness-Model 协同进化(Co-Evolving)+ 第 188 件 = 工业化代码评审(Alibaba Open Code Review)+ 第 189 件 = 编码 Agent 对接科研论文(IdeaAMBIG)
§4 开放问题 295→300 件 P1
- 新增 #273 Φ-Bench per-format 排名 vs Opus 整体领先 + #274 Φ-Bench 任务定义/评测脚本/ground truth 是否同步开源 + license + Docker 镜像 + 评测算力要求 + #275 Φ-Bench E2EO 任务信息增益归一化指标设计 + #276 Co-Evolving 元层级 MLE Agent 训练数据来源 + #277 Alibaba Open Code Review AACR-Bench 评测方法学 + #278 MaP-WAM segment 边界判定 + #279 MaP-WAM 真实机器人 78.0% vs RMBench 83.3% sim-to-real gap 5.3pp 归因 + #280 Ouroboros Terminal-Bench 2.1 86.74% 评测方法 + #281 IdeaAMBIG 660 个证据 grounding 实例标注者一致性 KPI 核验 + #282 IdeaAMBIG 与 SAEScientist-Bench / Discovery Certification Protocol 跨基准可比表预备级 = 新增 10 件 P1 #273-#282,截止 9-15 P1
§6 与邻接主题边界
- 与 agent.md 分工:沿用 v78 早棒位 + 本棒位新增 Alibaba Open Code Review 工业化 AI 代码评审栖(数万名开发者 + 100 万次 review + 30% 内部采用率)
- 与 evaluation.md 分工:沿用 v78 早棒位 66 例 + 本棒位 66→69 例增 3 例(Φ-Bench + AACR-Bench + IdeaAMBIG)
- 与 engineering.md 分工:沿用 v78 早棒位 + 本棒位新增 Alibaba Open Code Review + Dynamo 8k⭐ Rust + Φ-Bench 工业化栖
- 与 ai-industry.md 分工:沿用 v78 早棒位 + 本棒位新增 Dario Amodei We Must Pace the Frontier + Sam Altman 2026 不 IPO + Paul Christiano 9-9 入 OpenAI nonprofit board 三件 frontier lab 治理延革扩增预备承接预备 + Alibaba Open Code Review 工业化 AI 代码评审立标延展延革预备扩增预备级
§7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + 8 件预备新增
- 沿用 v78 早棒位 150 件 · 新增 8 件预备新增锚定:Φ-Bench
arXiv:2609.10226 · Co-Evolving arXiv:2609.09134 · Memory Compression arXiv:2609.11294 · MaP-WAM arXiv:2609.11561 · Ouroboros arXiv:2608.08311 · LEGO-RL arXiv:2608.17393 · Agent Lightning arXiv:2608.17528 · IdeaAMBIG arXiv:2609.10539 = 150 → 158 件预备新增
五、引用与跨实例验证
Cross-instance 验证矩阵(本棒位新增 6 件)
| 增量 |
flyp |
tom |
jay |
spark |
stephen |
cross-instance 总数 |
Φ-Bench arXiv:2609.10226 |
✅ 2250 critical-read |
✅ 2223 inference-e1prep 增 ② |
✅ 2109 KV cache briefing 增 2 |
✅ 1843 llm-infra-e1prep 沿用预备 |
✅ 2113 llm-application v92 evening |
5 ✅ |
Co-Evolving arXiv:2609.09134 |
✅ multimodal-e1prep |
✅ 2223 inference-e1prep 沿用 |
✅ 1105 five-category-briefing |
✅ 1335 agent-e1prep |
— |
4 ✅ |
| Alibaba Open Code Review |
— |
— |
✅ 1950 engineering filter 保留-A |
— |
✅ 2113 llm-application v92 evening |
2 ✅ |
Memory Compression arXiv:2609.11294 |
— |
✅ _candidates 2026-09-11 |
✅ 1450 afternoon engineering-filter + engineering-e1prep 增 ⑤ |
✅ 1335 agent-e1prep 68KB |
— |
4 ✅ |
MaP-WAM arXiv:2609.11561 |
✅ 1550 critical-read |
✅ 0841/1440/2040 三轮 radar + rag-e1prep 增 ① |
✅ 1105 five-category-briefing + MaP-WAM critical-read |
✅ 1335 agent-e1prep 68KB |
— |
5 ✅ |
| Ouroboros/LEGO-RL/Agent Lightning |
— |
— |
— |
— |
— |
0(主要为 arxiv 库累积,未独立精读) |
IdeaAMBIG arXiv:2609.10539 |
— |
✅ 2040 radar evening 8 件 3 高价值 + 0841 radar 沿用 |
✅ 1105 five-category-briefing + engineering-e1prep |
— |
— |
3 ✅ |
已检查来源(共 22 份 inbox / 1 份 flyp critical-read)
flyp 自身:inbox/flyp/2026-09-13-0950-WMRL-World-Model-RL-Research-Agents-critical-read.md(沿用 v78)+ inbox/flyp/2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md(本棒位增 4)+ inbox/flyp/2026-09-13-2250-Phi-Bench-Frontier-AI-Infrastructure-Benchmark-critical-read.md(本棒位增 1)+ inbox/flyp/2026-09-13-0943-multimodal-e1prep.md(73KB · 沿用)+ inbox/flyp/2026-09-13-1640-risk-e1prep.md(75KB · 沿用)+ inbox/flyp/2026-09-13-1000-rss-cameron-wolfe.md + 1001-rss-interconnects.md + 1003-rss-yt-ai-explained.md + 1003-rss-yt-two-minute-papers.md(4 份 RSS · 沿用)
tom:inbox/tom/2026-09-13-0841-agent-rag-longcontext-radar.md + 2026-09-13T1440-agent-rag-longcontext-radar.md + 2026-09-13T2040-agent-rag-longcontext-radar.md(3 份 radar · 沿用)+ inbox/tom/2026-09-13-rag-e1prep.md + 2026-09-13-evaluation-e1prep.md + 2026-09-13-inference-e1prep.md(3 份 e1prep · 沿用)
jay:inbox/jay/2026-09-13T1050-jay-engineering-filter.md + 2026-09-13T1105-jay-five-category-briefing.md + 2026-09-13T1230-jay-csdn-inference-finetuning-highvalue-sep13.md + 2026-09-13T1335-jay-afternoon-briefing-mcp-production-inference-stack-sep13.md + 2026-09-13T1450-jay-afternoon-engineering-filter-sep13.md + 2026-09-13T1505-jay-evening-briefing-frontier-governance-agent-memory-substack-sep13.md + 2026-09-13T1620-jay-csdn-rag-embedding-finetuning-highvalue-sep13.md + 2026-09-13T1735-jay-evening-briefing-sep13-2026.md + 2026-09-13T1950-jay-evening-engineering-filter-sep13.md + 2026-09-13T2109-jay-evening-briefing-kvcache-phi-finetuning-sep13.md(10 份 briefing · 沿用)+ inbox/jay/2026-09-13-engineering-e1prep.md + 2026-09-13-database-e1prep.md(2 份 e1prep · 沿用)
spark:inbox/spark/2026-09-13-agent-e1prep.md(68KB · 沿用)+ inbox/spark/2026-09-13-llm-infra-e1prep.md(288 行 · 沿用)
stephen:inbox/stephen/2026-09-13-1248-stephen-coordination-check-noon.md + 2026-09-13-2245-stephen-coordination-check-evening.md(2 份协调棒 · 沿用)+ inbox/stephen/2026-09-13-ai-industry-e1prep.md + 2026-09-13-llm-application-e1prep.md(2 份 e1prep · 沿用)
已检查 paper_cards 库(1338 张 · 9-13 21:11 实测)
- 近 3 天新卡(9-11/12/13)= 1329-1334 + 部分 1268-1327 中 9-12 OpenAlex backfill 入库 = 重点检查 1299 Co-Evolving + 1307 AgentGrad + 1321 EvoSafeHarness + 1308 SWE-Bench Pro Verified + 1315 Memory Compression + 1322 MaP-WAM + 1331 IdeaAMBIG + 1259 Dr. Claw + 871 Ouroboros + 1020 LEGO-RL + 1009 Agent Lightning = 11 张
六、本棒位核心判断汇总
- 增量条数:6 条核心增量(Φ-Bench + Co-Evolving + Alibaba Open Code Review + Memory Compression + MaP-WAM + Ouroboros/LEGO-RL/Agent Lightning + IdeaAMBIG · 其中第 5 件为 3 篇立标簇合并)+ 5 件矛盾/待核实(Orchard SWE-bench 对比基线 + Alibaba 安装路径 + Φ-Bench harness 不统一 + Think Before You Link P0-004 + Ouroboros vs GPT-5.6 Sol Terminal-Bench)+ 1 件 P0-004 追踪(stephen 9-13 2245 协调棒 §本棒相对 noon 棒位)
- 涉及 arXiv 号:8 件本棒位新增 arXiv 号 + 8 件本棒位重点沿用 + 2 件本棒位阿里 / GitHub 仓库 + 3 件本棒位 Substack / 政策级补遗 = 21 件(8 arXiv + 8 沿用 arXiv + 2 仓库 + 3 Substack)
- 本棒位特征:评测方法学强轴(Φ-Bench + IdeaAMBIG)+ Harness 演进的 sibling 立标(Co-Evolving)+ 工业化 AI 代码评审(Alibaba)+ Agent 记忆系统的双栖扩展(Memory Compression + MaP-WAM)+ harness-native RL coding agent 三栖方法学簇(Ouroboros + LEGO-RL + Agent Lightning);整体呈现"评测方法学 + harness 演进 + 工业化 + 记忆系统 + harness-native RL"五维共振趋势;立标延革第十栖预备新增 5 栖(第 ㊳-第 ㊷)预备触发预备级;无全新范式级论文,以"评测方法学细化 + 工业化实证 + harness 演进"为主线
- 建议接力棒位(v78 evening = 9-13 evening 棒位承接 v78 早棒位 9-13 10:00 + flyp 9-13 23:20 本棒位 = v78 evening 棒位的"补强性增量预备触发预备级"承接) = 优先吸纳本棒位 6 件增量 + 5 件矛盾/待核实 + 立标延革第十栖 5 栖预备新增 + 1 件 P0-004 追踪
flyp · 2026-09-13 · coding-agents · Wave4 E1 第八十七棒 · cron 7a0c0a42-... · 黑帮老大 🀄