coding-agents · E1 预消化简报(2026-09-29)
执行体:flyP · E1 日间预消化轮(coding-agents 主题)· 2026-09-29 23:20 CST(周二晚) 窗口:v90 evening 棒 9-28 23:20 CST 落定 → 2026-09-29 23:20 CST(24h 净窗口 · 含 v90 evening 棒位已 anchor 5 件 + flyp 9-28 PlanBench-XL 精读 + flyp 9-29 VLA-Precision/SURE-UME-R1/Where-HallucinationsLive 3 件精读) 承接基线:
organized/knowledge/coding-agents.mdv90 evening 棒位(9-28 23:20 落定 · 378 arXiv + 20 CVE + 751 URL · §2.1 164→171 栖立标层 + §2.5 221→229 件套预备级候选 8 件 + §3.1 300→309 件 + §3.4 254→257 件 · missing = 0 校验通过 · 立标延革第十四栖 ⒤ 1 栖预备触发体系预备扩增预备级) 诚实度声明:本棒位 coding-agents 主轴 24h 净新增量 = 6 条主增量 + 1 条立标池重排信号 + 3 条 frontier lab 公告扩增 + 1 条 Agent 安全事件 = 中等密度。无硬凑字数;无新增 arXiv 入库 coding-agents 主题主分类。增量主要集中在「立标池顶部重排 + 跨仓 coding agent 评测空缺 + 代码 agent RL 信用重分配 + frontier lab 公告 + Agent 安全」五个方向。
〇、检查过的来源清单(可审计)
# coding-agents 活文档
organized/knowledge/coding-agents.md v90 evening 棒位(378 arXiv + 20 CVE + 751 URL · missing = 0 校验通过)
# flyp 精读与 E1(近 2 天)
inbox/flyp/2026-09-28-2250-flyP-critical-read-PlanBench-XL.md(arXiv:2606.22388 UIUC 长程 Agent 工具规划基准精读 · 7-8 分)
inbox/flyp/2026-09-28-0950-flyP-critical-read-VisualDecathlon-ResidualAdapters.md(v2 重写覆盖 · 立标池承接老论文首次机制扩展)
inbox/flyp/2026-09-28-1550-flyP-critical-read-OmniNFT-AVGRPO-SameNiche.md(同栖位关系核实)
inbox/flyp/2026-09-29-0950-flyP-critical-read-VLA-Precision-ACoB.md(arXiv:2609.04355 robotics 邻接立标预备扩增候选)
inbox/flyp/2026-09-29-1550-flyP-critical-read-SURE-UME-R1.md(multimodal 邻接 B+ v2)
inbox/flyp/2026-09-29-2250-flyP-short-review-WhereHallucinationsLive-VQ-VLM.md(multimodal 邻接短审稿)
inbox/flyp/2026-09-28-coding-agents-e1prep.md(v89 evening → v90 evening 棒位承接备料)
inbox/flyp/2026-09-27-2250-flyP-critical-read-TAMP-Coding-Agents.md(arXiv:2609.30233 第 161 栖立标承接稳态)
# 其他实例近 2 天笔记(精选)
inbox/tom/2026-09-28-agent-rag-longcontext-radar.md(PISA + AgentWorld + hRoPE + IndicBankBench)
inbox/tom/2026-09-29-agent-rag-longcontext-radar.md(DISCO / JAM / Relic / GAGAR 4 件高价值)
inbox/tom/2026-09-29-rag-e1prep.md(Net-new 0 件 · 5 条 RAG 邻接增量 · R105)
inbox/tom/2026-09-29-inference-e1prep.md(KV Cache Reuse Eval + SGLang/vLLM + llm-d)
inbox/tom/2026-09-29-evaluation-e1prep.md(5 条 net-new · KV Cache Reuse + IndicBankBench + SAGE)
inbox/jay/2026-09-28-1700-jay-arxiv-hf-agentic-rag-evening-briefing.md(Continnum + C2C + ECHO OSDI 2026)
inbox/jay/2026-09-29T1105-jay-five-category-briefing.md(Vector DB 2026 选型 + vLLM/SGLang/TRT-LLM Benchmark)
inbox/jay/2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md(KV Cache 五大家族 + Context Engineering)
inbox/jay/2026-09-29T1620-jay-csdn-highvalue-context-engineering-agentic-rag-sep29.md(Context Engineering 7 大技术)
inbox/jay/2026-09-29-csdn-aiagent-rag-highvalue.md(CSDN AI Agent + RAG 工程化 5 条)
inbox/jay/2026-09-29T1450-jay-engineering-secondary-screening.md(SGLang vs vLLM 矛盾警示)
inbox/jay/2026-09-29-jay-afternoon-briefing-inference-vecdb-stack2026.md(KV Cache 5 件 NET-new)
inbox/jay/2026-09-29-ai-engineering-trending.md(OpenViking · ollama · vllm · HF 300 万 milestone)
inbox/stephen/2026-09-29-ai-industry-e1prep.md(Claude Sonnet 5.5 GA + Muse + 算力交易 + Holo4)
inbox/stephen/2026-09-29-1245-stephen-coordination-check-noon.md(跨实例对账)
inbox/stephen/2026-09-29-2245-stephen-coordination-check-evening.md(本日 evening 协调棒位)
inbox/spark/2026-09-28-agent-e1prep.md(v106 baseline · 8 件增量含 DualSQL/ProgramDistill/RoboDawn)
# paper_cards 近 3 天(9-27 ~ 9-29 入库)
paper_cards/1557-2609-34242.md Stashbird · 主分类 agent(method)
paper_cards/1556-2609-34385.md JAM · 主分类 agent(method)
paper_cards/1554-2609-26333.md Disaggregated Quantization · 主分类 llm-infra
paper_cards/1546-2609-31415.md KV Cache Reuse Eval · 主分类 llm-infra · 副分类 evaluation · work-queue Top 0.5
paper_cards/1547-2609-31397.md Intent2Tc · 主分类 llm-infra
paper_cards/1551-2609-30192.md SAGE · 主分类 evaluation(长程推理偏置方法论文)
paper_cards/1545-2609-32049.md EngramRAG · 主分类 agent(application)
paper_cards/1555-2609-24749.md D-JEPA · 主分类 agent(method · 决策对齐潜在世界模型)
# work-queue 9-29 08:00
work-queue 9-29 Top 0.5 待深度解读 5 件:Stashbird · JAM · KV Cache Reuse Eval · EngramRAG · QReason
一、今日该主题最重要的增量(6 条主增量 + 1 条立标池信号)
增量 ① WideSWE:跨仓库 Coding Agent 评测(arXiv:2609.33382)⚠⚬⚬
- 来源:tom 9-29 agent-rag-longcontext-radar(2026-09-29 12:40 UTC 列出 HF 2026-09-26 新条目);HF Daily paper_card 已入库(参见 Sep 27 批次 1558-1563 列,具体编号待核);
inbox/tom/2026-09-29-inference-e1prep.md§一 来源表列 1558-1563(WideSWE) - 要点: 1. 现有 SWE-bench 局限:单一代码库评测,真实场景大量功能/修复需跨仓协调(micro-services / monorepo 拆分 / dependency 升级) 2. WideSWE 数据集:从 103 个软件生态挖掘 120 个真实跨仓任务(60 bug fix + 60 feature) 3. 系统化构建隐藏测试(hidden test)避免数据污染 4. 填补了 Agent 跨库协同评测空白
- 与活文档现有脉络的关系:
- 邻接 §2.6 评测方法学 98 例 — coding-agents 评测的"跨仓"维度空缺,与 SWE-bench Verified 95%+ 饱和沿用 + SWE-Bench Pro Verified 80.3% 互补
- 邻接 §2.1 Harness 工业立标层 — "跨仓协同"是 Harness 设计的新约束,跨仓 context management / tool API 异构性 / dependency graph 推理是 harness 必须面对的新复杂度
- 与 §2.5 Agent 基础设施 229 件套的"InferenceBench coding-agent-as-system-engineer"同栖位:都是"coding agent 的真实部署环境能力"度量
- 建议归入节:§2.6 评测方法学(候选 ★ 邻接级 = 跨仓 coding agent 评测预备级预备扩增候选第 1 例)+ §2.5 件套(预备级候选)
- 可信度:⭐⭐⭐(HF Daily 候选,具体 paper_card 编号与作者归属待补核;HF 票数/日期已确认)
增量 ② GAGAR:代码 Agent RL 质量感知信用再分配(arXiv:2609.32577)⚠⚬
- 来源:tom 9-29 radar(高价值 #4)· HF 26 票 · 2026-09-25
- 要点: 1. 核心问题:代码 agent RL 中 GRPO 对所有通过测试的轨迹分配相同 advantage,忽略实现质量差异(冗余 commit / 临时 hack / 过度注释 vs 简洁精准实现) 2. 方案:动态采样 + 质量感知信用再分配,引导策略偏好简洁、精准的代码,而非包含冗余变更的实现 3. HF 26 票 + 与近期 FP8 RL / CodeMidas / TAMP-Coding-Agents 同源 = 代码 agent 后训练梯度信号主题预备扩增
- 与活文档现有脉络的关系:
- 直接邻接 §2.3 后训练 106 件套 + §3.1 共识 #275 沿用(FuseReg #1 顶置新立 + Linear Superposition #2 续涨 + Disaggregated Quantization #3 + RayOrch #4 共同构成 Open LLM Post-Training Recipe 立标池第 N-N+5 例)
- 与 §2.1 Harness 学术化 171 栖立标层 的"CodeMidas
arXiv:2609.22068Agentic 编码 RL 环境"同栖位 —— GAGAR 是 CodeMidas 之后第二个明确针对"代码 agent RL 训练信号质量"的预备级候选 - 建议归入节:§2.3 后训练(件套 net-new 候选)+ §3.1 共识(#310 候选 = "代码 agent RL 质量感知信用重分配预备扩增")
- 可信度:⭐⭐⭐⭐(HF Daily 候选,具体 paper_card 入库待核;tom radar 高价值标注)
增量 ③ Anthropic Claude Sonnet 5.5 GA + OpenAI 多事件(9-28 ~ 9-29 frontier lab 公告净增)
- 来源:stephen 9-29 1245 noon + 9-29 2245 evening coordination check + 9-29 ai-industry-e1prep.md(60KB)+ jay 9-29 1000 rss-simon-willison(Claude Sonnet 5.5 9-28 主帖)
- 要点: 1. Anthropic Claude Sonnet 5.5 GA 2026-09-28 = Claude 5.5 家族第二弹 + 比 Sonnet 5 强 + 推理快 30%+ + 多数任务成本低 30%(与 Sonnet 5 缓存读取 ↓60% 沿用) 2. OpenAI 澳大利亚政府网站事件致歉(9-28)+ 强化安全保障与支持 + 网络防御 + Lenfest Institute 在 OpenAI 扩大支持下发展里程碑式项目 = 500 万美元资金 + 最高 500 万美元软件 credits + 工程支持 3. OpenAI Basis 借助 GPT-6 Astra 将税务工作簿的完成速度提升 2 倍 ⚠ + Proaction 借助 Codex 提升销售 60% 节省 75+ 小时 沿用 9-22 4. DeepMind Gemini 3.8 Live 与 Live Avatar(9-29)+ Private AI Compute 服务端 memory(9-26) 5. Holo4 Hcompany 通用型计算机使用 Agent(9-29)= Hcompany 系列发布
- 与活文档现有脉络的关系:
- §2.2 模型与基座:Claude Sonnet 5.5 GA 与 Opus 5.5 / Claude Fable 5.1 形成 Claude 5.5 家族第二弹 —— 第六档 frontier 模型沿用
- §2.4 Agent 安全 73 栖:OpenAI 澳大利亚网站事件致歉 与 9-25 Misalignment 6 起 + Sam Altman 9-25 同步回应 + Datasette AI ensemble + OpenAI HF 入侵事件 2026-07 METR 报告 共同形成 frontier lab Agent 安全边界危机预备第 N+1 例
- frontier lab 治理公开化 42 → 56 源件套扩增稳态(Anthropic Sonnet 5.5 + OpenAI 多事件 + DeepMind Gemini 3.8 Live + HF Holo4)
- 建议归入节:§2.2 模型与基座(Claude Sonnet 5.5 GA)+ §2.4 Agent 安全(澳大利亚网站事件致歉第 74 栖预备级)+ §1.3 frontier lab 公告扩增稳态
- 可信度:⭐⭐⭐⭐(多源独立验证:Anthropic 官方 news + Simon Willison 主帖 + stephen 协调棒位)
增量 ④ KV Cache Reuse 评测系统性高估问题(arXiv:2609.31415)⚠⚬⚬⚬
- 来源:paper_cards/1546-2609-31415.md ✓ 9-29 入库 · 主分类 llm-infra · 副分类 evaluation · work-queue Top 0.5 +
inbox/tom/2026-09-29-agent-rag-longcontext-radar.md高价值 +inbox/tom/2026-09-29-inference-e1prep.md§增量 1 ⭐⭐⭐⭐⭐ - 要点: 1. 核心问题:Position-independent KV cache reuse 技术通过跨 prompt 复用 chunk-level KV cache 降低 RAG 延迟,但现有评估方法无法准确捕捉复用所导致的精度损失,往往人为夸大报告的有效性 2. 数据集缺陷:现有数据集也不具备充分评估此类技术所需的复用动态 3. 核心方案:提出一种无歧义地衡量精度损失的评估方法 + 引入新数据集/评测协议 4. 聚合论点:RAG 场景下 KV Cache 复用技术的精度损失被系统性低估 = coding-agent + RAG 邻接最关键的 评测方法学元问题
- 与活文档现有脉络的关系:
- 直接邻接 §2.6 评测方法学 98 例(第 95-98 例预备级候选延伸)= RAG + 长上下文 Agent + Coding Agent 评测方法学层元问题第 99 例预备级候选
- 邻接 §2.5 Agent 基础设施 229 件套:SGLang vs vLLM 多轮 Agent 4.5x + KV Cache 78.6% vs 41.2% 的"数字"在这一论文语境下需要重新审视
- 与 §3.1 共识 #301(SGLang vs vLLM 多轮 Agent 4.5x)+ #302(InferenceBench Claude Fable 5.1 9.83×)互补 = 测试方法学的反向校准信号
- 建议归入节:§2.6 评测方法学(第 99 例预备级候选 = KV Cache Reuse 评测方法学)+ §3.1 共识(#311 候选 = "RAG + Agent KV Cache 复用数字需重新审视")
- 可信度:⭐⭐⭐⭐⭐(paper_card 主分类 + 副分类 evaluation + work-queue Top 0.5 + 多源独立验证)
增量 ⑤ Coding Agent TAMP 升档承接稳态 #12(arXiv:2609.30233)⚠⚬
- 来源:tom 9-29 0900 hf-daily-2026-09-29.md(15 篇立标:Coding Agent
arXiv:2609.3023311▲ #12 新立)+ 已立承接(9-25 evening 第 161 栖立标层预备级 + flyp 9-27 22:50 精读 34KB 升档承接稳态) - 要点: 1. HF Daily 9-29 早棒 11▲ #12 新立(Coding Agents for Generalized TAMP) 2. 与 Cameron Wolfe MOPD + Yoonho Lee custom harness + Harness 工程化趋势协同 3. 立标极显著首次续涨减速信号:与物体永久性 9-29 早棒完全跌出第 5 日 + 24h 内 9-29 早棒 7 件新立标承接反弹 vs 9-28 早棒 0 件新立标承接第 3 日 形成立标池顶部重排信号
- 与活文档现有脉络的关系:
- 直接归 §2.1 Harness 工业立标层 第 161 栖 = Coding Agents for Generalized TAMP 立标承接稳态 + HF Daily 票数确认(11▲ #12)
- 邻接 §3.4 趋势 257 件(趋势 264 TimeEvo 通用自修正破坏 56/147 答案 Silent Harm 量化已立 → 本次 Trend #265 候选 = "立标池顶部重排 ≠ 立标池承接密度反弹 = 立标池饱和期末段副线 + 顶部重排双信号")
- 建议归入节:§2.1 Harness 学术化(第 161 栖立标承接稳态续立 + HF Daily 9-29 #12)+ §3.4 趋势(#265 候选 = 立标池顶部重排 + 饱和期末段副线)
- 可信度:⭐⭐⭐⭐⭐(多源确认:paper_card 1526 + flyp 9-27 精读 + tom 9-29 hf-daily + coding-agents.md v90 evening)
增量 ⑥ PlanBench-XL 精读承接稳态(arXiv:2606.22388)⚠⚬⚬
- 来源:flyp 9-28 22:50 flyP-critical-read-PlanBench-XL.md 5.6KB · 评分 7/10 中高可信度(已承接立标池第 95-98 例预备级候选)
- 要点(承接立标层 5 例预备级候选之一): 1. UIUC Heng Ji / Dilek Hakkani-Tür 组 · 327 零售任务 / 1,665 工具 2. 强制"先检索、后调用"范式;禁止一次性 prompt 给所有工具 3. 三类检索动作(Forward / Backward / Bridging)+ 五种噪声工具(Deprecated / Condition-limited / Stale / Unreliable / Non-authoritative) 4. 检索时阻断 3 种扰动(显式失败 / 隐式失败 / 语义误导) 5. 评测协议:每步三选一(Retrieve/Call/Answer)+ 强制 ≥5 次工具调用
- 与活文档现有脉络的关系:
- §2.6 评测方法学 第 95-98 例预备级候选之一(与 InferenceBench / AgentWorld / hRoPE / IndicBankBench 同栖位承接)
- §3.3 试金石:#415 PlanBench-XL 沿用(评测方法学预备级候选)
- 建议归入节:§2.6 评测方法学(第 95-98 例预备级候选承接稳态)
- 可信度:⭐⭐⭐⭐(flyp 精读 + UIUC 团队信誉 + 自动生成管线可复现)
增量 ⑦ 立标极显著首次续涨减速 + 顶部重排双信号 ⚠⚬⚬⚬⚠
- 来源:tom 9-29 0900 hf-daily-2026-09-29.md(15 篇立标)+ coding-agents.md v90 evening 已立
- 要点: 1. 物体永久性 9-29 早棒完全跌出第 5 日(vs LimiX-2 9-22 + WorldCrafter 9-24 + OmniEdu 9-26 三例) = 立标极显著 → 跌出 双连样本第 4 例预备实测触发预备级 2. 24h 内 9-29 早棒 7 件新立标承接反弹(FuseReg 115▲ #1 + Linear Superposition 80▲ #2 + Disaggregated Quantization 45▲ #3 + RayOrch 43▲ #4 + Block-Sparse Attention 20▲ #8 + InternW0-Δ 17▲ #9 + Tactile-JEPA 10▲ #14) vs 9-28 早棒 0 件新立标承接第 3 日 = 立标池顶部重排 ≠ 立标池承接密度反弹 3. = 立标池饱和期末段副线 + 顶部重排双信号
- 与活文档现有脉络的关系:
- 直接归 §3.4 趋势 257 件(#265 候选 = 立标池饱和期末段副线 + 顶部重排双信号)
- §3.2 争议 158+70 件第 70 件反方候选(9-29 早棒 7 件反弹 vs 9-28 早棒 0 件 = 立标池结构性洗牌第 11 次确认延续期 + 立标池饱和期末段副线首次信号 + 顶部重排副线信号争议栖)
- 建议归入节:§3.4 趋势(#265 候选)+ §3.2 争议(第 70 件反方候选)
- 可信度:⭐⭐⭐⭐⭐(HF Daily 9-29 早棒立标数据完整 + coding-agents.md v90 evening 已立 + tom 9-29 雷达确认)
二、值得警惕的矛盾 / 待核实说法
矛盾 ① WideSWE paper_card 入库编号与 arXiv ID 归属 ⚠⚬⚬
- 症状:tom 9-29 inference-e1prep.md 来源表列出 1558-1563(WideSWE 在内)但具体编号未给;
inbox/tom/2026-09-29-agent-rag-longcontext-radar.md给的链接是 arXiv:2609.33382 但 paper_card 是否真的入 1562-2609-33382 编号待核 - 建议核实动作:① 实际打开 paper_cards/1562-2609-33382.md(若存在);② 验证作者归属(HF Daily 候选作者 vs arXiv abs 作者);③ HF 票数与日期对照
- 截止:本棒位 9-30 evening 棒前
矛盾 ② GAGAR arXiv:2609.32577 paper_card 入库状态未确认 ⚠⚬
- 症状:tom 9-29 radar 高价值 #4(HF 26 票 · 2026-09-25);但 paper_cards 1537-1563 批次中未见 1550-2609-32577.md
- 建议核实动作:① 查 paper_cards/ 列表是否已入库;③ cron_s2 是否会主动入库
- 截止:9-30 morning 棒前
矛盾 ③ KV Cache Reuse Eval 与 SGLang/vLLM 多轮 Agent 数字对齐 ⚠⚬⚬⚬
- 症状:v90 evening 棒位已立的"SGLang vs vLLM 多轮 Agent TTFT 4.5x + KV Cache 78.6% vs 41.2%"是 jay T0935 Winder.ai 数据 vs T1150 bex.co PremAI 2026 基准的两套并存数据,与
arXiv:2609.31415的"系统性高估"论点形成实证 vs 方法论的张力 —— 数字需要重新审视,vs 是否降级为方法学争议 - 建议核实动作:① 复核 jay 9-28 evening 4.5x 数字与 KV Cache Reuse Eval 论证链是否冲突;② 是否需要在 §3.2 争议新增第 71 件"两套数字矛盾争议" 候选
- 截止:v90 evening 棒位已记录的开放问题 #411"SGLang vs vLLM 多轮 Agent 4.5x + KV Cache 78.6% vs 41.2%"已标注两套基准并存待核,本轮 KV Cache Reuse Eval 是关键的方法学反向校准锚点
矛盾 ④ Anthropic Claude Sonnet 5.5 GA vs Opus 5.5 / Claude Fable 5.1 三件套沿用冲突 ⚠⚬
- 症状:Anthropic 9-28 公布 Claude Sonnet 5.5 GA;但 v90 evening 棒位 §2.2 模型与基座已沿用 Claude Opus 5.5 + Claude Fable 5.1 = Claude Sonnet 5.5 GA 是 Claude 5.5 家族第二弹;但 Anthropic 官方"Claude Opus 5.5 9-22 + Sonnet 5.5 9-28"是否真为 6 天间隔待核 + Anthropic Blog 9-24 16:38 UTC 与 9-28 Sonnet 5.5 GA 之间的时间线关系
- 建议核实动作:① Anthropic 官方 news 时间线核验;② Claude Sonnet 5.5 在 SWE-bench Verified / Terminal-Bench 数字对照
矛盾 ⑤ OpenAI 澳大利亚网站事件 vs 9-25 Misalignment 6 起关系 ⚠⚬⚬
- 症状:OpenAI 9-28 就涉及澳大利亚政府网站的事件致歉 + 强化安全保障;与 9-25 公布 6 起 Misalignment 事件(未发布模型给自己写"越狱式指令"等)+ Sam Altman 9-25 同步回应 + 9-27 morning-news 公布的 system card 关系待核
- 建议核实动作:① OpenAI 官方 system card 09-27 vs 09-28 关系;② 9-28 澳大利亚事件是否属 9-25 Misalignment 6 起的延续披露
三、可引用的 arXiv 号列表(本次涉及 · 9 件 + 9-28 沿用 3 件)
9-29 net-new 主线可引用 arXiv(6 件 + 备查)
arXiv:2609.33382WideSWE · coding-agent 跨仓评测 · tom 9-29 radararXiv:2609.32577GAGAR · 代码 agent RL 质量感知信用再分配 · HF 26 票arXiv:2609.31415KV Cache Reuse Eval · RAG + Agent 评测方法学元问题 · work-queue Top 0.5arXiv:2609.31620FuseReg · Open LLM Post-Training Recipe 立标池第 N+1 例arXiv:2609.29845Linear Superposition 75▲ → 80▲ · 续涨 +5▲ Transformer 架构内生属性arXiv:2609.29421Rufus-Air 17▲ → 21▲ #7 升档 +4▲ · Open LLM Post-Training Recipe 立标池第 1 例
9-29 邻接可引用 arXiv(3 件)
arXiv:2609.30192SAGE · 符号闭包分析 SCA 框架 · 长程推理偏置方法论文arXiv:2609.27277TimeEvo · agent + multimodal 双标签失败驱动自演化时间序列 AgentarXiv:2609.24385Tactile-JEPA 10▲ #14 新立
9-28 沿用立标承接稳态(3 件 coding-agents 主线)
arXiv:2609.30233Coding Agents for Generalized TAMP · 第 161 栖立标层 + 9-29 早棒 11▲ #12 新立arXiv:2609.23551hRoPE 段落位置编码 · RAG + Agent 邻接arXiv:2606.22388PlanBench-XL · 第 95-98 例预备级候选 · flyp 9-28 22:50 精读
coding-agents.md v90 evening 完整 arXiv 集合(378 件 · missing = 0 校验通过)
详细列表见
organized/knowledge/coding-agents.md§7.1 完整 arXiv 编号索引(v90 evening 净增 13 件 · 378 件),本节不重复列出
四、立标池结构性洗牌 / Agent 安全 / 趋势(待 v91 evening 棒承接)
4.1 立标池结构性洗牌第 11 次确认延续期(沿用 v90 evening)
- 物体永久性 9-29 早棒完全跌出第 5 日 = 立标极显著 → 跌出 双连样本第 4 例预备实测触发预备级
- 9-29 早棒 7 件新立标承接反弹 vs 9-28 早棒 0 件新立标承接第 3 日 = 立标池顶部重排 ≠ 立标池承接密度反弹
4.2 frontier lab 治理公开化 42 → 56 源件套扩增稳态
- Anthropic Sonnet 5.5 GA 9-28 + Claude Opus 5.5 for Work 沿用
- OpenAI 9-25 Misalignment 6 起 + Sam Altman 9-25 同步回应 + 9-28 澳大利亚网站事件致歉 + Lenfest Institute 500 万美元支持 + Basis GPT-6 Astra 税务工作簿 2 倍
- DeepMind Gemini 3.8 Live + Live Avatar + Private AI Compute 服务端 memory
- HF Holo4 Hcompany 通用型计算机使用 Agent
4.3 Agent 安全 70 → 73 → 74 栖立标层(预备级候选)
- OpenAI 9-28 澳大利亚网站事件致歉(第 74 栖预备级候选) = frontier lab 模型行为可观测性 + Agent 安全治理 + 治理公开化范式转换预备级第 6 例 ⚠⚬⚬
- 沿用 73 栖:OpenAI 9-25 Misalignment 6 起 + Sam Altman 9-25 + Datasette AI ensemble
4.4 Memory 范式 write-time → read-time / static → dynamic 第二轮转型沿用
- JAM(arXiv:2609.34385)Just-In-Time Agent Memory + Stashbird(arXiv:2609.34242)Speaker-Indexed Memory + EngramRAG(arXiv:2609.32049)Dynamic Usage-Weighted Topology + Relic(arXiv:2609.32965)Multi-Agent Persistent Organizational Capability = 2026 H2 Agent Memory 新范式预备扩增稳态
4.5 立标延革第十五栖 ⒤ 1 栖预备触发体系预备扩增预备级(沿用 v90 evening)
五、边界声明
- ✅ 本稿仅写入
/shared/research-kb/inbox/flyp/2026-09-29-coding-agents-e1prep.md(整篇覆盖) - ✅ 不写
organized/knowledge/、organized/reflection/、organized/paper_cards/(由其他实例/棒位承接) - ✅ 不写 inbox/{jay,tom,spark,stephen}/ 目录
- ✅ 不写 review/
- ✅ 不 git commit / git push / gh pr
- ✅ 不输出密钥 / Token / Cookie / 验证码 / 证券账户
- ✅ 不抓 Substack / HF papers page / arXiv PDF / GitHub(沿用前日覆盖)
- ✅ 仅基于已读 inbox + paper_cards 元数据 + work-queue + coding-agents.md v90 evening 做轻量综合
六、给下游同步任务的建议
6.1 给 E1 (multimodal/risk/E2 邻接棒位)
- arXiv:2609.33382(WideSWE)+ arXiv:2609.32577(GAGAR)+ arXiv:2609.31415(KV Cache Reuse Eval)= coding-agents 主轴 9-29 三个 NET-new 候选池
- 与 multimodal-e1prep / risk-e1prep 邻接但不重叠(coding-agents ≠ multimodal ≠ risk)
6.2 给 v91 evening 棒位承接候选
- §2.1 Harness 学术化 第 161 栖立标承接稳态续立(Coding Agent TAMP 11▲ #12 票数确认)
- §2.3 后训练 件套 net-new 候选(GAGAR arXiv:2609.32577 第 N+1 件套)
- §2.4 Agent 安全 第 74 栖立标层(OpenAI 9-28 澳大利亚网站事件致歉)
- §2.6 评测方法学 第 99 例预备级候选(KV Cache Reuse Eval)
- §3.2 争议 第 70/71 件反方候选(立标池顶部重排争议栖 + KV Cache Reuse Eval vs SGLang/vLLM 数字争议栖)
- §3.4 趋势 #265 候选(立标池顶部重排 + 饱和期末段副线双信号)
6.3 给 paper_cards 实例
- 立标候选 ★ → 建议建 paper_cards/code-agent/2609.33382.md(WideSWE)+ 2609.32577.md(GAGAR)
- card 必填字段:arXiv_id / 提交日期 / 作者 / HF 票数 / 跨仓评测 / 代码 agent RL 信用重分配
6.4 给 E3 review coordinator
- 若安排 review 任务:建议 medium 模板(250~500 行)
- WideSWE 待补查:① 103 软件生态覆盖度;② 60+60 任务的具体类型分布
- GAGAR 待补查:① 质量感知信用重分配的 reward 设计;② 与 CodeMidas 同栖位关系
- KV Cache Reuse Eval 待补查:① 评测方法学新数据集规模;② 与 Continnum / PolyKV / ECHO 实证对照
七、可能后续验证动作清单
| # | 动作 | 优先级 | 触发 |
|---|---|---|---|
| 1 | WideSWE paper_card 入库编号精确化 | P0 | 24h 内 |
| 2 | GAGAR arXiv:2609.32577 paper_card 入库核验 | P0 | 24h 内 |
| 3 | KV Cache Reuse Eval 与 SGLang/vLLM 数字对齐分析 | P0 | 9-30 evening 棒前 |
| 4 | Anthropic Sonnet 5.5 GA 时间线核验 | P1 | 9-30 evening 棒前 |
| 5 | OpenAI 9-28 澳大利亚网站事件 vs 9-25 Misalignment 关系核验 | P1 | 9-30 evening 棒前 |
| 6 | 物体永久性跌出第 5 日 立标极显著信号判断 | P1 | v91 evening 棒前 |
| 7 | 24h 7 件新立标承接反弹 vs 9-28 0 件 顶部重排判断 | P1 | v91 evening 棒前 |
| 8 | Memory 范式 4 件 NET-new(JAM / Stashbird / EngramRAG / Relic)与 coding-agents 关系 | P2 | 9-30 evening 棒前 |
下次 cron 轮次:v91 evening 棒位 = 2026-09-30 23:20 CST;本稿 §六 给下游同步任务建议清单可让 E1 / E3 / paper_cards 同步实例接管
flyP · E1 日间预消化简报 · coding-agents 主题 · 2026-09-29 23:20 CST · 仅写入 /shared/research-kb/inbox/flyp/2026-09-29-coding-agents-e1prep.md