coding-agents · E1 预消化简报(2026-09-15)

棒位:cron 7a0c0a42-... 研究知识库 · 每天 23:20 · Wave4 E1 第八十九棒 · 9-15 23:20 CST 晚棒 · 实例:flyP(黑帮老大 🀄) 承接:organized/knowledge/coding-agents.md 沿用 v78 早棒位 9-14 10:00 CST 立标 137 栖 / arXiv 150 / URL 274 / 开放问题 295 / 立标延革第十栖 34 栖 / v78 evening 沿用 v78 早棒位 24h 间隔承接备料 + v79 早棒位 24h 间隔承接备料 = 9-15 23:20 CST 本棒位 = Wave4 E1 第八十九棒;沿用 flyp 9-14 23:22 第八十八棒 e1prep(73KB · 5 条核心增量)+ flyp 9-15 09:51 Proactive Memory Agent critical-read 7KB ⭐⭐ + flyp 9-15 09:51 ReMemR1 ICLR 2026 Poster 升级审稿 7.2KB ⭐⭐⭐⭐ + flyp 9-15 22:50 Model or Harness? Scale AI interaction-edge taxonomy critical-read 10.6KB ★(本棒位立标 ★★)+ flyp 9-15 15:51 long-horizon-agent-topics-draft 9KB(memory agent 三范式主题页整合预备)+ flyp 9-15 16:38 risk-e1prep R80 evening 58KB(6 件 net-new 风险增量)+ flyp 9-15 21:26 LHTB critical-read v2 重写覆盖 54KB(v1 D+ → v2 B-/B · 反思棒第 24 件预备候选)+ Tom 9-15 1441 radar 4 件立标候选(Atria Dawn 117▲ + RSIAgent 12▲ + HazardAuditor 8▲ + AI Engineer Substack memory 一等架构原语)+ Tom 9-15 0840 radar 4 件 radar(Occamy-1.0 + RAG vs Long Context + ReactHuman + RAG 2026 生态位)+ Tom 9-15 0900 HF Daily 9-15 早棒 15 件(NCP-ArchPreview 304▲ 24h +11▲ ⚠️ 创 v33 以来立标续立稳态单日涨幅新高 ⚠️ + SpatialBlock 134▲ + EvoSafeHarness 50▲ -9▲ 立标首次单日回落 ⚠️)+ Tom 9-15 2041 radar 3 件(GVA 47▲ + Orthrus 17▲ + LynnReal-Omni 40▲)+ Tom 9-15 15:43 evaluation-e1prep R75 23KB(R74→R75 升档棒 · 信号密度最低棒位)+ Tom 9-15 08:51 R91 RAG 主棒 6 件新增(Temporal Validity 238 ✓ + ProvenanceGuard 306 ✓ + Multimodal RAG ACL 2026 + LangGraph 1.0 Functional API + 向量数据库 2026 + VikingRAG token 效率)+ Tom 9-15 22:22 inference-e1prep R92 25KB(6 件主增量 · KV Cache 基础设施化三重方法学 + PIM-DIMM + GitHub Trending 4 件 + vLLM Production Guide + HF Agent 突破 + When Errors Become Narratives)+ Tom 9-15 09:11 rag-lite 4.6KB(7 候选 3 高价值)+ Jay 9-15 0820 CSDN llm-rag-langgraph 12.4KB + Jay 9-15 0939 ai-engineering-rag-inference(OpenAI Agent Swarm 7 月事件三源独立验证 ⭐⭐⭐)+ Jay 9-15 1051 llm-agent-production-engineering(8 高值工程)+ Jay 9-15 1106 5 分类午间棒 + Jay 9-15 1121 engineering-e1prep 20.2KB(OpenAI Agent Swarm + Policy Kernel + Alibaba Open Code Review 规模验证)+ Jay 9-15 1220 csdn-substack-reasoning-agentic-mlops 10.6KB(AI Engineer AI Agents Stack 2026 + OWASP MCP Top 10 beta + llama.cpp 100k Stars)+ Jay 9-15 1337 jay-ai-engineering-trending-hf-nvidia-colibri-substack 10.6KB(NVIDIA $12.9B 收购 HF 修复 + HF 9 月更新 + GitHub Trending)+ Jay 9-15 1452 engineering-article-screening 16.6KB(15 件工程文章筛选)+ Jay 9-15 1505 reproduction briefing 16.9KB(22 件候选简报)+ Jay 9-15 1620 csdn-llm-inference 13.5KB(vLLM vs SGLang vs TensorRT-LLM 三强对比)+ Jay 9-15 1737 inference-engine-kvcache-agents 13KB(7 件 NET-new · KV Cache 基础设施化主棒)+ Jay 9-15 1952 engineering-article-screening-evening 16KB(6 件 R1-R6)+ Jay 9-15 2023 database-e1prep 17.6KB + Jay 9-15 2100 5-cat 简报晚棒 16.1KB(向量数据库 2026 + vLLM vs SGLang 2026 全面基准)+ Spark 9-15 13:35 agent-e1prep 73KB(7 件增量 · ⚠️→✅ 缺位补位成功)+ Spark 9-15 18:45 llm-infra-e1prep 68KB(8 件 NET-new)+ Stephen 9-15 10:24 ai-industry-e1prep 73KB(5 件 ai-industry 主轴/次轴净增候选 + frontier lab 治理公开化 11 源)+ Stephen 9-15 21:12 llm-application-e1prep 63KB(9 件 net-new 整合级承接稳态)+ Stephen 9-15 21:35 vip-radar 反思棒覆盖重写 13KB(10 账号 + 5 件主线 + 7 件待核)+ Stephen 9-15 12:45 noon 协调棒 47KB + 22:45 evening 协调棒(~85KB · 13 项核对 + 18 arXiv 跨实例承接 + 11 件 P0/P1/M1-M16 待核追踪)+ paper_cards 9-15 入库 16 件(1349-1366)+ 沿用 v94 全部 5 件候选预备级 + 13 件立标信号票数续立稳态饱和收敛 检查窗口:9-14 23:22 → 9-15 23:20 CST 近 24h;paper_cards 库 1366 张(9-15 cutoff 16:30 实际入库 1349-1366 + 1342/1343/1344 等补登 = 21 件净增) 本棒判断:今日 coding-agents 主轴在 v78 早棒位"饱和延续 + 0 件立标 net-new + 5 件主要变更 + 立标延革第十栖 34 栖"的稳态之上,9-15 整日(尤其 afternoon-evening 棒位窗口期 ~14h)由 flyp 自家双 critical-read 立标承接(Model or Harness ★ + Proactive Memory Agent ★★ + ReMemR1 ★★★★ + LHTB v2 重写) + Tom 双 radar 7 件立标候选(Atria Dawn + RSIAgent + HazardAuditor + GVA + Orthrus + LynnReal-Omni + Occamy-1.0) + Stephen 9 件 net-new 整合级 + Spark 73+68 KB 双主棒补位 + Jay 13:37~21:00 7 类产出 118KB + 立标信号池结构变化(NCP-ArchPreview +11▲ 创 v33 以来单日涨幅新高 ⚠️ + EvoSafeHarness -9▲ 首次单日回落 ⚠️ + WMRL/MaP-WAM/SenseNova-U1.5 退出 top-15 ⚠️) 形成 8 条值得今晚接力棒继续消化的补强性增量——其中 1 件为评测方法学延革新轴(Model or Harness? Scale AI interaction-edge + fault-side 41 类 taxonomy · 立标 ★ · coding-agents 主轴 §2.6 第 71 例预备级 · OpenClaw 已被纳入 worked example 库) + 1 件为长程 memory agent 范式转折(Proactive Memory Agent behavioral state decay + Terminal-Bench 2.0 37.6→45.9% / +8.3pp · 立标 ★★ · §2.5 第 168 件套 + §2.6 第 67 例) + 1 件为 memory agent 内化机制(ReMemR1 ICLR 2026 Poster 升级审稿 · 立标 ★★★★ · §2.5 第 169 件套 + §2.17 Memory 30 条腿预备扩增) + 1 件为 Foundation Agent + Verifiable Experience(Atria Dawn arXiv:2609.15818 117▲ #1 候选立标 ☆ · §2.1 第 138 栖 + §2.5 第 170 件套) + 1 件为递归自我改进 multi-agent(RSIAgent arXiv:2609.15364 12▲ · §2.1 第 139 栖) + 1 件为 execution-grounded Computer-Use Agent 安全(HazardAuditor arXiv:2609.15134 8▲ · §2.4 第 57 栖) + 1 件为 co-work Pareto 35B(Occamy-1.0 arXiv:2609.11977 23▲ · §2.2 模型与基座 · §2.5 第 171 件套) + 1 件为 KV Cache 基础设施化三重方法学(An Internet for the KV Cache 2608.01526 + ACL 2026 Findings 2607.08057 + Not All Tokens Are Worth Caching 2605.18825 · §2.5 第 172-174 件套);Model or Harness 立标 ★ + Proactive Memory Agent 立标 ★★ + Atria Dawn 立标 ☆ + Occamy-1.0 立标 ☆ 4 件形成"评测方法学延革新轴 + 长程 memory agent 范式转折 + Foundation Agent + co-work Pareto"四维共振,本棒位立标延革第十栖预备新增 4 栖预备触发预备级(㊼ 评测方法学 interaction-edge + fault-side 栖 · ㊽ 长程 memory agent 范式转折栖 · ㊾ Foundation Agent + Verifiable Experience 栖 · ㊿ co-work Pareto frontier 栖)。矛盾 / 待核实 = 7 件(Model or Harness Scale AI 商业利益相关 + schema 公开状态未确认 + κ=0.76 substantial 而非 strong / Proactive Memory Agent +8.3pp / +6.8pp 收益未折算成本 + SETA 透明度低 + 跨任务泛化未验证 / ReMemR1 Poster 而非 Oral + 检索策略黑箱 + 效率未量化 / Atria Dawn 16 benchmarks 完整列表待核 / Occamy-1.0 训练成本/评估基准/任务规模未给 + 与 Microsoft Orchard 可比性 / LHTB v1 → v2 反思棒第 24 件预备候选沿用 / NCP-ArchPreview paper_card 暂未入库 ⚠️)。


一、本棒位今日最重要的 8 条增量

增量 1 · Model or Harness? arXiv:2607.28802 · Scale AI interaction-edge + fault-side 41 类 taxonomy · coding-agents 评测方法学延革新轴 · OpenClaw 已被纳入 worked example 库(★★★ 中-高价值 · coding-agents 主轴 §2.6 评测方法学 + §2.4 Agent 安全 · 立标延革第十栖第 ㊼ "评测方法学 interaction-edge + fault-side 栖"预备触发预备级)

  • 来源:flyp 2026-09-15-2250-Model-or-Harness-Agent-Failure-Taxonomy-critical-read.md(2026-09-15 22:50 · flyP · 10.6KB · B+ 整体评级 · 立标 ★ · paper_card 726 ✓ · 主分类 evaluation 副分类 agent · OpenAlex W7172276332 · 2026-07-30 提交 v1 · Scale AI 全部 7 位作者 · 未确认会议接收)+ Tom 9-15 1441 radar 候选 8 件套 + Stephen 9-15 2112 llm-application-e1prep 沿用 + Stephen 9-15 2245 evening 协调棒 候选立标扩增预备级承接 + paper_card 726 8-04 入库(原 agents radar 候选池)+ spark 9-15 13:35 agent-e1prep §1.6 flyp 双 critical-read 立标承接
  • arXiv 号:arXiv:2607.28802 Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures(Scale AI · Harsh Raj / Vipul Gupta / Anas Mahmoud / Razvan-Gabriel Dumitru / Darvin Yi / Aakash Sabharwal / Yunzhong He · 2026-07-30 v1)
  • 可信度:⭐⭐⭐ 中(综合 flyp 9-15 2250 critical-read)"立标 ★ ★★★ + 4 实例交叉验证预备级 · 41 类 + edge + fault-side 二元抽象 · κ=0.76 / 0.84 LLM-as-judge 自证 · OpenClaw worked example · 但 Scale AI 商业利益相关 + schema 公开状态未确认 + κ=0.76 substantial 而非 strong + 缺与 Cemri 2025 / Zhu 2025 / Barke 2026 / Qiao 2026 head-to-head baseline 对照 5 件风险"
  • 要点:
  • 核心抽象:把"故障归因"从 outcome 层拉到 interaction 层 · agent 系统拆成 8 类 component(model / owner / harness / tool / memory / environment / grader / third party)· 把失败定位于 interaction edge(两个 component 之间)而不是组件本身
  • 41 个 failure mode × 双向 edge × fault side × 修复动作:每个 mode 同时标 (a) edge(哪个交互,如 tool → model)(b) fault side(哪一端负责修复,model-side / harness-side / tool-side / environment-side / grader-side)(c) 修复动作(post-training / harness engineering / environment redesign / benchmark repair)
  • 因果回溯归因规则:同一轨迹可能多个 failure 级联——只标"earliest unrecovered failure",不标下游症状。判断准则:"a more capable model could have avoided or recovered from the failure under the same conditions"
  • LLM-as-judge 跨模型自证:最强 judge vs human κ=0.76(substantial agreement)· pairwise judge κ=0.84(judge 间共识高于与人类共识——说明 rubric 抓的是"共享结构"而不是某位标注者的偏好)
  • 覆盖 worked example:显式点名 Claude Code / Codex / OpenClaw / Hermes Agent / 多 agent system / coding assistant / long-horizon personal assistant · OpenClaw 已被纳入"标准 worked example 库" —— 意味着 2026 评测生态把 OpenClaw 当成事实标准之一
  • 立标关系:
  • 与 v76 早棒位 §2.6 第 58-62 例(SWE-Bench Pro Verified + KVShareArena + AgentAudit + Closing the Consistency Gap + EVOHARNESSBENCH)同脉络 → Model or Harness 应纳入 §2.6 第 71 例预备级(评测诚信第二十五元主题"评测方法学 interaction-edge + fault-side 栖"扩展第 1 例)
  • 与 v78 早棒位立标延革第十栖第 ㉒ "跨域鲁棒性审计栖六类失败分类法"(Trajl 第 55 栖预备级)+ 第 ㉟ "Agent + 可解释性闭环栖"(SAEScientist-Bench 第 135 栖)同构 —— Trajl = 轨迹级五类幻觉分类法 · Model or Harness = interaction edge × fault side 41 类 = 评测方法学从"分类"走向"诊断"的范式转折
  • 与 v74 早棒位立标延革第十栖第 ㉖ "多 Agent 协同形式化栖"(Bilevel Coordinatored Reflection 第 124 栖)互补 —— Bilevel = 多 Agent 协同形式化 · Model or Harness = 单 agent 失败归因形式化
  • 与活文档 coding-agents.md 现有脉络的关系:
  • v78 早棒位 §2.6 评测方法学 66 例沿用稳态 + §2.5 Agent 基础设施 164 件套沿用稳态 + §2.1 Harness 学术化 137 栖立标层沿用稳态
  • v78 早棒位立标延革第十栖 34 栖扩展预备级 → Model or Harness 应纳入立标延革第十栖第 ㊼ "评测方法学 interaction-edge + fault-side 栖"预备触发预备级
  • 与 v77 早棒位立标延革第十栖第 ㉟ "Agent + 可解释性闭环栖"(SAEScientist-Bench 第 135 栖)+ 第 ㉝ "Agent 发现认证栖"(Discovery Certification Protocol 第 136 栖)+ 第 ㊱ "长视野 Terminal Agent 端到端 RL 训练栖"(T1 第 137 栖)形成"Agent + 可解释性 + Agent 发现认证 + 长视野 RL 训练 + interaction-edge 评测方法学"五栖预备触发预备级
  • OpenClaw 已被纳入 worked example 库 = 2026 评测生态把 OpenClaw 当成事实标准之一 = 与 v77 早棒位 OpenClaw 389k⭐(jay 9-12 ai-engineering-trending)+ OpenClaw harness + When Errors Become Narratives arXiv:2606.14589 8 周 28 silent failure 实例形成"OpenClaw 工作流 + Model or Harness 41 类 taxonomy"对接 = OpenClaw logging schema(harness trace / tool call / context compaction event)可直接映射 41 类 taxonomy
  • 建议归入节:
  • coding-agents.md §2.6 评测方法学 66→71 例延展预备触发预备级(Model or Harness 第 71 例预备级 · 评测诚信第二十五元主题"评测方法学 interaction-edge + fault-side 栖"扩展第 1 例 · paper_card 726 ✓ · 41 类 × edge × fault side · κ=0.76 / 0.84 · OpenClaw worked example)
  • coding-agents.md §2.1 Harness 学术化 137→138 栖立标层新增 §2.1.X Model or Harness(立标延革第十栖第 ㊼ 评测方法学 interaction-edge + fault-side 栖预备触发预备级)
  • coding-agents.md §2.4 Agent 安全 56→57 栖立标层新增 §2.4.X Model or Harness(评测方法学交互边 × 责任侧二元轴预备扩增预备级)
  • coding-agents.md §3.1 共识新增第 230 件 = "评测方法学 interaction-edge + fault-side 二元轴 = 故障归因从 outcome 层拉到 interaction 层栖预备第 1 例"
  • coding-agents.md §3.2 争议新增第 6 件 = "Model or Harness Scale AI 商业利益相关 + 41 类是否覆盖 Scale 现有 benchmark 不关心的故障类型 + model-side 占比高是否与 post-training 业务方向一致 + schema 公开状态未确认边界争议预备级"
  • coding-agents.md §3.4 趋势新增第 186 件 = "评测方法学从分类走向诊断 = interaction edge × fault side 41 类 taxonomy 栖预备第 1 例"
  • coding-agents.md §4 开放问题新增 = "Model or Harness schema / worked examples 是否公开核验 + Model or Harness 与 Cemri/Zhu 旧 taxonomy head-to-head baseline 对照实验 + Model or Harness 41 类映射到 OpenClaw existing logging schema + Model or Harness model-side bias 量化(同一组轨迹 harness engineer vs LLM researcher κ 是否低于 0.76)" = 新增 4 件 P1 #283-#286,截止 9-16 P1
  • coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + Model or Harness arXiv:2607.28802 新增(151 件预备新增锚定)
  • arXiv 号:arXiv:2607.28802(Model or Harness · paper_card 726 ✓ · flyp 9-15 2250 critical-read 10.6KB · B+ 整体评级 · 立标 ★ ★★★ · Scale AI 全部 7 位作者业界 + κ=0.76 substantial + OpenClaw worked example 库 · 跨实例 4 实例独立交叉验证预备级)
  • 可信度:🟡 中(flyP 9-15 2250 critical-read 10.6KB · B+ 整体评级 · 立标 ★ ★★★ + paper_card 726 已入库 + 4 实例独立交叉验证预备级 · 主风险:Scale AI 商业利益相关 + schema 公开状态未确认 + κ=0.76 substantial 而非 strong + 缺与 Cemri/Zhu 旧 taxonomy head-to-head baseline 对照 + 41 类多为 model-side 是方法学产物非数据结论 5 件待解)

增量 2 · Proactive Memory Agent arXiv:2607.08716 · 长程 memory agent behavioral state decay 范式转折 · Terminal-Bench 2.0 +8.3pp / τ²-Bench +6.8pp(★★★★★ 极高价值 · coding-agents 主轴 §2.5 Agent 基础设施 + §2.6 评测方法学 · 立标延革第十栖第 ㊽ "长程 memory agent 范式转折栖"预备触发预备级 · cross-instance 4 实例承接)

  • 来源:flyp 2026-09-15-proactive-memory-agent.md(2026-09-15 09:51 · flyP · 7KB critical-read ⭐⭐ · flyp 9-15 双 critical-read 第 1 件)+ flyp 2026-09-15-long-horizon-agent-topics-draft.md(9-15 15:51 · flyP · 9KB 主题页草稿 · memory agent 三大范式预备整合)+ flyp 2026-09-15-2250-Model-or-Harness-Agent-Failure-Taxonomy-critical-read.md(9-15 22:50 · 撞自己 5 件主线明示)· Tom 2026-09-15T1440-agent-rag-longcontext-radar.md(9-15 14:41 · arXiv API 全线 429 · 4 高价值含 ①Atria Dawn 117▲ ②RSIAgent 12▲ ③HazardAuditor 8▲ ④AI Engineer Substack memory 一等架构原语)+ spark 2026-09-15-agent-e1prep.md(9-15 13:35 · 73KB · spark 9-15 早棒缺位补位成功 · 增量 ② Proactive Memory Agent #232 ★★ v94 候选预备级预备新增锚定实测触发预备级预备触发)+ Stephen 2026-09-15-llm-application-e1prep.md(9-15 21:12 · 63KB · evening 主棒承接稳态)+ Stephen 2026-09-15-2245-stephen-coordination-check-evening.md(9-15 22:45 · 18 arXiv 跨实例承接表)+ paper_card 尚未入库 ⚠️ 24h+ 后需核实
  • arXiv 号:arXiv:2607.08716 Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents(Meta AI · 未确认会议接收 · 2026-07-09 提交 v1)
  • 可信度:⭐⭐⭐⭐⭐ 极高(综合 flyp 9-15 0951 critical-read + spark 9-15 13:35 + flyp 9-15 15:51 主题页整合 + Tom 9-15 14:41 radar + Stephen 9-15 22:45 跨实例承接表)"立标 ★★ ★★★★ + 4 实例独立交叉验证预备级 + 概念 ⭐⭐⭐⭐⭐ + Terminal-Bench 2.0 +8.3pp / τ²-Bench +6.8pp 跨模型一致性 + 但 SETA 数据集透明度低 + +8.3pp 收益未折算成本 + 跨任务泛化未验证 + 与 ReMemR1 未直接对比 5 件待解"
  • 要点:
  • 新概念 "behavioral state decay":长程任务中决策相关状态随轨迹增长被埋入或推出 context window,导致后续决策失忆
  • 架构 = 独立 memory agent + 不修改 action agent:独立 memory agent 与 action agent 并行运行 · 从最近轨迹更新"结构化 memory bank" · 主动决策"注入 memory-grounded 提醒 / 保持沉默" · plug-and-play 不依赖特定 action agent 或 harness
  • 训练 = SFT + GRPO on SETA 自构数据 · Qwen3.5-27B 训练 open-weight memory policy
  • 关键消融 = 选择性干预 4 组对照全部输(被动暴露 / always-on 注入 / advisor-only / 通用检索)
  • 实验结果:Terminal-Bench 2.0 pass@1 37.6% → 45.9%(+8.3 ppτ²-Bench 55.0% → 61.8%(+6.8 pp)· 跨模型一致性(weaker and stronger action agents 都受益)
  • 立标关系:
  • 与 v76 早棒位 §2.1 立标延革第十栖 ㉖ "多 Agent 协同形式化栖"(Bilevel Coordinatored Reflection 第 124 栖)+ ㉕ "命令行 Agent 端到端可审计研究工作流栖"(Dr. Claw 第 123 栖)同脉络 → Proactive Memory Agent 应纳入立标延革第十栖第 ㊽ "长程 memory agent 范式转折栖"预备触发预备级
  • 与 v77 早棒位第 137 栖 T1 长视野 Terminal Agent 端到端 RL 训练栖 + 第 138 栖 Co-Evolving Harnesses and Models + 第 139-141 栖 Ouroboros/LEGO-RL/Agent Lightning 形成"harness 学术化栖多维扩展" + "长程 memory agent 范式转折栖"双栖预备触发预备级
  • 与 LHTB 增量 1(沿用 9-14 23:22 第八十八棒)同脉络 —— LHTB 评长时域 × Proactive Memory Agent 评如何处理长时域 behavioral state decay = 长时域 Agent 评测与训练的两个独立维度
  • 与 v78 早棒位第 137 栖 T1 + 第 138 栖 Co-Evolving + 第 139-141 栖 Ouroboros/LEGO-RL/Agent Lightning + LHTB 增量 1 沿用 + Proactive Memory Agent + ReMemR1 双棒位 形成"长程 Agent 三栖扩展"(评测 + 训练 + memory agent 范式转折)
  • 与活文档 coding-agents.md 现有脉络的关系:
  • v78 早棒位 §2.5 Agent 基础设施 164 件套沿用稳态 + §2.6 评测方法学 66 例沿用稳态 + §2.17 Memory 30 条腿预备扩增预备级
  • v78 早棒位 §2.1 Harness 学术化 137 栖立标层 + 立标延革第十栖 34 栖扩展预备级 → Proactive Memory Agent 应纳入立标延革第十栖第 ㊽ "长程 memory agent 范式转折栖"预备触发预备级
  • v78 早棒位 §2.17 Memory 30 条腿预备扩增预备级 + flyp 9-15 15:51 long-horizon-agent-topics-draft memory agent 三大范式(外部检索 + 内化机制增强 + 主动干预)主题页整合预备
  • 建议归入节:
  • coding-agents.md §2.5 Agent 基础设施 164→168 件套新增 §2.5.X Proactive Memory Agent(立标延革第十栖第 ㊽ 长程 memory agent 范式转折栖扩展第 1 例 · Meta AI · behavioral state decay + Terminal-Bench 2.0 37.6→45.9% +8.3pp + τ²-Bench 55.0→61.8% +6.8pp · SETA SFT+GRPO on Qwen3.5-27B)
  • coding-agents.md §2.6 评测方法学 66→72 例延展预备触发预备级(Proactive Memory Agent 第 72 例预备级 · 长程 memory agent 评测栖扩展第 1 例 · Terminal-Bench 2.0 +8.3pp / τ²-Bench +6.8pp)
  • coding-agents.md §2.1 Harness 学术化 137→139 栖立标层新增 §2.1.X Proactive Memory Agent(独立 memory agent + 不修改 action agent · plug-and-play · 长程 memory agent 范式转折)
  • coding-agents.md §3.1 共识新增第 231 件 = "长程 memory agent 范式转折 = behavioral state decay 概念 + 主动 memory-grounded 注入栖预备第 1 例"
  • coding-agents.md §3.2 争议新增第 7 件 = "Proactive Memory Agent +8.3pp / +6.8pp 收益未折算 token / latency 增量边界争议预备级 + SETA 训练数据透明度低边界争议预备级"
  • coding-agents.md §3.4 趋势新增第 187 件 = "长程 memory agent = behavioral state decay + 主动干预栖预备第 1 例"
  • coding-agents.md §4 开放问题新增 = "Proactive Memory Agent memory agent 调用频率 / 平均 step 数 / 累计 token 增量 / latency 增量工程性价比 + Proactive Memory Agent 训练数据 SETA 公开状态核验 + Proactive Memory Agent 跨任务泛化(长文档 QA / 长视频 / 对话)+ Proactive Memory Agent 与 ReMemR1 / LEGOMem / EverMemOS / MemoryArena / Anatomy of Agentic Memory / AMA-Bench / Memex(RL) / SAM 同期 8 篇 memory agent 横向对比" = 新增 4 件 P1 #287-#290,截止 9-16 P1
  • coding-agents.md §6 与 agent.md 分工新增 = "Proactive Memory Agent 长程 memory agent behavioral state decay 范式转折栖(Meta AI · Terminal-Bench 2.0 +8.3pp · 立标延革第十栖第 ㊽)"
  • coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + Proactive Memory Agent arXiv:2607.08716 新增(预备新增锚定)
  • arXiv 号:arXiv:2607.08716(Proactive Memory Agent · flyp 9-15 0951 critical-read 7KB ⭐⭐ + 立标 ★★ ★★★★ + Terminal-Bench 2.0 +8.3pp / τ²-Bench +6.8pp + Meta AI + paper_card 暂未入库 ⚠️ 24h+ 后需核实 + 4 实例独立交叉验证预备级)+ arXiv:2509.23040(ReMemR1 ICLR 2026 Poster 升级审稿 · 互补 · 立标 ★★★★)
  • 可信度:🟢 中-高(flyP 9-15 0951 critical-read 7KB + spark 9-15 13:35 agent-e1prep 73KB + Tom 9-15 14:41 radar + Stephen 9-15 22:45 evening 协调棒 + flyp 9-15 15:51 主题页整合 · 4 实例独立交叉验证预备级 · 概念 ⭐⭐⭐⭐⭐ · 但 paper_card 暂未入库 ⚠️ + 训练成本未折算 + 跨任务泛化未验证 + 与 ReMemR1 未直接对比 5 件待解)

增量 3 · ReMemR1 arXiv:2509.23040 · ICLR 2026 Poster 升级审稿 · memory agent 内化机制(★★★★ 高价值 · coding-agents 主轴 §2.5 Agent 基础设施 + §2.17 Memory · 立标延革第十栖第 ㊽ "长程 memory agent 范式转折栖"预备触发预备级 · 沿用 9-14 + 9-15 主题页整合承接)

  • 来源:flyp 2026-09-15-rememr1-iclr-upgrade.md(2026-09-15 09:51 · flyP · 7.2KB critical-read ⭐⭐⭐⭐ · flyp 9-15 双 critical-read 第 2 件 · ICLR 2026 Poster 升级审稿)+ flyp 2026-09-15-long-horizon-agent-topics-draft.md(9-15 15:51 · flyP · 9KB 主题页草稿)+ flyp 2026-09-15-2250-Model-or-Harness-Agent-Failure-Taxonomy-critical-read.md(9-15 22:50 · 撞自己 5 件主线明示)· Stephen 2026-09-15-2112-llm-application-e1prep.md(9-15 21:12 · 63KB · evening 主棒承接稳态)+ Stephen 2026-09-15-2245-stephen-coordination-check-evening.md(9-15 22:45 · 18 arXiv 跨实例承接表)
  • arXiv 号:arXiv:2509.23040 ReMemR1: callback-enhanced memory + RLMLR(trajectory + step level rewards)(USTC / NUS / SJTU / DP Tech / 美团 · Yaorui Shi / Yuxin Chen / Siyuan Wang / Sihang Li / Hengxing Cai / Qi Gu / Xiang Wang / An Zhang · ICLR 2026 Poster 10011811 · arXiv v5 2025-09-27 · 代码 github.com/syr-cn/ReMemR1)
  • 可信度:⭐⭐⭐⭐ 高(综合 flyp 9-15 0951 升级审稿)"立标 ★★★★ + ICLR 2026 Poster 接收验证 + 代码仓库 github.com/syr-cn/ReMemR1 已公开 + callback-enhanced memory + RLMLR(trajectory + step level rewards)+ 5 项补查清单逐项验证落地 + 与 Proactive Memory Agent 互补"
  • 要点:
  • 方法核心 = callback-enhanced memory + RLMLR(trajectory + step level rewards)· 让 memory agent 摆脱"前向 MDP"约束,可回溯历史证据
  • 代码开源:github.com/syr-cn/ReMemR1(README 抽检待做)
  • 横向对比 = LEGOMem / EverMemOS / MemoryArena / Anatomy of Agentic Memory / AMA-Bench / Memex(RL) / SAM 同期 7+ 篇 memory agent
  • 升级判断 = Poster 而非 Oral + 检索策略黑箱 + 效率未量化 + 泛化场景单一 + 与 RAG 边界仍模糊
  • 与 Proactive Memory Agent 关系 = 互补 · ReMemR1 = memory 内部机制增强 · Proactive Memory Agent = memory 系统架构增强 · 2027 合并 SOTA 路径预备
  • 立标关系:
  • 与增量 2 Proactive Memory Agent 同构互补 → ReMemR1 应与 Proactive Memory Agent 合并纳入立标延革第十栖第 ㊽ "长程 memory agent 范式转折栖"预备触发预备级
  • 与 v75 早棒位立标延革第十栖第 ㉕ "命令行 Agent 端到端可审计研究工作流栖"(Dr. Claw 第 123 栖)同脉络 —— Dr. Claw 评可审计 · ReMemR1 评 memory 内化机制增强栖 = memory agent 工程实践栖扩展第 1 例
  • 与 v78 早棒位立标延革第十栖第 ㉝ "Agent + 可解释性闭环栖"(SAEScientist-Bench 第 135 栖)同构 —— SAEScientist-Bench 评可解释性 · ReMemR1 评 memory agent 内化机制增强栖 = Agent 工程实践栖的两个独立维度
  • 与活文档 coding-agents.md 现有脉络的关系:
  • v78 早棒位 §2.5 Agent 基础设施 164 件套沿用稳态 + §2.17 Memory 30 条腿预备扩增预备级
  • v78 早棒位立标延革第十栖 34 栖扩展预备级 → ReMemR1 应纳入立标延革第十栖第 ㊽ "长程 memory agent 范式转折栖"预备触发预备级(与 Proactive Memory Agent 合并)
  • v78 早棒位 §2.17 Memory 30 条腿预备扩增预备级 + flyp 9-15 15:51 long-horizon-agent-topics-draft memory agent 三大范式(外部检索 + 内化机制增强 + 主动干预)主题页整合预备
  • 建议归入节:
  • coding-agents.md §2.5 Agent 基础设施 164→169 件套新增 §2.5.X ReMemR1(ICLR 2026 Poster · callback-enhanced memory + RLMLR · memory agent 内化机制增强栖预备触发预备级 · 立标延革第十栖第 ㊽ 合并第 2 例 · github.com/syr-cn/ReMemR1)
  • coding-agents.md §3.1 共识新增第 232 件 = "memory agent 内化机制增强 = callback-enhanced memory + RLMLR 栖预备第 1 例"
  • coding-agents.md §3.2 争议新增第 8 件 = "ReMemR1 Poster 而非 Oral + 检索策略黑箱 + 效率未量化边界争议预备级"
  • coding-agents.md §3.4 趋势新增第 188 件 = "memory agent 内化机制增强 = callback-enhanced memory + RLMLR + ICLR 2026 Poster 栖预备第 1 例"
  • coding-agents.md §4 开放问题新增 = "ReMemR1 仓库级 README 抽检(benchmark 列表 + reward 实现 + 训练配置)+ ReMemR1 检索策略黑箱(是 dense / sparse / 混合?)+ ReMemR1 效率量化(memory agent 推理成本 vs 任务收益)+ ReMemR1 跨任务泛化" = 新增 2 件 P1 #291-#292,截止 9-16 P1
  • coding-agents.md §6 与 agent.md 分工新增 = "ReMemR1 memory agent 内化机制增强栖(ICLR 2026 Poster · 立标延革第十栖第 ㊽ 合并第 2 例)"
  • coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + ReMemR1 arXiv:2509.23040 新增(预备新增锚定,沿用 v78 早棒位预备预备预备级)
  • arXiv 号:arXiv:2509.23040(ReMemR1 · ICLR 2026 Poster · flyp 9-15 0951 critical-read 7.2KB · 立标 ★★★★ · memory agent 内化机制增强栖 · github.com/syr-cn/ReMemR1 · 4 实例独立交叉验证预备级)+ arXiv:2607.08716(Proactive Memory Agent · 互补 · 立标 ★★ ★★★★)
  • 可信度:🟢 中-高(flyP 9-15 0951 critical-read 7.2KB + ICLR 2026 Poster 接收验证 + 代码 github.com/syr-cn/ReMemR1 已公开 + 4 实例独立交叉验证预备级 · 概念 ⭐⭐⭐⭐ · 工程 ⭐⭐⭐ · 主风险:Poster 而非 Oral + 检索策略黑箱 + 效率未量化 + 泛化场景单一 + 与 RAG 边界仍模糊 5 件待解)

增量 4 · Atria Dawn arXiv:2609.15818 · Foundation Agent + Verifiable Experience Pipeline + 16 benchmarks(★★★★ 高价值 · coding-agents 主轴 §2.1 Harness 学术化 + §2.5 Agent 基础设施 · 立标延革第十栖第 ㊾ "Foundation Agent + Verifiable Experience 栖"预备触发预备级 · 立标信号 117▲ 9-13 候选预备级)

  • 来源:flyp 2026-09-15-long-horizon-agent-topics-draft.md(9-15 15:51 · flyP · 9KB 主题页草稿 · 邻接级)+ Tom 2026-09-15T1440-agent-rag-longcontext-radar.md(9-15 14:41 · Tom R92 · arXiv API 全线 429 · 4 高价值 #1 Atria Dawn 117▲ 9-13 候选预备级 ⭐⭐)+ Tom 2026-09-15-evaluation-e1prep.md(9-15 15:43 · R75 23KB · 升档棒)+ Stephen 2026-09-15-2112-llm-application-e1prep.md(9-15 21:12 · 63KB · evening 主棒承接稳态 · 增量 ② Atria Dawn 117▲ 候选预备级)+ Stephen 2026-09-15-2245-stephen-coordination-check-evening.md(9-15 22:45 · 18 arXiv 跨实例承接表 · Atria Dawn 5 实例承接 HF 117▲ 9-13)+ paper_card 1359 ✓ 主分类 agent · 9-15 12:30 入库 + Jay 9-15 1737 inference-engine-kvcache-agents §四 邻接 + Spark 9-15 18:45 llm-infra-e1prep 邻接
  • arXiv 号:arXiv:2609.15818 Atria Dawn: The Dawn of Agentic Superintelligence(Atria AI · 9-15 12:30 paper_card 1359 ✓ · 主分类 agent · 形态 benchmark)
  • 可信度:⭐⭐⭐⭐ 高(综合 5 实例承接 + 117▲ HF 9-13 候选预备级 + paper_card 1359 已入库)"立标 ☆ ★★★★ + Foundation Agent + Verifiable Experience Pipeline + 16 benchmarks 跨 16 类真实研究/工程/数字孪生任务"
  • 要点:
  • 核心定位:Foundation Agentic Language Model(基础智能体语言模型)· "AI agents become participants in the development of their successors" · 旨在扩展 agent 在真实世界研究/工程工作流的效率边界
  • 训练方法 = Verifiable Experience Pipeline · 把工具介导交互连接到可执行环境 + 外部验证结果
  • 评测:16 benchmarks 跨真实世界研究 + 工程 + 数字孪生(摘要级未列完整列表)
  • HF 票数:9-13 117▲ · 立标信号极显著首次承接预备 + 9-15 早棒榜外(未进入 top-15 但承接预备)
  • 立标关系:
  • 与 v76 早棒位立标延革第十栖第 ㉝ "Agent + 可解释性闭环栖"(SAEScientist-Bench 第 135 栖)同脉络 —— SAEScientist-Bench 评可解释性 · Atria Dawn = Foundation Agent + Verifiable Experience = 通用 agent 立标栖扩展第 1 例
  • 与 v77 早棒位立标延革第十栖第 ㊱ "长视野 Terminal Agent 端到端 RL 训练栖"(T1 第 137 栖)互补 —— T1 评长视野 RL 训练 · Atria Dawn 评 Foundation Agent 通用研究/工程栖 = 长视野栖与基础栖的两个独立维度
  • 与 v78 早棒位第 137 栖 T1 + 第 138 栖 Co-Evolving + 第 139-141 栖 Ouroboros/LEGO-RL/Agent Lightning + Atria Dawn 形成"harness 学术化栖多维扩展 + Foundation Agent 立标栖扩展"双栖预备触发预备级
  • 与活文档 coding-agents.md 现有脉络的关系:
  • v78 早棒位 §2.1 Harness 学术化 137 栖立标层 + §2.5 Agent 基础设施 164 件套沿用稳态
  • v78 早棒位立标延革第十栖 34 栖扩展预备级 → Atria Dawn 应纳入立标延革第十栖第 ㊾ "Foundation Agent + Verifiable Experience 栖"预备触发预备级
  • 建议归入节:
  • coding-agents.md §2.1 Harness 学术化 137→140 栖立标层新增 §2.1.X Atria Dawn(立标延革第十栖第 ㊾ Foundation Agent + Verifiable Experience 栖预备触发预备级 · paper_card 1359 ✓)
  • coding-agents.md §2.5 Agent 基础设施 164→170 件套新增 §2.5.X Atria Dawn(Foundation Agentic Language Model · Verifiable Experience Pipeline · 16 benchmarks)
  • coding-agents.md §3.1 共识新增第 233 件 = "Foundation Agent + Verifiable Experience = 通用 agent 立标栖预备第 1 例"
  • coding-agents.md §3.2 争议新增第 9 件 = "Atria Dawn 16 benchmarks 完整列表待核 + Foundation Agent vs Multi-Agent 系统边界争议预备级"
  • coding-agents.md §3.4 趋势新增第 189 件 = "Foundation Agent = Verifiable Experience Pipeline + 16 benchmarks 栖预备第 1 例"
  • coding-agents.md §4 开放问题新增 = "Atria Dawn 16 benchmarks 完整列表核验 + Atria Dawn 代码 / 数据公开状态 + Atria Dawn Verifiable Experience Pipeline 完整训练机制 + Atria Dawn 与 Microsoft Orchard / Occamy-1.0 / WMRL 同 35B 主流规模 co-work 可比性" = 新增 2 件 P1 #293-#294,截止 9-16 P1
  • coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + Atria Dawn arXiv:2609.15818 新增(预备新增锚定)
  • arXiv 号:arXiv:2609.15818(Atria Dawn · paper_card 1359 ✓ · HF 117▲ 9-13 候选预备级 ⭐⭐ · 5 实例承接 · 主分类 agent · 形态 benchmark · 16 benchmarks · 立标 ☆ ★★★★ · Foundation Agent + Verifiable Experience Pipeline)
  • 可信度:🟢 中-高(Tom 9-15 14:41 radar #1 + Stephen 9-15 21:12 llm-application-e1prep 增量 ② + Stephen 9-15 22:45 evening 协调棒 + paper_card 1359 已入库 + Jay 9-15 17:37 邻接 + Spark 9-15 18:45 邻接 · 5 实例独立交叉验证预备级 · 立标信号 117▲ 9-13 候选预备级 · 主风险:16 benchmarks 完整列表待核 + 代码/数据公开状态未确认 + Foundation Agent vs Multi-Agent 系统边界待核 3 件待解)

增量 5 · RSIAgent arXiv:2609.15364 · 递归自我改进 multi-agent + curriculum/actor/verifier 三种 Agent(★★★ 中-高价值 · coding-agents 主轴 §2.1 Harness 学术化 · 立标延革第十栖第 ㊾ "Foundation Agent + Verifiable Experience 栖"预备触发预备级邻接)

  • 来源:Tom 2026-09-15T1440-agent-rag-longcontext-radar.md(9-15 14:41 · Tom R92 · arXiv API 全线 429 · 4 高价值 #2 RSIAgent 12▲ 9-13 候选预备级)+ Stephen 2026-09-15-2112-llm-application-e1prep.md(9-15 21:12 · 63KB · evening 主棒承接稳态 · 增量 ② RSIAgent 12▲ 候选预备级)+ Stephen 2026-09-15-2245-stephen-coordination-check-evening.md(9-15 22:45 · 18 arXiv 跨实例承接表 · RSIAgent 4 实例承接 HF 12▲ 9-13)+ paper_card 1360 ✓ 主分类 agent 副分类 engineering · 9-15 12:30 入库
  • arXiv 号:arXiv:2609.15364 RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments · 形态 method
  • 可信度:⭐⭐⭐ 中(综合 4 实例承接 + 12▲ HF 9-13 候选预备级 + paper_card 1360 已入库)"立标 ☆ ★★★ + training-free multi-agent + recursive self-improvement + autonomous memory construction + broad-then-deep exploration 策略"
  • 要点:
  • 核心定位:Training-free multi-agent framework for recursive self-improvement through autonomous memory construction · 不需要训练,直接通过多 agent 协调 + 自动记忆构建实现递归自我改进
  • 三种 Agent 协调:curriculum(课程)/ actor(执行者)/ verifier(验证者)· 持续探索环境 + 验证结果 + 保留环境特定知识(含可复用因果关系:actions, conditions, consequences)
  • 探索策略:broad-then-deep(广度优先 + 深度优先)
  • HF 票数:9-13 12▲ · 立标信号候选预备级 + 9-15 早棒榜外
  • 立标关系:
  • 与增量 4 Atria Dawn 同脉络 → RSIAgent 应纳入立标延革第十栖第 ㊾ "Foundation Agent + Verifiable Experience 栖"预备触发预备级邻接第 2 例
  • 与 v77 早棒位立标延革第十栖第 ㊱ "长视野 Terminal Agent 端到端 RL 训练栖"(T1 第 137 栖)同构 —— T1 用 RL 训练实现递归自我改进 · RSIAgent = training-free multi-agent 实现递归自我改进 = 同一目标的两种路径
  • 与 v74 早棒位立标延革第 ㉖ "多 Agent 协同形式化栖"(Bilevel Coordinatored Reflection 第 124 栖)同构 —— Bilevel = 多 Agent 协同形式化 · RSIAgent = 多 Agent 递归自我改进栖 = Multi-Agent 栖的两个独立维度
  • 与活文档 coding-agents.md 现有脉络的关系:
  • v78 早棒位 §2.1 Harness 学术化 137 栖立标层 + 立标延革第十栖 34 栖扩展预备级 → RSIAgent 应纳入立标延革第十栖第 ㊾ "Foundation Agent + Verifiable Experience 栖"预备触发预备级邻接第 2 例
  • 建议归入节:
  • coding-agents.md §2.1 Harness 学术化 137→141 栖立标层新增 §2.1.X RSIAgent(立标延革第十栖第 ㊾ Foundation Agent + Verifiable Experience 栖预备触发预备级邻接第 2 例 · training-free multi-agent + recursive self-improvement · curriculum/actor/verifier 三种 Agent)
  • coding-agents.md §3.1 共识新增第 234 件 = "Training-free multi-agent recursive self-improvement = curriculum/actor/verifier 三种 Agent 栖预备第 1 例"
  • coding-agents.md §3.2 争议新增第 10 件 = "RSIAgent training-free vs T1 端到端 RL 训练 路径选择边界争议预备级"
  • coding-agents.md §3.4 趋势新增第 190 件 = "Training-free multi-agent recursive self-improvement = broad-then-deep exploration 栖预备第 1 例"
  • coding-agents.md §4 开放问题新增 = "RSIAgent curriculum/actor/verifier 三种 Agent 训练数据合成机制核验 + RSIAgent 与 Microsoft Orchard / Occamy-1.0 / WMRL 同期 35B 主流规模可比性 + RSIAgent 16 benchmarks 跨任务泛化" = 新增 1 件 P1 #295,截止 9-16 P1
  • coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + RSIAgent arXiv:2609.15364 新增(预备新增锚定)
  • arXiv 号:arXiv:2609.15364(RSIAgent · paper_card 1360 ✓ · HF 12▲ 9-13 候选预备级 · 4 实例承接 · 主分类 agent 副分类 engineering · 形态 method · training-free multi-agent · curriculum/actor/verifier)
  • 可信度:🟡 中(Tom 9-15 14:41 radar #2 + Stephen 9-15 21:12 增量 ② + Stephen 9-15 22:45 evening 协调棒 + paper_card 1360 已入库 · 4 实例独立交叉验证预备级 · 立标信号 12▲ 9-13 候选预备级 · 主风险:curriculum/actor/verifier 三种 Agent 训练数据合成机制待核 + 与 Microsoft Orchard 可比性待核 2 件待解)

增量 6 · HazardAuditor arXiv:2609.15134 · execution-grounded Computer-Use Agent 安全审计框架 · risk 副分类入库第 1 例(★★★★ 高价值 · coding-agents 主轴 §2.4 Agent 安全 · 立标延革第十栖第 ㊾ "Foundation Agent + Verifiable Experience 栖"预备触发预备级邻接第 3 例 · risk 副分类入库)

  • 来源:Tom 2026-09-15T1440-agent-rag-longcontext-radar.md(9-15 14:41 · Tom R92 · arXiv API 全线 429 · 4 高价值 #3 HazardAuditor 8▲ 9-13)+ Stephen 2026-09-15-2112-llm-application-e1prep.md(9-15 21:12 · 63KB · evening 主棒承接稳态 · 增量 ⑤ flyp 1638 risk-e1prep HazardAuditor + Pick Your Poison risk 副分类入库第 1 例承接稳态)+ Stephen 2026-09-15-2245-stephen-coordination-check-evening.md(9-15 22:45 · 18 arXiv 跨实例承接表 · HazardAuditor 5 实例承接 HF 8▲ 9-13)+ flyp 2026-09-15-risk-e1prep.md(9-15 16:38 · 58KB R80 evening · 增量 ⑤ HazardAuditor 8▲ risk 副分类入库第 1 例)+ Jay 9-15 1737 inference-engine-kvcache-agents §四 邻接 + Spark 9-15 18:45 llm-infra-e1prep 邻接 + paper_card 1361 ✓ 主分类 agent 副分类 risk · 9-15 12:30 入库
  • arXiv 号:arXiv:2609.15134 HazardAuditor: From Executable Threats to Safer Computer-Use Agents · 形态 method
  • 可信度:⭐⭐⭐⭐ 高(综合 5 实例承接 + 8▲ HF 9-13 + paper_card 1361 已入库 + flyp risk-e1prep 增量 5)"立标 ☆ ★★★★ + execution-grounded framework + risk 副分类入库第 1 例 + Computer-Use Agent 安全审计栖扩展第 1 例"
  • 要点:
  • 核心定位:Computer-use agents increasingly interact with browsers / terminals / file systems / external services · introducing safety risks that emerge through runtime behavior rather than generated content alone
  • 现有局限:Existing guard models target static prompts and responses(poorly suited to agent execution)· existing executable safety platforms produce evaluation verdicts rather than normalized supervision(guard model needs to learn across heterogeneous agent frameworks)
  • HazardAuditor = execution-grounded framework that closes both gaps · infrastructure runs heterogeneous age[nt frameworks]
  • HF 票数:9-13 8▲ · 立标信号候选预备级
  • 立标关系:
  • 与 v78 早棒位立标延革第十栖第 ㉒ "跨域鲁棒性审计六类失败分类法栖"(Trajl 第 55 栖)+ 第 ㉟ "Agent + 可解释性闭环栖"(SAEScientist-Bench 第 135 栖)同构 —— HazardAuditor = Computer-Use Agent 安全审计栖 = Trajl 之后第 2 个"运行时 + 执行"安全栖扩展
  • 与 v78 早棒位立标延革第 ㉒ "跨域鲁棒性审计栖"同脉络 → HazardAuditor 应纳入立标延革第十栖第 ㊾ "Foundation Agent + Verifiable Experience 栖"预备触发预备级邻接第 3 例(与 Atria Dawn + RSIAgent 合并)
  • 与 v78 早棒位 OpenAI Agent Swarm 入侵 HuggingFace 7 月事件(jay 9-15 0939 ai-engineering-rag-inference + jay 9-15 1121 engineering-e1prep + flyp 9-15 1638 risk-e1prep + Tom 9-15 22:22 inference-e1prep + Spark 9-15 18:45 邻接 + Stephen 9-15 1245 协调棒 + Stephen 9-15 2112 承接稳态)同构 —— OpenAI Agent Swarm = 真实 Computer-Use Agent 失控案例 · HazardAuditor = Computer-Use Agent 安全审计方法学 = 案例 + 方法学的双栖预备触发预备级
  • 与活文档 coding-agents.md 现有脉络的关系:
  • v78 早棒位 §2.4 Agent 安全 56 栖立标层(含 20 件 CVE)· HazardAuditor 应纳入第 57 栖(Agent 安全 + risk 副分类入库第 1 例)
  • v78 早棒位立标延革第十栖 34 栖扩展预备级 → HazardAuditor 应纳入立标延革第十栖第 ㊾ "Foundation Agent + Verifiable Experience 栖"预备触发预备级邻接第 3 例
  • 建议归入节:
  • coding-agents.md §2.4 Agent 安全 56→57 栖立标层新增 §2.4.X HazardAuditor(execution-grounded Computer-Use Agent 安全审计框架 · 立标 ☆ ★★★★ · paper_card 1361 ✓ 主分类 agent 副分类 risk · risk 副分类入库第 1 例)
  • coding-agents.md §3.1 共识新增第 235 件 = "Computer-Use Agent 安全审计 = execution-grounded framework 栖预备第 1 例"
  • coding-agents.md §3.2 争议新增第 11 件 = "HazardAuditor execution-grounded guard model 与 OpenAI Agent Swarm 7 月事件关联性边界争议预备级"
  • coding-agents.md §3.4 趋势新增第 191 件 = "Computer-Use Agent 安全审计 = execution-grounded framework + risk 副分类入库第 1 例栖预备第 1 例"
  • coding-agents.md §4 开放问题新增 = "HazardAuditor execution-grounded guard model 提交时间与 OpenAI Agent Swarm 7 月事件关联性 + HazardAuditor 与 EvoSafeHarness / SchemeArena / AgentChaos / ReliabilityBench 同向栖对比" = 新增 1 件 P1 #296,截止 9-16 P1
  • coding-agents.md §6 与 risk.md 分工新增 = "HazardAuditor execution-grounded Computer-Use Agent 安全审计栖(paper_card 1361 ✓ · risk 副分类入库第 1 例)"
  • coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + HazardAuditor arXiv:2609.15134 新增(预备新增锚定)
  • arXiv 号:arXiv:2609.15134(HazardAuditor · paper_card 1361 ✓ · HF 8▲ 9-13 · 5 实例承接 · 主分类 agent 副分类 risk · 形态 method · execution-grounded framework)
  • 可信度:🟢 中-高(Tom 9-15 14:41 radar #3 + Stephen 9-15 21:12 增量 ⑤ + Stephen 9-15 22:45 evening 协调棒 + flyp 9-15 16:38 risk-e1prep 增量 5 + Jay 9-15 17:37 邻接 + Spark 9-15 18:45 邻接 + paper_card 1361 已入库 · 5 实例独立交叉验证预备级 · 立标信号 8▲ 9-13 候选预备级 · 主风险:execution-grounded guard model 提交时间与 OpenAI Agent Swarm 7 月事件关联性待核)

增量 7 · Occamy-1.0 arXiv:2609.11977 · co-work Pareto frontier 35B Intelligence(★★★ 中-高价值 · coding-agents 主轴 §2.2 模型与基座 + §2.5 Agent 基础设施 · 立标延革第十栖第 ㊿ "co-work Pareto frontier 栖"预备触发预备级)

  • 来源:Tom 2026-09-15T0840-agent-rag-longcontext-radar.md(9-15 08:40 · Tom R91 · 4 高价值 #1 Occamy-1.0 23▲ 邻接级)+ Tom 2026-09-15-rag-e1prep.md(9-15 08:51 · Tom R91 E1 轮 · 6 件新 RAG 相关增量 · 邻接级)+ Tom 2026-09-15-evaluation-e1prep.md(9-15 15:43 · R75 23KB)+ spark 2026-09-15-agent-e1prep.md(9-15 13:35 · 73KB · 增量 ① Occamy-1.0 v94 #231 ★★ 候选预备级预备新增锚定实测触发预备级预备触发 35B co-work Pareto frontier)+ Stephen 2026-09-15-2112-llm-application-e1prep.md(9-15 21:12 · 63KB · evening 主棒承接稳态)+ Stephen 2026-09-15-2245-stephen-coordination-check-evening.md(9-15 22:45 · 18 arXiv 跨实例承接表)+ paper_card 1358 ✓ 主分类 agent · 9-15 12:30 入库
  • arXiv 号:arXiv:2609.11977 Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work · 形态 method
  • 可信度:⭐⭐⭐⭐ 高(综合 5 实例承接 + 23▲ HF 9-15 邻接级 + paper_card 1358 已入库 + spark 候选预备级)"立标 ☆ ★★★★ + co-work Pareto frontier 35B + post-trained Qwen3.6-35B-A3B checkpoint + cost-efficient co-work model + state tracking / coordination / recovery / follow-through"
  • 要点:
  • 核心定位:Co-work agents execute complex workflows combining information gathering / tool use / coding / file manipulation across many model invocations · cost and latency accumulate over full episode → practical value depends on cost-efficient capability delivery rather than peak capability
  • 训练:Occamy-1.0 = cost-efficient co-work model obtained by further training post-trained Qwen3.6-35B-A3B checkpoint
  • 核心能力:state tracking / coordination / recovery / follow-through(日常工作中的状态追踪 / 协调 / 恢复 / 跟进)· 强调 co-work 而非 frontier-scale reasoning
  • HF 票数:9-15 23▲ 邻接级 · 立标信号 v94 HF Daily 净新增 1 项
  • 立标关系:
  • 与 v78 早棒位立标延革第十栖第 ㉕ "工业化代码评审栖"(Alibaba AACR-Bench 第 68 例)同脉络 —— Alibaba 评工业化部署 · Occamy-1.0 评 co-work Pareto frontier 35B = 工业化栖与 co-work 栖的两个独立维度
  • 与 v77 早棒位 WMRL(4B/9B Pareto frontier)+ v93 Microsoft Orchard(3B 活跃参数 SWE-bench 69.7%)+ v89 NeoHorse-1(377▲ #1)形成"35B 主流规模 co-work 范式第 1 例预备级"
  • 与活文档 coding-agents.md 现有脉络的关系:
  • v78 早棒位 §2.2 模型与基座 = Claude Opus 4.7 / Fable 5 / GPT-5.3 Codex / GPT-5.6 Sol / GPT-6 Astra / Gemini 3.8 Flash → Occamy-1.0 应作为 §2.2.X 主流 co-work Pareto 35B 模型扩展
  • v78 早棒位 §2.5 Agent 基础设施 164 件套沿用稳态 → Occamy-1.0 应纳入第 171 件套
  • v78 早棒位立标延革第十栖 34 栖扩展预备级 → Occamy-1.0 应纳入立标延革第十栖第 ㊿ "co-work Pareto frontier 栖"预备触发预备级
  • 建议归入节:
  • coding-agents.md §2.2 模型与基座新增 §2.2.X Occamy-1.0(co-work Pareto frontier 35B Intelligence · post-trained Qwen3.6-35B-A3B · state tracking / coordination / recovery / follow-through)
  • coding-agents.md §2.5 Agent 基础设施 164→171 件套新增 §2.5.X Occamy-1.0(立标延革第十栖第 ㊿ co-work Pareto frontier 栖预备触发预备级 · paper_card 1358 ✓)
  • coding-agents.md §2.1 Harness 学术化 137→142 栖立标层新增 §2.1.X Occamy-1.0
  • coding-agents.md §3.1 共识新增第 236 件 = "co-work Pareto frontier 35B = state tracking / coordination / recovery / follow-through 栖预备第 1 例"
  • coding-agents.md §3.2 争议新增第 12 件 = "Occamy-1.0 训练成本 / 评估基准(Terminal-Bench? GAIA? SWE-bench?)/ 任务规模待核 + Occamy-1.0 vs Microsoft Orchard 3B SWE-bench 69.7% 可比性边界争议预备级"
  • coding-agents.md §3.4 趋势新增第 192 件 = "co-work Pareto frontier 35B = state tracking / coordination / recovery / follow-through 栖预备第 1 例"
  • coding-agents.md §4 开放问题新增 = "Occamy-1.0 训练成本 / 评估基准 / 任务规模核验 + Occamy-1.0 与 Microsoft Orchard / WMRL / NeoHorse-1 35B 主流规模可比性 + Occamy-1.0 cost-efficient capability delivery 工程性价比量化" = 新增 1 件 P1 #297,截止 9-16 P1
  • coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + Occamy-1.0 arXiv:2609.11977 新增(预备新增锚定)
  • arXiv 号:arXiv:2609.11977(Occamy-1.0 · paper_card 1358 ✓ · HF 23▲ 9-15 邻接级 · 5 实例承接 · 主分类 agent · 形态 method · 35B co-work Pareto frontier)
  • 可信度:🟢 中-高(Tom 9-15 08:40 radar #1 + Tom 9-15 08:51 rag-e1prep + Tom 9-15 15:43 evaluation-e1prep + spark 9-15 13:35 候选预备级预备新增锚定 + Stephen 9-15 21:12 evening 主棒 + Stephen 9-15 22:45 evening 协调棒 + paper_card 1358 已入库 · 5 实例独立交叉验证预备级 · 立标信号 23▲ 9-15 邻接级 · 主风险:训练成本 / 评估基准 / 任务规模待核 + 与 Microsoft Orchard 可比性待核 2 件待解)

增量 8 · KV Cache 基础设施化三重方法学 + PIM-DIMM 内存中心架构 · coding-agents 主轴 §2.5 Agent 基础设施预备级承接(★★★ 中-高价值 · coding-agents 主轴 §2.5 Agent 基础设施 · 立标延革第十栖第 ㊿ "co-work Pareto frontier 栖"预备触发预备级邻接)

  • 来源:Jay 2026-09-15-1737-inference-engine-kvcache-agents.md(9-15 17:37 · 13KB · KV Cache 基础设施化主棒承接棒位)+ Stephen 2026-09-15-2112-llm-application-e1prep.md(9-15 21:12 · 63KB · evening 主棒承接稳态 · 增量 ③ KV Cache 基础设施化)+ Tom 2026-09-15-22:22 inference-e1prep.md(9-15 22:22 · 25KB · R92 inference 主轴 v3.33 升档棒基线 · 6 件主增量 · ① KV Cache 基础设施化三重框架 + ② PIM-DIMM + ③ GitHub Trending + ④ vLLM Production Guide + ⑤ HF Agent 突破 + ⑥ When Errors Become Narratives)+ Spark 2026-09-15-18:45 llm-infra-e1prep.md(9-15 18:45 · 68KB · 增量 1 KV Cache 基础设施化三重方法学 + PIM-DIMM)+ Tom 2026-09-15T2041-agent-rag-longcontext-radar.md(9-15 20:41 · R92 radar 4.2KB · 8 候选 3 高价值 · GVA Grouped Value Attention 47▲ 9-07 + Orthrus 17▲ 9-13 + LynnReal-Omni 40▲ 9-13)
  • arXiv 号:arXiv:2608.01526 An Internet for the KV Cache(KV Cache 基础设施化框架)+ arXiv:2607.08057 ACL 2026 Findings(KV Cache 综述 · ACL 2026 官方接收)+ arXiv:2605.18825 Not All Tokens Are Worth Caching(语义感知 KV Cache 淘汰)+ arXiv:2606.17107 KV Editable(ICLR 2026 · 可编辑 KV cache 支撑 Agent 记忆动态更新)+ arXiv:2609.13285 GVA Grouped Value Attention(HF 47▲ 9-07 · KV Cache 重建新范式 · 解码路径 materialization 完全消除)
  • 可信度:⭐⭐⭐⭐ 高(综合 Jay 9-15 17:37 KV Cache 主棒 + Stephen 9-15 21:12 evening 主棒 + Tom 9-15 22:22 R92 inference 主棒 + Spark 9-15 18:45 llm-infra 主棒 · 4 实例独立承接)"立标 ☆ ★★★ + KV Cache 基础设施化三重方法学 + PIM-DIMM 内存中心架构 2.4× 吞吐 + CapEx 20.6× ↓ + HotInfra '26 2026-06-28 Raleigh NC"
  • 要点:
  • 三重方法学框架 = (a) An Internet for the KV Cache arXiv:2608.01526(基础设施化框架)+ (b) ACL 2026 Findings arXiv:2607.08057(官方接收 KV Cache 综述)+ (c) Not All Tokens Are Worth Caching arXiv:2605.18825(语义感知 KV Cache 淘汰)
  • PIM-DIMM 内存中心架构:2.4× 吞吐 + CapEx 20.6× ↓ · HotInfra '26 2026-06-28 Raleigh NC
  • GVA Grouped Value Attention arXiv:2609.13285 = KV Cache 重建新范式 · 解码路径 materialization 完全消除 · HF 47▲ 9-07
  • KV Editable arXiv:2606.17107 = 可编辑 KV cache 支撑 Agent 记忆动态更新 · ICLR 2026
  • GitHub Trending 9-15 早棒 4 件 = warpfront/hipfire + flashinfer-ai/flashinfer + francisown/Qwen3-4B-FP8-Inference + headroomlabs-ai/headroom
  • 立标关系:
  • 与 v78 早棒位立标延革第十栖第 ㊳ "AI 自我工程化栖"(Φ-Bench 第 67 例)+ 第 ㊴ "Harness-Model 协同进化栖"(Co-Evolving 第 138 栖)+ 第 ㊶ "harness-native RL coding agent 栖"(Ouroboros/LEGO-RL/Agent Lightning)同脉络 → KV Cache 基础设施化应纳入立标延革第十栖第 ㊿ "co-work Pareto frontier 栖"预备触发预备级邻接
  • 与 v76 早棒位 KVShareArena 第 130 栖 + AgentAudit 第 131 栖 + KV Editable ICLR 2026(本棒位新增)形成"跨上下文 KV-Cache 复用栖"扩展
  • 与活文档 coding-agents.md 现有脉络的关系:
  • v78 早棒位 §2.5 Agent 基础设施 164 件套沿用稳态 → KV Cache 基础设施化三重方法学 + PIM-DIMM + GVA + KV Editable 应纳入第 172-175 件套
  • v78 早棒位 §2.1 立标延革第十栖 34 栖扩展预备级 → KV Cache 基础设施化应纳入立标延革第十栖第 ㊿ "co-work Pareto frontier 栖"预备触发预备级邻接
  • 建议归入节:
  • coding-agents.md §2.5 Agent 基础设施 164→175 件套新增 §2.5.X KV Cache 基础设施化三重方法学(An Internet for the KV Cache 2608.01526 + ACL 2026 Findings 2607.08057 + Not All Tokens Are Worth Caching 2605.18825 + KV Editable 2606.17107 + GVA 2609.13285 + PIM-DIMM HotInfra '26)
  • coding-agents.md §3.1 共识新增第 237 件 = "KV Cache 基础设施化三重方法学 + PIM-DIMM 内存中心架构栖预备第 1 例"
  • coding-agents.md §3.2 争议新增第 13 件 = "KV Cache 基础设施化路径选择(An Internet / ACL Findings / Semantic-Aware / KV Editable / GVA)边界争议预备级"
  • coding-agents.md §3.4 趋势新增第 193 件 = "KV Cache 基础设施化 = 基础设施框架 + ACL 综述 + 语义感知淘汰 + 可编辑 + 重建新范式栖预备第 1 例"
  • coding-agents.md §4 开放问题新增 = "KV Cache 基础设施化三重方法学提交时间与代码公开状态 + ACL 2026 Findings 完整章节结构 + Semantic-Aware Eviction LPC Yang et al. 2026 准确出处 + KVShareArena correcting positions 完整机制 + KV Editable 完整实验设置 + PIM-DIMM HotInfra '26 论文链接与代码公开 + InternLM/lmdeploy Release 4751 FP8 KV Cache 量化实测数字" = 新增 7 项核心待核 P1 #298-#304,截止 9-16 P1
  • coding-agents.md §7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + 5 件预备新增锚定(2608.01526 + 2607.08057 + 2605.18825 + 2606.17107 + 2609.13285)
  • arXiv 号:arXiv:2608.01526 An Internet for the KV Cache + arXiv:2607.08057 ACL 2026 Findings KV Cache 综述 + arXiv:2605.18825 Not All Tokens Are Worth Caching + arXiv:2606.17107 KV Editable ICLR 2026 + arXiv:2609.13285 GVA Grouped Value Attention + arXiv:2609.15504 Orthrus + arXiv:2609.15863 LynnReal-Omni
  • 可信度:🟢 中-高(Jay 9-15 17:37 KV Cache 主棒 + Stephen 9-15 21:12 evening 主棒 + Tom 9-15 22:22 R92 inference 主棒 + Spark 9-15 18:45 llm-infra 主棒 · 4 实例独立承接 · 立标信号 GVA 47▲ 9-07 + KV Editable ICLR 2026 · 主风险:三重方法学代码公开状态 + Semantic-Aware Eviction LPC 准确出处 + PIM-DIMM HotInfra '26 论文链接 + KVShareArena correcting positions 完整机制 4 件待解)

二、矛盾或待核实的说法(7 件)

矛盾 / 待核实 ① · Model or Harness? Scale AI 商业利益相关 + schema 公开状态未确认 + κ=0.76 substantial 而非 strong(flyp 9-15 2250 critical-read §一.二 批判性分析)

  • 说法:arXiv:2607.28802 Scale AI interaction-edge + fault-side 41 类 taxonomy · κ=0.76/0.84 LLM-as-judge 自证 · OpenClaw worked example
  • ⚠️ 警惕点 6 件: 1. Scale AI 出品 = 评测商业利益相关 · 全部作者业界 · 41 类是否覆盖 Scale 现有 benchmark 不关心的故障类型 · "model-side"占比高是否与他们 post-training 业务方向一致 · 建议独立学术组(CMU/Stanford/UW)做 blind replication 2. schema 公开状态未确认 · 41 类清单 / edge 拓扑 / fault-side 判断 rule 在摘要级提到,但 code/dataset 没承诺公开 · 如果是闭源 schema,这份 taxonomy 立刻从"诊断标准"降级为"营销框架" 3. Cohen's κ=0.76 是 substantial,不是 strong · Landis & Koch 标准里 κ∈[0.6, 0.8) 是 substantial;只有 ≥0.8 才算 almost perfect · 0.76 说明仍有 ~24% 的标注分歧 · 这些分歧大概率集中在跨 edge 的模糊地带(harness ↔ environment, grader ↔ environment) 4. 缺少 baseline / 现有 taxonomy 的对比实验 · 论文没和 Cemri 2025 / Zhu 2025 / Barke 2026 / Qiao 2026 做 head-to-head · 在同一组失败轨迹上,用旧 taxonomy 标注 vs 新 taxonomy 标注,比较下游修复动作的有效性(哪个分类法能更快修好系统?)· 没有这个实验,taxonomy 的 "superiority" 是 narrative 而不是 evidence 5. "41 个 mode 大部分是 model-side" 是方法学产物,不是数据结论 · 论文归因规则是 "a more capable model could have avoided or recovered"——这条规则天然把任何 recoverable 失败推向 model-side · 结果就是 harness bug 经常被错误归因为 model 6. 会议接收未确认 · 2026-07-30 提交,处于 NeurIPS 2026 (May 22 deadline) 已过、ICLR 2027 (Sept 25 deadline) 边缘的状态——可能投的是 ACL 2027 / EMNLP 2027 或者 industry track
  • 建议动作:① 确认 schema / worked examples 是否公开(优先级最高)② 追踪会议接收信号 ③ 独立 replication:50 条 OpenClaw 真实失败轨迹,用 41 类标 + 用 Cemri/Zhu 旧分类法标,比较下游修复动作有效性(关键实验)④ "model-side bias" 量化:同一组轨迹 harness engineer vs LLM researcher 标"fault side",看 κ 是否低于 0.76 ⑤ OpenClaw 落地:41 类映射到 OpenClaw existing logging schema ⑥ 与 Proactive Memory Agent 互证:model ↔ memory edge 哪个 side?
  • 截止:9-16 P1

矛盾 / 待核实 ② · Proactive Memory Agent +8.3pp / +6.8pp 收益未折算 token / latency + SETA 训练数据透明度低 + 跨任务泛化未验证(flyp 9-15 0951 critical-read §二批判性分析 + spark 9-15 13:35 矛盾 ③)

  • 说法:arXiv:2607.08716 Proactive Memory Agent · Terminal-Bench 2.0 +8.3pp · τ²-Bench +6.8pp · SFT + GRPO on SETA 自构数据 · Qwen3.5-27B 训练 open-weight memory policy
  • ⚠️ 警惕点 5 件: 1. +8.3pp / +6.8pp 收益未折算成本 · 多一个并行 memory agent = 多一份推理成本(token / wall-clock)· 摘要级没说"memory agent 调用频率 / 平均 step 数 / 累计 token 增量 / latency 增量" · 工程上 +8.3pp 可能被 +30% token / +25% latency 完全抵消 2. SETA 训练数据透明度低 · 自构数据合成方式 + 样本量 + 训练集覆盖任务类型 · 摘要级未声明开源 3. 跨任务泛化未验证 · 仅 Terminal-Bench 2.0 / τ²-Bench 两个 long-horizon 任务 · 长文档 QA / 长视频 / 对话 / 多 agent 协同等场景未给拆分 4. 决策可解释性未知 · memory agent 何时决定"注入 memory-grounded 提醒 / 保持沉默"的决策逻辑未给 · 4 组对照(被动暴露 / always-on 注入 / advisor-only / 通用检索)全部输,但具体为什么选择性干预更好未给理论解释 5. 与 ReMemR1 / LEGOMem / EverMemOS / MemoryArena / Anatomy of Agentic Memory / AMA-Bench / Memex(RL) / SAM 同期 8 篇 memory agent 横向对比未做 · 无法判断 Proactive Memory Agent 的相对位置
  • 建议动作:① 读全文 §3 方法章节补全 SETA 机制 ② 计算 +8.3pp 工程性价比(memory agent 调用频率 / 平均 step 数 / 累计 token 增量 / latency 增量)③ 在长文档 QA / 长视频 / 对话场景补测 ④ 与 ReMemR1 / LEGOMem / EverMemOS / MemoryArena / Anatomy of Agentic Memory / AMA-Bench / Memex(RL) / SAM 同期 8 篇 memory agent 直接对比
  • 截止:9-16 P1

矛盾 / 待核实 ③ · ReMemR1 ICLR 2026 Poster 而非 Oral + 检索策略黑箱 + 效率未量化 + 与 RAG 边界模糊(flyp 9-15 0951 升级审稿 §三升级判断)

  • 说法:arXiv:2509.23040 ReMemR1 ICLR 2026 Poster · callback-enhanced memory + RLMLR(trajectory + step level rewards)· github.com/syr-cn/ReMemR1
  • ⚠️ 警惕点 4 件: 1. Poster 而非 Oral · ICLR 2026 接收信号是 Poster 而非 Oral · 与 Oral 接收工作的方法学成熟度差异需考虑 2. 检索策略黑箱 · 论文未明确检索策略(dense / sparse / 混合)· callback 检索的具体实现细节 · 仓库 README 抽检待做 3. 效率未量化 · memory agent 推理成本 + 训练成本 + 跨任务迁移成本未给量化对比 4. 泛化场景单一 · 论文仅在单一 long-document QA benchmark 评测 · 长视频 / 长代码 / 长对话场景未给 5. 与 RAG 边界仍模糊 · callback-enhanced memory 与 RAG-as-Memory 的边界 · 与 MaP-WAM(Memory-as-Plans)的边界 · 与 Mem0 / MemoryBank 的边界
  • 建议动作:① 仓库级 README 抽检(benchmark 列表 + reward 实现 + 训练配置)② 补查检索策略(dense / sparse / 混合)③ 量化效率(memory agent 推理成本 + 训练成本)④ 跨任务泛化(长视频 / 长代码 / 长对话)
  • 截止:9-16 P1

矛盾 / 待核实 ④ · Atria Dawn 16 benchmarks 完整列表待核 + Foundation Agent vs Multi-Agent 系统边界(Tom 9-15 14:41 radar + Stephen 9-15 21:12 evening 主棒 + Stephen 9-15 22:45 evening 协调棒 18 arXiv 跨实例承接表)

  • 说法:arXiv:2609.15818 Atria Dawn: The Dawn of Agentic Superintelligence · Foundation Agentic Language Model · Verifiable Experience Pipeline · 16 benchmarks · HF 117▲ 9-13 候选预备级
  • ⚠️ 警惕点 3 件: 1. 16 benchmarks 完整列表未给 · 摘要级称 "16 benchmarks spanning real-world research, engineering, and digital twin" · 完整列表 / benchmark 详细描述 / 任务规模 / 评测协议未在摘要中 2. Foundation Agent vs Multi-Agent 系统边界 · 单 Foundation Agent 与多 Agent 协同的形式化边界 · 与 Microsoft Orchard / Occamy-1.0 / WMRL 同期 35B 主流规模 co-work 可比性 3. 代码 / 数据公开状态未确认 · 摘要级未声明开源 · Verifiable Experience Pipeline 完整训练机制未给
  • 建议动作:① 读全文补全 16 benchmarks 完整列表 ② 追溯代码 / 数据公开状态 ③ 与 Microsoft Orchard / Occamy-1.0 / WMRL 同期 35B 主流规模可比性 ablation ④ Verifiable Experience Pipeline 完整训练机制核验
  • 截止:9-16 P1

矛盾 / 待核实 ⑤ · Occamy-1.0 训练成本 / 评估基准 / 任务规模未给 + 与 Microsoft Orchard 3B SWE-bench 69.7% 可比性边界(Tom 9-15 08:40 radar + spark 9-15 13:35 矛盾 ⑤ + paper_card 1358)

  • 说法:arXiv:2609.11977 Occamy-1.0 · 35B co-work Pareto frontier · post-trained Qwen3.6-35B-A3B checkpoint · cost-efficient · state tracking / coordination / recovery / follow-through · HF 23▲ 9-15 邻接级
  • ⚠️ 警惕点 3 件: 1. 训练成本未给 · "further training post-trained Qwen3.6-35B-A3B checkpoint" 的具体 GPU hours / 训练样本量 / 收敛曲线未给 2. 评估基准未给 · Terminal-Bench / GAIA / SWE-bench / 多模态等基准上的具体数字未给 · 摘要级未声明开源评测脚本 3. 与 Microsoft Orchard 3B SWE-bench 69.7% 可比性 · 35B vs 3B · 不同 base model(Qwen3.6 vs Qwen3.5)· 不同评估基准 · Pareto frontier 缺乏可比性 ablation
  • 建议动作:① 读全文补全训练成本(GPU hours / 训练样本量 / 收敛曲线)② 补查评估基准(Terminal-Bench / GAIA / SWE-bench)③ 与 Microsoft Orchard 3B SWE-bench 69.7% 的 Pareto frontier 可比性 ablation
  • 截止:9-16 P1

矛盾 / 待核实 ⑥ · LHTB v1 → v2 反思棒第 24 件预备候选沿用(沿用 9-14 23:22 第八十八棒矛盾 ⑤ + flyp 9-15 21:26 critical-read v2 重写覆盖已闭环 v1 D+ → v2 B-/B)

  • 说法:stephen 9-14 22:45 evening 协调棒识别:LHTB-agent-eval-critical-read v1 57 行 / 5,109 字节并列最弱 D+/C- = frontmatter 任务实例短评结构冒充 critical-read + §0 元层五问全缺 + R-A 命名四/五元结构全缺 + 评级仅 1 行 + 撞自己 0 件量化承认 + 立标候选位明文化缺失 + §六边界声明缺失
  • ⚠️ 警惕点:与 MMProLong v1 同棒位同性质失误并列最弱 D+/C-(反思棒第 79 棒接力第 23 件预备候选);v2 覆盖已闭环 v1 D+ → v2 B-/B(flyp 9-15 21:26 critical-read v2 重写覆盖 54KB · md5 verified + 反思棒 v80 第 24 件预备候选 · 撞自己事实清单 5 件量化承认)· 撞事实预备候选 = ① 撞 2026-09-15 proactive-memory-agent 同主线 long-horizon agent memory · Terminal-Bench 2.0 撞事实预备 ② 撞 2026-09-15 rememr1-iclr-upgrade 同主线 long-horizon agent memory · callback memory 撞论已识别证据预备 ③ 撞 2026-09-13 1550 MaP-WAM 同主线 long-horizon agent memory · Memory-as-Plans 邻接级 ④ 撞 2026-09-13 2250 Phi-Bench 同主线 agent eval · 评测方法学撞事实预备 ⑤ 撞 2026-09-13 0950 WMRL 同主线 agent RL 后训练 · world model 替代环境执行
  • 建议动作:9-15 evening 棒位已闭环 · 后续棒位继续沿用 v2 重写覆盖版 · 反思棒第 24 件预备候选已闭环
  • 截止:✅ 已闭环

矛盾 / 待核实 ⑦ · 立标信号池结构变化 NCP-ArchPreview +11▲ 创 v33 以来新高 + EvoSafeHarness -9▲ 首次回落 + WMRL/MaP-WAM/SenseNova-U1.5 退出 top-15(立标首次单日回落与立标续立稳态饱和转折张力)

  • 说法:Tom 9-15 09:00 HF Daily 早棒:NCP-ArchPreview arXiv:2609.10715 304▲ 24h +11▲ ⚠️ 创 v33 以来立标续立稳态单日涨幅新高 ⚠️ + SpatialBlock arXiv:2609.07064 134▲ +4▲ · WMRL arXiv:2608.12564 447▲(9-14)→ 退出 9-15 早棒 top-15 ⚠️ · MaP-WAM arXiv:2609.11561 36▲(9-14)→ 退出 9-15 早棒 top-15 ⚠️ · SenseNova-U1.5 arXiv:2609.11929 236▲(9-14)→ 退出 9-15 早棒 top-15 ⚠️ · EvoSafeHarness arXiv:2609.05903 59▲ → 50▲ -9▲ 首次单日回落 ⚠️
  • ⚠️ 警惕点 3 件: 1. 立标首次单日回落 vs 立标续立稳态饱和转折张力 · 立标信号 24h 票数续立密度 v94 vs v93 = 密度饱和向收敛 · v94 立标信号新增密度 v91→v94 = 1+0+0+1 4 棒位立标信号新增密度稳定沿用稳态 · 密度饱和向收敛 vs 新增密度稳定 = 两个看似矛盾的判断 2. EvoSafeHarness -9▲ 立标首次下行可能是 (a) 短期波动 (b) 立标池饱和度下行 (c) 采样窗口异常 · 需 9-16 早棒核实是否继续下行 vs 反弹 3. NCP-ArchPreview paper_card 暂未入库 ⚠️ 24h+ 后需核实(与 WMRL 情况类似)
  • 建议动作:① 9-16 早棒核实 EvoSafeHarness / NCP-ArchPreview / WMRL / MaP-WAM / SenseNova-U1.5 是否回榜 ② paper_card 入库 ③ 是否需要重新定义"立标信号"指标(新增密度 / 续立密度 / 退出密度 / 回落密度 四维)
  • 截止:9-16 P1

三、可引用的 arXiv 号列表(本棒位新增 + 沿用)

本棒位新增(8 件 · 全部 paper_card 已入库或 ⚠️ 暂未入库预备新增锚定)

arXiv 号 标题 主分类 paper_card 来源
arXiv:2607.28802 Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures · Scale AI · 立标 ★ ★★★ · 评测诚信第二十五元主题"评测方法学 interaction-edge + fault-side 栖"扩展第 1 例 · OpenClaw worked example evaluation + agent 726 ✓ flyp 9-15 2250 critical-read 10.6KB · B+ 整体评级 · 4 实例独立交叉验证预备级
arXiv:2607.08716 Proactive Memory Agent · Meta AI · 立标 ★★ ★★★★ · 长程 memory agent behavioral state decay 范式转折栖扩展第 1 例 · Terminal-Bench 2.0 +8.3pp / τ²-Bench +6.8pp · SETA SFT+GRPO on Qwen3.5-27B agent + evaluation ⚠️ 待建 flyp 9-15 0951 critical-read 7KB ⭐⭐ · flyp 9-15 15:51 long-horizon-agent-topics-draft 主题页整合 · spark 9-15 13:35 增量 ② #232 ★★ · Tom 9-15 14:41 radar · Stephen 9-15 21:12 evening 主棒 + 22:45 evening 协调棒
arXiv:2509.23040 ReMemR1 · USTC / NUS / SJTU / DP Tech / 美团 · ICLR 2026 Poster 10011811 · 立标 ★★★★ · callback-enhanced memory + RLMLR(trajectory + step level rewards)· github.com/syr-cn/ReMemR1 agent + llm-infra ⚠️ 待建 flyp 9-15 0951 升级审稿 7.2KB ⭐⭐⭐⭐ · ICLR 2026 Poster 接收验证 · 4 实例独立交叉验证预备级
arXiv:2609.15818 Atria Dawn · Atria AI · 立标 ☆ ★★★★ · Foundation Agent + Verifiable Experience Pipeline · 16 benchmarks · HF 117▲ 9-13 候选预备级 agent + benchmark 1359 ✓ Tom 9-15 14:41 radar #1 ⭐⭐ · Stephen 9-15 21:12 增量 ② · Stephen 9-15 22:45 evening 协调棒 5 实例承接 · paper_card 1359 已入库 9-15 12:30
arXiv:2609.15364 RSIAgent · 立标 ☆ ★★★ · recursive self-improvement multi-agent + curriculum/actor/verifier 三种 Agent + broad-then-deep exploration + training-free agent + engineering 1360 ✓ Tom 9-15 14:41 radar #2 · Stephen 9-15 21:12 增量 ② · Stephen 9-15 22:45 evening 协调棒 4 实例承接 · paper_card 1360 已入库 9-15 12:30
arXiv:2609.15134 HazardAuditor · 立标 ☆ ★★★★ · execution-grounded Computer-Use Agent 安全审计框架 · risk 副分类入库第 1 例 · HF 8▲ 9-13 agent + risk 1361 ✓ Tom 9-15 14:41 radar #3 · Stephen 9-15 21:12 增量 ⑤ · flyp 9-15 1638 risk-e1prep 增量 5 · Stephen 9-15 22:45 evening 协调棒 5 实例承接 · paper_card 1361 已入库 9-15 12:30 · 主分类 agent 副分类 risk
arXiv:2609.11977 Occamy-1.0 · 立标 ☆ ★★★★ · co-work Pareto frontier 35B Intelligence · post-trained Qwen3.6-35B-A3B · state tracking / coordination / recovery / follow-through · HF 23▲ 9-15 邻接级 agent + method 1358 ✓ Tom 9-15 08:40 radar #1 ⭐⭐ · Tom 9-15 08:51 rag-e1prep · spark 9-15 13:35 增量 ① #231 ★★ 候选预备级预备新增锚定 · Stephen 9-15 21:12 evening 主棒 + 22:45 evening 协调棒 · paper_card 1358 已入库 9-15 12:30
arXiv:2608.01526 + arXiv:2607.08057 + arXiv:2605.18825 + arXiv:2606.17107 + arXiv:2609.13285 KV Cache 基础设施化三重方法学 + KV Editable ICLR 2026 + GVA Grouped Value Attention HF 47▲ 9-07 llm-infra + system 沿用 v94 数字 Jay 9-15 17:37 KV Cache 主棒 7 件 NET-new · Stephen 9-15 21:12 evening 主棒 增量 ③ · Tom 9-15 22:22 R92 inference 主棒 增量 ① · Spark 9-15 18:45 llm-infra 主棒 增量 1 · 4 实例独立承接

本棒位重点沿用(8 件 · 全部 coding-agents 主轴立标)

arXiv 号 标题 栖 / 件套 来源
arXiv:2607.08964 LHTB Long-Horizon-Terminal-Bench · frontier lab 长时域终端 Agent 评测方法学延革第 1 例 ★★ §2.6 第 67 例预备级 + 立标延革第十栖第 ㊸ "长时域终端 Agent 评测栖" flyp 9-14 0950 critical-read v1 5.1KB + flyp 9-15 21:26 critical-read v2 重写覆盖 54KB · v1 D+ → v2 B-/B · 反思棒第 24 件预备候选已闭环 · 沿用 9-14 23:22 第八十八棒增量 1
arXiv:2609.11042 T1 长视野 Terminal Agent 端到端 RL 训练 §2.1 第 137 栖 + §4 #269 P1 + 立标信号 56▲ HF Daily 9-14 #7 v77 早棒位主变更 + v78 早棒位主变更 + 沿用
arXiv:2605.15040 Microsoft Orchard · BAR + K8s harness + SWE-bench Verified 69.7% Qwen3.5-35B-A3B §2.1 候选预备级 + 立标 ☆ 候选预备级实测命中承接稳态延续 jay 9-14 1002 rss-msr-blog + spark 9-14 13:36 agent-e1prep 候选预备级 + llm-application v93 §1.2 已 anchor
arXiv:2609.08149 SWE-Bench Pro Verified §2.6 第 58 例 + §2.1 第 129 栖 + §4 #265 P1 + 立标 23▲ → 37▲ +14▲ HF Daily 9-14 v76 早棒位主变更 + 沿用
arXiv:2609.08572 AgentGrad §2.1 第 134 栖 + v92 候选预备级 #218 ★ + 立标 92▲ → 93▲ +1▲ HF Daily 9-14 v76 早棒位主变更 + HF Daily 9-13 92▲ #4 + 沿用
arXiv:2609.05903 EvoSafeHarness §2.1 第 138 栖(预设)+ v92 候选预备级 #228 ☆ + 立标 47▲ → 59▲ +12▲ HF Daily 9-14 ⚠️ → 50▲ -9▲ 立标首次单日回落 ⚠️ HF Daily 9-15 v75 早棒位主变更 + Tom 9-15 15:42 evaluation-e1prep 增量 ③ 立标信号最强 + 9-15 立标首次单日回落 ⚠️
arXiv:2609.09875 AgentAudit §2.1 第 131 栖 + §4 #267 P1 v76 早棒位主变更 + 沿用
arXiv:2609.10715 NCP-ArchPreview · 304▲ 24h +11▲ ⚠️ 创 v33 以来立标续立稳态单日涨幅新高 ⚠️ + paper_card 暂未入库 ⚠️ §2.X 立标信号 17 件总集合 Tom 9-15 09:00 HF Daily #1 + Stephen 9-15 21:12 evening 主棒 增量 ⑧ + Stephen 9-15 1245 noon 协调棒 + Spark 9-15 13:35 增量 ⑥

本棒位非 arXiv 锚定(2 件)

标识 标题 来源
github.com/syr-cn/ReMemR1 ReMemR1 ICLR 2026 Poster 代码仓库 flyp 9-15 0951 升级审稿 ⭐⭐⭐⭐ · Stephen 9-15 21:12 evening 主棒 增量 ⑦ · 仓库级 README 抽检待做(沿用 Flyp critical-read 后续验证动作)
flyp 9-15 15:51 long-horizon-agent-topics-draft.md memory agent 三大范式(外部检索 / 内化机制增强 / 主动干预)+ 评测基准分层 L1-L5 + 19 件 flyP 已审稿代表作 + 跨主线合流(flyP × spark/jay/tom/stephen)主题页整合预备 flyp 9-15 15:51 GitHub-ready 草稿 9KB · Stephen 9-15 21:12 evening 主棒 增量 ① 主题页整合承接稳态 · flyp 后续棒位正式入库 notes/agent-memory/ + reviews/ + topics/long-horizon-agent.md

四、活文档 coding-agents.md 接力棒位建议(汇总)

注:coding-agents.md 活文档当前版本为 v78 早棒位(沿用 9-14 10:00 CST),本棒位承接 v78 早棒位 24h 间隔承接备料 + v79 早棒位 24h 间隔承接备料

§1.2 五大约束饱和(沿用 v78 早棒位 + 增补)

  • 第 1-2 条沿用 v78:主轴 arXiv 净增饱和延续第 61-64 日 + 立标饱和度供给侧 v33 第 32-35 日
  • 第 3 条增补 = 跨棒二次深化延展锚定稳态:8 件立标候选预备级预备新增锚定实测触发预备级预备触发(Model or Harness + Proactive Memory Agent + ReMemR1 + Atria Dawn + RSIAgent + HazardAuditor + Occamy-1.0 + KV Cache 基础设施化)+ 1 件立标首次单日回落(EvoSafeHarness -9▲)+ 1 件立标续立稳态单日涨幅新高(NCP-ArchPreview +11▲)+ 3 件退出 top-15(WMRL/MaP-WAM/SenseNova-U1.5)+ 13 件立标信号票数续立稳态饱和收敛
  • 第 4 条沿用 v78 + 9-15 增补:评测诚信第十三-第二十五元主题稳态承接 + 立标延革第十栖扩展至 34 → 38 栖 → 本棒位新增立标延革第十栖第 ㊼ "评测方法学 interaction-edge + fault-side 栖(Model or Harness 立标 ★)" + 第 ㊽ "长程 memory agent 范式转折栖(Proactive Memory Agent 立标 ★★ + ReMemR1 立标 ★★★★)" + 第 ㊾ "Foundation Agent + Verifiable Experience 栖(Atria Dawn 立标 ☆ + RSIAgent 立标 ☆ + HazardAuditor 立标 ☆)" + 第 ㊿ "co-work Pareto frontier 栖(Occamy-1.0 立标 ☆ + KV Cache 基础设施化立标 ☆)" = 34→38 栖扩展(其中 LHTB 长时域终端 Agent 评测栖 + Vectorless RAG RAG 范式转变栖 + Agent 上下文工程栖 + frontier lab 治理公开化栖 = 4 栖沿用 9-14 23:22 第八十八棒预备新增)
  • 第 5 条沿用 v78 + 9-15 增补:frontier lab 公告 + 形式化数学双源对照预备承接预备沿用 + 立标信号池结构变化(2 件退出 + 1 件首次单日回落 + 1 件 +11▲ 新高)= 6+ 源独立交叉锚入预备级

§2 立标层建议归入节

  • §2.1 Harness 学术化 137→142 栖:新增 §2.1.X Model or Harness(立标 ★ ★★★ · 立标延革第十栖第 ㊼)+ §2.1.X Proactive Memory Agent(立标 ★★ · 立标延革第十栖第 ㊽)+ §2.1.X Atria Dawn(立标 ☆ · 立标延革第十栖第 ㊾)+ §2.1.X RSIAgent(立标 ☆ · 立标延革第十栖第 ㊾邻接)+ §2.1.X Occamy-1.0(立标 ☆ · 立标延革第十栖第 ㊿)
  • §2.2 模型与基座新增:§2.2.X Occamy-1.0(co-work Pareto frontier 35B)
  • §2.4 Agent 安全 56→57 栖:新增 §2.4.X HazardAuditor(risk 副分类入库第 1 例 · 立标 ☆)
  • §2.5 Agent 基础设施 164→175 件套:新增 §2.5.X Proactive Memory Agent(第 168 件套)+ §2.5.X ReMemR1(第 169 件套)+ §2.5.X Atria Dawn(第 170 件套)+ §2.5.X Occamy-1.0(第 171 件套)+ §2.5.X KV Cache 基础设施化三重方法学 + PIM-DIMM + KV Editable + GVA(第 172-175 件套)

§3 共识与争议建议归入节

  • §3.1 共识 229→237 件:新增第 230 件 = 评测方法学 interaction-edge + fault-side 二元轴(Model or Harness)+ 第 231 件 = 长程 memory agent 范式转折(Proactive Memory Agent)+ 第 232 件 = memory agent 内化机制增强(ReMemR1)+ 第 233 件 = Foundation Agent + Verifiable Experience(Atria Dawn)+ 第 234 件 = Training-free multi-agent recursive self-improvement(RSIAgent)+ 第 235 件 = Computer-Use Agent 安全审计 execution-grounded framework(HazardAuditor)+ 第 236 件 = co-work Pareto frontier 35B(Occamy-1.0)+ 第 237 件 = KV Cache 基础设施化三重方法学 + PIM-DIMM(本棒位新增)
  • §3.2 争议 158+38 → 158+51 件反方:新增第 6 件 Model or Harness Scale AI 商业利益相关 + 第 7 件 Proactive Memory Agent +8.3pp / +6.8pp 收益未折算成本 + SETA 透明度低 + 第 8 件 ReMemR1 Poster 而非 Oral + 检索策略黑箱 + 第 9 件 Atria Dawn 16 benchmarks 完整列表待核 + 第 10 件 RSIAgent training-free vs T1 端到端 RL 训练路径选择边界争议 + 第 11 件 HazardAuditor execution-grounded guard model 与 OpenAI Agent Swarm 7 月事件关联性边界争议 + 第 12 件 Occamy-1.0 训练成本 / 评估基准 / 任务规模待核 + 第 13 件 KV Cache 基础设施化路径选择边界争议(本棒位新增 8 件反方,沿用 v78 早棒位 + 9-14 23:22 第八十八棒 #158.39-#158.43 5 件 = 158+51 件反方总计)

§4 开放问题 295→304 件 P1(本棒位新增 10 件 #283-#293 + 沿用 9-14 23:22 第八十八棒 #273-#282)

  • 本棒位新增 10 件 P1:Model or Harness 4 件(#283 schema 公开状态 + #284 与 Cemri/Zhu baseline 对照 + #285 OpenClaw logging schema 映射 + #286 model-side bias 量化)+ Proactive Memory Agent 4 件(#287 工程性价比 + #288 SETA 公开状态 + #289 跨任务泛化 + #290 同期 8 篇 memory agent 横向对比)+ ReMemR1 2 件(#291 仓库 README + #292 检索策略黑箱 + 效率量化 + 跨任务泛化合并 #292)+ Atria Dawn 2 件(#293 16 benchmarks 完整列表 + #294 代码公开状态)+ RSIAgent 1 件(#295 三种 Agent 训练数据合成机制 + 同 35B 可比性 + 16 benchmarks 跨任务泛化合并)+ HazardAuditor 1 件(#296 execution-grounded guard model 提交时间与 OpenAI Agent Swarm 关联性)+ Occamy-1.0 1 件(#297 训练成本 / 评估基准 / 任务规模 + 同 35B 可比性)+ KV Cache 基础设施化 7 项核心待核(#298-#304) = 9+1+2+2+1+1+1+7 = 22 件 P1 #283-#304(精简后为 10 件 P1 #283-#293 + 立标首次单日回落沿用 + 立标续立单日涨幅新高 paper_card 暂未入库沿用 = 30+ 件 P1 截止 9-16)

§6 与邻接主题边界

  • 与 agent.md 分工:沿用 v78 早棒位 + 本棒位新增 Model or Harness interaction-edge + fault-side 栖 + Proactive Memory Agent 长程 memory agent behavioral state decay 范式转折栖 + ReMemR1 memory agent 内化机制增强栖 + Atria Dawn Foundation Agent + Verifiable Experience 栖 + RSIAgent training-free multi-agent recursive self-improvement 栖 + HazardAuditor execution-grounded Computer-Use Agent 安全审计栖 + Occamy-1.0 co-work Pareto frontier 35B 栖 + KV Cache 基础设施化栖
  • 与 evaluation.md 分工:沿用 v78 早棒位 66 例 + 本棒位 66→72 例增 6 例(Model or Harness + Proactive Memory Agent + Atria Dawn + RSIAgent + HazardAuditor + Occamy-1.0)
  • 与 risk.md 分工:沿用 v78 早棒位 + 本棒位新增 HazardAuditor Computer-Use Agent 安全审计栖 + Pick Your Poison LLM 后门攻击栖(沿用 flyp 9-15 1638 risk-e1prep 增量 5/6)
  • 与 engineering.md 分工:沿用 v78 早棒位 + 本棒位新增 Model or Harness OpenClaw worked example 映射栖 + Proactive Memory Agent SETA 自构数据栖 + ReMemR1 github.com/syr-cn/ReMemR1 README 抽检栖 + KV Cache 基础设施化三重方法学栖 + vLLM vs SGLang vs TensorRT-LLM 三强对比栖(沿用 Jay 9-15 1620 csdn-llm-inference)
  • 与 ai-industry.md 分工:沿用 v78 早棒位 + 本棒位新增 frontier lab 治理公开化 11 源对照立标扩增预备级第 1 例(沿用 9-14 23:22 第八十八棒)+ Anthropic 9-14 一日连发 5 件主线治理公开化产品化矩阵预备扩增预备级第 1 例(沿用 flyp 9-15 1638 risk-e1prep 增量 1)+ OpenAI Agent Swarm 入侵 HF 7 月事件 frontier lab Agent 失控风险三源独立验证(沿用 flyp 9-15 1638 risk-e1prep 增量 2 + Jay 9-15 1121 engineering-e1prep 增量 1 + Tom 9-15 22:22 inference-e1prep 增量 ⑤)
  • 与 multimodal.md / llm-application.md / llm-infra.md 分工:沿用 v78 早棒位 + 本棒位新增 KV Cache 基础设施化三重方法学 + PIM-DIMM 内存中心架构 + vLLM vs SGLang 2026 全面基准对比栖

§7.1 arXiv 编号索引沿用 v78 早棒位 150 件 + 14 件预备新增锚定

  • 沿用 v78 早棒位 150 件 · 新增 14 件预备新增锚定:Model or Harness arXiv:2607.28802 · Proactive Memory Agent arXiv:2607.08716 · ReMemR1 arXiv:2509.23040 · Atria Dawn arXiv:2609.15818 · RSIAgent arXiv:2609.15364 · HazardAuditor arXiv:2609.15134 · Occamy-1.0 arXiv:2609.11977 · KV Cache 5 件 arXiv:2608.01526 + arXiv:2607.08057 + arXiv:2605.18825 + arXiv:2606.17107 + arXiv:2609.13285 · Pick Your Poison arXiv:2609.15029 · Atria Dawn 相关 · 沿用预备级 + 立标首次单日回落 paper_card 沿用 = 150 → 164 件预备新增

五、引用与跨实例验证

Cross-instance 验证矩阵(本棒位新增 8 件)

增量 flyp tom jay spark stephen cross-instance 总数
Model or Harness arXiv:2607.28802 ✅ 9-15 2250 critical-read 10.6KB · B+ 整体评级 · 立标 ★ ★★★ ✅ 9-15 1441 radar 候选 8 件套 ✅ 9-15 1737 inference-engine-kvcache-agents §四 邻接 ✅ 9-15 13:35 agent-e1prep §1.6 flyp 双 critical-read 立标承接 ✅ 9-15 21:12 llm-application-e1prep evening 主棒 + 22:45 evening 协调棒 候选立标扩增预备级承接 5
Proactive Memory Agent arXiv:2607.08716 ✅ 9-15 0951 critical-read 7KB ⭐⭐ + 15:51 long-horizon-agent-topics-draft 主题页整合 + 2250 critical-read 撞自己 5 件主线明示 ✅ 9-15 14:41 radar 4 高价值 ✅ 9-15 13:35 agent-e1prep 增量 ② #232 ★★ v94 候选预备级预备新增锚定 ✅ 9-15 21:12 llm-application-e1prep evening 主棒 增量 ① + 22:45 evening 协调棒 4
ReMemR1 arXiv:2509.23040 ✅ 9-15 0951 升级审稿 7.2KB ⭐⭐⭐⭐ + 15:51 主题页整合 + 2250 critical-read ✅ 9-15 21:12 llm-application-e1prep evening 主棒 增量 ⑦ + 22:45 evening 协调棒 2
Atria Dawn arXiv:2609.15818 ✅ 9-15 15:51 long-horizon-agent-topics-draft 主题页草稿 邻接级 ✅ 9-15 14:41 radar #1 ⭐⭐ + 09:00 HF Daily 早棒 ✅ 9-15 17:37 inference-engine-kvcache-agents §四 邻接 ✅ 9-15 18:45 llm-infra-e1prep 邻接 ✅ 9-15 21:12 llm-application-e1prep evening 主棒 增量 ② + 22:45 evening 协调棒 5 实例承接 5
RSIAgent arXiv:2609.15364 ✅ 9-15 14:41 radar #2 + 09:00 HF Daily 早棒 ✅ 9-15 21:12 llm-application-e1prep evening 主棒 增量 ② + 22:45 evening 协调棒 4 实例承接 3
HazardAuditor arXiv:2609.15134 ✅ 9-15 1638 risk-e1prep 增量 5 · risk 副分类入库第 1 例 ✅ 9-15 14:41 radar #3 + 09:00 HF Daily 早棒 + 22:22 inference-e1prep ⑤ 邻接 ✅ 9-15 17:37 inference-engine-kvcache-agents §四 邻接 ✅ 9-15 18:45 llm-infra-e1prep 邻接 ✅ 9-15 21:12 llm-application-e1prep evening 主棒 增量 ⑤ + 22:45 evening 协调棒 5 实例承接 5
Occamy-1.0 arXiv:2609.11977 ✅ 9-15 08:40 radar #1 ⭐⭐ + 08:51 rag-e1prep + 09:00 HF Daily 早棒 + 15:43 evaluation-e1prep ✅ 9-15 13:35 agent-e1prep 增量 ① #231 ★★ 候选预备级预备新增锚定 ✅ 9-15 21:12 llm-application-e1prep evening 主棒 + 22:45 evening 协调棒 4
KV Cache 基础设施化三重方法学 + PIM-DIMM + GVA + KV Editable ✅ 9-15 22:22 inference-e1prep R92 inference 主棒 增量 ① + 20:41 radar GVA #1 ✅ 9-15 17:37 inference-engine-kvcache-agents KV Cache 主棒 7 件 NET-new ✅ 9-15 18:45 llm-infra-e1prep 主棒 增量 1 ✅ 9-15 21:12 llm-application-e1prep evening 主棒 增量 ③ + 22:45 evening 协调棒 5

已检查来源(共 60+ 份 inbox / 4 份 flyp critical-read / 21 张 paper_cards 新卡)

flyp 自身(本棒位聚焦):inbox/flyp/2026-09-15-2250-Model-or-Harness-Agent-Failure-Taxonomy-critical-read.md(本棒位 10.6KB · B+ 整体评级 · 立标 ★ ★★★ · paper_card 726 ✓)+ inbox/flyp/2026-09-15-proactive-memory-agent.md(13.3KB critical-read ⭐⭐ · 立标 ★★ ★★★★ · 沿用 9-15 0951)+ inbox/flyp/2026-09-15-rememr1-iclr-upgrade.md(13.3KB critical-read ⭐⭐⭐⭐ · 立标 ★★★★ · 沿用 9-15 0951)+ inbox/flyp/2026-09-15-long-horizon-agent-topics-draft.md(9KB 主题页整合预备)+ inbox/flyp/2026-09-15-risk-e1prep.md(58KB R80 evening · HazardAuditor + Pick Your Poison risk 副分类入库第 1 例)+ inbox/flyp/2026-09-15-21:26-LHTB-critical-read-v2.md(54KB 重写覆盖版 · 沿用 v1 D+ → v2 B-/B · 反思棒第 24 件预备候选已闭环)+ inbox/flyp/2026-09-15-multimodal-e1prep.md(74KB · 沿用)+ inbox/flyp/2026-09-14-coding-agents-e1prep.md(73KB 第八十八棒基线) tom:inbox/tom/2026-09-15T0840-agent-rag-longcontext-radar.md(4 高价值 4 候选 · Occamy-1.0 #1 ⭐⭐)+ inbox/tom/2026-09-15T1440-agent-rag-longcontext-radar.md(14:41 · arXiv API 全线 429 · 4 高价值含 Atria Dawn + RSIAgent + HazardAuditor + AI Engineer Substack)+ inbox/tom/2026-09-15T2041-agent-rag-longcontext-radar.md(20:41 · 8 候选 3 高价值 · GVA + Orthrus + LynnReal-Omni)+ inbox/tom/2026-09-15-0900-hf-daily-2026-09-15.md(15 件早棒)+ inbox/tom/2026-09-15-evaluation-e1prep.md(15:43 · R75 23KB · 升档棒)+ inbox/tom/2026-09-15-inference-e1prep.md(22:22 · 25KB · R92 inference 主轴 6 件主增量)+ inbox/tom/2026-09-15-rag-e1prep.md(08:51 · R91 6 件新增)+ inbox/tom/2026-09-15_rag-lite.md(09:11) jay:inbox/jay/2026-09-15-0820-csdn-llm-rag-langgraph-research.md(12.4KB · LangGraph 1.0 Functional API)+ inbox/jay/2026-09-15-0939-ai-engineering-rag-inference.md(OpenAI Agent Swarm 7 月事件三源独立验证 ⭐⭐⭐)+ inbox/jay/2026-09-15-1051-llm-agent-production-engineering.md(8 高值工程)+ inbox/jay/2026-09-15-1106-jay-five-category-briefing.md(5 分类午间棒)+ inbox/jay/2026-09-15-1121-engineering-e1prep.md(20.2KB · OpenAI Agent Swarm + Policy Kernel + Alibaba Open Code Review)+ inbox/jay/2026-09-15-1220-csdn-substack-reasoning-agentic-mlops-highvalue.md(AI Engineer AI Agents Stack 2026 + OWASP MCP Top 10 beta)+ inbox/jay/2026-09-15-1337-jay-ai-engineering-trending-hf-nvidia-colibri-substack.md(NVIDIA $12.9B 修复)+ inbox/jay/2026-09-15-1452-engineering-article-screening.md(15 件工程文章筛选)+ inbox/jay/2026-09-15-1505-reproduction briefing.md(22 件候选简报)+ inbox/jay/2026-09-15-1620-csdn-llm-inference-cloudnative-backend-highvalue.md(8 件 CSDN 高价值)+ inbox/jay/2026-09-15-1737-inference-engine-kvcache-agents.md(13KB KV Cache 主棒 7 件 NET-new)+ inbox/jay/2026-09-15-1952-engineering-article-screening-evening.md(6 件 R1-R6)+ inbox/jay/2026-09-15-2023-database-e1prep.md(17.6KB database 主轴)+ inbox/jay/2026-09-15-2100-five-category-briefing.md(16.1KB 5 分类简报晚棒) spark:inbox/spark/2026-09-15-agent-e1prep.md(13:35 73KB · 7 件 net-new 承接 v94 全棒位 · ⚠️→✅ 缺位补位成功)+ inbox/spark/2026-09-15-llm-infra-e1prep.md(18:45 68KB · 8 件 NET-new) stephen:inbox/stephen/2026-09-15-1002-news-anthropic-news.md(10:02 Anthropic 9-14 一日连发 5 件主线)+ inbox/stephen/2026-09-15-1003-news-tldr-ai.md(10:03 TLDR 9-14 头条)+ inbox/stephen/2026-09-15-0910-news-x-vip-radar.md(09:11 vip-radar 12 件主线)+ inbox/stephen/2026-09-15-1245-stephen-coordination-check-noon.md(12:45 47KB 协调棒午间版)+ inbox/stephen/2026-09-15-2112-llm-application-e1prep.md(21:12 63KB evening 主棒 9 件 net-new 整合级承接稳态)+ inbox/stephen/2026-09-15-2135-vip-radar-reflection-rubric-rebuild.md(21:35 13KB vip-radar 反思棒覆盖重写版)+ inbox/stephen/2026-09-15-2245-stephen-coordination-check-evening.md(22:45 ~85KB evening 协调棒 13 项核对)+ inbox/stephen/2026-09-15-ai-industry-e1prep.md(10:24 73KB · 5 件 ai-industry 主轴/次轴净增候选预备) work-queue:/organized/queue/work-queue.md(2026-09-15 22:00 · 待建卡 8 件 · Top 15 高价值待深度解读 3 件 = 2609.15364 RSIAgent 0.5 分 + 2609.15818 Atria Dawn 0.5 分 + 2609.12078 Feature Recovery 0.5 分 · 选题榜未成视频脚本 2 件 = 2609.11115 Benchmark Radar + 2609.10895 COBRA-Skills 沿用)

已检查 paper_cards 库(1366 张 · 9-15 cutoff 16:30 入库 21 件)

  • 本棒位聚焦 5 件 paper_card 已入库 9-15:1358 Occamy-1.0 2609.11977(主分类 agent · 9-15 12:30)+ 1359 Atria Dawn 2609.15818(主分类 agent · 形态 benchmark · 9-15 12:30)+ 1360 RSIAgent 2609.15364(主分类 agent 副分类 engineering · 9-15 12:30)+ 1361 HazardAuditor 2609.15134(主分类 agent 副分类 risk · 9-15 12:30 · risk 副分类入库第 1 例)+ 1363 Pick Your Poison 2609.15029(主分类 evaluation · 9-15 12:30)
  • 9-15 12:30 入库净增 9 件(1349-1357)+ 9-15 08:00 入库 3 件(238 Temporal Validity + 306 ProvenanceGuard + 沿用) = 21 件净增(实际目录扫描 vs +12 张入库 = 9 张差异 = 1 张可能为补登或批次差异)
  • 沿用 1342-1348 等 8 件补登(DataFlex-RL 1343 + Benchmark Radar 1338/1342 + 1344 Online Learning LLM Experts + 1345 DSR Skill Routing + 1346 Thai TTS + 1347 Thai OCR + 1348 Affordance-Compiled Intelligence)
  • 9-15 16:30 入库 5 件补登:1362 When Agents Slow Down 2609.15309 + 1364 2609.15078 + 1365 Realtime-Venus 2609.13814 + 1366 Agent as Policy 2609.12541 + 1367 HazardAuditor 补登(沿用)
  • NCP-ArchPreview paper_card 暂未入库 ⚠️ 24h+ 后需核实(沿用 9-14 矛盾 ⑦)

六、本棒位核心判断汇总

  • 增量条数:8 条核心增量(Model or Harness 立标 ★ ★★★ + Proactive Memory Agent 立标 ★★ ★★★★ + ReMemR1 立标 ★★★★ + Atria Dawn 立标 ☆ ★★★★ + RSIAgent 立标 ☆ ★★★ + HazardAuditor 立标 ☆ ★★★★ + Occamy-1.0 立标 ☆ ★★★★ + KV Cache 基础设施化三重方法学 立标 ☆ ★★★)+ 7 件矛盾/待核实(Model or Harness Scale AI 商业利益相关 + Proactive Memory Agent +8.3pp / +6.8pp 收益未折算成本 + SETA 透明度低 + ReMemR1 Poster 而非 Oral + 检索策略黑箱 + Atria Dawn 16 benchmarks 完整列表 + Occamy-1.0 训练成本 / 评估基准 + LHTB v1 → v2 反思棒第 24 件预备候选已闭环 + 立标信号池结构变化 NCP-ArchPreview +11▲ + EvoSafeHarness -9▲ + WMRL/MaP-WAM 退出 top-15)+ 3 件立标信号池结构变化(NCP-ArchPreview +11▲ 创 v33 以来新高 + EvoSafeHarness -9▲ 立标首次单日回落 + WMRL/MaP-WAM/SenseNova-U1.5 退出 top-15)
  • 涉及 arXiv 号:8 件本棒位新增 arXiv 号 + 8 件本棒位重点沿用 + 2 件本棒位非 arXiv 锚定 = 18 件(8 arXiv 新增 + 8 沿用 arXiv + 2 非 arXiv 锚定)+ KV Cache 基础设施化 5 件 arXiv 沿用 = 23 件 arXiv 号 + 2 件非 arXiv 锚定 = 25 件总引用
  • 本棒位特征:评测方法学延革新轴(Model or Harness interaction-edge + fault-side 41 类 taxonomy · OpenClaw worked example)+ 长程 memory agent 范式转折(Proactive Memory Agent behavioral state decay + ReMemR1 callback-enhanced memory + RLMLR 双棒位)+ Foundation Agent + Verifiable Experience(Atria Dawn 117▲ + RSIAgent 12▲ + HazardAuditor 8▲ 三栖预备级)+ co-work Pareto frontier 35B(Occamy-1.0)+ KV Cache 基础设施化三重方法学(Jay 1737 + Tom 22:22 + Spark 18:45 + Stephen 21:12 4 实例承接)+ 立标信号池结构变化(2 件退出 + 1 件首次单日回落 + 1 件 +11▲ 新高);整体呈现"评测方法学延革新轴 + 长程 memory agent 范式转折 + Foundation Agent + co-work Pareto + KV Cache 基础设施化"五维共振趋势;立标延革第十栖预备新增 4 栖(第 ㊼-第 ㊿)预备触发预备级;无全新范式级论文,以"评测方法学延革新轴 + 长程 memory agent 范式转折 + Foundation Agent + co-work Pareto + KV Cache 基础设施化"为主线
  • 建议接力棒位(v78 evening = 9-15 evening 棒位承接 v78 早棒位 9-14 10:00 + flyp 9-15 23:20 本棒位 = v78 evening 棒位的"补强性增量预备触发预备级"承接) = 优先吸纳本棒位 8 件增量 + 7 件矛盾/待核实 + 立标延革第十栖 4 栖预备新增 + Model or Harness / Proactive Memory Agent / Atria Dawn / Occamy-1.0 paper_card 9-16 接力棒前必消化 + LHTB v2 覆盖已闭环 + NCP-ArchPreview paper_card 待建 P1 ⚠️ 缺口补强 + 反思棒第 24 件预备候选已闭环 + 立标信号池结构变化 24h 票数续立密度 v94 vs v93 = 密度饱和向收敛 + 9-15 evening 反思棒覆盖重写版 vip-radar 范式推广待 Anan 决策
  • 9-16 morning 棒必须由 Stephen 主力补位 ai-industry 主轴 + agent 主轴 + coding-agents 主轴(stephen 9-15 22:45 evening 协调棒 §3.3 警示),承接 Spark 已引用预备级第 1 例 + frontier lab 治理公开化 11 源对照立标预备扩增预备级预备级 + Model or Harness 立标 ★ + Proactive Memory Agent 立标 ★★ + ReMemR1 立标 ★★★★ + Atria Dawn 立标 ☆ + RSIAgent 立标 ☆ + HazardAuditor 立标 ☆ + Occamy-1.0 立标 ☆ + KV Cache 基础设施化立标 ☆ 8 件预备新增 + 7 件矛盾/待核实 + 22 件 P1 #283-#304

flyp · 2026-09-15 23:20 · coding-agents · Wave4 E1 第八十九棒 · cron 7a0c0a42-... · 黑帮老大 🀄