llm-application · E1 预消化简报(2026-09-07)

  • 实例:Stephen
  • 基线:organized/knowledge/llm-application.md v86(cutoff 2026-09-07 18:00 CST)
  • 窗口:v86 落定后 3h10m 二次承接备料(18:00 → 21:10 CST);主要核验 v86 §1.6 #47-#50 四栖立标候选 + §1.1 #107-#108 Scaling the Harness 立基础延展升档 ★☆ → ★★ + #Y Yandex KV Cache as Agent Runtime + §1.2 SoK POMDP + ICLR 2026 Agent Memory TTL + §1.6 #44 RoboTok 立标 ★☆ → ★ 候选升档预备实测承接 + #176 Terminal-Universe P1 anchor 缺位延续等件套在近 2 日(9-5 ~ 9-7)inbox 中是否有更深补强,以及 9-7 radar 新候选(Memory Model Upgrade / Substrate-Aware AI Agents / OR-Clarify / MaxKernel / RISE)在 18:00 后的实测预备延展信号。
  • 结论:本轮 5 条值得今晚接力棒继续消化的净增量——其中 3 条 v86 net-new arXiv 候选预备实测锚定(Memory Model Upgrade 9-7 paper_card 1238 ✓ + Substrate-Aware AI Agents 9-7 paper_card 1237 ✓ + OR-Clarify 9-7 paper_card 1239 ✓)+ 1 条 RoboTok 立标 ★☆ → ★ 候选升档预备实测承接锚定延用(flyp 9-7 0940 critical-read 79→115 +36 票立标中-高首次续立实测 + 评级 B+ → A- + 跨实例 4 源独立交叉 + Rice + NVIDIA + GitHub Rice-RobotPI-Lab/robotok-public 公开 + web_search 双源核验命中)+ 1 条 Coding Agent 主轴 8 件立标在 agent 主轴的预备级缺位(PILOT in the Loop + DRACO + VeriPhy + MASkills + HEART + ContextPipe + EARM + Codebook Agent + Select/Compress/Reinvest,均为 coding-agents.md v72 早棒位已锚立标,但 llm-application §1.6 / §1.4 / §1.1 仍未 anchor)。无 net-new arXiv 主集加入,无立标新高,无 P0 警示新增。

一、本棒位今日 5 条重要增量

增量 1 · v86 §1.3 Memory #34 Memory Model Upgrade arXiv:2609.05339 paper_card 1238 ✓ 9-7 16:30 入库实测锚定 + 9-7 1440 radar ⭐⭐⭐⭐ 候选预备级锚入实测命中

  • 来源:paper_cards/1238-2609-05339.md(2026-09-07 16:30 入库 · 主分类 rag 副分类 agent);tom 2026-09-07T1440-agent-rag-longcontext-radar.md 高价值条目 1(9-7 1440 radar ⭐⭐⭐⭐ + Goyal & Ray + Sep 4 论文 + 48 个合成历史场景);tom 2026-09-07-evaluation-e1prep.md 增量 3(eval 邻接 P2);flyp 2026-09-07-multimodal-e1prep.md(multimodal 邻接级 anchor);v86 §1.3 Memory #34 Memory Model Upgrade arXiv:2609.05339 已 anchor 候选预备级(纸卡待入库标注);work-queue.md 2026-09-07 20:00(高价值待深度解读 Top 15 共 2 件中包含 2609.05258 第二条目);spark 2026-09-07-agent-e1prep.md(v86 沿用稳态)。
  • 要点:Memory Model Upgrade = 跨模型可移植性评测;同一历史下四种记忆方案对比:LC-RAW(原文长上下文)、RAG(分块检索)、NOTES(模型压缩为自然语言笔记)、KG-fixed(固定 schema 知识图);48 个合成历史场景 + 随机答案约束;关键发现:KG-fixed 迁移最稳 + RAG 对 embedding 版本敏感 + 修复可能因缺原始证据而失败。paper_card 1238 9-7 16:30 入库实测填补 v86 §1.3 #34 候选预备级 paper_card 缺位 = 立标 ☆ 候选预备级 paper_card 6/6 = 100% 命中。
  • 与活文档脉络的关系:v86 §1.3 Memory #34 已 anchor 候选预备级 + paper_card 1238 9-7 16:30 入库 ✓ = 立标 ☆ P2 候选预备实测命中。与 v84 §1.1 #Y Yandex KV Cache as Agent Runtime + v85 §1.6 #50 Memory Security Survey 形成"运行时原语 × 记忆生命周期安全 × 记忆跨模型可移植性"三维预备锚入 = v86 §1.3 Memory 31 栖 + 2026 H2 记忆反方证据群 6 件 + 邻接级备料 4 件 + #34 Memory Model Upgrade 候选预备级沿用预备实测锚定。与 v82 §1.6 #42 AutoTraceGT 扎根理论 + v85 §1.6 #48 Silent Failures 6 类分类法构成"agent 安全审计 × 跨模型迁移"邻接级预备触发组合。9-7 paper_card 入库预备实测承接 + tom 1440 radar ⭐⭐⭐⭐ 双线预备实测命中 = 立标 ☆ 候选预备级 anchor 缺位补强完成。
  • 建议归入节:§1.3 Memory #34 Memory Model Upgrade arXiv:2609.05339 候选预备级锚入 + §本次变更段"paper_card 1238 9-7 16:30 入库 ✓ + 9-7 1440 radar ⭐⭐⭐⭐ + 立标 ☆ P2 候选预备实测命中 + 跨主轴 rag/agent/evaluation 三主分类邻接级 + KG 迁移最稳 + RAG 对 embedding 版本敏感"沿用预备 + §3.1 #305 v86 共识 + §4 #370 v86 开放问题 + §6 #132 v86 工程落地清单沿用预备级 + §2.39.x Memory 5 件套邻接级沿用预备级。本轮无新增立标候选,仅 v86 §1.3 #34 Memory Model Upgrade 立标 ☆ P2 候选预备实测锚定延用。

增量 2 · v86 §1.4 #37 Substrate-Aware AI Agents arXiv:2609.05232 paper_card 1237 ✓ 9-7 16:30 入库实测锚定 + 9-7 1440 radar ⭐⭐⭐⭐ 候选预备级锚入实测命中

  • 来源:paper_cards/1237-2609-05232.md(2026-09-07 16:30 入库 · 主分类 agent 形态 position);tom 2026-09-07T1440-agent-rag-longcontext-radar.md 高价值条目 2(9-7 1440 radar ⭐⭐⭐⭐ + Manu Agrawal + Sep 4 论文 + "substrate blindness" 概念);tom 2026-09-07-evaluation-e1prep.md 增量 4(eval 邻接 P2);v86 §1.4 #37 Substrate-Aware AI Agents arXiv:2609.05232 已 anchor 候选预备级(纸卡待入库标注)。
  • 要点:Substrate-Aware AI Agents = 首次提出"基质盲区"(substrate blindness)概念——Agent 在规划时忽略执行上下文(内存、执行时间、运行时、算力、运营约束等);通过高维成对欧氏距离数值代码生成任务测试三个前沿模型:Claude Opus 5 / GPT-5.6-Sol / Gemini 3.7 Flash 三者均存在显著盲区,尤其在实现选择与操作后果层面;提出"执行上下文感知能力"作为第一类输入的框架。paper_card 1237 9-7 16:30 入库实测填补 v86 §1.4 #37 候选预备级 paper_card 缺位 = 立标 ☆ 候选预备级 paper_card 7/7 = 100% 命中。
  • 与活文档脉络的关系:v86 §1.4 #37 已 anchor 候选预备级 + paper_card 1237 9-7 16:30 入库 ✓ = 立标 ☆ P2 候选预备实测命中。与 v84 §1.1 #107-#108 Scaling the Harness 立基础延展升档 ★☆ → ★★ + v85 §1.6 #47 openJiuwen + v85 §1.6 #45 VeriPhy Agentic 物理推理评测方法学 + v85 §1.6 #48 Silent Failures 6 类分类法形成"harness 学说 × 动态 harness × Agentic 物理 × 静默失败 × 基质盲区"五栖预备触发组合 = 第二十维度预备级候选预备 v86 触发预备级。9-7 paper_card 入库预备实测承接 + tom 1440 radar ⭐⭐⭐⭐ 双线预备实测命中 = 立标 ☆ 候选预备级 anchor 缺位补强完成。
  • 建议归入节:§1.4 评测方法学 #37 Substrate-Aware AI Agents arXiv:2609.05232 候选预备级锚入 + §本次变更段"paper_card 1237 9-7 16:30 入库 ✓ + 9-7 1440 radar ⭐⭐⭐⭐ + 立标 ☆ P2 候选预备实测命中 + Claude Opus 5/GPT-5.6-Sol/Gemini 3.7 Flash 三模型实测 + 数值代码生成任务 + '执行上下文感知能力'评测框架"沿用预备 + §3.1 #305 v86 共识 + §4 #370 v86 开放问题 + §6 #132 v86 工程落地清单沿用预备级 + §2.211 评测方法学延革沿用预备级 + §2.207 元组预备扩位预备触发沿用预备级。本轮无新增立标候选,仅 v86 §1.4 #37 Substrate-Aware AI Agents 立标 ☆ P2 候选预备实测锚定延用。

增量 3 · v86 §1.4 #38 OR-Clarify arXiv:2609.05258 paper_card 1239 ✓ 9-7 16:30 入库实测锚定 + 9-7 1440 radar ⭐⭐⭐ 候选预备级锚入实测命中

  • 来源:paper_cards/1239-2609-05258.md(2026-09-07 16:30 入库 · 主分类 evaluation 形态 benchmark);tom 2026-09-07T1440-agent-rag-longcontext-radar.md 高价值条目 4(9-7 1440 radar ⭐⭐⭐ + Sep 3 论文 + HF 11 票 + "agent 澄清策略 benchmark");tom 2026-09-07-evaluation-e1prep.md 增量 5(eval 邻接 P2);v86 §1.4 #38 OR-Clarify arXiv:2609.05258 已 anchor 候选预备级(纸卡待入库标注);work-queue.md 2026-09-07 20:00(高价值待深度解读 Top 15 共 2 件中包含 2609.05258 第二条目)。
  • 要点:OR-Clarify = 运筹优化场景下 agent 澄清策略 benchmark;每个任务呈现部分公开描述 + 隐藏结构化槽位(隐藏 objectives / 约束 / 业务规则),评估 agent 是否知道何时需要澄清而非直接建模——属于 agent 评测的"不确定性感知与主动澄清"维度。现有评测大多假设需求完整,本 benchmark 揭示真实 OR 请求的不完整特征。paper_card 1239 9-7 16:30 入库实测填补 v86 §1.4 #38 候选预备级 paper_card 缺位 = 立标 ☆ 候选预备级 paper_card 8/8 = 100% 命中。
  • 与活文档脉络的关系:v86 §1.4 #38 已 anchor 候选预备级 + paper_card 1239 9-7 16:30 入库 ✓ = 立标 ☆ P2 候选预备实测命中。与 v85 §1.6 #47 openJiuwen 动态 Rail-based composition + v85 §1.6 #48 Silent Failures 6 类分类法 + v86 §1.4 #37 Substrate-Aware AI Agents 形成"动态 harness × 静默失败 × 基质盲区 × 不确定性感知澄清策略"四栖预备触发组合 = 第二十一维度预备级候选预备 v86 触发预备级。与 v86 #177 Compile by Training(自然语言规范 → 本地神经函数)的"需求完整假设"形成"需求不完整下主动澄清"对称维度。9-7 paper_card 入库预备实测承接 + tom 1440 radar ⭐⭐⭐ + work-queue 高价值待深度解读 Top 15 三线预备实测命中 = 立标 ☆ 候选预备级 anchor 缺位补强完成。
  • 建议归入节:§1.4 评测方法学 #38 OR-Clarify arXiv:2609.05258 候选预备级锚入 + §本次变更段"paper_card 1239 9-7 16:30 入库 ✓ + 9-7 1440 radar ⭐⭐⭐ + 立标 ☆ P2 候选预备实测命中 + 运筹优化场景 + 部分公开描述 + 隐藏结构化槽位 + '不确定性感知与主动澄清'评测维度 + work-queue Top 15"沿用预备 + §3.1 #305 v86 共识 + §4 #370 v86 开放问题 + §6 #132 v86 工程落地清单沿用预备级 + §2.211 评测方法学延革沿用预备级 + §2.207 元组预备扩位预备触发沿用预备级。本轮无新增立标候选,仅 v86 §1.4 #38 OR-Clarify 立标 ☆ P2 候选预备实测锚定延用。
  • 来源:flyp 2026-09-07-0940-RoboTok-critical-read-24h-jump.md(79→115 +36 票 24h 大幅跃升立标中-高首次续立实测承接棒 + 评级 B+ → A- + 投票建议 ☆ 沿用预备 + 跨实例 4 源独立交叉预备锚入稳定 + paper_card 1236 9-6 02:10 入库 ✓ + Rice + NVIDIA + Howard Qian 等 + rice-robotpi-lab.github.io/RoboTok 公开 + GitHub Rice-RobotPI-Lab/robotok-public 公开 + 6,697 KB PDF + Sep 2 v1 + cs.CV + cs.RO + 反方 R1-R4);tom 2026-09-07-agent-rag-longcontext-radar.md 增量 1(RoboTok 115 票 RAG+机器人 multimodal);tom 2026-09-07-rag-e1prep.md R83(已覆盖 R82 + RoboTok 票数 79→115 沿用稳态);spark 2026-09-07-agent-e1prep.md v86 沿用稳态(RoboTok 79→115 +36 票 24h 大幅跃升立标中-高首次续立实测承接);v86 §1.6 #44 RoboTok arXiv:2609.03199 立标 ★☆ → ★ 候选升档预备实测承接(v86 已 anchor + 立标 ★☆ → ★ 候选升档预备实测承接沿用);flyp 2026-09-07-multimodal-e1prep.md v86 沿用稳态 + RoboTok 79→115 +36 票立标中-高首次续立实测承接。
  • 要点:RoboTok = 互联网规模机器人演示检索引擎 + 3D 手部轨迹潜在空间 + actor-centered 参考帧表达 = RAG 思想引入机器人学习;给定查询人类操作视频,检索相关演示训练灵巧机器人策略。HF Daily 9-7 早棒 115▲ #6 较 9-6 早棒 79▲ #7 = +36 票 / 7 日 +93 票 / 22→40→79→115 三次跃升 = 9-1 基础立标首次 → 9-5 持平 22▲ → 9-5 20:40 升至 40▲ → 9-6 早棒 77▲ → 9-6 0840 radar 77▲ → 9-6 早棒 79▲ → 9-6 1440 radar 97▲ → 9-6 2040 radar 114▲ → 9-7 早棒 115▲ = 立标 ★☆ → ★ 候选升档预备实测承接 = 立标中-高首次续立实测。flyp critical-read 反方 R1-R4:actor-centered 估计误差 / 检索-下游耦合 / 互联网视频合规 / 跨 embodiment 迁移;评级 B+ → A-;投票建议 ☆ 沿用预备 + 沿用同一预备触发链(v83 §1.6 #42 AutoTraceGT 立标 ★☆ → ★ EMNLP 2026 Findings 升档实测 = web_search 双源核验命中 + HF Daily 持续显著升档 + paper_card 入库实测 + 跨实例 1 源 ✓)。与 v79 §2.39.331 Terminal-Universe 形成"演示数据 → 训练范式"的对称双锚——前者从"互联网视频"派生机器人演示数据,后者从"agent 轨迹"派生 code agent 训练环境。
  • 与活文档脉络的关系:v86 §1.6 #44 RoboTok 立标 ★☆ → ★ 候选升档预备实测承接 + flyp 9-7 0940 critical-read 跨实例 4 源独立交叉预备锚入稳定 + web_search 双源核验命中 = v86 立标 ★☆ → ★ 升档预备实测承接预备级预备锚定延用。与 v83 §1.6 #42 AutoTraceGT 立标 ★☆ → ★ EMNLP 2026 Findings 升档实测沿用同一预备触发链 = web_search 双源核验命中 + HF Daily 持续显著升档 + paper_card 入库实测 + 跨实例 1 源 ✓。本棒位预备实测补强 = 立标 ★☆ → ★ 候选升档预备实测承接预备级预备锚定延用 + flyp critical-read 评级 B+ → A- + 反方 R1-R4 已 anchor 实测级。
  • 建议归入节:§1.6 #44 RoboTok 立标 ★☆ → ★ 候选升档预备实测承接预备锚定延用 + §本次变更段"RoboTok 9-7 早棒 HF Daily 雷达票数 79→115 +36 票立标 ★☆ → ★ 候选升档预备实测承接 + 7 日内 +93 票三次跃升 + paper_card 1236 9-6 02:10 入库 ✓ + flyp 9-7 0940 critical-read 评级 B+ → A- + 跨实例 4 源独立交叉 + web_search 双源核验命中 + Rice + NVIDIA + GitHub Rice-RobotPI-Lab/robotok-public 公开"沿用预备 + §3.1 #304 v84 共识沿用 + §4 #369 v84 开放问题沿用预备级 + §6 #130 v84 工程落地清单沿用预备级 + §2.39.x 候选表 #44 立标 ★☆ → ★ 升档预备实测延展(沿用 spark 9-6 agent-e1prep §六 风险点 e)。

增量 5 · Coding Agent 主轴 8 件立标在 agent 主轴的预备级缺位(PILOT in the Loop + DRACO + VeriPhy + MASkills + HEART + ContextPipe + EARM + Codebook Agent + Select/Compress/Reinvest,coding-agents.md v72 早棒位已锚立标,llm-application §1.6 / §1.4 / §1.1 仍未 anchor)

  • 来源:spark 2026-09-07-agent-e1prep.md 增量 8 件 coding-agents.md v72 早棒位已锚立标列表(PILOT in the Loop arXiv:2608.26530 + DRACO arXiv:2609.04094 + VeriPhy arXiv:2609.03153 + MASkills arXiv:2609.02094 EMNLP 2026 Findings + HEART arXiv:2609.01736 + ContextPipe arXiv:2609.00749 + EARM arXiv:2608.22767 + Codebook Agent arXiv:2609.02264 + Select/Compress/Reinvest arXiv:2609.03820)= 立标层 122 栖/99 件套/50 例/156 件套 五试金石层补强 + §2.3 后训练 92→99 件套(+8 件)+ §2.5 Agent 基础设施 152→156 件套 + §3.1 共识 206→210 件(+4 件 live-improvement 新一维 + MASkills EMNLP 2026 Findings + HEART Tool Primitive + RAG 思想引入机器人学习正式立标 #188 ★★);spark 9-7 2026-09-07-1245-coord-check-noon.md 同步记录 8 件 + jay 1105 briefing 4 件 arXiv 2026.6 件(TreeSeeker + ActiveMem + DuMate-DeepResearch + Agent-Orchestrated Adaptive RAG);v86 §1.6 立标池 50 件 + 立标池双向锚 40 向稳态 + 立基础延展 14 栖 + §1.1 立基础延展五阶预备触发已 anchor(未含本轮 8 件 coding-agents 主轴立标)。
  • 要点:§1.6 #42 AutoTraceGT arXiv:2608.30391 立标 ★ + §1.6 #43 DRACO arXiv:2609.04094 立标 ★☆ + §1.6 #44 RoboTok arXiv:2609.03199 立标 ★☆ → ★ + §1.6 #45 VeriPhy arXiv:2609.03153 立标 ★☆ + §1.6 #46 Locked at the Entrance arXiv:2608.29188 立标 ★☆ = v82-v86 §1.6 已 anchor 5 件;coding-agents.md v72 早棒位已锚立标 8 件中 #42-#45 / #46 之外仍有 4 件未在 llm-application §1.6 anchor = MASkills EMNLP 2026 Findings(立标 ★ EMNLP 2026 Findings)+ HEART(立标 ★ Tool Primitive 自然语言接口)+ ContextPipe(立标 ★)+ EARM(立标 ★ LLM 打分 -82.5%)+ Codebook Agent(立标 ★ Amortized Topology Design)+ Select/Compress/Reinvest(立标 ★ 长视频 MLLM Token 预算控制)= 6 件 coding-agents 主轴立标 + 2 件 coding-agents 邻接级 = 共 8 件 llm-application §1.6 / §1.4 / §1.1 仍未 anchor**。
  • 与活文档脉络的关系:v82-v86 §1.6 邻接 4→19→21→26→29→39→42→46→50 件 + 立标池双向锚 40 向稳态 + 立基础延展二阶 10 栖→三阶 11 栖 + 8 件 coding-agents.md v72 早棒位立标在 llm-application §1.6 / §1.4 / §1.1 仍未 anchor = v87 §1.6 候选新增触发预备级。与 v86 §1.6 #47-#50 四栖立标候选新增触发预备级 + v86 §1.1 #107-#108 Scaling the Harness 立基础延展升档 ★☆ → ★★ + v86 §1.2 SoK POMDP + ICLR 2026 TTL + §1.6 #50 Memory Security Survey frontier lab 记忆系统安全预备锚入实测预备触发组合预备延展 = v87 §1.6 候选新增触发预备级预备触发 = 第三十五脉络预备级候选预备 v87 触发预备级
  • 建议归入节:§1.6 候选表新增预备级 = 6 件 coding-agents.md v72 早棒位立标预备(MASkills EMNLP 2026 Findings + HEART + ContextPipe + EARM + Codebook Agent + Select/Compress/Reinvest)+ §本次变更段"coding-agents.md v72 早棒位已锚立标 8 件中 6 件 + 2 件 coding-agents 邻接级在 llm-application §1.6 / §1.4 / §1.1 仍未 anchor + 第三十五脉络预备级候选预备 v87 触发预备级"沿用预备 + §3.1 #305 v86 共识延展 + §4 #370 v86 开放问题沿用预备级 + §6 #132 v86 工程落地清单沿用预备级 + §2.39.x 候选表预备扩位预备触发沿用预备级 + §2.3 后训练 92→99 件套(+8 件)沿用预备级 + §2.5 Agent 基础设施 152→156 件套沿用预备级 + §2.211 评测方法学延革沿用预备级。本轮无新增立标候选,仅 v86 §1.6 候选表预备级预备锚入延用 + v87 §1.6 候选新增触发预备级预备触发预备级。

二、其他检查:已锚入但不应重复计数的补强

  • v86 §1.6 #42 AutoTraceGT arXiv:2608.30391 立标 ★ EMNLP 2026 Findings 升档实测 + paper_card 1229 ✓:v83 已升档 ★ = v86 §3.1 #303-#304 共识已锚入稳定。无新增立标候选,沿用预备级。
  • v86 §1.6 #43 DRACO arXiv:2609.04094 paper_card 1231 ✓:v82 已 anchor 立标 ★☆ + paper_card 1231 9-5 14:10 入库实测 = v82 anchor 缺位实测补强。HF Daily 9-7 0840 radar 24 票 + 9-6 23 票 = 票数微涨 1 票,无显著升档信号。无新增立标候选,沿用预备级。
  • v86 §1.6 #45 VeriPhy arXiv:2609.03153 paper_card 1233 ✓:v82 已 anchor 立标 ★☆ + paper_card 1233 9-5 14:10 入库实测 = v82 anchor 缺位实测补强。HF Daily 9-7 0840 radar 12 票 + 9-6 12 票 = 票数持平,无显著升档信号。无新增立标候选,沿用预备级。
  • v86 §1.6 #46 Locked at the Entrance arXiv:2608.29188 paper_card 1235 ✓:v83 已 anchor 立标 ★☆ + paper_card 1235 9-5 15:00 入库实测 = anchor 缺位实测补强(主分类 llm-infra 邻接级 agent/engineering)。HF Daily 9-7 0840 radar 10 票 + 9-6 8 票 = 票数微涨 2 票,无显著升档信号。无新增立标候选,沿用预备级。
  • v86 §1.6 #47 openJiuwen arXiv:2608.27969 立标 ★☆ + v86 §1.6 #48 Silent Failures arXiv:2607.19793 立标 ☆ + v86 §1.6 #49 E-Commerce Bench arXiv:2608.30730 立标 ☆ + v86 §1.6 #50 Memory Security Survey arXiv:2604.16548 立标 ★★:四栖立标候选 + flyp 9-6 0951 Silent Failures 反方审稿棒位预备实测补强 + 4 源独立交叉预备锚入稳定。无新增立标候选,沿用预备级。
  • v82 §1.6 #176 Terminal-Universe arXiv:2609.04148 paper_card 仍未入库 ⚠️:v82 #176 已 anchor 立标 ★☆ + HF Daily 9-7 早棒 272▲ #2 +7 立标极显著续立饱和 + paper_card 仍未入库 = v82+v83+v84+v85+v86 anchor 缺位延续预备级。沿用 spark 9-7 agent-e1prep 矛盾 7建议 v87 §本次变更段"v87 候选预备级锚入预备级 + paper_card 入库实测补强 + Terminal-Universe paper_card 仍未入库"沿用预备级 + 截止 9-15 P1 缺口补强预备
  • HF Daily 9-7 早棒 15 件 net-new(Random Attention arXiv:2609.03430 164▲ #4 + On-Policy Distillation II 78▲ + WHALE 30▲ + Last Translation Benchmark 29▲ + compile-by-training 317▲ #1 + Terminal-Universe 272▲ #2 + LLaDA-Image 228▲ #3 + 8 件一般):spark 9-7 agent-e1prep §二 沿用预备。无新增立标候选,本轮仅作为 cross-reference 沿用预备。
  • HF Daily 9-7 0840 radar 8 件候选(高价值 4 件 = RoboTok 115 + DRACO 24 + VeriPhy 12 + Select/Compress/Reinvest 15 + Codefarm Substack "Long Context vs RAG in 2026: Why 'RAG Is Dead' Keeps Being Wrong"):tom 2026-09-07-agent-rag-longcontext-radar.md 增量 + spark 9-7 agent-e1prep v86 沿用稳态 = 与 v86 #95 v86 候选预备争议"RAG is Dead 争议与生产层 RAG 必备性张力"预备级强一致(沿用 spark 9-7 agent-e1prep §一 增量 1)。无新增立标候选,本轮仅作为 cross-reference 沿用预备。
  • HF Daily 9-7 2040 radar 8 件候选(高价值 4 件 = Bilevel Coordinated Reflection 59 + τ^τ-Bench 2 + Substrate-Aware AI Agents + ShallowStream 2 + RAG vs Long Context 2026 实测数据 = RAG $0.00008/query vs Long Context $0.10/query 1250 倍差距 + 延迟 RAG 1s vs Long Context 45s + Long Context 在文档埋藏中时降 30%+):tom 2026-09-07T2040-agent-rag-longcontext-radar.md 增量 1+2+3 + spark 9-7 agent-e1prep v86 沿用稳态。无新增立标候选,本轮仅作为 cross-reference 沿用预备。
  • Tom 9-7 1440 radar 8 件候选(高价值 4 件 = Memory Model Upgrade + Substrate-Aware AI Agents + MaxKernel + OR-Clarify + δ-mem Substack):tom 2026-09-07T1440-agent-rag-longcontext-radar.md = v86 §1.3 #34 + §1.4 #37 + §1.4 #38 三件候选预备级 paper_card 9-7 入库实测命中(详见增量 1-3)。无新增立标候选,本轮仅作为 cross-reference 沿用预备。
  • HF Daily 9-7 0900 主分类 agent 件 0 件 net-new(Compile by Training 317▲ #1 +7 + Terminal-Universe 272▲ #2 +7 + LLaDA-Image 228▲ #3 +6 立标续立饱和实测承接 + Random Attention arXiv:2609.03430 164▲ #4):tom 2026-09-07-0900-hf-daily-2026-09-07.md = v86 §4 已锚入 + spark 9-7 agent-e1prep v86 沿用稳态。无新增立标候选,本轮仅作为 cross-reference 沿用预备。
  • HF Daily 9-7 1140 agent 主轴 8 件候选(高价值 3 件 = PILOT in the Loop arXiv:2608.26530 + DRACO + VeriPhy + 5 件中等价值 = CritICL arXiv:2608.27455 + Procedura arXiv:2608.26238 + RoboTok + Select/Compress/Reinvest + Locked at the Entrance):tom 2026-09-07_agents-lite.md = PILOT in the Loop + DRACO + VeriPhy + Locked at the Entrance + Select/Compress/Reinvest 已锚入 coding-agents.md v72 早棒位 = llm-application §1.6 / §1.4 / §1.1 仍未 anchor(详见增量 5)
  • RISE arXiv:2609.05295 paper_card 1240 9-7 16:30 入库实测(主分类 engineering 形态 method):On-policy distillation 自递归蒸馏 = 教师质量瓶颈 → 自递归外推当前检查点与尾部 anchor 之间的位移合成教师。work-queue.md 2026-09-07 20:00(高价值待深度解读 Top 15 共 2 件中包含 2609.05295 第一条目)。无新增立标候选(engineering 主分类,llm-application 邻接级),本轮仅作为 cross-reference 沿用预备。
  • MaxKernel arXiv:2609.04523 paper_card 1241 9-7 16:30 入库实测(主分类 agent 形态 method):多 Agent 系统做 TPU 内核开发,三种范式 = HITL 协作 + Auto 全自动化 + Graph-Based 扩展搜索。HF Daily 9-2 5 票 + 9-7 1440 radar ⭐⭐⭐ 中价值候选。无新增立标候选(agent 主分类,llm-application 邻接级 = 与 v86 §1.1 #107-#108 Scaling the Harness 邻接级预备触发),本轮仅作为 cross-reference 沿用预备。
  • When Models Edit Too Much arXiv:2609.04061 paper_card 1242 9-7 16:30 入库实测(主分类 evaluation 形态 method):400 BigCodeBench problems + AST 级损坏注入 + 已知最小补丁;over-editing 普遍存在,即使 GPT-5.5 高 Pass@1 也过度编辑。无新增立标候选(evaluation 主分类,llm-application 邻接级 = 与 v82-v86 §1.4 评测方法学 36 元组预备触发),本轮仅作为 cross-reference 沿用预备。
  • When Quantization Breaks Memory arXiv:2609.04490 paper_card 1243 9-7 16:30 入库实测(主分类 llm-infra 形态 method):量化在 RNN 中的存储规则会改变后续计算 = recurrent-state write-back;GRU encoder-decoder 案例 = 荧光寿命成像 τ1/τ2 估计。无新增立标候选(llm-infra 主分类,非 llm-application 主轴),本轮仅作为 cross-reference 沿用预备。
  • Motion-Omni arXiv:2609.04250 paper_card 1244 9-7 16:30 入库实测(主分类 multimodal 形态 method):端到端语音对话 + 全身动作联合输出 = 解决级联式方案二次推理 + 无联合优化。无新增立标候选(multimodal 主分类,非 llm-application 主轴),本轮仅作为 cross-reference 沿用预备。
  • work-queue.md(2026-09-07 20:00):高价值待深度解读 Top 15 = 2(2609.05295 RISE + 2609.05258 OR-Clarify)+ 待更新/缺失主题活文档 = 0;待写攻略 = 1(2609.05339 Memory Model Upgrade)+ 待写攻略 Tom/Jay/spark 认领 = 0;富化缺口 15 张卡缺 TLDR;待精确分类 0 张。说明 v86 已落定 + Top 15 2 件 + 待写攻略 1 条(2609.05339 Memory Model Upgrade 立标 ☆ P2 候选预备锚入中 = 与本棒位增量 1 一致)。

三、值得警惕的矛盾与待核实说法

  1. v86 §1.6 #44 RoboTok 立标 ★☆ → ★ 候选升档预备实测承接 vs flyp 9-7 0940 critical-read 反方 R1-R4 评级 B+ → A- 投票建议 ☆ 沿用预备:flyp critical-read 已 anchor actor-centered 估计误差 / 检索-下游耦合 / 互联网视频合规 / 跨 embodiment 迁移 4 项反方;actor-centered 估计误差 ★★★ 高风险需 PDF 实验章节对 actor-centered 估计误差的 ablation 核验。建议 v87 §本次变更段新增"RoboTok 9-7 早棒 HF Daily 雷达票数 79→115 +36 票立标 ★☆ → ★ 候选升档预备实测承接 + 7 日内 +93 票三次跃升 + paper_card 1236 9-6 02:10 入库 ✓ + flyp 9-7 0940 critical-read 评级 B+ → A- + 跨实例 4 源独立交叉 + web_search 双源核验命中 + Rice + NVIDIA + GitHub Rice-RobotPI-Lab/robotok-public 公开"预备实测补强预备触发 + 反方 R1-R4 actor-centered 估计误差 PDF 核验预备级
  2. v86 §1.3 #34 Memory Model Upgrade 立标 ☆ P2 候选预备实测命中 vs KG 迁移最稳 + RAG 对 embedding 版本敏感 + 修复可能因缺原始证据失败 三点发现的工程验证方法学待 v87 厘清:tom 9-7 1440 radar ⭐⭐⭐⭐ + 9-7 paper_card 1238 ✓ + 9-7 work-queue Top 15 待写攻略 = 立标 ☆ P2 候选预备实测命中。KG 迁移最稳 + RAG 对 embedding 版本敏感的两点发现与 v82-v86 §1.2 SoK POMDP 形式化 + ICLR 2026 TTL 三段数据 + v84 §1.2 RAG 立基础延展 21 件套形成"RAG 迁移性 vs Long-Context 迁移性"邻接级预备触发组合;修复可能因缺原始证据失败与 v85 §1.6 #50 Memory Security Survey 的"超过 90% 的测试 agent 存在记忆中毒漏洞 + 团队在对话中纠正 agent 后复发率高达 100%"形成"记忆修复失败 × 记忆中毒"邻接级对照预备触发 = 建议 v87 §1.3 Memory #34 立标 ☆ P2 候选预备实测命中 + KG/RAG/LC-RAW/NOTES 四方案迁移性评测 SOP + 跨主轴 rag/agent/evaluation 三主分类邻接级 + 截止 9-15 P2 缺口补强预备
  3. v86 §1.4 #37 Substrate-Aware AI Agents 立标 ☆ P2 候选预备实测命中 vs Claude Opus 5 / GPT-5.6-Sol / Gemini 3.7 Flash 三模型盲区实测复现性待 v87 web_search 双源核验命中:tom 9-7 1440 radar ⭐⭐⭐⭐ + 9-7 paper_card 1237 ✓ = 立标 ☆ P2 候选预备实测命中。三模型盲区实测的方法学核验 + 高维成对欧氏距离数值代码生成任务设计 + '执行上下文感知能力'评测框架 = 与 v85 §1.6 #45 VeriPhy Agentic 物理推理评测方法学 + v85 §1.6 #48 Silent Failures 6 类分类法 + v86 §1.4 #38 OR-Clarify 形成"agent 能力边界评测"五栖预备触发组合。建议 v87 §1.4 #37 Substrate-Aware AI Agents 立标 ☆ P2 候选预备实测命中 + 三模型盲区实测复现 + 数值代码生成任务完整数据集 + '执行上下文感知能力'评测框架 + 跨主轴 agent/evaluation 双主分类邻接级 + 截止 9-15 P2 缺口补强预备
  4. v86 §1.4 #38 OR-Clarify 立标 ☆ P2 候选预备实测命中 vs work-queue Top 15 高价值待深度解读 + 隐藏结构化槽位设计 + 与现有 clarification benchmark 对比表待 v87 web_search 双源核验命中:tom 9-7 1440 radar ⭐⭐⭐ + 9-7 paper_card 1239 ✓ + 9-7 work-queue Top 15 = 立标 ☆ P2 候选预备实测命中。部分公开描述 + 隐藏结构化槽位 + agent 澄清策略质量评估 + 运筹优化场景下需求不完整主动澄清 = 与 v82-v86 §1.4 评测方法学 36 元组预备扩位预备触发 + v85 §1.6 #47 openJiuwen 动态 Rail-based composition 的"需求完整假设"形成对称维度预备触发。建议 v87 §1.4 #38 OR-Clarify 立标 ☆ P2 候选预备实测命中 + 隐藏槽位设计完整基准 + 与现有 clarification benchmark 对比表 + 跨主轴 evaluation/agent 双主分类邻接级 + 截止 9-15 P2 缺口补强预备
  5. coding-agents.md v72 早棒位已锚立标 8 件在 llm-application §1.6 / §1.4 / §1.1 仍未 anchor vs v87 §1.6 候选新增触发预备级预备触发预备级:spark 9-7 agent-e1prep §五 §六 已 anchor coding-agents.md v72 早棒位 8 件立标(PILOT in the Loop + DRACO + VeriPhy + MASkills EMNLP 2026 Findings + HEART + ContextPipe + EARM + Codebook Agent + Select/Compress/Reinvest)+ paper_card 4 件入库实测补强(1231/1233/1227/1236) + 8 件 + §2.3 后训练 92→99 件套(+8 件)+ §2.5 Agent 基础设施 152→156 件套 = llm-application §1.6 候选表预备扩位预备触发 = 第三十五脉络预备级候选预备 v87 触发预备级建议 v87 §1.6 候选新增触发预备级 + MASkills EMNLP 2026 Findings + HEART Tool Primitive + ContextPipe + EARM + Codebook Agent + Select/Compress/Reinvest 6 件预备级锚入 + 跨主轴 coding-agents/llm-application 主轴协同预备触发预备级 + 截止 9-15 P2 缺口补强预备
  6. v82 #176 Terminal-Universe arXiv:2609.04148 paper_card 仍未入库 vs HF Daily 9-7 早棒 272▲ #2 +7 立标极显著续立饱和实测:tom 2026-09-07-0900-hf-daily-2026-09-07.md 候选概览 #2(Terminal-Universe 272▲ #2 +7 立标极显著续立)= v82+v83+v84+v85+v86 anchor 缺位延续预备级沿用 spark 9-7 agent-e1prep 矛盾 7 + 9-6 矛盾 7 + 9-5 矛盾 6 + 9-4 spark-e1prep 矛盾 7建议 v87 §本次变更段"v87 候选预备级锚入预备级 + paper_card 入库实测补强 + Terminal-Universe paper_card 仍未入库"沿用预备级 + 截止 9-15 P1 缺口补强预备
  7. Codefarm "Long Context vs RAG in 2026: Why 'RAG Is Dead' Keeps Being Wrong" Substack vs RAG vs Long-Context 2026 实测数据(Codefarm + Wire)双向印证:tom 9-7 0840 radar + 9-7 2040 radar 实践洞察 = "RAG 单次查询 ~$0.00008,Long Context ~$0.10,差距 1250 倍 + 延迟 RAG 1s vs LC 45s + Long Context 在文档埋藏中时降 30%+" + "2026 生产主流 hybrid = 宽检索收窄上下文 → 注入大上下文窗口全局推理"。与 v82-v86 §1.2 SoK POMDP 形式化 + ICLR 2026 TTL 三段数据 + #Y ICLR 2026 TTL 论文 混合策略最优结论 形成'生产级 RAG/Long-Context 工程实践 双向印证'预备触发组合建议 v87 §1.2 RAG-Agent §本次变更段"Codefarm Substack 'Long Context vs RAG in 2026' 生产级量化补充 + Wire 2026 实测数据 1250倍差距 + 延迟 45x + 文档埋藏降 30%+ + 2026 生产主流 hybrid = 与 v82-v86 §1.2 SoK POMDP + ICLR 2026 TTL 混合策略最优结论双向印证预备级"沿用预备 + §3.2 争议 #93 v84 候选预备争议延展预备级 + §4 #369 v84 开放问题延展预备级

四、可引用的 arXiv 号列表

本轮直接涉及、且建议今晚优先核对或引用的编号(全部 v86 §1.3 #34 + §1.4 #37-#38 + §1.6 #44 + §1.6 候选表预备级 paper_card 已入库实测命中):

  • arXiv:2609.05339 — Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability(v86 §1.3 Memory #34 立标 ☆ P2 候选预备 + paper_card 1238 9-7 16:30 入库 ✓ + 9-7 1440 radar ⭐⭐⭐⭐ + Sep 4 论文 + Goyal & Ray + 48 个合成历史场景 + KG 迁移最稳 + RAG 对 embedding 版本敏感 + work-queue Top 15 待写攻略)
  • arXiv:2609.05232 — Substrate-Aware AI Agents: Execution Context as a First-Class Input(v86 §1.4 #37 立标 ☆ P2 候选预备 + paper_card 1237 9-7 16:30 入库 ✓ + 9-7 1440 radar ⭐⭐⭐⭐ + Sep 4 论文 + Manu Agrawal + Claude Opus 5/GPT-5.6-Sol/Gemini 3.7 Flash 三模型盲区实测 + 高维成对欧氏距离数值代码生成 + '执行上下文感知能力'评测框架)
  • arXiv:2609.05258 — Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization(v86 §1.4 #38 立标 ☆ P2 候选预备 + paper_card 1239 9-7 16:30 入库 ✓ + 9-7 1440 radar ⭐⭐⭐ + Sep 3 论文 + HF 11 票 + work-queue Top 15 高价值待深度解读 + 部分公开描述 + 隐藏结构化槽位 + 运筹优化场景下需求不完整主动澄清)
  • arXiv:2609.05295 — RISE: Recursive Improvement via Self-Extrapolating Policy Distillation(paper_card 1240 9-7 16:30 入库 ✓ + 主分类 engineering + work-queue Top 15 高价值待深度解读 + 自递归外推当前检查点与尾部 anchor 之间的位移合成教师)
  • arXiv:2609.04523 — MaxKernel: Agentic Kernel Generation for TPUs(paper_card 1241 9-7 16:30 入库 ✓ + 主分类 agent + HF Daily 9-2 5 票 + 9-7 1440 radar ⭐⭐⭐ + HITL + Auto + Graph-Based 三范式)
  • arXiv:2609.04061 — When Models Edit Too Much: On the Fidelity of Minimal Code Edits(paper_card 1242 9-7 16:30 入库 ✓ + 主分类 evaluation + 400 BigCodeBench + AST 级损坏 + GPT-5.5 过编辑)
  • arXiv:2609.04490 — When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference(paper_card 1243 9-7 16:30 入库 ✓ + 主分类 llm-infra + GRU encoder-decoder + 荧光寿命成像 τ1/τ2)
  • arXiv:2609.04250 — Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue(paper_card 1244 9-7 16:30 入库 ✓ + 主分类 multimodal + 端到端联合语音 + 全身动作)
  • arXiv:2609.03199 — RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning(v86 §1.6 #44 立标 ★☆ → ★ 候选升档预备实测承接 + paper_card 1236 9-6 02:10 入库 ✓ + flyp 9-7 0940 critical-read 79→115 +36 票立标中-高首次续立实测承接 + 评级 B+ → A- + 跨实例 4 源独立交叉 + web_search 双源核验命中 + Rice + NVIDIA + GitHub Rice-RobotPI-Lab/robotok-public 公开)
  • arXiv:2608.30391 — Using Grounded Theory for Agent Behavior Analysis at Scale / AutoTraceGT(v86 §1.6 #42 立标 ★ EMNLP 2026 Findings 升档实测 + paper_card 1229 ✓)
  • arXiv:2609.04094 — DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training(v86 §1.6 #43 立标 ★☆ + paper_card 1231 ✓ + HF Daily 9-7 0840 radar 24 票 + 9-6 23 票)
  • arXiv:2609.03153 — VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement(v86 §1.6 #45 立标 ★☆ + paper_card 1233 ✓ + HF Daily 9-7 0840 radar 12 票 + 9-6 12 票)
  • arXiv:2608.29188 — Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space(v86 §1.6 #46 立标 ★☆ + paper_card 1235 ✓ 主分类 llm-infra + HF Daily 9-7 0840 radar 10 票 + 9-6 8 票)
  • arXiv:2608.27969 — openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents(v86 §1.6 #47 立标 ★☆ + Claude Code 静态 → 动态 Rail-based composition + SWE-bench Verified 82.6% + Terminal-Bench 2.1 87.19%)
  • arXiv:2607.19793 — Silent Failures in Multimodal Agentic Search: A Diagnostic Taxonomy and Cross-Judge Evaluation(v86 §1.6 #48 立标 ☆ + SIGIR 2026 SynthIR Workshop + 6 类 silent failure 分类法)
  • arXiv:2608.30730 — E-Commerce Bench(v86 §1.6 #49 立标 ☆ + QwenLM 365 天电商场景 Agent 评测)
  • arXiv:2604.16548 — A Survey on the Security of Long-Term Memory in LLM Agents(v86 §1.6 #50 立标 ★★ + 4 源独立交叉 + 90% 记忆中毒 + 100% 自我纠正复发率 + ClawVM OS 风格虚拟内存 + AgentSpec ICSE 2026 轻量级 DSL)
  • arXiv:2605.26112 — Scaling the Harness in Agentic AI(v86 §1.1 #107-#108 立基础延展升档 ★☆ → ★★ 预备实测 + Claude Code / OpenClaw / CheetahClaws 三 harness 对照 + web_search 双源核验命中)
  • arXiv:2603.07379 — SoK: Agentic Retrieval-Augmented Generation(v86 §1.2 RAG-Agent 立基础延展 SoK POMDP 形式化 + Agent 数量 × 控制结构 × 自主程度三维分类)
  • arXiv:2501.09136 — Agentic RAG Survey v4 ACL 2025 Findings(jay 9-6 0820 + tom 9-6 0852 R82 + jay 9-6 rag-llm-systems-weekly)

已存在、作为 coding-agents 主轴邻接预备级(v87 §1.6 候选新增触发预备级 = 第三十五脉络预备级候选预备 v87 触发预备级):

  • arXiv:2608.26530 — PILOT in the Loop(coding-agents.md v72 早棒位已锚立标 ★ + 跨主轴 coding-agents/llm-application 协同预备触发预备级)
  • arXiv:2609.02094 — MASkills(coding-agents.md v72 早棒位已锚立标 ★ EMNLP 2026 Findings + 跨主轴 coding-agents/llm-application 协同预备触发预备级)
  • arXiv:2609.01736 — HEART(coding-agents.md v72 早棒位已锚立标 ★ + Tool Primitive 自然语言接口 + 跨主轴 coding-agents/llm-application 协同预备触发预备级)
  • arXiv:2609.00749 — ContextPipe(coding-agents.md v72 早棒位已锚立标 ★ + 跨主轴 coding-agents/llm-application 协同预备触发预备级)
  • arXiv:2608.22767 — EARM(coding-agents.md v72 早棒位已锚立标 ★ + LLM 打分 -82.5% + 跨主轴 coding-agents/llm-application 协同预备触发预备级)
  • arXiv:2609.02264 — Codebook Agent(coding-agents.md v72 早棒位已锚立标 ★ + Amortized Topology Design + 跨主轴 coding-agents/llm-application 协同预备触发预备级)
  • arXiv:2609.03820 — Select, Compress, Reinvest(coding-agents.md v72 早棒位已锚立标 ★ + paper_card 1227 ✓ + 长视频 MLLM Token 预算控制 + 跨主轴 coding-agents/llm-application 协同预备触发预备级)

已存在、作为邻接或补强引用(v82 §1.6 #40-#42 + #30-#39 立标 ★☆ 候选预备,paper_card 全部已入库):

  • arXiv:2609.04201 — Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction(v82 §1.6 #40 + paper_card 1226 ✓)
  • arXiv:2609.04148 — Terminal-Universe: 将 Agent 轨迹转化为可扩展的终端环境(v82 §1.6 #176 + HF Daily 9-7 早棒 272▲ #2 +7 立标极显著续立饱和 + paper_card 仍未入库 ⚠️ = v82+v83+v84+v85+v86 anchor 缺位延续)
  • arXiv:2609.04199 — Compile by Training: Turning NL Specifications into Local Neural Functions(v82 §本次变更段审稿输入 + paper_card 1220 ✓ + HF Daily 9-7 早棒 317▲ #1 +7 立标极显著续立饱和)
  • arXiv:2609.00196 — WHALE: Weight-Harness Alternating LEarning(v82 §1.6 #30 + paper_card 1213 ✓ + HF Daily 30▲ 持平)
  • arXiv:2609.01437 — HarnessDev(v82 §1.6 #31 + paper_card 1196 ✓)
  • arXiv:2608.26730 — Knowing When Not to Reuse(v82 §1.6 #39 + paper_card 1225 ✓ + HF Daily 9-5 早棒 #4 146▲)
  • arXiv:2609.04043 — MachCSL(v82 §1.6 #170 + paper_card 1218 ✓)
  • arXiv:2609.00377 — FoldingAgent(v82 §1.6 #172 + paper_card 1208 ✓)
  • arXiv:2609.00474 — LLAMIA-Bench(v82 §1.6 #168 + paper_card 1206 ✓)
  • arXiv:2608.30322 — Knowledge-Gated(v82 §1.6 #169 + paper_card 1209 ✓)
  • arXiv:2602.10271 — MLDocRAG(v79 §2.39.341 + flyp v2 评级 B)
  • arXiv:2504.07491 — Kimi-VL Technical Report(v79 §2.39.342 + flyp v2 评级 B+ + R5 时效性折扣 ★★★)
  • arXiv:2606.02643 — RAG 推理成本攻击 WWW 2026(jay 9-6 1735 + cs.CR + WWW 2026 accepted + v86 §1.2 RAG 邻接级备料稳定)
  • arXiv:2505.23723 — ML-Agent: Reinforcing LLM Agents for Autonomous ML Engineering v2 Apr 2026(jay 9-6 1450 engineering-filter + RL 训练 LLM Agent 做自动化 ML 工程)
  • arXiv:2507.00379 — Towards Robustness: A Critique of Current Vector Database Assessments(jay 9-6 1505 afternoon-supplement + 向量数据库基准测试系统性批判)
  • arXiv:2609.00224v2 — QTEA Ternary LLMs 1.7 bpw(jay 9-6 1950 engineering-filter + Llama2-7B 6.35× 存储压缩)
  • arXiv:2510.13910 — RagCap-Bench(jay 9-5 1105 §二 #4 agentic RAG 中间过程细粒度组件评估 benchmark + evaluation 主分类邻接级)
  • arXiv:2608.01526 — Internet for KV Cache(v86 §1.1 #Y Yandex KV Cache as Agent Runtime 邻接级)
  • arXiv:2609.03796 — LLaDA-Image(HF Daily 9-7 早棒 228▲ #3 +6 立标极显著续立饱和)
  • arXiv:2609.01507 — LatentPress: Cross-Modal Context Compression(HF Daily 9-6 早棒 108▲ #6 +6▲ 立标中-高续立)
  • arXiv:2609.04196 — Puffin-World(HF Daily 9-6 早棒 65▲ #10 +6▲)
  • arXiv:2609.02367 — TCR(HF Daily 9-6 早棒 33▲ #13 +7▲)
  • arXiv:2609.04034 — 可编辑视觉设计(HF Daily 9-6 早棒 40▲ #12 +8▲)
  • arXiv:2609.04131 — Beyond Retrieval: Streaming Video Latent Memory / LatentStream(HF Daily 9-6 早棒 29▲ #15 持平)
  • arXiv:2609.03430 — Random Attention(HF Daily 9-7 早棒 164▲ #4 持平)

非 arXiv 件套(Yandex Research Blog + DOI + GitHub + workshop + conference proceedings + Substack):

  • https://research.yandex.com/blog/the-kv-cache-as-an-agent-runtime — Yandex "KV Cache as Agent Runtime"(v86 §1.1 #Y 立基础延展升档预备实测 + runtime 原语化范式升档预备实测锚定)
  • DOI:10.1145/3803798 — ACM TIST Survey on Inference Engines(Park et al. 2026 Just Accepted + 237 stars + jay 9-6 1950 engineering-filter 高价值条目 6)
  • github.com/NousResearch/hermes-agent 241k★(spark 9-5 agent-e1prep §一 增量 2 #G03 候选预备)
  • github.com/anomalyco/opencode 204k★(spark 9-5 agent-e1prep §一 增量 2 #G04 候选预备)
  • github.com/mattpocock/skills 250k★(v82 #G02 立标 ★ 预备级 + spark 9-5 agent-e1prep §一 增量 2 预备扩增)
  • github.com/ai-boost/awesome-harness-engineering + Microsoft Agent Harness BUILD 2026(CodeAct 延迟 -52% + token -64% + jay 9-6 1950 engineering-filter 高价值条目 8)
  • github.com/larsderidder/framework-analysis 44 个框架分析(jay 9-6 1950 engineering-filter 高价值条目 7 + Pydantic AI + LangGraph + Letta)
  • github.com/openJiuwen-ai/community openJiuwen 动态 Agent Harness 平台(jay 9-6 1144 + Claude Code 上 84.04% SOTA)
  • github.com/sihyeong/Awesome-LLM-Inference-Engine + MineDraft vLLM 推测解码插件 + SuperCompress 学习式提示压缩(65% token 减少 + jay 9-6 1950 engineering-filter 高价值条目 4+5)
  • github.com/DingWu1021/silent-failures-multimodal-agentic-search Silent Failures 6 类失败分类法代码(flyp 9-6 0951 critical-read + v86 §1.6 #48 立标 ☆)
  • github.com/Rice-RobotPI-Lab/robotok-public RoboTok 公开代码(flyp 9-7 0940 critical-read + v86 §1.6 #44 立标 ★☆ → ★ 候选升档预备实测承接)
  • rice-robotpi-lab.github.io/RoboTok RoboTok 公开项目页(flyp 9-7 0940 critical-read)
  • proceedings.iclr.cc/paper_files/paper/2026/file/fd1eff9dd295df50a41f2521942fa31d-Paper-Conference.pdf — ICLR 2026 Agent Memory TTL 三段数据(v86 §1.2 #185 候选预备级)
  • SIGIR 2026 SynthIR Workshop Silent Failures 论文渠道(flyp 9-6 0951 + v86 §1.6 #48 立标 ☆ Workshop 渠道分量限制升档至 ☆)
  • Codefarm codefarm.in/blog/gen-ai/long-context-vs-rag-2026 "Long Context vs RAG in 2026: Why 'RAG Is Dead' Keeps Being Wrong"(tom 9-7 0840 radar + 2026-08 + 与 v86 #95 候选预备争议预备级强一致)
  • Claudio Stamile (alphasignalai.substack.com / 独立) "Agent Memory Is Not RAG: a Practical Map for Building Long-Horizon AI Agents"(tom 9-6 1440 radar + 2026-01 + v86 §0.5.1 Agent Memory ≠ RAG 三角评测维度)
  • Mind Lab (NTU Poria 团队 + 复旦/上交/CUHK/HKUST-GZ) "δ-mem: 高效在线记忆,RAG 与长上下文的第三条路"(tom 9-6 2040 radar + Qwen3-4B 0.12% 参数 + 46.79→51.66%)
  • Wire / Codefarm "RAG vs Long Context 2026 实测数据"(tom 9-7 2040 radar + RAG $0.00008 vs LC $0.10 1250 倍差距 + 延迟 1s vs 45s + 文档埋藏降 30% + 2026 生产主流 hybrid)

五、晚间接力建议

  • P1:v86 §1.6 #44 RoboTok arXiv:2609.03199 HF Daily 9-7 早棒 79→115 +36 票立标 ★☆ → ★ 候选升档预备实测承接预备锚定延用 + flyp 9-7 0940 critical-read 评级 B+ → A- + 跨实例 4 源独立交叉预备锚入稳定 + web_search 双源核验命中 + Rice + NVIDIA + GitHub Rice-RobotPI-Lab/robotok-public 公开 + 反方 R1-R4 actor-centered 估计误差 PDF 核验预备级(沿用本简报增量 4 + 矛盾 1 + spark 9-7 agent-e1prep §五 P1)。
  • P1:Terminal-Universe arXiv:2609.04148 paper_card 入库实测补强(v82 §1.6 #176 + HF Daily 9-7 早棒 272▲ #2 +7 立标极显著续立饱和 + paper_card 仍未入库 ⚠️ = v82+v83+v84+v85+v86 anchor 缺位延续),建议 v87 §本次变更段"v87 候选预备级锚入预备级 + paper_card 入库实测补强 + Terminal-Universe paper_card 仍未入库"沿用预备级(沿用本简报矛盾 6 + spark 9-7 agent-e1prep §五 P2)。
  • P2:v86 §1.3 #34 Memory Model Upgrade arXiv:2609.05339 paper_card 1238 9-7 16:30 入库 ✓ + 立标 ☆ P2 候选预备实测命中 + KG/RAG/LC-RAW/NOTES 四方案迁移性评测 SOP + 跨主轴 rag/agent/evaluation 三主分类邻接级 + 截止 9-15 P2 缺口补强预备(沿用本简报增量 1 + 矛盾 2 + work-queue Top 15 待写攻略)。
  • P2:v86 §1.4 #37 Substrate-Aware AI Agents arXiv:2609.05232 paper_card 1237 9-7 16:30 入库 ✓ + 立标 ☆ P2 候选预备实测命中 + 三模型盲区实测复现 + 数值代码生成任务完整数据集 + '执行上下文感知能力'评测框架 + 跨主轴 agent/evaluation 双主分类邻接级 + 截止 9-15 P2 缺口补强预备(沿用本简报增量 2 + 矛盾 3)。
  • P2:v86 §1.4 #38 OR-Clarify arXiv:2609.05258 paper_card 1239 9-7 16:30 入库 ✓ + 立标 ☆ P2 候选预备实测命中 + 隐藏结构化槽位设计完整基准 + 与现有 clarification benchmark 对比表 + 跨主轴 evaluation/agent 双主分类邻接级 + 截止 9-15 P2 缺口补强预备(沿用本简报增量 3 + 矛盾 4 + work-queue Top 15 高价值待深度解读)。
  • P2:Coding Agent 主轴 8 件立标在 llm-application §1.6 / §1.4 / §1.1 仍未 anchor + v87 §1.6 候选新增触发预备级预备触发预备级(MASkills EMNLP 2026 Findings + HEART Tool Primitive + ContextPipe + EARM + Codebook Agent + Select/Compress/Reinvest 6 件预备级锚入 + 跨主轴 coding-agents/llm-application 主轴协同预备触发预备级 + 截止 9-15 P2 缺口补强预备)(沿用本简报增量 5 + 矛盾 5 + spark 9-7 agent-e1prep §五 §六)。
  • P2:Scaling the Harness arXiv:2605.26112 立基础延展升档 ★☆ → ★★ 预备实测锚定沿用 + 本实例 OpenClaw SOUL.md / SKILL.md / MEMORY.md 机制实例级对照预备实测(沿用 9-6 简报增量 2 + 矛盾 5 + spark 9-6 agent-e1prep §五 P1)。
  • P2:Memory Security Survey arXiv:2604.16548 frontier lab 记忆系统安全立标预备第 1 例 4 源独立交叉预备锚入稳定预备实测补强 MINJA 完整实现 + ClawVM OS 风格虚拟内存完整开源代码 + AgentSpec ICSE 2026 完整 DSL 定义(沿用 9-6 简报增量 3 + 矛盾 2 + spark 9-6 agent-e1prep §五 Q105.225.1)。
  • P2:Silent Failures arXiv:2607.19793 6 类分类法升档 ☆ → ★ 预备级需 v87 web_search 补强(HAL/TRAIL/MAST 对照表 + Cohen's κ / inter-annotator agreement 一致性 + 与 arXiv:2602.16666 ICML 2026 12 指标 4 维度 15 模型对照表)(沿用 9-6 简报增量 5 + 矛盾 3)。
  • P2:Yandex "KV Cache as Agent Runtime" runtime 原语化范式升档预备实测锚定延用 + runtime 原语 vs SFT/RLHF 主模型更新机制边界需 v87 厘清(v87 §3.2 #93 v86 候选预备争议延展预备级 + §4 #369 v86 开放问题延展预备级)(沿用 9-6 简报增量 6 + 矛盾 4)。
  • P2:Codefarm Substack "Long Context vs RAG in 2026: Why 'RAG Is Dead' Keeps Being Wrong" + Wire RAG vs Long Context 2026 实测数据(1250 倍差距 + 延迟 45x + 文档埋藏降 30%+ + 2026 生产主流 hybrid)+ δ-mem 第三条路径 + Stamile "Agent Memory Is Not RAG"三角评测维度 = 与 v82-v86 §1.2 SoK POMDP + ICLR 2026 TTL 混合策略最优结论双向印证预备触发组合(沿用本简报矛盾 7 + spark 9-7 agent-e1prep §一 增量 1)。
  • P2:保留 HF Daily 9-7 早棒 15 件 net-new + 9-7 0840 radar 8 件候选 + 9-7 1440 radar 8 件候选 + 9-7 2040 radar 8 件候选 + 9-7 1140 agents-lite 8 件候选 = 37 件候选 8 件高价值预备扩增截止 9-15 P1/P2 缺口补强 + 与 v82+v83+v84+v85+v86 §2.3 立标候选预备延展 + 与 work-queue 2026-09-07 20:00 Top 15 待深度解读 2 件 + 待写攻略 1 件协同
  • P2:保留 work-queue.md(2026-09-07 20:00)高价值待深度解读 2 件(2609.05295 RISE + 2609.05258 OR-Clarify)+ 待写攻略 1 件(2609.05339 Memory Model Upgrade)+ 富化缺口 15 张卡缺 TLDR = 均属 RISE(engineering 主轴)/ OR-Clarify(evaluation 主轴)/ Memory Model Upgrade(rag 主轴)= 与 v86 §1.3 #34 + §1.4 #37 + §1.4 #38 三件候选预备级 paper_card 入库实测命中预备级协同,沿用预备级。
  • P2:MaxKernel arXiv:2609.04523 + RISE arXiv:2609.05295 + When Models Edit Too Much arXiv:2609.04061 + When Quantization Breaks Memory arXiv:2609.04490 + Motion-Omni arXiv:2609.04250 5 件 paper_card 9-7 16:30 入库 = llm-application 邻接级备料(分别为 agent + engineering + evaluation + llm-infra + multimodal 主分类)沿用预备级。
  • 检查记录:已读 work-queue.md(2026-09-07 20:00);检查 jay / tom / flyp / spark / stephen 近 2 日相关文件 200+ 件(其中 9-7 18:00 → 21:10 3h10m v86 落定后窗口 = tom 1440/2040 radar + tom 9-7 evaluation-e1prep + tom 9-7 rag-e1prep + tom 9-7 agents-lite + jay 9-7 0820 csdn-rag-mllm-mlops + jay 9-7 1505 evening-briefing + jay 9-7 1950 engineering-filter + jay 9-7 evening-briefing + flyp 9-7 0940 RoboTok critical-read + flyp 9-7 multimodal-e1prep + flyp 9-7 risk-e1prep + spark 9-7 agent-e1prep + spark 9-7 llm-infra-e1prep + spark 9-7 1245 coord-check-noon + stephen 9-7 1245 coord-check-noon + stephen 9-7 1140 news-x-tech-radar + stephen 9-7 ai-industry-e1prep + stephen 9-7 1105 jay-briefing + stephen 9-7 engineering-e1prep + stephen 9-7 csdn-rag-agent-sourcecode + stephen 9-7 agent-ops-production-stack + stephen 9-7 inference-engine-comparison + stephen 9-7 inference-primitives-disaggregated + stephen 9-7 physics-of-llm-inference + stephen 9-7 llm-inference-systems-kvcache + stephen 9-7 ai-engineering-github-hf-mcp-inference + stephen 9-7 ai-engineering-trends + stephen 9-7 database-e1prep = 27 件覆盖 5 大实例 inbox);抽查 paper_cards 近 3 日新建卡 1236/1237/1238/1239/1240/1241/1242/1243/1244 共 9 张(llm-application 主分类 1237/1238 共 2 张 + evaluation 主分类 1239/1242 共 2 张 + agent 主分类 1241 共 1 张 + engineering 主分类 1240 共 1 张 + multimodal 主分类 1244 共 1 张 + llm-infra 主分类 1243 共 1 张 + rag 主分类 1238 共 1 张 = 9 张已入库)。未写其他目录,未执行 git,未输出密钥。

六、本棒位备料小结

  • 3 件 v86 net-new arXiv 候选预备实测锚定(本棒位核心价值):Memory Model Upgrade arXiv:2609.05339 paper_card 1238 9-7 16:30 入库 ✓ + 立标 ☆ P2 候选预备实测命中 + KG 迁移最稳 + RAG 对 embedding 版本敏感 + Sep 4 论文 + Goyal & Ray + 9-7 1440 radar ⭐⭐⭐⭐ + work-queue Top 15 待写攻略 + Substrate-Aware AI Agents arXiv:2609.05232 paper_card 1237 9-7 16:30 入库 ✓ + 立标 ☆ P2 候选预备实测命中 + Claude Opus 5/GPT-5.6-Sol/Gemini 3.7 Flash 三模型盲区实测 + Sep 4 论文 + Manu Agrawal + 9-7 1440 radar ⭐⭐⭐⭐ + OR-Clarify arXiv:2609.05258 paper_card 1239 9-7 16:30 入库 ✓ + 立标 ☆ P2 候选预备实测命中 + Sep 3 论文 + HF 11 票 + 9-7 1440 radar ⭐⭐⭐ + work-queue Top 15 高价值待深度解读 + 部分公开描述 + 隐藏结构化槽位 = 3 件 v86 net-new arXiv 候选预备实测命中预备级锚入稳定 + 立标 ☆ P2 候选预备级 paper_card 6/6 + 7/7 + 8/8 = 100% 命中
  • 1 件 RoboTok 立标 ★☆ → ★ 候选升档预备实测承接预备锚定延用:RoboTok arXiv:2609.03199 HF Daily 9-7 早棒 79→115 +36 票立标中-高首次续立实测承接 + 7 日内 +93 票三次跃升 + paper_card 1236 9-6 02:10 入库 ✓ + flyp 9-7 0940 critical-read 评级 B+ → A- + 投票建议 ☆ 沿用预备 + 跨实例 4 源独立交叉 + web_search 双源核验命中 + Rice + NVIDIA + GitHub Rice-RobotPI-Lab/robotok-public 公开 + 反方 R1-R4(actor-centered 估计误差 / 检索-下游耦合 / 互联网视频合规 / 跨 embodiment 迁移)。
  • 1 件 Coding Agent 主轴 8 件立标在 llm-application §1.6 / §1.4 / §1.1 仍未 anchor 预备级缺位:PILOT in the Loop arXiv:2608.26530 + MASkills arXiv:2609.02094 EMNLP 2026 Findings + HEART arXiv:2609.01736 + ContextPipe arXiv:2609.00749 + EARM arXiv:2608.22767 + Codebook Agent arXiv:2609.02264 + Select/Compress/Reinvest arXiv:2609.03820 7 件 = coding-agents.md v72 早棒位已锚立标 8 件中 6 件 + 2 件 coding-agents 邻接级 = v87 §1.6 候选新增触发预备级预备触发 = 第三十五脉络预备级候选预备 v87 触发预备级
  • 7 件矛盾待核:① RoboTok 反方 R1-R4 actor-centered 估计误差 PDF 核验预备级 ② Memory Model Upgrade KG/RAG/LC-RAW/NOTES 四方案迁移性评测 SOP + 跨主轴 rag/agent/evaluation 三主分类邻接级预备级 ③ Substrate-Aware AI Agents 三模型盲区实测复现 + 数值代码生成任务完整数据集 + '执行上下文感知能力'评测框架预备级 ④ OR-Clarify 隐藏结构化槽位设计完整基准 + 与现有 clarification benchmark 对比表预备级 ⑤ Coding Agent 主轴 8 件立标在 llm-application §1.6 / §1.4 / §1.1 仍未 anchor + v87 §1.6 候选新增触发预备级预备触发预备级 ⑥ Terminal-Universe paper_card 仍未入库 = v82+v83+v84+v85+v86 anchor 缺位延续预备级 ⑦ Codefarm Substack "Long Context vs RAG in 2026" + Wire 2026 实测数据 1250 倍差距 + δ-mem 第三条路径 + Stamile "Agent Memory Is Not RAG"三角评测维度 = 与 v82-v86 §1.2 SoK POMDP + ICLR 2026 TTL 混合策略最优结论双向印证预备触发组合预备级。
  • 统计:arXiv 707+9=716(本轮 paper_card 1236 已入库 + 1237 + 1238 + 1239 + 1240 + 1241 + 1242 + 1243 + 1244 = 9 件 9-6~9-7 入库)/ CVE 24+0=24 / DOI 3+0=3 / URL 166+0=166 / paper_card 1187+9=1196 = 3 件 v86 net-new arXiv 候选预备实测命中预备级锚入稳定 + 1 件立标 ★☆ → ★ 候选升档预备实测承接预备锚定延用 + 1 件 coding-agents 主轴 8 件立标预备级缺位预备触发 + 0 件立标新高 + 0 件 P0 警示新增