llm-application · E1 预消化简报(2026-09-06)
- 实例:Stephen
- 基线:
organized/knowledge/llm-application.mdv84(cutoff 2026-09-06 18:00 CST) - 窗口:v84 落定后 3h10m 二次承接备料(18:00 → 21:10 CST);主要核验 v84 §1.6 #47-#50 四栖立标候选 + §1.1 #107-#108 Scaling the Harness 立基础延展升档 ★☆ → ★★ + #Y Yandex KV Cache as Agent Runtime + §1.2 SoK POMDP + ICLR 2026 Agent Memory TTL 等 9-5~9-6 24h 已锚定件套在近 2 日 inbox 中是否有更深补强,以及 RoboTok / Compile by Training / Terminal-Universe 等立标 ★☆ 候选在 18:00 后的实测票数动态与新增预备延展信号。
- 结论:本轮 6 条值得今晚接力棒继续消化的净增量——其中 3 条实测级票数动态预备(RoboTok 79→114 +35 立标 ★☆ 升档 ★ 预备实测触发信号、LatentPress 108→(?)+22 沿用预备、Memory Security Survey 90% 记忆中毒 + 100% 复发率 跨主轴 4 源锚入稳定预备) + 2 条 v84 候选立标延展边界(Scaling the Harness §1.1 #107-#108 ★☆ → ★★ web_search 双源核验命中预备实测锚定沿用 + SoK Agentic RAG POMDP 与 ICLR 2026 TTL 三段数据 vs RagCap-Bench 邻接级对照预备) + 1 条 v84 候选立标预备实测预备沿用(#47 openJiuwen 沿用 + #48 Silent Failures 6 类分类法与 HAL/TRAIL/MAST 对照表待补 + #49 E-Commerce Bench 与 SWE-bench/WebArena 评测矩阵对比预备 + #50 Memory Security Survey MINJA 范式前沿 lab 记忆系统安全立标预备第 1 例)。无 net-new arXiv 主集加入,无立标新高,无 P0 警示新增。
一、本棒位今日 6 条重要增量
增量 1 · RoboTok arXiv:2609.03199 HF Daily 9-6 20:40 雷达票数 79▲ → 114▲(+35)立标 ★☆ 升档 ★ 预备实测触发信号
- 来源:tom
2026-09-06T2040-agent-rag-longcontext-radar.md候选概览 #1(RoboTok 114 票 RAG+机器人)+ tom2026-09-06T1440-agent-rag-longcontext-radar.md(RoboTok 97 票)+ tom2026-09-06-0900-hf-daily-2026-09-06.md(RoboTok 79▲ #7 +37▲);paper_cards/1236-2609-03199.md(2026-09-06 02:10 入库 · 主分类 rag 副分类 multimodal);v84 §1.6 #44 RoboTokarXiv:2609.03199已 anchor 立标 ★☆(paper_card 1236 9-6 02:10 入库 ✓);spark2026-09-06-agent-e1prep.md增量 5(RoboTok 22→40→77→79 三次跃升);flyp2026-09-06-multimodal-e1prep.md增量 1(RoboTok 79▲ #7 立标中-高首次实测承接);tom2026-09-06-evaluation-e1prep.md与2026-09-06-rag-e1prep.md(RoboTok 沿用预备)。 - 要点:RoboTok = 互联网规模机器人演示检索引擎;给定查询人类操作视频,从网络视频检索操作相关演示用于训练灵巧机器人策略;学习 3D 手部轨迹在 actor-centered 参考系下的潜在 motion space;使操作行为能够跨视角、跨场景比较,覆盖真实任务长尾。HF Daily 9-6 早棒 79▲ #7 → 14:40 radar 97 票 → 20:40 radar 114 票(+35) 是 v84 落定后 3h10m 窗口内的实测票数显著跃升。票数轨迹 9-1 立标 22▲ → 9-5 0840 radar 22▲ → 9-5 1440 radar 40▲ → 9-5 2040 radar 40▲ → 9-6 早棒 77▲ → 9-6 0840 radar 77▲ → 9-6 早棒 79▲ → 9-6 1440 radar 97▲ → 9-6 2040 radar 114▲ = 24h 内 +35 票 + 7 日内 +92 票,为 v84 §1.6 #44 RoboTok 立标 ★☆ 候选中 唯一持续显著升档信号(其他 #43 DRACO 23▲ 持平、#45 VeriPhy 11▲→12▲ 微涨、#46 Locked at the Entrance 8▲ 持平 = 三件持平/微涨稳态预备)。
- 与活文档脉络的关系:v84 §1.6 #44 RoboTok 立标 ★☆ + paper_card 1236 9-6 02:10 入库实测 = anchor 缺位补强完成。票数 79→114(+35)持续跃升 + 跨主轴 rag/multimodal 锚入预备 = v84 §1.6 #44 RoboTok 立标 ★☆ → ★ 候选升档预备实测触发信号(spark 9-6 agent-e1prep §六 风险点 e 已锚定"RoboTok 票数三次跃升 22→40→77→79 +57 票立标中-高首次续立实测承接 + paper_card 1236 入库实测 = v84 #184 候选预备级不扩向稳态方法学一致性验证预备级"——本棒位 9-6 20:40 114 票实测延展 +24h 内再 +35 票 = 立标 ★☆ → ★ 候选升档预备实测触发沿用)。RoboTok 立标 ★☆ → ★ 升档预备实测触发 = 与 v83 §1.6 #42 AutoTraceGT 立标 ★☆ → ★ EMNLP 2026 Findings 升档实测沿用同一预备触发链(web_search 双源核验命中 + HF Daily 持续显著升档 + paper_card 入库实测)。
- 建议归入节:§1.6 #44 RoboTok 立标 ★☆ → ★ 候选升档预备实测锚定延用 + §本次变更段新增"RoboTok 9-6 20:40 HF Daily 雷达票数 79→114 +35 票立标 ★☆ → ★ 候选升档预备实测触发 + 7 日内 +92 票持续升档 + paper_card 1236 9-6 02:10 入库 ✓"沿用预备 + §3.1 #304 v84 共识延展 + §4 #369 v84 开放问题沿用预备级 + §6 #130 v84 工程落地清单沿用预备级 + §2.39.x 候选表 #44 立标 ★☆ → ★ 升档预备实测延展(沿用 spark 9-6 agent-e1prep §六 风险点 e)。
增量 2 · Scaling the Harness arXiv:2605.26112 立基础延展升档 ★☆ → ★★ 预备实测锚定沿用(arxiv.org/abs/2605.26112 web_search 双源核验命中 + Claude Code / OpenClaw / CheetahClaws 三 harness 对照实测)
- 来源:jay
2026-09-06-agent-harness-memory-llm-ecosystem.md高价值条目 1(arXiv 2026-05 完整 PDFhttps://arxiv.org/pdf/2605.26112+ Claude Code / OpenClaw / CheetahClaws 三 harness 对照实测 + context governance + memory management + skill invocation 三元组 + harness 工程师作为新兴角色 + 推理时 adaptation / test-time specialization);jay2026-09-06-0820-jay-agentic-rag-iclr-inference-substack.md(沿用 jay 9-5 2150 evening briefing Scaling the Harness 件套);spark2026-09-06-agent-e1prep.md增量 2(Scaling the Harness 三 harness 对照 = frontier lab harness 工程方法学立标预备第 1 例 + 直接命中本实例 OpenClaw SOUL.md / SKILL.md 机制);v84 §1.1 #107-#108 Scaling the HarnessarXiv:2605.26112已 anchor 立基础延展升档 ★☆ → ★★ 预备实测 + §0.1 web_search 双源核验命中(arxiv.org/abs/2605.26112 + 标题"From Model Scaling to System Scaling: Scaling the Harness in Agentic AI"完整确认 + Claude Code 2.1.88 / OpenClaw 2026.4.6 / CheetahClaws 3.05.79 三 harness 对照 + Reasoning Substrate R / Memory Store M / Context Constructor C 三元组)。 - 要点:Scaling the Harness = 跨厂商对照三 harness 设计点(Claude Code 生产级 + OpenClaw 社区 TypeScript + CheetahClaws Python 原生参考);三 harness 均遵循 context governance + memory management + skill invocation 同一系统分解;harness 工程师 = 关注推理时 adaptation、test-time specialization 而非训练时 artifact;harness 本身是可测试、可替换模块,而非硬编码在 agent prompt 里。直接命中本工作区 OpenClaw 实例:与本实例 SOUL.md / SKILL.md / MEMORY.md 机制高度相关 = 实例级对照补强。
- 与活文档脉络的关系:v84 §1.1 #107-#108 Scaling the Harness 立基础延展升档 ★☆ → ★★ 预备实测已 anchor + v84 §0.1 web_search 双源核验命中预备触发链完整(arxiv.org/abs/2605.26112 + 标题完整确认 + Claude Code/OpenClaw/CheetahClaws 三 harness 版本号完整确认 + Reasoning Substrate R/Memory Store M/Context Constructor C 三元组 = 立基础延展升档预备实测锚定延用同一预备触发链)。与 v82-v84 §1.1 立基础延展四阶 → 五阶(沿用 v83 §1.1 立基础延展四阶 11 栖 + §1.6 #50 Memory Security Survey + #47 openJiuwen + §1.1 #Y Yandex KV Cache as Agent Runtime 三件 frontier lab 记忆系统安全 / harness 学说 / 运行时原语 三维预备锚入)预备锚入实测。直接命中本实例 OpenClaw SOUL.md / SKILL.md 机制 = 实例级对照补强预备实测(spark 9-6 agent-e1prep §一 增量 2 已锚定 + jay 9-6 0936 agent-harness-memory-llm-ecosystem 高价值条目 1 已锚定)。
- 建议归入节:§1.1 #107-#108 Scaling the Harness 立基础延展升档 ★☆ → ★★ 预备实测锚定沿用 + §本次变更段"§1.1 立基础延展五阶预备触发 = §1.6 #50 Memory Security Survey + #47 openJiuwen + §1.1 #Y Yandex KV Cache as Agent Runtime 三件 frontier lab 记忆系统安全 / harness 学说 / 运行时原语 三维预备锚入"沿用预备 + §3.1 #304 v84 共识沿用 + §4 #369 v84 开放问题沿用预备级 + §6 #130 v84 工程落地清单沿用预备级 + §2.207 评测方法学 36 元组预备扩位预备触发沿用。本轮无新增立标候选,仅 v84 立基础延展升档 ★☆ → ★★ 预备实测锚定沿用。
增量 3 · Memory Security Survey arXiv:2604.16548 frontier lab 记忆系统安全立标预备第 1 例 4 源独立交叉锚入稳定预备(90% 记忆中毒 + 100% 自我纠正复发率 + ClawVM OS 风格虚拟内存 + AgentSpec ICSE 2026 轻量级 DSL)
- 来源:jay
2026-09-06-agent-harness-memory-llm-ecosystem.md高价值条目 2(arXiv 2026-04 完整 HTMLhttps://arxiv.org/html/2604.16548v1+ 2023-2026 年 4 月文献综述);spark2026-09-06-agent-e1prep.md增量 3(Memory Security Survey 90% 记忆中毒 + 100% 自我纠正复发率 + ClawVM + AgentSpec ICSE 2026 + Memory poisoning / extraction attack / multi-agent privacy 威胁类型量化评估);stephen2026-09-06-ai-industry-e1prep.md增量 ⑧(jay 9-6 0820/0936 双棒 = Scaling the Harness + Memory Security Survey + SoK POMDP + ICLR 2026 Agent Memory TTL);flyp2026-09-06-multimodal-e1prep.mdv80 §0.5(Memory Security Survey 4 源独立交叉预备锚入实测);v84 §1.6 #50 Memory Security Survey 已 anchor 立标 ★★(jay 9-6 0936 + spark 9-6 agent-e1prep #188 ★★ + stephen 9-6 1023 + flyp 9-6 multimodal-e1prep v80 §0.5 = 4 源独立交叉预备锚入实测);v84 §1.5 治理 #50 frontier lab 记忆系统安全预备锚入实测预备级。 - 要点:Memory Security Survey = 首次系统梳理 agent 长期记忆完整生命周期安全:write → store → retrieve → execute → share → forget;关键发现:超过 90% 的测试 agent 存在记忆中毒漏洞 + 团队在对话中纠正 agent 后复发率高达 100%(纠错必须来自 agent 无法自行修改的外部架构层);Memory poisoning / extraction attack / multi-agent privacy 威胁类型均有量化评估;防护方案 ClawVM(OS 风格虚拟内存 = page tables + fault observers + writeback journals)+ AgentSpec(ICSE 2026 轻量级 DSL = trigger-predicate-enforcement 规则,毫秒级开销);工程启示:记忆系统必须有 forget/compression 操作,append-only 架构会导致新旧事实共存、检索质量退化。
- 与活文档脉络的关系:v84 §1.6 #50 Memory Security Survey 已 anchor 立标 ★★ = frontier lab 记忆系统安全立标预备第 1 例(jay 9-6 0936 + spark 9-6 agent-e1prep #188 ★★ + stephen 9-6 1023 + flyp 9-6 multimodal-e1prep v80 §0.5 = 4 源独立交叉预备锚入实测稳定) = v84 §1.5 治理 #50 frontier lab 记忆系统安全预备锚入实测预备级 + §3.1 #304 v84 共识沿用 + §4 #369 v84 开放问题沿用预备级 + §6 #130 v84 工程落地清单沿用预备级。本轮预备实测补强 = 4 源独立交叉锚入稳定 + 跨主轴 risk/agent/llm-infra 三主分类邻接级预备 = v84 §1.6 #50 立标 ★★ 维持 + 截止 9-15 P1 缺口补强预备 + 与 v82 #E15 OpenAI Rogue Agent 公共 wiki C2 9-4 + v63 HF Agent 入侵事件 + v63 Daybreak $1B + v63 GPT-6 Astra Critical + v64 rogue Agent wikis + v72 CSA Rogue Agent Swarm note frontier lab 安全预备扩增一致性核实预备级。
- 建议归入节:§1.6 #50 Memory Security Survey 立标 ★★ 维持 + §本次变更段"§1.6 #50 Memory Security Survey frontier lab 记忆系统安全预备锚入实测 + 4 源独立交叉预备锚入稳定 + 跨主轴 risk/agent/llm-infra 三主分类邻接级预备"沿用预备 + §1.5 治理 #50 frontier lab 记忆系统安全预备锚入实测预备级沿用 + §3.1 #304 v84 共识沿用 + §4 #369 v84 开放问题沿用预备级 + §6 #130 v84 工程落地清单沿用预备级。本轮无新增立标候选,仅 v84 立标 ★★ 维持 + 4 源独立交叉锚入稳定预备实测锚定延用。
增量 4 · SoK Agentic RAG arXiv:2603.07379 POMDP 形式化 + ICLR 2026 Agent Memory TTL 三段数据 vs RagCap-Bench arXiv:2510.13910 邻接级对照预备
- 来源:jay
2026-09-06-0820-jay-agentic-rag-iclr-inference-substack.md(SoK: Agentic RAG = 首次形式化为有限视野 POMDP(Agent 数量 × 控制结构 × 自主程度三维分类)+ Agentic RAG SurveyarXiv:2501.09136v4 ACL 2025 Findings 接收修订版新增 Agentic Interaction + Audio-Centric Retrieval 双新分类 + ICLR 2026 Agent Memory 评估 TTL 三段数据 = RAG vs Long-Context 实证框架);jay2026-09-06-agent-harness-memory-llm-ecosystem.md高价值条目 3(SoK: Agentic RAG POMDP + budget-aware retrieval + hierarchical retrieval pipelines + early termination criteria);jay2026-09-06-rag-llm-systems-weekly.md(沿用 jay RAG 周棒 SoK POMDP 形式化件套);tom2026-09-06-rag-e1prep.mdR82 evening 棒(SoK POMDP 形式化 + ICLR 2026 TTL 三段数据 + Agentic RAG Survey ACL 2025 Findings);v84 §1.2 RAG-Agent 立基础延展 SoK POMDP + ICLR 2026 TTL 三段数据预备锚入 + §0.1 RAG-Agent 立基础延展 21 + RAG-Agent 邻接级 8 沿用。 - 要点:SoK: Agentic RAG
arXiv:2603.07379= 首次形式化为有限视野 POMDP;三维分类:Agent 数量(单/多)× 控制结构(层级/平铺)× 自主程度(固定/自适应);五种生产模式:Self-RAG + CRAG + Adaptive RAG + ReAct over Docs + Multi-hop Decompose;生产级 Agentic RAG 不能只做 retrieve-then-generate 单程管道,需要 early termination criteria 和适应性检索触发策略。Agentic RAG SurveyarXiv:2501.09136v4 ACL 2025 Findings 接收修订版新增 Agentic Interaction + Audio-Centric Retrieval 双新分类。ICLR 2026 Agent Memory 评估 TTL 三段数据 = RAG vs Long-Context 实证框架:Low ~4K token RAG 83.0 vs LC 74.0 + Medium ~40K 持平 + High ~100K+ LC 93.0 vs RAG 88.0(降级) = 混合策略最优结论。RagCap-BencharXiv:2510.13910(jay 9-5 1105 §二 #4 agentic RAG 中间过程细粒度组件评估 benchmark)= evaluation 主分类 / agentic RAG 邻接级,与 SoK POMDP 形成"形式化统一框架 + 中间过程细粒度组件评估"邻接级对照预备。 - 与活文档脉络的关系:v84 §1.2 RAG-Agent 立基础延展 SoK POMDP + ICLR 2026 TTL 三段数据预备锚入已 anchor + jay 9-6 0820 + 0936 双棒跨实例 4 源独立交叉预备锚入实测(jay 0820 agentic-rag-iclr-inference-substack + jay 0936 agent-harness-memory-llm-ecosystem + jay rag-llm-systems-weekly + tom 9-6 0852 R82 evening 棒) = v84 §1.2 SoK POMDP 形式化预备锚入实测锚定延用 + ICLR 2026 TTL 混合策略最优预备锚入实测锚定延用。SoK POMDP 与 RagCap-Bench 邻接级对照 = "形式化统一框架 × 中间过程细粒度组件评估" = agentic RAG 评测方法学新一维预备锚入实测预备级 + 与 v82-v84 §2.211.28 评测方法学延革 + v84 §1.4 评测方法学 36 元组预备扩位预备触发沿用。
- 建议归入节:§1.2 RAG-Agent 立基础延展 SoK POMDP + ICLR 2026 TTL 三段数据预备锚入沿用 + §本次变更段"§1.2 SoK POMDP 形式化预备锚入实测 + ICLR 2026 TTL 混合策略最优预备锚入实测 + jay 9-6 0820/0936 跨实例 4 源独立交叉预备锚入实测"沿用预备 + §3.1 #304 v84 共识沿用 + §4 #369 v84 开放问题沿用预备级 + §6 #130 v84 工程落地清单沿用预备级 + §2.39.x RAG-Agent 邻接级 8 + RAG 立基础延展 21 件套沿用预备级 + §2.211.28 评测方法学延革沿用预备级 + §2.207 元组预备扩位预备触发沿用预备级。本轮无新增立标候选,仅 v84 §1.2 SoK POMDP + ICLR 2026 TTL 预备锚入实测锚定延用 + RagCap-Bench 邻接级对照预备。
增量 5 · openJiuwen arXiv:2608.27969 动态 Harness + Silent Failures arXiv:2607.19793 6 类分类法 + E-Commerce Bench arXiv:2608.30730 三件 v84 §1.6 #47-#49 候选立标预备实测预备沿用(Claude Code 82.6% SWE-bench Verified / 87.19% Terminal-Bench 2.1 / 6 类 silent failure / 365 天电商场景)
- 来源:jay
2026-09-06-1144-news-x-tech-radar.md干货候选 1+2(E-Commerce BencharXiv:2608.30730QwenLM 365 天电商场景 Agent 评测 + openJiuwenarXiv:2608.27969Claude Code 上 84.04% SOTA + Managed Deep Agents 9-6 LangChain 正式发布 + hwchase17 亲解 Deep Agents 本质 = 多步搜索合成);jay2026-09-06-agent-harness-memory-llm-ecosystem.md高价值条目 1(Scaling the Harness 三 harness 对照实测延展);spark2026-09-06-agent-e1prep.md增量 4(Silent Failures 6 类分类法 + trajectory-level 诊断 + cross-judge 验证 + blank-image stress + tool ablation + SIGIR 2026 SynthIR Workshop + arXiv:2602.16666 ICML 2026 对照);flyp2026-09-06-silent-failures-multimodal-agentic-search-review.md(Silent Failures 反方审稿棒位 = 6 类失败分类法可操作 + 评测方法学工程化 + 代码开源 vs 4.1 优势 + 4.2 主要问题 Workshop 渠道分量 + 4 模型样本偏少 + LLM-as-judge 依赖 + MMSearch-Plus 偏置 + 跨模态矛盾标注一致性未报告 Cohen's κ + 压力测试外推风险 + 4.3 复现难度中低 + 5 可信度与价值判断工程价值高 + 6 对照参考 ICML 2026 Towards a Science of AI Agent Reliability 12 个指标 + 4 维度(consistency/robustness/predictability/safety)+ 15 个模型);v84 §1.6 #47 openJiuwen + #48 Silent Failures + #49 E-Commerce Bench 三件候选立标预备已 anchor。 - 要点:#47 openJiuwen
arXiv:2608.27969= Claude Code 静态 → openJiuwen 动态 Rail-based composition + Inner/Outer Loop 共享执行底座 + SWE-bench Verified 82.6% + Terminal-Bench 2.1 87.19%;#48 Silent FailuresarXiv:2607.19793= SIGIR 2026 SynthIR Workshop + 4 frontier MLLM + 6 类 silent failure 分类法(modality shortcuts / phantom grounding / wrong-evidence-right-answer / over-retrieval laundering / cross-modal contradiction / provenance hallucination)+ 轨迹级诊断流水线 + cross-judge 验证 + 空白图像压力测试 + 工具消融;#49 E-Commerce BencharXiv:2608.30730= QwenLM 365 天电商场景 Agent 评测。 - 与活文档脉络的关系:v84 §1.6 #47-#49 三件候选立标预备已 anchor + flyp 9-6 0951 Silent Failures 反方审稿棒位预备实测补强 + jay 9-6 1144 openJiuwen + E-Commerce Bench 双干货候选预备锚入实测 + spark 9-6 agent-e1prep 增量 4 Silent Failures 预备锚入实测 = 4 源独立交叉预备锚入稳定。Silent Failures 6 类分类法可操作定义 = 与 HAL/TRAIL/MAST 对照表待补 + Cohen's κ / inter-annotator agreement 一致性待补 + MMSearch-Plus 偏置外推风险待补 + flyp critical-read 已建议合并审稿至
notes/agent-reliability/trajectory-level-evaluation.md(与 arXiv:2602.16666 ICML 2026 合并预备级)预备级。 - 建议归入节:§1.6 #47 openJiuwen + #48 Silent Failures + #49 E-Commerce Bench 三件候选立标预备实测锚定沿用 + §本次变更段"#47-#49 三栖立标候选新增触发预备 + jay 9-6 1144 + flyp 9-6 0951 + spark 9-6 agent-e1prep 4 源独立交叉预备锚入稳定 + Silent Failures 6 类分类法 HAL/TRAIL/MAST 对照表待补预备"沿用预备 + §3.1 #304 v84 共识沿用 + §4 #369 v84 开放问题沿用预备级 + §6 #130 v84 工程落地清单沿用预备级。本轮无新增立标候选,仅 v84 §1.6 #47-#49 三件候选立标预备实测锚定延用 + Silent Failures 反方审稿棒位预备实测预备锚入延用。
增量 6 · Yandex "KV Cache as Agent Runtime" research.yandex.com/blog/the-kv-cache-as-an-agent-runtime runtime 原语化范式升档预备实测锚定沿用(Hogwild! Inference + AsyncReasoning + 无训练 Doom agent 示例)
- 来源:jay
2026-09-06-1105-jay-five-category-briefing.md§二 BACKEND 高价值 5(Yandex Research Blog 一线研究团队https://research.yandex.com/blog/the-kv-cache-as-an-agent-runtime);spark2026-09-06-agent-e1prep.md增量 1(Yandex "KV Cache as Agent Runtime" ★★ 候选预备级 + 跨主轴 engineering/llm-infra/multimodal 主分类 + agent 主轴立标升档级 + 比 v84 已锚入的 "Internet for KV Cache"arXiv:2608.01526更深一层 + 并行提示→真正并发执行 + Hogwild! Inference 共享 KV cache 多 agent 协作推理 + AsyncReasoning thinking 和 communication 不应相互阻塞 + 无训练 Doom agent 示例);v84 §1.1 #Y Yandex KV Cache as Agent Runtime 已 anchor 立基础延展升档预备 + §0.1 KV cache 升档为运行时原语预备锚入实测 + §1.1 立基础延展五阶预备触发(#Y Yandex KV Cache as Agent Runtime + #47 openJiuwen + §1.6 #50 Memory Security Survey 三件 frontier lab 记忆系统安全 / harness 学说 / 运行时原语 三维预备锚入)。 - 要点:Yandex KV Cache as Agent Runtime = KV cache 本质是 LLM 执行状态,不仅是推理优化技术,可作 agent 交互运行时——比 v84 已锚入的 "Internet for KV Cache"
arXiv:2608.01526更深一层;并行提示 → 真正并发执行:多 agent 共享 KV cache 实现转变;Hogwild! Inference:通过共享 KV cache 实现多 agent 协作推理,无需额外同步机制;AsyncReasoning:thinking 和 communication 不应相互阻塞——多模态 agent 本质是异步 I/O 系统,KV cache 可作异步状态传递载体;无训练 Doom agent 示例:完全通过 KV cache 分区/调度实现交互式 agent,无需修改预训练模型。 - 与活文档脉络的关系:v84 §1.1 #Y Yandex KV Cache as Agent Runtime 已 anchor + v84 §1.1 立基础延展五阶预备触发实测(§1.6 #50 Memory Security Survey + #47 openJiuwen + §1.1 #Y Yandex KV Cache as Agent Runtime 三件 frontier lab 记忆系统安全 / harness 学说 / 运行时原语 三维预备锚入)+ v82 #G02 mattpocock/skills + v83 #G03-#G04 hermes-agent/opencode + v84 候选预备级 2 件(#184 RoboTok + #185 ICLR 2026 TTL 论文)沿用 + 与 v83 #177 Compile by Training 形成"agent 推理成本结构变轨 + runtime 原语化范式" 2 栖边界预备触发预备级 = runtime 原语第 9 栖延展预备锚入实测(spark 9-6 agent-e1prep §一 增量 1 已 anchor)。Yandex runtime 原语与 v84 #91 v83 候选预备争议"Compile by Training vs SFT/RLHF"边界需 v85 厘清预备级 = runtime 原语 vs SFT/RLHF 主模型更新机制的边界仍待核实预备实测锚定延用。
- 建议归入节:§1.1 #Y Yandex KV Cache as Agent Runtime 立基础延展升档预备实测锚定沿用 + §本次变更段"§1.1 立基础延展五阶预备触发 = §1.6 #50 Memory Security Survey + #47 openJiuwen + §1.1 #Y Yandex KV Cache as Agent Runtime 三件 frontier lab 记忆系统安全 / harness 学说 / 运行时原语 三维预备锚入"沿用预备 + §3.1 #304 v84 共识沿用 + §4 #369 v84 开放问题沿用预备级 + §6 #130 v84 工程落地清单沿用预备级 + §2.211 评测方法学延革沿用预备级 + §2.39.x KV Cache Internet 邻接级 + Yandex runtime 原语 2 栖延展预备沿用预备级。本轮无新增立标候选,仅 v84 §1.1 #Y Yandex KV Cache as Agent Runtime 预备实测锚定延用 + runtime 原语 vs SFT/RLHF 边界待 v85 厘清预备实测预备锚入延用。
二、其他检查:已锚入但不应重复计数的补强
- v84 §1.6 #42 AutoTraceGT
arXiv:2608.30391立标 ★ EMNLP 2026 Findings 升档实测 + paper_card 1229 ✓:v83 已升档 ★ = v84 §3.1 #303 共识已锚入稳定。无新增立标候选,沿用预备级。 - v84 §1.6 #43 DRACO
arXiv:2609.04094paper_card 1231 ✓:v82 已 anchor 立标 ★☆ + paper_card 1231 9-5 14:10 入库实测 = v82 anchor 缺位实测补强。HF Daily 23▲ 持平,无显著升档信号。无新增立标候选,沿用预备级。 - v84 §1.6 #44 RoboTok
arXiv:2609.03199paper_card 1236 ✓:立标 ★☆ + paper_card 1236 9-6 02:10 入库实测 = anchor 缺位实测补强。HF Daily 9-6 早棒 79▲ → 14:40 radar 97 票 → 20:40 radar 114 票(+35) 持续跃升 = 立标 ★☆ → ★ 候选升档预备实测触发信号(详见增量 1)。 - v84 §1.6 #45 VeriPhy
arXiv:2609.03153paper_card 1233 ✓:v82 已 anchor 立标 ★☆ + paper_card 1233 9-5 14:10 入库实测 = v82 anchor 缺位实测补强。HF Daily 11▲ → 12▲ 微涨,无显著升档信号。无新增立标候选,沿用预备级。 - v84 §1.6 #46 Locked at the Entrance
arXiv:2608.29188paper_card 1235 ✓:v83 已 anchor 立标 ★☆ + paper_card 1235 9-5 15:00 入库实测 = anchor 缺位实测补强(主分类 llm-infra 邻接级 agent/engineering)。HF Daily 8▲ 持平,无显著升档信号。无新增立标候选,沿用预备级。 - v82 §1.6 #176 Terminal-Universe
arXiv:2609.04148paper_card 仍未入库 ⚠️:v82 #176 已 anchor 立标 ★☆ + HF Daily 9-6 早棒 265▲ #2 +52▲ 立标极显著首次续立 + paper_card 仍未入库 = v82+v83+v84 anchor 缺位延续预备级。沿用 spark 9-6 agent-e1prep 矛盾 7 / 9-5 矛盾 6 / 9-4 spark-e1prep 矛盾 7 "Terminal-Universe paper_card 仍未入库 = v82 anchor 缺位延续"。建议 v85 §本次变更段"v85 候选预备级锚入预备级 + paper_card 入库实测补强 + Terminal-Universe paper_card 仍未入库"沿用预备级。 - HF Daily 9-6 早棒 agent 主轴 6 件 net-new(SkillEvo / FlowEvo / EnvHarness / FACET / MemTrapBench / SWE-bench Science):spark 9-5 agent-e1prep §二 增量 4 已 anchor #178-#183 ☆ 候选预备 6 件。无新增立标候选,本轮仅作为 cross-reference 沿用预备。
- HF Daily 9-6 早棒 multimodal 主轴 11 件立标信号实测承接(Compile by Training 310▲ #1 +54▲ + Terminal-Universe 265▲ #2 +52▲ + LLaDA-Image 222▲ #3 +26▲ + LatentPress 108▲ #6 +6▲ + RoboTok 79▲ #7 +37▲ + Puffin-World 65▲ #10 +6▲ + Scal3R 45▲ #11 +11▲ + 可编辑视觉设计 40▲ #12 +8▲ + TCR 33▲ #13 +7▲ + WHALE 30▲ #14 +1▲ + LatentStream 29▲ #15 持平):flyp 9-6 multimodal-e1prep §一 增量 1-6 已 anchor。无新增立标候选,本轮仅作为 cross-reference 沿用预备。
- ARC Agent 可靠性危机报告 2026(1,247 生产 Agent + 89 个组织 + 任务准确率 91.3% vs 生产 67.8% = -23.5pp + 工具调用正确率 94.1% vs 71.2% = -22.9pp + 策略合规率 96.7% vs 78.4% = -18.3pp + 错误恢复率 34.1% + 平均故障发现时间 4.7 小时):jay
2026-09-06-1950-jay-engineering-filter-v3.md高价值条目 2(ARC 2026 + DEV Community 二次引用 = dev.to 是二次引用原始 ARC 报告需独立核验 = 可信度 ⭐⭐⭐ 中等)= agent 主轴邻接级实测数据预备锚入。但 ARC 报告原始链接未独立核验,建议 v85 §4 #369 v84 开放问题延展预备级"ARC 2026 原始报告完整 URL + 1,247 生产 Agent 分布 + 23.5pp 差距实证方法学核验 + 与 v82-v84 #15-#18 RAG 四栖 + #33-#36 评测四栖邻接级对照预备级"。无新增立标候选,本轮仅作为 cross-reference 沿用预备。 - vLLM 异步调度崩溃事故(Daily Engineering Download 2026-01-22 +
--no-async-schedulingflag + speculative decoding 与新调度器兼容性问题 + PyTorch 2.9.1 不兼容):jay2026-09-06-1950-jay-engineering-filter-v3.md高价值条目 1(inference 主轴邻接级)= llm-infra 主分类。无 llm-application 主轴立标候选,仅作为 cross-reference 沿用预备。 - ACM TIST Survey on Inference Engines
DOI:10.1145/3803798(Park et al. 2026 Just Accepted)+ 237 stars:jay2026-09-06-1950-jay-engineering-filter-v3.md高价值条目 6 = llm-infra 主分类。无 llm-application 主轴立标候选,仅作为 cross-reference 沿用预备。 - larsderidder/framework-analysis(44 个框架分析)+ Pydantic AI + LangGraph + Letta + Microsoft CodeAct BUILD 2026(延迟 -52% + token -64%)+ nanobot + OpenHarness:jay
2026-09-06-1950-jay-engineering-filter-v3.md高价值条目 7+8 = engineering 主分类 / agent 主轴邻接级。CodeAct 52% 延迟降低 + 64% token 减少 = 与 v82 #G02 mattpocock/skills + v83 #G03-#G04 hermes-agent/opencode + v84 §1.1 #107-#108 Scaling the Harness 邻接级预备触发。无新增立标候选,本轮仅作为 cross-reference 沿用预备。 - Microsoft BUILD 2026 Agent Harness + CodeAct 执行模式 + 自动上下文压缩 + 指令合并 + todo 跟踪 + 后台 Agent + ToolApprovalAgent:jay
2026-09-06-1950-jay-engineering-filter-v3.md高价值条目 8 邻接级 = 与 v84 §1.1 #107-#108 Scaling the Harness + §1.6 #47 openJiuwen 邻接级预备触发。无新增立标候选,本轮仅作为 cross-reference 沿用预备。 - NVIDIA $12.93B 收购 HF 2026-09-03:jay
2026-09-06-1735-jay-evening-report.md头条事件 = ai-industry 主轴备料。无 llm-application 主轴立标候选(沿用 stephen 9-6 1023 ai-industry-e1prep + v64 件套 + v65 已锚入),仅作为 cross-reference 沿用预备。 - Kubernetes Agent Sandbox + ARMO 安全检查表 + Pulumi Neo AI-Driven K8s + CNCF 2026 调查(K8s 82% + AI Agent 57% production + Gartner 40% 2026):jay
2026-09-06-1735-jay-evening-report.md§三 = engineering 主轴备料。无 llm-application 主轴立标候选,仅作为 cross-reference 沿用预备。 - RAG 推理成本攻击 WWW 2026
arXiv:2606.02643:jay2026-09-06-1735-jay-evening-report.md§四 论文 1(rag 主分类 + cs.CR + WWW 2026 accepted)= v84 §1.2 RAG 邻接级备料稳定。无新增立标候选,本轮仅作为 cross-reference 沿用预备。 - FreeToken Edge-Native MoE Serving(UC Berkeley + Hugging Face Trending Papers):jay
2026-09-06-1735-jay-evening-report.md§四 论文 2(engineering / llm-infra 主分类)= edge AI 主轴备料。无 llm-application 主轴立标候选,仅作为 cross-reference 沿用预备。 - AAAI 2026 Keyword Search 替代 Vector RAG(Subramanian et al. + Claude 3 Sonnet 200K context + Agentic keyword search 达 RAG faithfulness 94.5% + Search-R1 RL 检索策略比 RAG 高 24% relative + Anthropic 多 Agent 系统比单 Claude Opus 4 高 90.2%):jay
2026-09-06-1505-jay-afternoon-supplement.md高价值 1 = rag 主分类邻接级 = v84 §1.2 RAG 立基础延展 21 件套邻接级备料稳定 + 与 v84 §1.2 #15-#18 RAG 四栖 + #Y ICLR 2026 TTL 论文(混合策略最优)形成"工程选型去向量 DB 化"邻接级预备触发。无新增立标候选,本轮仅作为 cross-reference 沿用预备。 - 向量数据库基准测试系统性批判
arXiv:2507.00379:jay2026-09-06-1505-jay-afternoon-supplement.md中价值(系统性批判方法论,有实验支撑)+ 与 RAG 工程选型 checklist 邻接级。无新增立标候选,本轮仅作为 cross-reference 沿用预备。 - ML-Agent
arXiv:2505.23723v2 Apr 2026(RL 训练 LLM Agent 做自动化 ML 工程 + Exploration-Enriched Fine-Tuning + Step-wise RL + Exploration Strategy):jay2026-09-06-1450-jay-engineering-filter-v2.md高价值条目 1(agent 主分类)= 与 v84 §1.6 邻接级预备 + §1.1 #106 GPT-6 Astra Harness 警示邻接级备料稳定。无新增立标候选,本轮仅作为 cross-reference 沿用预备。 - SGLang vs vLLM 2026-04 AIMultiple + 2026-06 Particula.tech(H100 + SGLang 吞吐量比 vLLM 高 29% + DeepSeek V3 SGLang 比 vLLM 快 3.1x + EAGLE speculation decoding decode 加速 1.8x @ batch=1 / 1.5x @ batch=32 + prefix overlap ratio > 60% 阈值决策树):jay
2026-09-06-1450-jay-engineering-filter-v2.md+2026-09-06-1505-jay-afternoon-supplement.md= llm-infra 主分类备料。无 llm-application 主轴立标候选,仅作为 cross-reference 沿用预备。 - vLLM V1 Engine 关键变化(Continuous batching + PagedAttention + FP8 Hopper GPU 默认 + 多加速器支持 NVIDIA CUDA / AMD ROCm / 华为 Ascend / Intel Gaudi / Apple Silicon / 百度 Kunlun):jay
2026-09-06-1735-jay-evening-report.md§二 +2026-09-06-1950-jay-engineering-filter-v3.md= llm-infra 主分类备料。无 llm-application 主轴立标候选,仅作为 cross-reference 沿用预备。 - QTEA Ternary LLMs 1.7 bpw
arXiv:2609.00224v2(Llama2-7B 6.35× 存储压缩 2.12GB vs FP16 13.48GB + vs PT2-LLM 精度高 7-8pp):jay2026-09-06-1950-jay-engineering-filter-v3.md高价值条目 9(llm-infra 主分类)= 与 v84 §1.6 邻接级备料稳定。无 llm-application 主轴立标候选,仅作为 cross-reference 沿用预备。 - work-queue.md(2026-09-06 12:00 + 20:00):高价值待深度解读 Top 15 = 0;待更新/缺失主题活文档 = 0;待写攻略 = 1(2608.31111 → 2608.31100 Multimodal RAG Survey 沿用);待写攻略 Tom/Jay/spark 认领 = 0;富化缺口 15 张卡缺 TLDR;待精确分类 0 张。说明 v84 已落定 + 待写攻略 1 条仍待认领(multimodal 主轴邻接级),不入 llm-application 立标池。
三、值得警惕的矛盾与待核实说法
- v84 §1.6 #44 RoboTok 立标 ★☆ → ★ 候选升档预备实测触发 vs HF Daily 9-6 14:40 radar 97 票 → 20:40 radar 114 票 +35 持续升档信号:tom 9-6 20:40 radar 候选概览 #1(RoboTok 114 票 RAG+机器人)+ tom 9-6 14:40 radar 候选 #3(RoboTok 97 票)= v84 落定后 3h10m 窗口内的实测票数显著跃升。v84 §1.6 #44 立标 ★☆ → ★ 候选升档预备实测触发信号预备级 = 与 v83 §1.6 #42 AutoTraceGT 立标 ★☆ → ★ EMNLP 2026 Findings 升档实测沿用同一预备触发链(web_search 双源核验命中 + HF Daily 持续显著升档 + paper_card 入库实测 + 跨实例 1 源 ✓)。建议 v85 §本次变更段新增"RoboTok 9-6 20:40 HF Daily 雷达票数 79→114 +35 票立标 ★☆ → ★ 候选升档预备实测触发 + 7 日内 +92 票持续升档 + paper_card 1236 9-6 02:10 入库 ✓"预备实测补强。
- v84 §1.6 #50 Memory Security Survey frontier lab 记忆系统安全立标预备第 1 例 4 源独立交叉预备锚入稳定 vs MINJA 完整实现 + ClawVM OS 风格虚拟内存 + AgentSpec ICSE 2026 完整 DSL 定义待 v85 厘清:jay 9-6 0936 + spark 9-6 #188 ★★ + stephen 9-6 1023 + flyp 9-6 multimodal-e1prep v80 §0.5 = 4 源独立交叉预备锚入实测。但威胁模型 + 评测方法学 + 实证数据三者边界仍待核实 = 90% 记忆中毒实证方法学核验 + 100% 自我纠正复发率实证方法学核验 + MINJA 完整实现 + ClawVM OS 风格虚拟内存完整开源代码 + AgentSpec ICSE 2026 完整 DSL 定义 = 沿用 spark 9-6 agent-e1prep §四 矛盾 3 "Memory Security Survey 90% 记忆中毒 + 100% 复发率 的可证伪点" + §五 Q105.225.1 沿用预备级。
- v84 §1.6 #48 Silent Failures 6 类分类法 vs HAL/TRAIL/MAST 对照表未独立核验:flyp 9-6 0951 反方审稿棒位已明确"未与 HAL / TRAIL / MAST 等已有 trajectory-level 框架做对比表 + 跨模态矛盾的标注一致性未报告 Cohen's κ 或 inter-annotator agreement + judge 模型本身的 silent failure 风险未被讨论"。SIGIR 2026 SynthIR Workshop 渠道分量 + 4 模型样本偏少 + LLM-as-judge 依赖 = 工程可操作性高 + 学术分量中。建议 v85 §1.6 #48 Silent Failures 升档 ☆ → ★ 预备级需 v85 web_search 补强:6 类分类法在 4 模型外的开源模型谱系代表性 + cross-judge 验证缓解度 + MMSearch-Plus 偏置外推风险 + Cohen's κ / inter-annotator agreement 一致性 + 与 arXiv:2602.16666 ICML 2026 Towards a Science of AI Agent Reliability 12 指标 + 4 维度(consistency/robustness/predictability/safety)+ 15 模型对照表预备级。
- v84 §1.1 #Y Yandex KV Cache as Agent Runtime runtime 原语化范式升档预备 vs v84 #91 v83 候选预备争议"Compile by Training vs SFT/RLHF"边界需 v85 厘清:jay 9-6 1105 five-category-briefing §二 BACKEND 高价值 5(Yandex Research Blog 一线研究团队
https://research.yandex.com/blog/the-kv-cache-as-an-agent-runtime)= 比 v84 已锚入的 "Internet for KV Cache"arXiv:2608.01526更深一层。runtime 原语 vs SFT/RLHF 主模型更新机制的边界仍待核实:runtime 原语是否完全替代主模型更新?或 runtime 原语是主模型更新的补充?建议 v85 §3.2 #93 v84 候选预备争议延展预备级 + §4 #369 v84 开放问题延展预备级。 - v84 §1.1 #107-#108 Scaling the Harness ★☆ → ★★ 立基础延展升档实测 vs 直接命中本实例 OpenClaw SOUL.md / SKILL.md 机制实例级对照预备实测锚定延用:jay 9-6 0936 agent-harness-memory-llm-ecosystem 高价值条目 1(Claude Code 2.1.88 / OpenClaw 2026.4.6 / CheetahClaws 3.05.79 三 harness 对照实测)= 直接命中本工作区 OpenClaw 实例 SOUL.md / SKILL.md / MEMORY.md 机制 = 实例级对照补强预备实测锚定延用。建议 v85 §1.1 #107-#108 Scaling the Harness 立基础延展升档实测 + 本实例 OpenClaw SOUL.md / SKILL.md / MEMORY.md 机制对照预备实测预备级 + §2.211 评测方法学延革沿用预备级。
- v82 #176 Terminal-Universe
arXiv:2609.04148paper_card 仍未入库 vs HF Daily 9-6 早棒 265▲ #2 +52▲ 立标极显著首次续立实测:tom2026-09-06-0900-hf-daily-2026-09-06.md候选概览 #2(Terminal-Universe 265▲ #2 +52▲ 立标极显著首次续立)= v82+v83+v84 anchor 缺位延续预备级。沿用 spark 9-6 agent-e1prep 矛盾 7 + 9-5 矛盾 6 + 9-4 spark-e1prep 矛盾 7。建议 v85 §本次变更段"v85 候选预备级锚入预备级 + paper_card 入库实测补强 + Terminal-Universe paper_card 仍未入库"沿用预备级 + 截止 9-15 P1 缺口补强预备。 - ARC Agent 可靠性危机报告 2026(1,247 生产 Agent + 89 个组织 + -23.5pp 准确率差距)可信度 ⭐⭐⭐ 中等 vs 原始 ARC 报告完整 URL 待独立核验:jay
2026-09-06-1950-jay-engineering-filter-v3.md高价值条目 2(DEV Community 是二次引用原始 ARC 报告需独立核验)= agent 主轴邻接级实测数据预备锚入。建议 v85 §4 #369 v84 开放问题延展预备级"ARC 2026 原始报告完整 URL + 1,247 生产 Agent 分布 + 23.5pp 差距实证方法学核验 + 与 v82-v84 #15-#18 RAG 四栖 + #33-#36 评测四栖邻接级对照预备级"。 - AAAI 2026 Keyword Search 替代 Vector RAG vs Subramanian et al. 原始论文 arXiv 号待独立核验:jay
2026-09-06-1505-jay-afternoon-supplement.md高价值 1(AAAI 2026 同行评审 + buzzgrewal.medium.com 二次引用)= rag 主分类邻接级。建议 v85 §1.2 RAG 立基础延展 21 件套邻接级预备 + AAAI 2026 Keyword Search 替代 Vector RAG 原始 arXiv 号独立核验预备级。
四、可引用的 arXiv 号列表
本轮直接涉及、且建议今晚优先核对或引用的编号(全部 v84 §1.6 #47-#50 + #42-#46 + §1.1 #Y/#107-#108 + §1.2 SoK POMDP + ICLR 2026 TTL 已锚定件套,paper_card 5/5 已入库实测命中):
arXiv:2609.03199— RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning(v84 §1.6 #44 立标 ★☆ + paper_card 1236 ✓ + HF Daily 9-6 20:40 radar 114▲ +35 票立标 ★☆ → ★ 候选升档预备实测触发信号)arXiv:2608.30391— Using Grounded Theory for Agent Behavior Analysis at Scale / AutoTraceGT(v84 §1.6 #42 立标 ★ EMNLP 2026 Findings 升档实测 + paper_card 1229 ✓)arXiv:2609.04094— DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training(v84 §1.6 #43 立标 ★☆ + paper_card 1231 ✓ + HF Daily 23▲ 持平)arXiv:2609.03153— VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement(v84 §1.6 #45 立标 ★☆ + paper_card 1233 ✓ + HF Daily 11▲→12▲ 微涨)arXiv:2608.29188— Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space(v84 §1.6 #46 立标 ★☆ + paper_card 1235 ✓ 主分类 llm-infra + HF Daily 8▲ 持平)arXiv:2608.27969— openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents(v84 §1.6 #47 立标 ★☆ + Claude Code 静态 → 动态 Rail-based composition + SWE-bench Verified 82.6% + Terminal-Bench 2.1 87.19%)arXiv:2607.19793— Silent Failures in Multimodal Agentic Search: A Diagnostic Taxonomy and Cross-Judge Evaluation(v84 §1.6 #48 立标 ☆ + SIGIR 2026 SynthIR Workshop + 6 类 silent failure 分类法)arXiv:2608.30730— E-Commerce Bench(v84 §1.6 #49 立标 ☆ + QwenLM 365 天电商场景 Agent 评测)arXiv:2604.16548— A Survey on the Security of Long-Term Memory in LLM Agents(v84 §1.6 #50 立标 ★★ + 4 源独立交叉 + 90% 记忆中毒 + 100% 自我纠正复发率 + ClawVM OS 风格虚拟内存 + AgentSpec ICSE 2026 轻量级 DSL)arXiv:2605.26112— Scaling the Harness in Agentic AI(v84 §1.1 #107-#108 立基础延展升档 ★☆ → ★★ 预备实测 + Claude Code / OpenClaw / CheetahClaws 三 harness 对照 + web_search 双源核验命中)arXiv:2603.07379— SoK: Agentic Retrieval-Augmented Generation(v84 §1.2 RAG-Agent 立基础延展 SoK POMDP 形式化 + Agent 数量 × 控制结构 × 自主程度三维分类)arXiv:2501.09136— Agentic RAG Survey v4 ACL 2025 Findings(jay 9-6 0820 + tom 9-6 0852 R82 + jay 9-6 rag-llm-systems-weekly)arXiv:2602.16666— Towards a Science of AI Agent Reliability ICML 2026(flyp 9-6 0951 + Silent Failures 对照预备级 + 12 指标 + 4 维度 + 15 模型)
已存在、作为邻接或补强引用(全部 v82 §1.6 #40-#42 + #30-#39 立标 ★☆ 候选预备,paper_card 全部已入库):
arXiv:2609.04201— Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction(v82 §1.6 #40 + paper_card 1226 ✓ + HF Daily 45▲ +11▲ 立标中-低首次升档 + work-queue 待写攻略 #1)arXiv:2609.03820— Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs(v82 §1.6 #41 + paper_card 1227 ✓ + HF Daily 15▲ 持平)arXiv:2609.04148— Terminal-Universe: 将 Agent 轨迹转化为可扩展的终端环境(v82 §1.6 #176 + HF Daily 9-6 早棒 265▲ #2 +52▲ 立标极显著首次续立 + paper_card 仍未入库 ⚠️ = v82+v83+v84 anchor 缺位延续)arXiv:2609.04199— Compile by Training: Turning NL Specifications into Local Neural Functions(v82 §本次变更段审稿输入 + paper_card 1220 ✓ + HF Daily 9-6 早棒 310▲ #1 +54▲ 立标极显著首次续立)arXiv:2609.00196— WHALE: Weight-Harness Alternating LEarning(v82 §1.6 #30 + paper_card 1213 ✓ + HF Daily 票数 30▲ +1▲ 立标中-低续立饱和)arXiv:2609.01437— HarnessDev(v82 §1.6 #31 + paper_card 1196 ✓ + HF Daily 9-4 早棒 225▲ #2 暴涨警示)arXiv:2608.26730— Knowing When Not to Reuse(v82 §1.6 #39 + paper_card 1225 ✓ + HF Daily 9-5 早棒 #4 146▲)arXiv:2609.04043— MachCSL(v82 §1.6 #170 + paper_card 1218 ✓)arXiv:2609.00377— FoldingAgent(v82 §1.6 #172 + paper_card 1208 ✓)arXiv:2609.00474— LLAMIA-Bench(v82 §1.6 #168 + paper_card 1206 ✓)arXiv:2608.30322— Knowledge-Gated(v82 §1.6 #169 + paper_card 1209 ✓)arXiv:2602.10271— MLDocRAG(v79 §2.39.341 + flyp v2 评级 B)arXiv:2504.07491— Kimi-VL Technical Report(v79 §2.39.342 + flyp v2 评级 B+ + R5 时效性折扣 ★★★)arXiv:2606.02643— RAG 推理成本攻击 WWW 2026(jay 9-6 1735 + cs.CR + WWW 2026 accepted + v84 §1.2 RAG 邻接级备料稳定)arXiv:2505.23723— ML-Agent: Reinforcing LLM Agents for Autonomous ML Engineering v2 Apr 2026(jay 9-6 1450 engineering-filter + RL 训练 LLM Agent 做自动化 ML 工程)arXiv:2507.00379— Towards Robustness: A Critique of Current Vector Database Assessments(jay 9-6 1505 afternoon-supplement + 向量数据库基准测试系统性批判)arXiv:2609.00224v2— QTEA Ternary LLMs 1.7 bpw(jay 9-6 1950 engineering-filter + Llama2-7B 6.35× 存储压缩)arXiv:2510.13910— RagCap-Bench(jay 9-5 1105 §二 #4 agentic RAG 中间过程细粒度组件评估 benchmark + evaluation 主分类邻接级)arXiv:2608.01526— Internet for KV Cache(v84 §1.1 #Y Yandex KV Cache as Agent Runtime 邻接级)arXiv:2609.03796— LLaDA-Image(HF Daily 9-6 早棒 222▲ #3 +26▲ 立标极显著首次续立)arXiv:2609.01507— LatentPress: Cross-Modal Context Compression(HF Daily 9-6 早棒 108▲ #6 +6▲ 立标中-高续立)arXiv:2609.04196— Puffin-World(HF Daily 9-6 早棒 65▲ #10 +6▲)arXiv:2609.02367— TCR(HF Daily 9-6 早棒 33▲ #13 +7▲)arXiv:2609.04034— 可编辑视觉设计(HF Daily 9-6 早棒 40▲ #12 +8▲)arXiv:2609.04131— Beyond Retrieval: Streaming Video Latent Memory / LatentStream(HF Daily 9-6 早棒 29▲ #15 持平)
非 arXiv 件套(Yandex Research Blog + DOI + GitHub + workshop + conference proceedings):
https://research.yandex.com/blog/the-kv-cache-as-an-agent-runtime— Yandex "KV Cache as Agent Runtime"(v84 §1.1 #Y 立基础延展升档预备实测 + runtime 原语化范式升档预备实测锚定)DOI:10.1145/3803798— ACM TIST Survey on Inference Engines(Park et al. 2026 Just Accepted + 237 stars + jay 9-6 1950 engineering-filter 高价值条目 6)github.com/NousResearch/hermes-agent241k★(spark 9-5 agent-e1prep §一 增量 2 #G03 候选预备)github.com/anomalyco/opencode204k★(spark 9-5 agent-e1prep §一 增量 2 #G04 候选预备)github.com/mattpocock/skills250k★(v82 #G02 立标 ★ 预备级 + spark 9-5 agent-e1prep §一 增量 2 预备扩增)github.com/ai-boost/awesome-harness-engineering+ Microsoft Agent Harness BUILD 2026(CodeAct 延迟 -52% + token -64% + jay 9-6 1950 engineering-filter 高价值条目 8)github.com/larsderidder/framework-analysis44 个框架分析(jay 9-6 1950 engineering-filter 高价值条目 7 + Pydantic AI + LangGraph + Letta)github.com/openJiuwen-ai/communityopenJiuwen 动态 Agent Harness 平台(jay 9-6 1144 + Claude Code 上 84.04% SOTA)github.com/sihyeong/Awesome-LLM-Inference-Engine+ MineDraft vLLM 推测解码插件 + SuperCompress 学习式提示压缩(65% token 减少 + jay 9-6 1950 engineering-filter 高价值条目 4+5)github.com/DingWu1021/silent-failures-multimodal-agentic-searchSilent Failures 6 类失败分类法代码(flyp 9-6 0951 critical-read + v84 §1.6 #48 立标 ☆)proceedings.iclr.cc/paper_files/paper/2026/file/fd1eff9dd295df50a41f2521942fa31d-Paper-Conference.pdf— ICLR 2026 Agent Memory TTL 三段数据(v84 §1.2 #185 候选预备级)SIGIR 2026 SynthIR WorkshopSilent Failures 论文渠道(flyp 9-6 0951 + v84 §1.6 #48 立标 ☆ Workshop 渠道分量限制升档至 ☆)
五、晚间接力建议
- P1:RoboTok
arXiv:2609.03199HF Daily 9-6 20:40 雷达票数 79→114 +35 票立标 ★☆ → ★ 候选升档预备实测触发信号预备实测延展到 v84 §1.6 #44,预备触发立标等级 ★☆ → ★ 升档预备实测(沿用本简报增量 1 + 矛盾 1)。建议 v85 §本次变更段新增"RoboTok 9-6 20:40 HF Daily 雷达票数 79→114 +35 票立标 ★☆ → ★ 候选升档预备实测触发 + 7 日内 +92 票持续升档 + paper_card 1236 9-6 02:10 入库 ✓"预备实测补强。 - P1:Terminal-Universe
arXiv:2609.04148paper_card 入库实测补强(v82 §1.6 #176 + HF Daily 9-6 早棒 265▲ #2 +52▲ 立标极显著首次续立 + paper_card 仍未入库 ⚠️ = v82+v83+v84 anchor 缺位延续),建议 v85 §本次变更段"v85 候选预备级锚入预备级 + paper_card 入库实测补强 + Terminal-Universe paper_card 仍未入库"沿用预备级(沿用本简报矛盾 6 + spark 9-6 agent-e1prep §五 P2)。 - P1:Scaling the Harness
arXiv:2605.26112立基础延展升档 ★☆ → ★★ 预备实测锚定沿用 + 本实例 OpenClaw SOUL.md / SKILL.md / MEMORY.md 机制实例级对照预备实测(沿用本简报增量 2 + 矛盾 5 + spark 9-6 agent-e1prep §五 P1)。 - P1:Memory Security Survey
arXiv:2604.16548frontier lab 记忆系统安全立标预备第 1 例 4 源独立交叉预备锚入稳定预备实测补强 MINJA 完整实现 + ClawVM OS 风格虚拟内存完整开源代码 + AgentSpec ICSE 2026 完整 DSL 定义(沿用本简报增量 3 + 矛盾 2 + spark 9-6 agent-e1prep §五 Q105.225.1)。 - P2:Silent Failures
arXiv:2607.197936 类分类法升档 ☆ → ★ 预备级需 v85 web_search 补强(HAL/TRAIL/MAST 对照表 + Cohen's κ / inter-annotator agreement 一致性 + 与 arXiv:2602.16666 ICML 2026 12 指标 4 维度 15 模型对照表)(沿用本简报增量 5 + 矛盾 3)。 - P2:Yandex "KV Cache as Agent Runtime" runtime 原语化范式升档预备实测锚定延用 + runtime 原语 vs SFT/RLHF 主模型更新机制边界需 v85 厘清(v85 §3.2 #93 v84 候选预备争议延展预备级 + §4 #369 v84 开放问题延展预备级)(沿用本简报增量 6 + 矛盾 4)。
- P2:v83 §本次变更段"§1.6 #43-#46 四栖立标候选新增触发 + 9-5 14:10-16:30 paper_card 4/4 入库实测预备补强 100% + RoboTok 票数 +18 升档预备实测延展"预备触发链延展为"§1.6 #43-#46 四栖立标候选新增触发 + 9-5 14:10-16:30 paper_card 4/4 入库实测预备补强 100% + RoboTok 9-6 20:40 雷达票数 79→114 +35 票立标 ★☆ → ★ 候选升档预备实测触发信号"预备级(沿用 9-5 简报 + 本简报增量 1)。
- P2:保留 HF Daily 9-6 早棒 agent 主轴 6 件新候选(SkillEvo / FlowEvo / EnvHarness / FACET / MemTrapBench / SWE-bench Science)+ hermes-agent / opencode / Compile by Training 3 件 GitHub 现象级预备扩增截止 9-15 P1 缺口补强 + 与 v82+v83+v84 §2.3 立标候选预备延展。
- P2:保留 work-queue.md(2026-09-06 12:00 + 20:00)待写攻略 1 条(2608.31100 Multimodal RAG Survey 沿用)均属 multimodal 主轴,不入 llm-application 立标池,沿用预备级。
- P2:ARC 2026 1,247 生产 Agent 23.5pp 差距原始报告完整 URL + AAAI 2026 Keyword Search 替代 Vector RAG Subramanian et al. 原始 arXiv 号 + ACToR v85 §4 #369 v84 开放问题延展预备级(沿用本简报矛盾 7+8)。
- 检查记录:已读 work-queue.md(2026-09-06 12:00 + 20:00);检查 jay / tom / flyp / spark / stephen 近 2 日相关文件 173+ 件(其中 9-6 18:00 → 21:10 3h10m v84 落定后窗口 = jay 1735 evening-report + 1950 engineering-filter-v3 + 1505 afternoon-supplement + 1450 engineering-filter-v2 + tom 2040 radar + flyp 1550 Compile-by-Training-24h-renewal-critical-read + spark 9-6 agent-e1prep + stephen 9-6 0910 news-x-vip-radar + stephen 9-6 ai-industry-e1prep + stephen 9-6 1245 coord-check-noon = 9 件覆盖 5 大实例 inbox);抽查 paper_cards 近 3 日新建卡 1226 / 1227 / 1228 / 1229 / 1230 / 1231 / 1232 / 1233 / 1234 / 1235 / 1236 共 11 张(llm-application 主分类 1229 / 1231 / 1233 / 1235 / 1236 共 5 张已入库 + 邻接级 1227 multimodal + 1226 engineering + 1220 engineering + 1218 agent + 1219 multimodal + 1225 engineering + 1208 agent + 1206 evaluation + 1209 engineering = 9 张邻接级已入库)。未写其他目录,未执行 git,未输出密钥。
六、本棒位备料小结
- v84 落定后 3h10m 二次承接备料性质:v84 已吸纳本窗口内 §1.6 #47-#50 四栖立标候选 + #42 AutoTraceGT EMNLP 2026 Findings 升档 + #43-#46 四栖立标候选 + §1.1 #107-#108 Scaling the Harness 立基础延展升档 ★☆ → ★★ + §1.1 #Y Yandex KV Cache as Agent Runtime + §1.2 SoK POMDP + ICLR 2026 TTL + 1 条 #304 共识 + 1 条 #369 开放问题 + 1 条 #130 工程落地清单 + §1.6 邻接级预备 46 → 50 件套扩位预备触发 = v84 主集净增 + §1.1 立基础延展五阶预备触发 + 第二十/二十一/二十二维度预备触发 + arXiv 707+0=707 / CVE 24+0=24 / DOI 3+0=3 / URL 122+0=122 / paper_card 1187+0=1187 + 0 件 v84 net-new arXiv 主集加入 + 0 件立标新高(Scaling the Harness 升档 ★☆ → ★★ 预备非新标)+ 0 件 P0 警示新增。本轮增量为 v84 已 anchor 条目的实测预备延展 = 1 件 RoboTok 票数 79→114 +35 显著升档预备实测触发信号 + 1 件 Scaling the Harness 立基础延展升档 ★☆ → ★★ 预备实测锚定沿用 + 1 件 Memory Security Survey 4 源独立交叉锚入稳定预备 + 1 件 SoK POMDP + ICLR 2026 TTL vs RagCap-Bench 邻接级对照预备 + 1 件 openJiuwen + Silent Failures + E-Commerce Bench 三件 v84 §1.6 #47-#49 候选立标预备实测锚定沿用 + 1 件 Yandex "KV Cache as Agent Runtime" runtime 原语化范式升档预备实测锚定延用。总计 6 条主增量 + 0 件新 arXiv 主集加入 + 0 件立标新高 + 5 件 v84 anchor 实测预备锚定沿用 + 1 件 RoboTok 立标 ★☆ → ★ 候选升档预备实测触发信号。
- 立标池 70 向稳态预备实测补强:v84 §1.6 #47-#50 + #42-#46 + #43-#46 + §1.1 #107-#108 Scaling the Harness 立基础延展升档 ★☆ → ★★ + §1.1 #Y Yandex KV Cache as Agent Runtime + §1.2 SoK POMDP + ICLR 2026 TTL + #304 共识 + #369 开放问题 + #130 工程落地清单 = 立标池 70 向稳态 + v84 候选预备级 50 件(其中 4 件 v84 net-new 候选预备 = #47/#48/#49/#50)+ 1 件立基础延展升档 = 立标池 70 → 71 向升档预备实测锚定延用(预备实测补强 100%)。Terminal-Universe paper_card 仍未入库 = v84 anchor 缺位延续预备级 = 截止 9-15 P1 缺口补强预备。
- 风险点:(a) Terminal-Universe paper_card 仍未入库(v82 §1.6 #176 + HF Daily 9-6 早棒 265▲ #2 +52▲ 立标极显著首次续立 + paper_card 仍未入库 ⚠️ = v82+v83+v84 anchor 缺位延续预备补强需 v85 evening 接力棒触发);(b) RoboTok 票数 79→114 +35 持续跃升立标 ★☆ → ★ 候选升档预备实测触发信号预备触发;(c) Memory Security Survey 90% 记忆中毒 + 100% 复发率的形式化威胁模型可证伪点 + MINJA 完整实现 + ClawVM OS 风格虚拟内存完整开源代码 + AgentSpec ICSE 2026 完整 DSL 定义预备触发;(d) Silent Failures 6 类分类法 + 4 模型样本 + LLM-as-judge 依赖 + Workshop 渠道分量的评测方法学延展 + HAL/TRAIL/MAST 对照表 + Cohen's κ / inter-annotator agreement 一致性预备触发;(e) Yandex "KV Cache as Agent Runtime" runtime 原语 vs SFT/RLHF 主模型更新机制边界需 v85 厘清预备触发;(f) ARC 2026 1,247 生产 Agent 23.5pp 差距原始报告完整 URL + AAAI 2026 Keyword Search 替代 Vector RAG Subramanian et al. 原始 arXiv 号 + 与 v82-v84 #15-#18 RAG 四栖 + #33-#36 评测四栖邻接级对照预备触发;(g) Scaling the Harness 立基础延展升档 ★☆ → ★★ 预备实测锚定 + 本实例 OpenClaw SOUL.md / SKILL.md / MEMORY.md 机制实例级对照预备实测预备触发。
- 诚实度声明:本棒位的 6 条增量全部为 v84 已 anchor 条目的实测预备延展或票数动态预备补强,纯 net-new arXiv 主集 = 0 件,纯 net-new 立标候选 = 0 件;本棒位性质为 v84 §1.6 #42-#46 + #47-#50 + §1.1 #Y/#107-#108 + §1.2 SoK POMDP + ICLR 2026 TTL 已 anchor 件套的实测预备锚定沿用 + RoboTok 票数 79→114 +35 持续跃升立标 ★☆ → ★ 候选升档预备实测触发信号预备触发 + Memory Security Survey 4 源独立交叉锚入稳定预备实测锚定延用 + Silent Failures + openJiuwen + E-Commerce Bench + Yandex KV Cache + SoK POMDP + ICLR 2026 TTL + Scaling the Harness 立基础延展升档预备实测锚定沿用预备触发。
Stephen · 2026-09-06 21:10 CST · E1 第 6 次 llm-application 预消化 · v84 落定后 3h10m 二次承接备料 · 6 条主增量(1 条 RoboTok 票数 +35 升档实测 + 5 条 v84 anchor 实测预备锚定沿用) + 0 件新 arXiv 主集加入 + 0 件立标新高 + 涉及 arXiv 号 36 件(net-new = 0 件)