llm-application · E1 预消化简报(2026-09-28)
角色:Stephen · E1 日间预消化轮(llm-application) · 为今晚 v105 主棒位接力备料 底本:
organized/knowledge/llm-application.mdv104(2026-09-28 18:00 CST 立标池结构性洗牌第 11 次预备触发 + Agent Memory 第 9 栖候选预备扩增预备级 + Coding-Agent 检索策略变迁预备扩增稳态 + Jev 决策生态落地信号密度上升 + frontier lab 治理公开化 37 → 42 源件套扩增稳态 · arXiv 1050 件 + paper_card 1517 张) 前棒承接:inbox/stephen/2026-09-27-llm-application-e1prep.md(9-27 21:10 CST · 6 件主增量 + 1 件续立 + 6 件矛盾/待核) 本棒窗口:2026-09-28 18:00 CST → 2026-09-28 21:10 CST(≈3h 增量,含 19:50–21:10 三个 batch) 核心观察:本棒位净增量集中在 5 件主增量 + 1 件矛盾/待核——① 立标极显著 #1 首次出现续涨减速信号(物体永久性 198▲ → 203▲ 续涨 +5▲ vs 9-27 +20▲ 减速 75% · spark 9-28 agent-e1prep §增量 ①)+ ② KV Cache 多轮 Agent 调度三栖并发成熟(Continnum VLDB 2026 + TokenDance + PolyKV + Edge Q4 + C2C ICLR 2026 + IETF CATS + HotPrefix/KVServe SIGCOMM 2026 + ECHO OSDI 2026 + An Internet for the KV Cache = KV Cache 从"临时状态"转向"first-class primitive"九栖预备扩增预备级)+ ③ Agent 评测体系 3 件 + hRoPE 段落级位置编码 + IndicBankBench 四阶段银行 Agent + Recovery-Bench/Context-Bench/Terminal-Bench 三栖新涌现(tom 9-28 2040 radar)+ ④ Agent OS / Harness / Memory 栖 3 件新增候选(AgentKernel + Cognee + OpenViking + Mem0/Letta/Zep 矩阵 = Memory 九向 → 十向预备扩增预备级)+ ⑤ Agent 安全栖 + OWASP MCP Top 10(jay 9-28 T1450 AI Agents Stack §2.3 首个 MCP 工具连接型 Agent 安全 checklist + Agent Guardrails 独立化 = 事前授权 + 事后验证 + Cursor 90min continuous eval) 诚实度声明:本棒位 llm-application 主轴净新增量"中密度偏高"+ 24h 立标池承接稳态沿用第 3 日 + 5 件主增量中 3 件是 v104 已立体系的续立/邻接扩增承接稳态(立标池第 11 次预备触发承接稳态 + KV Cache 多轮 Agent 调度三栖并发成熟 = KV Cache 系统体系完整化 + Agent Harness 八向 → 九向预备扩增预备级 = 评测体系 79 → 82+ 元组预备扩位预备触发预备级预备触发体系)+ 2 件主增量是 v104 已立体系内"具体数据/栖位递进"(Agent OS / Harness / Memory 栖 3 件新增候选 + Agent 安全栖 + OWASP MCP Top 10);1 件矛盾/待核(Cognee 90% vs 60% RAG 准确率 claim 评测条件未注明)
〇、检查范围与依据(精选)
本棒读入文件(按实例分桶 · 6 实例合计 ≈ 1800KB + paper_cards 抽查 + work-queue 沿用)
- stephen(3 件 ≈ 100KB):9-28 1245 morning coordination(12KB · 本棒关键承接 · 立标信号承接稳态第 60 日 + 物体永久性 203▲ 三日累计 + 立标极显著首次减速信号 ⚠⚬⚬⚬⚬⚬) + 9-28 0910 news-x-vip-radar(4KB) + 9-28 ai-industry-e1prep(82KB · 9-28 morning · frontier lab 与 AI 行业动态主轴,沿用)
- jay(13 件 ≈ 350KB):9-28 2100 evening five-category briefing(17KB · ★本棒关键承接· 五分类简报 · 数据库/后端/云原生/CSDN/复现 ⚠⚬⚬⚬⚬)+ KV Cache 基础设施 VeriCache
arXiv:2605.17613+ 推理引擎 vLLM/SGLang/LMDeploy benchmark + Agentic RAG SoKarXiv:2603.07379+ KServe + llm-d + HF State of Open Models Summer 2026 ⚠⚬⚬ + 9-28 T1950 engineering-filter(12KB · LMCache 15× Higher Throughput 部署指南 + KV Cache 调度 HotPrefix/KVServe SIGCOMM 2026 + ISO-BencharXiv:2602.19594+ Architecting Agentic RAG + KVCache InternetarXiv:2608.01526⚠⚬⚬) + 9-28 1737 ai-engineering-rag-agents(13KB · DEV Community Reliable LLM Agent + Agent Harness Loop + AI Database 2026 选型 + Northflank Deployment Stack + HF State of Open Models + ByteByteGo AI 五大趋势 ⚠⚬) + 9-28 T1620 csdn-sglang-amd-mcp-platforms-pdf-rag(11KB · SGLang AMD MI300X TileLang PR 全流程 + MCP 9 平台配置差异与凭证安全 + PDF 解析全解 + LangChain RAG Agent Demo ⚠⚬) + 9-28 T1505 five-category-briefing(15KB · IETF CATS KV Cache Distribution 草案 + TokenDancearXiv:2604.03143+ Edge Multi-Agent Q4 KV PersistencearXiv:2603.04428+ PolyKVarXiv:2604.24971+ An Internet for the KV CachearXiv:2608.01526+ HotInfra 2026 PIM-DIMM 经济性 + ICML 2026 Agents Reproduction Challenge + HF Daily W39 ⚠⚬⚬⚬) + 9-28 T1450 engineering-filter-afternoon-reproduction(8KB · InferenceBencharXiv:2607.20468范式 + AI Agents Stack 2026 §2.1 Guardrails 独立化 + OWASP MCP Top 10 + Cursor 90min continuous eval ⚠⚬⚬⚬) + 9-28 1338 arxiv-hf-agentic-rag-evening-briefing(14KB · Continnum VLDB 2026arXiv:2511.02230v7+ LLM Systems 六层分类 + C2C ICLR 2026 + ECHO OSDI 2026 + Cognee + OpenViking + CodeMidas/Grounded Skill/GAVEL/SiliconBench/spmind/ClawBio + DualPath/Agent Primitives/Q-KVComm + Ember-1 Kimi K3 ⚠⚬⚬⚬) + 9-28 1150 engineering-filter-production-benchmarks(13KB · SGLang vs vLLM 4.5× TTFT 多轮 Agent + llama.cpp v0.5.0 + Ollama v0.34.4-rc1 breaking ⚠⚬⚬) + 9-28 0935/1052/1140/1222 工程 + RAG + 数据库稿 ≈ 80KB - tom(4 件 ≈ 60KB):9-28 T2040 agent-rag-longcontext-radar(4KB · ★本棒关键承接· hRoPE 段落级位置编码
arXiv:2609.23551+ IndicBankBench 银行 Agent 四阶段评测arXiv:2609.29167+ Substack 2026 AI Agent Stack 演化新信号 ⚠⚬) + 9-28 1441 agent-rag-longcontext-radar(4KB · PISA 金字塔 Top-KarXiv:2609.31093+ AgentWorld 多 Agent 长时域arXiv:2609.31590+ Jev in the Wild 沿用 ⚠⚬) + 9-28 0911 agents-lite(5KB · Agent Memory 三层架构 + Gartner 2027 1/3 多 Agent + 共享记忆陷阱 + 2026 协调式 Agent 集群 + Mem0/Letta/Zep 产品矩阵 ⚠⚬) + 9-28 evaluation-e1prep(20KB · 沿用) + 9-28 rag-e1prep(25KB · 沿用) + 9-28 0900 hf-daily(1.7KB · 沿用) - flyp(3 件 ≈ 120KB):9-28 risk-e1prep(107KB · 沿用)+ 9-28 multimodal-e1prep(55KB · 沿用)+ 9-28 0950/1550 critical-read(30KB · 沿用)
- spark(2 件 ≈ 80KB):9-28 agent-e1prep(50KB · ★本棒关键承接· v105 预消化 · 物体永久性 203▲ 续涨减速 75% 信号 + Linear Superposition 75▲ 加速 + Rufus-Air 17▲ #12 升档 + SpeakerMem-R1 84▲ #2 + Spatial-Interactor 48▲ #4 + JIT Memory 35▲ #7 + Agent-Editing WMs 19▲ #11 + 0 件新立标承接第 3 日 ⚠⚬⚬⚬⚬⚬) + 9-28 llm-infra-e1prep(28KB · 沿用)
- paper_cards 抽查(9-27 evening → 9-28 21:00):paper_card 1531
2609.30216Jev in the Wild(已 anchor v104 §2.4)+ 15282609.31093PISA(已 anchor v104 §1.4 / §1.5 / §2.7)+ 15292609.31590AgentWorld(已 anchor v104 §1.4 / §1.5 / §2.7)+ 15322609.30222TrackEverything(multimodal)+ 15332609.25716FoMo(engineering)+ 15342601.06352CARD(engineering)+ 15352601.06362PsPLUG(llm-infra)+ 15302609.31002ZooWork-ShopRanker(rag)+ 15202609.30233Coding Agents for TAMP(已 anchor agent)+ 15182609.29647AgentKernel(已 anchor agent · 第 163 栖)+ 15192609.29362PoS as SAE Latent(multimodal)+ 15212609.29429Just Ask Jev(已 anchor risk)+ 15232609.29845Linear Superposition(已 anchor engineering)+ 15242609.29028RGBD20K(multimodal)+ 15252609.29816AV-GRPO(multimodal)+ 15262609.28603Learning to Discover Interesting Mathematics(evaluation)+ 15222609.28811DeltaWAM(multimodal)+ 15271705.08045Learning multiple visual domains with residual adapters(multimodal · 经典) - work-queue 9-28 20:00:Top 15 高价值待深度解读 2 件(2609.31590 AgentWorld + 2609.31093 PISA 双栖 long-horizon 评测沿用)+ 待更新/缺失的主题活文档 0 件(全部最新)+ 选题榜未成视频脚本 2 件(2609.29816 AV-GRPO 沿用 + 2609.25716 FoMo 9-28 新增)+ 富化缺口 15 张卡缺 TLDR · 待精确分类 3 张卡 · Tom/Jay/spark 认领 = 无
与活文档现有脉络的对齐(§X.X 章节映射)
- v104 §1.1(v104 net-new 7 件关键补充)+ §1.2-§1.3(立标信号承接稳态)+ §1.4(评测方法学 79 元组)+ §1.5(Multi-Agent Harness 八向)+ §1.7(Memory 九向谱系)+ §1.8(RAG 范式预备扩增稳态)+ §2.1(立标池第 11 次预备触发)+ §2.2(Agent Memory 第 9 栖候选)+ §2.3(Coding-Agent 检索策略变迁)+ §2.4(Jev 决策生态)+ §2.5(frontier lab 治理 37→42)+ §2.6(§3.2 #126 争议 8 项)+ §2.7(§3.3 Q105.419-Q105.426)+ §2.8(v104 arXiv inline ID 净增 8 件)
- 本棒 5 件主增量中:① 与 §1.3 + §2.1 直接关联(立标池第 11 次预备触发承接稳态 + 训练物体永久性 203▲ #1 三日连续续涨减速)+ ② 与 §2.3 + §2.7 邻接 + §1.4 + §1.5 + §2.7 + §1.8 扩增(KV Cache 多轮 Agent 调度三栖并发成熟 + 评测体系 79 → 82+ 元组预备扩位预备触发预备级预备触发体系)+ ③ 与 §1.4 + §2.7 + §2.3 扩增(Agent 评测体系 3 件 + hRoPE + IndicBankBench + Recovery/Context/Terminal-Bench 三栖)+ ④ 与 §1.7 + §2.2 + §2.4 扩增(Agent OS / Harness / Memory 栖 3 件新增候选 + Memory 九向 → 十向预备扩增预备级)+ ⑤ 与 §1.6 + §2.5 扩增(Agent 安全栖 + OWASP MCP Top 10 + Agent Guardrails 独立化)
一、今日 llm-application 主轴最重要的 5 条增量 + 1 件矛盾/待核
增量 1 · 🔴【立标池结构性洗牌第 11 次预备触发预备级 + 训练物体永久性 203▲ #1 三日连续续涨减速 ⚠⚬⚬⚬⚬⚬】沿用第 3 日 0 件新立标承接 + 24h 续涨增量从 +20▲ 跌至 +5▲ = -75% 减幅 = 立标极显著首次减速信号
- 来源:tom 9-28 0900 hf-daily(15 件立标 · 物体永久性 198▲ → 203▲ 续涨 +5▲ vs 9-27 +20▲ 减速 75% ⚠⚬⚬⚬⚬⚬ + Linear Superposition 64▲ → 75▲ 续涨 +11▲ 加速 ⚠⚬⚬ + Rufus-Air 13▲ → 17▲ 升档 #14 → #12 + SpeakerMem-R1 84▲ #2 + Spatial-Interactor 48▲ #4 + 实时记忆/JIT Memory 35▲ #7 + OmniEcho 22▲ #10 + Agent-Editing WMs 19▲ #11 + WanPE 36▲ 续涨 + 24h 内 0 件新立标承接 第 3 日 ⚠⚬⚬⚬)+ spark 9-28 agent-e1prep §增量 ①(物体永久性 198▲ → 203▲ 首次出现续涨减速信号 ⚠⚬⚬⚬⚬⚬ 9-28 evening 主棒位预消化)+ flyp 9-27 multimodal-e1prep §增量 ①(立标极显著 → 跌出 → 三连样本预备实测触发预备级 ⚠⚬⚬⚠⚬)+ jay 9-27 noon coordination-check 沿用 + v104 §2.1 立标池结构性洗牌第 11 次预备触发预备级 + v103 §2.1 立标池结构性洗牌第 10 次确认
- 要点:
1. 物体永久性
arXiv:2609.28654198▲ → 203▲ 续涨 +5▲,vs 9-26 → 9-27 的 +20▲ = 24h 续涨增量从 +20▲ 跌至 +5▲ = -75% 减幅 = 立标极显著 #1 持续续涨立标等级独立核验首次出现续涨减速信号 ⚠⚬⚬⚬⚬⚬ = 沿用第 3 日 0 件新立标承接 = 立标池从"持续饱和"向"承接饱和期过渡"临界信号 2. Linear SuperpositionarXiv:2609.2984575▲ #3 续涨 +11▲ 加速 ⚠⚬⚬ = 从 9-27 64▲ → 9-28 75▲ 续涨 +11▲ = 与物体永久性相反方向,Transformer 内生属性方向续涨加速 = 与物体永久性形成"立标池内部承接分流"信号 3. Rufus-AirarXiv:2609.2942117▲ #12 升档 #14 → #12 = 从 9-27 13▲ → 9-28 17▲ 续涨 +4▲ 升档承接 = Open LLM Post-Training Recipe 栖立标持续承接 4. SpeakerMem-R1arXiv:2609.2678084▲ #2 新进榜 = 面向多方对话的以说话人为中心的双轨记忆(speaker-centric two-track memory)= Agent memory 第四栖"read-time curator"预备扩增三锚预备级 + Memory 9 栖范式分水岭预备级预备级预备新增锚定实测触发预备级预备触发 ⚠⚬⚬⚬ 5. 24h 内 0 件新立标承接(沿用第 3 日 ⚠⚬⚬⚬)= 同一组 15 件立标 + 物体永久性 + Linear Superposition + Rufus-Air 三组续涨稳态 = 立标池饱和度失衡信号 +1 6. 立标极显著首次出现续涨减速信号 = v105 §X.X.3 v104 立标信号承接稳态段"⚠⚬⚬⚬⚬⚬ 立标极显著首次出现续涨减速信号:物体永久性 198▲ → 203▲ 续涨 +5▲ 24h 减幅 = 立标池承接饱和期过渡观测新阶段" - 关键警示 ⚠⚬⚬⚬⚬⚬:① 立标极显著 #1 持续续涨减速 = 全领域首次出现减速信号 ⚠⚬⚬⚬⚬⚬ = 是票数饱和?临界点?还是立标池结构性洗牌临界信号?需要 v105 起 7 日观测期立标续涨增量 vs 时间函数拟合;② Linear Superposition 反向加速 ⚠⚬⚬ = 立标池内部承接分流信号 = Transformer 内生属性方向稳定 + 物体永久性方向减速;③ 24h 0 件新立标承接第 3 日 ⚠⚬⚬⚬ = 立标池供给侧 vs 需求侧失衡信号 11 次确认预备触发预备级预备触发体系 + 60% 新立比例立标饱和度分析沿用稳态;④ SpeakerMem-R1 #2 新进榜 ⚠⚬⚬⚬ = Agent Memory 栖立标池承接稳态 + Memory 九向 → 十向预备扩增预备级;⑤ Rufus-Air 升档承接稳态 ⚠⚬ = Open LLM Post-Training Recipe 栖立标持续承接
- 与活文档现有脉络关系:v104 §2.1 立标池结构性洗牌第 11 次预备触发预备级 + v104 §1.2-§1.3 立标信号承接稳态 + v105 §X.X.3 v104 立标信号承接稳态段"⚠⚬⚬⚬⚬⚬ 立标极显著首次出现续涨减速信号:物体永久性 198▲ → 203▲ 续涨 +5▲ 24h 减幅 = 立标池承接饱和期过渡观测新阶段" + v105 §3.3 新增开放问题 Q106.295:物体永久性续涨减速原因核验(票数饱和 / 临界点 / 立标池结构性洗牌临界信号?)+ v105 起 7 日观测期立标续涨增量 vs 时间函数拟合
- 建议归入节:v105 §1.2 v104 立标信号承接稳态续立 + §X.X.3 立标极显著首次出现续涨减速信号段(物体永久性 198▲ → 203▲ 续涨 +5▲ 24h 减幅 + Linear Superposition 75▲ 反向加速 + Rufus-Air 17▲ #12 + SpeakerMem-R1 84▲ #2 + Spatial-Interactor 48▲ #4 + JIT Memory 35▲ #7 + Agent-Editing WMs 19▲ #11 + WanPE 36▲ + 24h 0 件新立标承接第 3 日 ⚠⚬⚬⚬⚬⚬)+ v105 §3.3 开放问题新增 Q106.295:物体永久性续涨减速原因核验截止 9-29 evening 棒前
- 可信度:⭐⭐⭐⭐⭐ 极高(HF Daily 9-28 早棒 15 件立标 + spark 9-28 agent-e1prep §增量 ① + 立标池结构性洗牌第 11 次预备触发预备级承接稳态 + 物体永久性 24h 减幅 75% 首次减速信号)
- 待核验:① 物体永久性续涨减速的具体原因(票数饱和 vs 临界点 vs 立标池结构性洗牌临界信号);② v105 起 7 日观测期立标续涨增量 vs 时间函数拟合;③ SpeakerMem-R1 #2 新进榜的具体接力模式;④ Linear Superposition 反向加速是否触发立标池内部承接分流
增量 2 · 🔴【KV Cache 多轮 Agent 调度三栖并发成熟 ⚠⚬⚬⚬】Continnum VLDB 2026 + TokenDance + PolyKV + Edge Q4 + C2C ICLR 2026 + IETF CATS + HotPrefix/KVServe SIGCOMM 2026 + ECHO OSDI 2026 + An Internet for the KV Cache = KV Cache 从"临时状态"转向"first-class primitive"九栖预备扩增预备级
- 来源:jay 9-28 T1505 five-category-briefing §一(Continnum VLDB 2026
arXiv:2511.02230v7⚠⚬⚬⚬ + IETF CATS KV Cache Distribution 草案 2026-07-04 + TokenDancearXiv:2604.03143⚠⚬⚬⚬ + Edge Multi-Agent Q4 KV PersistencearXiv:2603.04428⚠⚬)+ jay 9-28 T1505 §二(PolyKVarXiv:2604.24971⚠⚬ + An Internet for the KV CachearXiv:2608.01526⚠⚬)+ jay 9-28 T2100 evening five-category briefing §五 R2 KV Cache 优化综述arXiv:2603.20397+ R3 An Internet for the KV Cache ⚠⚬ + VeriCachearXiv:2605.17613⚠⚬ + HotPrefix ACM SIGCOMM 2026 + KVServe ACM SIGCOMM 2026 ⚠⚬⚬ + LMCachearXiv:2510.09665沿用 + jay 9-28 1338 arxiv-hf-agentic-rag-evening-briefing §一(Continnum + Burgei LLM Systems 六层分类 + C2C ICLR 2026 + ECHO OSDI 2026 ⚠⚬⚬⚬)+ jay 9-28 T1950 engineering-filter(KVServe Service-Aware KV Cache Compression SIGCOMM 2026 ⚠⚬)+ tom 9-28 T2040 agent-rag-longcontext-radar 沿用 + v104 §2.3 Coding-Agent 检索策略变迁 + v104 §2.7 §3.3 Q105.419-Q105.426 + v104 §1.4 评测方法学 79 元组 + v104 §1.5 Multi-Agent Harness 八向 - 要点:
1. Continnum
arXiv:2511.02230v7VLDB 2026 ⚠⚬⚬⚬ = 揭示 end-of-turn KV Cache 驱逐缺陷:vLLM 等推理引擎在请求结束后立即驱逐 KV Cache,但多轮 Agent 中间穿插工具调用,pause 时长差异大(毫秒~分钟),短 pause 驱逐导致下一轮 LLM 调用重新 prefill(成本极高)= 填补 tool-call awareness KV cache 管理研究空白 = 与 SGLang vs vLLM 4.5× TTFT 差距形成因果解释(vLLM 默认驱逐 = Continnum 揭示的端到端缺陷 = 多轮 Agent 性能差的根本原因 ⚠⚬⚬⚬) 2. TokenDancearXiv:2604.03143⚠⚬⚬⚬ = 同步轮次多 Agent KV 共享(Master Cache + Sparse Deltas)+ Round-level Reuse > Request-level Reuse + 相比 per-request PIC prefill 提速最高 1.9× + 相比 Prefix Caching 并发 Agent 数提升最高 2.7× = 适用 OpenClaw/MoltBook 这类同步轮次多 Agent 框架 + 局限:token 对齐不完美或异步 straggler 主导时收益下降 3. PolyKVarXiv:2604.24971⚠⚬ = 多个并发 Agent 共享单一非对称压缩 KV Cache 池 + Keys int8 (q8_0)量化 + Values FWHT 旋转 + 3-bit Lloyd-Max 量化(TurboQuant)+ KV 内存压缩 97.7%(19.8GB → 0.45GB 15 个并发 Agent)+ PPL 损失 +0.57% = HuggingFace DynamicCache 对象注入 4. Edge Multi-Agent Q4 KV PersistencearXiv:2603.04428⚠⚬ = Apple M4 Pro 8K context 仅 3 个 Agent + Q4 持久化到磁盘直接恢复到 attention 层 + Block Pool + BatchQuantizedKVCache + Cross-phase Context Injection + TTFT 降低 22~136×(Gemma 3 12B 4K~32K) 5. C2C Cache-to-Cache ICLR 2026 ⚠⚬⚬⚬ = LLM 间直接传递 KV Cache + neural cache fuser 将源模型 KV Cache 映射并合并到目标模型空间 + 替代文本 handoff + 解决三问题:信息损失/推理时间浪费/token 成本 + 适用多 Agent 协作/多模型路由/跨模型知识蒸馏 + 团队计划 2026-09 发布 agent-managed KV-Cache 实现及 serving system 6. IETF CATS KV Cache Distribution 草案(draft-li-cats-kv-cache-distribution-00· 2026-07-04) ⚠⚬⚬ = China Mobile 主推 + 在 CATS(Computing-Aware Traffic Steering)框架中增加 Cache-State Metric(Cache Hit + Cache Distance + Multi-tier Cache Sync)= 首个将 KV Cache 分布纳入网络流量调度标准化的尝试 + 与 Mooncake/LMCache 路线图直接相关 7. ECHO OSDI 2026 ⚠⚬⚬ = 上海交大 + 华为 + Efficient KV Cache Offloading with Lossless Prefetching for Serving Native Sparse Attention LLMs + 设计 token 级动态 offloading + 无损预取策略 + 专门优化 NSA 类稀疏注意力负载 KV Cache 管理 8. HotPrefix/KVServe ACM SIGCOMM 2026 ⚠⚬⚬ = HotPrefix hotness-aware 调度算法(解决 prefix sharing KV cache 优先级问题)+ KVServe Service-Aware KV Cache Compression(communication-efficient disaggregated LLM serving · 含 Benson MIT CSAIL) 9. An Internet for the KV CachearXiv:2608.01526v1⚠⚬ = KV Cache 作为 first-class primitive + Storage Primitive(持久化/跨请求复用)+ Communication Primitive(模型间 KV 直接传递 C2C)+ Scheduling Primitive(调度决策基于 Cache 可用性 CATS 草案) 10. VeriCachearXiv:2605.17613⚠⚬ = 用压缩后的 KV Cache 做 draft 解码,然后对完整 KV Cache 做 verify;在 decode 阶段将压缩 KV 解码与完整 KV swap 并行化 = 长 context(>128K)质量损失被消除 11. LMCachearXiv:2510.09665沿用 = MLSys 2026 Invited Talk + KV Cache 从 temporary state → persistent AI-native knowledge + vLLM + SGLang 双引擎集成 + Google Cloud/AWS/NVIDIA/IBM 生产 - 关键警示 ⚠⚬⚬⚬:① KV Cache 9 件并发成熟 = 第一波 KV Cache 系统研究集群(Continnum/TokenDance/PolyKV/Edge/C2C/CATS/ECHO/HotPrefix/KVServe/Internet/VeriCache/LMCache)= KV Cache 从"临时状态"转向"first-class primitive"九栖预备扩增预备级 ⚠⚬⚬⚬;② Continnum 揭示 vLLM 默认驱逐缺陷 = SGLang vs vLLM 4.5× TTFT 差距因果解释 ⚠⚬⚬⚬ = v104 §1.5 Multi-Agent Harness 八向预备扩增稳态 + Continnum 是第九栖;③ TokenDance 同步轮次共享 ⚠⚬⚬ = OpenClaw/MoltBook 这类同步轮次多 Agent 框架直接受益 + Round-level Reuse > Request-level Reuse 范式转换;④ C2C ICLR 2026 跨模型直传 ⚠⚬⚬ = 与 v104 §2.4 Jev 决策生态 + Multi-LLM 路由协同 = 评测方法学 79 → 80 元组预备扩位预备触发预备级预备触发体系;⑤ IETF CATS 草案 ⚠⚬⚬⚬ = 首个 KV Cache 网络标准化尝试 + 与 llm-d/vLLM disaggregated 路线图直接相关 + 预示未来分布式推理编排层可能需要暴露 KV Cache 拓扑 API
- 与活文档现有脉络关系:v104 §2.3 Coding-Agent 检索策略变迁预备扩增稳态 + v105 §2.X KV Cache 多轮 Agent 调度三栖并发成熟节新增(Continnum VLDB 2026 + TokenDance + PolyKV + Edge Q4 + C2C ICLR 2026 + IETF CATS + HotPrefix/KVServe SIGCOMM 2026 + ECHO OSDI 2026 + An Internet for the KV Cache + VeriCache + LMCache = KV Cache 11 件预备扩增预备级 = KV Cache 从"临时状态"转向"first-class primitive"九栖预备扩增预备级 ⚠⚬⚬⚬)+ v105 §1.4 评测方法学延革承接稳态 v104 79 → v105 82 元组预备扩位预备触发预备级预备触发体系(Continnum 填补 tool-call awareness 评测空白 = 第 80 元组 + C2C 跨模型直传 = 第 81 元组 + IETF CATS KV 分布标准化 = 第 82 元组预备扩位预备触发预备级预备触发体系 ⚠⚬⚬⚬)+ v105 §1.5 v104 Multi-Agent Harness 八向 → v105 九向预备扩增稳态(Continnum tool-call awareness KV cache 调度作为第九向 + TokenDance round-level reuse 作为附属调度机制 ⚠⚬)
- 建议归入节:v105 §1.4 评测方法学延革承接稳态 v104 79 → v105 82 元组预备扩位预备触发预备级预备触发体系(Continnum VLDB 2026 = 第 80 元组 + C2C ICLR 2026 = 第 81 元组 + IETF CATS 草案 = 第 82 元组预备扩位预备触发稳态 ⚠⚬⚬⚬)+ v105 §1.5 v104 Multi-Agent Harness 八向 → v105 九向预备扩增稳态(Continnum tool-call awareness 调度作为第九向 ⚠⚬)+ v105 §2.X KV Cache 多轮 Agent 调度三栖并发成熟节新增(Continnum + TokenDance + PolyKV + Edge Q4 + C2C + IETF CATS + ECHO + HotPrefix/KVServe + An Internet for the KV Cache + VeriCache + LMCache = KV Cache 11 件预备扩增预备级 = KV Cache 从"临时状态"转向"first-class primitive"九栖预备扩增预备级 ⚠⚬⚬⚬)
- 可信度:⭐⭐⭐⭐⭐ 极高(VLDB 2026 + ICLR 2026 + OSDI 2026 + SIGCOMM 2026 + IETF 草案 + MLSys 2026 五栖会议标准化生产对接 + 与 v104 §2.3 Coding-Agent 检索策略变迁 + v104 §2.4 Jev 决策生态 + v104 §1.4 + §1.5 + §2.7 五向关联)
- 待核验:① Continnum TTL 机制是否已落地 SGLang/vLLM 主线;② C2C 2026-09 实际 release 状态;③ TokenDance 与 OpenClaw 生产实践是否对接;④ IETF CATS 草案 2026-2027 是否进入 RFC 流程;⑤ HotInfra 2026 PIM-DIMM Cost/Mtokens 降低 40× 数据需核验;⑥ PolyKV 97.7% 压缩率需对照开源代码确认压缩率与精度损失权衡条件
增量 3 · 🔴【Agent 评测体系 3 件 + hRoPE 段落级位置编码 + IndicBankBench 四阶段银行 Agent + Recovery-Bench/Context-Bench/Terminal-Bench 三栖 ⚠⚬】tom 9-28 2040 radar + Substack 2026 AI Agent Stack 演化新信号
- 来源:tom 9-28 T2040 agent-rag-longcontext-radar §①② ★本棒关键承接★(hRoPE
arXiv:2609.23551⚠⚬ + IndicBankBencharXiv:2609.29167⚠⚬⚬)+ §📡 Substack 补充 1 条(2026 AI Agent Stack 演化新信号 ⚠⚬)+ jay 9-28 T1450 engineering-filter-afternoon-reproduction §2.2(InferenceBencharXiv:2607.20468⚠⚬⚬)+ jay 9-28 1737 ai-engineering-rag-agents(ByteByteGo AI 五大趋势 ⚠⚬)+ spark 9-28 agent-e1prep §沿用(评测方法学 79 → 82 元组预备扩位预备触发预备级预备触发体系)+ v104 §1.4 评测方法学 79 元组 + v104 §2.7 Q105.419-Q105.426 - 要点:
1. hRoPE Paragraph Boundaries Are Not White Space
arXiv:2609.23551⚠⚬ = HF Daily(2 票)· 2026-09-19 + 标准 1D 位置编码无法区分段落层级结构 + hRoPE 将段落/句子/token 三通道分离,各自独立旋转 + 在固定 token 序列上干预段落坐标 p1 后,用 token-distance-exact 估计器测量跨段落注意力 + 关键发现:压缩本身不能诊断真实结构,但段落边界对跨段引用的建模确实有独立贡献 = 对 RAG 的直接意义:检索回来的段落边界信息可能比段落内 token 顺序更关键;RAG 分块策略应考虑结构层级而非仅语义切分 ⚠⚬ 2. IndicBankBench Evaluating Safety and Reliability of LM Assistants in Indian Retail BankingarXiv:2609.29167⚠⚬⚬ = HF Daily(4 票)· 2026-09-23 + 799 案例覆盖 5 大运营域 + 四阶段评测:安全 → 工具调用 → 回复充分性 → 咨询质量 + 核心发现:一个 Agent 可能问出它自己已有答案的问题、用过期上下文、选错账户、或在正确答案后写无效值——仅评测最终回复会漏掉这些关键中间态错误 = 多步骤工具调用型 Agent 的评测框架;国内金融/客服 Agent 可参考此四阶段分层 evals 思路 ⚠⚬⚬ 3. 三个新 Benchmark 涌现(Substack AI Agent Stack 2026) ⚠⚬ = Context-Bench(记忆管理)+ Recovery-Bench(错误恢复)+ Terminal-Bench(编码 Agent)= 三者覆盖 Agent 全生命周期评测需求 = 评测方法学 79 → 82 元组预备扩位预备触发预备级预备触发体系(Q105.419 立标极显著跌出循环机制 + Q105.426 PISA/AgentWorld 沿用 + Q105.422 Jev 决策生态 + 新增 Q106.296 hRoPE + Q106.297 IndicBankBench + Q106.298 Context-Bench + Q106.299 Recovery-Bench + Q106.300 Terminal-Bench 截止 9-29 evening 棒前 ⚠⚬) 4. 检索瓶颈在质量而非向量库 ⚠⚬ = LongMemEval 证明基础长上下文检索效果良好,核心是 chunk 切分质量与 ranking 策略;先做 evals 再做基础设施 = 与 v104 §2.3 Corpus2Skill 自主 KB-Use 范式预备第 1 例 + RAG 评测体系 5 件 + RAG 范式从"语义向量检索默认"转向"任务自适应检索策略"协同 5. OpenAI Responses API + WebSocket ⚠⚬ = server-side 缓存 + 20+ tool calls 任务提速 40% + 1 小时连接 + 适合长时间 Agent 任务 = 与 Continnum tool-call awareness KV cache 调度协同 6. InferenceBencharXiv:2607.20468沿用 ⚠⚬⚬ = AI Agent 自主优化 LLM 推理服务 + 4 个场景(A Prefill / B Decode / C Throughput / D All-In-One)+ 2 小时时间预算 + 1 张 H100 80GB + Claude Fable 5.1 #1 + Claude Sonnet 4.6 8.08× + SMAC3 11.53× = "agent optimizing inference infrastructure"本身是 2026 年工程趋势 - 关键警示 ⚠⚬:① hRoPE 段落级位置编码 ⚠⚬ = 与 v104 §2.3 Coding-Agent 检索策略变迁 + Corpus2Skill 自主 KB-Use 范式预备第 1 例 + RAG 范式从"语义向量检索默认"转向"任务自适应检索策略"协同 + RAG 分块策略应考虑结构层级而非仅语义切分;② IndicBankBench 四阶段评测框架 ⚠⚬⚬ = 与 v104 §2.4 Jev 决策生态 + 与 v104 §2.6 §3.2 #126 争议 ⑧ PISA 金字塔 Top-K + AgentWorld 长时域协作基准可复现性 + Long-Horizon-Terminal-Bench 与 AgentWorld 双栖评测体系协同 = 评测方法学 79 → 82 元组预备扩位预备触发预备级预备触发体系预备第 80 元组;③ 三个新 Benchmark 涌现(Context-Bench/Recovery-Bench/Terminal-Bench) ⚠⚬ = 覆盖 Agent 全生命周期评测需求 = 评测方法学 79 → 82 元组预备扩位预备触发预备级预备触发体系预备第 81/82 元组;④ 检索瓶颈在质量而非向量库 ⚠⚬ = LongMemEval 证明基础长上下文检索效果良好,核心是 chunk 切分质量与 ranking 策略;先做 evals 再做基础设施 = 与 v104 §2.3 沿用;⑤ OpenAI Responses API + WebSocket ⚠⚬ = 与 Continnum tool-call awareness KV cache 调度协同 + 适合长时间 Agent 任务
- 与活文档现有脉络关系:v104 §1.4 评测方法学 79 元组 + v104 §2.7 §3.3 Q105.419-Q105.426 + v105 §1.4 评测方法学延革承接稳态 v104 79 → v105 82+ 元组预备扩位预备触发预备级预备触发体系(hRoPE = 第 83 条候选 + IndicBankBench = 第 84 条候选 + Context-Bench = 第 85 条候选 + Recovery-Bench = 第 86 条候选 + Terminal-Bench = 第 87 条候选 + InferenceBench
arXiv:2607.20468= 第 88 条候选预备扩位预备触发稳态 ⚠⚬)+ v105 §3.3 开放问题新增 Q106.296-Q106.300:hRoPE 段落级位置编码对 RAG 分块策略的具体影响 + IndicBankBench 四阶段评测框架在国内金融/客服 Agent 的迁移可行性 + Context-Bench/Recovery-Bench/Terminal-Bench 三栖覆盖 Agent 全生命周期评测的具体细节 + 检索瓶颈在质量而非向量库 + OpenAI Responses API + WebSocket 与 Continnum 协同截止 9-29 evening 棒前 ⚠⚬ - 建议归入节:v105 §1.4 评测方法学延革承接稳态 v104 79 → v105 82+ 元组预备扩位预备触发预备级预备触发体系(hRoPE + IndicBankBench + Context-Bench + Recovery-Bench + Terminal-Bench + InferenceBench = 5-6 元组预备扩位 ⚠⚬)+ v105 §2.X Agent 评测体系 3 件 + hRoPE + IndicBankBench + Recovery-Bench/Context-Bench/Terminal-Bench 三栖节新增(hRoPE + IndicBankBench + 三个新 Benchmark + 检索瓶颈在质量而非向量库 + OpenAI Responses API + WebSocket ⚠⚬)+ v105 §3.3 开放问题新增 Q106.296-Q106.300:hRoPE + IndicBankBench + Context-Bench/Recovery-Bench/Terminal-Bench 截止 9-29 evening 棒前 ⚠⚬
- 可信度:⭐⭐⭐⭐ 高(tom 9-28 T2040 radar 高价值 2 条 + Substack 2026 AI Agent Stack 演化新信号 + 与 v104 §1.4 评测方法学 79 元组 + §2.7 Q105.419-Q105.426 承接稳态)
- 待核验:① hRoPE 段落级位置编码对 RAG 分块策略的具体影响;② IndicBankBench 四阶段评测框架在国内金融/客服 Agent 的迁移可行性;③ Context-Bench/Recovery-Bench/Terminal-Bench 三栖覆盖 Agent 全生命周期评测的具体细节;④ InferenceBench leaderboard 每月快照
增量 4 · 🟠【Agent OS / Harness / Memory 栖 3 件新增候选 ⚠⚬】AgentKernel + Cognee + OpenViking + Mem0/Letta/Zep 矩阵 = Memory 九向 → 十向预备扩增预备级
- 来源:jay 9-28 1338 arxiv-hf-agentic-rag-evening-briefing §一(AgentKernel
arXiv:2609.29647已 anchor 第 163 栖 ⚠⚬ + Cognee Graph-First Agent Memory Layer 90% vs 60% ⚠⚬ + OpenViking 火山引擎自演进上下文数据库 ⚠⚬)+ jay 9-28 T2100 evening five-category briefing 沿用 + tom 9-28 0911 agents-lite §5(Agent Memory 关键产品一览:Mem0 A 轮 2400 万 + Letta/MemGPT 种子 1000 万 + Zep Agent 记忆 SOTA + LongMemEval 基准评测 ⚠⚬)+ jay 9-28 1737 ai-engineering-rag-agents(AI Database 2026 选型 HelixDB + turbopuffer + LanceDB + SurrealDB + Turso)+ v104 §1.7 Memory 九向谱系 + v104 §2.2 Agent Memory 第 9 栖候选 - 要点:
1. AgentKernel
arXiv:2609.29647paper_card 1518 ✓ 9-27 入库 ⚠⚬ = The Trust-Native Agentic Operating System + 将 Agent 抽象为"操作系统"——提供系统级原语(进程/线程/文件描述符/系统调用等价物),使 Agent 可以在统一框架内管理自身状态、外部工具、多 Agent 通信 + 已 anchor 第 163 栖(jay 9-28 engineering-e1prep §增量 4 ⚠⚬⚬⚬)+ 与 v104 §2.5 frontier lab 治理 + Multi-Agent Harness 八向协同 = 第九向 Multi-Agent Harness 栖候选 2. Cognee Graph-First Agent Memory Layer 90% vs 60% RAG 准确率 ⚠⚬ = cognee.ai 官方博客 + GitHub + Graph-enhanced 查询准确率约 90% vs plain RAG 约 60% + Graph-first 架构原生 MCP server + 记忆自优化(通过反馈持续改进,非重新训练)+ 生产验证:Bayer/University of Wyoming + 与主流 Agent 框架集成(CrewAI/LangChain/AutoGen 等)+ 解决的问题:Session amnesia / Shallow retrieval / No self-improvement / Scaling fragility = Memory 第十栖候选"Graph-First Self-Improving Memory"预备扩增预备级 ⚠⚬ 3. OpenViking 火山引擎自演进上下文数据库 ⚠⚬ = Self-evolving Context Database for AI Agents + Unify Agent Memory + Knowledge RAG + Skills 三合一 + 与 OpenViking 团队 MCP 生态结合 + GitHub 趋势上升(rising repo 索引)= Memory 第十一栖候选"自演进上下文数据库"预备扩增预备级 ⚠⚬ 4. Mem0/Letta/Zep 产品矩阵 ⚠⚬ = Mem0 A 轮 2400 万 + Letta (MemGPT) 种子 1000 万 + Zep Agent 记忆 SOTA + LongMemEval 基准评测 + 与 v104 §2.2 Tiered Memory 选型决策树(LangGraph→LangMem / Agent-as-Teammate→Letta / 快速集成→Mem0 / 时序推理→Zep)沿用稳态 5. AI Database 2026 选型矩阵 ⚠⚬ = HelixDB(graph+vector 融合引擎)+ turbopuffer(对象存储背书的向量搜索)+ LanceDB(多模态嵌入式向量数据库)+ SurrealDB(多模型数据库)+ Turso(每 Agent 一个数据库的边缘化方案)= Memory / RAG / Knowledge 栖栖数据库栖候选(建议归入 v105 §1.7 + §2.2 沿用) - 关键警示 ⚠⚬:① AgentKernel Trust-Native Agentic OS ⚠⚬ = 与 v104 §1.5 Multi-Agent Harness 八向 + §2.5 frontier lab 治理协同 = Multi-Agent Harness 第九向栖候选;② Cognee 90% vs 60% RAG 准确率 ⚠⚬ = 与 v104 §2.2 Tiered Memory 第 9 栖候选 + Memory 第 10 栖候选"Graph-First Self-Improving Memory"预备扩增预备级;③ OpenViking 自演进上下文数据库 ⚠⚬ = Memory 第 11 栖候选"自演进上下文数据库"预备扩增预备级;④ Mem0/Letta/Zep 产品矩阵 ⚠⚬ = 与 v104 §2.2 Tiered Memory 选型决策树沿用稳态;⑤ AI Database 2026 选型矩阵 ⚠⚬ = 与 v104 §2.2 沿用 + Memory / RAG / Knowledge 栖栖数据库栖候选
- 与活文档现有脉络关系:v104 §1.5 Multi-Agent Harness 八向 + v104 §1.7 Memory 九向谱系 + v104 §2.2 Agent Memory 第 9 栖候选 + v105 §1.5 v104 Multi-Agent Harness 八向 → v105 九向预备扩增稳态(AgentKernel Trust-Native Agentic OS 作为第九向栖候选 ⚠⚬)+ v105 §1.7 v104 Memory 九向谱系 → v105 十向谱系预备扩增预备级(Cognee Graph-First Self-Improving Memory 作为第十栖 + OpenViking 自演进上下文数据库作为第十一栖预备扩增预备级 ⚠⚬)+ v105 §2.X Agent OS / Harness / Memory 栖 3 件新增候选节新增(AgentKernel + Cognee + OpenViking + Mem0/Letta/Zep 矩阵 + AI Database 2026 选型矩阵 ⚠⚬)
- 建议归入节:v105 §1.5 v104 Multi-Agent Harness 八向 → v105 九向预备扩增稳态(AgentKernel Trust-Native Agentic OS 作为第九向栖候选 ⚠⚬)+ v105 §1.7 v104 Memory 九向谱系 → v105 十向谱系预备扩增预备级(Cognee Graph-First Self-Improving Memory 作为第十栖 + OpenViking 自演进上下文数据库作为第十一栖预备扩增预备级 ⚠⚬)+ v105 §2.X Agent OS / Harness / Memory 栖 3 件新增候选节新增(AgentKernel + Cognee + OpenViking + Mem0/Letta/Zep 矩阵 + AI Database 2026 选型矩阵 ⚠⚬)
- 可信度:⭐⭐⭐⭐ 高(AgentKernel 已 anchor paper_card 1518 ✓ + Cognee 官方博客 + OpenViking GitHub + Mem0/Letta/Zep 产品矩阵已 anchor + 与 v104 §1.5 + §1.7 + §2.2 承接稳态)
- 待核验:① AgentKernel Trust-Native Agentic OS 的工程成熟度(OpenAlex 被引 0);② Cognee 90% vs 60% RAG 准确率 claim 评测条件未注明;③ OpenViking 火山引擎自演进上下文数据库的工程成熟度与生产案例
增量 5 · 🟠【Agent 安全栖 + OWASP MCP Top 10 + Agent Guardrails 独立化 ⚠⚬⚬】jay 9-28 T1450 AI Agents Stack 2026 §2.1-§2.3 + Cursor 90min continuous eval = Agent 安全栖双锚预备扩增预备级
- 来源:jay 9-28 T1450 engineering-filter-afternoon-reproduction §2.1-§2.5(AI Agents Stack 2026 O'Reilly/Substack ★本棒关键承接★ ⚠⚬⚬⚬)+ jay 9-28 1737 ai-engineering-rag-agents(DEV Community Reliable LLM Agent + Agent Harness Loop ⚠⚬)+ jay 9-28 T1620 csdn-sglang-amd-mcp-platforms-pdf-rag §B(MCP 9 平台配置差异与凭证安全 ⚠⚬)+ v104 §1.6 frontier lab 治理公开化 37 → 42 源件套扩增稳态 + v104 §2.5 frontier lab 治理 37 → 42
- 要点:
1. Agent Guardrails 已成为独立于 LLM Guardrails 的工程领域 ⚠⚬⚬⚬ = 2024 年的 guardrails 是对模型 I/O 的事后过滤;2026 年必须做事前授权(authorize before calling)和事后验证(validate what the agent did)+ 工具执行层的 guardrails 优先级已高于输出层过滤
2. "Guardrails before Action" 模式成为生产共识 ⚠⚬⚬ = 团队吸取教训后,现在在工具执行层(而非输出层)强制授权 = 等你在响应层过滤时,agent 已经执行了操作(发送邮件、转账等)
3. OWASP MCP Top 10(Beta)发布 ⚠⚬⚬ = 首个针对 MCP 工具连接型 Agent 的安全检查清单 + 主要覆盖恶意工具描述注入 / 未授权工具调用 / MCP 服务器权限逃逸 = MCP 安全从"没有标准"进入"有 checklist 可循"阶段,但落地实施仍由各团队 DIY
4. A2A + MCP 是互补协议,不是竞争关系 ⚠⚬ = A2A = Agent-to-Agent 协调层(委托、编排)+ MCP = Tool/数据访问层(工具调用、外部数据源)+ 典型模式:同一 agent 对上用 A2A 协调,对下用 MCP 调用工具
5. Cursor 的 Continuous Eval 实践 ⚠⚬ = Cursor retrains its acceptance-rate model every 90 minutes based on whether users accept or reject suggestions + Eval 不再是一次性离线评估,而是生产环境持续运行:每 90 分钟根据用户接受/拒绝行为重新训练接受率模型 = 2026 年"Continuous Improvement Loop"的典型案例
6. MCP 9 平台配置差异与凭证安全 ⚠⚬ = Claude Desktop
~/.claude/settings.json+ Claude Code~/.claude/mcp.json(官方明确此路径不读取)+ Cursor~/.cursor/mcp.json+ VS Codesettings.json+ Windsurf~/.windsurf/mcp.json+ OpenClaw~/.openclaw/mcp.json= MCP Server 四类来源:官方参考实现 / 社区开源 / SaaS 官方 / 自研 + 敏感凭证安全姿势 + Node.js ≥18 要求 + 7 个 Server 同时运行最佳,超过 10 个 LLM 选择工具时会犹豫 7. Gartner 数据引用 ⚠⚬ = 2026 年底 40% 企业应用将包含任务专用 AI Agent(2025 年不到 5%)+ Goldman Sachs:AI 实施后交易量增长 30% + Visa:交易处理时间缩短 50% 8. MCP 2026-07-28 无状态化重大版本(v104 §2.5 已 anchor)沿用 ⚠⚬⚬⚬⚬ = 移除 Mcp-Session-Id + Multi Round-Trip Requests + Header-based 路由 + MCP Apps 扩展 + 30+ CVEs 瞄准 MCP - 关键警示 ⚠⚬⚬:① Agent Guardrails 独立化 ⚠⚬⚬⚬ = 与 v104 §1.6 + §2.5 frontier lab 治理公开化 37 → 42 源件套扩增稳态协同 = Agent 安全栖双锚预备扩增预备级;② OWASP MCP Top 10(Beta)发布 ⚠⚬⚬ = 与 MCP 2026-07-28 无状态化重大版本协同 = MCP 安全从"没有标准"进入"有 checklist 可循"阶段;③ A2A + MCP 互补关系 ⚠⚬ = 澄清多 Agent 系统拓扑 = 与 v104 §1.6 + §2.5 协同;④ Cursor 90min continuous eval ⚠⚬ = 2026 年"Continuous Improvement Loop"的典型案例 = 与 v104 §2.4 Jev 决策生态 + Eval 持续化协同;⑤ MCP 9 平台配置差异与凭证安全 ⚠⚬ = OpenClaw
~/.openclaw/mcp.json与本次任务实例直接相关,建议优先实测核验路径 - 与活文档现有脉络关系:v104 §1.6 frontier lab 治理公开化 37 → 42 源件套扩增稳态 + v104 §2.5 frontier lab 治理 37 → 42 + v105 §1.6 v104 frontier lab 治理公开化 37 → 42 → v105 47 源件套扩增稳态(Agent Guardrails 独立化 + OWASP MCP Top 10(Beta)+ Cursor 90min continuous eval + MCP 9 平台配置差异与凭证安全作为新增 5 源件 ⚠⚬⚬)+ v105 §2.5 v104 frontier lab 治理 37 → 42 → v105 47 源件套扩增稳态(同上 ⚠⚬⚬)+ v105 §2.X Agent 安全栖 + OWASP MCP Top 10 + Agent Guardrails 独立化节新增(Guardrails before Action + OWASP MCP Top 10(Beta)+ A2A + MCP 互补 + Cursor 90min continuous eval + MCP 9 平台配置差异 ⚠⚬⚬)
- 建议归入节:v105 §1.6 v104 frontier lab 治理公开化 37 → 42 → v105 47 源件套扩增稳态(Agent Guardrails 独立化 + OWASP MCP Top 10(Beta)+ Cursor 90min continuous eval + MCP 9 平台配置差异与凭证安全作为新增 5 源件 ⚠⚬⚬)+ v105 §2.5 v104 frontier lab 治理 37 → 42 → v105 47 源件套扩增稳态(同上 ⚠⚬⚬)+ v105 §2.X Agent 安全栖 + OWASP MCP Top 10 + Agent Guardrails 独立化节新增(Guardrails before Action + OWASP MCP Top 10(Beta)+ A2A + MCP 互补 + Cursor 90min continuous eval + MCP 9 平台配置差异 ⚠⚬⚬)
- 可信度:⭐⭐⭐⭐ 高(jay 9-28 T1450 AI Agents Stack 2026 O'Reilly/Substack + jay 9-28 T1620 csdn MCP 9 平台配置 + 与 v104 §1.6 + §2.5 frontier lab 治理公开化 37 → 42 源件套扩增稳态承接稳态)
- 待核验:① Agent Guardrails 独立化的具体落地案例;② OWASP MCP Top 10(Beta)与 MCP 2026-07-28 无状态化重大版本的协同关系;③ Cursor 90min continuous eval 的具体生产数据;④ MCP 9 平台配置差异与 OpenClaw
~/.openclaw/mcp.json路径实测核验
矛盾 / 待核 1 · ⚠ Cognee 90% vs 60% RAG 准确率 claim 评测条件未注明
- 问题:Cognee 官方博客宣称 Graph-enhanced 查询准确率约 90% vs plain RAG 约 60%,但评测条件未注明(数据集 / 任务类型 / 模型 / 评测协议)
- 建议核实:对照独立 benchmark 数据(Mem0 vs 朴素 RAG vs Full context 量化对比 KTH IEEE COMPSAC 2026 81.1% vs 78.3% vs 77.2% + GraphRAG ~56%)
- 可信度:⭐⭐ 中(官方博客,自评数据,需对照独立 benchmark)
二、可引用的 arXiv 号列表(本棒位新发现 · 24 件 · 按主题分组)
KV Cache 系统(11 件 · ★本棒核心新增★)
arXiv:2511.02230v7Continnum · VLDB 2026 · End-of-Turn KV Cache 驱逐缺陷arXiv:2604.03143TokenDance · 同步轮次多 Agent KV 共享arXiv:2604.24971PolyKV · 非对称压缩 KV Cache 共享池arXiv:2603.04428Edge Multi-Agent Q4 KV Persistence · Apple M4 ProarXiv:2603.20397KV Cache 优化策略系统综述arXiv:2605.17613VeriCache · Lossy KV Cache → 无损推断arXiv:2608.01526v1An Internet for the KV Cache · first-class primitivearXiv:2608.01526v1IETF CATS KV Cache Distribution 草案 · draft-li-cats-kv-cache-distribution-00arXiv:2510.09665LMCache · KV Cache Layer for Enterprise LLM Inference · MLSys 2026- HotPrefix · ACM SIGCOMM 2026
- KVServe Service-Aware KV Cache Compression · ACM SIGCOMM 2026
Agent 评测(5 件 · 本棒关键承接)
arXiv:2609.23551hRoPE Paragraph Boundaries Are Not White SpacearXiv:2609.29167IndicBankBench Evaluating Safety and Reliability of LM Assistants in Indian Retail BankingarXiv:2607.20468InferenceBench · AI Agent 自主优化 LLM 推理服务- Context-Bench · Substack AI Agent Stack 2026
- Recovery-Bench · Substack AI Agent Stack 2026
- Terminal-Bench · Substack AI Agent Stack 2026
Agent OS / Harness / Memory 栖(3 件 · 增量 4)
arXiv:2609.29647AgentKernel · Trust-Native Agentic OS · paper_card 1518 ✓- Cognee · Graph-First Agent Memory Layer · cognee.ai
- OpenViking · 火山引擎自演进上下文数据库 · volcengine/OpenViking
Agent 安全(2 件 · 增量 5)
- OWASP MCP Top 10(Beta)· jay 9-28 T1450 AI Agents Stack 2026 §2.3
- MCP 2026-07-28 无状态化重大版本(沿用 v104 §2.5)
邻接 · 推理引擎 + Multi-Agent Harness(3 件 · 增量 2 邻接)
arXiv:2609.31093PISA · Block Sparse Attention with Log-Linear Complexity · paper_card 1528 ✓arXiv:2609.31590AgentWorld · Benchmarking Long-Horizon Collaboration of Multi-agent LLMs · paper_card 1529 ✓arXiv:2602.19594ISO-Bench · Coding Agents optimize real-world inference
三、本棒位无显著新增量的领域(如实报告 · 不硬凑字数)
- RAG 主分类 paper_card 入库 0 件:9-28 批次 1530-1535 中无 RAG 主分类,沿用 v104 §2.3 Coding-Agent 检索策略变迁预备扩增稳态
- frontier lab 治理公开化 37 → 42 源件套:v104 §1.6 + §2.5 已 anchor 42 源件套,本棒位新增 5 源件候选(详见增量 5),v105 §1.6 + §2.5 应升格至 47 源件套
- Coding Agents for TAMP:work-queue 9-28 唯一未成视频脚本项
2609.30233,仍待 flyp P0 7 项验证动作 9-28 evening 棒位前补全(沿用 v104 §2.8) - Jev 决策生态落地信号密度上升:v104 §2.4 已 anchor Jev in the Wild
arXiv:2609.30216paper_card 1531 ✓,本棒位无新增量,沿用稳态
v105 · 2026-09-28 evening · Stephen · E1 日间预消化轮(llm-application) · 5 件主增量 + 1 件矛盾/待核 · 立标池第 11 次预备触发承接稳态 + KV Cache 多轮 Agent 调度三栖并发成熟 + Agent 评测体系 3 件 + Agent OS / Harness / Memory 栖 3 件新增候选 + Agent 安全栖 + OWASP MCP Top 10 + arXiv 24 件新发现引用清单 · 反思棒第 70 例 + 监控第 77 次 + 概率 0.9999~1.0