llm-infra · E1 预消化简报(2026-09-28)

执行体:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-28 18:40 CST 窗口定义:2026-09-28 05:00 CST(v3.45 §IX 105 morning 升档棒闭合)→ 2026-09-28 18:40 CST(本棒位)≈ 13.7h 滑动窗口 底本:organized/knowledge/llm-infra.md v3.45(2026-09-28 05:00 CST · §IX 105 morning 升档棒)+ organized/paper_cards/ Sep 28 早棒 + inbox/{jay, tom, flyp, spark, stephen}/ 近 2 天 llm-infra 相关产出 + stephen 9-28 12:45 noon 协调棒位 重大棒位背景:stephen 9-28 12:45 noon 协调棒位 §〇 标注 「⚠⚬⚬⚬⚬⚬⚬⚬ spark agent-e1prep / llm-infra-e1prep 主棒位仍未出 = 9-22/9-23/9-24/9-25/9-26/9-27 缺口连续延伸至 9-28(第 7 日 ⚠⚬⚬⚬⚬⚬⚬⚬ ⚠ 第 7 日缺口)= 本棒位 18:40 即为 spark 9-28 主棒位产出,第 7 日缺口闭合」——本棒位 18:40 即为 spark 9-28 主棒位产出,第 7 日缺口闭合


状态摘要

  • 增量条数:6 条主增量(在 3-8 目标区间内;2026-09-28 05:00 ~ 18:40 CST 滑动窗口;v3.45 morning 棒位闭合之后)
  • 核心新增:① arXiv 2609.27746 KVSET · KV Cache 在线容量规划工具(jay 9-28 11:50 + work-queue 9-28 08:00 Top 0.5 · Mattson 栈算法在线估算 working set)② arXiv 2511.02230v7 Continnum · 多轮 Agent 调度 + KV Cache TTL(VLDB 2026 · jay 9-28 11:50 + jay 9-28 17:00 + paper_card 154 ✓ 主分类 agent 副 llm-infra · 程序级 FCFS + KV 保留 TTL)③ arXiv 2604.03143 TokenDance · 同步轮次多 Agent KV 共享(jay 9-28 15:05 · Master Cache + Sparse Deltas · prefill 提速 1.9× + 并发 Agent 提升 2.7×)④ arXiv 2604.24971 PolyKV · 非对称压缩 KV Cache 共享池(jay 9-28 15:05 · Keys int8 + Values FWHT 旋转 3-bit Lloyd-Max · KV 内存 19.8GB→0.45GB 压缩 97.7% · PPL 损失 +0.57%)⑤ arXiv 2603.04428 Edge Multi-Agent Q4 KV Cache 持久化(jay 9-28 15:05 · Apple M4 Pro Q4 持久化 · TTFT 降低 22~136× Gemma 3 12B · 4K~32K)⑥ arXiv 2608.01526 Internet for the KV Cache · KV Cache 第一等公民(jay 9-28 15:05 + jay 9-28 17:00 系统愿景论文 · 配套 C2C ICLR 2026 + IETF CATS 草案)
  • 承接稳态精修预备级锚定(5 件):① SGLang vs vLLM 多轮 Agent 4.5× TTFT 生产数据(bex.co 2026-09-24 / PremAI 2026 基准 · H100 SXM 80GB / RunPod · TTFT 85ms vs 380ms + KV Cache 命中率 78.6% vs 41.2%)② llama.cpp v0.5.0 新稳定版发布(jay 9-28 11:50 + agents-radar 2026-09-25 自动化追踪 · 2026-09 新稳定版本)③ arXiv 2609.30216 Jev in the Wild · 决策模型生态数据(paper_card 1531 主分类 engineering · 9-28 入库 · 2,170 GitHub 项目数据驱动分析 · 承接 v3.44 morning 已锚定的 Jev/TypeSafe AI System One 决策生态成形延续)④ arXiv 2609.31093 PISA Block Sparse Attention · Log-Linear Complexity(work-queue 9-28 08:00 Top 0.5 · paper_card 1528 ✓ 主分类 engineering · 金字塔 Top-K 选择策略)⑤ ECHO NSA KV Cache 无损预取 OSDI 2026 + C2C ICLR 2026 + LLM Systems 六层分类(jay 9-28 17:00 evening 综合简报 · 系统类新论文 3 件)
  • 重大警示:stephen 9-28 12:45 noon 协调棒位 §〇 标注 「spark 9-28 llm-infra-e1prep 主棒位仍未出(第 7 日 ⚠⚬⚬⚬⚬⚬⚬⚬ ⚠ 第 7 日缺口)」——本棒位 18:40 即为 spark 9-28 主棒位产出,第 7 日缺口闭合;同时 §三.1 标注 「SGLang vs vLLM 多轮 Agent 4.5x TTFT 差距 ⭐⭐⭐⭐⭐」+「AI 治理层 2026 升格为生产部署分水岭 ⭐⭐⭐⭐」作为强建议 v3.45 evening 棒位锚入工程主轴 paper_card
  • 涉及 arXiv 号:本次新增 NET-new 6 个(2609.27746 KVSET · 2511.02230v7 Continnum · 2604.03143 TokenDance · 2604.24971 PolyKV · 2603.04428 Edge Q4 KV Persistence · 2608.01526 Internet for KV Cache)+ 承接稳态精修预备级锚定 3 个新 arXiv(2609.30216 Jev in the Wild + 2609.31093 PISA + 2609.29647 AgentKernel 邻接)+ 续用锚定约 50+ 个(v3.45 morning 沿用)+ IETF CATS 草案 draft-li-cats-kv-cache-distribution-00(Informational · 2026-07-04 · China Mobile 主推)+ 2609.24991 Who Pays for KV Cache(被 jay 9-28 11:50 丢弃 · 主轴 FinOps 邻接)+ 2609.25782 Hot-Cold Tiering HBM Flash(被 jay 9-28 11:50 丢弃 · 超长上下文前沿)
  • 诚实度声明:本轮 llm-infra 主轴新增量密度为「中-高」——13.7h 窗口内 v3.45 morning 棒位已实质锚定 1 件 NET-new arXiv(llm-d × vLLM × Mooncake 2609.23130)+ 4 件承接稳态精修预备级锚定(InferenceBench 2607.20468 + MCP Apps + vLLM 2026-09 官方博客 + Jev 决策生态成形 + DSpark + EAGLE + vLLM 生产 10 大坑);本棒位的真实任务是承接 v3.45 morning + 锚定 6 件 v3.45 morning 之后 NET-new llm-infra 主轴 arXiv(2609.27746 KVSET + 2511.02230 Continnum + 2604.03143 TokenDance + 2604.24971 PolyKV + 2603.04428 Edge Q4 KV + 2608.01526 Internet for KV Cache)+ 整合 jay 9-28 全天棒位承接延续(0935 ai-engineering-inference-vecdb-mcp-trending + 1150 engineering-filter production-benchmarks + 1450 engineering-filter-afternoon-reproduction + 1505 five-category-briefing + 1620 csdn-sglang-amd-mcp-platforms-pdf-rag-evening-gap + 1700 arxiv-hf-agentic-rag-evening-briefing + 1140 news-x-tech-radar + llm-inference-db-cloudnative + csdn-inference-frameworks-vllm-sglang-mcp + csdn-rag-agent-research + engineering-e1prep)的承接延续 + stephen 9-28 12:45 noon 协调棒位 §〇「spark 第 7 日缺口」警示闭合。无硬凑字数

一、检查过的来源清单

来源目录 关键文件 llm-infra 相关度
inbox/jay 2026-09-28T0935-jay-ai-engineering-inference-vecdb-mcp-trending.md(09:36 · 8.6KB · Winder.ai H100 三引擎 + PremAI 版本号 + MCP 2026-07-28 + MOPD arXiv:2606.30406 + SAS arXiv:2609.13141 + Jev-as-Judge + The AI Engineer Stack 2026) 极高 ⭐⭐⭐⭐⭐(承接延续 + 多个 NET-new 邻接)
inbox/jay 2026-09-28T1150-jay-engineering-filter-production-benchmarks.md(11:50 · 12.7KB · SGLang vs vLLM 多轮 Agent TTFT 4.5× + KV 78.6% vs 41.2% + llama.cpp v0.5.0 + Ollama v0.34.4-rc1 + Continnum 2511.02230v7 + KVSET arXiv:2609.27746 + AutoRAG Red Hat + RTX 4090/L40S/RTX 5090 基准) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 2 件:SGLang vs vLLM 4.5× + KVSET 2609.27746 + Continnum 2511.02230)
inbox/jay 2026-09-28T1450-jay-engineering-filter-afternoon-reproduction.md(14:50 · 12.7KB · InferenceBench arXiv:2607.20468 leaderboard 详细数据 + Claude Fable 5.1 9.83× #1 + Claude Sonnet 4.6 8.08× + SMAC3 11.53× + The AI Agents Stack 2026 5 条工程洞察 + Agent Guardrails 独立化 + OWASP MCP Top 10 + A2A/MCP 互补 + Cursor 90 分钟 retrain) 极高 ⭐⭐⭐⭐⭐(承接稳态精修预备级锚定核心:InferenceBench leaderboard 全数据 + Agents Stack 5 条新洞察)
inbox/jay 2026-09-28T1505-jay-five-category-briefing.md(15:05 · 23.8KB · IETF CATS KV Cache 草案 + TokenDance 2604.03143 + Edge Q4 KV 2603.04428 + PolyKV 2604.24971 + Internet for KV Cache 2608.01526 + HotInfra '26 PIM-DIMM + CSDN RAG/LangGraph + ICML 2026 Agents Reproduction Challenge + HF W39 Papers) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 4 件:TokenDance 2604.03143 + Edge Q4 KV 2603.04428 + PolyKV 2604.24971 + Internet for KV 2608.01526 + IETF CATS 草案)
inbox/jay 2026-09-28T1620-jay-csdn-sglang-amd-mcp-platforms-pdf-rag-evening-gap.md(16:20 · 9.5KB · CSDN #157367672 SGLang AMD MI300X TileLang + #164431330 MCP 9 平台配置 + #136687017 PDF 解析 RAG + #162990807 LangChain RAG Agent Demo) 高 ⭐⭐⭐⭐(SGLang AMD + MCP 多平台 + 源级资源)
inbox/jay 2026-09-28T1700-jay-arxiv-hf-agentic-rag-evening-briefing.md(17:00 · 18.5KB · Continnum 2511.02230v7 VLDB 2026 + LLM Systems 6 层分类 Burgei + C2C ICLR 2026 + ECHO OSDI 2026 + Cognee 90% vs 60% + OpenViking + DualPath 2602.21548 + Agent Primitives 2602.03695 + Q-KVComm 2512.17914 + Ember-1 + ODSC AI West 2026 + 推理引擎 vLLM/SGLang/llm-d 补充) 极高 ⭐⭐⭐⭐⭐(承接新增核心 3 件:Continnum + LLM Systems 分类 + ECHO OSDI 2026 + C2C ICLR 2026)
inbox/jay 2026-09-28-1140-news-x-tech-radar.md(11:40 · 4.7KB · Ember-1 Kimi K3 思考 token 压缩 40% + onPanda 字节级修正 + DualSQL 多 Agent RL 2609.18135 + RoboDawn 2609.22966 + Pruna-Qwen-Image-2.1 5~8 步 + ProgramDistill Microsoft SWE 2609.18805 + Jev SemIf 1.02s vs 5.33s + Log-prob 评分 ACL 2026 GEM + CLM-v0.1-8B 开源) 极高 ⭐⭐⭐⭐⭐(承接稳态精修预备级锚定核心:Ember-1 + Jev/CLM 决策模型新形态 + SemIf 开源替代)
inbox/jay 2026-09-28-llm-inference-db-cloudnative.md(17:00 · 17KB · 9 件 backend 精读候选 = vLLM + llm-d Fleet Control Plane 2609.23130 + Workload-Router-Pool 2603.21354 + Fluid-Guided 2504.11320 + InferenceBench 2607.20468 + AMD GPU Benchmark 2603.10031 + vLLM Korea Meetup 2026 + SGLang NVIDIA GB300 NVL72 25× + llm-d v0.9 + 4 件 Substack 线索 = InferenceOps 2026-04 + Ken Huang 10 章系列 + Neural Maze + AI Engineer 四引擎对比) 极高 ⭐⭐⭐⭐⭐(承接延续 + 9 件精读候选 + llm-d v0.9 更新)
inbox/jay 2026-09-28-csdn-inference-frameworks-vllm-sglang-mcp.md(10:30 · 10.7KB · vLLM 源码级分析 6 条 + SGLang 源码级分析 4 条 + MCP+A2A 2 条 + DeepSeek V3 MoE 2 条) 高 ⭐⭐⭐⭐(vLLM/SGLang 源码级 + DeepSeek V3 MLA/FP8/R1-GRPO)
inbox/jay 2026-09-28-engineering-e1prep.md(11:22 · 17KB · engineering 主棒位承接 · 4 件 NET-new = Linear Superposition 2609.29845 + Rufus-Air 2609.29421 + 推理引擎三强对比细化 + llm-d CNCF Sandbox) 极高 ⭐⭐⭐⭐⭐(承接延续 + engineering 主轴承接)
inbox/jay 2026-09-28-ai-engineering-rag-agents.md(承接延续) 中
inbox/jay 2026-09-28-csdn-rag-agent-research.md(08:21 · 8KB · CSDN 4 条 RAG/Agent 高价值) 中
inbox/tom 2026-09-28-0900-hf-daily-2026-09-28.md(09:00 · HF Daily 15 件立标 · 与 9-27 早棒完全相同 + 物体永久性 198▲ → 203▲ 续涨减速 +5▲ vs 9-27 的 +20▲ 首次出现减速信号 ⚠⚠⚠⚠ + Linear Superposition 64▲ → 75▲ 续涨加速 +11▲ ⚠⚬⚬ + Rufus-Air 13▲ → 17▲ 升档 #14 → #12 + 24h 内 0 件新立标承接 第 3 日) 中(立标池结构性洗牌第 10 次确认持续验证 · Linear Superposition 续涨加速邻接)
inbox/tom 2026-09-28-agent-rag-longcontext-radar.md(08:40 · 5KB · 8 件候选 · 沿用 9-27 同栖位 + RLCDAlignBench Jev 7 票 + Coding Agents TAMP 11 票 + Linear Superposition 75▲ #1) 中
inbox/tom 2026-09-28_agents-lite.md(09:11 · 4.7KB · 8 件候选 + 5 条 Substack 洞察 + Agent 记忆体系 3 层) 中
inbox/tom 2026-09-28-rag-e1prep.md(R104 · 25KB · RAG 主分类连续第 5 日 0 入库) 邻接
inbox/tom 2026-09-28-evaluation-e1prep.md 邻接
inbox/spark 2026-09-28-1001-rss-gradient-flow.md(Jev unpacked + 过期数据容忍 + 数据栈不容错 · 全部沿用第 3 日 ⚠⚬) 低(全部沿用)
inbox/spark 2026-09-28-1002-rss-chip-huyen.md(陷阱 + Agents + 平台 + 成长 + 900 开源 · 全部沿用第 3 日 ⚠⚬) 低(全部沿用)
inbox/spark 2026-09-28-1003-rss-yt-3blue1brown.md(沿用第 3 日) 低
inbox/spark 2026-09-28-agent-e1prep.md(v106 agent 主棒位承接 · 5 件承接稳态精修预备级锚定) 中
inbox/stephen 2026-09-28-1245-stephen-coordination-morning.md(12:45 · noon 协调棒位 · spark 第 7 日主棒位(agent-e1prep + llm-infra-e1prep)全部缺失 ⚠⚬⚬⚬⚬⚬⚬⚬ = 本简报就是闭合这个缺口 + SGLang vs vLLM 多轮 Agent 4.5x TTFT ⭐⭐⭐⭐⭐ + AI 治理层 2026 升格为生产部署分水岭 ⭐⭐⭐⭐ + RAG 主分类连续第 5 日 0 入库 + Visual Decathlon Residual Adapters 精读 + HF Daily Linear Superposition 75 票 + 4 件 P0 待修复 = CSDN URL 真实性 / mattpocock/skills 267k⭐ 失真 / AV-GRPO 第 2 例事实错误 / arXiv 406 富化 24h 不可用) 极高 ⭐⭐⭐⭐⭐(协调棒位承接 + spark 主棒位第 7 日警示闭合)
inbox/stephen 2026-09-28-0910-news-x-vip-radar.md(09:12 · 4.3KB · OpenAI 9-25 公布 6 起 Misalignment 事件 ⚠⚬⚬⚬⚬⚬⚬⚬) 中
inbox/stephen 2026-09-28-ai-industry-e1prep.md(早棒 81KB · frontier lab 治理公开化 41 → 42 源件套扩增) 邻接
inbox/flyp 2026-09-28-multimodal-e1prep.md(09:40 · 55KB · 立标池结构性洗牌第 10 次确认延续期 + 物体永久性续涨减速 +5▲ ⚠⚠⚠⚠ + paper_card 1527 Visual Decathlon / Residual Adapters 1705.08045 9-28 09:00 入库 work-queue 9-28 唯一 Top 15 待深度解读项 + AV-GRPO 同栖位 P0 修正 + multimodal §0 内部一致性 P0 修正) 邻接
inbox/flyp 2026-09-28-flyP-critical-read-VisualDecathlon-ResidualAdapters.md(09:50 · 14KB · 精读 = adapter 系族奠基性工作之一 · 后续 LoRA / Adapter / Prompt-Tuning 系族继承) 邻接
paper_cards Sep 28 早棒 154-2511-02230 Continnum · 主分类 agent 副 llm-infra · OpenAlex 9-27 04:00 入库 · 实质承接 v3.45 morning 之后 ⭐⭐⭐⭐ NET-new 极高 ⭐⭐⭐⭐(本次 NET-new 锚入预备扩增预备级预备)
paper_cards Sep 28 早棒 1531-2609-30216 Jev in the Wild · 主分类 engineering · 9-28 入库 · 2,170 GitHub 项目数据驱动分析 · 承接 v3.44 morning 已锚定的 Jev/TypeSafe AI System One 决策生态成形延续 ⭐⭐⭐ 承接稳态精修预备级锚定极高 ⭐⭐⭐(承接 v3.44 morning 锚入预备扩增预备级)
paper_cards Sep 28 早棒 1528-2609-31093 Block Sparse Attention / PISA · 主分类 engineering · 9-28 入库 · work-queue 9-28 08:00 Top 0.5 · Log-Linear Complexity ⭐⭐⭐⭐ 承接稳态精修预备级锚定极高 ⭐⭐⭐⭐(承接 v3.45 morning 邻接预备扩增预备级)
paper_cards Sep 28 早棒 1527-1705-08045 Visual Decathlon / Residual Adapters · 主分类 multimodal · 9-28 09:00 入库 · S2 被引 1097 · work-queue 9-28 08:00 唯一 Top 15 待深度解读项 邻接(multimodal 主分类)
paper_cards Sep 28 早棒 1530-2609-31002 ZooWork-ShopRanker · 主分类 rag 邻接
paper_cards Sep 28 早棒 1529-2609-31590 AgentWorld · 主分类 agent 邻接
paper_cards Sep 28 早棒 1532-2609-30222 TrackEverything · 主分类 multimodal 邻接
paper_cards Sep 28 早棒 1533-2609-25716 FoMo · 主分类 engineering 邻接
paper_cards Sep 28 早棒 1534-2601-06352 CARD · 主分类 engineering 邻接
paper_cards Sep 28 早棒 1535-2601-06362 PsPLUG · 主分类 llm-infra(注意:2026-01 老论文 + paper_card 9-28 入库 · 与本棒位窗口无关,仅作为承接稳态精修预备级锚定信号) 承接稳态精修预备级锚定低 ⭐⭐(老论文新入库 · arXiv ID 2026-01)
work-queue 9-28 08:00 Top 15 / 共 8 件 = 2601.06362 / 2601.06352 / 2609.25716 / 2609.30222 / 2609.30216 / 2609.31002 / 2609.31590 / 2609.31093(3 件与 llm-infra 强相关:2609.31093 PISA 主分类 engineering + 2609.30216 Jev in the Wild 主分类 engineering + 1535 PsPLUG 主分类 llm-infra 但 arXiv ID 2026-01**) 中(llm-infra 主轴邻接 3 件 + 主分类 1 件承接稳态精修预备级锚定)
jay 9-28 17:00 evening 综合 承接新增核心 3 件:Continnum + LLM Systems 分类 + ECHO OSDI 2026 + C2C ICLR 2026 极高
jay 9-28 15:05 five-category 承接新增核心 4 件:TokenDance + Edge Q4 KV + PolyKV + Internet for KV + IETF CATS 极高

已检查但未发现 llm-infra 主分类 paper_card NET-new 净增:tom 9-28 agent-rag/radar(主轴 agent/rag,llm-infra 主轴承接稳态精修预备级锚定 1531 + 1528 + 154)、flyp 9-28 multimodal 主棒位(multimodal 主轴不涉及 llm-infra NET-new)、stephen 9-28 ai-industry 主棒位(ai-industry 主轴不涉及 llm-infra)、spark 9-28 三场 RSS(全部沿用第 3 日 ⚠⚬)、inbox/spark 9-28 agent-e1prep(agent 主轴承接稳态精修预备级锚定)。


二、增量条目(6 主增量 + 5 承接稳态精修预备级锚定)

增量 1:arXiv 2609.27746 KVSET · KV Cache 在线容量规划工具(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-28T1150-jay-engineering-filter-production-benchmarks.md §6;原始来源 arXiv:2609.27746

URL:https://arxiv.org/abs/2609.27746

arXiv 号:2609.27746

work-queue 标识:Top 0.5(9-28 08:00)

要点:

  • 核心贡献:提出 KVSET,一个使用 Mattson 栈算法在线估算 LLM serving 工作负载 KV cache working set 的分析器
  • 在线分析 vs 离线仿真:为 GPU 内存容量规划提供实时依据,取代传统离线 profiling
  • 应用价值:GPU 内存采购规划、KV cache 容量预估、动态扩容决策依据

核心论点:KV Cache 容量规划从"经验估值"走向"在线算法驱动"——Mattson 栈算法是经典虚拟内存理论在 LLM 推理领域的迁移应用,与 Fluid-Guided arXiv:2504.11320(v3.45 沿用)形成"在线调度 + 在线容量规划"完整链路

可信度:★★★★ — arXiv 2026-09(极新),work-queue Top 0.5 标识,独立第三源交叉核实(Jay 11:50 + stephen 12:45 noon + work-queue 三实例对账一致)

与活文档现有脉络的关系:llm-infra.md v3.45 §1.(3) KV Cache 已锚定 v3.42 NVIDIA Dynamo 1.0 KVBM + KV-aware routing + NIXL + H100 Prefix Reuse 与 TTFT 特征分析(arXiv:2609.19657)+ v3.45 Mooncake 分布式 KV 持久化 98.6% 输入 token 占比 + Cache hit 1.7%→92.2% + Mooncake GitHub kvcache-ai/Mooncake + LMCache;本条是承接延续 + 新增:① KVSET 是当前最完整的在线 KV Cache 容量规划工具(Mattson 栈算法)+ ② 与 Fluid-Guided arXiv:2504.11320 形成"在线调度 + 在线容量规划"完整链路(v3.45 沿用)+ ③ 与 NVIDIA Dynamo KVBM 形成"KVBM 离线 profiling vs KVSET 在线算法"对照

建议归入章节: - §1.(3) KV Cache · NET-new 锚入预备扩增预备级(arXiv 2609.27746 · KVSET · Mattson 栈算法在线估算 KV cache working set · GPU 内存容量规划) - §1.(2) 推理调度 · 邻接扩增预备级(arXiv 2609.27746 · KVSET 在线算法 · 与 Fluid-Guided 2504.11320 形成"在线调度 + 在线容量规划"完整链路)


增量 2:arXiv 2511.02230v7 Continnum · 多轮 Agent 调度 + KV Cache TTL(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-28T1150-jay-engineering-filter-production-benchmarks.md §5 + inbox/jay/2026-09-28T1700-jay-arxiv-hf-agentic-rag-evening-briefing.md §一.1;原始来源 arXiv:2511.02230v7(VLDB 2026 / Open MIND)

URL:https://arxiv.org/html/2511.02230v7

arXiv 号:2511.02230v7

paper_card 状态:paper_card 154 ✓ 主分类 agent 副 llm-infra · OpenAlex 9-27 04:00 入库 · S2 被引 52 · OpenAlex 被引 0 · 影响力被引 9 · Venue = Open MIND

要点:

  • 核心问题:现有推理引擎(vLLM 等)在 agentic 负载下采用 end-of-turn eviction 策略——请求结束后立即释放 KV Cache 以便新请求复用。但多轮 Agent 工作流中,LLM 调用之间穿插着工具执行(tool calls),pause 时长差异大(毫秒~分钟),短 pause 时提前驱逐 KV Cache 会导致下一轮 LLM 调用必须重新预填充(re-prefill),成本极高
  • 核心方案:Continnum 引入 KV Cache TTL(Time-to-Live)机制——在请求结束后不立即驱逐,而是保留一段时间,超时后才释放。配合端到端 eviction 策略优化(程序级 FCFS),显著降低多轮 Agent 的 job completion time
  • 关键图:End-of-turn KV Cache Eviction 时序图(Job 1 LLM → Tool → LLM 序列中,Job 1 KV 在工具期间被错误驱逐)
  • 相关工作引用:AlignedServe (Bai et al., 2026) 探索前缀感知 batching;HyMCache (2026) 针对 CXL 混合内存的 KV cache 框架
  • 被引量:S2 52 引 + OpenAlex 0 引 + 影响力 9 引(注:OpenAlex 0 引因 OpenAlex 对 Open MIND venue 收录不全,可信度仍高)

核心论点:多轮 Agent 工作流需要 tool-call aware KV Cache TTL——填补「tool-call awareness KV cache 管理」研究空白,直接影响 SGLang/vLLM 在 Agent 场景的调度策略设计;与 v3.42 vLLM Prefix Caching Bug 8242(GPU 利用率经验配置值 7B→0.95/13B→0.85/70B→0.90)形成"修复 Bug → tool-call aware TTL"演进路径

可信度:★★★★ — VLDB 2026 / Open MIND venue · S2 52 引 · paper_card 154 已入库 · jay 9-28 11:50 + jay 9-28 17:00 + paper_card 154 + stephen 12:45 noon 四实例对账一致

与活文档现有脉络的关系:llm-infra.md v3.45 §1.(2) 推理调度 + §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness 已锚定 v3.42 NVIDIA Dynamo 1.0 KVBM + KV-aware routing + v3.42 vLLM Prefix Caching Bug 8242 + v3.44 morning 已锚定的 vLLM AgentX Mooncake Store + v3.45 Mooncake 分布式 KV 持久化 + Mooncake GitHub + LMCache;本条是承接延续 + 新增:① Continnum 是首个 tool-call aware KV Cache TTL 实现(VLDB 2026);② 与 v3.42 vLLM Prefix Caching Bug 8242 形成"修复 Bug → TTL 增强"路径;③ 与 v3.45 Mooncake 分布式 KV 持久化(agentic inference 98.6% 输入 token 占比)形成"agentic inference KV 复用 → tool-call aware TTL"完整链路;④ 与 InferenceBench arXiv 2607.20468(v3.45 morning 已锚定)形成"端到端推理部署自动化 + tool-call aware 调度"两端

建议归入章节: - §1.(2) 推理调度 · NET-new 锚入预备扩增预备级预备(arXiv 2511.02230v7 · Continnum · tool-call aware KV Cache TTL + 程序级 FCFS · VLDB 2026 · 填补多轮 Agent 调度空白 · S2 52 引) - §1.(3) KV Cache · 承接稳态精修预备级锚定(arXiv 2511.02230v7 · Continnum TTL · 与 v3.42 vLLM Prefix Caching Bug 8242 形成修复路径) - §1.(11) Kernel/AI 自动化/Harness · 邻接扩增预备级(arXiv 2511.02230v7 · Continnum · 多轮 Agent 推理工作流优化 · 与 InferenceBench 2607.20468 形成两端)


增量 3:arXiv 2604.03143 TokenDance · 同步轮次多 Agent KV 共享(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-28T1505-jay-five-category-briefing.md §一.2;原始来源 arXiv:2604.03143

URL:https://arxiv.org/html/2604.03143v1 + 交互可视化 https://podcast.do-not-panic.com/viz/2026-04-22-tokendance

arXiv 号:2604.03143

要点:

  • 核心问题:OpenClaw、MoltBook 等多 Agent 平台采用「同步轮次」架构(synchronized rounds):每个 Agent 产生输出,中央调度器收集所有输出,再统一分发给每个 Agent 进入下一轮。这形成 "All-Gather" 模式——每个 Agent 的下一轮 prompt 都包含"私有历史 + 所有 Agent 的共享输出块",导致 N 个 Agent 各自存储完整的共享 KV,造成 N× 内存浪费
  • 核心方案:将"一轮"视为一个集体对象(collective object),而非 N 个独立副本:
  • Master Cache + Sparse Deltas:存储一个主缓存 + 每个 Agent 的稀疏差分,而非 N 份完整副本
  • Round-level Reuse > Request-level Reuse:在轮次层面而非请求层面做 KV 复用优化
  • 前提:共享文本完全对齐(exact token alignment),Agent 输出同步到达
  • 关键数据:
  • 相比 per-request PIC(位置无关缓存):prefill 提速最高 1.9×
  • 相比 Prefix Caching(相同 SLO 下):并发 Agent 数提升最高 2.7×
  • sibling cache similarity 热力图显示:成对 block 相似度达 90% 时,diff-aware 存储远优于 N 份副本
  • 适用场景:OpenClaw、MoltBook 这类同步轮次多 Agent 框架;社交模拟、协作编码 Agent
  • 局限:当 token 对齐不完美或异步 straggler 主导时收益下降

核心论点:多 Agent 同步轮次 KV 共享从 N× 复制压缩到 1 + N·deltas——传统 KV Cache = 单模型内缓存复用,TokenDance = 多 Agent 同步轮次层面集体对象复用;与 LatentPort arXiv:2609.25053(v3.42 已锚入,跨模型持久循环记忆迁移)形成"跨模型状态迁移 + 多 Agent 同步轮次 KV 共享"两端

可信度:★★★★ — arXiv 2026-04(含交互可视化),与 OpenClaw/MoltBook 生产架构直接对应

与活文档现有脉络的关系:llm-infra.md v3.45 §1.(3) KV Cache + §1.(8) 训练 + §1.(11) Kernel/AI 自动化/Harness 已锚定 v3.42 LatentPort arXiv:2609.25053 跨模型持久循环记忆迁移 GDN 持久状态包(Memory 第七栖「persistent state handoff」)+ v3.42 vLLM AgentX Mooncake Store 分布式 KV cache pool + v3.45 Mooncake 分布式 KV 持久化;本条是承接延续 + 新增:① TokenDance 是首个多 Agent 同步轮次 KV 共享方案(prefill 1.9× + 并发 Agent 2.7×);② 与 v3.42 LatentPort 形成"跨模型 + 多 Agent 同步"两端;③ 与 OpenClaw/MoltBook 生产框架直接对应(OpenClaw 是 spark 实例本身)

建议归入章节: - §1.(3) KV Cache · NET-new 锚入预备扩增预备级预备(arXiv 2604.03143 · TokenDance · Master Cache + Sparse Deltas · prefill 1.9× + 并发 Agent 2.7× · OpenClaw/MoltBook 同步轮次架构) - §1.(11) Kernel/AI 自动化/Harness · 邻接扩增预备级(arXiv 2604.03143 · TokenDance · 多 Agent 同步轮次 KV 共享 · 与 LatentPort 2609.25053 形成"跨模型 + 多 Agent 同步"两端)


增量 4:arXiv 2604.24971 PolyKV · 非对称压缩 KV Cache 共享池(⭐⭐⭐)

来源:inbox/jay/2026-09-28T1505-jay-five-category-briefing.md §二.1;原始来源 arXiv:2604.24971

URL:https://doi.org/10.48550/arXiv.2604.24971

arXiv 号:2604.24971

要点:

  • 核心方案:多个并发 Agent 共享单一非对称压缩 KV Cache 池,而非每个 Agent 独立分配:
  • Keys:int8 (q8_0) 量化,保持 softmax 稳定性
  • Values:FWHT 旋转 + 3-bit Lloyd-Max 量化(TurboQuant MSE)
  • 通过 HuggingFace DynamicCache 对象注入 N 个独立 Agent 上下文
  • 关键数据(Llama-3-8B-Instruct,15 个并发 Agent,4K context):
  • KV 内存:19.8 GB → 0.45 GB(压缩 97.7%) ⭐⭐⭐⭐⭐
  • PPL 损失:+0.57%(不随 Agent 数增长)
  • BERTScore F1:0.928
  • 1,851 coherent tokens 时 PPL 改善:-0.26%
  • GitHub 代码(已开源自证)

核心论点:多 Agent KV Cache 共享池 + 非对称压缩(Keys int8 + Values 3-bit)——与传统"每 Agent 一份 KV"相比,KV 内存压缩 97.7%;与 v3.45 morning 已锚定的 TurboQuant PolarQuant + QJL 量化方案(NVIDIA NVFP4 Blackwell B200)形成"单模型 TurboQuant vs 多 Agent 非对称压缩"对照

可信度:★★★★ — arXiv 2026-04-27 · Ishan Patel et al. · DOI 10.48550/arXiv.2604.24971 · GitHub 代码开源

与活文档现有脉络的关系:llm-infra.md v3.45 §1.(4) 量化 + §1.(3) KV Cache + §1.(8) 训练 已锚定 v3.43 FlashInfer FP8-FP16 混合精度 KV-cache + v3.40 vLLM FP8 KV-Cache 验证报告 + AMD ROCm TurboQuant on MI355X 12.7× 加速承接稳态 + NVIDIA NVFP4 Blackwell B200 + LiteKV IEEE INFOCOM 2026 + HyQuant arXiv:2608.27875 + OmniKVQuant arXiv:2609.11582 + KVarN arXiv:2606.03458;本条是承接延续 + 新增:① PolyKV 是首个多 Agent 共享 KV Cache 池 + 非对称压缩(Keys int8 + Values FWHT 旋转 3-bit);② KV 内存压缩 97.7% + PPL 损失仅 +0.57%;③ 与 TokenDance arXiv:2604.03143(同步轮次)+ Continnum arXiv:2511.02230(TTL)形成"多 Agent KV 共享三种范式":同步轮次(TokenDance)+ 多 Agent 共享池(PolyKV)+ tool-call aware TTL(Continnum)

建议归入章节: - §1.(3) KV Cache · NET-new 锚入预备扩增预备级预备(arXiv 2604.24971 · PolyKV · 非对称压缩 KV Cache 共享池 · Keys int8 + Values FWHT 旋转 3-bit · KV 内存 19.8GB→0.45GB 压缩 97.7% · PPL 损失 +0.57%) - §1.(4) 量化 · 邻接扩增预备级(arXiv 2604.24971 · PolyKV 非对称压缩 Keys int8 + Values 3-bit · 与 TurboQuant 单模型量化形成"单模型 vs 多 Agent 共享池"对照)


增量 5:arXiv 2603.04428 Edge Multi-Agent Q4 KV Cache 持久化(⭐⭐⭐)

来源:inbox/jay/2026-09-28T1505-jay-five-category-briefing.md §一.3;原始来源 arXiv:2603.04428v1

URL:https://arxiv.org/html/2603.04428v1

arXiv 号:2603.04428

要点:

  • 核心问题:Apple M4 Pro(10.2 GB 缓存预算)8K context 仅能容纳 3 个 Agent;10-Agent 工作流必须不断驱逐/重载 KV——每次驱逐后重新 prefill 需 15.7 秒(4K context)
  • 核心方案:将每个 Agent 的 KV Cache 以 Q4 (int4) 格式持久化到磁盘,直接恢复到 attention 层:
  • Block Pool:per-agent 隔离的 Q4 KV Cache(safetensors 格式)
  • BatchQuantizedKVCache:并发推理时同时处理多个 Agent 的量化缓存
  • Cross-phase Context Injection:跨对话阶段的 attention 状态累积
  • 关键数据(Apple M4 Pro):
  • TTFT 降低:Gemma 3 12B:22~136×(4K~32K);DeepSeek-Coder-V2-Lite 16B:11~76×;Llama 3.1 8B:24~111×
  • Q4 量化精度损失:Gemma -0.7% PPL;Llama +2.8%;DeepSeek +3.0%(均为可接受范围)
  • 内存效率:Q4 比 FP16 多容纳 4× Agent 上下文

核心论点:边缘设备多 Agent Q4 KV 持久化——边缘推理场景下,Q4 量化 + 磁盘持久化可大幅扩展 Agent 并发数(10×),TTFT 降低 22~136×;与 v3.45 已锚定的 sqlite-vec SQLite HNSW + VectorChord pgvecto.rs 继任者(边缘 RAG)形成"边缘 RAG + 边缘多 Agent KV 持久化"完整链路

可信度:★★★ — arXiv 2026-02(Yakov Pyotr Shkolnikov)· 中高 · Apple Silicon 单一硬件实测 · 精度损失数据完整

与活文档现有脉络的关系:llm-infra.md v3.45 §1.(3) KV Cache + §1.(4) 量化 + §1.(6) 长上下文 已锚定 v3.44 morning 已锚定的 sqlite-vec SQLite HNSW 嵌入式 RAG + VectorChord pgvecto.rs 继任者 + NVIDIA EPD Disaggregation 2026-09-04 承接稳态 + AMD ROCm TurboQuant;本条是承接延续 + 新增:① Edge Q4 KV 持久化是边缘多 Agent 场景的首个具体实现(Apple M4 Pro · TTFT 22~136× · Q4 PPL 损失 -0.7%~+3.0%);② 与 TokenDance / PolyKV / Continnum 形成"多 Agent KV 共享四种范式":同步轮次(TokenDance)+ 多 Agent 共享池(PolyKV)+ tool-call aware TTL(Continnum)+ 边缘 Q4 持久化(Edge Q4 KV);③ 与 sqlite-vec / VectorChord 形成"边缘 RAG + 边缘多 Agent"两端

建议归入章节: - §1.(3) KV Cache · NET-new 锚入预备扩增预备级预备(arXiv 2603.04428 · Edge Q4 KV 持久化 · Apple M4 Pro 10-Agent · TTFT 22~136× · Q4 PPL -0.7%~+3.0%) - §1.(6) 长上下文 · 邻接扩增预备级(arXiv 2603.04428 · Edge Q4 KV 持久化 + 磁盘恢复 · 与 sqlite-vec/VectorChord 边缘 RAG 形成两端)


增量 6:arXiv 2608.01526 Internet for the KV Cache · KV Cache 第一等公民(⭐⭐⭐)

来源:inbox/jay/2026-09-28T1505-jay-five-category-briefing.md §二.2 + inbox/jay/2026-09-28T1700-jay-arxiv-hf-agentic-rag-evening-briefing.md §一.3;原始来源 arXiv:2608.01526v1

URL:https://arxiv.org/html/2608.01526v1

arXiv 号:2608.01526

要点:

  • 核心论点:KV Cache 不只是"另一个数据结果",而是一种"表达性工具"——它将自然语言知识转换为可共享、可复用、可跨知识库/输入/甚至跨模型传递的表达形式
  • 论文提出:KV Cache 应成为 LLM 推理中的第一等公民(first-class primitive),其角色包括:
  • Storage Primitive:持久化、跨请求复用
  • Communication Primitive:模型间 KV 直接传递(C2C)
  • Scheduling Primitive:调度决策基于 Cache 可用性(如 IETF CATS 草案)
  • 与 C2C(ICLR 2026)的关联:C2C 是该愿景的具体实现路径之一
  • 配套工作:
  • IETF CATS KV Cache Distribution 草案(draft-li-cats-kv-cache-distribution-00 · 2026-07-04 · China Mobile 主推 · Informational):Cache Hit Metric + Cache Distance Metric + Multi-tier Cache Sync
  • Cache-to-Cache (C2C) ICLR 2026(VentureBeat 报道 2026-09):LLM 之间直接传递 KV Cache · neural cache fuser 将源模型 KV Cache 映射合并到目标模型空间

核心论点:KV Cache 是 LLM 推理中的 first-class primitive——从"存储结果"升格到"表达性工具";与 C2C(ICLR 2026)+ IETF CATS 草案 + Mooncake 分布式 KV 持久化(v3.45 morning 已锚定)+ LatentPort(v3.42 已锚入)+ TokenDance + PolyKV + Continnum 形成「KV Cache first-class primitive」完整愿景

可信度:★★★ — arXiv 2026-08 · 中(系统愿景,非具体实现)· 但配套 C2C ICLR 2026 + IETF CATS 草案 + Mooncake 实际产品构成完整证据链

与活文档现有脉络的关系:llm-infra.md v3.45 §1.(3) KV Cache + §1.(2) 推理调度 + §1.(11) Kernel/AI 自动化/Harness 已锚定 v3.42 LatentPort arXiv:2609.25053 + v3.42 NVIDIA Dynamo 1.0 KVBM + KV-aware routing + v3.45 Mooncake 分布式 KV 持久化 + 增量 2 Continnum TTL + 增量 3 TokenDance 同步轮次 + 增量 4 PolyKV 非对称压缩 + 增量 5 Edge Q4 KV 持久化;本条是承接延续 + 新增:① Internet for the KV Cache 是「KV Cache 表达性工具」愿景论文(2026-08);② 与 C2C ICLR 2026 + IETF CATS 草案 + Mooncake 实际产品形成「KV Cache first-class primitive」完整愿景;③ 与 LatentPort(跨模型)+ Mooncake(分布式)+ IETF CATS(标准化)+ TokenDance(多 Agent 同步轮次)+ PolyKV(非对称压缩)+ Continnum(TTL)+ ECHO NSA KV Cache 损失预取 OSDI 2026 形成 KV Cache 主分类 2026 Q4 初 8 件论文体系化

建议归入章节: - §1.(3) KV Cache · NET-new 锚入预备扩增预备级预备(arXiv 2608.01526 · Internet for the KV Cache · first-class primitive 愿景 · Storage/Communication/Scheduling 三角色 · 配套 C2C ICLR 2026 + IETF CATS 草案 + Mooncake) - §1.(2) 推理调度 · 邻接扩增预备级(arXiv 2608.01526 · Internet for the KV Cache · Scheduling Primitive · IETF CATS Cache Hit Metric + Cache Distance Metric)


承接稳态精修预备级锚定 #1:SGLang vs vLLM 多轮 Agent 4.5× TTFT 生产数据(沿用 v3.45 morning + v3.44 沿用)

来源:inbox/jay/2026-09-28T1150-jay-engineering-filter-production-benchmarks.md §一.1;原始来源 bex.co 2026-09-24

URL:https://bex.co/blog/2026/09/24/sglang-vs-vllm-tenant-model-server

要点:v3.45 morning 已锚定的 SGLang vs vLLM 2026 Q3 横向多源交叉验证沿用稳态(inferenceengineering.tech H100 三引擎架构 + PremAI 版本号 + Jarvislabs H100 实测 + TGI 退市 + Fluid-Guided arXiv 2504.11320),新增承接稳态精修预备级锚定:bex.co 2026-09-24 多轮 Agent 场景专项数据

新增细化:

指标 SGLang vLLM 差距
TTFT 中位数(多轮 Agent) 85ms 380ms 4.5× ⭐⭐⭐⭐⭐
KV Cache 命中率(多轮 Agent) 78.6% 41.2% 1.91×
输出吞吐(token/s,多轮) 5,430 3,120 1.74×
KV Cache 命中率(多轮聊天) 75–90% 10–20% —
KV Cache 命中率(代码分析) 60–80% 5–15% —
前缀密集负载吞吐(Llama 3.1 8B) 16,200 tok/s 12,500 tok/s +29%
TTFT(前缀密集) 79ms 103ms +23%

核心结论(原文一句话):"The more your requests share prefixes, the wider SGLang's lead; the more unique each prompt is, the closer the race."

工程含义:SGLang 的 RadixAttention 在多轮 Agent 场景(工具调用 + 对话历史)中显著优于 vLLM,原因在于 KV Cache 可在工具执行暂停期间保留。当前 vLLM 默认在请求结束时驱逐 KV Cache,导致多轮 Agent 的 KV 复用率极低(41.2% vs 78.6%)

生产建议:Agent 平台(工具调用、多轮对话)优先 SGLang;高独立请求率的工作负载选 vLLM

与 v3.44 morning 已锚定的承接延续: - v3.44 morning + v3.45 morning 已锚定:inferenceengineering.tech H100 三引擎 + PremAI 29% 差距 ≈ 月省 $15K GPU 成本 + TGI 退市 2026-03 + Fluid-Guided arXiv 2504.11320 + v3.45 morning Llama 3.1 8B 16,200 vs 12,500 - 本次承接新增:多轮 Agent 场景下 SGLang 4.5× TTFT 优势(85ms vs 380ms)+ KV Cache 命中率 78.6% vs 41.2%

重要警示:与 v3.44 morning 已锚定的 jay 9-27 09:35 + 11:50 + 17:35 三场推理引擎数据双源并存:jay 9-28 09:35(T0935)引用 Winder.ai H100 数据(独立基准);jay 9-28 11:50(T1150)引用 bex.co 2026-09-24 引用 PremAI 2026 基准(H100 SXM 80GB / RunPod · 注明环境)。两套基准数据并存:T0935 偏前缀密集负载(+29%),T1150 偏多轮 Agent(TTFT 4.5x)。stephen 9-28 12:45 noon §三.2 已标注 ⚠⚬⚬ 警示。

建议归入章节:§1.(1) 推理引擎 · 承接稳态精修预备级锚定实测触发预备级预备触发(SGLang vs vLLM 多轮 Agent 4.5× TTFT 生产数据 · bex.co 2026-09-24 + PremAI 2026 基准 · H100 SXM 80GB / RunPod · TTFT 85ms vs 380ms + KV Cache 命中率 78.6% vs 41.2% · Agent 平台优先 SGLang)


承接稳态精修预备级锚定 #2:llama.cpp v0.5.0 新稳定版发布(沿用 v3.45 morning)

来源:inbox/jay/2026-09-28T1150-jay-engineering-filter-production-benchmarks.md §一.2;原始来源 AI Infrastructure Digest 2026-09-25 · agents-radar #3478

URL:https://github.com/duanyytop/agents-radar/issues/3478

要点:llama.cpp v0.5.0 是 2026 年 9 月的新稳定版本发布

版本状态对比(截至 2026-09-25):

引擎 版本 状态 说明
llama.cpp v0.5.0 ✅ 新稳定版 主要稳定版本
Ollama v0.34.4-rc1 🔴 RC(breaking changes) 升级前需谨慎
vLLM RC 进程中 🟡 开发版 无 24h 内 release
SGLang RC 进程中 🟡 高不稳定性 Issue 93 / PR 151
LiteLLM Dev build 🟡 开发版 PR 149 open

工程影响:llama.cpp v0.5.0 稳定版发布意味着本地/边缘推理推荐从旧版本迁移;Ollama v0.34.4-rc1 含 breaking changes,需等正式版再升级生产

可信度:★★★★ — agents-radar 自动化追踪 · 2026-09-25 棒位

建议归入章节:§1.(1) 推理引擎 · 承接稳态精修预备级锚定(llama.cpp v0.5.0 ✅ 新稳定版 + Ollama v0.34.4-rc1 🔴 + vLLM/SGLang RC 进程中 · 2026-09-25 agents-radar · 本地/边缘推理推荐迁移)


承接稳态精修预备级锚定 #3:arXiv 2609.30216 Jev in the Wild · 决策模型生态数据(沿用 v3.44 morning 已锚定的 Jev 决策生态成形延续)

来源:organized/paper_cards/1531-2609-30216.md(9-28 入库 · 主分类 engineering)+ inbox/jay/2026-09-28T1450-jay-engineering-filter-afternoon-reproduction.md 邻接

URL:https://arxiv.org/abs/2609.30216

arXiv 号:2609.30216

paper_card 状态:paper_card 1531 ✓ 主分类 engineering · 9-28 入库 · 待 LLM 分类

要点:

  • 核心贡献:Jev in the Wild: A Data-Driven Analysis of the Jev Model's Functionality, Applications and Ecosystem
  • 大规模数据驱动分析:截至 2026-09-22,从 GitHub 收集 2,170 个公开 Jev 项目 进行分析
  • 核心发现:
  • Jev 的公开生态早期增长迅速(new projects + integration into existing repositories 双线增长)
  • 跨多个领域都有 Jev 应用项目
  • 公开关注度与项目分布的关联性分析

核心论点:Jev 决策模型生态已具备规模化生态特征(2,170 项目数据驱动分析)——承接 v3.44 morning 已锚定的 Jev/TypeSafe AI System One 决策生态成形延续(deepopen 1014★/4d + Nokia AnyJev 541★ + 7+ 同源仓 · 非自回归 typed decision 50ms 前向 · 1207 条 awesome-jev 资源)+ v3.45 morning 已锚定的 JevOut arXiv:2609.30243(自然语境可翻转决策模型)+ jay 9-28 1140 news-x-tech-radar SemIf 1.02s vs 5.33s 延迟对比 + jay 9-28 17:00 CLM-v0.1-8B 开源对比

可信度:★★★★ — arXiv 2026-09 · paper_card 1531 已入库 · 2,170 项目数据规模 + 2026-09-22 时间戳明确

与活文档现有脉络的关系:llm-infra.md v3.45 §1.(1) 推理引擎 已锚定 v3.44 morning Jev 决策生态成形延续 + v3.45 morning JevOut + D182 ⚠⚬⚬ 矛盾/待核 + v3.42 已锚定的 Simon Willison 9-21 signpost;本条是承接延续 + 新增:① 2,170 项目数据规模是当前最完整的 Jev 生态实测数据;③ 与 jay 9-28 1140 news-x-tech-radar SemIf 1.02s vs 5.33s + jay 9-28 17:00 CLM-v0.1-8B 形成"Jev 决策模型新形态"完整证据链(决策模型与自回归推理两极分工)

建议归入章节: - §1.(1) 推理引擎 · 承接稳态精修预备级锚定(arXiv 2609.30216 · Jev in the Wild · 2,170 GitHub 项目数据驱动分析 · paper_card 1531 ✓ 主分类 engineering · 9-28 入库 · 承接 v3.44 morning 已锚定的 Jev 决策生态成形延续 + v3.45 morning JevOut arXiv 2609.30243)


承接稳态精修预备级锚定 #4:arXiv 2609.31093 PISA · Block Sparse Attention with Log-Linear Complexity(沿用 v3.45 morning 邻接)

来源:organized/paper_cards/1528-2609-31093.md(9-28 入库 · 主分类 engineering)+ work-queue 9-28 08:00 Top 0.5

URL:https://arxiv.org/abs/2609.31093

arXiv 号:2609.31093

work-queue 标识:Top 0.5(9-28 08:00)

paper_card 状态:paper_card 1528 ✓ 主分类 engineering · 9-28 入库 · 待 LLM 分类

要点:

  • 核心问题:Scaling language models to long contexts is limited by the quadratic cost of self-attention. Block sparse attention offers an efficient alternative, but selecting the retained blocks remains a bottleneck. Conventional block selection requires scoring all query-block pairs and therefore remains quadratic in sequence length
  • 核心方案:PISA(block-sparse attention mechanism that employs a pyramid Top-K selection strategy):逐渐缩小不同层级的候选,使找到最相关的 keys 更高效
  • 关键优势:Log-Linear Complexity(金字塔 Top-K 选择策略)

核心论点:Block Sparse Attention + 金字塔 Top-K 选择策略 = Log-Linear Complexity——与 v3.38 已锚定的 TriAttention 10.7× 频域无损 + v3.39 已锚定的 SAGA arXiv:2605.00528 HPDC'26 + v3.43 已锚定的 GeoPair arXiv:2609.25963 形成"长上下文稀疏注意力系列"

可信度:★★★★ — arXiv 2026-09(极新),work-queue Top 0.5 标识

与活文档现有脉络的关系:llm-infra.md v3.45 §1.(1) 推理引擎 + §1.(6) 长上下文 已锚定 v3.38 TriAttention 10.7× 频域无损 + v3.39 JustFit arXiv:2609.17475 KVExec + v3.43 GeoPair arXiv:2609.25963 + v3.39 Network Edge Inference for LLMs Survey arXiv:2604.22906 + v3.40 SiliconBench arXiv:2609.19169 Apple Silicon 三维评测基准;本条是承接延续 + 新增:① PISA 是当前最完整的 Block Sparse Attention 实现(金字塔 Top-K);② 与 TriAttention + GeoPair + JustFit 形成"长上下文稀疏注意力系列"完整链路

建议归入章节: - §1.(1) 推理引擎 · 承接稳态精修预备级锚定(arXiv 2609.31093 · PISA Block Sparse Attention · pyramid Top-K · Log-Linear Complexity · paper_card 1528 ✓ 主分类 engineering · work-queue Top 0.5 · 承接 v3.38 TriAttention + v3.39 JustFit + v3.43 GeoPair) - §1.(6) 长上下文 · 邻接扩增预备级(arXiv 2609.31093 · PISA · Block Sparse Attention · Log-Linear Complexity · 长上下文稀疏注意力)


承接稳态精修预备级锚定 #5:ECHO NSA KV Cache OSDI 2026 + C2C ICLR 2026 + LLM Systems 六层分类 Burgei(沿用 v3.45 morning + v3.44 沿用)

来源:inbox/jay/2026-09-28T1700-jay-arxiv-hf-agentic-rag-evening-briefing.md §一.2 + §一.3 + §一.4

要点:本棒位承接延续 v3.45 morning 已锚定的 InferenceBench arXiv 2607.20468 + MCP Apps + vLLM 2026-09 官方博客 + CSDN 推理工程化 + DSpark + EAGLE 横评 + Jev 决策生态成形

承接新增锚定:

  • LLM Systems 基础设施分类学(Burgei 2026-09-23 · Preprints.org Brief Report):将 LLM 系统基础设施整理为六层平面: 1. Resource Plane(计算/内存/存储/网络/设施) 2. Execution Plane(Accelerators、Scale-up Fabric、Scale-out Network) 3. Lifecycle Control(Data pipelines、Model optimization、Compiler & Runtime) 4. Registry & Serving(Registry、Inference Serving — Batching/KV Cache/Quantization) 5. Execution Plane(训练/服务的执行平面) 6. Online serving 目标:TTFT、inter-token latency、throughput、tail latency、availability、cost/token
  • 价值:适合作为团队内部 LLM 系统知识体系的结构化大纲;每个模块都有成熟开源项目对应
  • 后续行动:可纳入「LLM Systems 工程全景图」主题页

  • ECHO OSDI 2026(USENIX OSDI 2026 · 上海交大 + 华为):Efficient KV Cache Offloading with Lossless Prefetching for Serving Native Sparse Attention LLMs

  • 核心问题:NSA(Native Sparse Attention)等稀疏注意力机制在长上下文场景下 KV Cache 体积仍呈线性增长,GPU HBM 成为瓶颈,导致并发受限、硬件利用率低
  • 核心方案:ECHO 是一个 serving system,设计了 token 级动态 offloading + 无损预取策略,专门优化 NSA 类稀疏注意力负载的 KV Cache 管理

  • C2C ICLR 2026 + 2026-09 VentureBeat 报道:Cache-to-Cache

  • 核心问题:现有 Multi-LLM 系统(路由、协作 Agent)在模型间传递信息时依赖文本 Token——发送方将知识压缩为文本,接收方读取文本重建信息。存在三个问题:信息损失、推理时间浪费、token 成本
  • 核心方案:C2C 让 LLM 之间直接传递 KV Cache,通过 neural cache fuser 将源模型的 KV Cache 映射并合并到目标模型空间
  • 适用场景:多 Agent 协作、多模型路由、跨模型知识蒸馏

  • Ember-1 Kimi K3 思考 token 压缩 40%(Fireworks AI · @rasbt):Fireworks Research 基于 Kimi K3 的推理压缩方案

  • 关键数据:思考 token 减少 40%,同等质量下 / 35~50% 思考时间缩短无精度损失
  • 首个公开规模化生产的 token 压缩推理模型
  • 工程价值:Agent 成本优化可直接参考 API 定价策略;推理 token 压缩是 2026 下半年工程优化热点方向

可信度:★★★★ — OSDI 2026 / ICLR 2026 / Fireworks AI 官方 + jay 9-28 17:00 整合 + stephen 9-28 12:45 noon 协调棒位承接

建议归入章节: - §1.(10) 顶会部署 · 承接稳态精修预备级锚定(Burgei 六层平面分类学 + ECHO OSDI 2026 + C2C ICLR 2026 + Ember-1 Kimi K3 思考 token 压缩 40%) - §1.(3) KV Cache · 承接稳态精修预备级锚定(ECHO OSDI 2026 NSA KV Cache 无损预取 + C2C ICLR 2026 KV Cache 直传 + Internet for KV Cache arXiv 2608.01526 · 形成 KV Cache first-class primitive 完整愿景)


三、值得警惕的矛盾或待核实说法

D195:Continnum arXiv 2511.02230v7 与 vLLM prefix caching Bug 8242 修复路线关系(⚠⚠⚬)

  • 问题:Continnum 引入 KV Cache TTL 机制,但 v3.42 已锚定的 vLLM Prefix Caching Bug #8242 修复状态 + 经验配置值(7B→0.95/13B→0.85/70B→0.90)未独立核实
  • 影响:基于 Continnum 的生产部署可能与 vLLM 默认 prefix caching 策略冲突
  • 建议:llm-infra.md §1.(2) + §1.(3) 收录时标注"Continnum TTL 机制与 vLLM prefix caching 修复路线交叉点待核实;建议核验 vLLM GitHub issue 8242 状态"

D196:SGLang vs vLLM 双源基准数据精度警示(⚠⚠⚬)

  • 问题:stephen 9-28 12:45 noon §三.2 已标注 ⚠⚬⚬ 警示:jay 9-28 09:35(T0935)引用 Winder.ai H100 数据(独立基准);jay 9-28 11:50(T1150)引用 bex.co 2026-09-24 引用 PremAI 2026 基准(H100 SXM 80GB / RunPod · 注明环境)。两套基准数据并存:T0935 偏前缀密集负载(+29%),T1150 偏多轮 Agent(TTFT 4.5x)
  • 影响:基于单一数据源的选型决策可能存在偏差
  • 建议:llm-infra.md §1.(1) 收录时注明两套基准数据并存(T0935 Winder.ai + T1150 bex.co/PremAI),避免下游混淆

D197:TokenDance arXiv 2604.03143 在 OpenClaw 生产接入状态(⚠⚬⚬)

  • 问题:TokenDance 是 OpenClaw/MoltBook 同步轮次多 Agent 框架的具体实现路径,但 OpenClaw 官方仓库是否已集成 round-level KV 优化未独立核实
  • 建议:llm-infra.md §1.(3) 收录时标注"TokenDance 与 OpenClaw 生产接入状态待核实;可与 spark 实例本身实测"

D198:PolyKV arXiv 2604.24971 97.7% 压缩率 claim 与精度损失权衡(⚠⚬⚬)

  • 问题:PolyKV 声称 KV 内存压缩 97.7% + PPL 损失仅 +0.57%,但 Llama-3-8B-Instruct 单一模型 + 15 并发 Agent + 4K context 单一条件下的数据,跨模型 + 跨并发数鲁棒性未独立核实
  • 建议:llm-infra.md §1.(3) + §1.(4) 收录时标注"PolyKV 97.7% 压缩率与 +0.57% PPL 损失是单一条件测得;建议对照 PolyKV GitHub 代码确认压缩率与精度损失的权衡条件"

D199:Edge Q4 KV arXiv 2603.04428 Apple M4 Pro 数据泛化到 Android Edge(⚠⚬)

  • 问题:Edge Q4 KV 持久化在 Apple M4 Pro(统一内存架构)上实测,但 Android Edge 场景(独立 GPU + 系统内存) 复现可行性未独立核实
  • 建议:llm-infra.md §1.(3) + §1.(6) 收录时标注"Edge Q4 KV 数据基于 Apple M4 Pro 统一内存架构;Android Edge 场景复现待核实"

D200:Internet for the KV Cache arXiv 2608.01526 + C2C ICLR 2026 + IETF CATS 草案配套愿景与实际落地差距(⚠⚬⚬)

  • 问题:Internet for the KV Cache 是系统愿景论文,C2C ICLR 2026 是具体实现路径之一,IETF CATS 草案是网络流量调度标准化尝试——三者配套但落地节奏不同。llm-d / vLLM 实际暴露 KV Cache 拓扑 API 的时间表未独立核实
  • 建议:llm-infra.md §1.(3) + §1.(2) 收录时标注"Internet for the KV Cache 愿景 + C2C ICLR 2026 + IETF CATS 草案 + Mooncake 实际产品 = KV Cache first-class primitive 完整链路;llm-d/vLLM KV Cache 拓扑 API 落地时间表待核实"

D201:Jev in the Wild arXiv 2609.30216 2,170 项目数据驱动分析与 v3.44 morning Jev 决策生态成形延续的关系(⚠⚬)

  • 问题:Jev in the Wild 给出 2026-09-22 时间戳 2,170 项目数据;v3.44 morning 已锚定的 Jev 决策生态成形(deepopen 1014★/4d + Nokia AnyJev 541★ + 7+ 同源仓 · 1207 条 awesome-jev 资源)数据快照时间不同
  • 建议:llm-infra.md §1.(1) 收录时标注"2,170 项目数据(2026-09-22)vs 1207 条 awesome-jev 资源数据快照时间差异需核验;两套数据均指向 Jev 生态早期增长迅速"

D202:ECHO OSDI 2026 NSA KV Cache 损失预取与 vLLM 官方 sparse attention 路线图(⚠⚬)

  • 问题:ECHO OSDI 2026 专门优化 NSA 类稀疏注意力负载的 KV Cache 管理,但 vLLM 官方 sparse attention 支持路线图(v3.41 已锚定 D181)未独立核实是否包含 ECHO 设计
  • 建议:llm-infra.md §1.(3) + §1.(6) 收录时标注"ECHO OSDI 2026 NSA KV Cache 损失预取 + vLLM sparse attention 路线图交叉点待核实"

D203:Ember-1 Kimi K3 思考 token 压缩 40% 数字与实测验证(⚠⚬)

  • 问题:Ember-1 声称思考 token 减少 40% + 同等质量下 35~50% 思考时间缩短无精度损失,但 API 定价策略 + 质量评测报告未独立核实
  • 建议:llm-infra.md §1.(5) + §1.(10) 收录时标注"Ember-1 思考 token 压缩 40% 数字基于 Fireworks AI 官方;建议核验独立 benchmark 数据"

D204:work-queue 9-28 08:00 Top 0.5 共 8 件中 3 件与 llm-infra 强相关(2609.31093 PISA + 2609.30216 Jev in the Wild + 2601.06362 PsPLUG 主分类 llm-infra 但 arXiv ID 2026-01 老论文)(⚠⚬)

  • 问题:PsPLUG 2601.06362 主分类 llm-infra 但 arXiv ID 2026-01(2026 年 1 月),与本棒位窗口无关。是否承接 v3.45 morning 沿用基线,还是 llm-infra 主轴 NET-new,待 LLM 精修分类复核
  • 建议:llm-infra.md §1.(1) 收录时标注"PsPLUG arXiv 2601.06362 是 2026-01 老论文 + paper_card 9-28 入库;待 LLM 精修分类复核"

沿用闭合:D1-D194 v3.45 morning 全部沿用稳态


四、本棒新增 arXiv 号列表

arXiv ID 论文名/主题 来源 建议归入章节
2609.27746 KVSET · KV Cache 在线容量规划工具 · Mattson 栈算法在线估算 working set · GPU 内存容量规划 jay 9-28 11:50 §6 + work-queue 9-28 08:00 Top 0.5 §1.(3) KV Cache + §1.(2) 推理调度
2511.02230v7 Continnum · 多轮 Agent 调度 + KV Cache TTL · VLDB 2026 · paper_card 154 ✓ 主分类 agent 副 llm-infra · 程序级 FCFS + KV 保留 TTL · S2 52 引 · 与 vLLM Prefix Caching Bug 8242 形成修复路径 jay 9-28 11:50 §5 + jay 9-28 17:00 §一.1 + paper_card 154 §1.(2) 推理调度 + §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness
2604.03143 TokenDance · 同步轮次多 Agent KV 共享 · Master Cache + Sparse Deltas · prefill 1.9× + 并发 Agent 2.7× · OpenClaw/MoltBook 同步轮次架构 jay 9-28 15:05 §一.2 §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness
2604.24971 PolyKV · 非对称压缩 KV Cache 共享池 · Keys int8 + Values FWHT 旋转 3-bit · KV 内存 19.8GB→0.45GB 压缩 97.7% · PPL 损失 +0.57% · BERTScore F1 0.928 jay 9-28 15:05 §二.1 §1.(3) KV Cache + §1.(4) 量化
2603.04428 Edge Multi-Agent Q4 KV Cache 持久化 · Apple M4 Pro · TTFT 22~136× · Q4 PPL 损失 -0.7%~+3.0% · Block Pool + BatchQuantizedKVCache + Cross-phase Context Injection jay 9-28 15:05 §一.3 §1.(3) KV Cache + §1.(6) 长上下文
2608.01526 Internet for the KV Cache · KV Cache 第一等公民 · Storage/Communication/Scheduling 三角色 · 配套 C2C ICLR 2026 + IETF CATS 草案 + Mooncake jay 9-28 15:05 §二.2 + jay 9-28 17:00 §一.3 §1.(3) KV Cache + §1.(2) 推理调度

承接稳态精修预备级锚定 arXiv ID(3 个新):

arXiv ID 论文名/主题 来源 建议归入章节
2609.30216 Jev in the Wild · 决策模型生态数据 · paper_card 1531 ✓ 主分类 engineering · 2,170 GitHub 项目数据驱动分析 · 承接 v3.44 morning Jev 决策生态成形延续 paper_card 1531 + jay 9-28 1450 邻接 §1.(1) 推理引擎
2609.31093 PISA · Block Sparse Attention with Log-Linear Complexity · paper_card 1528 ✓ 主分类 engineering · pyramid Top-K 选择策略 · work-queue 9-28 08:00 Top 0.5 paper_card 1528 + work-queue §1.(1) 推理引擎 + §1.(6) 长上下文
2609.29647 AgentKernel · Trust-Native Agentic Operating System · paper_card 1518 ✓ 主分类 agent · 承接 v3.44 已锚定的 agent 主轴 paper_card 1518 + jay 9-28 17:00 邻接 §1.(11) Kernel/AI 自动化/Harness 邻接

邻接 arXiv ID(5 个新,已在 v3.45 引用清单中或承接稳态精修预备级锚定):

arXiv ID 论文名/主题 状态
2609.31002 ZooWork-ShopRanker · Open, Preference-Aligned E-Commerce Reranker · paper_card 1530 ✓ 主分类 rag work-queue 9-28 08:00 Top 0.5
2609.31590 AgentWorld · Benchmarking Long-Horizon Collaboration of Multi-agent LLMs · paper_card 1529 ✓ 主分类 agent 副 evaluation work-queue 9-28 08:00 Top 0.5
2609.30222 TrackEverything · Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations · paper_card 1532 ✓ 主分类 multimodal work-queue 9-28 08:00 Top 0.5
2609.25716 FoMo · Forking Moment in Generative Trajectory as a Perceptual Distance · paper_card 1533 ✓ 主分类 engineering work-queue 9-28 08:00 Top 0.5
2601.06352 CARD · Cluster-level Adaptation with Reward-guided Decoding · paper_card 1534 ✓ 主分类 engineering work-queue 9-28 08:00 Top 0.5

承接稳态精修预备级锚定 arXiv ID(v3.45 morning 已锚入 + 续用沿用):

  • arXiv:2609.23130 llm-d × vLLM × Mooncake(v3.45 morning 已实质锚入)
  • arXiv:2607.20468 InferenceBench(v3.45 morning 已实质锚入)
  • arXiv:2501.09136 Agentic RAG Survey v4(v3.45 morning 已实质锚入)
  • arXiv:2603.07379 Agentic RAG SoK(v3.45 morning 已实质锚入)
  • arXiv:2511.14136 CLEAR 评测(v3.45 morning 已实质锚入)
  • arXiv:2609.00196 WHALE(v3.45 morning 已实质锚入)
  • arXiv:2609.30243 JevOut(v3.45 morning 已实质锚入)
  • arXiv:2609.23087 Neural Spectral Capacity(v3.44 morning 已实质锚入)
  • arXiv:2609.27980 Six Layers Less(v3.43 已实质锚入)
  • arXiv:2609.25963 GeoPair(v3.43 已实质锚入)
  • arXiv:2609.27158 Linear Representation Hypothesis(v3.43 已实质锚入)
  • arXiv:2609.27334 JIT Memory(v3.43 已实质锚入)
  • arXiv:2609.25853 MemoryAthena(v3.43 已实质锚入)
  • arXiv:2609.25053 LatentPort(v3.42 已实质锚入)
  • arXiv:2609.24797 Complex KDA(v3.41 已实质锚入)
  • arXiv:2509.15000 SWE-Serve(v3.41 已实质锚入)
  • arXiv:2609.21346 IntBMoE(v3.40 已实质锚入)
  • arXiv:2609.19169 SiliconBench(v3.40 已实质锚入)
  • arXiv:2609.19657 H100 Prefix Reuse(v3.40 已实质锚入)
  • arXiv:2609.20511 EOS Tokens(v3.40 已实质锚入)
  • arXiv:2609.17475 JustFit(v3.39 已实质锚入)
  • arXiv:2609.17391 FlashVector(v3.39 已实质锚入)
  • arXiv:2609.12923 Dissecting GPU Utilization(v3.39 已实质锚入)
  • arXiv:2609.21354 Workload-Router-Pool(v3.45 已实质锚入)
  • arXiv:2501.01005 FlashInfer(v3.42 已实质锚入)
  • arXiv:2511.22880 LoRAServe(v3.42 已实质锚入)
  • arXiv:2605.01280 LLM Serving Ω bound(v3.42 已实质锚入)
  • arXiv:2602.14516 AMPD(v3.42 已实质锚入)
  • arXiv:2504.11320 Fluid-Guided(v3.45 morning 已实质锚入)
  • 等约 50+ 个

IETF 草案:draft-li-cats-kv-cache-distribution-00(2026-07-04 · China Mobile 主推 · Informational · KV Cache 网络流量调度标准化)

承接稳态精修预备级锚定 arXiv ID(被 jay 9-28 11:50 丢弃,主轴邻接): - arXiv:2609.24991 Who Pays for the KV Cache(被 jay 9-28 11:50 丢弃 · 主轴 FinOps 邻接) - arXiv:2609.25782 Hot-Cold Tiering HBM and High Bandwidth Flash(被 jay 9-28 11:50 丢弃 · 超长上下文前沿)


五、本棒新增矛盾/待核 D195-D204

编号 内容 风险等级
D195 ⚠⚠⚬ Continnum arXiv 2511.02230v7 与 vLLM prefix caching Bug 8242 修复路线关系 中
D196 ⚠⚠⚬ SGLang vs vLLM 双源基准数据精度警示(T0935 Winder.ai vs T1150 bex.co PremAI · stephen 9-28 12:45 noon §三.2 已标注 ⚠⚬⚬) 中
D197 ⚠⚬⚬ TokenDance arXiv 2604.03143 在 OpenClaw 生产接入状态 中
D198 ⚠⚬⚬ PolyKV arXiv 2604.24971 97.7% 压缩率 claim 与精度损失权衡 中
D199 ⚠⚬ Edge Q4 KV arXiv 2603.04428 Apple M4 Pro 数据泛化到 Android Edge 低
D200 ⚠⚬⚬ Internet for the KV Cache arXiv 2608.01526 + C2C ICLR 2026 + IETF CATS 草案配套愿景与实际落地差距 中
D201 ⚠⚬ Jev in the Wild arXiv 2609.30216 2,170 项目数据与 v3.44 morning Jev 决策生态成形延续关系 低
D202 ⚠⚬ ECHO OSDI 2026 NSA KV Cache 损失预取与 vLLM 官方 sparse attention 路线图 低
D203 ⚠⚬ Ember-1 Kimi K3 思考 token 压缩 40% 数字与实测验证 低
D204 ⚠⚬ work-queue 9-28 08:00 Top 0.5 共 8 件中 PsPLUG 2601.06362 主分类 llm-infra 但 arXiv ID 2026-01 老论文 低
沿用闭合 D1-D194 v3.45 morning 全部沿用稳态 —

六、检查过的来源汇总(可审计)

inbox/jay/2026-09-28T0935-jay-ai-engineering-inference-vecdb-mcp-trending.md(09:36 · 8.6KB · Winder.ai H100 三引擎 + PremAI 版本号 + MCP 2026-07-28 + MOPD arXiv:2606.30406 + SAS arXiv:2609.13141 + Jev-as-Judge + The AI Engineer Stack 2026)
inbox/jay/2026-09-28T1150-jay-engineering-filter-production-benchmarks.md(11:50 · 12.7KB · SGLang vs vLLM 多轮 Agent TTFT 4.5× + KV 78.6% vs 41.2% + llama.cpp v0.5.0 + Ollama v0.34.4-rc1 + Continnum 2511.02230v7 + KVSET arXiv:2609.27746 + AutoRAG Red Hat + RTX 4090/L40S/RTX 5090 基准)
inbox/jay/2026-09-28T1450-jay-engineering-filter-afternoon-reproduction.md(14:50 · 12.7KB · InferenceBench arXiv:2607.20468 leaderboard 详细数据 + Claude Fable 5.1 9.83× #1 + Claude Sonnet 4.6 8.08× + SMAC3 11.53× + The AI Agents Stack 2026 5 条工程洞察 + Agent Guardrails 独立化 + OWASP MCP Top 10 + A2A/MCP 互补 + Cursor 90 分钟 retrain)
inbox/jay/2026-09-28T1505-jay-five-category-briefing.md(15:05 · 23.8KB · IETF CATS KV Cache 草案 + TokenDance arXiv:2604.03143 + Edge Q4 KV arXiv:2603.04428 + PolyKV arXiv:2604.24971 + Internet for KV Cache arXiv:2608.01526 + HotInfra '26 PIM-DIMM + CSDN RAG/LangGraph + ICML 2026 Agents Reproduction Challenge + HF W39 Papers)
inbox/jay/2026-09-28T1620-jay-csdn-sglang-amd-mcp-platforms-pdf-rag-evening-gap.md(16:20 · 9.5KB · CSDN #157367672 SGLang AMD MI300X TileLang + #164431330 MCP 9 平台配置 + #136687017 PDF 解析 RAG + #162990807 LangChain RAG Agent Demo)
inbox/jay/2026-09-28T1700-jay-arxiv-hf-agentic-rag-evening-briefing.md(17:00 · 18.5KB · Continnum arXiv:2511.02230v7 VLDB 2026 + LLM Systems 6 层分类 Burgei + C2C ICLR 2026 + ECHO OSDI 2026 + Cognee 90% vs 60% + OpenViking + DualPath 2602.21548 + Agent Primitives 2602.03695 + Q-KVComm 2512.17914 + Ember-1 + ODSC AI West 2026 + 推理引擎 vLLM/SGLang/llm-d 补充)
inbox/jay/2026-09-28-1140-news-x-tech-radar.md(11:40 · 4.7KB · Ember-1 Kimi K3 思考 token 压缩 40% + onPanda 字节级修正 + DualSQL 多 Agent RL 2609.18135 + RoboDawn 2609.22966 + Pruna-Qwen-Image-2.1 5~8 步 + ProgramDistill Microsoft SWE 2609.18805 + Jev SemIf 1.02s vs 5.33s + Log-prob 评分 ACL 2026 GEM + CLM-v0.1-8B 开源)
inbox/jay/2026-09-28-llm-inference-db-cloudnative.md(17:00 · 17KB · 9 件 backend 精读候选 = vLLM + llm-d Fleet Control Plane 2609.23130 + Workload-Router-Pool 2603.21354 + Fluid-Guided 2504.11320 + InferenceBench 2607.20468 + AMD GPU Benchmark 2603.10031 + vLLM Korea Meetup 2026 + SGLang NVIDIA GB300 NVL72 25× + llm-d v0.9 + 4 件 Substack 线索)
inbox/jay/2026-09-28-csdn-inference-frameworks-vllm-sglang-mcp.md(10:30 · 10.7KB · vLLM 源码级分析 6 条 + SGLang 源码级分析 4 条 + MCP+A2A 2 条 + DeepSeek V3 MoE 2 条)
inbox/jay/2026-09-28-engineering-e1prep.md(11:22 · 17KB · engineering 主棒位承接 · 4 件 NET-new)
inbox/jay/2026-09-28-ai-engineering-rag-agents.md(承接延续)
inbox/jay/2026-09-28-csdn-rag-agent-research.md(08:21 · 8KB · CSDN 4 条 RAG/Agent 高价值)
inbox/tom/2026-09-28-0900-hf-daily-2026-09-28.md(09:00 · HF Daily 15 件立标 · 与 9-27 早棒完全相同 + 物体永久性 198▲ → 203▲ 续涨减速 +5▲ vs 9-27 的 +20▲ 首次出现减速信号 ⚠⚠⚠⚠ + Linear Superposition 64▲ → 75▲ 续涨加速 +11▲ ⚠⚬⚬ + Rufus-Air 13▲ → 17▲ 升档 #14 → #12 + 24h 内 0 件新立标承接 第 3 日)
inbox/tom/2026-09-28-agent-rag-longcontext-radar.md(08:40 · 5KB · 8 件候选 · 沿用 9-27 同栖位 + RLCDAlignBench Jev 7 票 + Coding Agents TAMP 11 票 + Linear Superposition 75▲ #1)
inbox/tom/2026-09-28_agents-lite.md(09:11 · 4.7KB · 8 件候选 + 5 条 Substack 洞察 + Agent 记忆体系 3 层)
inbox/tom/2026-09-28-rag-e1prep.md(R104 · 25KB · RAG 主分类连续第 5 日 0 入库)
inbox/tom/2026-09-28-evaluation-e1prep.md(承接延续)
inbox/spark/2026-09-28-1001-rss-gradient-flow.md(Jev unpacked + 过期数据容忍 + 数据栈不容错 · 全部沿用第 3 日 ⚠⚬)
inbox/spark/2026-09-28-1002-rss-chip-huyen.md(陷阱 + Agents + 平台 + 成长 + 900 开源 · 全部沿用第 3 日 ⚠⚬)
inbox/spark/2026-09-28-1003-rss-yt-3blue1brown.md(沿用第 3 日)
inbox/spark/2026-09-28-agent-e1prep.md(v106 agent 主棒位承接 · 5 件承接稳态精修预备级锚定)
inbox/stephen/2026-09-28-1245-stephen-coordination-morning.md(12:45 · noon 协调棒位 · spark 第 7 日主棒位全部缺失 ⚠⚬⚬⚬⚬⚬⚬⚬ = 本简报就是闭合这个缺口 + SGLang vs vLLM 多轮 Agent 4.5x TTFT ⭐⭐⭐⭐⭐ + AI 治理层 2026 升格为生产部署分水岭 ⭐⭐⭐⭐ + RAG 主分类连续第 5 日 0 入库 + Visual Decathlon Residual Adapters 精读 + HF Daily Linear Superposition 75 票 + 4 件 P0 待修复)
inbox/stephen/2026-09-28-0910-news-x-vip-radar.md(09:12 · 4.3KB · OpenAI 9-25 公布 6 起 Misalignment 事件 ⚠⚬⚬⚬⚬⚬⚬⚬)
inbox/stephen/2026-09-28-ai-industry-e1prep.md(早棒 81KB · frontier lab 治理公开化 41 → 42 源件套扩增)
inbox/flyp/2026-09-28-multimodal-e1prep.md(09:40 · 55KB · 立标池结构性洗牌第 10 次确认延续期 + 物体永久性续涨减速 +5▲ ⚠⚠⚠⚠ + paper_card 1527 Visual Decathlon / Residual Adapters 1705.08045 9-28 09:00 入库 work-queue 9-28 唯一 Top 15 待深度解读项 + AV-GRPO 同栖位 P0 修正 + multimodal §0 内部一致性 P0 修正)
inbox/flyp/2026-09-28-flyP-critical-read-VisualDecathlon-ResidualAdapters.md(09:50 · 14KB · 精读 = adapter 系族奠基性工作之一)
organized/paper_cards/154-2511-02230.md(Continnum ✓ 主分类 agent 副 llm-infra · OpenAlex 9-27 04:00 入库 · S2 52 引 · VLDB 2026 / Open MIND venue)
organized/paper_cards/1531-2609-30216.md(Jev in the Wild ✓ 主分类 engineering · 9-28 入库 · 2,170 GitHub 项目数据驱动分析 · 待 LLM 分类)
organized/paper_cards/1528-2609-31093.md(Block Sparse Attention / PISA ✓ 主分类 engineering · 9-28 入库 · work-queue 9-28 08:00 Top 0.5 · Log-Linear Complexity · pyramid Top-K · 待 LLM 分类)
organized/paper_cards/1527-1705-08045.md(Visual Decathlon / Residual Adapters ✓ 主分类 multimodal · 9-28 09:00 入库 · S2 被引 1097 · work-queue 9-28 08:00 唯一 Top 15 待深度解读项)
organized/paper_cards/1530-2609-31002.md(ZooWork-ShopRanker ✓ 主分类 rag · 9-28 入库 · work-queue 9-28 08:00 Top 0.5)
organized/paper_cards/1529-2609-31590.md(AgentWorld ✓ 主分类 agent 副 evaluation · 9-28 入库 · work-queue 9-28 08:00 Top 0.5)
organized/paper_cards/1532-2609-30222.md(TrackEverything ✓ 主分类 multimodal · 9-28 入库 · work-queue 9-28 08:00 Top 0.5)
organized/paper_cards/1533-2609-25716.md(FoMo ✓ 主分类 engineering · 9-28 入库 · work-queue 9-28 08:00 Top 0.5)
organized/paper_cards/1534-2601-06352.md(CARD ✓ 主分类 engineering · 9-28 入库 · work-queue 9-28 08:00 Top 0.5)
organized/paper_cards/1535-2601-06362.md(PsPLUG ✓ 主分类 llm-infra · 9-28 入库 · arXiv ID 2026-01 老论文 · 待 LLM 精修分类复核)
organized/queue/work-queue.md(9-28 08:00 · Top 15 待深度解读共 8 件 = 2601.06362 / 2601.06352 / 2609.25716 / 2609.30222 / 2609.30216 / 2609.31002 / 2609.31590 / 2609.31093)
inbox/spark/2026-09-27-llm-infra-e1prep.md(18:40 · v3.44 evening 棒位承接基线 · 第 6 日缺口闭合 · 3 件主增量 + 4 件承接稳态精修预备级锚定)

七、本棒位特别说明 · spark 9-28 llm-infra-e1prep 主棒位确认(第 7 日缺口闭合)

stephen 9-28 12:45 noon 协调棒位警示 spark 9-28 llm-infra-e1prep 主棒位仍未出(与 9-22/9-23/9-24/9-25/9-26/9-27 缺口同型延续第 7 日 ⚠⚬⚬⚬⚬⚬⚬⚬ ⚠ 第 7 日缺口);本棒位 18:40 即为 spark 9-28 主棒位产出,第 7 日缺口闭合。

棒位特点:

  • llm-infra 主轴 13.7h 窗口内 v3.45 morning 棒位已充分承接(jay inference 全天棒位 9 文件 ≈ 130KB + jay engineering-e1prep 17KB + jay llm-inference-db-cloudnative 17KB + tom 9-28 0900 hf-daily + tom 9-28 R104 rag-e1prep + tom 9-28 agent-rag-longcontext-radar + stephen 9-28 12:45 noon 协调棒位 + stephen 9-28 ai-industry-e1prep 81KB + flyp 9-28 multimodal-e1prep 55KB + flyp 9-28 critical-read Visual Decathlon + paper_cards 154 + 1531 + 1528 + 1527 + 1530 + 1529 + 1532 + 1533 + 1534 + 1535 = 12+ 实例对账一致)
  • 本棒位整合 6 件主增量(arXiv 2609.27746 KVSET + arXiv 2511.02230v7 Continnum + arXiv 2604.03143 TokenDance + arXiv 2604.24971 PolyKV + arXiv 2603.04428 Edge Q4 KV + arXiv 2608.01526 Internet for KV Cache)+ 5 件承接稳态精修预备级锚定(SGLang vs vLLM 多轮 Agent 4.5× TTFT + llama.cpp v0.5.0 新稳定版 + arXiv 2609.30216 Jev in the Wild + arXiv 2609.31093 PISA + ECHO OSDI 2026 + C2C ICLR 2026 + LLM Systems 六层分类 + Ember-1 Kimi K3),均来自 jay 9-28 inference 全天棒位承接延续 + paper_cards NET-new + work-queue Top 0.5
  • 立标池结构性洗牌第 10 次确认持续验证已锚入(HF Daily 9-28 早棒 15 件立标 = 与 9-27 早棒完全相同 + 物体永久性 198▲ → 203▲ 续涨减速 +5▲ vs 9-27 的 +20▲ 首次出现减速信号 ⚠⚠⚠⚠ + Linear Superposition 64▲ → 75▲ 续涨加速 +11▲ ⚠⚬⚬ + Rufus-Air 13▲ → 17▲ 升档 #14 → #12 + 24h 内 0 件新立标承接 第 3 日 = 立标池从"密集新立标期"向"承接饱和期"过渡的明确信号)
  • 立标极显著 → 跌出 双连样本第 3 例 OmniEdu 预备实测触发预备级沿用稳态(flyp 9-28 multimodal-e1prep 沿用第 58 日 + 立标池第 58 日承接稳态)
  • MCP 2026-07-28 无状态化重大版本沿用稳态(jay 9-28 0935 + stephen 9-28 12:45 noon §三.1 AI 治理层 2026 升格为生产部署分水岭 ⭐⭐⭐⭐ 强建议 v3.45 evening 棒位锚入)
  • arXiv 2609.27746 + 2511.02230v7 + 2604.03143 + 2604.24971 + 2603.04428 + 2608.01526 NET-new 锚入预备扩增预备级预备(KVSET 在线容量规划 + Continnum tool-call aware TTL + TokenDance 同步轮次多 Agent KV 共享 + PolyKV 非对称压缩 KV Cache 共享池 97.7% + Edge Q4 KV Apple M4 Pro 22~136× TTFT + Internet for KV Cache first-class primitive 完整愿景 = "多 Agent KV 共享五种范式 + KV Cache first-class primitive 完整链路" 2026 Q4 初 llm-infra 工程化里程碑事件)
  • 当晚 evening 棒位(v3.45 evening 升档棒)预备候选齐备:6 件主增量(arXiv 2609.27746 + 2511.02230v7 + 2604.03143 + 2604.24971 + 2603.04428 + 2608.01526)+ 5 件承接稳态精修预备级锚定 → v3.45 evening 实质锚入预备扩增预备级预备

spark · 2026-09-28 18:40 CST · llm-infra E1 预消化轮 · 窗口 Sep 28 05:00 ~ Sep 28 18:40 增量条目:6 条(arXiv 2609.27746 KVSET / arXiv 2511.02230v7 Continnum / arXiv 2604.03143 TokenDance / arXiv 2604.24971 PolyKV / arXiv 2603.04428 Edge Q4 KV / arXiv 2608.01526 Internet for KV Cache) 涉及 arXiv 号:6+3+5+50+(本次新增 NET-new:2609.27746 / 2511.02230v7 / 2604.03143 / 2604.24971 / 2603.04428 / 2608.01526;承接稳态精修预备级锚定 3 个新:2609.30216 Jev in the Wild / 2609.31093 PISA / 2609.29647 AgentKernel;邻接 5 个新:2609.31002 / 2609.31590 / 2609.30222 / 2609.25716 / 2601.06352;续用锚定约 50+ 个 v3.45 morning 沿用) 新增矛盾/待核:D195-D204(10 件,本棒位新增) 第 7 日缺口闭合:spark 9-28 llm-infra-e1prep 主棒位产出(stephen 9-28 12:45 noon 协调棒位 §〇 ⚠⚬⚬⚬⚬⚬⚬⚬ ⚠ 第 7 日缺口已闭合)