Jay 晚间简报 · 2026-09-29 · 第3次/天

实例:Jay 时间:2026-09-29 15:05(Asia/Shanghai) 定位:晚间版 · inference engine + KV cache systems + agentic RAG 专题 覆盖来源:arXiv(cs.DC/cs.IR)· Tavily 实时搜索 · MortalApps · TECHSYS · Yotta Labs · VLDB/FAST/OSDI 2026


📦 Database · 向量数据库与存储系统

高价值条目

🔷 py-kvcache 工程综述(arXiv 2609.11744 · 2026-09-10)

  • 来源:arXiv · cs.DC · 10 Sep 2026
  • URL:https://arxiv.org/abs/2609.11744
  • 核心价值:
  • 外部 KV 缓存已成多层级存储平台:CPU DRAM → NVMe SSD → 共享文件系统 → 远程 Redis
  • 代表系统:LMCache、vLLM external caching、llm-d offloading
  • 关键技术引用:
    • Bidaw(FAST 26):双向计算-存储感知 KV 缓存增强
    • HyMCache(2026):CXL 混合内存多轮 LLM 服务框架
    • DUAL-BLADE(2026):双路径 NVMe 直连 KV 缓存卸载(边缘 LLM 推理)
    • Sol-idAttention(FAST 26):SSD 低延迟服务(内存受限 PC)
    • No buffer, no bottleneck(OSDI 26):零拷贝 KV 缓存卸载长上下文 LLM
  • 核心结论:外部缓存命中用磁盘读取 + CPU↔GPU 传输替代 GPU prefill 运算;短上下文场景下外部缓存可能反而更慢
  • 工程评价:FAST/OSDI 2026 论文合集,KV 存储系统工程前沿;稀缺的中文技术圈系统性梳理
  • 可信度:高(顶会同行评审论文)
  • 分类标签:KV缓存 存储系统 NVMe CXL 边缘推理 FAST26 OSDI26
  • 建议行动:精读 Bidaw / Sol-idAttention 原文;更新 KV cache 主题页存储层次结构

🔷 Moon-cake KV-Centric Disaggregated Architecture(ACM TOS 2025)

  • 来源:ACM Transactions on Storage · arXiv 引录
  • URL:https://arxiv.org/abs/2509.23202(Moon-cake 论文)
  • 核心价值:
  • KV 缓存为中心:牺牲本地存储换取降低的重新计算成本
  • vLLM-Mooncake 集成实验:cache hit rate 从 1.7% → 92.2%,吞吐量 3.8×,P50 TTFT 降低 46×,端到端延迟降低 8.6×(12 GB200 配置,source-local 数据)
  • 架构意义:session state 主导 agentic 推理成本
  • 工程评价:工业界影响力大,ByteDance 生产系统,已有多篇后续工作;建议精读
  • 可信度:高(ACM TOS 同行评审 + 生产验证)
  • 分类标签:KV缓存 disaggregated serving Mooncake vLLM集成 agentic推理
  • 建议行动:精读 Moon-cake 原文;写入 inference engine + distributed systems 主题页

⚙️ Backend · 推理引擎与分布式 Serving

高价值条目

🔷 From Inference Engine to Inference Control Plane(arXiv 2609.23130 · 2026-09-19)

  • 来源:arXiv · Systems Synthesis · 19 Sep 2026
  • URL:https://arxiv.org/abs/2609.23130
  • 核心价值(论文全貌):
  • 核心论点:KV 状态已成为分布式推理系统的一等公民;引擎层优化(batching/paging/quantization/parallelism)完成后,收益边界已到;下一阶段竞争在 control plane 层
  • P2P KV 共享(Guy et al., 2026):对等节点直接传输 KV 而非路由回缓存所有者;GLM-5.2 实验:TTFT 7.85s → 2.56s,吞吐量 3.80 → 10.10 req/s(2.7×);Llama-3.1-8B 资源池峰值吞吐量 +32%
  • NVIDIA Dynamo:与 vLLM/SGLang/TensorRT-LLM 协同的推理框架;提供 disaggregated serving、KV-aware routing、cache management、autoscaling;KV-aware router 显式结合可复用 KV 状态与预估活跃负载
  • llm-d:暴露 control plane 机制作为引擎之上的模块化组件
  • 4条设计原则:
    1. 先优化引擎,再优化 fleet;control plane 无法补偿低效模型服务器
    2. 测量工作负载几何:输入/输出分布、前缀复用、session 暂停、模态、并发
    3. 将 KV 作为有经济价值的状态:追踪驻留、传输字节、避免的重算成本、缓存压力
    4. 跟踪缓存命中背后的 size/value,而不只是 hit rate
  • vLLM 0.29.0(2026-09-09):最新 release
  • 工程评价:本轮最高价值条目;当前推理系统工程最重要的方向性论文,综合性强,非单一系统论文
  • 可信度:高(arXiv 系统合成论文,引用量预期大)
  • 分类标签:推理架构 control plane 分布式推理 vLLM SGLang NVIDIA Dynamo KV复用
  • 建议行动:精读;更新 inference engine 主题页架构分层;建议纳入 weekly digest

🔷 The Inference Engineering Pareto Atlas(arXiv 2609.17863 · 2026-09)

  • 来源:arXiv · 54个锚点配置实测(July 2026)· $18 花费
  • URL:https://arxiv.org/html/2609.17863v1
  • 核心价值:
  • 实测 vLLM 0.12.0,Qwen2.5-7B-Instruct,512-token prompts,128-token outputs
  • 硬件:RunPod L4($0.39/hr)、A100 80GB PCIe($1.39/hr)、H100 PCIe($2.89/hr)
  • 量化对比:FP16、AWQ、FP8 weights、FP8 KV cache、两种 speculation 配置
  • 结论:不同优化组合构成帕累托前沿;不存在单一最优配置
  • 工程评价:少见的工程实测(不是论文引用堆砌);可作为生产部署参考基准
  • 可信度:中高(实测数据,有具体硬件配置和花费)
  • 分类标签:推理benchmark Pareto优化 vLLM 量化 FP8 AWQ
  • 建议行动:归档 Tier1;提取关键 benchmark 数据表

🔷 The KV Cache Working Set:Online Capacity Planning(arXiv 2609.27746 · 2026-09-23)

  • 来源:Kingsoft Cloud · arXiv · cs.DC · 23 Sep 2026
  • URL:https://arxiv.org/abs/2609.27746
  • 核心价值:
  • 定义 KV cache working set:达到目标命中率所需的最小缓存容量
  • 研究问题:保留全部历史 KV 状态成本过高,容量不足又会导致命中率大幅下降
  • 适用场景:agentic 工作负载——多轮对话 + 工具调用历史反复触发模型
  • 关键发现(摘要):working set 大小与 agentic 任务的 session 长度分布高度相关
  • 工程评价:容量规划是生产部署必备;Kingsoft Cloud 工程背景可信;建议精读
  • 可信度:高(顶会级别研究 + 企业背景)
  • 分类标签:KV缓存 容量规划 prefix caching agentic serving Kingsoft Cloud
  • 建议行动:精读;评估是否可以提取关键公式/估算方法写入 O&M 文档

🔷 Rethinking Cache Replacement For LLM Prefix Reuse(arXiv 2609.28870 · 2026-09-24)

  • 来源:arXiv · cs.DC · 24 Sep 2026
  • URL:https://arxiv.org/abs/2609.28870
  • 核心价值(从 snippet 提取):
  • LLM 前缀缓存的 4 个关键特征:
    1. 生命周期短:session-bounded
    2. 复用间隔短:低方差,稳定节奏
    3. 未命中成本高度非均匀:取决于 KV cache 在该 token 深度的计算强度
    4. 少数 session 持有大部分 KV 字节
  • 设计原则:
    • 优先考虑 recency 而非 frequency 用于 retention
    • 用 frequency 来 admit,不用来 rank
    • Hit ratio 不能预测节省的计算量
    • 大 session 需要 block 级 eviction 避免 all-or-nothing
  • Baseline:LRU(robust,元数据最小)
  • 引用语义感知 eviction 学习方法(Shaoping Feng, 2026):Not all tokens are worth caching
  • 工程评价:对 prefix caching 策略设计有直接指导意义;建议精读 eviction policy 部分
  • 可信度:高(顶会级别 arXiv)
  • 分类标签:KV缓存 prefix caching eviction策略 LRU 缓存理论
  • 建议行动:写入 KV cache 主题页 eviction 章节;对比 vLLM 自动前缀缓存实现

🔷 PAGE:Partition-Aware Gated KV-Cache Eviction(arXiv 2609.22157 · 2026-09)

  • 来源:arXiv · 2026 年发表
  • URL:https://arxiv.org/abs/2609.22157
  • 核心价值:
  • 现有 eviction 方法共性:固定预算下决定保留哪些 KV 状态
  • 新视角:当被丢弃状态冗余时,压缩可减少 attention dilution,甚至改善长上下文效果
  • 关键:当答案依赖少量关键 token 时,错误 eviction 损害明显
  • 引用相关工作:Evic-Press(联合压缩+eviction)、CompilerKV(风险自适应压缩)、IndexMem(latent memory 学习 eviction)
  • 工程评价:eviction 方向新工作;适合精读理解 KV 缓存压缩与 eviction 的联合优化空间
  • 可信度:高(arXiv)
  • 分类标签:KV缓存 eviction 压缩 长上下文优化
  • 建议行动:归档 Tier2;写入 KV cache 主题页 eviction 章节

🔷 Who Pays for the KV Cache?(arXiv 2609.24991 · 2026-09)

  • 来源:arXiv · 作者 Timurista(GitHub)· Zenodo DOI
  • URL:https://arxiv.org/abs/2609.24991
  • 核心价值:
  • unalloc 工具:将 OpenCost、LiteLLM、OpenAI/Anthropic 成本数据合并为统一账单
  • 研究问题:Kubernetes 调度 vs LLM 提供商计费之间的成本归属盲区
  • vLLM 风格模拟器:paged KV memory + prefix caching 场景下验证成本归因
  • 案例:发现 Kubernetes 资源分配与实际 LLM 消费之间的归属断裂(5个 case studies)
  • 工程评价:FinOps + LLM Serving 交叉的稀缺工作;适合 SRE/平台工程团队关注成本归因
  • 可信度:中(工具+研究,GitHub 开源)
  • 分类标签:成本归因 FinOps Kubernetes vLLM OpenCost LiteLLM
  • 建议行动:归档 Tier2;写入 inference O&M 主题页成本监控章节

🔷 vLLM vs SGLang 2026 技术架构深度对比(MortalApps · 2026-09)

  • 来源:MortalApps · 技术博客 · 16 min read · September 2026
  • URL:https://mortalapps.com/blog/vllm-vs-sglang-vs-llama-cpp-inference-engines
  • 核心价值:
  • PagedAttention(vLLM):虚拟内存风格分页,非连续物理块,最小化 VRAM 碎片
  • RadixAttention(SGLang):将 KV cache 构建为共享树结构,最大化 token 序列物理共享
  • 关键结论:SGLang 在前缀重叠多的工作负载(多轮对话、结构化输出、RAG)有明显优势
  • TGI 状态:Hugging Face 已将 TGI 置于 maintenance mode(2025-12);README 明确建议迁移到 vLLM/SGLang/llama.cpp/MLX
  • vLLM vs SGLang 核心差异:
    • vLLM:硬件覆盖最广(NVIDIA/AMD/Intel/TPU/Arm),社区最大
    • SGLang:原生 multi-LoRA batching、结构化输出低 overhead、disaggregated serving 已有生产验证
  • 工程评价:当前最全面的引擎对比博客;建议作为架构选型参考
  • 可信度:中高(技术博客,有具体 benchmark 数据但未全部注明条件)
  • 分类标签:推理引擎对比 vLLM SGLang PagedAttention RadixAttention TGI维护模式
  • 建议行动:写入 inference engine 主题页选型章节;注意时效性(每月验证版本号)

🔷 vLLM vs SGLang H100 专项 Benchmark(TECHSYS · 2026-09-01)

  • 来源:TECHSYS · bex.co · 2026-09-01
  • URL:https://techsy.io/en/blog/vllm-vs-sglang
  • 核心价值(H100 实测对比表):
维度 vLLM SGLang 优胜
Raw throughput(8B,H100) ~12,500 tok/s ~16,200 tok/s SGLang +29%
Raw throughput(70B+) ~5% 差异 ~5% 差异 Tie
Tail latency(TTFT p95) 基准 低 5-8% SGLang
前缀缓存(多轮) Block-level hash Token-level radix tree SGLang
结构化输出 高 batch size 时明显 overhead Minimal(overlapped mask gen) SGLang
Multi-LoRA batching 支持 原生支持 SGLang
硬件支持 NVIDIA/AMD/Intel/Trainium/TPU NVIDIA/AMD vLLM
社区规模 17k+ GitHub stars 15k+ stars vLLM
  • 工程评价:首个有具体 H100 实测数字的公平对比;选型必读
  • 可信度:中高(具体 benchmark 条件,部分数字需验证)
  • 分类标签:推理引擎benchmark H100 vLLM SGLang 生产选型
  • 建议行动:提取表格归档;写入 inference engine 选型主题页

☁️ Cloud-Native · 分布式系统与 K8s

高价值条目

🔷 NVIDIA Dynamo:Inference Control Plane 生产级实现(2026)

  • 来源:NVIDIA 官方文档 · Tavily 引录
  • URL:(从 arXiv 2609.23130 引用追踪)
  • 核心价值:
  • 开源推理框架,支持 vLLM、SGLang、TensorRT-LLM
  • 核心能力:disaggregated serving、KV-aware routing、cache management、autoscaling
  • KV-aware router:显式结合可复用 KV 状态与预估活跃负载;disaggregated path 分离 worker 选择与 KV 传输
  • 定位:engine/control-plane 分离架构的生产级实现
  • 工程评价:2026 年最重要的基础设施发布之一;控制平面架构落地方向
  • 可信度:高(NVIDIA 官方)
  • 分类标签:NVIDIA Dynamo control plane disaggregated serving KV routing 云原生推理
  • 建议行动:跟踪官方 release;评估与 vLLM-Mooncake 集成的可行性

🔷 SlotBank:Hybrid-Safe Dense & MoE Local Serving(SSRN · 2026)

  • 来源:SSRN · 技术报告 · 2026
  • URL:https://papers.ssrn.com/sol3/Delivery.cfm/7404578.pdf?abstractid=7404578&mirid=1
  • 核心价值:
  • 混合安全地服务 Dense + MoE 混合模型
  • 在 M3 Max 128 GB 上 benchmark(accessed 2026-09-02)
  • 工程评价:MoE serving 领域新工作;可关注 Dense/MoE 混合部署的经济性分析
  • 可信度:中(SSRN 预印本)
  • 分类标签:MoE 混合部署 本地推理 slotbank
  • 建议行动:归档 Tier2;关注后续正式发表

🌐 CSDN · 中文技术高价值内容

(本轮 Tavily 搜索聚焦英文技术来源,CSDN 内容由前轮简报已覆盖)

本轮 CSDN 去重说明:CSDN 内容已由同日午间简报(2026-09-29T1105)全面覆盖,包括 openGauss RAG 可复现教程、Vector DB 2026 选型格局等高价值条目,本轮不再重复收录。


🔬 Reproduction · 可复现工程与学术验证

高价值条目

🔷 Continuum:Multi-Turn LLM Agent 鲁棒调度 + KV TTL(arXiv 2511.02230 · VLDB 2026)

  • 来源:VLDB 2026 · Proceedings of VLDB Endowment · arXiv 2511.02230v7
  • URL:https://arxiv.org/abs/2511.02230
  • 核心价值:
  • 多轮 Agent 调度的两种主要失败模式:
    1. End-of-turn eviction:工具调用后 KV 被 evict,恢复需重新 prefill 或 reload
    2. Per-turn queueing delay:KV eviction 后新请求排队等待
  • 核心问题:工具调用速度(≤2s)远快于人工输入,导致调度策略需要适应快速追加的新请求
  • 解决方案框架:按 TTL 管理 KV cache,减少 all-or-nothing eviction
  • 与 HyMCache(2026)同为多轮 agent serving 关键工作
  • 工程评价:VLDB 2026 论文,生产背景强;工具调用密集的 agent 场景必读
  • 可信度:高(VLDB 2026 同行评审)
  • 分类标签:多轮Agent VLDB2026 KV调度 工具调用 eviction 可复现
  • 建议行动:精读;评估引入 production inference 调度层的可行性

🔷 Dynamic Flow, Static Graph:Mobile NPU KV Cache Reuse(arXiv 2609.34727 · 2026-09)

  • 来源:arXiv · 2026-09
  • URL:https://arxiv.org/abs/2609.34727
  • 核心价值:
  • 移动端 NPU(ExecuTorch、MLC-LLM、llama.cpp、MediaPipe)缺乏 KV 复用机制
  • SGLANG/RAGCache 用 Radix Tree / Knowledge Tree 实现前缀复用
  • CacheBlend:分布式 KV 存储与检索(非前缀复用)
  • LMCache:统一 KV cache 层,支持跨引擎共享
  • Strata(2026):层级上下文缓存(长上下文服务)
  • Mooncake(2025):KV-centric 架构
  • 核心发现:移动端工作负载恰好表现出最强的跨请求上下文重复——最需要 KV 复用的场景恰好最难实现
  • 工程评价:移动端/端侧 AI 推理的关键研究;填补了一个重要的系统空白
  • 可信度:高(arXiv 系统论文)
  • 分类标签:端侧推理 NPU KV复用 移动AI llama.cpp
  • 建议行动:归档 Tier1;可考虑写入端侧 AI 主题页

📋 本轮汇总与后续行动

写入路径

/shared/research-kb/inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md

核心主题

本轮核心主题:Inference Control Plane 架构崛起 + KV Cache 精细化运营

关键趋势识别

  1. Control Plane 独立化:NVIDIA Dynamo + llm-d 将 KV-aware routing、cache management、autoscaling 从引擎层抽出;下一阶段竞争在 control plane 而非 engine internal
  2. KV 缓存工程化:从"越大越好"到"working set 容量规划";eviction 策略从通用 LRU 到语义感知学习
  3. SGLang vs vLLM 格局已定:SGLang 在 agentic/multi-turn 场景优势明显(+29% throughput);vLLM 守通用场景和硬件覆盖
  4. Mooncake 类架构成为主流:disaggregated KV store 将 cache hit rate 从 1.7% 提升到 92.2%;session state 经济性已超过 compute 成为成本主导因素
  5. Agentic RAG 安全开始严肃化:MMA-RAGT 用 POMDP 建模多阶段对抗;静态防御已不够用

高优先级精读

  1. arXiv 2609.23130(Inference Control Plane)— 本轮最高价值,建议纳入 weekly digest
  2. arXiv 2609.27746(KV Cache Working Set)— 容量规划实操参考
  3. Continuum VLDB 2026(Multi-turn agent scheduling)— 工具调用密集场景必读

本轮未覆盖(建议下次轮次补充)

  • Hugging Face 每日 trending(晨间轮已覆盖)
  • ByteByteGo / Lilian Weng / Simon Willison RSS(需专门轮次)
  • CSDN 晚间更新(建议次日晨间轮跟进)
  • Substack AI 工程类高质量专栏追踪

Jay · 2026-09-29 15:05 · 草稿状态(待合并)