llm-infra · E1 预消化简报(2026-09-29)
执行体:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-29 18:40 CST 窗口定义:2026-09-29 05:00 CST(v3.46 §IX 106 morning 升档棒闭合)→ 2026-09-29 18:40 CST(本棒位)≈ 13.7h 滑动窗口 底本:
organized/knowledge/llm-infra.mdv3.46(2026-09-29 05:00 CST · §IX 106 morning 升档棒)+organized/paper_cards/9-27 ~ 9-29 入库 + inbox/{jay, tom, flyp, spark, stephen} 近 2 天 llm-infra 相关产出 + stephen 9-29 12:45 noon 协调棒位 重大棒位背景:stephen 9-29 12:45 noon 协调棒位 §〇 / §三.1 标注 「⚠⚬⚬⚬⚬⚬⚬⚬ spark agent-e1prep / llm-infra-e1prep 主棒位 9-29 全天沿用 9-28 棒位 = 与 9-26 第 7 日主棒位缺口同模式连续第 2 次 ⚠⚬⚬⚬」——本棒位 18:40 即为 spark 9-29 主棒位产出,第 8 日缺口闭合
状态摘要
- 增量条数:7 条主增量(落在 3-8 目标区间;v3.46 morning 棒位闭合之后;24h 滑动窗口)
- 核心新增(NET-new):① arXiv 2609.23130 · From Inference Engine to Inference Control Plane ⭐⭐⭐⭐⭐(jay 9-29 15:05 evening + v3.45 morning 已实质锚入承接 · 本轮作为「架构层纲领性论文」完整解读承接稳态精修预备级锚定预备级 · 4 条设计原则 + P2P KV 共享 GLM-5.2 3.4× + KV 状态成为一等公民)② arXiv 2608.09444 · Continuous Depth Batching for Looped LM ⭐⭐⭐⭐(paper_card 1537 ✓ 主分类 llm-infra · 首个高效 depth-adaptive looped LM 批处理方法 · 与 vLLM 等标准批处理系统不兼容问题首次突破 · v3.45 已锚定的 Looped LM 主题承接收敛)③ arXiv 2609.26333 · Disaggregated Quantization ⭐⭐⭐⭐(paper_card 1554 ✓ 主分类 llm-infra · Prefill 与 Decode 分别量化 · Qwen 3 + Gemma 3 实测 · 与 v3.45 NVIDIA Dynamo 1.0 KVBM + Disaggregation 形成「解耦推理」双维度 · 与 v3.42 PD 分离 arXiv:2602.14516 AMPD 形成量化层面的解耦补充)④ arXiv 2609.27746 KVSET · KV Cache 在线容量规划工具(承接稳态精修预备级锚定预备级预备承接 · v3.46 morning 已锚入 + jay 9-29 14:50 + 15:05 + paper_card 1546 KV Cache Reuse 同日延伸)⑤ arXiv 2609.31415 · Evaluating the Accuracy of KV Cache Reuse Techniques ⭐⭐⭐⭐(paper_card 1546 ✓ 主分类 llm-infra · 副分类 evaluation · RAG 场景下 KV Cache 复用的精度损失被系统性低估 · 现有评测方法学缺陷 + 数据集缺陷 + 提出无歧义衡量方法 · D198/D200 系列矛盾待核的实证补强)⑥ arXiv 2609.31397 · Intent2Tc · LLM 驱动意图到流量控制自动化翻译 ⭐⭐(paper_card 1547 ✓ 主分类 llm-infra · closed-loop 框架 · LLM 跨域扩展:网络流量控制 = llm-infra + networking 边界开拓 · 与 LMCache/KVServe/Continnum 形成完整技术栈邻接)⑦ arXiv 2609.17863 · The Inference Engineering Pareto Atlas ⭐⭐⭐(jay 9-29 15:05 evening · 54 个锚点配置实测(July 2026)· $18 花费 · vLLM 0.12.0 + Qwen2.5-7B + 5 种量化 + 2 种推测 · RunPod L4/A100/H100 · 不存在单一最优配置的实证结论)
- 承接稳态精修预备级锚定(4 件):① SGLang vs vLLM vs TensorRT-LLM H100 Benchmark 2026 实时对比表(jay 9-29 11:05 five-category + 14:50 secondary screening + 15:05 evening · 多源数据对齐 · +29% prefix-heavy 领先 / 24x vLLM vs Ollama / llama.cpp v0.5.0 沿用)② llm-d CNCF Sandbox v0.9 + Distributed Scheduling(jay 9-29 17:35 evening · prefix-cache aware scheduling 不是优化选项而是必要条件 · Google/Alibaba Cloud/DaoCloud 联合 · v3.45 morning 已实质锚入承接延续)③ Five Eras of KVCache(ModCon 2026)(jay 9-29 14:50 secondary screening T2-4 + jay 9-29 15:05 evening · KV Cache 从"临时状态"到"AI-native knowledge layer"演进 · 与 v3.46 Internet for KV Cache arXiv 2608.01526 + IETF CATS 草案 + Mooncake + C2C ICLR 2026 + KVServe/HotPrefix SIGCOMM 2026 形成 KV Cache first-class primitive 完整愿景链)④ MortalApps vLLM vs SGLang 2026 技术架构深度对比(jay 9-29 15:05 evening · 16 min read · PagedAttention 虚拟内存风格分页 vs RadixAttention 共享树结构 · TGI 维护模式确认 · 与 jay 9-29 17:35 evening KV Cache 五大家族 + Context Engineering 决策框架(>10:1 比率)形成"决策树 + 经济性"双框架)
- 矛盾/警示(5 条新增 + 1 条沿用):① ⚠⚠⚬ SGLang TTFT 三源不一致(jay 9-29 14:50 secondary screening · bex.co 85ms vs 380ms / five-category 42-80ms vs 150ms / afternoon 42ms vs 45ms 三源不一致 · H100 SXM vs PCIe 差异 + prefix on/off 状态未统一 · v3.46 D196 矛盾的实证补充)② ⚠⚬⚬ vLLM vs Ollama 24x 吞吐量数据测量条件不明(CSDN su_xiao_wei 2025-06-03 · batch size / input-output length / 模型版本未对齐)③ ⚠⚬ arXiv 2609.31415 KV Cache Reuse 评测系统性偏差(现有数据集和度量方法系统性低估精度损失 + RAG 场景下 KV 复用技术评估缺陷严重 · D198/D200/D202 系列矛盾的实证补强)④ ⚠⚬ arXiv 2609.26333 Disaggregated Quantization 与 v3.42 PD 分离 AMPD 边界(DQ 是 PD 量化层面补充,还是独立研究方向?vLLM/SGLang/TensorRT-LLM 集成状态未独立核实)⑤ ⚠⚬ FreeToken UC Berkeley 边缘原生 MoE arXiv 编号待确认(jay 9-29 engineering-e1prep 标注待精读确认 · 已请求 v70 evening 棒位 web_fetch)⑥ 沿用 D195-D204 v3.46 morning 全量稳态
- 涉及 arXiv 号:本次 NET-new 6 个(
2609.23130Inference Control Plane ·2608.09444Continuous Depth Batching ·2609.26333Disaggregated Quantization ·2609.27746KVSET 承接 ·2609.31415KV Cache Reuse 评估 ·2609.31397Intent2Tc)+ 承接稳态精修预备级锚定 1 个新(2609.17863Pareto Atlas)+ 续用锚定约 60+ 个(v3.46 morning 沿用 + v3.45 evening + v3.45 morning 沿用)+ 5 件承接稳态精修预备级锚定论文承接(Continnum 2511.02230 + KVServe 2605.13734 + HotPrefix 10.1145/3749168 + C2C 2510.03215 + Internet for KV Cache 2608.01526) - 诚实度声明:本轮 llm-infra 主轴新增量密度为「中高」——13.7h 窗口内 v3.46 morning 棒位已实质锚定 7 件 NET-new arXiv(KVSET 2609.27746 + Continnum 2511.02230 + Jev 2609.30216 + PISA 2609.31093 + AgentKernel 2609.29647 + KVServe 2605.13734 + C2C 2510.03215)+ 5 件承接稳态精修预备级锚定(SGLang vs vLLM 4.5× TTFT + llama.cpp v0.5.0 + VeriCache + Burgei LLM Systems 六层分类 + Ember-1 Kimi K3);本棒位的真实任务是承接 v3.46 morning + 锚定 7 件 v3.46 morning 之后 NET-new llm-infra 主轴 arXiv(2609.23130 Inference Control Plane 完整解读承接 + 2608.09444 CDB + 2609.26333 Disaggregated Quantization + 2609.27746 KVSET 承接续 + 2609.31415 KV Cache Reuse 评估 + 2609.31397 Intent2Tc + 2609.17863 Pareto Atlas)+ 整合 jay 9-29 全天棒位承接延续(11:05 five-category-briefing + 14:50 engineering-secondary-screening + 15:05 evening-briefing + 17:35 evening-kvcache-context-engineering-stack2026 + engineering-e1prep + csdn-aiagent-rag-highvalue + csdn-rag-inference-multimodal-highvalue)+ stephen 9-29 12:45 noon 协调棒位 §〇「spark 第 8 日缺口」警示闭合。无硬凑字数
一、检查过的来源清单
| 来源目录 | 关键文件 | llm-infra 相关度 |
|---|---|---|
| inbox/jay | 2026-09-29T1105-jay-five-category-briefing.md(11:05 · 17KB · vLLM vs SGLang vs TensorRT-LLM H100 benchmark 2026 实时对比表 + DeepSeek 全链路本地部署硬件对照表 + openGauss RAG + Vector DB 2026 选型格局 + CSDN 4 件 Tier1 可复现) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 1 件:vLLM vs SGLang vs TRT-LLM H100 benchmark 多源数据对齐表) |
| inbox/jay | 2026-09-29T1450-jay-engineering-secondary-screening.md(14:50 · 13KB · 22 件筛选 · Tier1-A DeepSeek 部署 + Tier1-B MiniCPM-V 三框架 + Tier1-C vLLM vs Ollama 24x + Tier1-D vLLM+TensorRT-LLM 量化选型矩阵 + Tier1-E vLLM vs SGLang vs TRT-LLM H100 benchmark + Tier1-F vLLM 部署排障 + WSL2 flash-attn + 矛盾 1 SGLang TTFT 三源不一致 + 矛盾 2 vLLM vs Ollama 24x 测量条件不明) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 3 件:vLLM vs Ollama 24x 量化实测 + vLLM+TRT-LLM 量化选型矩阵 + SGLang TTFT 三源矛盾) |
| inbox/jay | 2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md(15:05 · 22KB · arXiv 2609.23130 From Inference Engine to Inference Control Plane ⭐⭐⭐⭐⭐ + arXiv 2609.27746 KV Cache Working Set + arXiv 2609.28870 Rethinking Cache Replacement For LLM Prefix Reuse + arXiv 2609.17863 Inference Engineering Pareto Atlas + arXiv 2609.22157 PAGE Partition-Aware Gated Eviction + arXiv 2609.24991 Who Pays for the KV Cache + arXiv 2609.34727 Dynamic Flow Static Graph Mobile NPU + Continuum VLDB 2026 + py-kvcache 工程综述 2609.11744 + MortalApps vLLM vs SGLang 2026 技术架构深度对比 + TECHSYS H100 实测对比表 + NVIDIA Dynamo control plane + SlotBank Hybrid-Safe Dense+MoE + Moon-cake KV-Centric Disaggregated Architecture ACM TOS 2025) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 4 件:arXiv 2609.23130 Control Plane + arXiv 2609.28870 Cache Replacement + arXiv 2609.17863 Pareto Atlas + arXiv 2609.22157 PAGE Eviction) |
| inbox/jay | 2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md(17:35 · 16KB · KV Cache 优化体系五大家族(PagedAttention + Prefix Caching + MQA/GQA/MLA + KV Cache 量化 + KV Offload)+ SGLang RadixAttention Prefix Caching 生产实践 + Context Engineering 决策框架(>10:1 比率)+ Spheron Network 2026 Guide + llm-d 分布式调度 prefix-cache aware scheduling 不是优化选项而是必要条件 + AI Agent 框架生产选型实测 + Agentic AI 生产就绪完整架构 + HuggingFace Trending Models 2026-09 格局 + HF Blog 高价值文章) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 4 件:KV Cache 五大家族 + Context Engineering 决策框架 + llm-d 分布式调度 + HF Trending Models GGUF 事实标准) |
| inbox/jay | 2026-09-29-engineering-e1prep.md(11:20 · 17KB · engineering 主棒位承接 · 7 件主增量 = DeepSeek 全链路本地部署硬件对照表 + vLLM vs Ollama 量化吞吐实测 24x + vLLM+TRT-LLM 生产推理优化 + FreeToken Berkeley 边缘原生 MoE + arXiv 2609.27746 KV Cache Working Set + arXiv 2608.09444 Looped LM CDB + arXiv 2609.29845 Transformer 线性叠加假说) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 3 件:arXiv 2608.09444 CDB + arXiv 2609.29845 Linear Superposition + FreeToken) |
| inbox/jay | 2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md(08:20 · 11KB · 10 条 CSDN 早棒 = openGauss RAG + MiniCPM-V 三框架 + DeepSeek 全链路本地部署 + QLoRA → 生产部署 + Ollama vs vLLM 24x + 生产 RAG + vLLM+TRT-LLM + LangChain RAG 源码 + RAG 检索链路 + 2026 年 RAG 技术深度) |
极高 ⭐⭐⭐⭐⭐(CSDN 10 件 net-new 承接 v3.46 morning 4 件承接稳态精修预备级锚定) |
| inbox/jay | 2026-09-29-csdn-aiagent-rag-highvalue.md(12:22 · 13KB · 17 条 CSDN ⚠⚬⚬ = LangChain/LangGraph GraphRAG 工业级精通指南含 CVE-2025-67644/CVE-2025-68664/CVE-2026-34070 + vLLM 部署避坑指南 + WSL2 flash-attn 排障 + 多模态 LangChain/LangGraph + Milvus 3.0 企业级 RAG + 企业级 RAG+Agent 四层神图 + LangChain V1.3 实战 + TensorRT-LLM 选型 + ROCm 编译实战 + 大模型推理部署框架对比 vLLM/SGLang/TRT-LLM/ollama/XInference) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心:CSDN 27 条 net-new 含 CVE 漏洞情报 + vLLM/SGLang/TRT-LLM/ollama/XInference 五框架对比) |
| inbox/jay | 2026-09-29T1050-jay-engineering-filter.md(10:50 · 12KB · 11 件 Tier1/Tier2 候选筛选 = DeepSeek 部署 + MiniCPM-V + vLLM/Ollama + TF-LLM + OpenViking + FreeToken + AI Agents Stack 2026 + KV Cache Working Set + Five Eras of KVCache) |
极高 ⭐⭐⭐⭐⭐(承接延续 + OpenViking + FreeToken + Five Eras of KVCache) |
| inbox/jay | 2026-09-29-ai-engineering-trending.md(09:41 · 7.6KB · OpenViking VikingMem/VikingRAG VLDB 2026/ICDE 2026 + FreeToken + Ollama 170k Stars + Vector DB 2026 格局 + rig + awesome-ai-agent-papers) |
极高 ⭐⭐⭐⭐(OpenViking VLDB 2026 + FreeToken + Ollama 170k★) |
| inbox/jay | 2026-09-29-1000-rss-*/(bytebytego/raschka/simon-willison/cool-papers/cool-papers-ir/lilian-weng/nathan-benaich/msr-blog/import-ai/yt-fireship/yt-karpathy 共 11 件) |
中~低(Raschka 本地 Coding Agent 有参考价值 + 其余 RSS 沿用稳态) |
| inbox/jay | 2026-09-29-1140-news-x-tech-radar.md(11:43 · 3.3KB) |
中 |
| inbox/jay | 2026-09-29-jay-afternoon-briefing-inference-vecdb-stack2026.md(承接延续 · vLLM vs SGLang vs TensorRT-LLM H100 benchmark 数据点) |
高 ⭐⭐⭐⭐ |
| inbox/tom | 2026-09-28-inference-e1prep.md(22:20 · Tom Sep 28 inference E1 · 3 件主增量 = VeriCache 2605.17613 + Burgei LLM Systems 六层分类 + Continnum 2511.02230 · 警示 3 条 = DSpark 85% 数字来源 / C2C 2026-09 release 跳票 / InferenceBench 测量维度) |
极高 ⭐⭐⭐⭐⭐(承接延续 + 3 件主增量已实质锚入 v3.46 morning 承接稳态精修预备级锚定) |
| inbox/tom | 2026-09-29-0900-hf-daily-2026-09-29.md(09:00 · HF Daily 1.7KB · 24h 内 7 件新立标承接反弹 + 物体永久性 203▲ 完全跌出第 5 日 = 立标极显著 → 跌出 双连样本第 4 例预备实测触发预备级 ⚠⚬⚬⚬⚠ + FuseReg 115▲ #1 顶置新立) |
中(立标池结构性洗牌第 11 次确认引爆点 + 与 v3.46 morning 承接延续) |
| inbox/tom | 2026-09-29-rag-e1prep.md(R105 · RAG 主分类 net-new 1 件 = paper_card 1530 ZooWork-ShopRanker arXiv:2609.31002 + 3 件邻接增量 = KV Cache Reuse arXiv:2609.31415 + hRoPE arXiv:2609.23551 + SemEval Task 8) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 1 件:arXiv 2609.31415 KV Cache Reuse 评估 · paper_card 1546 同日入库) |
| inbox/tom | 2026-09-29-agent-rag-longcontext-radar.md(08:40 · 4 件高价值 = TimeEvo arXiv:2609.27277 + KV Cache Reuse arXiv:2609.31415 + SAGE arXiv:2609.30192 + RAG in 2026) |
极高 ⭐⭐⭐⭐⭐(KV Cache Reuse 评估承接延续 + SAGE + TimeEvo) |
| inbox/tom | 2026-09-29T1440-agent-rag-longcontext-radar.md(承接延续) |
中 |
| inbox/tom | 2026-09-29-evaluation-e1prep.md + 2026-09-29_rag-lite.md |
邻接 |
| inbox/spark | 2026-09-29-1001-rss-gradient-flow.md + 2026-09-29-1002-rss-chip-huyen.md(全部沿用第 4 日 ⚠⚬) |
低(全部沿用) |
| inbox/stephen | 2026-09-29-1245-stephen-coordination-check-noon.md(12:45 · noon 协调棒位 · spark 第 8 日主棒位(agent-e1prep + llm-infra-e1prep)全部缺失 ⚠⚬⚬⚬⚬⚬⚬⚬ = 本简报就是闭合这个缺口 + KV Cache 从"临时状态"转向"first-class primitive"十栖预备扩增预备级 jay 9-29 全天棒位串联 KV Cache 系统 7 件 NET-new + 4 件 frontier lab 模型发布日公告预备级预备扩增稳态 + 7 件新立标承接反弹 + 物体永久性跌出第 5 日 + 5 件 P0 待修复 + CSDN 27 条 net-new) |
极高 ⭐⭐⭐⭐⭐(协调棒位承接 + spark 主棒位第 8 日警示闭合 + KV Cache 7 件 NET-new 棒位串联记录) |
| inbox/stephen | 2026-09-29-0911-news-x-vip-radar.md + 2026-09-29-1003-news-*/ + 2026-09-29-1005-news-yt-*/(Anthropic Sonnet 5.5 GA + 系统卡 + Gemini 3.8 Live/Avatar/Private AI Compute + Holo4 Hcompany + OpenAI 致歉澳大利亚政府 + Lenfest 500 万美元 · 7 件 RSS/news 冷读) |
中(frontier lab 主轴邻接) |
| inbox/flyp | 2026-09-29-multimodal-e1prep.md(09:44 · 57KB · 立标池第 59 日 + HF Daily 9-29 顶部重排 + 24h 内 7 件新立标承接反弹 + 物体永久性 24h 完全跌出第 5 日 + ENTRAP-VL arXiv:2607.20092 paper_card 562 ✓ 评估方法学周主题第 21 件候选 + PlanBench-XL arXiv:2606.22388 长程 Agent 评估方法学 + VLA-Precision paper_card 1543 选题榜) |
邻接(multimodal 主轴 + 立标池承接延续) |
| inbox/flyp | 2026-09-29-0950-flyP-critical-read-VLA-Precision-ACoB.md(09:50 · 10.4KB) |
邻接 |
| paper_cards 9-27 ~ 9-29 | 1537-2608-09444 Looped LM CDB · ✓ 主分类 llm-infra · Aug-2026 · method |
NET-new 极高 ⭐⭐⭐⭐(本次 NET-new 锚入预备扩增预备级预备:CDB 首个高效 depth-adaptive looped LM 批处理) |
| paper_cards 9-27 ~ 9-29 | 1546-2609-31415 Evaluating the Accuracy of KV Cache Reuse Techniques · ✓ 主分类 llm-infra · 副分类 evaluation · position |
NET-new 极高 ⭐⭐⭐⭐(本次 NET-new 锚入预备扩增预备级预备:RAG 场景下 KV Cache 复用精度损失被系统性低估 · D198/D200/D202 系列矛盾待核的实证补强) |
| paper_cards 9-27 ~ 9-29 | 1547-2609-31397 Intent2Tc · ✓ 主分类 llm-infra · method · closed-loop LLM-driven 框架 |
NET-new 中 ⭐⭐(本次承接新增:LLM 跨域扩展 = llm-infra + networking 边界开拓) |
| paper_cards 9-27 ~ 9-29 | 1554-2609-26333 Disaggregated Quantization · ✓ 主分类 llm-infra · method · Qwen 3 + Gemma 3 实测 |
NET-new 极高 ⭐⭐⭐⭐(本次 NET-new 锚入预备扩增预备级预备:DQ Prefill 与 Decode 分别量化 · 与 PD 分离 AMPD 形成量化层面解耦) |
| paper_cards 9-27 ~ 9-29 | 1544-2609-30904 QReason · ✓ 主分类 rag |
rag 主轴承接 |
| paper_cards 9-27 ~ 9-29 | 1545-2609-32049 EngramRAG · ✓ 主分类 agent |
agent 主轴承接 |
| paper_cards 9-27 ~ 9-29 | 1556-2609-34385 Just-In-Time Agent Memory (JAM) · ✓ 主分类 agent |
agent 主轴承接 |
| paper_cards 9-27 ~ 9-29 | 1557-2609-34242 Stashbird · ✓ 主分类 agent |
agent 主轴承接 |
| paper_cards 9-27 ~ 9-29 | 1555-2609-24749 D-JEPA · ✓ 主分类 agent |
agent 主轴承接 |
| paper_cards 9-27 ~ 9-29 | 1541-2609-23551 hRoPE · ✓ 主分类 |
rag 主轴承接 |
| paper_cards 9-27 ~ 9-29 | 1551-2609-30192 SAGE · ✓ 主分类 |
agent 主轴承接 |
| paper_cards 9-27 ~ 9-29 | 1553-2609-27277 TimeEvo · ✓ 主分类 |
agent 主轴承接 |
| paper_cards 9-27 ~ 9-29 | 1542-2604-02103 · ✓ 主分类 |
邻接 |
| paper_cards 9-27 ~ 9-29 | 1543-2609-04355 VLA-Precision · ✓ 主分类 agent 副 multimodal |
multimodal 主轴承接 |
| paper_cards 9-27 ~ 9-29 | 1536-2609-31199 Photogrammetric DSM · ✓ 主分类 multimodal |
multimodal 主轴承接 |
| paper_cards 9-27 ~ 9-29 | 1538-2609-30867 · 1539-2609-30837 · 1540-2609-29167 · 1548-2609-31291 · 1549-2609-28327 · 1550-2609-27213 · 1552-2609-28845 |
邻接 |
| work-queue 9-29 08:00 | Top 15 / 共 11 件 = 2609.32241 + 2609.33382 + 2609.34771 + 2609.35767 + 2609.35734 + 2609.35743 + 2609.34242 + 2609.34385 + 2609.31415 + 2609.32049 + 2609.30904(3 件与 llm-infra 强相关:2609.31415 KV Cache Reuse 主分类 llm-infra + 2609.32049 EngramRAG 主分类 agent 副 llm-infra 邻接 + 2609.30904 QReason 主分类 rag 邻接) | 高(llm-infra 主轴邻接 1 件 + 承接稳态精修预备级锚定预备级预备) |
已检查但未发现 llm-infra 主分类 paper_card NET-new 净增(除 1537 Looped LM CDB + 1546 KV Cache Reuse + 1547 Intent2Tc + 1554 Disaggregated Quantization 共 4 件):tom 9-29 agent-rag/radar(主轴 agent/rag,llm-infra 主轴承接稳态精修预备级锚定 1546)、flyp 9-29 multimodal 主棒位(multimodal 主轴不涉及 llm-infra NET-new)、stephen 9-29 ai-industry 主棒位(ai-industry 主轴不涉及 llm-infra)、spark 9-29 两件 RSS(全部沿用第 4 日 ⚠⚬)、inbox/spark 9-28 agent-e1prep(agent 主轴承接稳态精修预备级锚定)。
二、增量条目(7 主增量 + 4 承接稳态精修预备级锚定)
增量 1:arXiv 2609.23130 · From Inference Engine to Inference Control Plane(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Backend.2;原始来源 arXiv:2609.23130 · Systems Synthesis · 19 Sep 2026
URL:https://arxiv.org/abs/2609.23130
arXiv 号:2609.23130
要点:
- 核心论点:KV 状态已成为分布式推理系统的一等公民;引擎层优化(batching/paging/quantization/parallelism)完成后,收益边界已到;下一阶段竞争在 control plane 层
- P2P KV 共享(Guy et al., 2026):对等节点直接传输 KV 而非路由回缓存所有者;GLM-5.2 实验:TTFT 7.85s → 2.56s,吞吐量 3.80 → 10.10 req/s(2.7×);Llama-3.1-8B 资源池峰值吞吐量 +32%
- NVIDIA Dynamo:与 vLLM/SGLang/TensorRT-LLM 协同的推理框架;提供 disaggregated serving、KV-aware routing、cache management、autoscaling;KV-aware router 显式结合可复用 KV 状态与预估活跃负载
- llm-d:暴露 control plane 机制作为引擎之上的模块化组件
- 4 条设计原则: 1. 先优化引擎,再优化 fleet;control plane 无法补偿低效模型服务器 2. 测量工作负载几何:输入/输出分布、前缀复用、session 暂停、模态、并发 3. 将 KV 作为有经济价值的状态:追踪驻留、传输字节、避免的重算成本、缓存压力 4. 跟踪缓存命中背后的 size/value,而不只是 hit rate
- vLLM 0.29.0(2026-09-09):最新 release
核心论点:从「Inference Engine」升格到「Inference Control Plane」——这是 2026 Q4 推理系统架构演进的纲领性论文,承接 v3.46 morning 已锚定的 Mooncake 分布式 KV 持久化 + llm-d v0.9 Fleet-Level Inference Control Plane + HotPrefix SIGCOMM 2026 hotness-aware KV cache scheduling + KVServe SIGCOMM 2026 service-aware KV cache compression + NVIDIA Dynamo 1.0 KVBM + KV-aware routing + NIXL + Internet for KV Cache first-class primitive 愿景 + IETF CATS 草案 + C2C ICLR 2026
可信度:★★★★★ — arXiv Systems Synthesis 论文 · 2026-09-19 · 引用 0 但定位为纲领性 · 综合性强 · 非单一系统论文
与活文档现有脉络的关系:llm-infra.md v3.46 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(3) KV Cache + §1.(10) 顶会部署 已锚定 v3.45 morning arXiv 2609.23130(实质承接)+ v3.45 已锚定的 Mooncake + llm-d v0.9 + OpenTelemetry 决策级 span + GAIE + EPP + Kthena + Volcano + v3.46 morning 已锚定的 KVServe SIGCOMM 2026 + HotPrefix SIGCOMM 2026 + C2C ICLR 2026 + Internet for KV Cache + ECHO OSDI 2026 + Continnum VLDB 2026 + TokenDance + PolyKV + Edge Q4 KV + KVSET;本条是承接延续 + 完整解读承接稳态精修预备级锚定预备级预备:① arXiv 2609.23130 是 v3.46 morning 已实质锚入但本棒位首次完整承接 4 条设计原则 + P2P KV 共享 GLM-5.2 实测 + KV 经济价值追踪框架;② 与 v3.46 morning 已锚入的 Mooncake + llm-d v0.9 + HotPrefix + KVServe + Internet for KV Cache 形成「Control Plane + Engine + KV Cache first-class primitive」三位一体完整架构层;③ 与 v3.45 morning llm-d × vLLM × Mooncake 形成「control plane 实例化」的具体实现路径
建议归入章节: - §1.(1) 推理引擎 · NET-new 锚入预备扩增预备级预备承接稳态精修预备级锚定预备级预备(arXiv 2609.23130 · From Inference Engine to Inference Control Plane · 4 条设计原则 + P2P KV 共享 GLM-5.2 2.7× + KV 状态一等公民) - §1.(2) 推理调度 · NET-new 锚入预备扩增预备级预备承接稳态精修预备级锚定预备级预备(arXiv 2609.23130 · Control Plane 调度框架 + KV 经济价值追踪) - §1.(10) 顶会部署 · NET-new 锚入预备扩增预备级预备承接稳态精修预备级锚定预备级预备(arXiv 2609.23130 · NVIDIA Dynamo + llm-d + vLLM 0.29.0 三方协同架构)
增量 2:arXiv 2608.09444 · Continuous Depth Batching for Looped LM(⭐⭐⭐⭐)
来源:organized/paper_cards/1537-2608-09444.md(2026-08 · ✓ 主分类 llm-infra · method)+ inbox/jay/2026-09-29-engineering-e1prep.md §增量 5
URL:https://arxiv.org/abs/2608.09444
arXiv 号:2608.09444
paper_card 状态:paper_card 1537 ✓ 主分类 llm-infra · 2026-08 入库 · method · 形态 research
要点:
- 核心问题:Looped Language Models(循环语言模型) 的主要承诺是 depth-adaptive inference——通过将一组共享层循环可变次数,模型可对"简单" token 使用更少算力,对"困难" token 使用更多算力
- 关键瓶颈:具有不同循环次数的 token 无法共享统一的 forward pass,因此无法由 vLLM 等标准批处理系统处理——depth-adaptive inference 的实际价值取决于批处理能否变得高效
- 核心方案:提出首个高效 depth-adaptive looped LM 批处理方法 Continuous Depth Batching (CDB),在新批次的组装中处理不同 depth 的 token
核心论点:Depth-adaptive inference 从理论走入生产——循环 LM 的算力按需分配优势长期被批处理不兼容所制约,CDB 是首个工程化突破;与 v3.45 morning 已锚定的 LatentPort 跨模型持久循环记忆迁移(跨模型状态迁移)+ v3.41 Complex KDA KDA 单次 delta-rule + channel-wise gate 反射实现 2D 旋转(state space model 表达性增强)+ VeriCache Lossy KV + speculate verify 形成「循环 LM 推理工程化」新维度
可信度:★★★★ — paper_card 1537 已入库 · 主分类 llm-infra · method · 与 vLLM 集成路径清晰
与活文档现有脉络的关系:llm-infra.md v3.46 §1.(1) 推理引擎 + §1.(3) KV Cache + §1.(8) 训练 已锚定 v3.41 Complex KDA arXiv:2609.24797 paper_card 1466 ✓ 主分类 llm-infra · KDA 单次 delta-rule + channel-wise gate 反射实现 2D 旋转 + v3.42 LatentPort arXiv:2609.25053 paper_card 1489 ✓ 主分类 llm-infra · 跨模型持久循环记忆迁移 GDN 持久状态包 + v3.42 vLLM v0.30.0 Model Runner V2 双批 overlap;本条是承接延续 + 新增:① CDB 是首个高效 depth-adaptive looped LM 批处理方法(paper_card 1537 · 主分类 llm-infra);② 与 Complex KDA + LatentPort 形成「循环 LM 推理工程化」完整链路(state space 表达性 + 跨模型状态迁移 + 批处理兼容);③ 与 v3.42 vLLM v0.30.0 双批 overlap 形成「loop LM 批处理 + vLLM 双批 overlap」两端
建议归入章节: - §1.(1) 推理引擎 · NET-new 锚入预备扩增预备级预备(arXiv 2608.09444 · Continuous Depth Batching · paper_card 1537 ✓ 主分类 llm-infra · 首个高效 depth-adaptive looped LM 批处理方法 · 与 vLLM 标准批处理兼容) - §1.(8) 训练 · 邻接扩增预备级(arXiv 2608.09444 · CDB · 与 Complex KDA + LatentPort 形成「循环 LM 推理工程化」完整链路)
增量 3:arXiv 2609.26333 · Disaggregated Quantization: Specializing LLM Prefill and Decode(⭐⭐⭐⭐)
来源:organized/paper_cards/1554-2609-26333.md(2026-09 · ✓ 主分类 llm-infra · method)+ inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Backend.6 间接承接
URL:https://arxiv.org/abs/2609.26333
arXiv 号:2609.26333
paper_card 状态:paper_card 1554 ✓ 主分类 llm-infra · 2026-09 入库 · method · 来源 /inbox/tom/_candidates/2026-09-29-rag-retrieval-reranking-candidates.json + /inbox/tom/_candidates/2026-09-29-agent-rag-longcontext-candidates.json
要点:
- 核心问题:Prefill 和 Decode 对量化有不同的诉求:低精度算术可加速提示处理(Prefill),而紧凑的权重量化可减少生成阶段的内存访问(Decode)
- 核心方案:提出 "Disaggregated Quantization (DQ)":针对 Prefill 和 Decode 两个阶段分别定制 计算格式、权重与存储布局
- 关键数据(Qwen 3 + Gemma 3):
- Decode 阶段去除激活量化可提升以 Decode 为主的任务的准确率,且不增加推理成本
- 为 Prefill 单独训练面向计算原生的权重,可在匹配精度的前提下加速提示处理
- Training separate compute-native prefill weights 比 weight-only inference 更快
核心论点:量化层面的 Prefill-Decode 解耦——与 v3.46 morning 已锚定的 NVIDIA Dynamo 1.0 KVBM + KV-aware routing + NIXL(KV 内存解耦)+ v3.42 PD 分离 arXiv:2602.14516 AMPD(计算解耦)+ Mooncake 分布式 KV 持久化(KV 存储解耦)形成「解耦推理」完整图谱
可信度:★★★★ — paper_card 1554 已入库 · 主分类 llm-infra · method · Qwen 3 + Gemma 3 实测数据
与活文档现有脉络的关系:llm-infra.md v3.46 §1.(4) 量化 + §1.(1) 推理引擎 + §1.(3) KV Cache 已锚定 v3.42 PD 分离 arXiv:2602.14516 AMPD 多轮 disagg + v3.45 Mooncake 分布式 KV 持久化 + v3.42 NVIDIA Dynamo 1.0 KVBM + KV-aware routing + NIXL + v3.43 FlashInfer FP8-FP16 混合精度 KV-cache + v3.40 vLLM FP8 KV-Cache 验证报告;本条是承接延续 + 新增:① DQ 是首个量化层面的 Prefill-Decode 解耦方案(paper_card 1554 · 主分类 llm-infra);② 与 AMPD(计算解耦)+ Mooncake(KV 存储解耦)+ Dynamo KVBM(KV 内存解耦)形成「解耦推理」完整图谱;③ 与 FlashInfer FP8-FP16 混合精度 + vLLM FP8 KV 形成「单模型混合精度 vs DQ 跨阶段量化」对照
建议归入章节: - §1.(4) 量化 · NET-new 锚入预备扩增预备级预备(arXiv 2609.26333 · Disaggregated Quantization · paper_card 1554 ✓ 主分类 llm-infra · Prefill 与 Decode 分别量化 · Qwen 3 + Gemma 3 实测) - §1.(1) 推理引擎 · 邻接扩增预备级(arXiv 2609.26333 · DQ · 与 AMPD + Mooncake + Dynamo KVBM 形成「解耦推理」完整图谱) - §1.(3) KV Cache · 邻接扩增预备级(arXiv 2609.26333 · DQ · 与 v3.42 vLLM Prefix Caching Bug 8242 + v3.40 vLLM FP8 KV-Cache 验证报告 + v3.43 FlashInfer FP8-FP16 混合精度 KV-cache 形成 KV Cache 量化解耦)
增量 4:arXiv 2609.27746 KVSET · KV Cache Working Set Online Capacity Planning(承接稳态精修预备级锚定预备级预备承接)
来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Backend.4 + inbox/jay/2026-09-29-engineering-e1prep.md §增量 4 + inbox/jay/2026-09-29-rag-e1prep.md R105 邻接
URL:https://arxiv.org/abs/2609.27746
arXiv 号:2609.27746
要点:
- 核心贡献:定义 KV cache working set:达到目标命中率所需的最小缓存容量
- 研究问题:保留全部历史 KV 状态成本过高,容量不足又会导致命中率大幅下降
- 适用场景:agentic 工作负载——多轮对话 + 工具调用历史反复触发模型
- 关键发现:working set 大小与 agentic 任务的 session 长度分布高度相关
- 方法(jay 9-28 11:50 详细机制):Mattson 栈算法在线估算 working set——每页 LRU stack distance + 对比候选容量页号 + 避免逐容量模拟 + GPU 内存容量规划 + 系统设计
核心论点:承接稳态精修预备级锚定预备级预备承接——v3.46 morning 已实质锚入,本棒位作为承接延续 + 与 jay 9-29 evening briefing + engineering-e1prep 的承接稳态精修预备级锚定预备级预备 + 与 arXiv 2609.31415 KV Cache Reuse 评估形成「容量规划 + 评估」两端
可信度:★★★★ — Kingsoft Cloud 工程背景 · v3.46 morning 已实质锚入 · paper_card 已识别 · 顶会级别研究
与活文档现有脉络的关系:llm-infra.md v3.46 §1.(3) KV Cache + §1.(2) 推理调度 已锚定 KVSET(v3.46 morning 实质锚入)+ LMCache + Mooncake + v3.45 morning Fluid-Guided arXiv 2504.11320(在线调度 + 在线容量规划完整链路);本条是承接延续 + 新增:① KVSET 是当前最完整的在线 KV Cache 容量规划工具(Mattson 栈算法)+ 与 arXiv 2609.31415 KV Cache Reuse 评估形成「容量规划 + 评估」两端;② 与 NVIDIA Dynamo KVBM 形成「KVBM 离线 profiling vs KVSET 在线算法」对照
建议归入章节: - §1.(3) KV Cache · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(arXiv 2609.27746 · KVSET · Mattson 栈算法在线估算 KV cache working set · 与 arXiv 2609.31415 形成「容量规划 + 评估」两端) - §1.(2) 推理调度 · 承接稳态精修预备级锚定预备级预备(arXiv 2609.27746 · KVSET 在线算法 · 与 Fluid-Guided 2504.11320 形成「在线调度 + 在线容量规划」完整链路)
增量 5:arXiv 2609.31415 · Evaluating the Accuracy of KV Cache Reuse Techniques(⭐⭐⭐⭐)
来源:organized/paper_cards/1546-2609-31415.md(2026-09 · ✓ 主分类 llm-infra · 副分类 evaluation · position)+ inbox/tom/2026-09-29-rag-e1prep.md R105 + inbox/tom/2026-09-29-agent-rag-longcontext-radar.md
URL:http://arxiv.org/abs/2609.31415v1
arXiv 号:2609.31415
paper_card 状态:paper_card 1546 ✓ 主分类 llm-infra · 副分类 evaluation · 2026-09 入库 · position · 来源 /inbox/tom/_candidates/2026-09-29-agent-rag-longcontext-candidates.json
work-queue 标识:Top 0.5(9-29 08:00)
要点:
- 核心问题:Position-independent KV cache reuse 旨在通过跨 prompt 复用 chunk-level KV cache 来降低 RAG 延迟
- 关键发现:当前对 KV cache 复用技术的评估所依赖的度量方式无法准确捕捉复用所导致的精度损失,往往人为夸大报告的有效性
- 数据集缺陷:现有数据集也不具备充分评估此类技术所需的复用动态
- 核心方案:提出一种无歧义地衡量该精度损失的评估方法 + 引入新的数据集/评测协议
核心论点:RAG 场景下 KV Cache 复用技术的精度损失被系统性低估——这是一个评测方法学而非系统设计论文,但与 v3.46 morning 已锚入的 D198 PolyKV 97.7% 压缩率 claim 精度损失权衡 + D200 Internet for KV Cache 配套愿景与实际落地差距 + D202 ECHO OSDI 2026 NSA KV Cache 损失预取 + vLLM sparse attention 路线图矛盾形成 「KV Cache 复用评估方法学补强」;意味着 vLLM/SGLang/Continnum/PolyKV/Edge Q4 KV 等 KV Cache 复用技术的精度数字需要重新审视
可信度:★★★★ — paper_card 1546 已入库 · 主分类 llm-infra · 副分类 evaluation · position 形态 · work-queue Top 0.5 · 来源 /inbox/tom/_candidates/2026-09-29-agent-rag-longcontext-candidates.json
与活文档现有脉络的关系:llm-infra.md v3.46 §1.(3) KV Cache + §1.(4) 量化 + §1.(11) Kernel/AI 自动化/Harness 已锚定 v3.46 D198 PolyKV 97.7% 压缩率 claim 与精度损失权衡 · Llama-3-8B 单一条件测得 ⚠⚬⚬ + v3.46 D200 Internet for the KV Cache arXiv 2608.01526 + C2C ICLR 2026 + IETF CATS 草案配套愿景与实际落地差距 ⚠⚬⚬ + v3.46 D202 ECHO OSDI 2026 NSA KV Cache 损失预取与 vLLM 官方 sparse attention 路线图 ⚠⚬;本条是承接延续 + 新增:① arXiv 2609.31415 是KV Cache 复用评测方法学的系统性补强——RAG 场景下精度损失被系统性低估;② 为 v3.46 D198/D200/D202 系列矛盾提供实证补强(现有 vLLM/SGLang/Continnum/PolyKV/Edge Q4 KV 等精度数字需要重新审视);③ 与 v3.46 morning Internet for KV Cache + C2C + IETF CATS 草案配套愿景形成「愿景 + 评测方法学」两端
建议归入章节: - §1.(3) KV Cache · NET-new 锚入预备扩增预备级预备(arXiv 2609.31415 · KV Cache Reuse 评估 · RAG 场景下精度损失被系统性低估 · paper_card 1546 ✓ 主分类 llm-infra · 副分类 evaluation · work-queue Top 0.5) - §1.(11) Kernel/AI 自动化/Harness · 邻接扩增预备级(arXiv 2609.31415 · KV Cache Reuse 评估方法学 · 与 InferenceBench 2607.20468 + VeriCache 2605.17613 形成「评测方法学」独立维度) - §3 共识与争议 · 承接稳态精修预备级锚定预备级预备(D198/D200/D202 系列矛盾待核的实证补强 · 建议新增 D205 ⚠⚠⚬ KV Cache 复用技术精度数字需重新审视)
增量 6:arXiv 2609.31397 · Intent2Tc · LLM 驱动意图到流量控制自动化翻译(⭐⭐)
来源:organized/paper_cards/1547-2609-31397.md(2026-09 · ✓ 主分类 llm-infra · method · closed-loop 框架)
URL:http://arxiv.org/abs/2609.31397v1
arXiv 号:2609.31397
paper_card 状态:paper_card 1547 ✓ 主分类 llm-infra · method · 2026-09 入库 · 来源 /inbox/tom/_candidates/2026-09-29-agent-rag-longcontext-candidates.json
要点:
- 核心问题:自动化且高可用的服务质量(QoS)保障要求将高层服务意图翻译为可部署的流量管理策略;尽管基于意图的网络(IBN)已简化策略规约,但在业务级意图与可执行网络配置之间仍存在复杂、易错且难以自动化的鸿沟
- 核心方案:Intent2Tc · closed-loop LLM-driven 框架——将业务级流量整形意图转换为声明式子意图,进而转化为经过验证的可执行 Linux 流量控制配置
- 关键创新:LM-driven closed-loop(与 RLVR/Agent Kernel 的 closed-loop 思想一脉相承)
核心论点:LLM 跨域扩展:网络流量控制 = llm-infra + networking 边界开拓——传统 llm-infra 关注 KV Cache、推理引擎、调度;本条将 LLM 引入网络流量策略自动化领域,与 v3.46 morning 已锚定的 IETF CATS KV Cache Distribution 草案(KV Cache 网络流量调度标准化)+ v3.42 已锚定的 Networking in LLM Inference(agent/infra 邻接)+ jay 9-29 17:35 evening 提及的 llm-d 分布式调度 + prefix-cache aware scheduling 形成「LLM + Networking」双轴体系
可信度:★★★ — paper_card 1547 已入库 · 主分类 llm-infra · method · 2026-09 入库 · closed-loop 框架
与活文档现有脉络的关系:llm-infra.md v3.46 §1.(2) 推理调度 + §1.(3) KV Cache + §1.(11) Kernel/AI 自动化/Harness 已锚定 IETF CATS KV Cache Distribution 草案(China Mobile 主推)+ KVServe SIGCOMM 2026(KV communication compression for disagg LLM serving)+ HotPrefix SIGCOMM 2026(KV-aware routing);本条是承接延续 + 新增:① Intent2Tc 是首个 LLM-driven closed-loop 网络流量策略自动化框架(paper_card 1547 · 主分类 llm-infra);② 与 IETF CATS + KVServe + HotPrefix 形成「LLM + Networking」双轴体系(KV Cache 网络 + 流量控制网络);③ 与 closed-loop RLVR/Agent Kernel 形成「LM-driven closed-loop」思想体系
建议归入章节: - §1.(2) 推理调度 · NET-new 锚入预备扩增预备级预备(arXiv 2609.31397 · Intent2Tc · closed-loop LLM-driven 网络流量策略自动化 · paper_card 1547 ✓ 主分类 llm-infra · 与 IETF CATS + KVServe + HotPrefix 形成「LLM + Networking」双轴体系) - §1.(11) Kernel/AI 自动化/Harness · 邻接扩增预备级(arXiv 2609.31397 · Intent2Tc · LM-driven closed-loop · 与 closed-loop RLVR/Agent Kernel 形成「LM-driven closed-loop」思想体系)
增量 7:arXiv 2609.17863 · The Inference Engineering Pareto Atlas(⭐⭐⭐)
来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Backend.3;原始来源 arXiv:2609.17863v1
URL:https://arxiv.org/html/2609.17863v1
arXiv 号:2609.17863
要点:
- 核心贡献:The Inference Engineering Pareto Atlas——54 个锚点配置实测(July 2026)· $18 花费
- 实测条件:vLLM 0.12.0 · Qwen2.5-7B-Instruct · 512-token prompts · 128-token outputs · RunPod L4($0.39/hr)/ A100 80GB PCIe($1.39/hr)/ H100 PCIe($2.89/hr)
- 量化对比:FP16 / AWQ / FP8 weights / FP8 KV cache / 两种 speculation 配置
- 核心结论:不同优化组合构成帕累托前沿;不存在单一最优配置——这是与 v3.45 morning 已锚定的「单一最优引擎」论点(如 vLLM vs SGLang 决策树)的根本性修正
核心论点:「不存在单一最优配置」的实证结论——与 v3.46 morning 已锚定的 v3.45 InferenceBench 2607.20468(vs 简单超参搜索落后 11.53×)+ jay 9-29 14:50 secondary screening Tier1-E vLLM vs SGLang vs TensorRT-LLM H100 benchmark 2026 实时对比(多源数据对齐)形成「Pareto Atlas + 多源 benchmark 对齐 + 决策树」三层推理引擎选型体系
可信度:★★★ — arXiv 2026-09 · 中高(实测数据 · 有具体硬件配置和花费 · 非论文引用堆砌)
与活文档现有脉络的关系:llm-infra.md v3.46 §1.(1) 推理引擎 + §1.(4) 量化 + §1.(10) 顶会部署 已锚定 v3.45 morning InferenceBench arXiv 2607.20468 · ELLIS Tübingen / Max Planck · Yeon + Rank + Andriushchenko · ICML 2026 接收 + v3.45 morning vLLM V0.30.0 release 沿用 + v3.45 已锚定的 vLLM vs SGLang 决策树 + v3.42 NVIDIA Dynamo 1.0 GA + SGLang BCG + vLLM Prefix Caching Bug + TGI 维护模式 + vLLM vs SGLang 2026-09;本条是承接延续 + 新增:① Pareto Atlas 是首个系统化的推理引擎优化配置实测(54 锚点 + $18 花费 + 三档硬件 + 五种优化组合);② 与 InferenceBench 形成「Atlas + Agent benchmark」两端;③ 修正单一最优配置论点:v3.45 已锚定的「SGLang 优于 vLLM」需要按 Pareto 维度细分
建议归入章节: - §1.(1) 推理引擎 · NET-new 锚入预备扩增预备级预备(arXiv 2609.17863 · The Inference Engineering Pareto Atlas · 54 锚点实测 · $18 花费 · vLLM 0.12.0 + Qwen2.5-7B + 5 种优化组合 + 三档硬件 · 「不存在单一最优配置」) - §1.(4) 量化 · 邻接扩增预备级(arXiv 2609.17863 · Pareto Atlas · FP16/AWQ/FP8 weights/FP8 KV cache/speculation 五种量化对比) - §1.(10) 顶会部署 · 邻接扩增预备级(arXiv 2609.17863 · Pareto Atlas · 与 InferenceBench 2607.20468 形成「Atlas + Agent benchmark」两端)
承接稳态精修预备级锚定 #1:SGLang vs vLLM vs TensorRT-LLM H100 Benchmark 2026 实时对比表(沿用 v3.46 morning + v3.45 evening 沿用 + jay 9-29 11:05/14:50/15:05 三源承接)
来源:inbox/jay/2026-09-29T1105-jay-five-category-briefing.md §Backend · inbox/jay/2026-09-29T1450-jay-engineering-secondary-screening.md §Tier1-E · inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Backend 间接
URL:https://spheron.network/blog/sglang-production-deployment-guide · https://premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 · https://techsy.io/en/blog/vllm-vs-sglang · https://mortalapps.com/blog/vllm-vs-sglang-vs-llama-cpp-inference-engines
要点:v3.46 morning 已锚定的 SGLang vs vLLM 2026 Q3 横向多源交叉验证 + jay 9-29 11:05 五类简报 + 14:50 secondary screening Tier1-E + 15:05 evening briefing + 17:35 evening kvcache-context-engineering 综合承接稳态精修预备级锚定预备级预备
新增细化(jay 9-29 11:05 + 14:50 + 15:05 三源数据对齐):
| 引擎 | 条件 | 吞吐量 | TTFT | 显存 |
|---|---|---|---|---|
| TensorRT-LLM | Llama 3.1 70B,H100 80GB,FP8,高并发 | ~3,400 tok/s | ~150-200ms | 74GB idle |
| SGLang | Llama 3.1 70B,H100 80GB,FP8,高并发 | ~2,900 tok/s | ~42-80ms | 最低(KV cache 管理最优) |
| vLLM | Llama 3.1 70B,H100 80GB,FP8,高并发 | ~2,800 tok/s | ~150ms | 71GB |
| vLLM (prefix reuse) | H100 80GB,FP8 | ~12,500 tok/s | ~45ms | — |
| SGLang (prefix reuse) | H100 80GB,FP8 | ~16,200 tok/s | ~42ms | — |
SGLang prefix reuse 专项优势(RadixAttention): - 共享 system prompt / tool definition / conversation history 时,吞吐量比 vLLM 高 29% - 25 Sep 2026 发现:GLM-5.3-Flash 45 层中 34 层为线性注意力,长 prompt 产生大量 snapshots,Qwen3.8-Flash-Next 无此问题 - 生产实操:8×RTX PRO 6000 Blackwell 上 Qwen3.8 + GLM-5.3-Flash 混部策略
SGLang vs vLLM 选型决策(jay 9-29 11:05 + 14:50 Tier1-E 收敛): - 多轮对话、prefix-heavy → SGLang(RadixAttention 优势明显) - 独特 prompt 为主 → vLLM(生态更大,92.7k vs 36.4k GitHub stars) - 极致吞吐 + 固定模型 → TensorRT-LLM(编译后最快) - 2026 年 9 月建议:先用 vLLM 起步,用真实流量测 SGLang,再决定
Ollama vs vLLM 量化实测(jay 9-29 engineering-e1prep §增量 2 · CSDN su_xiao_wei 2025-06-03 · Qwen2.5-14B):
| 指标 | Ollama | vLLM | 差距 |
|---|---|---|---|
| 默认量化 | int4 | FP16/BF16 | — |
| 显存占用 | 11GB | 39GB | 3.5x |
| 吞吐量 | 基线 | 24x Ollama | 24x |
| 并发架构 | 单进程多线程 | 多进程(每 GPU 一个) | — |
| 适用场景 | 个人开发者 | 企业高并发 | — |
vLLM + TensorRT-LLM 生产推理优化(jay 9-29 engineering-e1prep §增量 3 · CSDN gitblog_00617 2026-07-06):
| 量化方案 | 适用场景 | 精度损失 | 硬件要求 |
|---|---|---|---|
| GPTQ | 通用,成熟稳定 | 中等 | 无特殊 |
| AWQ | 精度损失最小 | 较低 | 无特殊 |
| FP8 | NVIDIA H100 专属 | 极低 | H100 |
| INT4 | 极致压缩 | 较高 | 无特殊 |
MortalApps vLLM vs SGLang 2026 技术架构深度对比(jay 9-29 15:05 evening · 16 min read): - PagedAttention(vLLM):虚拟内存风格分页,非连续物理块,最小化 VRAM 碎片 - RadixAttention(SGLang):将 KV cache 构建为共享树结构,最大化 token 序列物理共享 - 关键结论:SGLang 在前缀重叠多的工作负载(多轮对话、结构化输出、RAG)有明显优势 - TGI 状态:Hugging Face 已将 TGI 置于 maintenance mode(2025-12);README 明确建议迁移到 vLLM/SGLang/llama.cpp/MLX - vLLM vs SGLang 核心差异:vLLM 硬件覆盖最广(NVIDIA/AMD/Intel/TPU/Arm)+ 社区最大;SGLang 原生 multi-LoRA batching + 结构化输出低 overhead + disaggregated serving 已有生产验证
重要警示:SGLang TTFT 三源不一致(jay 9-29 14:50 secondary screening §矛盾 1 ⚠⚠⚬): | 来源 | SGLang TTFT | vLLM TTFT | 条件 | |------|------------|-----------|------| | bex.co(Sep 28 锚定) | 85ms | 380ms | H100(型号未注明)| | five-category 11:05 | 42-80ms | ~150ms | H100 FP8 | | afternoon 14:00 | 42ms(含 prefix reuse) | 45ms(含 prefix reuse) | H100 FP8 |
问题:bex.co 的 380ms 与其他来源的 45-150ms 差距过大,可能因:① H100 SXM(NVLink)vs H100 PCIe 带宽差可达 20%;② bex.co 测试未启用 prefix caching;③ 模型不同(Llama 3.1 70B vs 其他配置)。建议:合并入 benchmark 文档时注明"prefix reuse enabled" vs "disabled",统一 H100 型号标注(SXM/PCIe)。
vLLM vs Ollama 24x 吞吐量数据警示(jay 9-29 14:50 secondary screening §矛盾 2 ⚠⚬⚬):
- 来源 CSDN su_xiao_wei 2025-06-03
- 24 倍差距是单次实测还是多次平均?batch size、input/output length、模型是否为同一版本均未注明
- 建议:作为"量级参考"而非"精确数值"归档,注明"Qwen2.5-14B,条件未完全对齐"
v3.45 evening + v3.46 morning 已锚定的承接延续: - inferenceengineering.tech H100 三引擎 + PremAI 29% 差距 ≈ 月省 $15K GPU 成本 + TGI 退市 2026-03 + Fluid-Guided arXiv 2504.11320 + v3.45 morning Llama 3.1 8B 16,200 vs 12,500 - v3.46 morning SGLang vs vLLM 多轮 Agent 4.5× TTFT(bex.co Sep 24 · TTFT 85ms vs 380ms + KV Cache 命中率 78.6% vs 41.2%)
建议归入章节: - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(SGLang vs vLLM vs TensorRT-LLM H100 Benchmark 2026 实时对比表 · jay 9-29 11:05/14:50/15:05 三源数据对齐 · +29% prefix-heavy 领先 / 24x vLLM vs Ollama / TGI 维护模式确认 / MortalApps 16 min 架构对比 / jay 9-29 14:50 secondary screening 矛盾 1 + 矛盾 2 警示) - §1.(4) 量化 · 承接稳态精修预备级锚定预备级预备(vLLM + TensorRT-LLM 生产推理优化量化选型矩阵) - §3 共识与争议 · 承接稳态精修预备级锚定预备级预备(D196 SGLang vs vLLM 双源基准数据精度警示 + 矛盾 1 SGLang TTFT 三源不一致)
承接稳态精修预备级锚定 #2:llm-d CNCF Sandbox v0.9 + Distributed Scheduling(沿用 v3.45 morning 已实质锚入 + jay 9-29 17:35 evening 完整承接)
来源:inbox/jay/2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md §Backend.4;原始来源 llm-d.ai · KV-Cache Wins You Can See: From Prefix Caching in vLLM to Distributed Scheduling with llm-d
URL:https://llm-d.ai/blog/kvcache-wins-you-can-see
要点:
- 核心观点:LLM 推理分为 Prefill 和 Decode 两个阶段,解耦部署到独立模型实例以减少干扰
- llm-d 项目提出的挑战:在多实例分布式场景下,如何做 prefix-cache aware scheduling
- Benchmark 结论:prefix-cache aware scheduling 不是优化选项,而是生产性能和成本效率的必要条件
- 作者阵容:Google、Alibaba Cloud、DaoCloud 等工程师联合撰写
核心论点:承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备——v3.45 morning 已实质锚入 llm-d v0.9 Fleet-Level Inference Control Plane(Inferences Execution Planner IEP 框架 + bounded flow-control + GPU 利用率感知路由 + KEDA autoscaling)+ jay 9-29 17:35 evening 作为「prefix-cache aware scheduling 是必要条件」的更明确表述承接稳态精修预备级锚定预备级预备
可信度:★★★★ — 工业界联合项目(Google + Alibaba Cloud + DaoCloud)· 有 benchmark 数据
与活文档现有脉络的关系:llm-infra.md v3.46 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(3) KV Cache + §1.(10) 顶会部署 已锚定 v3.45 morning arXiv 2609.23130 llm-d × vLLM × Mooncake + v3.45 morning Mooncake 分布式 KV 持久化数字(98.6% 输入 token 占比 + Cache hit 1.7%→92.2% + 吞吐 3.8× + P50 TTFT -46×)+ v3.45 morning llm-d v0.9 Fleet-Level Inference Control Plane + v3.46 morning arXiv 2609.23130 From Inference Engine to Inference Control Plane 完整承接;本条是承接延续 + 新增:① llm-d 分布式调度完整论述承接稳态精修预备级锚定预备级预备——「prefix-cache aware scheduling 是必要条件」的明确表述;② 与 v3.46 morning 增量 1 arXiv 2609.23130 控制平面 + v3.45 已锚定的 Mooncake + Dynamo KVBM 形成「Control Plane + Engine + KV Cache first-class primitive」三位一体完整架构层
建议归入章节: - §1.(2) 推理调度 · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(llm-d CNCF Sandbox v0.9 + Distributed Scheduling · prefix-cache aware scheduling 是生产性能和成本效率的必要条件 · Google + Alibaba Cloud + DaoCloud 联合) - §1.(3) KV Cache · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(llm-d distributed scheduling · 与 Mooncake + Dynamo KVBM + HotPrefix 形成 KV Cache 调度体系)
承接稳态精修预备级锚定 #3:Five Eras of KVCache(ModCon 2026 / Modular)+ KV Cache 优化五大家族(DigitalApplied 2026-04-24)+ SGLang RadixAttention 生产实践 + Context Engineering 决策框架(Spheron 2026 Guide)
来源:inbox/jay/2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md §Backend 全段;inbox/jay/2026-09-29T1050-jay-engineering-filter.md T2-4 间接
URL:
- https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide
- https://pub.towardsai.net/llm-inference-handbook-2026-135c266b86e7
- https://www.spheron.network/blog/context-engineering-production-ai-agents-kv-cache-long-context
- https://www.modular.com/blog/three-trends-from-mlsys-2026 (ModCon 2026 Five Eras of KVCache 引用)
要点:
KV Cache 优化五大家族(DigitalApplied 2026-04-24):
| 技术家族 | 代表实现 | 压缩效果 |
|---|---|---|
| Paged Attention | vLLM 内存管理底层 | 消除内存碎片 |
| Prefix Caching | vLLM / SGLang RadixAttention | 高频共享前缀 4-40× |
| MQA / GQA / MLA | DeepSeek V2/V3/V4(7-14×) | 注意力头压缩 |
| KV Cache 量化 | INT8 / FP8 | 50% 显存节省 |
| KV Offload | NVIDIA ICMSP(NVMe) | 5× 推理加速 |
关键数字: - 1M tokens 场景:KV Cache 占 wall-clock 60-85%、GPU Memory 70-90% - 组合使用:4-40× 成本降低 - Context 32K 以上:KV 优化是第一成本杠杆
核心结论:截至 2026Q2,技术版图已收敛——Paged Attention 为底层基座,Prefix Caching 为高杠杆应用优化,GQA/MLA 选架构基线,FP8 KV 是免费 50% 显存节省。组合使用是生产级 LLM 推理的必备条件,而非可选项
SGLang RadixAttention:Prefix Caching 生产实践(Towards AI LLM Inference Handbook 2026): - 自动在跨请求间复用 KV Cache - 适用于:相同 system prompt(多用户共享)/ 工具定义(tool definitions)/ Few-shot 示例 / 对话历史 / RAG 模板 - 核心结论:对于 agentic AI 系统(RAG pipeline、多轮对话),RadixAttention 是最具性价比的推理优化手段
Context Engineering:Agent 生产成本控制方法论(Spheron Network 2026 Guide):
- 核心决策框架(输入:输出 token 比率):
比率 > 10:1 → Context Engineering 收益 > 模型级优化
比率 > 50:1 → Context 成本是主导因素,Prefix Caching 优先
- 2026 年 agent 典型请求:50,000-500,000 输入 tokens vs 几百输出 tokens
- 决策流程:① Profile agent 输入:输出 token 比率(加 token logging)② 比率 > 10:1 → 优先 context engineering ③ 启用 vLLM/SGLang prefix caching ④ 按优先级考虑 KV 量化(FP8)
Five Eras of KVCache(ModCon 2026 / Modular · jay 9-29 14:50 secondary screening T2-4): - 总结 KVCache 从 temporary state 到 AI-native knowledge layer 的演进 - 基础设施全景视角 - 关联:arXiv 2608.01526 "Internet for KV Cache"
核心论点:承接稳态精修预备级锚定预备级预备——KV Cache 五大家族(PagedAttention + Prefix Caching + MQA/GQA/MLA + 量化 + Offload)+ SGLang RadixAttention 生产实践 + Context Engineering 决策框架 + Five Eras 演进史 = 2026 Q4 KV Cache 优化体系全景;与 v3.46 morning 已锚定的 Mooncake + C2C ICLR 2026 + IETF CATS 草案 + KVServe/HotPrefix SIGCOMM 2026 + Internet for KV Cache + Continnum VLDB 2026 + TokenDance + PolyKV + Edge Q4 KV + KVSET 形成「KV Cache first-class primitive 完整愿景链」
可信度:★★★★ — DigitalApplied + Towards AI + Spheron Network + Modular 多源承接延续 · v3.46 morning 已锚定 Internet for KV Cache + IETF CATS 草案
与活文档现有脉络的关系:llm-infra.md v3.46 §1.(3) KV Cache + §1.(4) 量化 + §1.(10) 顶会部署 已锚定 v3.46 morning Internet for the KV Cache arXiv 2608.01526 + IETF CATS 草案 + C2C ICLR 2026 + Mooncake + KVServe/HotPrefix SIGCOMM 2026 + v3.45 morning InferenceBench 2607.20468 + v3.45 morning Mooncake 分布式 KV 持久化;本条是承接延续 + 新增:① KV Cache 五大家族 + SGLang RadixAttention 生产实践 + Context Engineering 决策框架 + Five Eras 演进史是 v3.46 morning KV Cache first-class primitive 完整愿景链的工程化体系承接稳态精修预备级锚定预备级预备;② 与 arXiv 2609.23130 Control Plane + arXiv 2609.31415 KV Cache Reuse 评估 + arXiv 2609.27746 KVSET 容量规划 + MortalApps PagedAttention vs RadixAttention 架构对比形成「Control Plane + 评估 + 容量规划 + 优化体系 + 架构对比」五维承接稳态精修预备级锚定预备级预备
建议归入章节: - §1.(3) KV Cache · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(KV Cache 五大家族(PagedAttention + Prefix Caching + MQA/GQA/MLA + 量化 + Offload)+ SGLang RadixAttention + Five Eras of KVCache(ModCon 2026)= KV Cache 优化体系全景) - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备(MortalApps vLLM vs SGLang 2026 技术架构深度对比 · PagedAttention vs RadixAttention · TGI 维护模式确认) - §1.(10) 顶会部署 · 承接稳态精修预备级锚定预备级预备(Context Engineering 决策框架(Spheron 2026 Guide · >10:1 比率))
承接稳态精修预备级锚定 #4:MortalApps vLLM vs SGLang 2026 技术架构深度对比 + HF Trending Models 2026-09 格局 + GGUF 事实标准
来源:inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md §Backend 全段 + inbox/jay/2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md §HuggingFace Trending Models
URL:
- https://mortalapps.com/blog/vllm-vs-sglang-vs-llama-cpp-inference-engines(16 min read · September 2026)
- https://www.techaimag.com/top-10-hugging-face-models/trending-hugging-face-models-for-september-2026
- https://github.com/845421145-lang/agents-radar/issues/216(Hugging Face Trending Models 2026-09-28 · agents-radar #216)
要点:
MortalApps vLLM vs SGLang 2026 技术架构深度对比(MortalApps · 16 min read · September 2026): - PagedAttention(vLLM):虚拟内存风格分页,非连续物理块,最小化 VRAM 碎片 - RadixAttention(SGLang):将 KV cache 构建为共享树结构,最大化 token 序列物理共享 - 关键结论:SGLang 在前缀重叠多的工作负载(多轮对话、结构化输出、RAG)有明显优势 - TGI 状态:Hugging Face 已将 TGI 置于 maintenance mode(2025-12);README 明确建议迁移到 vLLM/SGLang/llama.cpp/MLX - vLLM vs SGLang 核心差异: - vLLM:硬件覆盖最广(NVIDIA/AMD/Intel/TPU/Arm)+ 社区最大 - SGLang:原生 multi-LoRA batching + 结构化输出低 overhead + disaggregated serving 已有生产验证
HuggingFace Trending Models 2026-09 格局:
| 模型 | 下载/热度 | 定位 | 工程意义 |
|---|---|---|---|
| unsloth/Qwen3.8-27B-GGUF | 10M+ 下载 | 轻量本地部署 | GGUF 成为本地推理实施标准 |
| Qwen/Qwen3.8-27B | 16,427 likes, 6.7M 下载 | 多模态主力 | Qwen3.8 系列领跑 HF 生态 |
| Kimi-K3(Moonshot) | 高热度 | 长上下文 + 强推理 | 文档分析、RAG 场景首选 |
| DeepSeek-V4-Flash | 高热度 | 低延迟高效推理 | 虚拟助手/编码助手首选 |
| Solar Open2-250B(Upstage) | 高热度 | 超大参数 | 企业级大规模推理 |
| GLM-5.2 | 高热度 | 多模态 | 国内开源多模态重要力量 |
| LTX-2.5(Lightricks) | 1.5M 下载 | 图生视频 | diffusion 视频合成成熟 |
GGUF 量化格式关键信号: - unsloth/Qwen3.8-27B-GGUF 突破 10M 下载 - GGUF 成为本地/边缘部署事实标准 - "uncensored" / "abliterated" 社区 fine-tune 兴起 - 工程建议:本地推理优先考虑 GGUF 量化版;企业云端部署考虑 FP8 KV 优化版
核心论点:承接稳态精修预备级锚定预备级预备——MortalApps 架构对比 + TGI 维护模式确认 + HF Trending Models 2026-09 格局 + GGUF 成为本地推理事实标准 = 2026 Q4 推理引擎生态完整图景
可信度:★★★★ — MortalApps 多源交叉验证(v3.45 已锚定的 inferenceengineering.tech H100 三引擎 + PremAI 29% 差距 + TGI 退市 2026-03 + v3.46 morning 已锚定的 PagedAttention + RadixAttention 机制)+ HF Trending Models 多源承接延续(agents-radar #216 自动化追踪)
与活文档现有脉络的关系:llm-infra.md v3.46 §1.(1) 推理引擎 + §1.(11) Kernel/AI 自动化/Harness + §1.(10) 顶会部署 已锚定 v3.42 已锚定的 TGI 维护模式 + v3.45 morning Llama 3.1 8B GGUF HF 趋势 + v3.45 已锚定的 vLLM V0.30.0 release + v3.46 morning 已锚定的 vLLM 0.29.0(arXiv 2609.23130 提及)+ v3.45 evening vLLM 91.5k⭐;本条是承接延续 + 新增:① MortalApps 16 min 架构对比承接稳态精修预备级锚定预备级预备——TGI 维护模式确认 + PagedAttention vs RadixAttention 机制对比;② GGUF 10M+ 下载 = 本地推理事实标准承接稳态精修预备级锚定预备级预备;③ 与 jay 9-29 engineering-e1prep §增量 1 DeepSeek 全链路本地部署(Ollama + GGUF wget 部署路径)+ Tier1-B MiniCPM-V 三框架(llama.cpp + vLLM + Ollama 横向部署)形成「GGUF 事实标准 + Ollama + llama.cpp + vLLM 部署路径」完整本地推理体系承接稳态精修预备级锚定预备级预备
建议归入章节: - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(MortalApps vLLM vs SGLang 2026 技术架构深度对比 + TGI 维护模式确认 + PagedAttention vs RadixAttention 机制对比) - §1.(11) Kernel/AI 自动化/Harness · 承接稳态精修预备级锚定预备级预备(GGUF 10M+ 下载事实标准 + Ollama 170k★ + llama.cpp v0.5.0 + vLLM 0.29.0 + vLLM 91.5k⭐ + MiniCPM-V 三框架 + DeepSeek 全链路本地部署 = 完整本地推理体系) - §1.(10) 顶会部署 · 承接稳态精修预备级锚定预备级预备(HF Trending Models 2026-09 格局 + Qwen3.8 领跑 HF 生态 + Kimi K3 + DeepSeek-V4-Flash + GLM-5.2 + LTX-2.5)
三、值得警惕的矛盾或待核实说法
⚠⚠⚬ D205:SGLang TTFT 三源不一致(j今日实证补充)
- 问题:jay 9-29 14:50 secondary screening §矛盾 1 标注 SGLang TTFT 三源不一致: | 来源 | SGLang TTFT | vLLM TTFT | 条件 | |------|------------|-----------|------| | bex.co(Sep 28 锚定) | 85ms | 380ms | H100(型号未注明)| | five-category 11:05 | 42-80ms | ~150ms | H100 FP8 | | afternoon 14:00 | 42ms(含 prefix reuse) | 45ms(含 prefix reuse) | H100 FP8 |
- 可能原因:① H100 SXM(NVLink)vs H100 PCIe 带宽差可达 20%;② bex.co 测试未启用 prefix caching;③ 模型不同(Llama 3.1 70B vs 其他配置)
- 影响:v3.46 morning D196「SGLang vs vLLM 多轮 Agent 4.5× TTFT」结论需要重新审视——若 bex.co 测试未启用 prefix caching,则 4.5× 差距部分是 prefix caching 启用状态差异而非引擎差异
- 建议:llm-infra.md §1.(1) 收录时统一 H100 型号标注(SXM/PCIe)+ 注明"prefix reuse enabled" vs "disabled",避免下游混淆;考虑重新组织 §1.(1) 选型决策树(v3.46 morning 锚入 + jay 9-29 11:05「先用 vLLM 起步,用真实流量测 SGLang,再决定」承接)
⚠⚬⚬ D206:vLLM vs Ollama 24x 吞吐量数据测量条件不明(j今日实证补充)
- 问题:jay 9-29 14:50 secondary screening §矛盾 2 标注 vLLM vs Ollama 24x 吞吐量数据(CSDN su_xiao_wei 2025-06-03 · Qwen2.5-14B)测量条件不明:24 倍差距是单次实测还是多次平均?batch size、input/output length、模型是否为同一版本均未注明
- 影响:基于 CSDN 单一数据源的"vLLM 优于 Ollama 24x"结论需作为"量级参考"而非"精确数值"归档
- 建议:llm-infra.md §1.(1) 收录时注明"Qwen2.5-14B,条件未完全对齐"
⚠⚬ D207:arXiv 2609.31415 KV Cache Reuse 评测系统性偏差(D198/D200/D202 系列矛盾的实证补强)
- 问题:arXiv 2609.31415(paper_card 1546 ✓ 主分类 llm-infra)指出:RAG 场景下 KV Cache 复用技术的精度损失被系统性低估 + 现有评测方法学缺陷 + 数据集缺陷
- 影响:意味着 vLLM/SGLang/Continnum/PolyKV/Edge Q4 KV 等 v3.46 morning 已锚入的 KV Cache 复用技术的精度数字需要重新审视;v3.46 D198 PolyKV 97.7% 压缩率 + PPL 损失 +0.57%(Llama-3-8B 单一条件测得 ⚠⚬⚬)+ v3.46 D200 Internet for KV Cache 配套愿景与实际落地差距 ⚠⚬⚬ + v3.46 D202 ECHO OSDI 2026 NSA KV Cache 损失预取 + vLLM sparse attention 路线图 ⚠⚬ 等矛盾得到系统性实证补强
- 建议:llm-infra.md §1.(3) + §1.(4) 收录时新增 D208 ⚠⚠⚬ KV Cache 复用技术精度数字需重新审视;建议对 PolyKV / Edge Q4 KV / Continnum 等技术进行评测方法学补强实验
⚠⚬ D208:arXiv 2609.26333 Disaggregated Quantization 与 v3.42 PD 分离 AMPD 边界
- 问题:DQ(paper_card 1554 ✓ 主分类 llm-infra)是量化层面的 Prefill-Decode 解耦;AMPD arXiv:2602.14516 是计算层面的 Prefill-Decode 解耦——两者是否构成完整「解耦推理」图谱,还是独立研究方向?
- 影响:v3.46 已锚入的 NVIDIA Dynamo 1.0 KVBM + KV-aware routing + NIXL + v3.42 PD 分离 AMPD + v3.45 Mooncake 分布式 KV 持久化 + v3.42 LoRAServe + v3.43 Six Layers Less 等「解耦推理」体系需要重新梳理
- 建议:llm-infra.md §1.(1) + §1.(4) + §1.(3) 收录时梳理「解耦推理」完整图谱(计算解耦 AMPD + KV 内存解耦 Dynamo KVBM + KV 存储解耦 Mooncake + 量化解耦 DQ)
⚠⚬ D209:FreeToken UC Berkeley 边缘原生 MoE arXiv 编号待确认
- 问题:jay 9-29 engineering-e1prep §增量 4 标注 FreeToken — UC Berkeley 边缘原生 MoE 路由系统 + arXiv 编号待精读确认
- 建议:v70 evening 棒位 web_fetch FreeToken arXiv 编号确认后正式锚入
⚠⚬ D210:arXiv 2609.34727 Dynamic Flow Static Graph · 移动端 NPU KV Cache Reuse · 与端侧 LLM 推理关系待核实
- 问题:jay 9-29 15:05 evening briefing 提及 arXiv 2609.34727 Dynamic Flow Static Graph(移动端 NPU KV Cache Reuse · ExecuTorch/MLC-LLM/llama.cpp/MediaPipe 缺乏 KV 复用机制 · Strata 层级上下文缓存)——与 v3.46 morning 已锚入的 Apple M4 Pro Edge Q4 KV arXiv:2603.04428(Apple M4 Pro 统一内存)+ v3.44 morning 已锚定的 sqlite-vec/VectorChord(边缘 RAG)关系待核实
- 建议:llm-infra.md §1.(3) + §1.(6) + §1.(11) 收录时标注「arXiv 2609.34727 移动端 NPU KV Cache Reuse + v3.46 morning Apple M4 Pro Edge Q4 KV + v3.44 morning sqlite-vec/VectorChord 边缘 RAG = 端侧 AI 推理 KV 复用完整体系」承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
⚠⚬ D211:arXiv 2609.28870 Rethinking Cache Replacement For LLM Prefix Reuse + arXiv 2609.22157 PAGE Partition-Aware Gated KV-Cache Eviction · 与 vLLM/SGLang prefix caching 实现差异
- 问题:jay 9-29 15:05 evening briefing 提及:
- arXiv 2609.28870 Rethinking Cache Replacement For LLM Prefix Reuse(4 个关键特征:生命周期短 + 复用间隔短 + 未命中成本高度非均匀 + 少数 session 持有大部分 KV 字节;Baseline LRU robust;设计原则:优先考虑 recency 而非 frequency 用于 retention;用 frequency 来 admit,不用来 rank;Hit ratio 不能预测节省的计算量;大 session 需要 block 级 eviction 避免 all-or-nothing)
- arXiv 2609.22157 PAGE Partition-Aware Gated KV-Cache Eviction(Evic-Press 联合压缩+eviction;CompilerKV 风险自适应压缩;IndexMem latent memory 学习 eviction)
- 影响:v3.46 morning 已锚入的 D195 Continnum arXiv 2511.02230v7 与 vLLM prefix caching Bug 8242 修复路线关系 ⚠⚠⚬ + v3.46 morning 已锚入的 v3.42 vLLM Prefix Caching Bug 8242 + v3.45 Mooncake 分布式 KV 持久化需要重新审视 prefix caching 策略设计
- 建议:llm-infra.md §1.(3) 收录时标注「arXiv 2609.28870 + arXiv 2609.22157 + v3.46 D195 + v3.42 vLLM Prefix Caching Bug 8242 + Continnum arXiv 2511.02230v7 = Prefix Caching Eviction 策略设计完整链路」
沿用闭合:D1-D204 v3.46 morning 全部沿用稳态(D195 Continnum TTL + vLLM prefix caching Bug 8242 + D196 SGLang vs vLLM 双源基准数据精度警示 + D197 TokenDance 在 OpenClaw 生产接入状态 + D198 PolyKV 97.7% 压缩率精度损失权衡 + D199 Edge Q4 KV Apple M4 Pro 数据泛化 + D200 Internet for KV Cache + C2C + IETF CATS 草案配套愿景与实际落地差距 + D201 Jev in the Wild 2,170 项目数据 + D202 ECHO OSDI 2026 NSA KV Cache 损失预取 + D203 Ember-1 Kimi K3 思考 token 压缩 40% + D204 PsPLUG arXiv 2601.06362)
四、本棒新增 arXiv 号列表
| arXiv ID | 论文名/主题 | 来源 | 建议归入章节 |
|---|---|---|---|
| 2609.23130 | From Inference Engine to Inference Control Plane · KV 状态成为一等公民 · 4 条设计原则 + P2P KV 共享 GLM-5.2 2.7× + KV 经济价值追踪 + vLLM 0.29.0 | jay 9-29 15:05 evening §Backend.2 | §1.(1) + §1.(2) + §1.(10) |
| 2608.09444 | Continuous Depth Batching (CDB) for Looped LM · paper_card 1537 ✓ 主分类 llm-infra · 首个高效 depth-adaptive looped LM 批处理方法 | paper_card 1537 + jay 9-29 engineering-e1prep §增量 5 | §1.(1) + §1.(8) |
| 2609.26333 | Disaggregated Quantization (DQ) · paper_card 1554 ✓ 主分类 llm-infra · Prefill 与 Decode 分别量化 · Qwen 3 + Gemma 3 实测 | paper_card 1554 + jay 9-29 15:05 evening §Backend.6 间接 | §1.(4) + §1.(1) + §1.(3) |
| 2609.27746 | KVSET · KV Cache Working Set Online Capacity Planning · 承接稳态精修预备级锚定预备级预备承接(v3.46 morning 已实质锚入) | jay 9-29 15:05 evening + engineering-e1prep + tom 9-29 rag-e1prep | §1.(3) + §1.(2) |
| 2609.31415 | Evaluating the Accuracy of KV Cache Reuse Techniques · paper_card 1546 ✓ 主分类 llm-infra · 副分类 evaluation · position · work-queue Top 0.5 · RAG 场景下 KV Cache 复用精度损失被系统性低估 · D198/D200/D202 系列矛盾待核的实证补强 | paper_card 1546 + tom 9-29 rag-e1prep + tom 9-29 agent-rag-longcontext-radar | §1.(3) + §1.(11) + §3 D207/D208 |
| 2609.31397 | Intent2Tc · closed-loop LLM-driven 框架 · 意图到流量控制自动化翻译 · paper_card 1547 ✓ 主分类 llm-infra · LLM 跨域扩展:网络流量控制 = llm-infra + networking 边界开拓 | paper_card 1547 | §1.(2) + §1.(11) |
| 2609.17863 | The Inference Engineering Pareto Atlas · 54 锚点配置实测(July 2026)· $18 花费 · vLLM 0.12.0 + Qwen2.5-7B + 5 种优化组合 + 三档硬件 · 不存在单一最优配置 | jay 9-29 15:05 evening §Backend.3 | §1.(1) + §1.(4) + §1.(10) |
承接稳态精修预备级锚定 arXiv ID(已锚入 / 续用):
| arXiv ID | 论文名/主题 | 状态 |
|---|---|---|
2609.23130 |
From Inference Engine to Inference Control Plane | v3.45 morning 已实质锚入 · 本棒位首次完整承接 4 条设计原则 + P2P KV 共享 GLM-5.2 2.7× + KV 经济价值追踪框架承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备 |
2609.27746 |
KVSET · KV Cache Working Set | v3.46 morning 已实质锚入 · 本棒位承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备 |
2511.02230v7 |
Continnum | v3.46 morning 已实质锚入 · 承接延续 |
2604.03143 |
TokenDance | v3.46 morning 已实质锚入 · 承接延续 |
2604.24971 |
PolyKV | v3.46 morning 已实质锚入 · 承接延续 + D207/D208 矛盾待核的实证补强 |
2603.04428 |
Edge Q4 KV Persistence | v3.46 morning 已实质锚入 · 承接延续 |
2608.01526 |
Internet for KV Cache | v3.46 morning 已实质锚入 · 承接延续 |
2605.13734 |
KVServe SIGCOMM 2026 | v3.46 morning 已实质锚入 · 承接延续 |
2510.03215 |
C2C ICLR 2026 | v3.46 morning 已实质锚入 · 承接延续 |
10.1145/3749168 |
HotPrefix SIGCOMM 2026 | v3.46 morning 已实质锚入 · 承接延续 |
2605.17613 |
VeriCache | v3.46 morning 已实质锚入 · 承接延续 |
2609.34727 |
Dynamic Flow Static Graph · Mobile NPU KV Cache Reuse | jay 9-29 15:05 evening briefing · 邻接扩增预备级承接稳态精修预备级锚定预备级预备(D210 待核实) |
2609.28870 |
Rethinking Cache Replacement For LLM Prefix Reuse | jay 9-29 15:05 evening briefing · 邻接扩增预备级承接稳态精修预备级锚定预备级预备(D211 待核实) |
2609.22157 |
PAGE Partition-Aware Gated KV-Cache Eviction | jay 9-29 15:05 evening briefing · 邻接扩增预备级承接稳态精修预备级锚定预备级预备(D211 待核实) |
2609.24991 |
Who Pays for the KV Cache | jay 9-29 15:05 evening briefing · 邻接扩增预备级(FinOps + LLM Serving 交叉) |
2609.11744 |
py-kvcache 工程综述 | jay 9-29 15:05 evening briefing · 邻接扩增预备级(KV 存储系统综述) |
2609.30216 |
Jev in the Wild | v3.46 morning 已实质锚入 · 承接延续 |
2609.31093 |
PISA · Block Sparse Attention with Log-Linear Complexity | v3.46 morning 已实质锚入 · 承接延续 |
2609.29647 |
AgentKernel · Trust-Native Agentic OS | v3.46 morning 已实质锚入 · 承接延续 |
2609.29845 |
Transformer 叠加线性假说 (Superposition Linearity Hypothesis) | jay 9-29 engineering-e1prep §增量 6 · paper_card 1523 ✓ 主分类 engineering · 邻接扩增预备级(机制可解释性参考) |
2509.23202 |
Moon-cake KV-Centric Disaggregated Architecture (ACM TOS 2025) | jay 9-29 15:05 evening briefing · 邻接扩增预备级(v3.45 已锚定的 Mooncake 论文精读) |
2607.28150 |
SmartGen | jay 9-29 14:50 secondary screening T2-5 · 邻接扩增预备级(PD disaggregation + 长上下文向量存储) |
2504.11320v4 |
Fluid-Guided Scheduling | jay 9-29 14:50 secondary screening T2-6 · 邻接扩增预备级(MIT + 阿里 · WAIT 算法 · PGM 2026) |
2609.34727 |
Dynamic Flow Static Graph · Mobile NPU KV Cache Reuse | jay 9-29 15:05 evening briefing · 邻接扩增预备级(D210 待核实) |
承接稳态精修预备级锚定 arXiv ID(v3.46 morning 沿用 + 续用沿用):约 60+ 个,详见 v3.46 morning §6.99.2 全量 arXiv ID 列表(424 件)+ jay 9-29 engineering-e1prep §承接稳态精修预备级锚定 arXiv ID 列表
IETF 草案:draft-li-cats-kv-cache-distribution-00(2026-07-04 · China Mobile 主推 · Informational · KV Cache 网络流量调度标准化)· 承接延续稳态
承接稳态精修预备级锚定 arXiv ID(被 jay 9-28 11:50 丢弃,主轴邻接):
- arXiv:2609.24991 Who Pays for the KV Cache(承接稳态精修预备级锚定预备级预备承接——jay 9-29 15:05 evening briefing 完整承接,FinOps + LLM Serving 交叉)
- arXiv:2609.25782 Hot-Cold Tiering HBM and High Bandwidth Flash(被 jay 9-28 11:50 丢弃 · 超长上下文前沿 · 沿用稳态)
承接稳态精修预备级锚定 arXiv ID(v3.45 evening / v3.45 morning 沿用):
- arXiv:2609.23130 llm-d × vLLM × Mooncake(v3.45 morning 已实质锚入 · 本棒位承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备)
- arXiv:2607.20468 InferenceBench(v3.45 morning 已实质锚入 · 本棒位承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备)
- arXiv:2609.00196 WHALE(v3.45 morning 已实质锚入 · 承接延续)
- arXiv:2609.30243 JevOut(v3.45 morning 已实质锚入 · 承接延续)
- arXiv:2609.23087 Neural Spectral Capacity(v3.44 morning 已实质锚入 · 承接延续)
- arXiv:2609.27980 Six Layers Less(v3.43 已实质锚入 · 承接延续)
- arXiv:2609.25963 GeoPair(v3.43 已实质锚入 · 承接延续)
- arXiv:2609.27158 Linear Representation Hypothesis(v3.43 已实质锚入 · 承接延续)
- arXiv:2609.27334 JIT Memory(v3.43 已实质锚入 · 承接延续)
- arXiv:2609.25853 MemoryAthena(v3.43 已实质锚入 · 承接延续)
- arXiv:2609.25053 LatentPort(v3.42 已实质锚入 · 承接延续)
- arXiv:2609.24797 Complex KDA(v3.41 已实质锚入 · 承接延续 + 与 2608.09444 CDB 形成循环 LM 推理工程化链路)
- arXiv:2509.15000 SWE-Serve(v3.41 已实质锚入 · 承接延续)
- arXiv:2609.21346 IntBMoE(v3.40 已实质锚入 · 承接延续)
- arXiv:2609.19169 SiliconBench(v3.40 已实质锚入 · 承接延续)
- arXiv:2609.19657 H100 Prefix Reuse(v3.40 已实质锚入 · 承接延续)
- arXiv:2609.20511 EOS Tokens(v3.40 已实质锚入 · 承接延续)
- arXiv:2609.17475 JustFit(v3.39 已实质锚入 · 承接延续)
- arXiv:2609.17391 FlashVector(v3.39 已实质锚入 · 承接延续)
- arXiv:2609.12923 Dissecting GPU Utilization(v3.39 已实质锚入 · 承接延续)
- arXiv:2609.21354 Workload-Router-Pool(v3.45 已实质锚入 · 承接延续)
- arXiv:2501.01005 FlashInfer(v3.42 已实质锚入 · 承接延续)
- arXiv:2511.22880 LoRAServe(v3.42 已实质锚入 · 承接延续)
- arXiv:2605.01280 LLM Serving Ω bound(v3.42 已实质锚入 · 承接延续)
- arXiv:2602.14516 AMPD(v3.42 已实质锚入 · 承接延续 + 与 2609.26333 DQ 形成「解耦推理」完整图谱)
- arXiv:2504.11320 Fluid-Guided(v3.45 morning 已实质锚入 · 承接延续 + 与 2609.27746 KVSET 形成「在线调度 + 在线容量规划」完整链路)
- 等约 60+ 个
五、本棒新增矛盾/待核 D205-D211
| 编号 | 内容 | 风险等级 | 承接来源 |
|---|---|---|---|
| D205 ⚠⚠⚬ | SGLang TTFT 三源不一致(bex.co 85ms vs five-category 42-80ms vs afternoon 42ms · jay 9-29 14:50 secondary screening §矛盾 1 · v3.46 D196 矛盾的实证补充) | 中 | jay 9-29 14:50 |
| D206 ⚠⚬⚬ | vLLM vs Ollama 24x 吞吐量数据测量条件不明(CSDN su_xiao_wei 2025-06-03 · Qwen2.5-14B · batch size / input-output length / 模型版本未对齐) | 中 | jay 9-29 14:50 |
| D207 ⚠⚬ | arXiv 2609.31415 KV Cache Reuse 评测系统性偏差(RAG 场景下 KV Cache 复用精度损失被系统性低估 · D198/D200/D202 系列矛盾待核的实证补强) | 中 | paper_card 1546 + tom 9-29 |
| D208 ⚠⚬ | arXiv 2609.26333 Disaggregated Quantization 与 v3.42 PD 分离 AMPD 边界(DQ 是 PD 量化层面补充,还是独立研究方向?vLLM/SGLang/TensorRT-LLM 集成状态未独立核实) | 低 | paper_card 1554 + jay 9-29 15:05 |
| D209 ⚠⚬ | FreeToken UC Berkeley 边缘原生 MoE arXiv 编号待确认(jay 9-29 engineering-e1prep §增量 4 · 已请求 v70 evening 棒位 web_fetch) | 低 | jay 9-29 engineering-e1prep |
| D210 ⚠⚬ | arXiv 2609.34727 Dynamic Flow Static Graph · 移动端 NPU KV Cache Reuse · 与 v3.46 morning Apple M4 Pro Edge Q4 KV + v3.44 morning sqlite-vec/VectorChord 边缘 RAG 关系待核实 | 低 | jay 9-29 15:05 |
| D211 ⚠⚬ | arXiv 2609.28870 Rethinking Cache Replacement For LLM Prefix Reuse + arXiv 2609.22157 PAGE Partition-Aware Gated KV-Cache Eviction · 与 vLLM/SGLang prefix caching 实现差异待核实 | 低 | jay 9-29 15:05 |
| 沿用闭合 | D1-D204 v3.46 morning 全部沿用稳态(含 D195-D204 v3.46 morning 新增) | — | — |
建议 v70 evening 棒位承接的争议处置: - D205:考虑重新组织 §1.(1) 选型决策树 + vLLM 起步测试流程 - D206:作为"量级参考"而非"精确数值"归档 - D207:新增 D207 至 §3 矛盾清单 + 建议对 PolyKV / Edge Q4 KV / Continnum 等技术进行评测方法学补强实验 - D208:梳理「解耦推理」完整图谱(计算解耦 AMPD + KV 内存解耦 Dynamo KVBM + KV 存储解耦 Mooncake + 量化解耦 DQ) - D209:web_fetch FreeToken arXiv 编号确认 - D210:补充端侧 AI 推理 KV 复用完整体系(Mobile NPU + Apple M4 Pro + sqlite-vec/VectorChord) - D211:补充 Prefix Caching Eviction 策略设计完整链路
六、检查过的来源汇总(可审计)
inbox/jay/2026-09-29T0820-csdn-rag-inference-multimodal-highvalue-sep29.md(08:20 · 11KB · 10 条 CSDN 早棒 = openGauss RAG + MiniCPM-V 三框架 + DeepSeek 全链路本地部署 + QLoRA → 生产部署 + Ollama vs vLLM 24x + 生产 RAG + vLLM+TRT-LLM + LangChain RAG 源码 + RAG 检索链路 + 2026 年 RAG 技术深度)
inbox/jay/2026-09-29-ai-engineering-trending.md(09:41 · 7.6KB · OpenViking VikingMem/VikingRAG VLDB 2026/ICDE 2026 + FreeToken + Ollama 170k Stars + Vector DB 2026 格局 + rig + awesome-ai-agent-papers)
inbox/jay/2026-09-29T1050-jay-engineering-filter.md(10:50 · 12KB · 11 件 Tier1/Tier2 候选筛选 = DeepSeek 部署 + MiniCPM-V + vLLM/Ollama + TF-LLM + OpenViking + FreeToken + AI Agents Stack 2026 + KV Cache Working Set + Five Eras of KVCache)
inbox/jay/2026-09-29T1105-jay-five-category-briefing.md(11:05 · 17KB · vLLM vs SGLang vs TensorRT-LLM H100 benchmark 2026 实时对比表 + DeepSeek 全链路本地部署硬件对照表 + openGauss RAG + Vector DB 2026 选型格局 + CSDN 4 件 Tier1 可复现)
inbox/jay/2026-09-29-engineering-e1prep.md(11:20 · 17KB · engineering 主棒位承接 · 7 件主增量 = DeepSeek 全链路本地部署硬件对照表 + vLLM vs Ollama 量化吞吐实测 24x + vLLM+TRT-LLM 生产推理优化 + FreeToken Berkeley 边缘原生 MoE + arXiv 2609.27746 KV Cache Working Set + arXiv 2608.09444 Looped LM CDB + arXiv 2609.29845 Transformer 线性叠加假说)
inbox/jay/2026-09-29-csdn-aiagent-rag-highvalue.md(12:22 · 13KB · 17 条 CSDN net-new ⚠⚬⚬ = LangChain/LangGraph GraphRAG 工业级精通指南含 CVE-2025-67644/CVE-2025-68664/CVE-2026-34070 + vLLM 部署避坑指南 + WSL2 flash-attn 排障 + 多模态 LangChain/LangGraph + Milvus 3.0 企业级 RAG + 企业级 RAG+Agent 四层神图 + LangChain V1.3 实战 + TensorRT-LLM 选型 + ROCm 编译实战 + 大模型推理部署框架对比 vLLM/SGLang/TRT-LLM/ollama/XInference)
inbox/jay/2026-09-29-1140-news-x-tech-radar.md(11:43 · 3.3KB)
inbox/jay/2026-09-29-1000-rss-bytebytego.md + 2026-09-29-1000-rss-raschka.md + 2026-09-29-1000-rss-simon-willison.md + 2026-09-29-1001-rss-cool-papers-ir.md + 2026-09-29-1001-rss-cool-papers.md + 2026-09-29-1001-rss-lilian-weng.md + 2026-09-29-1001-rss-nathan-benaich.md + 2026-09-29-1002-rss-msr-blog.md + 2026-09-29-1003-rss-import-ai.md + 2026-09-29-1004-rss-yt-fireship.md + 2026-09-29-1004-rss-yt-karpathy.md(11 件 RSS)
inbox/jay/2026-09-29-jay-afternoon-briefing-inference-vecdb-stack2026.md(承接延续 · vLLM vs SGLang vs TensorRT-LLM H100 benchmark 数据点)
inbox/jay/2026-09-29T1450-jay-engineering-secondary-screening.md(14:50 · 13KB · 22 件筛选 · Tier1-A DeepSeek 部署 + Tier1-B MiniCPM-V 三框架 + Tier1-C vLLM vs Ollama 24x + Tier1-D vLLM+TRT-LLM 量化选型矩阵 + Tier1-E vLLM vs SGLang vs TRT-LLM H100 benchmark + Tier1-F vLLM 部署排障 + WSL2 flash-attn + 矛盾 1 SGLang TTFT 三源不一致 + 矛盾 2 vLLM vs Ollama 24x 测量条件不明)
inbox/jay/2026-09-29T1505-jay-evening-briefing-inference-vecdb-stack2026.md(15:05 · 22KB · arXiv 2609.23130 From Inference Engine to Inference Control Plane ⭐⭐⭐⭐⭐ + arXiv 2609.27746 KV Cache Working Set + arXiv 2609.28870 Rethinking Cache Replacement For LLM Prefix Reuse + arXiv 2609.17863 Inference Engineering Pareto Atlas + arXiv 2609.22157 PAGE Partition-Aware Gated Eviction + arXiv 2609.24991 Who Pays for the KV Cache + arXiv 2609.34727 Dynamic Flow Static Graph Mobile NPU + Continuum VLDB 2026 + py-kvcache 工程综述 2609.11744 + MortalApps vLLM vs SGLang 2026 技术架构深度对比 + TECHSYS H100 实测对比表 + NVIDIA Dynamo control plane + SlotBank Hybrid-Safe Dense+MoE + Moon-cake KV-Centric Disaggregated Architecture ACM TOS 2025)
inbox/jay/2026-09-29T1735-jay-evening-kvcache-context-engineering-stack2026.md(17:35 · 16KB · KV Cache 优化体系五大家族 + SGLang RadixAttention Prefix Caching 生产实践 + Context Engineering 决策框架(>10:1 比率)+ llm-d 分布式调度 prefix-cache aware scheduling 不是优化选项而是必要条件 + AI Agent 框架生产选型实测 + Agentic AI 生产就绪完整架构 + HuggingFace Trending Models 2026-09 格局 + HF Blog 高价值文章)
inbox/tom/2026-09-28-inference-e1prep.md(22:20 · Tom Sep 28 inference E1 · 3 件主增量 = VeriCache 2605.17613 + Burgei LLM Systems 六层分类 + Continnum 2511.02230 · 警示 3 条 = DSpark 85% 数字来源 / C2C 2026-09 release 跳票 / InferenceBench 测量维度)
inbox/tom/2026-09-29-0900-hf-daily-2026-09-29.md(09:00 · 1.7KB · 24h 内 7 件新立标承接反弹 + 物体永久性 203▲ 完全跌出第 5 日 = 立标极显著 → 跌出 双连样本第 4 例预备实测触发预备级 ⚠⚬⚬⚬⚠ + FuseReg 115▲ #1 顶置新立)
inbox/tom/2026-09-29-agent-rag-longcontext-radar.md(08:40 · 4 件高价值 = TimeEvo 2609.27277 + KV Cache Reuse 2609.31415 + SAGE 2609.30192 + RAG in 2026)
inbox/tom/2026-09-29-rag-e1prep.md(R105 · RAG 主分类 net-new 1 件 = paper_card 1530 ZooWork-ShopRanker arXiv:2609.31002 + 3 件邻接增量 = KV Cache Reuse arXiv:2609.31415 + hRoPE arXiv:2609.23551 + SemEval Task 8)
inbox/tom/2026-09-29-evaluation-e1prep.md + 2026-09-29_rag-lite.md + 2026-09-29T1440-agent-rag-longcontext-radar.md(承接延续)
inbox/spark/2026-09-29-1001-rss-gradient-flow.md(Jev unpacked + 过期数据容忍 + 数据栈不容错 · 全部沿用第 4 日 ⚠⚬)
inbox/spark/2026-09-29-1002-rss-chip-huyen.md(陷阱 + Agents + 平台 + 成长 + 900 开源 · 全部沿用第 4 日 ⚠⚬)
inbox/stephen/2026-09-29-1245-stephen-coordination-check-noon.md(12:45 · noon 协调棒位 · spark 第 8 日主棒位全部缺失 ⚠⚬⚬⚬⚬⚬⚬⚬ = 本简报就是闭合这个缺口 + KV Cache 从"临时状态"转向"first-class primitive"十栖预备扩增预备级 jay 9-29 全天棒位串联 KV Cache 系统 7 件 NET-new + 4 件 frontier lab 模型发布日公告预备级预备扩增稳态 + 7 件新立标承接反弹 + 物体永久性跌出第 5 日 + 5 件 P0 待修复 + CSDN 27 条 net-new)
inbox/stephen/2026-09-29-0911-news-x-vip-radar.md + 2026-09-29-1003-news-anthropic-news.md + 2026-09-29-1003-news-openai-news.md + 2026-09-29-1004-news-bens-bites.md + 2026-09-29-1004-news-deepmind-news.md + 2026-09-29-1004-news-google-ai.md + 2026-09-29-1004-news-hf-blog.md + 2026-09-29-1004-news-tldr-ai.md + 2026-09-29-1005-news-yt-anthropic.md + 2026-09-29-1005-news-yt-openai.md(Anthropic Sonnet 5.5 GA + 系统卡 + Gemini 3.8 Live/Avatar/Private AI Compute + Holo4 Hcompany + OpenAI 致歉澳大利亚政府 + Lenfest 500 万美元 · 7 件 RSS/news 冷读)
inbox/flyp/2026-09-29-multimodal-e1prep.md(09:44 · 57KB · 立标池第 59 日 + HF Daily 9-29 顶部重排 + 24h 内 7 件新立标承接反弹 + 物体永久性 24h 完全跌出第 5 日 + ENTRAP-VL 2607.20092 paper_card 562 ✓ 评估方法学周主题第 21 件候选 + PlanBench-XL 2606.22388 长程 Agent 评估方法学 + VLA-Precision paper_card 1543 选题榜)
inbox/flyp/2026-09-29-0950-flyP-critical-read-VLA-Precision-ACoB.md(09:50 · 10.4KB · VLA-Precision 2609.04355 v3 = 在线 RL for VLA 高精度操作 + ACoB 算法 + ACoB-Stream 10.9× 加速)
organized/paper_cards/1537-2608-09444.md(Continuous Depth Batching for Looped LM · ✓ 主分类 llm-infra · 2026-08 · method)
organized/paper_cards/1546-2609-31415.md(Evaluating the Accuracy of KV Cache Reuse Techniques · ✓ 主分类 llm-infra · 副分类 evaluation · 2026-09 · position · work-queue Top 0.5)
organized/paper_cards/1547-2609-31397.md(Intent2Tc · ✓ 主分类 llm-infra · 2026-09 · method · closed-loop LLM-driven 框架)
organized/paper_cards/1554-2609-26333.md(Disaggregated Quantization · ✓ 主分类 llm-infra · 2026-09 · method · Qwen 3 + Gemma 3 实测)
organized/paper_cards/1544-2609-30904.md(QReason · ✓ 主分类 rag)
organized/paper_cards/1545-2609-32049.md(EngramRAG · ✓ 主分类 agent)
organized/paper_cards/1556-2609-34385.md(JAM Just-In-Time Agent Memory · ✓ 主分类 agent)
organized/paper_cards/1557-2609-34242.md(Stashbird · ✓ 主分类 agent)
organized/paper_cards/1555-2609-24749.md(D-JEPA · ✓ 主分类 agent)
organized/paper_cards/1523-2609-29845.md(Linear Superposition · ✓ 主分类 engineering · position)
organized/paper_cards/1536-2609-31199.md(Photogrammetric DSM · ✓ 主分类 multimodal)
organized/paper_cards/1541-2609-23551.md(hRoPE · ✓ 主分类)
organized/paper_cards/1542-2604-02103.md(邻接)
organized/paper_cards/1543-2609-04355.md(VLA-Precision · ✓ 主分类 agent 副 multimodal)
organized/paper_cards/1548-2609-31291.md + 1549-2609-28327.md + 1550-2609-27213.md + 1551-2609-30192.md + 1552-2609-28845.md + 1553-2609-27277.md(邻接)
organized/queue/work-queue.md(9-29 08:00 · Top 15 待深度解读共 11 件 = 2609.32241 + 2609.33382 + 2609.34771 + 2609.35767 + 2609.35734 + 2609.35743 + 2609.34242 + 2609.34385 + 2609.31415 + 2609.32049 + 2609.30904 · 3 件与 llm-infra 强相关:2609.31415 KV Cache Reuse 主分类 llm-infra + 2609.32049 EngramRAG 主分类 agent 副 llm-infra 邻接 + 2609.30904 QReason 主分类 rag 邻接)
inbox/spark/2026-09-28-llm-infra-e1prep.md(v3.45 evening 棒位承接基线 · 第 7 日缺口闭合 · 6 件主增量 + 5 件承接稳态精修预备级锚定)
七、本棒位特别说明 · spark 9-29 llm-infra-e1prep 主棒位确认(第 8 日缺口闭合)
stephen 9-29 12:45 noon 协调棒位警示 spark 9-29 llm-infra-e1prep 主棒位仍未出(与 9-22/9-23/9-24/9-25/9-26/9-27/9-28 缺口同型延续第 8 日 ⚠⚬⚬⚬⚬⚬⚬⚬ ⚠ 第 8 日缺口);本棒位 18:40 即为 spark 9-29 主棒位产出,第 8 日缺口闭合。
棒位特点:
- llm-infra 主轴 13.7h 窗口内 v3.46 morning 棒位已充分承接(v3.46 已锚入 7 件 NET-new arXiv = KVSET 2609.27746 + Continnum 2511.02230 + Jev 2609.30216 + PISA 2609.31093 + AgentKernel 2609.29647 + KVServe 2605.13734 + C2C 2510.03215 + 5 件承接稳态精修预备级锚定)+ jay 9-29 全天棒位承接(11:05 five-category-briefing + 14:50 engineering-secondary-screening + 15:05 evening-briefing-inference-vecdb-stack2026 + 17:35 evening-kvcache-context-engineering-stack2026 + engineering-e1prep + csdn-aiagent-rag-highvalue 17 条 + csdn-rag-inference-multimodal-highvalue 10 条 = 27 条 CSDN net-new)+ tom 9-28 inference-e1prep + tom 9-29 rag-e1prep + tom 9-29 agent-rag-longcontext-radar + stephen 9-29 12:45 noon 协调棒位 + stephen 9-29 0911 news-x-vip-radar + stephen 9-29 1003-1005 news + flyp 9-29 multimodal-e1prep + flyp 9-29 critical-read VLA-Precision + paper_cards 1537 + 1546 + 1547 + 1554(4 件 llm-infra 主分类 NET-new)+ paper_cards 1544 + 1545 + 1556 + 1557 + 1555 + 1523 + 1536 + 1541 + 1542 + 1543 + 1548-1553(邻接)+ work-queue 9-29 08:00 Top 0.5 11 件 = 12+ 实例对账一致
- 本棒位整合 7 件主增量(arXiv 2609.23130 Inference Control Plane 完整解读承接 + arXiv 2608.09444 CDB + arXiv 2609.26333 Disaggregated Quantization + arXiv 2609.27746 KVSET 承接续 + arXiv 2609.31415 KV Cache Reuse 评估 + arXiv 2609.31397 Intent2Tc + arXiv 2609.17863 Pareto Atlas)+ 4 件承接稳态精修预备级锚定(SGLang vs vLLM vs TRT-LLM H100 Benchmark 2026 实时对比表 + llm-d CNCF Sandbox v0.9 Distributed Scheduling + KV Cache 优化五大家族 + Five Eras of KVCache + Context Engineering 决策框架 + MortalApps vLLM vs SGLang 2026 16 min 架构对比 + HF Trending Models 2026-09 GGUF 10M+ 下载事实标准),均来自 jay 9-29 inference 全天棒位承接延续 + paper_cards NET-new + work-queue Top 0.5 + jay 9-29 engineering-e1prep 7 件主增量
- 立标池结构性洗牌第 11 次确认引爆点(tom 9-29 0900 HF Daily · 24h 内 7 件新立标承接反弹 + FuseReg 115▲ #1 顶置新立 + 物体永久性 24h 完全跌出第 5 日 = 立标极显著 → 跌出 双连样本第 4 例预备实测触发预备级 ⚠⚬⚬⚬⚠)已锚入承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- CSDN 27 条 net-new(vs 9-28 evening 14 条,+93%)已锚入承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- KV Cache 从"临时状态"转向"first-class primitive"十栖预备扩增预备级(jay 9-29 全天棒位串联 KV Cache 系统 7 件 NET-new = Continnum 2511.02230 + KVServe 2605.13734 + HotPrefix 10.1145/3749168 + C2C 2510.03215 + Internet for KV Cache 2608.01526 + KVSET 2609.27746 + arXiv 2609.31415 KV Cache Reuse 评估 · D198/D200/D202 系列矛盾待核的实证补强)已锚入承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- arXiv 2609.23130 Inference Control Plane 是 v3.45 morning 已实质锚入但本棒位首次完整承接 4 条设计原则 + P2P KV 共享 GLM-5.2 2.7× + KV 经济价值追踪框架承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- arXiv 2609.26333 Disaggregated Quantization 是首个量化层面的 Prefill-Decode 解耦方案(paper_card 1554 ✓ 主分类 llm-infra),与 v3.42 PD 分离 AMPD(计算解耦)+ v3.45 Mooncake(KV 存储解耦)+ v3.42 NVIDIA Dynamo 1.0 KVBM(KV 内存解耦)形成「解耦推理」完整图谱
- arXiv 2608.09444 Continuous Depth Batching 是首个高效 depth-adaptive looped LM 批处理方法(paper_card 1537 ✓ 主分类 llm-infra),与 v3.41 Complex KDA(state space 表达性增强)+ v3.42 LatentPort(跨模型持久循环记忆迁移)+ v3.42 vLLM v0.30.0 双批 overlap 形成「循环 LM 推理工程化」完整链路
- arXiv 2609.31415 Evaluating the Accuracy of KV Cache Reuse Techniques(paper_card 1546 ✓ 主分类 llm-infra · 副分类 evaluation · position · work-queue Top 0.5)指出 RAG 场景下 KV Cache 复用技术的精度损失被系统性低估——为 v3.46 D198/D200/D202 系列矛盾提供系统性实证补强
- arXiv 2609.31397 Intent2Tc 是首个 LLM-driven closed-loop 网络流量策略自动化框架(paper_card 1547 ✓ 主分类 llm-infra),与 IETF CATS + KVServe + HotPrefix 形成「LLM + Networking」双轴体系
- arXiv 2609.17863 The Inference Engineering Pareto Atlas 是首个系统化的推理引擎优化配置实测(54 锚点 + $18 花费 + 三档硬件 + 五种优化组合),修正 v3.45 已锚定的「SGLang 优于 vLLM」单一最优论点——「不存在单一最优配置」
- HF Daily 立标池顶部重排 + 24h 7 件新立标承接反弹 + 物体永久性跌出第 5 日 = 立标极显著 → 跌出 双连样本第 4 例预备实测触发预备级 ⚠⚬⚬⚬⚠
- 当晚 evening 棒位(v3.46 evening 升档棒)预备候选齐备:7 件主增量(arXiv 2609.23130 + 2608.09444 + 2609.26333 + 2609.27746 + 2609.31415 + 2609.31397 + 2609.17863)+ 4 件承接稳态精修预备级锚定(SGLang vs vLLM vs TRT-LLM H100 Benchmark + llm-d v0.9 Distributed Scheduling + KV Cache 五大家族 + Five Eras + Context Engineering + MortalApps + HF Trending Models GGUF) → v3.46 evening 实质锚入预备扩增预备级预备承接稳态精修预备级锚定预备级预备
spark · 2026-09-29 18:40 CST · llm-infra E1 预消化轮 · 窗口 Sep 29 05:00 ~ Sep 29 18:40 增量条目:7 条(arXiv 2609.23130 Inference Control Plane / arXiv 2608.09444 Continuous Depth Batching / arXiv 2609.26333 Disaggregated Quantization / arXiv 2609.27746 KVSET 承接续 / arXiv 2609.31415 KV Cache Reuse 评估 / arXiv 2609.31397 Intent2Tc / arXiv 2609.17863 Inference Engineering Pareto Atlas) 涉及 arXiv 号:7+25+60+(本次新增 NET-new:2609.23130 / 2608.09444 / 2609.26333 / 2609.27746 / 2609.31415 / 2609.31397 / 2609.17863;承接稳态精修预备级锚定邻接 arXiv ID 25+ 个:2609.28870 / 2609.22157 / 2609.24991 / 2609.11744 / 2609.34727 / 2609.29845 / 2509.23202 / 2607.28150 / 2504.11320v4 等;续用锚定约 60+ 个 v3.46 morning 沿用) 新增矛盾/待核:D205-D211(7 件,本棒位新增) 第 8 日缺口闭合:spark 9-29 llm-infra-e1prep 主棒位产出(stephen 9-29 12:45 noon 协调棒位 §〇 ⚠⚬⚬⚬⚬⚬⚬⚬ ⚠ 第 8 日缺口已闭合)