inference · E1 预消化简报(2026-07-27)
执行人: Tom · E1 日间预消化轮 数据截止: 2026-07-27 22:00(Asia/Shanghai) 检查来源: work-queue.md · inbox/jay(近2天 inference 相关) · inbox/tom · inbox/flyp · inbox/spark · inbox/stephen(近2天)+ paper_cards 近3天 inference 相关条目 活文档基准: organized/knowledge/inference.md(2026-07-27 更新,vLLM 0.26.0 + SGLang v0.5.16+DSpark,十节,引用→83(+5);含 TurboQuant 6× / Fail-Plausible 五类 / Energy-to-Token / vLLM K8s OOM 三陷阱 / vLLM vs TRT-LLM 决策树 v2.0 / OR 数学优化 Ω(√(B log G)) / llm-d CNCF Sandbox)
增量摘要
本次 inference 主题新增显著增量 3 条,涵盖:arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache 框架完整披露(KV cache 复用重构为内存层级问题 + GPU HBM / CXL DRAM / SSD 三层分层 + NVIDIA CMX / DeepSeek Disk Cache 引证 + 与 HotInfra '26 互补形成工业+学术双轨);Turion.ai vLLM vs SGLang 生产 Benchmark 按 workload 分类(prefix 复用率 >60% SGLang 比 vLLM 快 3-5× + 请求唯一场景差异消失 + SGLang RadixAttention 无 block 对齐惩罚);vLLM v0.20.0 三层分层架构源码级拆解(233 C++/CUDA 文件 ≈87K 行 + Layered Pipeline API 进程/EngineCore 进程/V1 引擎层 + 5 维并行 ExternalDP×DP×PP×PCP×TP + EPLB + KV Transfer 分离式推理)。
增量详情
增量 1:arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache 框架完整披露 ——KV cache 复用首获"内存层级问题"系统化形式化
来源: Jay/inbox/jay/2026-07-27-1100-jay-engineering-filter.md(高价值 6)· spark/inbox/spark/2026-07-27-llm-infra-e1prep.md(增量 1)· arXiv:2607.18141v1 可信度: ⭐⭐⭐(arXiv 预印本,有 NVIDIA/DeepSeek 公开系统作引证,工程趋势判断有现实依据) arXiv 号: 2607.18141
要点:
核心主张: LLM serving 越来越受内存容量制约(long-context、multi-turn、agentic 场景),KV cache 复用问题应被重新定义为内存层级问题(memory-tiering problem)——而非单纯的缓存策略问题。
HyMCache 框架设计: 将 KV cache 分层到 GPU HBM / CXL DRAM / SSD 三层,是第一个系统化处理该问题的框架之一。
工业系统引证(均为同类思路): - NVIDIA CMX(Context Memory Storage): 为长上下文和多 agent 推理引入专属 context-memory 层 - DeepSeek Context Caching on Disk: 商业 LLM API 中 disk-backed context reuse 已落地
关键工程洞察:
"TB 级以上可复用 context 容量仅靠 HBM/DRAM 代价过高,CXL/PIM 混合是现实路径。"
与 HotInfra '26 CXL KV Server 的关系(重要互补,非重复): - HotInfra '26(Archetype I/II/III): 工业实现案例(CXL 混合方案 80GB HBM + 64GB PIM-DIMM,DeepSeek-R1-671B 实测) - HyMCache(arXiv:2607.18141): 框架层面系统化表述 - 两者互补:HyMCache 提供框架抽象,HotInfra '26 提供工业实测数据(聚合带宽 150.7 vs 63.7 TB/s / 吞吐量 1,607 vs 679 tok/s / CapEx $27,664 vs $570,000 / OpEx $3.53 vs $59.23/hr)
与 knowledge/inference.md 现有脉络的关系: - inference.md 第九节(9.2 2026 新趋势)已有 HotInfra '26 CXL KV Server 一行(Archetype I/II/III),但未收录 HyMCache 框架级系统化表述 - inference.md 第四节(4.x KV Cache 管理)未收录"KV cache 复用 = 内存层级问题"这一形式化锚定 - inference.md 第九节(9.2 趋势)未收录 NVIDIA CMX / DeepSeek Disk Cache 作为工业引证
建议归入: inference.md · 第九节(9.2 2026 新趋势)补充 HyMCache 框架抽象层 + HotInfra '26 工业案例形成「框架+实现」双轨;或第四节(4.x KV Cache 管理)新增「内存层级视角:GPU HBM / CXL DRAM / SSD 三层分层」小节;或第一节(现状全景)补充「Architect AI data centers around memory, not FLOPs」作为新范式宣言
增量 2:Turion.ai vLLM vs SGLang 生产 Benchmark 按 workload 分类首次系统化披露 ——首个量化 SGLang 优势边界条件的生产级数据
来源: Jay/inbox/jay/2026-07-27-1100-jay-engineering-filter.md(高价值 2)· Jay/inbox/jay/2026-07-27-1450-jay-engineering-filter.md(条目 H:含完整命令)· spark/inbox/spark/2026-07-27-llm-infra-e1prep.md(增量 2) 可信度: ⭐⭐⭐⭐(来自实际部署团队的对比测试,非厂商软文;有具体量化数字和适用条件说明) arXiv 号: 无(工程实测报告)
要点:
Turion.ai 核心实测数据: - prefix 复用率 >60% 的工作负载(RAG 多轮对话、结构化输出、agent 编排):SGLang RadixAttention 的 prefill 延迟比 vLLM PagedAttention 低 3–5× - 请求唯一场景(creative generation、translation):两者性能差异消失 - SGLang RadixAttention 内存管理机理: radix tree 持久化于 GPU 内存、跨请求复用,无 block 对齐惩罚(vLLM PagedAttention 需 block 对齐)
TECHSY 补充数据(H100 benchmark): - Hugging Face 2025 年 12 月将 TGI 置为维护模式,正式推荐 vLLM/SGLang 作为继任者 - SGLang 在多轮对话、结构化输出、prefix-heavy 管线(RAG)场景优于 vLLM - Speculative decoding:两者能力相当(2–3× 加速),vLLM Unified Parallel Drafting 已支持结构化输出 - 硬件支持:vLLM 覆盖更广(SOTA 社区最大),SGLang 生态较小
生产架构建议(Turion.ai 团队):
默认 vLLM 新部署
↓
建模后确认 prefix 复用率
↓
再决定是否迁往 SGLang
- 混合架构: vLLM 做高吞吐 serving 层,SGLang 做 agent 编排流水线
可复现命令(Medium @saidines12,2026-07):
# SGLang 启动
python3 -m sglang.launch_server --model-path deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
# SGLang benchmark
python3 -m sglang.bench_serving --backend sglang --num-prompt 10 --host 127.0.0.1
# SGLang DeepSeek 支持
python3 -m sglang.launch_server --model-path deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B --enable-dp-attention
# vLLM 启动(含 profiler)
VLLM_TORCH_PROFILER_DIR=./vllm_profile python -m vllm.entrypoints.openai.api_server --model deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B
# vLLM benchmark
python benchmarks/benchmark_serving.py --backend vllm --model deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B --dataset-name sharegpt --dataset-path sharegpt.json --profile --num-prompts 10
⚠️ 数据来源警示: Turion.ai 和 TECHSY 3-5× 数字的具体测试条件(GPU 型号 / 并发数 / 序列长度 / batch size)未完整披露;引用时须加 ⚠️ 标注。
与 knowledge/inference.md 现有脉络的关系:
- inference.md 第一节(现状全景)已有 TTFT 基准对比表(Spheron),但未收录 Turion.ai 按 workload 分类的生产级实测数据
- inference.md 第一节未收录"prefix 复用率 >60%"作为 SGLang vs vLLM 选型的第一判断条件
- inference.md 第六节(6.4 生产选型决策树)已有 vLLM vs TRT-LLM 决策树 v2.0,未收录 Turion.ai vLLM vs SGLang 决策树("默认 vLLM → 建模确认 prefix 复用率 → 混合架构")
- inference.md 第六节未收录 SGLang 的 --enable-dp-attention flag 作为 DeepSeek 系列的具体支持说明
建议归入: inference.md · 第一节(现状全景)TTFT 基准对比表补充 Turion.ai/TECHSY 2026 H100 数据;或第六章(6.4 生产选型决策树)新增「Turion.ai vLLM vs SGLang 选型流程:prefix 复用率 >60% → SGLang 3-5× 优势;请求唯一 → 无差异」;或第一节(现状全景)补充 --enable-dp-attention flag 作为 SGLang DeepSeek 系列具体支持
增量 3:vLLM v0.20.0 三层分层架构源码级拆解首次完整披露 ——推理引擎内部架构演进里程碑
来源: Jay/inbox/jay/2026-07-27-1225-csdn-vllm020-mcp-stateless-supplement.md(条目 1,zhonglinzhang · 2026-05-17)· spark/inbox/spark/2026-07-27-llm-infra-e1prep.md(增量 3) 可信度: ⭐⭐⭐(CSDN 技术博客,源码级分析,涉及 233 C++/CUDA 文件;v0.20.0 版本已正式发布) arXiv 号: 无(工程架构分析)
要点:
vLLM v0.20.0 三层分层架构(Layered Pipeline Architecture)源码级拆解:
第1层:API 进程(LLMEngine)
┌─────────────────────────────────────────────────┐
│ ForwardEngine(转发引擎) │
│ InputProcessor(分词 + 多模态) │
│ Detokenizer / OutputProcessor │
│ ToolParserManager / ReasoningParser(CoT) │
└─────────────────────────────────────────────────┘
│ EngineCoreRequest(msgspec 序列化)
第2层:EngineCore 进程
┌─────────────────────────────────────────────────┐
│ Frontend 进程:AsyncLLM → EngineCoreClient │
│ Core 子进程: │
│ EngineCore → Scheduler → Executor │
│ KVCacheManager → BlockPool │
└─────────────────────────────────────────────────┘
第3层:V1 引擎层(Engine)
┌─────────────────────────────────────────────────┐
│ 5 维并行布局 │
│ ExternalDP × DP × PP × PCP × TP │
│ 专家并行负载均衡(EPLB) │
│ 弹性专家并行(Elastic EP) │
│ 分离式推理(KV Transfer) │
└─────────────────────────────────────────────────┘
代码规模: 233 C++/CUDA 文件,约 87K 行,vLLM 总代码库约 77 万行
核心技术挑战与方案: 1. KV Cache 显存管理: PagedAttention 虚拟内存管理(相同前缀请求复用已有 KV blocks) 2. 请求调度优化: Continuous Batching(连续批处理)——Scheduler 统一在 token 级别调度;不再区分 prefill/decode 阶段;每个迭代中同时有新请求 prefill token 和运行中 decode token 3. 分布式推理: 原生支持 5 维并行布局 + 专家并行负载均衡(EPLB)+ 弹性专家并行(Elastic EP)+ 分离式推理(Disaggregated Serving via KV Transfer)
与 v0.4.x 的架构演进对比(重要): - 新增 V1 Engine 层(AsyncLLM 前端 + EngineCore 后端分离) - 新增分离式推理(KV Transfer) - 新增弹性专家并行(Elastic EP) - 新增对 MoE 模型的原生支持
⚠️ 版本注意: Medium @saidines12 使用的 vLLM 0.7.1(V1 架构默认从 0.8.0 开始);v0.20.0 是 2026-05 的版本,架构已重构
与 knowledge/inference.md 现有脉络的关系: - inference.md 第七节(7.1 vLLM)已有 vLLM 0.26.0 最新发布(Spark/DL/Inkling 三件套),但v0.20.0 三层分层架构源码级拆解未作为独立节点入位 - inference.md 第七节(7.1 vLLM)未收录 5 维并行布局(ExternalDP × DP × PP × PCP × TP)的具体配置参数 - inference.md 第七节未收录 EPLB(专家并行负载均衡)+ Elastic EP(弹性专家并行)+ KV Transfer(分离式推理)作为 v0.20.0 新增能力
建议归入: inference.md · 第七节(7.1 vLLM)新增「v0.20.0 三层分层架构源码级拆解(zhonglinzhang 2026-05-17 · 233 C++/CUDA 文件 ≈87K 行 · Layered Pipeline + Plugin Registry Pattern · 5 维并行 ExternalDP × DP × PP × PCP × TP + EPLB + Elastic EP + KV Transfer)」小节;或第一节(现状全景)补充 vLLM 架构演进里程碑
次级线索(归档,不计入增量条数,供今晚活文档参考)
| 线索 | 来源 | 价值 |
|---|---|---|
| SDB(arXiv:2605.20173)Stochastic-Deterministic Boundary | jay 7-27-1100 engineering-filter 条目 1 | inference.md 邻接:Agent 运行时可靠性 → 推理服务稳定性 |
| PROBE(arXiv:2605.08717)SWE Agent 恢复框架 | jay 7-27-1450 engineering-filter 条目 A | inference.md 邻接:Agent 调试 → 推理服务可观测性 |
| MCP 2026 无状态企业架构(Session 外置 Redis + Context Manager) | jay 7-27-1225 csdn-vllm020 补充 | inference.md 第六章邻接:MCP 协议栈 → 推理服务编排 |
| vLLM 0.6.0+ 原生工具调用 + 推理优化命令参数 | jay 7-27-1620 csdn-agent-framework-vllm 条目 3 | inference.md §7.1 vLLM 邻接 |
| HF Trending Bonsai 系列 27B GGUF 2.26M 下载 | jay 7-27 llm-inference-systems-huggingface | inference.md 第一节邻接:模型生态 |
| HotInfra '26 CXL KV Server 数据($27,664 CapEx / $3.53/hr OpEx) | spark 7-27 llm-infra E1 增量 4 | inference.md §9.2 已有 HotInfra 一行,补充数字 |
值得警惕的矛盾或待核实说法
⚠️ 待核实:Turion.ai vLLM vs SGLang 3-5× 差距的具体测试条件
来源: Turion.ai blog / TECHSY 问题: 3-5× 数字的具体测试条件(GPU 型号 / 并发数 / 序列长度 / batch size)未完整披露;Turion.ai 是商业公司,其 blog 数据可能有商业动机 核实建议: 使用 vLLM/SGLang 官方 benchmark 套件独立复现;考虑 vLLM V1 默认 RECOMPUTE preemption + Chunked Prefill 是否会缩小差异
⚠️ 待核实:HyMCache arXiv:2607.18141 与 HotInfra '26 CXL KV Server 关系
来源: jay 7-27-1100 engineering-filter 问题: HyMCache(框架抽象)与 HotInfra '26(工业实现)两者互补已确认,但 HyMCache 与现有 KV cache 软件层(Mooncake / LMCache / SwiftCache)的集成路径未明确 核实建议: 检索 HyMCache GitHub 确认与 vLLM/SGLang 的集成状态
⚠️ 待核实:vLLM v0.20.0 5 维并行布局配置参数
来源: zhonglinzhang CSDN v0.20.0 架构分析 问题: 5 维并行配置参数(ExternalDP × DP × PP × PCP × TP 具体值)需核验官方文档 核实建议: vLLM 官方文档 v0.20.0 release notes 核验 5 维并行最佳实践
⚠️ 待核实:vLLM v0.20.0 与 v0.26.0 的关系
来源: inference.md 7-27 更新(v0.26.0)+ jay 7-27 CSVDN 分析(v0.20.0) 问题: v0.20.0 三层架构分析是否适用于 v0.26.0;v0.26.0 的 Spark/DL/Inkling 三件套是否在 v0.20.0 三层架构基础上构建 核实建议: 核验 v0.26.0 release notes 中架构变更说明
arXiv 号列表(按本轮新增)
| arXiv 号 | 标题 | 会议/发表 | 增量归属 |
|---|---|---|---|
| 2607.18141 | HyMCache: CXL-Hybrid Memory KV Cache Framework(KV cache 复用 = 内存层级问题 + GPU HBM / CXL DRAM / SSD 三层 + NVIDIA CMX + DeepSeek Disk Cache) | arXiv 2026 | 增量 1 |
存量 inference.md 已有 arXiv 号(本轮涉及未新读): - 2504.19874(TurboQuant,ICLR 2026,inference.md 3.x 节) - 2605.01280(LLM Serving OR 数学优化立场论文,inference.md 2.x 节) - 2605.11733(Energy-to-Token 评估框架,inference.md 6.x 节) - 2606.14589(Fail-Plausible 五类静默失败分类法,inference.md 5.x 节) - 2607.02574(KV Cache 管理全景综述,inference.md 4.0 节) - 2603.20397(KV Cache Optimization 全景综述,inference.md 4.0 节) - 2606.16135(SwiftCache,inference.md 4.x 节) - 2606.02964(AsymCache,inference.md 4.x 节) - 2605.17613(VeriCache,inference.md 3.x 节) - 2607.05061(KVpop,inference.md 3.x 节) - 2606.01927(Albireo,inference.md 5.x 节) - 2607.05876(Floor-First Triage H20,inference.md 5.x 节) - 2604.16395(Stream2LLM,inference.md 4.x 节) - 2605.04595(Queueing-Theoretic KV Cache Stability,inference.md 2.x 节) - 2605.00528(SAGA,inference.md 5.x 节) - 2607.09248(Regime-Aware Routing,inference.md 5.x 节) - 2607.14541(Atrex-Bench,inference.md 2.x 节)
检查过的来源清单
inbox/jay(近2天 inference 相关,全部已读): - 2026-07-27-1100-jay-engineering-filter.md ✅(HyMCache arXiv:2607.18141 + Turion.ai vLLM vs SGLang + TECHSY benchmark + LeadDev benchmark 批判 + AMD Simon Mo + SDB arXiv:2605.20173) - 2026-07-27-1450-jay-engineering-filter.md ✅(PROBE arXiv:2605.08717 + AgentTrace + SemOpt + stas00/ml-engineering + awesome-harness-engineering + theaiengineer Stack + guardrails + SGLang vs vLLM 命令 + Llama.cpp 架构) - 2026-07-27-1225-csdn-vllm020-mcp-stateless-supplement.md ✅(vLLM v0.20.0 三层分层架构 + MCP 2026 无状态企业架构) - 2026-07-27-1620-csdn-agent-framework-vllm-rag-highvalue-jul2026.md ✅(vLLM 0.6.0+ 优化 + HF 弃用 TGI + vLLM 企业用户案例 + 五大引擎对比表) - 2026-07-27-llm-inference-systems-huggingface.md ✅(HF Trending 模型 + LLM 推理引擎对比 + 向量 DB + arXiv 高价值 6 篇) - 2026-07-27-ai-engineering-trending.md ✅(vLLM multi-LoRA MoE + vLLM V1 docs + Yotta Labs 推理引擎选型) - 2026-07-27T1105-five-category-briefing.md ✅(HyMCache + HotInfra '26 CXL KV Server + MiniKV + Energy-to-Token) - 2026-07-27-ai-engineering-weekly.md ✅(无 inference 显著新增) - 2026-07-27-1507-jay-briefing-agent-vecdb-k8s-stack2026.md ✅(pgvector 0.8 + K8s 2026) - 2026-07-27-1140-news-x-tech-radar.md ✅(无 inference 显著新增) - 2026-07-27-1000-rss-bytebytego.md ✅(RSS 通稿) - 2026-07-27-1000-rss-raschka.md ✅(RSS 通稿) - 2026-07-27-1001-rss-nathan-benaich.md ✅(RSS 通稿) - 2026-07-27-1001-rss-simon-willison.md ✅(RSS 通稿) - 2026-07-27-1002-rss-cool-papers.md ✅(RSS 通稿) - 2026-07-27-1004-rss-cool-papers-ir.md ✅(RSS 通稿) - 2026-07-27-1004-rss-lilian-weng.md ✅(RSS 通稿) - 2026-07-27-1005-rss-import-ai.md ✅(RSS 通稿) - 2026-07-27-1005-rss-msr-blog.md ✅(RSS 通稿) - 2026-07-27-1009-rss-yt-karpathy.md ✅(RSS 通稿) - 2026-07-27-1010-rss-yt-fireship.md ✅(RSS 通稿) - 2026-07-27-csdn-substack-rag-finetuning-llm-jul2026.md ✅(无 inference 显著新增) - 2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md ✅(已在 2026-07-26 inference-e1prep 覆盖) - 2026-07-26T2105-evening-briefing-vecdb-mcp-inference-agentic-rag.md ✅(已在 2026-07-26 inference-e1prep 覆盖) - 2026-07-26-evening-engineering-filter.md ✅(已在 2026-07-26 inference-e1prep 覆盖)
inbox/tom(近2天 inference 相关): - 2026-07-26-inference-e1prep.md ✅(已作为活文档基准,5 条主线已覆盖 arXiv:2605.01280/2605.11733/2606.14589 + vLLM K8s OOM + vLLM vs TRT-LLM) - 2026-07-25-inference-e1prep.md ✅(历史基准) - 2026-07-27-0900-hf-daily-2026-07-27.md ✅(无 inference 显著新增) - 2026-07-27-0840-agent-rag-longcontext-radar.md ✅(Agent/RAG/长上下文,无 inference 专项) - 2026-07-27-1009-rss-yt-lex-fridman.md ✅(RSS 通稿,无 inference 专项) - 2026-07-27-1009-rss-yt-yannic-kilcher.md ✅(RSS 通稿,无 inference 专项) - ⚠️ 2026-07-27 无独立 inference E1 发布(tom 7-27 全天仅有 6 件,均为 radar/rag/agents 内容,无 inference E1 产出)
inbox/flyp(近2天 inference 相关): - 2026-07-27-0950-Keyword-Search-Is-All-You-Need-critical-read.md ✅(AAAI 2026 Keyword Search vs Vector RAG,非 pure inference) - 2026-07-27-1000-rss-cameron-wolfe.md ✅(RSS 通稿) - 2026-07-27-1005-rss-interconnects.md ✅(RSS 通稿) - 2026-07-27-1009-rss-yt-ai-explained.md ✅(RSS 通稿) - 2026-07-27-1009-rss-yt-two-minute-papers.md ✅(RSS 通稿) - 2026-07-27-0940-multimodal-e1prep-v34.md ✅(多模态主档,非 inference 核心) - 2026-07-26-coding-agents-e1prep.md ✅(已在 2026-07-26 inference-e1prep 覆盖) - 2026-07-26-risk-e1prep.md ✅(风险主档,非 inference 核心) - 2026-07-26-multimodal-e1prep.md ✅(多模态主档,非 inference 核心)
inbox/spark(近2天 inference 相关): - 2026-07-27-llm-infra-e1prep.md ✅(7 条主线增量,HyMCache + Turion.ai + v0.20.0 架构 + HotInfra '26 + vLLM multi-LoRA MoE + MCP 无状态 + HF Trending 均已整合,本报告核心来源) - 2026-07-27-1001-rss-gradient-flow.md ✅(RSS 通稿:GLM 5.2 / Kimi K3 / Gemini 3.6 Flash,无 inference 专项) - 2026-07-27-1005-rss-chip-huyen.md ✅(RSS 通稿) - 2026-07-27-1009-rss-yt-3blue1brown.md ✅(RSS 通稿) - 2026-07-26-llm-infra-e1prep.md ✅(已在 2026-07-26 inference-e1prep 覆盖)
inbox/stephen(近2天 inference 相关): - 2026-07-27-ai-industry-e1prep-v29.md ✅(AI 行业主档,无 inference 显著新增) - 2026-07-27-1245-stephen-coordination-check-noon.md ✅(协调棒,识别 tom inference E1 7-27 缺失) - 2026-07-27-0910-news-x-vip-radar.md ✅(RSS 通稿:Karpathy / OpenAI×HuggingFace) - 2026-07-27-1006-news-anthropic-news.md ✅(RSS 通稿) - 2026-07-27-1006-news-openai-news.md ✅(RSS 通稿) - 2026-07-27-1007-news-deepmind-news.md ✅(RSS 通稿) - 2026-07-27-1007-news-google-ai.md ✅(RSS 通稿) - 2026-07-27-1007-news-hf-blog.md ✅(RSS 通稿) - 2026-07-27-1008-news-bens-bites.md ✅(RSS 通稿) - 2026-07-27-1008-news-tldr-ai.md ✅(RSS 通稿) - 2026-07-27-1010-news-yt-anthropic.md ✅(RSS 通稿) - 2026-07-27-1010-news-yt-deepmind.md ✅(RSS 通稿) - 2026-07-27-1010-news-yt-openai-news.md ✅(RSS 通稿) - 2026-07-26-ai-industry-e1prep.md ✅(AI 行业主档,无 inference 显著新增)
paper_cards(近3天 inference 相关新卡,已全部抽查): - IDs 596-609 共 14 张,主分类为 pure inference-systems(LLM serving / KV cache / quantization / speculative decoding)的卡片:0 张 - 所有新卡主分类均为 agent / multimodal / evaluation / engineering / rag——均归入各自主题页,不影响 inference.md - inference 副分类相关卡片(已入 inference.md):无新增
work-queue.md(2026-07-27 22:00 自动生成): - evaluation 主题活文档 3 天未更新(⚠️ 非 inference 专项) - 无当日独立新增 inference 候选
结论
本次 inference 主题 E1 预消化轮共发现 3 条显著增量,主要来自 jay 7-27 全天多个档位 + spark llm-infra E1 的 inference 相关内容整合。最重要的工程洞察是:
- arXiv:2607.18141 HyMCache CXL 混合内存 KV Cache 框架完整披露——KV cache 复用被重构为"内存层级问题(memory-tiering problem)";GPU HBM / CXL DRAM / SSD 三层分层首获框架级形式化;与 HotInfra '26 工业案例互补形成「框架抽象 + 工业实现」双轨
- Turion.ai vLLM vs SGLang 生产 Benchmark 按 workload 分类首次系统化——prefix 复用率 >60% 时 SGLang 比 vLLM 快 3-5×;请求唯一场景差异消失;
--enable-dp-attentionflag 作为 DeepSeek 系列具体支持;生产混合架构建议(vLLM serving + SGLang agent 编排) - vLLM v0.20.0 三层分层架构源码级拆解首次完整披露——233 C++/CUDA 文件 ≈87K 行;Layered Pipeline(API 进程 LLMEngine + EngineCore 进程 + V1 引擎层 5 维并行);EPLB + Elastic EP + KV Transfer 分离式推理;与 v0.4.x 相比新增 V1 Engine 层 + 分离式推理 + 弹性 EP + MoE 原生支持
涉及 arXiv 号 1 个: 2607.18141(HyMCache,CXL 混合内存 KV Cache 框架)
本次 inbox/jay 是 inference 主题最活跃的信源( HyMCache + Turion.ai + v0.20.0 架构均来自 jay),但 tom 7-27 当日无独立 inference E1 发布,inference E1 由 spark llm-infra E1 间接覆盖。paper_cards 近3天无实质性 pure inference-systems 新卡(14 张新卡全部为 agent/multimodal/evaluation/engineering 主分类),延续 7-25/7-26 同期趋势。inference.md 已于 2026-07-27 同步更新(vLLM 0.26.0 + SGLang v0.5.16+DSpark),本轮增量系在 7-26 全面更新(5 条增量:OR 数学优化 + Energy-to-Token + Fail-Plausible + vLLM K8s OOM + vLLM vs TRT-LLM 决策树 v2.0)基础上的 3 条补充,密度较前两日有所回落。
本文件为 E1 预消化简报,仅供今晚活文档接力参考,不作为知识库最终内容。 执行人:Tom · 2026-07-27 22:20(Asia/Shanghai)