Jay · 研究知识库 · CSDN 高频检索 · 2026-08-14 08:20

主题

LLM 推理框架工程选型 + Benchmark 范式 + KV Cache 系统论文 2026 年中盘点

检索范围

  • CSDN:高价值推理框架、RAG、Agent 工程实践(2026 年 6-8 月)
  • Substack:AI inference systems、model serving 社区动态
  • arXiv:KV Cache 调度、LLM 推理系统最新论文
  • Exa/Tavily:综合搜索补全

一、CSDN 高价值条目

1.1 ⭐⭐⭐ Ollama/vLLM/llama.cpp 实战对比(2026-04-19)

  • 链接:https://blog.csdn.net/shebao3333/article/details/160312355
  • 来源:CSDN 博客(hope_wisdom),进入月度精选
  • 核心内容
  • 实测数据(Llama 4 Scout 17B, 50 并发用户):
    • Ollama:~155 tokens/s,p95 延迟 18.4s;50 用户即达平台
    • vLLM:~920 tokens/s,p95 延迟 2.1s;128 并发 100% 成功率
    • llama.cpp:无并发批处理,高负载下同 Ollama 队列限制
  • 关键结论
    • Ollama 生产环境并发上限约 5 用户(GitHub issue #9054,2024 年至今未修复)
    • vLLM 唯一真正的 NVIDIA 生产级选择(Hugging Face 2025-12 弃用 TGI 后官方推荐)
    • llama.cpp:Apple Silicon、边缘设备、纯 CPU 部署首选
  • 2026 年新功能:llama.cpp MCP 客户端支持、RPC 分布式推理跨 GPU 并行加载
  • 工程价值:⭐⭐⭐ — 含实测命令、benchmark 表格、选型决策树,适合直接用于生产选型决策
  • 版本/环境:NVIDIA H100/A100,CUDA 7.0+;Python 3.12+;vLLM 需要 BF16 支持
  • 可信度:高(实测数据可复现,命令完整)
  • 复现价值:高,benchmark 脚本可直接参考

1.2 ⭐⭐⭐ 2026 年 LLM 推理框架全解析(CSDN 综合横评)

  • 链接:https://blog.csdn.net/Gaga246/article/details/155610267
  • 来源:CSDN 博客(Gaga246),2026 年初发布
  • 核心内容
  • 框架分层:高性能(vLLM/LMDeploy/SGLang/TGI)、轻量化(Ollama/llama.cpp/LocalAI)、灵活部署(XInference/OpenLLM/LiteLLM)
  • SGLang 最新动态(2025-02):全面支持 DeepSeek-R1 FP8 推理,0.4.3 版本引入 Multi-token prediction;结合 vLLM 后端生成速度突破 1000+ tokens/s
  • DeepSeek Open Infra Index:FlashMLA(Hopper GPU MLA 解码内核)、DeepEP(MoE EP 通信库)、DeepGEMM(FP8 GEMM 库)
  • 2026 年国产框架横评:vLLM 生态最全,SGLang 高并发结构化输出独树一帜,LMDeploy 国产生态最佳,TensorRT-LLM 吞吐量天花板但部署成本最高
  • 工程价值:⭐⭐⭐ — 选型指南结构完整,含适用场景分类,适合团队技术选型参考
  • 版本:SGLang 0.4.3+,vLLM PagedAttention,LMDeploy,DeepSeek AI Open Infra Index
  • 可信度:中高(综合编译文章,有实测数据支撑)

1.3 ⭐⭐ vLLM vs SGLang 推理框架性能横评

  • 链接:https://blog.csdn.net/yu808454/article/details/163394780 等多篇
  • 来源:CSDN 多位博主(2026 年 6-7 月密集发布)
  • 核心内容
  • SGLang 吞吐量领先 15%-40%(长文本/多轮对话),得益于 RadixAttention 前缀缓存
  • vLLM 短请求延迟更优,PagedAttention 显存效率更高
  • SGLang 结构化 JSON 输出成功率 99.8%
  • 2026 年实测:H100 上 SGLang vs vLLM 吞吐量差距约 29%(~16200 vs ~12500 tokens/s)
  • 工程价值:⭐⭐ — 多篇横评内容重叠度高,适合交叉验证;InfraTech 的 Notebook 练习(10 个核心主题:KV Cache 计算、调度器、Radix Attention、投机推理等)工程教学价值更高

1.4 ⭐ RAG 实战全解析(2026-08-09)

  • 链接:https://blog.csdn.net/xxue345678/article/details/163103149
  • 核心内容:文档切割策略、Embedding 演进、向量库选型、RRF 融合、Re-rank、幻觉五层防御
  • 工程价值:⭐ — 偏综述,缺少命令/版本/复现细节,不建议单独归档

1.5 ⭐⭐ 2026 年国产开源 LLM 推理框架横评(06-23)

  • 链接:CSDN yonggeit 博客
  • 核心内容:四大主流框架(vLLM、SGLang、LMDeploy、TensorRT-LLM)工程定位明确;建议以 vLLM 为默认起点,按业务瓶颈针对性切换
  • 工程价值:⭐⭐ — 实用选型建议,含国产 GPU 场景补充

二、Substack 高价值条目

2.1 ⭐⭐⭐ State of the Model Serving Communities — April 2026(InferenceOps)

  • 链接:https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93
  • 作者:Yuan Tang(Red Hat AI),社区联合作者
  • 核心内容

vLLM(v0.17→v0.19)关键进展: - Model Runner V2:模块化架构,重构 CUDA graph dispatch - 投机解码:P-EAGLE(Parallel Speculative Decoding),Eagle3 支持 - KV Cache Offloading:reuse-frequency-gated CPU stores、FlexKV offloading backend - 新增架构:Gemma 4(MoE/多模态/推理/tool-use)、Sarvam MoE、OLMo Hybrid、ColPali - gRPC serving(--grpc),GPU-less Render Serving(多模态预处理与 GPU 推理分离) - NGram GPU Speculative Decoding,兼容 async scheduler - DBO(Dual-Batch Overlap)泛化到所有模型 - FlashAttention 4 集成,FlashInfer 0.6.6 - vLLM 周安装量从 ~1M/周 增长到 ~2M/周(2026-03)

llm-d(CNCF Sandbox)关键进展: - 正式成为 CNCF Sandbox 项目,治理结构确立 - llm-d-kv-cache v0.7.0:内存降低 50-60%,GDS(GPUDirect Storage)支持 - EPD(Encode/Prefill/Decode)分解支持,KV cache enablement 初始支持 - Pure Go ZMQ 实现(消除 CGO 依赖) - 新指标 disagg_decision_total 统一追踪请求路由 - EPP(Endpoint Picker)代码将迁移到 llm-d-inference-scheduler(2026-04-20 起)

KServe v0.17.0 关键进展: - WVA/KEDA/HPA 集成:LLMInferenceService 支持生产级 autoscaling - Storage API 迁移:自动迁移到 InferencePool v1 和 v1alpha2 - OpenAI Responses API 支持(/v1/responses HTTPRoute) - llm-d 升级到 0.6,vLLM 升级到 0.17.1 - Namespace-scoped ModelCache(download jobs 可在独立 jobNamespace 运行) - Intel Gaudi 加速器支持,ARM builds for LLMInferenceService controller - ONNX model class 支持(MLServer)

Llama Stack(v0.7.1)关键进展: - Anthropic Messages API(/v1/messages)原生支持,count_tokens 支持 - Google Interactions API 前端(v1alpha) - Responses API 推理/CoT 支持,对话压缩(conversation compaction) - OpenAI API 一致性从 89.1% 提升到 91.2% - 结构化输出(structured outputs)支持

  • 可信度:极高(Red Hat AI 团队官方维护,多 SIG 联合作者)
  • 后续行动:v0.19 Release Notes 精读(P-EAGLE、Model Runner V2 详细原理)

2.2 ⭐⭐ Beyond Benchmaxxing: Why the Future of AI is Inference-Time Search(adlrocha)

  • 链接:https://adlrocha.substack.com/p/adlrocha-beyond-benchmaxxing-why
  • 作者:Alfonso de la Rocha
  • 核心内容
  • Benchmark 范式深度解析:single-turn(GPQA/HLE)vs multi-turn agentic(SWE-bench/WebArena);评测框架:LM Evaluation Harness(EleutherAI)、Stanford HELM、DeepEval(Pytest for LLMs)、Inspect AI(UK AI Safety Institute)
  • "Benchmaxxing" 现象与 Goodhart 定律:Llama 4 典型案例——benchmark 表现优异但实际使用失望
  • RLVR(Reinforcement Learning with Verifiable Rewards):SWE-bench 使用 pytest 验证,正确执行得奖励,崩溃受惩罚;比传统 RLHF(人类打分)更快、更客观
  • 推理时计算 Scaling:Sebastian Raschka 预测 2026 年 AI 进步更多来自推理时工具和基础设施,而非单纯训练侧;Inference-time scaling 可让小模型完成窄任务
  • Benchmark 即推理引擎:利用 sandbox 环境为 agent 提供实时反馈循环,实现动态适应
  • 防污染机制:Canary String(加密唯一字符串追踪)、动态评测(LiveBench/Humanity's Last Exam)
  • 可信度:高(技术深度好,有代码/框架引用)
  • 后续行动:Benchmark 测试框架(LM Harness、DeepEval、Inspect AI)可纳入评估体系

三、arXiv / 学术系统论文

3.1 ⭐⭐⭐ A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints

  • arXiv:https://arxiv.org/abs/2605.04595(ICML 2026 接收)
  • 核心内容:基于排队论的 KV Cache 内存约束稳定性分析框架;建模 LLM 推理中 KV cache 内存管理约束的理论基础
  • 可信度:高(顶会接收)
  • 后续行动:理论框架审稿,可结合 Fluid-Guided Online Scheduling(arXiv:2504.11320)一起精读

3.2 ⭐⭐ KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving

  • arXiv:https://arxiv.org/html/2605.13734v1
  • 核心内容: disaggregated LLM serving 下 KV cache 压缩;nvCOMP 高性能库集成;服务感知的动态压缩配置
  • 可信度:高
  • 后续行动:关注 disaggregated serving 场景中 KV transfer 带宽优化

3.3 ⭐⭐ Multi-Segment Attention: Enabling Efficient KV-Cache Management for Faster LLM Serving

  • arXiv:https://arxiv.org/html/2606.02964v1
  • 核心内容:block-level、position-aware 的 KV cache eviction;可无缝集成到请求级管理系统(与 Continuum 等互补)
  • 可信度:高
  • 后续行动:与 CacheTTL、ObjectCache 对比分析

3.4 ⭐⭐⭐ Rethinking Classical Infrastructure Boundaries in the LLM Inference Age

  • arXiv:https://arxiv.org/html/2608.01526v1
  • 核心内容:KV Cache 作为一等公民;提出 "Internet for the KV Cache" 概念;基础设施边界重新定义(计算/存储/传输);前缀缓存、KV offloading、prefetch/routing 现有原语综述
  • 可信度:高(2026-08 新论文)
  • 后续行动:重要论文,需精读;可能影响知识库基础设施架构页

3.5 ⭐⭐ Online Scheduling for LLM Inference with KV Cache Constraints

  • arXiv:https://arxiv.org/html/2502.07115v5
  • 核心内容:KV cache 约束下的在线调度;MC-SF 调度策略;真实 LLM 推理 trace 数据集
  • 可信度:高
  • 后续行动:Fluid-Guided Online Scheduling(2504.11320)相关

四、综合判断与建议

高价值条目(建议写入 published)

  1. State of Model Serving Communities April 2026(InferenceOps Substack)— 云原生推理基础设施季度权威动态
  2. CSDN Ollama/vLLM/llama.cpp 实战对比 — 生产选型可直接引用
  3. Rethinking Classical Infrastructure Boundaries in the LLM Inference Age(arXiv 2608.01526)— KV Cache 系统架构重要论文

需精读/审稿

  • vLLM v0.19 Release Notes(P-EAGLE、Model Runner V2 详细原理)
  • llm-d CNCF Sandbox 治理与 EPP 迁移计划
  • Fluid-Guided Online Scheduling + KV Cache 约束理论框架

知识库主题页更新建议

  • 推理框架选型页:补充 SGLang v0.5.8/v0.5.15(2026-07),vLLM v0.19 新架构
  • KV Cache 系统页:补充 Memory-Centric KV Cache Server(HotInfra '26),SAW-INT4,ObjectCache
  • Benchmark 体系页:新增 RLVR 范式、DeepEval/Inspect AI 工具链

五、本次写入路径

建议写入路径/shared/research-kb/inbox/jay/2026-08-14T0820-jay-csdn-inference-stack-substack-research.md

草稿内容:本文完整内容(已写入上述路径)

是否需要精读: - ✅ 是(InferenceOps Substack 精读) - ✅ 是(arXiv 2608.01526 精读) - ⚠️ CSDN 1.1 实战对比命令复现验证

是否需要审稿:是(InferenceOps Substack 季度动态需交叉验证 vLLM 周安装量数据)

是否需要主题页更新:是(推理框架选型 + KV Cache 系统两个主题页)


Jay · 2026-08-14 08:20 · Asia/Shanghai