Jay · 研究知识库 · CSDN 高频检索 · 2026-08-14 08:20
主题
LLM 推理框架工程选型 + Benchmark 范式 + KV Cache 系统论文 2026 年中盘点
检索范围
- CSDN:高价值推理框架、RAG、Agent 工程实践(2026 年 6-8 月)
- Substack:AI inference systems、model serving 社区动态
- arXiv:KV Cache 调度、LLM 推理系统最新论文
- Exa/Tavily:综合搜索补全
一、CSDN 高价值条目
1.1 ⭐⭐⭐ Ollama/vLLM/llama.cpp 实战对比(2026-04-19)
- 链接:https://blog.csdn.net/shebao3333/article/details/160312355
- 来源:CSDN 博客(hope_wisdom),进入月度精选
- 核心内容:
- 实测数据(Llama 4 Scout 17B, 50 并发用户):
- Ollama:~155 tokens/s,p95 延迟 18.4s;50 用户即达平台
- vLLM:~920 tokens/s,p95 延迟 2.1s;128 并发 100% 成功率
- llama.cpp:无并发批处理,高负载下同 Ollama 队列限制
- 关键结论:
- Ollama 生产环境并发上限约 5 用户(GitHub issue #9054,2024 年至今未修复)
- vLLM 唯一真正的 NVIDIA 生产级选择(Hugging Face 2025-12 弃用 TGI 后官方推荐)
- llama.cpp:Apple Silicon、边缘设备、纯 CPU 部署首选
- 2026 年新功能:llama.cpp MCP 客户端支持、RPC 分布式推理跨 GPU 并行加载
- 工程价值:⭐⭐⭐ — 含实测命令、benchmark 表格、选型决策树,适合直接用于生产选型决策
- 版本/环境:NVIDIA H100/A100,CUDA 7.0+;Python 3.12+;vLLM 需要 BF16 支持
- 可信度:高(实测数据可复现,命令完整)
- 复现价值:高,benchmark 脚本可直接参考
1.2 ⭐⭐⭐ 2026 年 LLM 推理框架全解析(CSDN 综合横评)
- 链接:https://blog.csdn.net/Gaga246/article/details/155610267
- 来源:CSDN 博客(Gaga246),2026 年初发布
- 核心内容:
- 框架分层:高性能(vLLM/LMDeploy/SGLang/TGI)、轻量化(Ollama/llama.cpp/LocalAI)、灵活部署(XInference/OpenLLM/LiteLLM)
- SGLang 最新动态(2025-02):全面支持 DeepSeek-R1 FP8 推理,0.4.3 版本引入 Multi-token prediction;结合 vLLM 后端生成速度突破 1000+ tokens/s
- DeepSeek Open Infra Index:FlashMLA(Hopper GPU MLA 解码内核)、DeepEP(MoE EP 通信库)、DeepGEMM(FP8 GEMM 库)
- 2026 年国产框架横评:vLLM 生态最全,SGLang 高并发结构化输出独树一帜,LMDeploy 国产生态最佳,TensorRT-LLM 吞吐量天花板但部署成本最高
- 工程价值:⭐⭐⭐ — 选型指南结构完整,含适用场景分类,适合团队技术选型参考
- 版本:SGLang 0.4.3+,vLLM PagedAttention,LMDeploy,DeepSeek AI Open Infra Index
- 可信度:中高(综合编译文章,有实测数据支撑)
1.3 ⭐⭐ vLLM vs SGLang 推理框架性能横评
- 链接:https://blog.csdn.net/yu808454/article/details/163394780 等多篇
- 来源:CSDN 多位博主(2026 年 6-7 月密集发布)
- 核心内容:
- SGLang 吞吐量领先 15%-40%(长文本/多轮对话),得益于 RadixAttention 前缀缓存
- vLLM 短请求延迟更优,PagedAttention 显存效率更高
- SGLang 结构化 JSON 输出成功率 99.8%
- 2026 年实测:H100 上 SGLang vs vLLM 吞吐量差距约 29%(~16200 vs ~12500 tokens/s)
- 工程价值:⭐⭐ — 多篇横评内容重叠度高,适合交叉验证;InfraTech 的 Notebook 练习(10 个核心主题:KV Cache 计算、调度器、Radix Attention、投机推理等)工程教学价值更高
1.4 ⭐ RAG 实战全解析(2026-08-09)
- 链接:https://blog.csdn.net/xxue345678/article/details/163103149
- 核心内容:文档切割策略、Embedding 演进、向量库选型、RRF 融合、Re-rank、幻觉五层防御
- 工程价值:⭐ — 偏综述,缺少命令/版本/复现细节,不建议单独归档
1.5 ⭐⭐ 2026 年国产开源 LLM 推理框架横评(06-23)
- 链接:CSDN yonggeit 博客
- 核心内容:四大主流框架(vLLM、SGLang、LMDeploy、TensorRT-LLM)工程定位明确;建议以 vLLM 为默认起点,按业务瓶颈针对性切换
- 工程价值:⭐⭐ — 实用选型建议,含国产 GPU 场景补充
二、Substack 高价值条目
2.1 ⭐⭐⭐ State of the Model Serving Communities — April 2026(InferenceOps)
- 链接:https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93
- 作者:Yuan Tang(Red Hat AI),社区联合作者
- 核心内容:
vLLM(v0.17→v0.19)关键进展:
- Model Runner V2:模块化架构,重构 CUDA graph dispatch
- 投机解码:P-EAGLE(Parallel Speculative Decoding),Eagle3 支持
- KV Cache Offloading:reuse-frequency-gated CPU stores、FlexKV offloading backend
- 新增架构:Gemma 4(MoE/多模态/推理/tool-use)、Sarvam MoE、OLMo Hybrid、ColPali
- gRPC serving(--grpc),GPU-less Render Serving(多模态预处理与 GPU 推理分离)
- NGram GPU Speculative Decoding,兼容 async scheduler
- DBO(Dual-Batch Overlap)泛化到所有模型
- FlashAttention 4 集成,FlashInfer 0.6.6
- vLLM 周安装量从 ~1M/周 增长到 ~2M/周(2026-03)
llm-d(CNCF Sandbox)关键进展:
- 正式成为 CNCF Sandbox 项目,治理结构确立
- llm-d-kv-cache v0.7.0:内存降低 50-60%,GDS(GPUDirect Storage)支持
- EPD(Encode/Prefill/Decode)分解支持,KV cache enablement 初始支持
- Pure Go ZMQ 实现(消除 CGO 依赖)
- 新指标 disagg_decision_total 统一追踪请求路由
- EPP(Endpoint Picker)代码将迁移到 llm-d-inference-scheduler(2026-04-20 起)
KServe v0.17.0 关键进展:
- WVA/KEDA/HPA 集成:LLMInferenceService 支持生产级 autoscaling
- Storage API 迁移:自动迁移到 InferencePool v1 和 v1alpha2
- OpenAI Responses API 支持(/v1/responses HTTPRoute)
- llm-d 升级到 0.6,vLLM 升级到 0.17.1
- Namespace-scoped ModelCache(download jobs 可在独立 jobNamespace 运行)
- Intel Gaudi 加速器支持,ARM builds for LLMInferenceService controller
- ONNX model class 支持(MLServer)
Llama Stack(v0.7.1)关键进展:
- Anthropic Messages API(/v1/messages)原生支持,count_tokens 支持
- Google Interactions API 前端(v1alpha)
- Responses API 推理/CoT 支持,对话压缩(conversation compaction)
- OpenAI API 一致性从 89.1% 提升到 91.2%
- 结构化输出(structured outputs)支持
- 可信度:极高(Red Hat AI 团队官方维护,多 SIG 联合作者)
- 后续行动:v0.19 Release Notes 精读(P-EAGLE、Model Runner V2 详细原理)
2.2 ⭐⭐ Beyond Benchmaxxing: Why the Future of AI is Inference-Time Search(adlrocha)
- 链接:https://adlrocha.substack.com/p/adlrocha-beyond-benchmaxxing-why
- 作者:Alfonso de la Rocha
- 核心内容:
- Benchmark 范式深度解析:single-turn(GPQA/HLE)vs multi-turn agentic(SWE-bench/WebArena);评测框架:LM Evaluation Harness(EleutherAI)、Stanford HELM、DeepEval(Pytest for LLMs)、Inspect AI(UK AI Safety Institute)
- "Benchmaxxing" 现象与 Goodhart 定律:Llama 4 典型案例——benchmark 表现优异但实际使用失望
- RLVR(Reinforcement Learning with Verifiable Rewards):SWE-bench 使用 pytest 验证,正确执行得奖励,崩溃受惩罚;比传统 RLHF(人类打分)更快、更客观
- 推理时计算 Scaling:Sebastian Raschka 预测 2026 年 AI 进步更多来自推理时工具和基础设施,而非单纯训练侧;Inference-time scaling 可让小模型完成窄任务
- Benchmark 即推理引擎:利用 sandbox 环境为 agent 提供实时反馈循环,实现动态适应
- 防污染机制:Canary String(加密唯一字符串追踪)、动态评测(LiveBench/Humanity's Last Exam)
- 可信度:高(技术深度好,有代码/框架引用)
- 后续行动:Benchmark 测试框架(LM Harness、DeepEval、Inspect AI)可纳入评估体系
三、arXiv / 学术系统论文
3.1 ⭐⭐⭐ A Queueing-Theoretic Framework for Stability Analysis of LLM Inference with KV Cache Memory Constraints
- arXiv:https://arxiv.org/abs/2605.04595(ICML 2026 接收)
- 核心内容:基于排队论的 KV Cache 内存约束稳定性分析框架;建模 LLM 推理中 KV cache 内存管理约束的理论基础
- 可信度:高(顶会接收)
- 后续行动:理论框架审稿,可结合 Fluid-Guided Online Scheduling(arXiv:2504.11320)一起精读
3.2 ⭐⭐ KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving
- arXiv:https://arxiv.org/html/2605.13734v1
- 核心内容: disaggregated LLM serving 下 KV cache 压缩;nvCOMP 高性能库集成;服务感知的动态压缩配置
- 可信度:高
- 后续行动:关注 disaggregated serving 场景中 KV transfer 带宽优化
3.3 ⭐⭐ Multi-Segment Attention: Enabling Efficient KV-Cache Management for Faster LLM Serving
- arXiv:https://arxiv.org/html/2606.02964v1
- 核心内容:block-level、position-aware 的 KV cache eviction;可无缝集成到请求级管理系统(与 Continuum 等互补)
- 可信度:高
- 后续行动:与 CacheTTL、ObjectCache 对比分析
3.4 ⭐⭐⭐ Rethinking Classical Infrastructure Boundaries in the LLM Inference Age
- arXiv:https://arxiv.org/html/2608.01526v1
- 核心内容:KV Cache 作为一等公民;提出 "Internet for the KV Cache" 概念;基础设施边界重新定义(计算/存储/传输);前缀缓存、KV offloading、prefetch/routing 现有原语综述
- 可信度:高(2026-08 新论文)
- 后续行动:重要论文,需精读;可能影响知识库基础设施架构页
3.5 ⭐⭐ Online Scheduling for LLM Inference with KV Cache Constraints
- arXiv:https://arxiv.org/html/2502.07115v5
- 核心内容:KV cache 约束下的在线调度;MC-SF 调度策略;真实 LLM 推理 trace 数据集
- 可信度:高
- 后续行动:Fluid-Guided Online Scheduling(2504.11320)相关
四、综合判断与建议
高价值条目(建议写入 published)
- State of Model Serving Communities April 2026(InferenceOps Substack)— 云原生推理基础设施季度权威动态
- CSDN Ollama/vLLM/llama.cpp 实战对比 — 生产选型可直接引用
- Rethinking Classical Infrastructure Boundaries in the LLM Inference Age(arXiv 2608.01526)— KV Cache 系统架构重要论文
需精读/审稿
- vLLM v0.19 Release Notes(P-EAGLE、Model Runner V2 详细原理)
- llm-d CNCF Sandbox 治理与 EPP 迁移计划
- Fluid-Guided Online Scheduling + KV Cache 约束理论框架
知识库主题页更新建议
- 推理框架选型页:补充 SGLang v0.5.8/v0.5.15(2026-07),vLLM v0.19 新架构
- KV Cache 系统页:补充 Memory-Centric KV Cache Server(HotInfra '26),SAW-INT4,ObjectCache
- Benchmark 体系页:新增 RLVR 范式、DeepEval/Inspect AI 工具链
五、本次写入路径
建议写入路径:/shared/research-kb/inbox/jay/2026-08-14T0820-jay-csdn-inference-stack-substack-research.md
草稿内容:本文完整内容(已写入上述路径)
是否需要精读: - ✅ 是(InferenceOps Substack 精读) - ✅ 是(arXiv 2608.01526 精读) - ⚠️ CSDN 1.1 实战对比命令复现验证
是否需要审稿:是(InferenceOps Substack 季度动态需交叉验证 vLLM 周安装量数据)
是否需要主题页更新:是(推理框架选型 + KV Cache 系统两个主题页)
Jay · 2026-08-14 08:20 · Asia/Shanghai