Jay 工程实践筛选 · 2026-09-28 上午场
主题: 推理引擎生产基准 · llama.cpp v0.5.0 · Agentic RAG · KV Cache 工程论文
检索范围: Tavily 搜索 · arXiv · Hugging Face · 技术博客 · AI Infrastructure Digest
时间: 2026-09-28 11:50 (Asia/Shanghai)
一、保留条目 · 工程高价值
1. SGLang vs vLLM 生产基准 — Agent 平台选型数据
来源: bex.co
类型: 技术博客 · 第三方基准
日期: 2026-09-24
可信度: 中高 — 引用 PremAI 2026 基准,注明 H100 SXM 80GB / RunPod 环境
保留理由: 本次研究中新发现的具体生产数据,不同于 09:35 简报中引用 Winder.ai 数据的是,此处覆盖多轮 Agent 工具调用场景,而非单纯前缀共享场景:
| 指标 | SGLang | vLLM | 差距 |
|---|---|---|---|
| TTFT 中位数(多轮 Agent) | 85ms | 380ms | 4.5x |
| TTFT P99 | — | — | 4.5x |
| KV Cache 命中率(多轮 Agent) | 78.6% | 41.2% | — |
| 输出吞吐(token/s,多轮) | 5,430 | 3,120 | 1.74x |
| KV Cache 命中率(多轮聊天) | 75–90% | 10–20% | — |
| KV Cache 命中率(代码分析) | 60–80% | 5–15% | — |
| 前缀密集负载吞吐(Llama 3.1 8B) | 16,200 tok/s | 12,500 tok/s | +29% |
| TTFT(前缀密集) | 79ms | 103ms | +23% |
核心结论(原文一句话): "The more your requests share prefixes, the wider SGLang's lead; the more unique each prompt is, the closer the race."
工程含义: SGLang 的 RadixAttention 在多轮 Agent 场景(工具调用 + 对话历史)中显著优于 vLLM,原因在于 KV Cache 可在工具执行暂停期间保留。当前 vLLM 默认在请求结束时驱逐 KV Cache,导致多轮 Agent 的 KV 复用率极低(41.2% vs 78.6%)。
生产建议: Agent 平台(工具调用、多轮对话)优先 SGLang;高独立请求率的工作负载选 vLLM。
建议写入: 推理引擎选型主题页 / SGLang 词条
2. llama.cpp v0.5.0 发布 — 新稳定版本
来源: AI Infrastructure Digest 2026-09-25
类型: 社区聚合 · 版本追踪
日期: 2026-09-25
可信度: 高 — 来自 agents-radar 自动化追踪
保留理由: llama.cpp v0.5.0 是 2026 年 9 月的新稳定版本发布,09:35 简报未记录具体版本号(简报只引用了 "v0.5.0" 字样但未做工程分析)。
版本状态对比(截至 2026-09-25):
| 引擎 | 版本 | 状态 | 说明 |
|---|---|---|---|
| llama.cpp | v0.5.0 | ✅ 新稳定版 | 主要稳定版本 |
| Ollama | v0.34.4-rc1 | 🔴 RC(breaking changes) | 升级前需谨慎 |
| vLLM | RC 进程中 | 🟡 开发版 | 无 24h 内 release |
| SGLang | RC 进程中 | 🟡 高不稳定性 | Issue 93 / PR 151 |
| LiteLLM | Dev build | 🟡 开发版 | PR 149 open |
工程影响: llama.cpp v0.5.0 稳定版发布意味着本地/边缘推理推荐从旧版本迁移;Ollama v0.34.4-rc1 含 breaking changes,需等正式版再升级生产。
3. Ollama vs vLLM vs llama.cpp 同卡基准(RTX 4090 / L40S / RTX 5090)
来源: ComputingForGeeks
类型: 技术博客 · 基准测试
日期: 2026-09-18
可信度: 中高 — 同一 GPU、同一模型、同一 prompt,三引擎对比,注明可复现步骤
保留理由: 不同于 09:35 简报中 Winder.ai 的 H100 远程数据,此文在消费级/小规模 GPU(RTX 4090、L40S、RTX 5090)上实测,适用本地部署选型参考。
关键测试条件: - 模型: Qwen2.5-7B-Instruct - 测量指标: tokens/s(同类可比) - 覆盖 GPU: RTX 4090(消费级)、L40S(数据中心)、RTX 5090(最新消费级)
缺失: 摘要仅见结论引用,无具体 tok/s 数据表格(需访问全文获取数值)
工程价值: 中 — 覆盖可复现的基准方法论,适合补充进推理引擎对比表,但需全文读取获取实际数值。
建议: 归档为「推理引擎选型 · 消费级 GPU 基准」词条,补充具体数值。
4. GGUF 量化指南 · llama.cpp 源码构建与回归测试
来源: Tech-Insider.org
类型: 技术教程
日期: 2026-09
可信度: 中 — 技术教程博客,有命令和步骤
保留理由: 包含可复现的 cmake 构建命令和回归测试流程,属于本次筛选新发现的具体工程内容。
关键命令:
# llama.cpp CUDA 构建(需预装 CUDA toolkit)
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
pip install -r requirements.txt
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)
# Apple Silicon(Metal 默认启用)
# cmake -B build
# cmake --build build --config Release -j$(sysctl -n hw.ncpu)
回归测试流程: 每次新版本发布,重新量化并对同一基准模型跑 llama-bench,对比结果以捕获特定架构的破坏性变更。
版本提示: ggml-org 于 2026 年 9 月发布 v0.4.1(gguf-org 标签),高于指南原始测试的 v0.4.0,建议拉取 latest tag。
工程价值: 中高 — cmake 命令对有自定义 GPU 后端需求的团队有实操价值;回归测试流程是生产环境版本管理的可执行建议。
5. Continnum — 多轮 Agent 场景下 KV Cache 驱逐策略问题
来源: arXiv:2511.02230v7
类型: arXiv 论文(2026 年 9 月 8 日修订)
可信度: 高 — 学术论文,引用 USENIX OSDI 26 等顶级会议
保留理由: 识别出当前推理引擎在 agentic 场景的 KV cache 管理缺陷(请求结束后默认驱逐导致多轮 agent 工作流缓存失效),并提出解决方案。09:35 简报已提及 Continnum,但未记录核心机制和工程含义。
核心问题: vLLM 等引擎在 LLM 调用结束后若新请求等待即驱逐 KV Cache;Agent 工作流中间穿插工具调用(时长差异大),导致缓存无法跨 turn 复用。
关键图: End-of-turn KV Cache Eviction 时序图(Job 1 LLM → Tool → LLM 序列中,Job 1 KV 在工具期间被错误驱逐)
相关工作引用: AlignedServe (Bai et al., 2026) 探索前缀感知 batching;HyMCache (2026) 针对 CXL 混合内存的 KV cache 框架。
工程价值: 高 — 为 SGLang vs vLLM 生产基准中的缓存命中率差异提供理论解释,对理解 Agent 平台选型有直接帮助。
6. KVSET — KV Cache 在线容量规划工具
来源: arXiv:2609.27746
类型: arXiv 论文
可信度: 高 — 学术论文
保留理由: 提出 KVSET,一个使用 Mattson 栈算法在线估算 LLM serving 工作负载 KV cache working set 的分析器。属于 KV cache 工程领域的具体工具创新,09:35 简报未覆盖。
核心贡献: 在线分析而非离线仿真,为 GPU 内存容量规划提供实时依据。
7. AutoRAG — Red Hat OpenShift AI 中的 RAG 评估流水线
来源: Red Hat 官方博客
类型: 官方技术博客
日期: 2026 年 9 月
可信度: 高 — Red Hat 官方工程博客
保留理由: 描述了企业 RAG 的具体评估指标和工具链集成(EvalHub / LM-Eval / SDG Hub),而非泛泛而谈。对比 09:35 简报中的 RAG 对比文章(Width.ai),此篇更具体。
工程内容: - RAG 评估三大核心指标(faithfulness、correctness 等),依赖 LLM-as-judge - EvalHub: 评估控制平面,监控 judge drift - LM-Eval: 基准测试框架 - SDG Hub: 合成数据生成 - Docling 用于 layout-aware 文档解析 - RAFT 模型微调作为 benchmark
生产含义: LLM-as-judge 的 judge drift 是运营风险点,需要持续监控。这点是企业 RAG 系统运营的真实工程痛点。
二、丢弃条目 · 及理由
丢弃 1: SGLang 跨 400,000 生产 GPU 文章(主要部分)
来源: bex.co
丢弃理由: 选型分析和具体 benchmark 数据保留(第 1 条),但文章中「SGLang 已部署 400,000 GPU at xAI/AMD/NVIDIA/Intel/LinkedIn/Cursor」属于市场规模陈述,无工程细节。生产选型数据已覆盖,无需重复归档。
丢弃 2: "Who Pays for the KV Cache" (arXiv:2609.24991)
来源: arXiv:2609.24991
丢弃理由: 属于 FinOps / 云成本归因领域,非核心工程实践条目。提及 vLLM paged KV memory 和 prefix caching 作为模拟器组件,但主体是 Kubernetes 成本分摊和 LLM provider 账单对齐,非推理工程团队的核心参考。归档价值不足以单独收录,可作为 KV Cache 成本优化补充参考。
丢弃 3: Hot-Cold Tiering of HBM and High Bandwidth Flash (arXiv:2609.25782)
来源: arXiv:2609.25782
丢弃理由: 学术研究层面有意义,但属于超长上下文 KV Cache 分层存储的前沿研究方向,距生产工程实践较远,无具体命令、benchmark 或可复现步骤。
丢弃 4: "Query Understanding for Production RAG" (Medium)
来源: Medium
丢弃理由: 属于 RAG 工程系列 Part 8,发布时间 "8 hours ago"(文章本身新鲜),但内容为知识性梳理,非原创工程数据或可执行基准。无具体 benchmark 数据,无错误/命令/源码分析。
丢弃 5: Agentic RAG vs Traditional RAG 对比(Width.ai)
来源: Width.ai
丢弃理由: 内容为策略性分析(Martin Anderson, September 26, 2026),引用微软 AgenticRAG 在 WixQA 基准上 factuality 提升 13%(相对)。但无具体工程命令、错误案例或生产数据。对比今日已归档的 Red Hat AutoRAG 文章,此文工程深度不足。
丢弃 6: LLM 2026 状态 · Interconnects.ai
来源: Interconnects.ai
丢弃理由: 模型市场分析为主(Qwen 下载量领先、Hugging Face 趋势、OpenRouter 使用数据),非具体工程内容。中国模型崛起是趋势观察,无具体工程命令或数据。
丢弃 7: 各类 Substack 综合性文章
涉及:
- "The Agentic Transition Playbook" (Linas Substack)
- "From Sparse Triples to Dense Wiki" (akmaier Substack)
- "Apple AI Hardware" (michaelparekh Substack)
- "Freemium: Anthropic Opus 5.5" (businessanalytics Substack)
丢弃理由: 均属行业分析/投资视角,无具体工程命令、benchmark 数据、源码分析或可复现步骤。Substack 内容筛选规则:仅保留有技术深度和可操作内容的专栏。
三、分类标签汇总
推理引擎 SGLang vLLM llama.cpp Ollama KV-Cache RadixAttention PagedAttention Agentic-RAG RAG-Eval 量化 GGUF Benchmark arXiv AutoRAG Red-Hat OpenShift CUDA ROCm
四、建议写入路径
- 主草稿:
/shared/research-kb/inbox/jay/2026-09-28T1150-jay-engineering-filter-production-benchmarks.md✅(本文)
五、精读 / 审稿 / 主题页更新建议
| 行动 | 条目 | 原因 |
|---|---|---|
| 精读 | Continnum (arXiv:2511.02230v7) | KV cache 驱逐策略缺陷是 Agent 平台选型的核心工程依据,需完整阅读机制和实验部分 |
| 精读 | SGLang vs vLLM (bex.co) 全文 | 当前仅读取 benchmark 摘要,需获取完整多卡数据、Prefill 性能对比 |
| 归档 | llama.cpp v0.5.0 版本状态 | 直接补充进 09:35 简报中的版本对比表 |
| 归档 | GGUF cmake 构建命令 | 补充进 llama.cpp 词条的构建部分 |
| 主题页更新 | 新增「SGLang vs vLLM 生产选型决策树」 | 基于本轮 benchmark 数据,替代现有简单的 Stars 对比 |
| 交叉验证 | LMSYS Chatbot Arena | 核实本轮各引擎的客观排名数据 |
| 审稿 | RTX 4090/L40S/RTX 5090 基准数值 | 当前草稿缺失具体 tok/s 数字,需全文读取 ComputingForGeeks 补充 |