Jay 工程实践筛选 · 2026-09-28 上午场

主题: 推理引擎生产基准 · llama.cpp v0.5.0 · Agentic RAG · KV Cache 工程论文
检索范围: Tavily 搜索 · arXiv · Hugging Face · 技术博客 · AI Infrastructure Digest
时间: 2026-09-28 11:50 (Asia/Shanghai)


一、保留条目 · 工程高价值

1. SGLang vs vLLM 生产基准 — Agent 平台选型数据

来源: bex.co
类型: 技术博客 · 第三方基准
日期: 2026-09-24
可信度: 中高 — 引用 PremAI 2026 基准,注明 H100 SXM 80GB / RunPod 环境

保留理由: 本次研究中新发现的具体生产数据,不同于 09:35 简报中引用 Winder.ai 数据的是,此处覆盖多轮 Agent 工具调用场景,而非单纯前缀共享场景:

指标 SGLang vLLM 差距
TTFT 中位数(多轮 Agent) 85ms 380ms 4.5x
TTFT P99 — — 4.5x
KV Cache 命中率(多轮 Agent) 78.6% 41.2% —
输出吞吐(token/s,多轮) 5,430 3,120 1.74x
KV Cache 命中率(多轮聊天) 75–90% 10–20% —
KV Cache 命中率(代码分析) 60–80% 5–15% —
前缀密集负载吞吐(Llama 3.1 8B) 16,200 tok/s 12,500 tok/s +29%
TTFT(前缀密集) 79ms 103ms +23%

核心结论(原文一句话): "The more your requests share prefixes, the wider SGLang's lead; the more unique each prompt is, the closer the race."

工程含义: SGLang 的 RadixAttention 在多轮 Agent 场景(工具调用 + 对话历史)中显著优于 vLLM,原因在于 KV Cache 可在工具执行暂停期间保留。当前 vLLM 默认在请求结束时驱逐 KV Cache,导致多轮 Agent 的 KV 复用率极低(41.2% vs 78.6%)。

生产建议: Agent 平台(工具调用、多轮对话)优先 SGLang;高独立请求率的工作负载选 vLLM。

建议写入: 推理引擎选型主题页 / SGLang 词条


2. llama.cpp v0.5.0 发布 — 新稳定版本

来源: AI Infrastructure Digest 2026-09-25
类型: 社区聚合 · 版本追踪
日期: 2026-09-25
可信度: 高 — 来自 agents-radar 自动化追踪

保留理由: llama.cpp v0.5.0 是 2026 年 9 月的新稳定版本发布,09:35 简报未记录具体版本号(简报只引用了 "v0.5.0" 字样但未做工程分析)。

版本状态对比(截至 2026-09-25):

引擎 版本 状态 说明
llama.cpp v0.5.0 ✅ 新稳定版 主要稳定版本
Ollama v0.34.4-rc1 🔴 RC(breaking changes) 升级前需谨慎
vLLM RC 进程中 🟡 开发版 无 24h 内 release
SGLang RC 进程中 🟡 高不稳定性 Issue 93 / PR 151
LiteLLM Dev build 🟡 开发版 PR 149 open

工程影响: llama.cpp v0.5.0 稳定版发布意味着本地/边缘推理推荐从旧版本迁移;Ollama v0.34.4-rc1 含 breaking changes,需等正式版再升级生产。


3. Ollama vs vLLM vs llama.cpp 同卡基准(RTX 4090 / L40S / RTX 5090)

来源: ComputingForGeeks
类型: 技术博客 · 基准测试
日期: 2026-09-18
可信度: 中高 — 同一 GPU、同一模型、同一 prompt,三引擎对比,注明可复现步骤

保留理由: 不同于 09:35 简报中 Winder.ai 的 H100 远程数据,此文在消费级/小规模 GPU(RTX 4090、L40S、RTX 5090)上实测,适用本地部署选型参考。

关键测试条件: - 模型: Qwen2.5-7B-Instruct - 测量指标: tokens/s(同类可比) - 覆盖 GPU: RTX 4090(消费级)、L40S(数据中心)、RTX 5090(最新消费级)

缺失: 摘要仅见结论引用,无具体 tok/s 数据表格(需访问全文获取数值)

工程价值: 中 — 覆盖可复现的基准方法论,适合补充进推理引擎对比表,但需全文读取获取实际数值。

建议: 归档为「推理引擎选型 · 消费级 GPU 基准」词条,补充具体数值。


4. GGUF 量化指南 · llama.cpp 源码构建与回归测试

来源: Tech-Insider.org
类型: 技术教程
日期: 2026-09
可信度: 中 — 技术教程博客,有命令和步骤

保留理由: 包含可复现的 cmake 构建命令和回归测试流程,属于本次筛选新发现的具体工程内容。

关键命令:

# llama.cpp CUDA 构建(需预装 CUDA toolkit)
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
pip install -r requirements.txt
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)

# Apple Silicon(Metal 默认启用)
# cmake -B build
# cmake --build build --config Release -j$(sysctl -n hw.ncpu)

回归测试流程: 每次新版本发布,重新量化并对同一基准模型跑 llama-bench,对比结果以捕获特定架构的破坏性变更。

版本提示: ggml-org 于 2026 年 9 月发布 v0.4.1(gguf-org 标签),高于指南原始测试的 v0.4.0,建议拉取 latest tag。

工程价值: 中高 — cmake 命令对有自定义 GPU 后端需求的团队有实操价值;回归测试流程是生产环境版本管理的可执行建议。


5. Continnum — 多轮 Agent 场景下 KV Cache 驱逐策略问题

来源: arXiv:2511.02230v7
类型: arXiv 论文(2026 年 9 月 8 日修订)
可信度: 高 — 学术论文,引用 USENIX OSDI 26 等顶级会议

保留理由: 识别出当前推理引擎在 agentic 场景的 KV cache 管理缺陷(请求结束后默认驱逐导致多轮 agent 工作流缓存失效),并提出解决方案。09:35 简报已提及 Continnum,但未记录核心机制和工程含义。

核心问题: vLLM 等引擎在 LLM 调用结束后若新请求等待即驱逐 KV Cache;Agent 工作流中间穿插工具调用(时长差异大),导致缓存无法跨 turn 复用。

关键图: End-of-turn KV Cache Eviction 时序图(Job 1 LLM → Tool → LLM 序列中,Job 1 KV 在工具期间被错误驱逐)

相关工作引用: AlignedServe (Bai et al., 2026) 探索前缀感知 batching;HyMCache (2026) 针对 CXL 混合内存的 KV cache 框架。

工程价值: 高 — 为 SGLang vs vLLM 生产基准中的缓存命中率差异提供理论解释,对理解 Agent 平台选型有直接帮助。


6. KVSET — KV Cache 在线容量规划工具

来源: arXiv:2609.27746
类型: arXiv 论文
可信度: 高 — 学术论文

保留理由: 提出 KVSET,一个使用 Mattson 栈算法在线估算 LLM serving 工作负载 KV cache working set 的分析器。属于 KV cache 工程领域的具体工具创新,09:35 简报未覆盖。

核心贡献: 在线分析而非离线仿真,为 GPU 内存容量规划提供实时依据。


7. AutoRAG — Red Hat OpenShift AI 中的 RAG 评估流水线

来源: Red Hat 官方博客
类型: 官方技术博客
日期: 2026 年 9 月
可信度: 高 — Red Hat 官方工程博客

保留理由: 描述了企业 RAG 的具体评估指标和工具链集成(EvalHub / LM-Eval / SDG Hub),而非泛泛而谈。对比 09:35 简报中的 RAG 对比文章(Width.ai),此篇更具体。

工程内容: - RAG 评估三大核心指标(faithfulness、correctness 等),依赖 LLM-as-judge - EvalHub: 评估控制平面,监控 judge drift - LM-Eval: 基准测试框架 - SDG Hub: 合成数据生成 - Docling 用于 layout-aware 文档解析 - RAFT 模型微调作为 benchmark

生产含义: LLM-as-judge 的 judge drift 是运营风险点,需要持续监控。这点是企业 RAG 系统运营的真实工程痛点。


二、丢弃条目 · 及理由

丢弃 1: SGLang 跨 400,000 生产 GPU 文章(主要部分)

来源: bex.co
丢弃理由: 选型分析和具体 benchmark 数据保留(第 1 条),但文章中「SGLang 已部署 400,000 GPU at xAI/AMD/NVIDIA/Intel/LinkedIn/Cursor」属于市场规模陈述,无工程细节。生产选型数据已覆盖,无需重复归档。


丢弃 2: "Who Pays for the KV Cache" (arXiv:2609.24991)

来源: arXiv:2609.24991
丢弃理由: 属于 FinOps / 云成本归因领域,非核心工程实践条目。提及 vLLM paged KV memory 和 prefix caching 作为模拟器组件,但主体是 Kubernetes 成本分摊和 LLM provider 账单对齐,非推理工程团队的核心参考。归档价值不足以单独收录,可作为 KV Cache 成本优化补充参考。


丢弃 3: Hot-Cold Tiering of HBM and High Bandwidth Flash (arXiv:2609.25782)

来源: arXiv:2609.25782
丢弃理由: 学术研究层面有意义,但属于超长上下文 KV Cache 分层存储的前沿研究方向,距生产工程实践较远,无具体命令、benchmark 或可复现步骤。


丢弃 4: "Query Understanding for Production RAG" (Medium)

来源: Medium
丢弃理由: 属于 RAG 工程系列 Part 8,发布时间 "8 hours ago"(文章本身新鲜),但内容为知识性梳理,非原创工程数据或可执行基准。无具体 benchmark 数据,无错误/命令/源码分析。


丢弃 5: Agentic RAG vs Traditional RAG 对比(Width.ai)

来源: Width.ai
丢弃理由: 内容为策略性分析(Martin Anderson, September 26, 2026),引用微软 AgenticRAG 在 WixQA 基准上 factuality 提升 13%(相对)。但无具体工程命令、错误案例或生产数据。对比今日已归档的 Red Hat AutoRAG 文章,此文工程深度不足。


丢弃 6: LLM 2026 状态 · Interconnects.ai

来源: Interconnects.ai
丢弃理由: 模型市场分析为主(Qwen 下载量领先、Hugging Face 趋势、OpenRouter 使用数据),非具体工程内容。中国模型崛起是趋势观察,无具体工程命令或数据。


丢弃 7: 各类 Substack 综合性文章

涉及:
- "The Agentic Transition Playbook" (Linas Substack)
- "From Sparse Triples to Dense Wiki" (akmaier Substack)
- "Apple AI Hardware" (michaelparekh Substack)
- "Freemium: Anthropic Opus 5.5" (businessanalytics Substack)

丢弃理由: 均属行业分析/投资视角,无具体工程命令、benchmark 数据、源码分析或可复现步骤。Substack 内容筛选规则:仅保留有技术深度和可操作内容的专栏。


三、分类标签汇总

推理引擎 SGLang vLLM llama.cpp Ollama KV-Cache RadixAttention PagedAttention Agentic-RAG RAG-Eval 量化 GGUF Benchmark arXiv AutoRAG Red-Hat OpenShift CUDA ROCm


四、建议写入路径

  • 主草稿: /shared/research-kb/inbox/jay/2026-09-28T1150-jay-engineering-filter-production-benchmarks.md ✅(本文)

五、精读 / 审稿 / 主题页更新建议

行动 条目 原因
精读 Continnum (arXiv:2511.02230v7) KV cache 驱逐策略缺陷是 Agent 平台选型的核心工程依据,需完整阅读机制和实验部分
精读 SGLang vs vLLM (bex.co) 全文 当前仅读取 benchmark 摘要,需获取完整多卡数据、Prefill 性能对比
归档 llama.cpp v0.5.0 版本状态 直接补充进 09:35 简报中的版本对比表
归档 GGUF cmake 构建命令 补充进 llama.cpp 词条的构建部分
主题页更新 新增「SGLang vs vLLM 生产选型决策树」 基于本轮 benchmark 数据,替代现有简单的 Stars 对比
交叉验证 LMSYS Chatbot Arena 核实本轮各引擎的客观排名数据
审稿 RTX 4090/L40S/RTX 5090 基准数值 当前草稿缺失具体 tok/s 数字,需全文读取 ComputingForGeeks 补充