工程筛选报告 · Jay · 2026-09-28(每日第 3 次轮次)
筛选时间: 2026-09-28 19:50(Asia/Shanghai) 筛选范围: vLLM/SGLang benchmark · LMCache · Agent Stack 2026 · KV Cache 调度 · CSDN 推理框架 本次主题: LLM 推理引擎选型 / KV Cache 基础设施 / Agent 生产架构
🔍 候选条目总览
| # | 条目 | 来源 | 主题 |
|---|---|---|---|
| 1 | vLLM vs SGLang vs LMDeploy benchmark (Prem AI) | Web | 推理引擎 benchmark |
| 2 | vLLM vs SGLang 2026 RadixAttention vs PagedAttention (Spheron) | Web | 推理引擎技术对比 |
| 3 | SGLang vs vLLM H100 benchmark (Jarvis Labs) | Web | H100 实测对比 |
| 4 | vLLM vs SGLang vs TensorRT-LLM (inferenceengineering.tech) | Web | 生产级推理对比 |
| 5 | LLM Inference Engines vLLM vs LMDeploy vs SGLang (AIMultiple) | Web | benchmark 数据表 |
| 6 | The AI Agents Stack 2026 Edition (The AI Engineer/ Substack) | Substack | Agent 技术栈 |
| 7 | LMCache KV Cache Layer (arXiv 2510.09665 / GitHub) | arXiv/GitHub | KV Cache 基础设施 |
| 8 | Deploy LMCache on GPU Cloud (Spheron) | Web | LMCache 部署指南 |
| 9 | HotPrefix: Hotness-Aware KV Cache Scheduling (ACM SIGCOMM 2026) | Web | KV Cache 调度新算法 |
| 10 | ISO-Bench: Coding Agents optimize real-world inference (arXiv 2602.19594) | arXiv | Agent 优化 benchmark |
| 11 | An Internet for the KV Cache (arXiv 2608.01526) | arXiv | KV Cache 作为基础设施 |
| 12 | SGLang vs vLLM vs TGI 2026 横评 (CSDN) | CSDN | 推理框架中文对比 |
| 13 | 2026年LLM推理框架全解析 (CSDN) | CSDN | 推理框架入门指南 |
| 14 | SGLang + vLLM 生产对比体验 (CSDN) | CSDN | 生产环境对比 |
| 15 | KVServe: Service-Aware KV Cache Compression (ACM SIGCOMM 2026) | Web | KV Cache 压缩 |
| 16 | Architecting Agentic RAG (aiamastery.substack.com) | Substack | Agentic RAG 架构 |
✅ 保留条目(高工程价值)
✅ 条目 1:vLLM vs SGLang vs LMDeploy benchmark(Prem AI)
保留理由: - 包含实测性能数据:SGLang/LMDeploy 达 16,200 tokens/s,vLLM 约 12,500 tokens/s,差距 29% - 明确 H100 配置前提,注明"your workload will differ,run your own tests" - 包含选型决策树:根据 prefix overlap ratio 判断(>60% 选 SGLang,否则均可) - 提供 practical recommendation:先用 vLLM,再用 SGLang/LMDeploy 按真实流量模式 benchmark
工程价值:可复现的 benchmark 方法论 + 明确的选型决策边界 建议写入: 精读留存,作为推理引擎选型参考数据点
✅ 条目 2:vLLM vs SGLang 2026 — RadixAttention vs PagedAttention(Spheron)
保留理由: - 技术原理拆解清晰:prefix overlap ratio >60% 时 SGLang 显著更优 - 明确各引擎适用场景矩阵:SGLang 适合 multi-turn agents / RAG / 结构化输出;vLLM 适合广谱模型支持 / Blackwell / 成熟 Eagle3 - 引用 vLLM/SGLang 官方生产部署指南链接 - 提供真实性能差异量化:prefix overlap 场景下 SGLang TTFT 和 throughput 领先
工程价值:技术原理对比 + 场景选型矩阵 建议写入: 留存,适合补充进推理引擎选型主题页
✅ 条目 3:SGLang vs vLLM H100 benchmark(Jarvis Labs)
保留理由: - 明确测试配置:单卡 H100 / Qwen2.5-7B,双卡 H100 / Qwen3-30B-A3B 和 Qwen3-32B - 提供框架适用场景分析:vLLM = 通用 baseline,SGLang = 特定 workload 优化 - 包含方法论说明:不同模型/并发/prompt 长度会导致结果差异 - 41 min read 详细深度长文,有代码级别的配置描述
工程价值:H100 实测 + 配置细节 + 场景分析 建议写入: 精读留存
✅ 条目 4:vLLM vs SGLang vs TensorRT-LLM(inferenceengineering.tech)
保留理由: - 专门面向推理工程的角度,含生产 maturity 评估 - 提供 H100 SXM 80GB 部署的代表性性能数字 - 核心问题拆解:"how much operational complexity can you absorb for how much performance gain?" - 强调 feature gap 已大幅弥合,决策关键在运维复杂度 vs 性能收益的权衡 - 提供生产部署指南链接
工程价值:生产工程视角的决策框架,不是纯理论对比 建议写入: 留存
✅ 条目 5:LLM Inference Engines benchmark(AIMultiple)
保留理由: - 含标准化的 benchmark 方法:1,000 ShareGPT prompts / Llama 3.1 8B-Instruct - 提供 CSV 数据下载(可验证性高) - 含 vLLM / LMDeploy / SGLang 三个引擎的横向量化比较 - 上次更新:September 27, 2026(极新鲜) - 含引用格式,可追溯
工程价值:标准化 benchmark + 可下载数据 + 极新鲜日期 建议写入: 精读留存,补充 benchmark 数据集
✅ 条目 6:The AI Agents Stack 2026 Edition(The AI Engineer / Substack)
保留理由: - Substack 高质量来源(AI Engineering Insider / theaiengineer.substack.com) - 明确区分 LLM stack vs Agent stack:Agent 需要 state management / tool access / memory / reasoning loops / guardrails - IBM ACP 和 Google A2A 协议的实际落地分析 - Layer 2 明确描述 MCP servers 如何连接编辑器/终端/文件系统/git - Layer 3 描述 codebase-aware retrieval with reranking(不读全 repo,只取相关文件) - Cursor 的实际路由案例(Claude / GPT-4 / 自有 fine-tuned 模型)
工程价值:生产 Agent 架构 checklist + 协议生态现状 建议写入: 留存,引用为"Agent 技术栈 2026"参考
✅ 条目 7:LMCache — KV Cache Layer for Enterprise LLM Inference(arXiv 2510.09665)
保留理由: - MLSys 2026 Invited Talk 论文,工程价值极高 - 已在 Google Cloud / AWS / NVIDIA / IBM 生产使用 - 明确 KV Cache 从 temporary state → persistent AI-native knowledge 的范式转变 - 支持 vLLM + SGLang 双引擎,已与 llm-d / NVIDIA Dynamo / KServe 集成 - 关键生产经验:remote storage backend 带来的延迟意外收益;context truncation 导致 prefix cache hit rate 下降 - 支持 GPU HBM → CPU DRAM → NVMe → Redis 分层存储
工程价值:生产级 KV Cache 基础设施论文,含实际部署经验数据 建议写入: 精读留存,补充 KV Cache 基础设施主题页
✅ 条目 8:Deploy LMCache on GPU Cloud — 15x Higher Throughput(Spheron)
保留理由:
- 含具体部署命令和 YAML 配置示例(local_cpu: true / local_disk 配置)
- 明确 tier 选择标准:CPU RAM ≥256GB → 开启 CPU warm tier;NVMe 顺序吞吐量 >4GB/s → 开启 cold tier
- 提供实测建议:用 fio 验证磁盘带宽再决定是否用 NVMe tier
- SATA SSD(500 MB/s)明确不推荐作为 cold tier
- 含 LMCache + vLLM 协同工作的具体架构描述
工程价值:具体命令 + 配置阈值 + 硬件选型建议 建议写入: 留存,补充 LMCache 部署最佳实践
✅ 条目 9:HotPrefix — Hotness-Aware KV Cache Scheduling(ACM SIGCOMM 2026)
保留理由: - SIGCOMM 2026 论文,hotness-aware 调度算法 - 解决 prefix sharing 场景下的 KV cache 优先级问题 - 作为 KVServe 同期工作(VLDB 2026)补充,形成 KV cache 调度 + 压缩完整图景
工程价值:顶会论文,追踪 KV Cache 调度前沿 建议写入: 留存归档
✅ 条目 10:ISO-Bench — Coding Agents optimize real-world inference(arXiv 2602.19594)
保留理由: - 独特视角:用 coding agent 测试真实推理优化任务 - 54 个 benchmark 实例(39 from vLLM + 15 from SGLang),含 verified performance benchmarks - 每任务提供 codebase + bottleneck description,agent 须产出 optimization patch - 可与 human expert solution 对比
工程价值:推断优化 benchmark 新范式,适合评估 agent 代码优化能力 建议写入: 留存,关注 AI agents 在 inference engineering 领域的自动化潜力
✅ 条目 11:An Internet for the KV Cache(arXiv 2608.01526)
保留理由: - 视野宽广:KV Cache 作为 storage/communication/scheduling primitive 的范式转变 - 综述 LMCache / TensorRT / llm-d / NVIDIA Dynamo 等主流方案 - 引用 SOLA / ThunderServe / Seesaw / Libra 等调度系统 - 关键判断:prefix caching 已成为生产系统标配,优化 KV cache hit rate 是核心指标
工程价值:KV Cache 基础设施全景综述,适合建立系统认知 建议写入: 精读留存
✅ 条目 15:KVServe — Service-Aware KV Cache Compression(ACM SIGCOMM 2026)
保留理由: - SIGCOMM 2026(2026-08-17),最新顶会工作 - KV Cache 压缩方向,解决 communication-efficient disaggregated LLM serving - 作者含 Benson(MIT CSAIL),可信度高
工程价值:KV Cache 压缩前沿 建议写入: 留存归档
✅ 条目 16:Architecting Agentic RAG(aiamastery.substack.com)
保留理由:
- 含具体 production 考虑:30s timeout / asyncio 并发 / retry with refined retrieval parameters / correlation IDs
- 含可运行的 ./test.sh 命令示例
- 完整的 pipeline test 流程描述
工程价值:Agentic RAG 生产部署检查清单,含超时/并发/重试/retry 设计 建议写入: 留存,补充 RAG 生产工程实践
❌ 丢弃条目(低工程价值)
❌ 条目 12:CSDN SGLang vs vLLM vs TGI 2026 横评
丢弃理由: - 内容实为英文 benchmark 的中文翻译整理,无原创工程数据 - 原文已在本轮保留(条目 1-5) - 属二手编译,无独立工程价值 - 建议:直接引用英文原始来源
❌ 条目 13:CSDN 2026年LLM推理框架全解析
丢弃理由: - 入门级教程文章,无实测数据 - 场景推荐矩阵过于简化("vLLM 略优" / "SGLang RadixAttention 75%" 等数字无来源) - 无具体命令、配置或错误处理 - 建议:直接引用英文 benchmark 原文(Prem AI / Spheron / Jarvis Labs)
❌ 条目 14:CSDN SGLang + vLLM 生产对比体验
丢弃理由: - 含部分代码片段(DSL 示例),但整体为综述性质 - JSON schema / guide() 组合描述有价值,但与英文来源重叠 - 错误堆栈深的警告("调试时错误堆栈略深")属于二手经验,无新工程数据
📊 筛选统计
| 指标 | 数量 |
|---|---|
| 候选总数 | 16 |
| 保留(✅) | 13 |
| 丢弃(❌) | 3 |
| 高价值(精读) | 6(条目 1, 5, 7, 8, 11, 16) |
| 归档留存 | 7 |
🏷️ 分类标签
inference-engineering vLLM SGLang LMDeploy benchmark
kv-cache LMCache prefix-caching PD-disaggregation
agentic-architecture MCP A2A ACP
production-deployment H100 multi-GPU
arxiv sigcomm-2026 vldb-2026
substack theaiengineer aiamastery
CSDN(已过滤)
📁 建议写入路径
精读草稿(建议写入 jay/inbox/):
- /shared/research-kb/inbox/jay/2026-09-28T1950-jay-engineering-filter.md(本文件)
- 建议补充写入:LMCache 精读笔记(含 Spheron 部署指南核心数据)
主题页更新建议:
- inference-engineering 主题页:补充 vLLM vs SGLang benchmark 数据表(条目 1, 3, 5)
- kv-cache-infrastructure 主题页:补充 LMCache 生产集成经验(条目 7, 8)
- agent-architecture 主题页:补充 The AI Agents Stack 2026(条目 6)
🔬 后续行动建议
| 优先级 | 行动 | 对应条目 |
|---|---|---|
| 高 | 精读 LMCache arXiv 论文(含生产部署数据) | 条目 7 |
| 高 | 精读 Spheron LMCache 部署指南(含 YAML 配置和硬件阈值) | 条目 8 |
| 高 | 精读 AIMultiple benchmark(含 CSV 下载 + September 27 更新) | 条目 5 |
| 中 | 精读 ISO-Bench(评估 agent 优化 inference 的 benchmark 新范式) | 条目 10 |
| 中 | 归档 SIGCOMM 2026 KV Cache 论文(条目 9, 15) | 条目 9, 15 |
| 低 | 归档 arXiv "Internet for KV Cache"(建立全景认知) | 条目 11 |
本轮筛选完毕。未执行 GitHub 写入。