工程筛选报告 · Jay · 2026-09-28(每日第 3 次轮次)

筛选时间: 2026-09-28 19:50(Asia/Shanghai) 筛选范围: vLLM/SGLang benchmark · LMCache · Agent Stack 2026 · KV Cache 调度 · CSDN 推理框架 本次主题: LLM 推理引擎选型 / KV Cache 基础设施 / Agent 生产架构


🔍 候选条目总览

# 条目 来源 主题
1 vLLM vs SGLang vs LMDeploy benchmark (Prem AI) Web 推理引擎 benchmark
2 vLLM vs SGLang 2026 RadixAttention vs PagedAttention (Spheron) Web 推理引擎技术对比
3 SGLang vs vLLM H100 benchmark (Jarvis Labs) Web H100 实测对比
4 vLLM vs SGLang vs TensorRT-LLM (inferenceengineering.tech) Web 生产级推理对比
5 LLM Inference Engines vLLM vs LMDeploy vs SGLang (AIMultiple) Web benchmark 数据表
6 The AI Agents Stack 2026 Edition (The AI Engineer/ Substack) Substack Agent 技术栈
7 LMCache KV Cache Layer (arXiv 2510.09665 / GitHub) arXiv/GitHub KV Cache 基础设施
8 Deploy LMCache on GPU Cloud (Spheron) Web LMCache 部署指南
9 HotPrefix: Hotness-Aware KV Cache Scheduling (ACM SIGCOMM 2026) Web KV Cache 调度新算法
10 ISO-Bench: Coding Agents optimize real-world inference (arXiv 2602.19594) arXiv Agent 优化 benchmark
11 An Internet for the KV Cache (arXiv 2608.01526) arXiv KV Cache 作为基础设施
12 SGLang vs vLLM vs TGI 2026 横评 (CSDN) CSDN 推理框架中文对比
13 2026年LLM推理框架全解析 (CSDN) CSDN 推理框架入门指南
14 SGLang + vLLM 生产对比体验 (CSDN) CSDN 生产环境对比
15 KVServe: Service-Aware KV Cache Compression (ACM SIGCOMM 2026) Web KV Cache 压缩
16 Architecting Agentic RAG (aiamastery.substack.com) Substack Agentic RAG 架构

✅ 保留条目(高工程价值)

✅ 条目 1:vLLM vs SGLang vs LMDeploy benchmark(Prem AI)

保留理由: - 包含实测性能数据:SGLang/LMDeploy 达 16,200 tokens/s,vLLM 约 12,500 tokens/s,差距 29% - 明确 H100 配置前提,注明"your workload will differ,run your own tests" - 包含选型决策树:根据 prefix overlap ratio 判断(>60% 选 SGLang,否则均可) - 提供 practical recommendation:先用 vLLM,再用 SGLang/LMDeploy 按真实流量模式 benchmark

工程价值:可复现的 benchmark 方法论 + 明确的选型决策边界 建议写入: 精读留存,作为推理引擎选型参考数据点


✅ 条目 2:vLLM vs SGLang 2026 — RadixAttention vs PagedAttention(Spheron)

保留理由: - 技术原理拆解清晰:prefix overlap ratio >60% 时 SGLang 显著更优 - 明确各引擎适用场景矩阵:SGLang 适合 multi-turn agents / RAG / 结构化输出;vLLM 适合广谱模型支持 / Blackwell / 成熟 Eagle3 - 引用 vLLM/SGLang 官方生产部署指南链接 - 提供真实性能差异量化:prefix overlap 场景下 SGLang TTFT 和 throughput 领先

工程价值:技术原理对比 + 场景选型矩阵 建议写入: 留存,适合补充进推理引擎选型主题页


✅ 条目 3:SGLang vs vLLM H100 benchmark(Jarvis Labs)

保留理由: - 明确测试配置:单卡 H100 / Qwen2.5-7B,双卡 H100 / Qwen3-30B-A3B 和 Qwen3-32B - 提供框架适用场景分析:vLLM = 通用 baseline,SGLang = 特定 workload 优化 - 包含方法论说明:不同模型/并发/prompt 长度会导致结果差异 - 41 min read 详细深度长文,有代码级别的配置描述

工程价值:H100 实测 + 配置细节 + 场景分析 建议写入: 精读留存


✅ 条目 4:vLLM vs SGLang vs TensorRT-LLM(inferenceengineering.tech)

保留理由: - 专门面向推理工程的角度,含生产 maturity 评估 - 提供 H100 SXM 80GB 部署的代表性性能数字 - 核心问题拆解:"how much operational complexity can you absorb for how much performance gain?" - 强调 feature gap 已大幅弥合,决策关键在运维复杂度 vs 性能收益的权衡 - 提供生产部署指南链接

工程价值:生产工程视角的决策框架,不是纯理论对比 建议写入: 留存


✅ 条目 5:LLM Inference Engines benchmark(AIMultiple)

保留理由: - 含标准化的 benchmark 方法:1,000 ShareGPT prompts / Llama 3.1 8B-Instruct - 提供 CSV 数据下载(可验证性高) - 含 vLLM / LMDeploy / SGLang 三个引擎的横向量化比较 - 上次更新:September 27, 2026(极新鲜) - 含引用格式,可追溯

工程价值:标准化 benchmark + 可下载数据 + 极新鲜日期 建议写入: 精读留存,补充 benchmark 数据集


✅ 条目 6:The AI Agents Stack 2026 Edition(The AI Engineer / Substack)

保留理由: - Substack 高质量来源(AI Engineering Insider / theaiengineer.substack.com) - 明确区分 LLM stack vs Agent stack:Agent 需要 state management / tool access / memory / reasoning loops / guardrails - IBM ACP 和 Google A2A 协议的实际落地分析 - Layer 2 明确描述 MCP servers 如何连接编辑器/终端/文件系统/git - Layer 3 描述 codebase-aware retrieval with reranking(不读全 repo,只取相关文件) - Cursor 的实际路由案例(Claude / GPT-4 / 自有 fine-tuned 模型)

工程价值:生产 Agent 架构 checklist + 协议生态现状 建议写入: 留存,引用为"Agent 技术栈 2026"参考


✅ 条目 7:LMCache — KV Cache Layer for Enterprise LLM Inference(arXiv 2510.09665)

保留理由: - MLSys 2026 Invited Talk 论文,工程价值极高 - 已在 Google Cloud / AWS / NVIDIA / IBM 生产使用 - 明确 KV Cache 从 temporary state → persistent AI-native knowledge 的范式转变 - 支持 vLLM + SGLang 双引擎,已与 llm-d / NVIDIA Dynamo / KServe 集成 - 关键生产经验:remote storage backend 带来的延迟意外收益;context truncation 导致 prefix cache hit rate 下降 - 支持 GPU HBM → CPU DRAM → NVMe → Redis 分层存储

工程价值:生产级 KV Cache 基础设施论文,含实际部署经验数据 建议写入: 精读留存,补充 KV Cache 基础设施主题页


✅ 条目 8:Deploy LMCache on GPU Cloud — 15x Higher Throughput(Spheron)

保留理由: - 含具体部署命令和 YAML 配置示例(local_cpu: true / local_disk 配置) - 明确 tier 选择标准:CPU RAM ≥256GB → 开启 CPU warm tier;NVMe 顺序吞吐量 >4GB/s → 开启 cold tier - 提供实测建议:用 fio 验证磁盘带宽再决定是否用 NVMe tier - SATA SSD(500 MB/s)明确不推荐作为 cold tier - 含 LMCache + vLLM 协同工作的具体架构描述

工程价值:具体命令 + 配置阈值 + 硬件选型建议 建议写入: 留存,补充 LMCache 部署最佳实践


✅ 条目 9:HotPrefix — Hotness-Aware KV Cache Scheduling(ACM SIGCOMM 2026)

保留理由: - SIGCOMM 2026 论文,hotness-aware 调度算法 - 解决 prefix sharing 场景下的 KV cache 优先级问题 - 作为 KVServe 同期工作(VLDB 2026)补充,形成 KV cache 调度 + 压缩完整图景

工程价值:顶会论文,追踪 KV Cache 调度前沿 建议写入: 留存归档


✅ 条目 10:ISO-Bench — Coding Agents optimize real-world inference(arXiv 2602.19594)

保留理由: - 独特视角:用 coding agent 测试真实推理优化任务 - 54 个 benchmark 实例(39 from vLLM + 15 from SGLang),含 verified performance benchmarks - 每任务提供 codebase + bottleneck description,agent 须产出 optimization patch - 可与 human expert solution 对比

工程价值:推断优化 benchmark 新范式,适合评估 agent 代码优化能力 建议写入: 留存,关注 AI agents 在 inference engineering 领域的自动化潜力


✅ 条目 11:An Internet for the KV Cache(arXiv 2608.01526)

保留理由: - 视野宽广:KV Cache 作为 storage/communication/scheduling primitive 的范式转变 - 综述 LMCache / TensorRT / llm-d / NVIDIA Dynamo 等主流方案 - 引用 SOLA / ThunderServe / Seesaw / Libra 等调度系统 - 关键判断:prefix caching 已成为生产系统标配,优化 KV cache hit rate 是核心指标

工程价值:KV Cache 基础设施全景综述,适合建立系统认知 建议写入: 精读留存


✅ 条目 15:KVServe — Service-Aware KV Cache Compression(ACM SIGCOMM 2026)

保留理由: - SIGCOMM 2026(2026-08-17),最新顶会工作 - KV Cache 压缩方向,解决 communication-efficient disaggregated LLM serving - 作者含 Benson(MIT CSAIL),可信度高

工程价值:KV Cache 压缩前沿 建议写入: 留存归档


✅ 条目 16:Architecting Agentic RAG(aiamastery.substack.com)

保留理由: - 含具体 production 考虑:30s timeout / asyncio 并发 / retry with refined retrieval parameters / correlation IDs - 含可运行的 ./test.sh 命令示例 - 完整的 pipeline test 流程描述

工程价值:Agentic RAG 生产部署检查清单,含超时/并发/重试/retry 设计 建议写入: 留存,补充 RAG 生产工程实践


❌ 丢弃条目(低工程价值)

❌ 条目 12:CSDN SGLang vs vLLM vs TGI 2026 横评

丢弃理由: - 内容实为英文 benchmark 的中文翻译整理,无原创工程数据 - 原文已在本轮保留(条目 1-5) - 属二手编译,无独立工程价值 - 建议:直接引用英文原始来源


❌ 条目 13:CSDN 2026年LLM推理框架全解析

丢弃理由: - 入门级教程文章,无实测数据 - 场景推荐矩阵过于简化("vLLM 略优" / "SGLang RadixAttention 75%" 等数字无来源) - 无具体命令、配置或错误处理 - 建议:直接引用英文 benchmark 原文(Prem AI / Spheron / Jarvis Labs)


❌ 条目 14:CSDN SGLang + vLLM 生产对比体验

丢弃理由: - 含部分代码片段(DSL 示例),但整体为综述性质 - JSON schema / guide() 组合描述有价值,但与英文来源重叠 - 错误堆栈深的警告("调试时错误堆栈略深")属于二手经验,无新工程数据


📊 筛选统计

指标 数量
候选总数 16
保留(✅) 13
丢弃(❌) 3
高价值(精读) 6(条目 1, 5, 7, 8, 11, 16)
归档留存 7

🏷️ 分类标签

inference-engineering  vLLM  SGLang  LMDeploy  benchmark
kv-cache  LMCache  prefix-caching  PD-disaggregation
agentic-architecture  MCP  A2A  ACP
production-deployment  H100  multi-GPU
arxiv  sigcomm-2026  vldb-2026
substack  theaiengineer  aiamastery
CSDN(已过滤)

📁 建议写入路径

精读草稿(建议写入 jay/inbox/): - /shared/research-kb/inbox/jay/2026-09-28T1950-jay-engineering-filter.md(本文件) - 建议补充写入:LMCache 精读笔记(含 Spheron 部署指南核心数据)

主题页更新建议: - inference-engineering 主题页:补充 vLLM vs SGLang benchmark 数据表(条目 1, 3, 5) - kv-cache-infrastructure 主题页:补充 LMCache 生产集成经验(条目 7, 8) - agent-architecture 主题页:补充 The AI Agents Stack 2026(条目 6)


🔬 后续行动建议

优先级 行动 对应条目
高 精读 LMCache arXiv 论文(含生产部署数据) 条目 7
高 精读 Spheron LMCache 部署指南(含 YAML 配置和硬件阈值) 条目 8
高 精读 AIMultiple benchmark(含 CSV 下载 + September 27 更新) 条目 5
中 精读 ISO-Bench(评估 agent 优化 inference 的 benchmark 新范式) 条目 10
中 归档 SIGCOMM 2026 KV Cache 论文(条目 9, 15) 条目 9, 15
低 归档 arXiv "Internet for KV Cache"(建立全景认知) 条目 11

本轮筛选完毕。未执行 GitHub 写入。