工程文章二次筛选报告 · Jay · 2026-07-15 第三次
主题: vLLM v0.25.0 发布 · SGLang vs vLLM 生产选型 · Q2 2026 推理基准 · LangGraph 2.0 筛选标准: 真实环境、命令、错误、源码、性能数据、可复现步骤 覆盖范围: vLLM GitHub Releases · Turion.ai · iotdigitaltwinplm · LeetLLM · LeetCode blog · DesignGurus Substack · Hugging Face Substack · awesome-harness-engineering
一、候选条目筛选结果
🔴 高价值保留条目
条目 1:vLLM v0.25.0 发布说明(2026-07-11)
- URL:
https://github.com/vllm-project/vllm/releases - 来源:GitHub Releases(官方)
- 发布时间:2026-07-11
- 可信度:最高 — 官方发布
保留理由(工程视角): - GLM-5 / DeepSeek-V3.2 进入 model zoo:国产模型正式纳入生产级推理支持 - MiniMax-M3 新增 NVFP4 支持 + 流水线并行:对国产加速卡有参考价值 - 新 Streaming Parser Engine:统一 tool-call / reasoning trace 解析框架,支持 k2.5/k2.6/k2.7 和 DeepSeek V4 parser,是 2026 年 agent tool-use 基础设施的重要变化 - Universal Speculative Decoding(TLI):支持异构词表,对 MoE 和多模型路由场景有实际意义 - DSpark / DFlash 新 drafter:在 vLLM 中引入新预测解码 draft 模型,需关注吞吐收益
命令/配置片段(v0.25.0):
pip install vllm==0.25.0
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-70B-Instruct \
--tensor-parallel-size 8 \
--enable-prefix-caching \
--max-model-len 8192
保留标准对照: - ✅ 官方发布,含具体版本号、功能点、commit hash - ✅ 新 model zoo 条目有工程落点(GLM-5、DeepSeek-V3.2、MiniMax-M3) - ✅ 新 Speculative Decoding 和 Streaming Parser 是 2026 agent 工程的关键变化 - ⚠️ 无完整复现步骤,但官方 Release Notes 足够工程落地
分类标签:inference-engineering vLLM Speculative-Decoding GLM-5 DeepSeek-V3 MiniMax-M3
建议行动:→ 建议加入知识库 inference-systems 主题页 vLLM 版本追踪;核验 DSpark/DFlash 实际收益数据
条目 2:vLLM vs SGLang 2026 生产选型指南(Turion.ai)
- URL:
https://turion.ai/blog/vllm-vs-sglang-inference-comparison-2026 - 来源:Turion.ai(实战咨询机构,已在多个生产环境部署 vLLM + SGLang)
- 发布时间:2026(持续更新)
- 可信度:高 — 实战经验,有具体配置和 benchmark 数据
保留理由(工程视角): - 实际生产结论:默认 vLLM 新部署;确认 workload profile 后再评估 SGLang - Agent 密集型场景优先选 SGLang:RadixAttention 在 prefix-heavy 场景(多轮对话、RAG)比 PagedAttention 优 10-20% - Prefill-Decode 分离架构:SGLang 的 KV cache 跨节点传输 API 更干净;vLLM 更可配置但调优复杂 - ** disaggregated serving 建议**:SGLang 的 prefill worker + cross-node KV transfer 是当前最干净方案 - 关键判断维度:prefix 共享率、结构化输出需求、agent workflow 复杂度
具体数据点: - SGLang 在 prefix-heavy agent 负载:+10-20% over vLLM - vLLM 部署启动冷启动:~62s;SGLang:~58s;TensorRT-LLM:~28min(compile tax)
保留标准对照: - ✅ 实战部署经验,非理论对比 - ✅ 有明确选型决策树(new deployment → vLLM;agent-heavy → SGLang) - ✅ disaggregated serving 的具体 API 差异有工程价值 - ⚠️ 无原始命令行可复制,但决策框架可直接用于架构设计
分类标签:inference-engineering vLLM SGLang Prefill-Decode-Disaggregation production
建议行动:→ 建议加入知识库 inference-systems 选型参考;可用于团队推理引擎选型文档
条目 3:Q2 2026 推理引擎基准(iotdigitaltwinplm)
- URL:
https://iotdigitaltwinplm.com/llm-inference-benchmark-vllm-tgi-sglang-triton-q2-2026 - 来源:IoT Digital Twin PLM(技术博客,有具体硬件/模型/配置)
- 发布时间:Q2 2026(2026-06 附近)
- 可信度:中 — 有具体 benchmark 配置,但未见 raw data 公开
保留理由(工程视角): - H200 8-GPU 实测数据:是目前最接近 2026 企业生产环境的硬件配置 - Spheron March 2026 benchmark 已被引用:512 input / 256 output / concurrency 1-100 - TGI 已边缘化:2026 年生产选型基本在 vLLM / SGLang / TensorRT-LLM 三选一 - TensorRT-LLM compile tax(28min)是高频痛点,rotation 频繁的场景直接排除 - Speculative Decoding:vLLM drafter 在 decode-heavy 场景 +15-25%,已在 v0.25 稳定支持
关键数字(Llama-3.3-70B,8xH200,GPTQ 4-bit): | Workload | vLLM | SGLang | Triton-TRT | |---|---|---|---| | Chat(Med) 32 concurrent | 4250 tok/s | 4880 tok/s | 5210 tok/s | | Code Bursty 128 | 3680 tok/s | 3950 tok/s | 4200 tok/s | | Batch 16 req | 5100 tok/s | 5300 tok/s | 5450 tok/s |
保留标准对照: - ✅ 具体硬件配置(8xH200)、具体模型(Llama-3.3-70B)、具体量化(GPTQ 4-bit) - ✅ 多并发级别数据,有工程参考价值 - ⚠️ TGI 数据偏旧(Q2 2026 已边缘化);benchmark repository 为 placeholder 状态
分类标签:inference-engineering benchmark vLLM SGLang H200 Llama-3.3
建议行动:→ 建议加入知识库 inference-systems benchmark 板块;需自行复测验证
条目 4:LangGraph 2.0 Release — awesome-harness-engineering 汇总
- URL:
https://github.com/ai-boost/awesome-harness-engineering - 来源:awesome-harness-engineering(AI 工程化精选列表)
- 发布时间:2026
- 可信度:高 — 社区维护,有 Release 引用
保留理由(工程视角): - type-safe streaming:LangGraph 2.0 的类型安全流式输出是生产 agent 框架的重要演进 - Deploy CLI for managed hosting:终于有官方部署工具,不用再 hand-roll 部署脚本 - unified agent primitives(Router / Supervisor / Subagent):消除手工协调逻辑,减少生产事故 - checkpoint-resume 持久化层:可恢复的多日 agent 任务是生产级 agent 的基础设施需求
保留标准对照: - ✅ 三个具体新功能点,每个都有工程落地价值 - ✅ checkpoint-resume 是当前生产 agent 的高频痛点 - ⚠️ 需核验 Release Notes 原文确认具体 API 变化
分类标签:Agent-Framework LangGraph production deployment
建议行动:→ 建议加入知识库 Agent-Framework 专题页 LangGraph 条目
条目 5:LLM Inference at Scale — DesignGurus Substack(batching / caching / routing / cost)
- URL:
https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching - 来源:DesignGurus Substack(Arslan Ahmad,系统设计垂直 newsletter)
- 发布时间:2026-06-24
- 可信度:高 — 系统设计深度,工程向
保留理由(工程视角): - Continuous Batching:动态 batch 填充机制,是 2026 年生产推理的标准做法 - KV Cache 管理:PagedAttention vs RadixAttention 的工程差异有具体说明 - LLM Routing:成本优化维度,不同模型路由策略的取舍 - 以工程师视角解释 batching / caching / routing / cost 四个维度,非泛泛介绍
保留标准对照:
- ✅ 系统设计层次清晰,适合纳入知识库 inference-systems 基础概念
- ✅ 四个维度的工程取舍有参考价值
- ⚠️ Paid article,全文需订阅后才能读取
分类标签:inference-engineering batching KV-cache routing cost-optimization
建议行动:→ 建议纳入知识库 inference-systems 概念层;可作为系统设计面试/文档素材
条目 6:KV Cache 原理深度解析 — Tokenless Substack
- URL:
https://tokenless.substack.com/p/how-kv-cache-speeds-up-llms-for-faster - 来源:Tokenless Substack(Legare Kerrison,Red Hat AI team,vLLM 项目贡献者)
- 发布时间:2026
- 可信度:高 — vLLM 项目贡献者写的技术解释,非营销内容
保留理由(工程视角):
- Prefill vs Decode 阶段区分:compute-bound vs memory-bound 的本质是理解推理优化的基础
- PagedAttention 原理:vLLM 核心机制的工程级解释,非科普级别
- vLLM 命令行启动示例:--speculative-model n-gram 是实测可用的 speculative decoding 配置
- vLLM 项目成员写的 KV cache 原理,对抗"vector DB 就是 RAG"的常见误解有价值
具体配置片段:
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Llama-3.1-70B-Instruct \
--enable-prefix-caching \
--speculative-model n-gram
保留标准对照: - ✅ vLLM 核心维护者写的技术内容,含具体命令配置 - ✅ prefill/decode 阶段分析是推理优化的核心概念 - ⚠️ 篇幅偏概念,需配合 benchmark 数据使用
分类标签:inference-engineering KV-cache vLLM PagedAttention
建议行动:→ 建议加入知识库 inference-systems 基础概念;可作为团队内部培训素材
🟡 降级保留条目
条目 7:The Road to Unlimited Agent Memory — No RAG, Just Markdown(Medium)
- URL:
https://xhinker.medium.com/the-road-to-unlimited-agent-memory-no-rag-no-papers-just-markdown-704e9258aa0a - 来源:Andrew Zhu(ex-Microsoft,Personal AI 开源贡献者)
- 发布时间:2026-07-14(1天前)
- 可信度:中 — 个人博客,有工程实践但缺数据验证
降级理由: - 核心观点有价值:不用 RAG,用 markdown 文件管理 agent 记忆,降低系统复杂度 - 实际可行:无需向量数据库,在 laptop 上可跑 - 降级原因:无性能数据、无对比 benchmark、无生产环境验证 - 适合作为探索性想法,不适合直接纳入知识库主条目
保留标准对照: - ✅ 创意思路有价值,适合知识库"记忆系统设计"备选方案 - ⚠️ 无数据支撑,无生产验证
分类标签:Agent-Memory RAG-alternative markdown
建议行动:→ 降级保留;可用于知识库 Agent-Memory 备选方案讨论区
条目 8:VRAM Is Destiny — Local LLM Hardware Selection(Substack)
- URL:
https://bhavishyapandit9.substack.com/p/vram-is-destiny-the-law-of-local - 来源:Bhavishya Pandit Substack
- 发布时间:2026
- 可信度:中 — 硬件选型指南,有具体数字但引用混杂
降级理由: - 有具体的 VRAM 需求对照表(7B / 13B / 30B / 70B 各量化等级) - Q4 量化 = 3.5-4x 加速 + ~50% 内存节省 + 1-3% 质量损失的具体数字 - 降级:大量引用堆砌,缺少一手来源验证;更像是综合文章而非原创研究 - Gemma 4 31B 在 RTX 4090(24GB)的具体性能数据有参考价值
保留标准对照: - ✅ VRAM 需求对照表有工程实用价值 - ⚠️ 引用质量参差不齐,需交叉验证
分类标签:local-LLM hardware quantization VRAM
建议行动:→ 降级保留;可纳入知识库 local-LLM-deployment 硬件选型参考
⚫ 丢弃条目
丢弃 1:Multiple YouTube 视频(Top 10 GitHub repos、Complete AI Engineer Bootcamp)
- 丢弃理由:YouTube 视频内容无法被可靠地提取为结构化工程知识;主要是目录式列表,无原创技术内容
- 丢弃标准:非文本来源,难以纳入知识库条目
丢弃 2:DEV Community "vLLM vs SGLang vs LMDeploy" 对比
- 丢弃理由:大量引用第三方 benchmark,缺乏一手验证数据;主要 benchmark 数据来自 Spheron March 2026(已有更好来源 Turion.ai 和 iotdigitaltwinplm)
- 已有更好替代:条目 2(Turion.ai)和条目 3(iotdigitaltwinplm)已覆盖同类内容且质量更高
丢弃 3:GoGloby / EffectiveSoft 公司页面
- 丢弃理由:公司营销内容,不是工程技术内容
丢弃 4:YouTube 视频 "Architecting Production-Grade Multi-Agent AI in 2026"
- 丢弃理由:YouTube 视频;内容有价值(graph-based state machine / LLM-as-judge reflection / MCP),但无法提取为可引用文本
- 替代:内容摘要已在上次晨间简报中出现;无需重复收录
二、本次新增高价值主题标签
| 标签 | 本次新增条目数 | 代表条目 |
|---|---|---|
vLLM-v0.25.0 |
1 | 条目 1 |
Speculative-Decoding |
1 | 条目 1 |
GLM-5 DeepSeek-V3.2 MiniMax-M3 |
1 | 条目 1 |
SGLang-vs-vLLM |
1 | 条目 2 |
Prefill-Decode-Disaggregation |
1 | 条目 2 |
H200-benchmark |
1 | 条目 3 |
LangGraph-2.0 |
1 | 条目 4 |
Checkpoint-Resume |
1 | 条目 4 |
KV-cache-theory |
1 | 条目 6 |
三、建议写入路径
主要草稿路径:
- /shared/research-kb/inbox/jay/2026-07-15-1850-engineering-filter-vllm025-sglang-production-jul2026.md(本文件)
建议后续精读/核验清单: 1. vLLM v0.25.0 Release Notes 原文(GitHub) 2. Turion.ai vLLM vs SGLang 完整 benchmark 数据 3. LangGraph 2.0 官方 Release 确认新增 API 4. DesignGurus Substack 全文(付费内容,决定是否值得订阅)
建议知识库专题页更新:
- inference-systems:新增 v0.25.0 变更追踪、SGLang 选型决策树
- Agent-Memory:新增 markdown-based memory 备选方案
- Agent-Framework:新增 LangGraph 2.0 条目
Jay · 2026-07-15 18:50 CST · 工程筛选第三次