工程文章二次筛选报告 · Jay · 2026-07-15 第三次

主题: vLLM v0.25.0 发布 · SGLang vs vLLM 生产选型 · Q2 2026 推理基准 · LangGraph 2.0 筛选标准: 真实环境、命令、错误、源码、性能数据、可复现步骤 覆盖范围: vLLM GitHub Releases · Turion.ai · iotdigitaltwinplm · LeetLLM · LeetCode blog · DesignGurus Substack · Hugging Face Substack · awesome-harness-engineering


一、候选条目筛选结果


🔴 高价值保留条目


条目 1:vLLM v0.25.0 发布说明(2026-07-11)

  • URLhttps://github.com/vllm-project/vllm/releases
  • 来源:GitHub Releases(官方)
  • 发布时间:2026-07-11
  • 可信度:最高 — 官方发布

保留理由(工程视角): - GLM-5 / DeepSeek-V3.2 进入 model zoo:国产模型正式纳入生产级推理支持 - MiniMax-M3 新增 NVFP4 支持 + 流水线并行:对国产加速卡有参考价值 - 新 Streaming Parser Engine:统一 tool-call / reasoning trace 解析框架,支持 k2.5/k2.6/k2.7 和 DeepSeek V4 parser,是 2026 年 agent tool-use 基础设施的重要变化 - Universal Speculative Decoding(TLI):支持异构词表,对 MoE 和多模型路由场景有实际意义 - DSpark / DFlash 新 drafter:在 vLLM 中引入新预测解码 draft 模型,需关注吞吐收益

命令/配置片段(v0.25.0):

pip install vllm==0.25.0
python -m vllm.entrypoints.openai.api_server \
  --model meta-llama/Llama-3.1-70B-Instruct \
  --tensor-parallel-size 8 \
  --enable-prefix-caching \
  --max-model-len 8192

保留标准对照: - ✅ 官方发布,含具体版本号、功能点、commit hash - ✅ 新 model zoo 条目有工程落点(GLM-5、DeepSeek-V3.2、MiniMax-M3) - ✅ 新 Speculative Decoding 和 Streaming Parser 是 2026 agent 工程的关键变化 - ⚠️ 无完整复现步骤,但官方 Release Notes 足够工程落地

分类标签inference-engineering vLLM Speculative-Decoding GLM-5 DeepSeek-V3 MiniMax-M3 建议行动:→ 建议加入知识库 inference-systems 主题页 vLLM 版本追踪;核验 DSpark/DFlash 实际收益数据


条目 2:vLLM vs SGLang 2026 生产选型指南(Turion.ai)

  • URLhttps://turion.ai/blog/vllm-vs-sglang-inference-comparison-2026
  • 来源:Turion.ai(实战咨询机构,已在多个生产环境部署 vLLM + SGLang)
  • 发布时间:2026(持续更新)
  • 可信度:高 — 实战经验,有具体配置和 benchmark 数据

保留理由(工程视角): - 实际生产结论:默认 vLLM 新部署;确认 workload profile 后再评估 SGLang - Agent 密集型场景优先选 SGLang:RadixAttention 在 prefix-heavy 场景(多轮对话、RAG)比 PagedAttention 优 10-20% - Prefill-Decode 分离架构:SGLang 的 KV cache 跨节点传输 API 更干净;vLLM 更可配置但调优复杂 - ** disaggregated serving 建议**:SGLang 的 prefill worker + cross-node KV transfer 是当前最干净方案 - 关键判断维度:prefix 共享率、结构化输出需求、agent workflow 复杂度

具体数据点: - SGLang 在 prefix-heavy agent 负载:+10-20% over vLLM - vLLM 部署启动冷启动:~62s;SGLang:~58s;TensorRT-LLM:~28min(compile tax)

保留标准对照: - ✅ 实战部署经验,非理论对比 - ✅ 有明确选型决策树(new deployment → vLLM;agent-heavy → SGLang) - ✅ disaggregated serving 的具体 API 差异有工程价值 - ⚠️ 无原始命令行可复制,但决策框架可直接用于架构设计

分类标签inference-engineering vLLM SGLang Prefill-Decode-Disaggregation production 建议行动:→ 建议加入知识库 inference-systems 选型参考;可用于团队推理引擎选型文档


条目 3:Q2 2026 推理引擎基准(iotdigitaltwinplm)

  • URLhttps://iotdigitaltwinplm.com/llm-inference-benchmark-vllm-tgi-sglang-triton-q2-2026
  • 来源:IoT Digital Twin PLM(技术博客,有具体硬件/模型/配置)
  • 发布时间:Q2 2026(2026-06 附近)
  • 可信度:中 — 有具体 benchmark 配置,但未见 raw data 公开

保留理由(工程视角): - H200 8-GPU 实测数据:是目前最接近 2026 企业生产环境的硬件配置 - Spheron March 2026 benchmark 已被引用:512 input / 256 output / concurrency 1-100 - TGI 已边缘化:2026 年生产选型基本在 vLLM / SGLang / TensorRT-LLM 三选一 - TensorRT-LLM compile tax(28min)是高频痛点,rotation 频繁的场景直接排除 - Speculative Decoding:vLLM drafter 在 decode-heavy 场景 +15-25%,已在 v0.25 稳定支持

关键数字(Llama-3.3-70B,8xH200,GPTQ 4-bit): | Workload | vLLM | SGLang | Triton-TRT | |---|---|---|---| | Chat(Med) 32 concurrent | 4250 tok/s | 4880 tok/s | 5210 tok/s | | Code Bursty 128 | 3680 tok/s | 3950 tok/s | 4200 tok/s | | Batch 16 req | 5100 tok/s | 5300 tok/s | 5450 tok/s |

保留标准对照: - ✅ 具体硬件配置(8xH200)、具体模型(Llama-3.3-70B)、具体量化(GPTQ 4-bit) - ✅ 多并发级别数据,有工程参考价值 - ⚠️ TGI 数据偏旧(Q2 2026 已边缘化);benchmark repository 为 placeholder 状态

分类标签inference-engineering benchmark vLLM SGLang H200 Llama-3.3 建议行动:→ 建议加入知识库 inference-systems benchmark 板块;需自行复测验证


条目 4:LangGraph 2.0 Release — awesome-harness-engineering 汇总

  • URLhttps://github.com/ai-boost/awesome-harness-engineering
  • 来源:awesome-harness-engineering(AI 工程化精选列表)
  • 发布时间:2026
  • 可信度:高 — 社区维护,有 Release 引用

保留理由(工程视角): - type-safe streaming:LangGraph 2.0 的类型安全流式输出是生产 agent 框架的重要演进 - Deploy CLI for managed hosting:终于有官方部署工具,不用再 hand-roll 部署脚本 - unified agent primitives(Router / Supervisor / Subagent):消除手工协调逻辑,减少生产事故 - checkpoint-resume 持久化层:可恢复的多日 agent 任务是生产级 agent 的基础设施需求

保留标准对照: - ✅ 三个具体新功能点,每个都有工程落地价值 - ✅ checkpoint-resume 是当前生产 agent 的高频痛点 - ⚠️ 需核验 Release Notes 原文确认具体 API 变化

分类标签Agent-Framework LangGraph production deployment 建议行动:→ 建议加入知识库 Agent-Framework 专题页 LangGraph 条目


条目 5:LLM Inference at Scale — DesignGurus Substack(batching / caching / routing / cost)

  • URLhttps://designgurus.substack.com/p/llm-inference-at-scale-batching-caching
  • 来源:DesignGurus Substack(Arslan Ahmad,系统设计垂直 newsletter)
  • 发布时间:2026-06-24
  • 可信度:高 — 系统设计深度,工程向

保留理由(工程视角): - Continuous Batching:动态 batch 填充机制,是 2026 年生产推理的标准做法 - KV Cache 管理:PagedAttention vs RadixAttention 的工程差异有具体说明 - LLM Routing:成本优化维度,不同模型路由策略的取舍 - 以工程师视角解释 batching / caching / routing / cost 四个维度,非泛泛介绍

保留标准对照: - ✅ 系统设计层次清晰,适合纳入知识库 inference-systems 基础概念 - ✅ 四个维度的工程取舍有参考价值 - ⚠️ Paid article,全文需订阅后才能读取

分类标签inference-engineering batching KV-cache routing cost-optimization 建议行动:→ 建议纳入知识库 inference-systems 概念层;可作为系统设计面试/文档素材


条目 6:KV Cache 原理深度解析 — Tokenless Substack

  • URLhttps://tokenless.substack.com/p/how-kv-cache-speeds-up-llms-for-faster
  • 来源:Tokenless Substack(Legare Kerrison,Red Hat AI team,vLLM 项目贡献者)
  • 发布时间:2026
  • 可信度:高 — vLLM 项目贡献者写的技术解释,非营销内容

保留理由(工程视角): - Prefill vs Decode 阶段区分:compute-bound vs memory-bound 的本质是理解推理优化的基础 - PagedAttention 原理:vLLM 核心机制的工程级解释,非科普级别 - vLLM 命令行启动示例--speculative-model n-gram 是实测可用的 speculative decoding 配置 - vLLM 项目成员写的 KV cache 原理,对抗"vector DB 就是 RAG"的常见误解有价值

具体配置片段:

python -m vllm.entrypoints.openai.api_server \
  --model meta-llama/Llama-3.1-70B-Instruct \
  --enable-prefix-caching \
  --speculative-model n-gram

保留标准对照: - ✅ vLLM 核心维护者写的技术内容,含具体命令配置 - ✅ prefill/decode 阶段分析是推理优化的核心概念 - ⚠️ 篇幅偏概念,需配合 benchmark 数据使用

分类标签inference-engineering KV-cache vLLM PagedAttention 建议行动:→ 建议加入知识库 inference-systems 基础概念;可作为团队内部培训素材


🟡 降级保留条目


条目 7:The Road to Unlimited Agent Memory — No RAG, Just Markdown(Medium)

  • URLhttps://xhinker.medium.com/the-road-to-unlimited-agent-memory-no-rag-no-papers-just-markdown-704e9258aa0a
  • 来源:Andrew Zhu(ex-Microsoft,Personal AI 开源贡献者)
  • 发布时间:2026-07-14(1天前)
  • 可信度:中 — 个人博客,有工程实践但缺数据验证

降级理由: - 核心观点有价值:不用 RAG,用 markdown 文件管理 agent 记忆,降低系统复杂度 - 实际可行:无需向量数据库,在 laptop 上可跑 - 降级原因:无性能数据、无对比 benchmark、无生产环境验证 - 适合作为探索性想法,不适合直接纳入知识库主条目

保留标准对照: - ✅ 创意思路有价值,适合知识库"记忆系统设计"备选方案 - ⚠️ 无数据支撑,无生产验证

分类标签Agent-Memory RAG-alternative markdown 建议行动:→ 降级保留;可用于知识库 Agent-Memory 备选方案讨论区


条目 8:VRAM Is Destiny — Local LLM Hardware Selection(Substack)

  • URLhttps://bhavishyapandit9.substack.com/p/vram-is-destiny-the-law-of-local
  • 来源:Bhavishya Pandit Substack
  • 发布时间:2026
  • 可信度:中 — 硬件选型指南,有具体数字但引用混杂

降级理由: - 有具体的 VRAM 需求对照表(7B / 13B / 30B / 70B 各量化等级) - Q4 量化 = 3.5-4x 加速 + ~50% 内存节省 + 1-3% 质量损失的具体数字 - 降级:大量引用堆砌,缺少一手来源验证;更像是综合文章而非原创研究 - Gemma 4 31B 在 RTX 4090(24GB)的具体性能数据有参考价值

保留标准对照: - ✅ VRAM 需求对照表有工程实用价值 - ⚠️ 引用质量参差不齐,需交叉验证

分类标签local-LLM hardware quantization VRAM 建议行动:→ 降级保留;可纳入知识库 local-LLM-deployment 硬件选型参考


⚫ 丢弃条目


丢弃 1:Multiple YouTube 视频(Top 10 GitHub repos、Complete AI Engineer Bootcamp)

  • 丢弃理由:YouTube 视频内容无法被可靠地提取为结构化工程知识;主要是目录式列表,无原创技术内容
  • 丢弃标准:非文本来源,难以纳入知识库条目

丢弃 2:DEV Community "vLLM vs SGLang vs LMDeploy" 对比

  • 丢弃理由:大量引用第三方 benchmark,缺乏一手验证数据;主要 benchmark 数据来自 Spheron March 2026(已有更好来源 Turion.ai 和 iotdigitaltwinplm)
  • 已有更好替代:条目 2(Turion.ai)和条目 3(iotdigitaltwinplm)已覆盖同类内容且质量更高

丢弃 3:GoGloby / EffectiveSoft 公司页面

  • 丢弃理由:公司营销内容,不是工程技术内容

丢弃 4:YouTube 视频 "Architecting Production-Grade Multi-Agent AI in 2026"

  • 丢弃理由:YouTube 视频;内容有价值(graph-based state machine / LLM-as-judge reflection / MCP),但无法提取为可引用文本
  • 替代:内容摘要已在上次晨间简报中出现;无需重复收录

二、本次新增高价值主题标签

标签 本次新增条目数 代表条目
vLLM-v0.25.0 1 条目 1
Speculative-Decoding 1 条目 1
GLM-5 DeepSeek-V3.2 MiniMax-M3 1 条目 1
SGLang-vs-vLLM 1 条目 2
Prefill-Decode-Disaggregation 1 条目 2
H200-benchmark 1 条目 3
LangGraph-2.0 1 条目 4
Checkpoint-Resume 1 条目 4
KV-cache-theory 1 条目 6

三、建议写入路径

主要草稿路径: - /shared/research-kb/inbox/jay/2026-07-15-1850-engineering-filter-vllm025-sglang-production-jul2026.md(本文件)

建议后续精读/核验清单: 1. vLLM v0.25.0 Release Notes 原文(GitHub) 2. Turion.ai vLLM vs SGLang 完整 benchmark 数据 3. LangGraph 2.0 官方 Release 确认新增 API 4. DesignGurus Substack 全文(付费内容,决定是否值得订阅)

建议知识库专题页更新: - inference-systems:新增 v0.25.0 变更追踪、SGLang 选型决策树 - Agent-Memory:新增 markdown-based memory 备选方案 - Agent-Framework:新增 LangGraph 2.0 条目


Jay · 2026-07-15 18:50 CST · 工程筛选第三次