vLLM 8月工程进展精要

Jay · 2026-08-17 上午 检索范围:vLLM 官方博客 · Hugging Face 官方博客 · Substack (AI Engineer / Louis Bouchard / Eugene Yan) 标签:vLLM · LLM推理 · Inference Engineering · Speculative Decoding · KV Cache · Hugging Face · Agentic


一、vLLM 8月工程进展(高价值)

来源:https://vllm-project.github.io | 均发表于 2026 年 7–8 月

1. vLLM 25K TPS/GPU on Qwen3.5(2026-07-29)

  • 来源:https://vllm-project.github.io/blog/vllm-25k-tps-gpu-qwen3.5/
  • 可信度:高——vLLM 官方博客工程报告
  • 核心数据
  • GB200 NVL72 分解式服务架构下达成 25K total TPS/GPU
  • 关键技术栈:Blackwell GDN kernels + HMA cache transfer + async scheduling fixes + srt-slurm recipes
  • Qwen3.5-397B-A17B(NVFP4 精度)
  • 工程意义:突破 GPU 利用率瓶颈的工程路线图,具体到 kernel 级别优化和调度修复,可作为生产级部署调优参考
  • 建议分类LLM推理 vLLM 性能优化 Qwen
  • 后续行动:归档——补充进 Qwen3.5 部署知识节点

2. Efficient Decode Context Parallelism(2026-08-07)

  • 来源:https://vllm-project.github.io/blog/decode-context-parallelism/
  • 可信度:高——vLLM 官方
  • 核心观点
  • 长上下文 Workloads 下 Decode 阶段的并行化新方案
  • 将 context 分解并行处理以降低长序列下的 decode 延迟
  • 针对 128K+ token 超长上下文场景专门优化
  • 工程意义:当前 RAG 和 Agent 多轮对话普遍遇到超长上下文 decode 瓶颈,这是官方工程方案
  • 建议分类LLM推理 vLLM 长上下文 并行化
  • 后续行动:精读——提取具体并行策略参数

3. Parallel All the Way Down: Speculative Decoding(2026-07-27)

  • 来源:https://vllm-project.github.io/blog/speculative-decoding/
  • 可信度:高——vLLM 官方
  • 核心观点
  • Beyond Single-Token Generation:从单 token 生成跃迁到多 token 并行
  • Speculative Decoding 的完整工程实现路径
  • 不是简单的多步生成,而是验证+回退的完整机制
  • 工程意义:对延迟敏感场景(实时对话、流式输出)有显著收益,理解其机制有助于正确选型
  • 建议分类LLM推理 Speculative Decoding 延迟优化 流式
  • 后续行动:归档——提取与 EAGLE3 等其他 Speculative Decoding 方案的对比

4. The State of FP8 KV-Cache and Attention Quantization(2026-04/持续更新)

  • 来源:https://vllm-project.github.io/blog/state-of-fp8-kv-cache/
  • 可信度:高——vLLM 官方
  • 核心数据(来自实测验证报告):
  • Hopper 和 Blackwell 双平台验证
  • Flash Attention 3 fixes 已并入
  • 内存节省 + Decode 加速的具体数字
  • 支持 skip certain layers 的选择性量化
  • 与现有条目的关系:CSDN 条目 KV-Cache 压缩技术综述 提到"主流框架未提供标准化压缩 API",本篇说明 FP8 KV-Cache 是 vLLM 原生支持的具体量化路径
  • 建议分类KVCache FP8 量化 vLLM
  • 后续行动:归档——与 CSDN 压缩综述交叉引用

5. EAGLE3 Speculative Decoding on AMD Instinct(2026-07-10)

  • 来源:https://vllm-project.github.io/blog/eagle3-amd-quark/
  • 可信度:高——vLLM 官方 + AMD 联合工程验证
  • 核心观点
  • EAGLE3 + AMD Quark + vLLM 完整推理链路
  • 训练和 serving 一体化方案
  • 建议分类LLM推理 AMD Speculative Decoding EAGLE3
  • 后续行动:归档——AMD GPU 部署参考

6. vLLM Semantic Router v0.1 Iris(2026-01/持续活跃)

  • 来源:https://vllm-project.github.io/blog/semantic-router-v0.1-iris/
  • 可信度:高——vLLM 官方
  • 核心观点
  • Beyond a Single Model:MoE (Mixture-of-Models) 系统构建
  • 语义路由在 vLLM 内的原生实现
  • 第一个正式 Release 版本
  • 建议分类LLM推理 MoE Semantic Router vLLM
  • 后续行动:归档——多模型路由选型参考

7. Disaggregated Serving for Hybrid SSM Models(2026-04/相关持续更新)

  • 来源:https://vllm-project.github.io/blog/disaggregated-serving-ssm/
  • 可信度:高——vLLM 官方
  • 核心观点
  • NIXL prefill/decode 分解扩展到 Hybrid SSM-Attention 模型
  • Dual descriptor views + physical-logical block bridging + Mamba conv-state transfer
  • 针对 SSM(State Space Model)架构的特殊支持
  • 建议分类LLM推理 Disaggregation SSM Mamba
  • 后续行动:归档

二、vLLM 优化技术完整图谱(来自 Jarvis Labs 综合分析)

来源:https://jarvislabs.ai/blog/vllm-optimization-techniques(Jaydev Tonde,2026-02) 状态:持续高价值

五大核心技术

技术 作用 适用场景
Prefix Caching 复用共享前缀计算结果 RAG、多轮对话、系统提示复用
FP8 KV-Cache 压缩缓存体积,提升内存效率 长上下文、高并发
CPU Offloading GPU+CPU 协同,分担显存压力 超大模型、显存受限环境
Disaggregated P/D Prefill/Decode 分离部署 超大模型、多租户、高并发
Zero Reload Sleep Mode 模型保热省显存 间歇性负载、边缘部署
  • 重要工程判断:CAAE(Context-Aware Adaptive Eviction)是一种动态 KV-cache 驱逐策略,通过成本模型预测"swap"和"recompute"的相对速度来优化内存压力下的缓存管理
  • 建议分类LLM推理 vLLM优化 KVCache 内存管理
  • 后续行动:归档——构建 vLLM 生产部署优化检查清单

三、Hugging Face 8月更新精选(2026-08)

来源:https://huggingface.co/blog | 2026-08-10 ~ 2026-08-13

1. LFM2.5-VL-3B(2026-08-12)

  • 来源:https://huggingface.co/blog/lfm2.5-vl-3b
  • 可信度:高——HF 官方
  • 核心观点:面向边缘的高效视觉语言模型,3B 参数级别
  • 建议分类多模态 边缘部署 VLM
  • 后续行动:归档——3B 级 VLM 边缘部署选型参考

2. ACE with Fewer Tokens(2026-08-11)

  • 来源:https://huggingface.co/blog/ace-fewer-tokens
  • 可信度:高——HF 官方
  • 核心观点:用更少 token 完成 ACE(某种对齐/效率任务),节省推理成本
  • 建议分类推理优化 效率 Token优化
  • 后续行动:归档

3. NVIDIA Magpie TTS(2026-08-11)

  • 来源:https://huggingface.co/blog/nvidia-magpie-tts
  • 可信度:高——HF + NVIDIA 联合
  • 核心观点:低延迟多语言语音 Agent 开源方案,支持本地部署
  • 建议分类TTS 语音Agent 本地部署
  • 后续行动:归档——语音 Agent 选型参考

4. Knowledge Distillation at Scale(2026-08-10)

  • 来源:https://huggingface.co/blog/knowledge-distillation
  • 可信度:高——HF 官方
  • 核心观点:大规模知识蒸馏的工程化方案,适合在算力受限环境下高效部署大模型能力
  • 建议分类模型压缩 蒸馏 部署优化
  • 后续行动:归档——模型压缩选型参考

5. Meta Muse Glimmer(2026-08-10)

  • 来源:https://huggingface.co/blog/muse-glimmer
  • 可信度:高——Meta + HF
  • 核心观点:本地部署、多模态、Agent 方向的 Glimmer 模型,开源
  • 建议分类多模态 Agent 开源模型 Meta
  • 后续行动:归档——本地多模态 Agent 模型选型

6. LongHorizon-Harness Agent(2026-08-03,Alibaba)

  • 来源:https://huggingface.co/papers/trending(Paper #128)
  • 可信度:中高——学术研究 + 阿里巴巴团队
  • 核心观点
  • 通过 manage-execute-audit 循环,显式追踪已验证任务状态(超出 context 范围)
  • 提升长时 Agent 任务完成率
  • 建议分类Agent 长时推理 记忆架构 阿里巴巴
  • 后续行动:精读——论文原文,提取 manage-execute-audit 机制的具体实现

四、HF State of Open Models: Summer 2026(高置信度概览)

来源:https://huggingface.co/blog/state-of-open-models-summer-2026 作者:Adina Yakefu 等,HF 官方

关键数据

  • 模型仓库:2.43M → 2.96M(+22%,Jan–Aug 2026)
  • 数据集仓库:711K → 1M(+40%,Jan–Aug 2026)
  • Spaces:1.00M → 1.44M(+44%,Jan–Aug 2026)
  • 极度头部效应:~85.6% 的模型终身下载量 <200次,1.5% 的仓库占 99.2% 的总下载量

六大观察

  1. 前沿推进速度极快:中国实验室(Qwen、DeepSeek)跳过小模型→顶级模型的渐进路线,直接发布顶级模型
  2. Attention ≠ Adoption:开源模型能力提升不等于市场采用,生态和工具链仍是关键
  3. Open weights 转移价值积累方向:权重开放改变了价值分布格局
  4. Qwen 成为社区 base model:Qwen 系列在 HF 生态中的基础地位确立
  5. Small models 仍是实用层:小模型在成本/延迟敏感场景持续占据主导
  6. Agents are the new user on HF:Agent(机器用户)首次成为 HF Hub 第一大用户类型——这是标志性转变,意味着基础设施需要面向机器友好的 API 和工具
  • 建议分类AI生态 开源模型 HuggingFace 趋势
  • 后续行动:精读原文——补充进 AI 开源生态知识节点

五、Substack 精选线索(与 vLLM/Agent 相关)

1. Louis Bouchard:AI Engineering Roadmap 2026

  • 来源:louisbouchard.substack.com/p/im-sharing-my-full-ai-engineering
  • 作者:Louis-François Bouchard
  • 可信度:高——YouTube AI 教育者,知名 AI 教学社区
  • 核心观点
  • repo 包括 beginner Python → foundational AI → RAG/agents/evals/MCP/deployment/safety/coding-agent 的完整分难度路线
  • 核心区分:build agentic RAG system vs. build RAG system
  • 强调 production deployment 和 evals,而非 just demos
  • 建议分类AI工程 学习路径 Agent RAG
  • 后续行动:归档——补充进 AI Engineer 学习路径知识节点

2. Eugene Yan:Building Production RAG

  • 来源:eugeneyan.com(Amazon 应用科学家)
  • 可信度:高——RAG 系统生产实践
  • 核心观点
  • 大多数 RAG 问题本质是检索问题,不是生成问题
  • 答案质量 = 上下文质量和相关性
  • End-to-end RAG 评估是建立可靠系统的关键
  • 建议分类RAG 生产工程 Evals
  • 后续行动:归档——RAG 评估知识节点

3. System Design Newsletter:10 AI Engineering 概念

  • 来源:newsletter.systemdesign.one
  • 作者:Neo Kim
  • 可信度:中高——AI 系统设计垂直 newsletter
  • 核心观点(精选):
  • How RAG Works / LLM Concepts / AI Agent Design / RL / Context Engineering vs Prompt Engineering / AI Coding Workflow / MCP Protocol
  • 建议分类AI工程 系统设计 学习资源
  • 后续行动:订阅跟踪——系统设计知识节点补充

六、PostgreSQL / 数据库工程更新(2026)

PostgreSQL 18(2026 发布)

  • 持续改进查询优化和并行度
  • JSONB 操作支持增强
  • 分区管理改善
  • 安全功能增强
  • 建议分类数据库 PostgreSQL 工程更新

TimescaleDB 2.26.0(2026-03-24)

  • 16 核服务器批量插入:1-2M 数据点/秒
  • 查询性能在 100 亿行级别保持一致(chunk pruning + compression)
  • 建议分类时序数据库 TimescaleDB 性能优化

TiDB v2026(PingCAP)

  • 定位:Built for agentic workloads that grow unpredictably
  • HTAP + ACID + native vector search
  • MySQL 兼容
  • 建议分类分布式数据库 HTAP 向量检索 TiDB

七、分类标签总览

标签 条目数 代表
LLM推理 7 25K TPS、Decode CP、Speculative Decoding、FP8 KV-Cache
vLLM 7 所有条目
KVCache 2 FP8量化、CAAE
HuggingFace 5 8月新模型、State of Open Models
Agent 3 Muse Glimmer、LongHorizon-Harness、AI Engineer路线
多模态 2 LFM2.5-VL-3B、Muse Glimmer
推理优化 4 Prefix Caching、FP8、Speculative Decoding、ACE
数据库 3 PostgreSQL 18、TimescaleDB、TiDB
AI生态 2 HF State of Open Models、Qwen base model

八、建议写入路径与行动

本次实际写入路径/shared/research-kb/inbox/jay/2026-08-17T1000-jay-vllm-august-2026-engineering-deep-dive.md

是否需要精读: - 高优先级精读: 1. vLLM 25K TPS/GPU 原文——提取 GB200 NVL72 具体配置参数 2. vLLM Decode Context Parallelism 原文——提取并行策略参数和 benchmark 数据 3. Speculative Decoding 完整机制——补充进推理优化知识节点 4. LongHorizon-Harness 论文——提取 manage-execute-audit 机制 5. HF State of Open Models Summer 2026 原文——提取六大观察详细数据

  • 次优先级归档
  • FP8 KV-Cache 量化数据(与 CSDN 压缩综述交叉引用)
  • EAGLE3 AMD Speculative Decoding(AMD GPU 部署参考)
  • Knowledge Distillation at Scale(模型压缩选型)
  • Muse Glimmer / LFM2.5-VL-3B / Magpie TTS(多模态边缘部署)
  • Louis Bouchard AI Engineering Roadmap(学习路径知识节点)
  • Eugene Yan RAG 生产实践(Evals 知识节点)

建议主题页更新: - vLLM 工程进展 知识节点:补充 8 月最新工程数据(25K TPS、Decode CP、Speculative Decoding) - LLM 推理优化 知识节点:更新五大优化技术图谱(CAAE 等新机制) - AI 开源生态 知识节点:补充 HF State of Open Models Summer 2026 数据(Agent 首次成为 HF Hub 第一大用户) - 向量数据库 / HTAP 知识节点:TiDB agentic workloads 定位更新

与其他条目的去重: - 已有 2026-08-17-csdn-substack-inference-rag-agent-highvalue.md 覆盖 vLLM vs SGLang 横评、LangGraph+MCP、OWASP Top 10 Agents - 本次条目聚焦:vLLM 8月官方工程博客、Hugging Face 8月新模型和生态报告、Substack AI Engineering 路线图