vLLM 8月工程进展精要
Jay · 2026-08-17 上午 检索范围:vLLM 官方博客 · Hugging Face 官方博客 · Substack (AI Engineer / Louis Bouchard / Eugene Yan) 标签:vLLM · LLM推理 · Inference Engineering · Speculative Decoding · KV Cache · Hugging Face · Agentic
一、vLLM 8月工程进展(高价值)
来源:https://vllm-project.github.io | 均发表于 2026 年 7–8 月
1. vLLM 25K TPS/GPU on Qwen3.5(2026-07-29)
- 来源:https://vllm-project.github.io/blog/vllm-25k-tps-gpu-qwen3.5/
- 可信度:高——vLLM 官方博客工程报告
- 核心数据:
- GB200 NVL72 分解式服务架构下达成 25K total TPS/GPU
- 关键技术栈:Blackwell GDN kernels + HMA cache transfer + async scheduling fixes + srt-slurm recipes
- Qwen3.5-397B-A17B(NVFP4 精度)
- 工程意义:突破 GPU 利用率瓶颈的工程路线图,具体到 kernel 级别优化和调度修复,可作为生产级部署调优参考
- 建议分类:
LLM推理vLLM性能优化Qwen - 后续行动:归档——补充进 Qwen3.5 部署知识节点
2. Efficient Decode Context Parallelism(2026-08-07)
- 来源:https://vllm-project.github.io/blog/decode-context-parallelism/
- 可信度:高——vLLM 官方
- 核心观点:
- 长上下文 Workloads 下 Decode 阶段的并行化新方案
- 将 context 分解并行处理以降低长序列下的 decode 延迟
- 针对 128K+ token 超长上下文场景专门优化
- 工程意义:当前 RAG 和 Agent 多轮对话普遍遇到超长上下文 decode 瓶颈,这是官方工程方案
- 建议分类:
LLM推理vLLM长上下文并行化 - 后续行动:精读——提取具体并行策略参数
3. Parallel All the Way Down: Speculative Decoding(2026-07-27)
- 来源:https://vllm-project.github.io/blog/speculative-decoding/
- 可信度:高——vLLM 官方
- 核心观点:
- Beyond Single-Token Generation:从单 token 生成跃迁到多 token 并行
- Speculative Decoding 的完整工程实现路径
- 不是简单的多步生成,而是验证+回退的完整机制
- 工程意义:对延迟敏感场景(实时对话、流式输出)有显著收益,理解其机制有助于正确选型
- 建议分类:
LLM推理Speculative Decoding延迟优化流式 - 后续行动:归档——提取与 EAGLE3 等其他 Speculative Decoding 方案的对比
4. The State of FP8 KV-Cache and Attention Quantization(2026-04/持续更新)
- 来源:https://vllm-project.github.io/blog/state-of-fp8-kv-cache/
- 可信度:高——vLLM 官方
- 核心数据(来自实测验证报告):
- Hopper 和 Blackwell 双平台验证
- Flash Attention 3 fixes 已并入
- 内存节省 + Decode 加速的具体数字
- 支持 skip certain layers 的选择性量化
- 与现有条目的关系:CSDN 条目
KV-Cache 压缩技术综述提到"主流框架未提供标准化压缩 API",本篇说明 FP8 KV-Cache 是 vLLM 原生支持的具体量化路径 - 建议分类:
KVCacheFP8量化vLLM - 后续行动:归档——与 CSDN 压缩综述交叉引用
5. EAGLE3 Speculative Decoding on AMD Instinct(2026-07-10)
- 来源:https://vllm-project.github.io/blog/eagle3-amd-quark/
- 可信度:高——vLLM 官方 + AMD 联合工程验证
- 核心观点:
- EAGLE3 + AMD Quark + vLLM 完整推理链路
- 训练和 serving 一体化方案
- 建议分类:
LLM推理AMDSpeculative DecodingEAGLE3 - 后续行动:归档——AMD GPU 部署参考
6. vLLM Semantic Router v0.1 Iris(2026-01/持续活跃)
- 来源:https://vllm-project.github.io/blog/semantic-router-v0.1-iris/
- 可信度:高——vLLM 官方
- 核心观点:
- Beyond a Single Model:MoE (Mixture-of-Models) 系统构建
- 语义路由在 vLLM 内的原生实现
- 第一个正式 Release 版本
- 建议分类:
LLM推理MoESemantic RoutervLLM - 后续行动:归档——多模型路由选型参考
7. Disaggregated Serving for Hybrid SSM Models(2026-04/相关持续更新)
- 来源:https://vllm-project.github.io/blog/disaggregated-serving-ssm/
- 可信度:高——vLLM 官方
- 核心观点:
- NIXL prefill/decode 分解扩展到 Hybrid SSM-Attention 模型
- Dual descriptor views + physical-logical block bridging + Mamba conv-state transfer
- 针对 SSM(State Space Model)架构的特殊支持
- 建议分类:
LLM推理DisaggregationSSMMamba - 后续行动:归档
二、vLLM 优化技术完整图谱(来自 Jarvis Labs 综合分析)
来源:https://jarvislabs.ai/blog/vllm-optimization-techniques(Jaydev Tonde,2026-02) 状态:持续高价值
五大核心技术
| 技术 | 作用 | 适用场景 |
|---|---|---|
| Prefix Caching | 复用共享前缀计算结果 | RAG、多轮对话、系统提示复用 |
| FP8 KV-Cache | 压缩缓存体积,提升内存效率 | 长上下文、高并发 |
| CPU Offloading | GPU+CPU 协同,分担显存压力 | 超大模型、显存受限环境 |
| Disaggregated P/D | Prefill/Decode 分离部署 | 超大模型、多租户、高并发 |
| Zero Reload Sleep Mode | 模型保热省显存 | 间歇性负载、边缘部署 |
- 重要工程判断:CAAE(Context-Aware Adaptive Eviction)是一种动态 KV-cache 驱逐策略,通过成本模型预测"swap"和"recompute"的相对速度来优化内存压力下的缓存管理
- 建议分类:
LLM推理vLLM优化KVCache内存管理 - 后续行动:归档——构建 vLLM 生产部署优化检查清单
三、Hugging Face 8月更新精选(2026-08)
来源:https://huggingface.co/blog | 2026-08-10 ~ 2026-08-13
1. LFM2.5-VL-3B(2026-08-12)
- 来源:https://huggingface.co/blog/lfm2.5-vl-3b
- 可信度:高——HF 官方
- 核心观点:面向边缘的高效视觉语言模型,3B 参数级别
- 建议分类:
多模态边缘部署VLM - 后续行动:归档——3B 级 VLM 边缘部署选型参考
2. ACE with Fewer Tokens(2026-08-11)
- 来源:https://huggingface.co/blog/ace-fewer-tokens
- 可信度:高——HF 官方
- 核心观点:用更少 token 完成 ACE(某种对齐/效率任务),节省推理成本
- 建议分类:
推理优化效率Token优化 - 后续行动:归档
3. NVIDIA Magpie TTS(2026-08-11)
- 来源:https://huggingface.co/blog/nvidia-magpie-tts
- 可信度:高——HF + NVIDIA 联合
- 核心观点:低延迟多语言语音 Agent 开源方案,支持本地部署
- 建议分类:
TTS语音Agent本地部署 - 后续行动:归档——语音 Agent 选型参考
4. Knowledge Distillation at Scale(2026-08-10)
- 来源:https://huggingface.co/blog/knowledge-distillation
- 可信度:高——HF 官方
- 核心观点:大规模知识蒸馏的工程化方案,适合在算力受限环境下高效部署大模型能力
- 建议分类:
模型压缩蒸馏部署优化 - 后续行动:归档——模型压缩选型参考
5. Meta Muse Glimmer(2026-08-10)
- 来源:https://huggingface.co/blog/muse-glimmer
- 可信度:高——Meta + HF
- 核心观点:本地部署、多模态、Agent 方向的 Glimmer 模型,开源
- 建议分类:
多模态Agent开源模型Meta - 后续行动:归档——本地多模态 Agent 模型选型
6. LongHorizon-Harness Agent(2026-08-03,Alibaba)
- 来源:https://huggingface.co/papers/trending(Paper #128)
- 可信度:中高——学术研究 + 阿里巴巴团队
- 核心观点:
- 通过 manage-execute-audit 循环,显式追踪已验证任务状态(超出 context 范围)
- 提升长时 Agent 任务完成率
- 建议分类:
Agent长时推理记忆架构阿里巴巴 - 后续行动:精读——论文原文,提取 manage-execute-audit 机制的具体实现
四、HF State of Open Models: Summer 2026(高置信度概览)
来源:https://huggingface.co/blog/state-of-open-models-summer-2026 作者:Adina Yakefu 等,HF 官方
关键数据
- 模型仓库:2.43M → 2.96M(+22%,Jan–Aug 2026)
- 数据集仓库:711K → 1M(+40%,Jan–Aug 2026)
- Spaces:1.00M → 1.44M(+44%,Jan–Aug 2026)
- 极度头部效应:~85.6% 的模型终身下载量 <200次,1.5% 的仓库占 99.2% 的总下载量
六大观察
- 前沿推进速度极快:中国实验室(Qwen、DeepSeek)跳过小模型→顶级模型的渐进路线,直接发布顶级模型
- Attention ≠ Adoption:开源模型能力提升不等于市场采用,生态和工具链仍是关键
- Open weights 转移价值积累方向:权重开放改变了价值分布格局
- Qwen 成为社区 base model:Qwen 系列在 HF 生态中的基础地位确立
- Small models 仍是实用层:小模型在成本/延迟敏感场景持续占据主导
- Agents are the new user on HF:Agent(机器用户)首次成为 HF Hub 第一大用户类型——这是标志性转变,意味着基础设施需要面向机器友好的 API 和工具
- 建议分类:
AI生态开源模型HuggingFace趋势 - 后续行动:精读原文——补充进 AI 开源生态知识节点
五、Substack 精选线索(与 vLLM/Agent 相关)
1. Louis Bouchard:AI Engineering Roadmap 2026
- 来源:louisbouchard.substack.com/p/im-sharing-my-full-ai-engineering
- 作者:Louis-François Bouchard
- 可信度:高——YouTube AI 教育者,知名 AI 教学社区
- 核心观点:
- repo 包括 beginner Python → foundational AI → RAG/agents/evals/MCP/deployment/safety/coding-agent 的完整分难度路线
- 核心区分:build agentic RAG system vs. build RAG system
- 强调 production deployment 和 evals,而非 just demos
- 建议分类:
AI工程学习路径AgentRAG - 后续行动:归档——补充进 AI Engineer 学习路径知识节点
2. Eugene Yan:Building Production RAG
- 来源:eugeneyan.com(Amazon 应用科学家)
- 可信度:高——RAG 系统生产实践
- 核心观点:
- 大多数 RAG 问题本质是检索问题,不是生成问题
- 答案质量 = 上下文质量和相关性
- End-to-end RAG 评估是建立可靠系统的关键
- 建议分类:
RAG生产工程Evals - 后续行动:归档——RAG 评估知识节点
3. System Design Newsletter:10 AI Engineering 概念
- 来源:newsletter.systemdesign.one
- 作者:Neo Kim
- 可信度:中高——AI 系统设计垂直 newsletter
- 核心观点(精选):
- How RAG Works / LLM Concepts / AI Agent Design / RL / Context Engineering vs Prompt Engineering / AI Coding Workflow / MCP Protocol
- 建议分类:
AI工程系统设计学习资源 - 后续行动:订阅跟踪——系统设计知识节点补充
六、PostgreSQL / 数据库工程更新(2026)
PostgreSQL 18(2026 发布)
- 持续改进查询优化和并行度
- JSONB 操作支持增强
- 分区管理改善
- 安全功能增强
- 建议分类:
数据库PostgreSQL工程更新
TimescaleDB 2.26.0(2026-03-24)
- 16 核服务器批量插入:1-2M 数据点/秒
- 查询性能在 100 亿行级别保持一致(chunk pruning + compression)
- 建议分类:
时序数据库TimescaleDB性能优化
TiDB v2026(PingCAP)
- 定位:Built for agentic workloads that grow unpredictably
- HTAP + ACID + native vector search
- MySQL 兼容
- 建议分类:
分布式数据库HTAP向量检索TiDB
七、分类标签总览
| 标签 | 条目数 | 代表 |
|---|---|---|
| LLM推理 | 7 | 25K TPS、Decode CP、Speculative Decoding、FP8 KV-Cache |
| vLLM | 7 | 所有条目 |
| KVCache | 2 | FP8量化、CAAE |
| HuggingFace | 5 | 8月新模型、State of Open Models |
| Agent | 3 | Muse Glimmer、LongHorizon-Harness、AI Engineer路线 |
| 多模态 | 2 | LFM2.5-VL-3B、Muse Glimmer |
| 推理优化 | 4 | Prefix Caching、FP8、Speculative Decoding、ACE |
| 数据库 | 3 | PostgreSQL 18、TimescaleDB、TiDB |
| AI生态 | 2 | HF State of Open Models、Qwen base model |
八、建议写入路径与行动
本次实际写入路径:/shared/research-kb/inbox/jay/2026-08-17T1000-jay-vllm-august-2026-engineering-deep-dive.md
是否需要精读: - 高优先级精读: 1. vLLM 25K TPS/GPU 原文——提取 GB200 NVL72 具体配置参数 2. vLLM Decode Context Parallelism 原文——提取并行策略参数和 benchmark 数据 3. Speculative Decoding 完整机制——补充进推理优化知识节点 4. LongHorizon-Harness 论文——提取 manage-execute-audit 机制 5. HF State of Open Models Summer 2026 原文——提取六大观察详细数据
- 次优先级归档:
- FP8 KV-Cache 量化数据(与 CSDN 压缩综述交叉引用)
- EAGLE3 AMD Speculative Decoding(AMD GPU 部署参考)
- Knowledge Distillation at Scale(模型压缩选型)
- Muse Glimmer / LFM2.5-VL-3B / Magpie TTS(多模态边缘部署)
- Louis Bouchard AI Engineering Roadmap(学习路径知识节点)
- Eugene Yan RAG 生产实践(Evals 知识节点)
建议主题页更新:
- vLLM 工程进展 知识节点:补充 8 月最新工程数据(25K TPS、Decode CP、Speculative Decoding)
- LLM 推理优化 知识节点:更新五大优化技术图谱(CAAE 等新机制)
- AI 开源生态 知识节点:补充 HF State of Open Models Summer 2026 数据(Agent 首次成为 HF Hub 第一大用户)
- 向量数据库 / HTAP 知识节点:TiDB agentic workloads 定位更新
与其他条目的去重:
- 已有 2026-08-17-csdn-substack-inference-rag-agent-highvalue.md 覆盖 vLLM vs SGLang 横评、LangGraph+MCP、OWASP Top 10 Agents
- 本次条目聚焦:vLLM 8月官方工程博客、Hugging Face 8月新模型和生态报告、Substack AI Engineering 路线图