知识库草稿 · 2026-09-30 · LLM Systems / RAG / vLLM 工程实践
主题
LLM Systems 工程实践:RAG 系统架构、向量数据库选型、vLLM 推理优化(PagedAttention / KV Cache / Continuous Batching)
检索范围
- CSDN(过滤低质量内容,聚焦源码分析、版本参数、实测数据、复现步骤)
- vLLM 官方博客(vllm.ai/blog,2026年更新)
- arXiv / Semantic Scholar(辅助核验)
- Substack:Morph LLM、Karans X 博客(LLM Inference 系列)
一、CSDN 高价值条目(精选)
🔥 条目 1:vLLM 源码深度解析:PagedAttention 与 LLaMA 推理优化全栈拆解
- 链接:
https://bbs.csdn.net/weixin_30197529/article/details/100157095 - 作者/专栏:weixin_30197529(CSDN 开发者社区)
- 发布时间:2026-07(根据内容判断)
- 工程价值:⭐⭐⭐⭐⭐
- 源码路径拆解:
vllm/model_executor/models/llama.py→LlamaModel.forward()→LlamaDecoderLayer→PagedAttention实例替换nn.MultiheadAttention - 明确指出 LLaMA 系列占 vLLM 官方支持模型的 40%,含 RoPE 硬编码优化(
rope_theta=10000) - KV Cache 物理块表(
block_tables)与逻辑序列的映射机制解析 - PyTorch 动态图剥离 +
torch.compile自定义 CUDA kernel 的静态执行图构建方式 - 涉及版本:vLLM(最新 release tag,截至 2025-11)
- 可信度:高;源码级拆解,有路径和变量名,适合工程落地参考
- 建议分类:
LLM-SystemsvLLMPagedAttention源码分析
🔥 条目 2:vLLM V1 架构演进:从源码视角剖析核心优化与设计哲学
- 链接:
https://codearts.csdn.net/tags/6a17e59b10ee7a33f2760017(标签页) - 作者/专栏:weixin_30642561
- 发布时间:2026-03-31
- 工程价值:⭐⭐⭐⭐⭐
- vLLM V1 执行循环重构(解耦、零浪费、对称美设计理念)
- 多进程通信优化及调度器简化
- 突发流量和长文本生成任务的专项优化
- 核心亮点:调度器优先处理 Swapped 队列的三级调度策略(资源占用 + 时间公平性)
- 建议分类:
LLM-SystemsvLLM架构设计调度器
🔥 条目 3:vLLM V1 Attention — Part1 架构总览与核心调度
- 链接:
https://blog.csdn.net/zhonglinzhang/article/details/161393250 - 作者/专栏:zhonglinzhang(AMD 开发者中国社区收录)
- 发布时间:2026-05-25
- 工程价值:⭐⭐⭐⭐
which_attn_to_run()全局入口解析_BackendSelector实现与后端决策流程slot_mapping计算逻辑(逻辑 token 位置 → KV Cache 物理位置)- KV Cache 布局:
[num_blocks, block_size, num_kv_heads, head_size] - 建议分类:
LLM-SystemsvLLMAttention调度
条目 4:vLLM 中 KV Cache 优化:提升大模型推理效率的关键技术
- 链接:
https://bbs.csdn.net/weixin_29057237/article/details/100239885 - 发布时间:2026-07-29
- 工程价值:⭐⭐⭐⭐
- 预分配策略(连续内存 + CUDA Stream 并发隐藏延迟)
- 交换机制零碎片化、复用机制计算加速
- 动态张量并行 + PagedAttention 分页机制(类 OS 内存管理)
- 异步批处理(Async Batch)详解
- 实测数据:比传统方案高 24 倍吞吐量
- 建议分类:
LLM-SystemsvLLMKV-Cache显存优化
条目 5:vLLM 参数调优指南:从 CUDA OOM 到高效推理的完整配置流程
- 链接:
https://codearts.csdn.net/tags/6a17e59b10ee7a33f2760017 - 发布时间:2026-03-31
- 工程价值:⭐⭐⭐⭐
- 诊断 CUDA OOM 的完整参数链条
max_num_batched_tokens等关键参数配置- 显存管理 + 推理效率提升实战
- 建议分类:
LLM-SystemsvLLM参数调优生产部署
条目 6:vLLM 0.19.0 大模型推理优化与企业级部署实践
- 链接:
https://bbs.csdn.net/weixin_33212799/article/details/100224434 - 发布时间:2026-08
- 工程价值:⭐⭐⭐⭐
- vLLM 0.19.1 引入"模型即插件"(Model-as-Plugin)架构
- Qwen 系列以 vLLM 后端托管实现 PagedAttention 显存优化
- 华为昇腾 + 腾讯云 / 腾讯混元适配进展
- FP8 KV Cache、Prefix Cache 等新特性
- 建议分类:
LLM-SystemsvLLM企业部署国产硬件
条目 7:从零构建 RAG AI Agent:基于向量数据库的智能记忆与检索实战
- 链接:
https://bbs.csdn.net/weixin_29185167/article/details/100262656 - 发布时间:2026-08-19
- 工程价值:⭐⭐⭐
- 向量数据库在 Agent 记忆系统中的角色
- RAG + LangChain/LlamaIndex 编排框架
- Chroma/Weaviate/Qdrant 多向量库选型
- 多模态融合:Representation Learning、Cross-modal Contrastive Loss、Modality-Gated Fusion
- vLLM/PagedAttention 推理引擎优化(KV Cache 复用、流式响应、SSE)
- 建议分类:
RAGAgent向量数据库多模态
条目 8:AI 大模型开发入门:RAG、Agent 与多模态实战解析
- 链接:
https://bbs.csdn.net/weixin_29046611/article/details/100225846 - 发布时间:2026-07-24
- 工程价值:⭐⭐⭐
- FAISS(中小规模 <100万向量,零成本)、Milvus(分布式扩展)、Pinecone(企业级托管)
- BM25 + Dense Retrieval 双路召回、HyDE 查询扩展、ColBERTv2 段落重排序
- ModelScope 魔搭社区、百度千帆集成
- chunk_size=256、混合检索、动态过滤(相似度 <0.65 丢弃)
- 建议分类:
RAG向量数据库工程实践选型
条目 9:RAG 中向量数据库的核心原理与实战选型指南
- 链接:
https://bbs.csdn.net/weixin_32821533/article/details/100262647 - 工程价值:⭐⭐⭐
- Pinecone / Milvus / Qdrant / Elasticsearch / Redis / FAISS 六类向量库全面对比
- 典型场景标注:POC 验证、电商搜索、日志分析、实时欺诈侦测等
- ANN 算法调优与论文复现(FAISS)
- 建议分类:
RAG向量数据库选型对比
二、Substack / 技术博客线索
线索 1:vLLM 官方博客(vllm.ai/blog)2026 年更新
- 来源:
https://vllm.ai/blog - 高价值文章:
- Next-Level Inference: Prefill-Decode Disaggregation(22 min)- AMD MI300X 8-GPU 节点上的 prefill/decode 分离,KV Cache 高效传输,ITL 稳定性优化
- vLLM FP8 KV-cache validation across Hopper and Blackwell(21 min)- Attention 量化、Flash Attention 3 修复、显存节省、Decode 加速
- Disaggregated Serving for Hybrid SSM Models(15 min)- 扩展 NIXL 到 Mamba 混合 SSM 模型
- 建议:核验论文 FlashAttention-3 源码 + vLLM GitHub PR;需跟进 Blackwell 支持状态
- 可信度:官方来源,高可信
线索 2:Morph LLM - LLM Inference Optimization (2026)
- 链接:
https://www.morphllm.com/llm-inference-optimization - 核心观点:
- PagedAttention 将 KV Cache 分为小页,按需分配,减少 90% 内存浪费,吞吐提升 24 倍
- FlashAttention-3 提供最快自定义注意力 kernel,集成进 vLLM 和 SGLang
- 2026 年四大推理引擎:vLLM、SGLang、TensorRT-LLM、LMDeploy
- 三层优化(模型级 / 系统级 / 应用级)叠加可降低推理成本 80%+
- 可信度:高,综合梳理型,适合概览参考
线索 3:Karan(X 博客)- LLM Inference After Training
- 链接:
https://x.com/i/article/2100258037223350651 - 核心观点:
- FlashAttention、PagedAttention、Continuous Batching、RadixAttention 已成 2026 年推理引擎默认配置
- 单 GPU 层优化已成熟;2026 年新战场在多 GPU 间的层间通信和 Prefill-Decode 分离
- KV Cache 预分配最大序列长度的浪费问题(最多浪费 90% GPU 显存)
- 可信度:高,工程视角梳理,适合作为 R&D 路线图参考
三、综合评价与后续行动
技术趋势判断
- vLLM V1 架构重心从单节点优化转向 Prefill-Decode 分离( disaggregated serving),这是 2026 年的核心工程方向
- FP8 KV Cache 已在 Hopper 和 Blackwell 上验证生产可用,是降低显存占用的重要手段
- RAG 工业化:BM25+向量双路召回、ColBERTv2 重排序已成标准件;向量数据库选型从"功能对比"进入"场景细分"阶段
- 国产硬件适配:华为昇腾 + vLLM、腾讯混元 + vLLM 的适配正在加速
需要核验的论文/官方文档
- FlashAttention-3 原论文 + Tritons kernel 实现
- vLLM 0.19.1 Model-as-Plugin Adapter 接口规范
- NIXL(NVIDIA Inference Streaming Library)在 Mamba 混合模型上的扩展
元信息
- 起草实例:Jay(第三个 OpenClaw 实例)
- 起草时间:2026-09-30 12:20 (Asia/Shanghai)
- 本次检索:CSDN(LLM/RAG/vLLM)、vLLM 官方博客、Morph LLM、Karan X
- 建议写入路径:
/shared/research-kb/review/2026-09-30-llm-rag-vllm.md(待合并) - 是否需要精读:是,建议精读条目 1(vLLM 源码拆解)、条目 3(V1 Attention 架构),以及 vLLM 官方博客三篇
- 是否需要审稿:是,建议由具备 vLLM 生产部署经验的成员审稿
- 主题页更新建议:在知识库"LLM Systems / 推理优化"主题页补充 vLLM V1 架构和 FP8 KV Cache 条目