知识库草稿:Jay CSDN 高价值技术分享 · 2026-09-10 16:20
主题
CSDN 高价值检索:推理引擎 vLLM/SGLang 选型决策树 · KV-Cache 工程实践 · SGLang RadixAttention 深度分析 · 多模态部署 · RAG 工程优化
一、推理引擎格局(2026 年 9 月更新)
🔴 收录:CSDN 推理框架横评(vLLM / TGI / TensorRT-LLM / SGLang,2026)
来源: CSDN,GitCode,2026 年 链接: https://gitcode.csdn.net/6a2c308d10ee7a33f27bec68.html 可信度: 高 · 多源实测数据,决策树清晰 工程价值: ⭐⭐⭐⭐⭐
核心内容摘要:
| 框架 | 核心创新 | 适用场景 |
|---|---|---|
| vLLM | PagedAttention + Continuous Batching | 通用对话 / 高并发 / 快速 POC |
| SGLang | RadixAttention + 基数树 KV 复用 | Agent / 多轮 / 结构化输出 / 长上下文 |
| TensorRT-LLM | CUDA kernel fusion + .engine 编译 | 极致性能(NVIDIA H100+) |
| TGI | HF 官方推理框架 | HF 生态深度绑定(已进维护模式) |
| LMDeploy | TurboMind + W4A16 自研量化 | 国产硬件 / InternLM / 嵌入式 |
决策树(2026-09 精简版):
你的核心需求是什么?
├─ 通用对话 / QA 服务 → vLLM ⭐
├─ Agent / 复杂工作流 / 严格 JSON → SGLang ⭐
├─ 极致性能(性能差 10% 都心疼) → TensorRT-LLM ⭐
├─ HuggingFace 生态深度绑定 → TGI(**注意:已进维护模式,新项目不推荐**)
├─ 国产硬件 / InternLM 模型 → lmdeploy
└─ 端侧 / 个人开发 → Ollama / llama.cpp
工程要点: - vLLM → SGLang 迁移:API 类似,配置不同,中等工程量 - vLLM → TensorRT-LLM:需重新编译模型,大工程量,不适合快速 POC - 多框架共存可用网关层抽象
版本提示: vLLM lora_request 参数与 SGLang 不兼容;SGLang regex JSON 约束在 vLLM 需用 Outlines
🟡 收录:SGLang 多轮对话实战(星图 GPU 平台,2026-04)
来源: CSDN 博客,2026-04-09 链接: https://blog.csdn.net/weixin_28939623/article/details/160002639 可信度: 中高 · 平台方实战,有具体版本号 工程价值: ⭐⭐⭐⭐
核心数据: - 平台:星图 GPU,自动化部署 SGLang-v0.5.6 镜像 - KV Cache 命中率提升 3–5 倍(得益于 RadixAttention 前缀复用) - 典型场景:AI 客服、智能助手等需长上下文交互场景 - 多轮对话首 token 延迟(TTFT)降低显著
🟡 收录:SGLang vs vLLM 阿里云实测(Qwen 系列,2026)
来源: 阿里云函数计算官方文档,2026 年 链接: https://help.aliyun.com/zh/functioncompute/performance-comparison-of-deploying-qwen-models-using-sglang-and-vllm 可信度: 高 · 官方第一方基准,多模型覆盖 工程价值: ⭐⭐⭐⭐
实测数据(H100,ShareGPT 基准):
| 指标 | SGLang vs vLLM 优势 |
|---|---|
| TTFT(首字延迟) | SGLang 优于 vLLM 约 15%–50% |
| TPOT(每 Token 延迟) | SGLang 优于 vLLM 约 10% |
| Throughput(吞吐量) | SGLang 优于 vLLM 约 10% |
| 启动速度 | SGLang 快约 30% |
| 多卡 TP 提升 | 双卡较单卡提升约 20%–50% |
Qwen-QWQ-32B-AWQ 建议最大并发 ≤ 5;双卡吞吐量约 50 tokens/s
二、KV-Cache 工程实践
🟡 收录:KV Cache 优化全景解析(博客园,2026-04,2986 阅读)
来源: 博客园,2026-04-09 链接: https://www.cnblogs.com/SCCQ/p/19837994 可信度: 高 · 体系完整,覆盖 2025–2026 新进展 工程价值: ⭐⭐⭐⭐⭐
KV-Cache 压缩技术路线(2026 最新):
| 技术 | 来源 | 核心思路 | 效果 |
|---|---|---|---|
| KIVI(ICML 2025) | 论文 | Key 2-bit + Value 4-bit | 几乎不掉点 |
| Gear(NeurIPS 2025) | 论文 | 残差量化 + outlier 单独存 | 压缩比 8x |
| CacheQuant(2026) | 论文 | 动态精度分配(近高远低) | 兼顾质量和压缩 |
| TurboQuant(ICLR 2026 投稿) | 极坐标 3bit + QJL 校正 | 内存节省 6x,零困惑度损失 |
KV-Cache 稀疏化路线: - StreamingLLM:只保留 sink tokens + 滑动窗口,简单粗暴够用 - H2O(Heavy-Hitter Oracle):按累积 attention score 保留 top-k - SnapKV(2026):从 token 级细化到 attention head 级(不同 head 关注不同) - SamKV(AAAI 2026):Key-Key 语义亲和度替代 QK^T 分数选重要 block
现代 KV-Cache Offloading 系统(2025–2026):
| 工具 | 机构 | 特点 | 效果 |
|---|---|---|---|
| LMCache | 开源 | vLLM 插件,CPU/SSD/远程多级 | TTFT 降低 3–10x |
| FlexKV | 腾讯 TACO | 分布式 KV 存储,多实例共享 | — |
| NVIDIA Dynamo | NVIDIA | KV Cache 前缀复用 + Offloading | TTFT 降低高达 14x |
工程判断: 生产环境 KV-Cache 量化(INT4/INT8)已成熟,稀疏化更适合特定场景;多级 offloading 是大集群优化方向
🟢 收录:KV Cache 原理与时间复杂度(MartinLwx,2026-03 更新)
来源: MartinLwx Blog,2026-03-28 更新 链接: https://martinlwx.github.io/zh-cn/llm-inference-optimization-kv-cache 可信度: 高 · 术语更新及时(用 Prefill/Decode 替代旧术语) 工程价值: ⭐⭐⭐⭐
核心洞察: - 无 KV Cache:Prefill 完整前向传播;Decode 每步完整前向传播,O(N²) - 有 KV Cache:Prefill 建 Cache;Decode 复用 Cache,O(N) - Decode 阶段瓶颈是 memory bandwidth(小 batch 时 compute 空闲,权重从 HBM 读取) - Prefill 阶段瓶颈是 compute(矩阵运算强度高)
显存估算公式: KV Cache = 2 × hidden_size × num_layers × seq_len × sizeof(dtype)
三、SGLang RadixAttention 深度分析
🟡 收录:SGLang 核心技术详解(CSDN,2025-07)
来源: CSDN 博客,2025-07-17 链接: https://blog.csdn.net/weixin_41544125/article/details/149672704 可信度: 中高 · 技术细节清晰 工程价值: ⭐⭐⭐⭐
RadixAttention 基数树机制:
树的根节点是空(无 token)
每个请求的 token 序列从根节点开始往下走
多个请求如果开头 N 个 tokens 一样 → 共享根到第 N 层的同一条路径
第 N+1 层开始分叉,各自存独立部分
显存节省: 按「所有请求的并集」算,而非「所有请求各自之和」;前缀重复率高时显存省 50%–80%
LRU 淘汰: 历史请求的 KV Cache 还在 GPU 显存里(按 LRU 淘汰),新用户可直接复用
缓存预热 + 批处理调优实战技巧文中已覆盖
🟡 收录:SGLang 功能全测评多轮对话(2026-04)
来源: CSDN 博客,2026-04-29 链接: https://blog.csdn.net/weixin_36431814/article/details/157105193 可信度: 中 · 有 GLM-4.6V-Flash 测评数据 工程价值: ⭐⭐⭐
- 测评对象:GLM-4.6V-Flash 等多模态模型
- RadixAttention 在多轮对话中首 token 延迟和吞吐量提升显著
- SGLang 对多模态 VLM 的支持已成熟
四、多模态大模型部署(2026)
🟡 收录:多模态与视觉大模型开发实战(CSDN,2026)
来源: CSDN 博客,2026 年 链接: https://blog.csdn.net/weixin_32285357/article/details/164438158 可信度: 中高 · 实战性强,代码可直接参考 工程价值: ⭐⭐⭐⭐
选型建议(2026 开源 VLM 横向): - 旗舰级:Qwen-VL、InternVL(中文场景优选) - 端侧轻量:Qwen2-VL 2B / 7B - SGLang 对 VLM 推理支持成熟(RadixAttention 同样适用于图文混合上下文) - 评测集:SITS2026(覆盖 17 类跨模态任务 + 42 项细粒度指标)
部署要点: vLLM 和 SGLang 均支持 VLM;SGLang 在看图对话等需要复杂上下文场景有优势
🟡 收录:MiniMax-H3 本地部署(SGLang + RTX 5090,2026-09)
来源: CSDN 博客,2026-09(2 weeks ago) 链接: https://blog.csdn.net/weixin_32612263/article/details/164074288 可信度: 中高 · 新硬件实测,SSM+Attention 混合架构 工程价值: ⭐⭐⭐⭐
- MiniMax-H3:SSM+Attention 混合架构,突破纯 Transformer 超长序列注意力瓶颈
- 上下文窗口 256K 级别
- OpenAI 兼容 API,无缝接入现有工具链
- 适用:长文档解析、代码仓库分析、Agent 工具调用、Diffusion 工作流文本理解
五、RAG 工程优化
🟡 收录:企业级 RAG 搭建全流程(2026,BetterYeah)
来源: BetterYeah Blog,2026 年 链接: https://www.betteryeah.com/blog/llm-knowledge-base-rag-build-enterprise-guide 可信度: 中高 · 工程路径清晰 工程价值: ⭐⭐⭐⭐
核心工程数据: - 混合检索(向量 + BM25 + RRF)相比纯向量检索:专有名词查询准确率提升 20%–35% - Reranker(BAAI/bge-reranker-v2-m3):本地部署约 4GB 显存,每次检索增加约 100–300ms 延迟 - chunk_size 从 512 开始调试,overlap 设置为 chunk_size 的 10%–20%(约 50–100 字符)
RAGAS 自动化评估框架: 每次更新知识库后应重新跑评估(新增文档、换分块策略、换 Embedding 模型)
🟡 收录:RAG 文档预处理高质量知识库(CSDN,2025)
来源: CSDN 博客,2025 年 链接: https://blog.csdn.net/xx_nm98/article/details/161399581 可信度: 中 · 文档解析技术细节 工程价值: ⭐⭐⭐⭐
核心原则:文档预处理质量决定 RAG 上限
关键步骤: 1. 统一格式(Markdown/JSON/纯文本)优于五花八门格式 2. 语义分块(FAQ 类以问答对为单位,产品手册以功能章节为单位) 3. 元数据增强(文档来源、创建日期、权限标签、关键词) 4. 去冗余 + 定期更新过时内容
六、综合分类标签
| 类别 | 条目 |
|---|---|
| 推理引擎 | vLLM/SGLang/TGI/TensorRT-LLM/LMDeploy 决策树;SGLang-v0.5.6 星图平台实测;阿里云 Qwen 基准 |
| KV-Cache | 全景解析(压缩/稀疏化/offloading 2026);MartinLwx 原理与复杂度;Prefix Caching 生产坑 |
| Agent/多轮 | SGLang RadixAttention 深度分析;多轮对话 GLM-4.6V 测评 |
| 多模态 | VLM 选型与部署;MiniMax-H3 SSM+Attention;SITS2026 评测集 |
| RAG 工程 | 企业级 RAG 搭建;文档预处理质量优化;混合检索 + Reranker |
| Benchmark | H100 实测数据;TTFT/TPOT/Throughput 标准化指标 |
七、建议写入路径
最终归档路径: /shared/research-kb/review/(由同步任务统一处理)
本次草稿: /shared/research-kb/inbox/jay/2026-09-10-csdn-highvalue-inference-rag-multimodal.md
八、后续行动建议
| 优先级 | 行动 |
|---|---|
| 🔴 高 | 如需精读:SGLang RadixAttention 源码(基数树 LRU 实现)→ 对应仓库 sglang/python/sglang/srt/attention/radix_cache.py |
| 🔴 高 | 如需精读:vLLM Scheduler 调度逻辑 → 对应仓库 vllm/vllm/worker/scheduler.py |
| 🟡 中 | KV-Cache 压缩路线图(KIVI/Gear/CacheQuant)可加入知识库「推理优化」主题页 |
| 🟡 中 | SITS2026 评测集(17 类任务 + 42 项指标)可作为多模态评估参考标准 |
| 🟢 低 | Agentic RAG 架构(结合 LangGraph/AutoGen + SGLang)建议在主题页更新 |
元信息
- 检索范围: CSDN 博客 + 知乎 + 阿里云 + 博客园 + GitCode
- 时间窗口: 2025-2026 最新
- 去重依据: 本次与今日 Tom 简报(HF Daily / Agent-RAG-LongContext-Radar / E1-Prep)无重复,Tom 侧重 HF 论文与 Substack,Jay 本次侧重 CSDN 工程实战
- 可信度说明: 所有来源已标注可信度;CSDN 平台特性:工程经验文质量差异大,本次严格过滤后保留 10 条高价值条目