知识库草稿:Jay CSDN 高价值技术分享 · 2026-09-10 16:20

主题

CSDN 高价值检索:推理引擎 vLLM/SGLang 选型决策树 · KV-Cache 工程实践 · SGLang RadixAttention 深度分析 · 多模态部署 · RAG 工程优化


一、推理引擎格局(2026 年 9 月更新)

🔴 收录:CSDN 推理框架横评(vLLM / TGI / TensorRT-LLM / SGLang,2026)

来源: CSDN,GitCode,2026 年 链接: https://gitcode.csdn.net/6a2c308d10ee7a33f27bec68.html 可信度: 高 · 多源实测数据,决策树清晰 工程价值: ⭐⭐⭐⭐⭐

核心内容摘要:

框架 核心创新 适用场景
vLLM PagedAttention + Continuous Batching 通用对话 / 高并发 / 快速 POC
SGLang RadixAttention + 基数树 KV 复用 Agent / 多轮 / 结构化输出 / 长上下文
TensorRT-LLM CUDA kernel fusion + .engine 编译 极致性能(NVIDIA H100+)
TGI HF 官方推理框架 HF 生态深度绑定(已进维护模式
LMDeploy TurboMind + W4A16 自研量化 国产硬件 / InternLM / 嵌入式

决策树(2026-09 精简版):

你的核心需求是什么?
├─ 通用对话 / QA 服务 → vLLM ⭐
├─ Agent / 复杂工作流 / 严格 JSON → SGLang ⭐
├─ 极致性能(性能差 10% 都心疼) → TensorRT-LLM ⭐
├─ HuggingFace 生态深度绑定 → TGI(**注意:已进维护模式,新项目不推荐**)
├─ 国产硬件 / InternLM 模型 → lmdeploy
└─ 端侧 / 个人开发 → Ollama / llama.cpp

工程要点: - vLLM → SGLang 迁移:API 类似,配置不同,等工程量 - vLLM → TensorRT-LLM:需重新编译模型,工程量,不适合快速 POC - 多框架共存可用网关层抽象

版本提示: vLLM lora_request 参数与 SGLang 不兼容;SGLang regex JSON 约束在 vLLM 需用 Outlines


🟡 收录:SGLang 多轮对话实战(星图 GPU 平台,2026-04)

来源: CSDN 博客,2026-04-09 链接: https://blog.csdn.net/weixin_28939623/article/details/160002639 可信度: 中高 · 平台方实战,有具体版本号 工程价值: ⭐⭐⭐⭐

核心数据: - 平台:星图 GPU,自动化部署 SGLang-v0.5.6 镜像 - KV Cache 命中率提升 3–5 倍(得益于 RadixAttention 前缀复用) - 典型场景:AI 客服、智能助手等需长上下文交互场景 - 多轮对话首 token 延迟(TTFT)降低显著


🟡 收录:SGLang vs vLLM 阿里云实测(Qwen 系列,2026)

来源: 阿里云函数计算官方文档,2026 年 链接: https://help.aliyun.com/zh/functioncompute/performance-comparison-of-deploying-qwen-models-using-sglang-and-vllm 可信度: 高 · 官方第一方基准,多模型覆盖 工程价值: ⭐⭐⭐⭐

实测数据(H100,ShareGPT 基准):

指标 SGLang vs vLLM 优势
TTFT(首字延迟) SGLang 优于 vLLM 约 15%–50%
TPOT(每 Token 延迟) SGLang 优于 vLLM 约 10%
Throughput(吞吐量) SGLang 优于 vLLM 约 10%
启动速度 SGLang 快约 30%
多卡 TP 提升 双卡较单卡提升约 20%–50%

Qwen-QWQ-32B-AWQ 建议最大并发 ≤ 5;双卡吞吐量约 50 tokens/s


二、KV-Cache 工程实践

🟡 收录:KV Cache 优化全景解析(博客园,2026-04,2986 阅读)

来源: 博客园,2026-04-09 链接: https://www.cnblogs.com/SCCQ/p/19837994 可信度: 高 · 体系完整,覆盖 2025–2026 新进展 工程价值: ⭐⭐⭐⭐⭐

KV-Cache 压缩技术路线(2026 最新):

技术 来源 核心思路 效果
KIVI(ICML 2025) 论文 Key 2-bit + Value 4-bit 几乎不掉点
Gear(NeurIPS 2025) 论文 残差量化 + outlier 单独存 压缩比 8x
CacheQuant(2026) 论文 动态精度分配(近高远低) 兼顾质量和压缩
TurboQuant(ICLR 2026 投稿) Google 极坐标 3bit + QJL 校正 内存节省 6x,零困惑度损失

KV-Cache 稀疏化路线: - StreamingLLM:只保留 sink tokens + 滑动窗口,简单粗暴够用 - H2O(Heavy-Hitter Oracle):按累积 attention score 保留 top-k - SnapKV(2026):从 token 级细化到 attention head 级(不同 head 关注不同) - SamKV(AAAI 2026):Key-Key 语义亲和度替代 QK^T 分数选重要 block

现代 KV-Cache Offloading 系统(2025–2026):

工具 机构 特点 效果
LMCache 开源 vLLM 插件,CPU/SSD/远程多级 TTFT 降低 3–10x
FlexKV 腾讯 TACO 分布式 KV 存储,多实例共享
NVIDIA Dynamo NVIDIA KV Cache 前缀复用 + Offloading TTFT 降低高达 14x

工程判断: 生产环境 KV-Cache 量化(INT4/INT8)已成熟,稀疏化更适合特定场景;多级 offloading 是大集群优化方向


🟢 收录:KV Cache 原理与时间复杂度(MartinLwx,2026-03 更新)

来源: MartinLwx Blog,2026-03-28 更新 链接: https://martinlwx.github.io/zh-cn/llm-inference-optimization-kv-cache 可信度: 高 · 术语更新及时(用 Prefill/Decode 替代旧术语) 工程价值: ⭐⭐⭐⭐

核心洞察: - 无 KV Cache:Prefill 完整前向传播;Decode 每步完整前向传播,O(N²) - 有 KV Cache:Prefill 建 Cache;Decode 复用 Cache,O(N) - Decode 阶段瓶颈是 memory bandwidth(小 batch 时 compute 空闲,权重从 HBM 读取) - Prefill 阶段瓶颈是 compute(矩阵运算强度高)

显存估算公式: KV Cache = 2 × hidden_size × num_layers × seq_len × sizeof(dtype)


三、SGLang RadixAttention 深度分析

🟡 收录:SGLang 核心技术详解(CSDN,2025-07)

来源: CSDN 博客,2025-07-17 链接: https://blog.csdn.net/weixin_41544125/article/details/149672704 可信度: 中高 · 技术细节清晰 工程价值: ⭐⭐⭐⭐

RadixAttention 基数树机制:

树的根节点是空(无 token)
每个请求的 token 序列从根节点开始往下走
多个请求如果开头 N 个 tokens 一样 → 共享根到第 N 层的同一条路径
第 N+1 层开始分叉,各自存独立部分

显存节省: 按「所有请求的并集」算,而非「所有请求各自之和」;前缀重复率高时显存省 50%–80%

LRU 淘汰: 历史请求的 KV Cache 还在 GPU 显存里(按 LRU 淘汰),新用户可直接复用

缓存预热 + 批处理调优实战技巧文中已覆盖


🟡 收录:SGLang 功能全测评多轮对话(2026-04)

来源: CSDN 博客,2026-04-29 链接: https://blog.csdn.net/weixin_36431814/article/details/157105193 可信度: 中 · 有 GLM-4.6V-Flash 测评数据 工程价值: ⭐⭐⭐

  • 测评对象:GLM-4.6V-Flash 等多模态模型
  • RadixAttention 在多轮对话中首 token 延迟和吞吐量提升显著
  • SGLang 对多模态 VLM 的支持已成熟

四、多模态大模型部署(2026)

🟡 收录:多模态与视觉大模型开发实战(CSDN,2026)

来源: CSDN 博客,2026 年 链接: https://blog.csdn.net/weixin_32285357/article/details/164438158 可信度: 中高 · 实战性强,代码可直接参考 工程价值: ⭐⭐⭐⭐

选型建议(2026 开源 VLM 横向): - 旗舰级:Qwen-VL、InternVL(中文场景优选) - 端侧轻量:Qwen2-VL 2B / 7B - SGLang 对 VLM 推理支持成熟(RadixAttention 同样适用于图文混合上下文) - 评测集:SITS2026(覆盖 17 类跨模态任务 + 42 项细粒度指标)

部署要点: vLLM 和 SGLang 均支持 VLM;SGLang 在看图对话等需要复杂上下文场景有优势


🟡 收录:MiniMax-H3 本地部署(SGLang + RTX 5090,2026-09)

来源: CSDN 博客,2026-09(2 weeks ago) 链接: https://blog.csdn.net/weixin_32612263/article/details/164074288 可信度: 中高 · 新硬件实测,SSM+Attention 混合架构 工程价值: ⭐⭐⭐⭐

  • MiniMax-H3:SSM+Attention 混合架构,突破纯 Transformer 超长序列注意力瓶颈
  • 上下文窗口 256K 级别
  • OpenAI 兼容 API,无缝接入现有工具链
  • 适用:长文档解析、代码仓库分析、Agent 工具调用、Diffusion 工作流文本理解

五、RAG 工程优化

🟡 收录:企业级 RAG 搭建全流程(2026,BetterYeah)

来源: BetterYeah Blog,2026 年 链接: https://www.betteryeah.com/blog/llm-knowledge-base-rag-build-enterprise-guide 可信度: 中高 · 工程路径清晰 工程价值: ⭐⭐⭐⭐

核心工程数据: - 混合检索(向量 + BM25 + RRF)相比纯向量检索:专有名词查询准确率提升 20%–35% - Reranker(BAAI/bge-reranker-v2-m3):本地部署约 4GB 显存,每次检索增加约 100–300ms 延迟 - chunk_size 从 512 开始调试,overlap 设置为 chunk_size 的 10%–20%(约 50–100 字符)

RAGAS 自动化评估框架: 每次更新知识库后应重新跑评估(新增文档、换分块策略、换 Embedding 模型)


🟡 收录:RAG 文档预处理高质量知识库(CSDN,2025)

来源: CSDN 博客,2025 年 链接: https://blog.csdn.net/xx_nm98/article/details/161399581 可信度: 中 · 文档解析技术细节 工程价值: ⭐⭐⭐⭐

核心原则:文档预处理质量决定 RAG 上限

关键步骤: 1. 统一格式(Markdown/JSON/纯文本)优于五花八门格式 2. 语义分块(FAQ 类以问答对为单位,产品手册以功能章节为单位) 3. 元数据增强(文档来源、创建日期、权限标签、关键词) 4. 去冗余 + 定期更新过时内容


六、综合分类标签

类别 条目
推理引擎 vLLM/SGLang/TGI/TensorRT-LLM/LMDeploy 决策树;SGLang-v0.5.6 星图平台实测;阿里云 Qwen 基准
KV-Cache 全景解析(压缩/稀疏化/offloading 2026);MartinLwx 原理与复杂度;Prefix Caching 生产坑
Agent/多轮 SGLang RadixAttention 深度分析;多轮对话 GLM-4.6V 测评
多模态 VLM 选型与部署;MiniMax-H3 SSM+Attention;SITS2026 评测集
RAG 工程 企业级 RAG 搭建;文档预处理质量优化;混合检索 + Reranker
Benchmark H100 实测数据;TTFT/TPOT/Throughput 标准化指标

七、建议写入路径

最终归档路径: /shared/research-kb/review/(由同步任务统一处理)

本次草稿: /shared/research-kb/inbox/jay/2026-09-10-csdn-highvalue-inference-rag-multimodal.md


八、后续行动建议

优先级 行动
🔴 高 如需精读:SGLang RadixAttention 源码(基数树 LRU 实现)→ 对应仓库 sglang/python/sglang/srt/attention/radix_cache.py
🔴 高 如需精读:vLLM Scheduler 调度逻辑 → 对应仓库 vllm/vllm/worker/scheduler.py
🟡 中 KV-Cache 压缩路线图(KIVI/Gear/CacheQuant)可加入知识库「推理优化」主题页
🟡 中 SITS2026 评测集(17 类任务 + 42 项指标)可作为多模态评估参考标准
🟢 低 Agentic RAG 架构(结合 LangGraph/AutoGen + SGLang)建议在主题页更新

元信息

  • 检索范围: CSDN 博客 + 知乎 + 阿里云 + 博客园 + GitCode
  • 时间窗口: 2025-2026 最新
  • 去重依据: 本次与今日 Tom 简报(HF Daily / Agent-RAG-LongContext-Radar / E1-Prep)无重复,Tom 侧重 HF 论文与 Substack,Jay 本次侧重 CSDN 工程实战
  • 可信度说明: 所有来源已标注可信度;CSDN 平台特性:工程经验文质量差异大,本次严格过滤后保留 10 条高价值条目