知识库草稿 · Jay · 2026-08-23
主题:LLM 推理框架(SGLang/vLLM)对比 & RAG 系统安全 & 长上下文推理
条目 1:SGLang vs vLLM 推理框架选型(2026年高质量对比)
来源:LLM推理框架选型实战:SGLang与vLLM的架构哲学与场景适配 · CSDN · 2026-02-07
可信度:⭐⭐⭐⭐⭐(含 benchmark 数据,框架版本对应关系清晰)
核心摘要
SGLang 核心技术:RadixAttention
- 采用基数树(Radix Tree)管理 KV 缓存,跨请求自动前缀匹配与复用
- 多轮对话场景缓存命中率提升 3-5 倍
- 支持约束解码(FSM + 正则)强制 JSON/XML 格式化输出
vLLM 核心技术:PagedAttention
- 借鉴 OS 虚拟内存分页机制,将 KV 缓存分割为固定大小块,动态分配
- Continuous Batching 实时将新请求动态加入处理队列,GPU 持续工作
- 显存利用率超 90%
性能对比(Llama3-70B-FP8 · 2×H100)
| 场景 | SGLang | vLLM |
|---|---|---|
| 顺序请求吞吐 | 38 tokens/s | 35 tokens/s |
| 并发请求吞吐(稳定值) | 30-31 tokens/s | 16 tokens/s(下降) |
| 首字延迟(TTFT)Llama3.1-8B | 340ms | 123ms |
| 高并发(batch=64) | 460 tokens/s | 落后 |
选型建议
- 选 SGLang:Agent 多轮交互、工具调用、强制结构化输出(JSON)、高并发下吞吐量稳定性优先
- 选 vLLM:首字延迟敏感场景(TTFT)、MoE 模型通用高并发、成熟生态优先
关键洞察
- vLLM 和 SGLang 已互相借鉴(vLLM 计划引入 RadixAttention),但短期差异化竞争持续
- 企业级可组合:vLLM 底层引擎 + SGLang 上层编排,兼顾性能与灵活性
工程价值:✅ 高(benchmark 数据完整,场景建议明确,适合生产选型决策) 复现价值:✅ 高(含完整推理服务启动命令示例)
条目 2:SGLang/vLLM 性能评测工具 bench_serving 实战命令
来源:sglang/VLLM性能评测: bench_serving工具 · CSDN · 2025
可信度:⭐⭐⭐⭐⭐(可直接复制运行的评测脚本命令,含完整参数说明)
核心内容
文章提供了 SGLang 内置 bench_serving 工具的完整使用方式,含多场景命令示例:
# SGLang backend 评测
python3 -m sglang.bench_serving \
--backend sglang \
--dataset-name random \
--dataset-path /root/ShareGPT_V3_unfiltered_cleaned_split.json \
--num-prompts 1024 \
--random-input 1024 \
--random-output 128 \
--request-rate 128 \
--max-concurrency 128 \
--warmup-requests 16 \
--base-url http://localhost:30000
# vLLM backend 评测
python3 -m sglang.bench_serving \
--backend vllm \
--model Qwen/Qwen3-32B-FP8 \
--dataset-name random \
--dataset-path /root/ShareGPT_V3_unfiltered_cleaned_split.json \
--num-prompts 1024 \
--random-input 2048 \
--random-output 512 \
--max-concurrency 512 \
--pd-separated \
--base-url http://localhost:9000
# vLLM 官方 benchmark_serving
python3 benchmarks/benchmark_serving.py \
--backend vllm \
--dataset-name random \
--base-url http://localhost:8000 \
--model /DATA/disk1/models/Qwen/Qwen3-32B-AWQ \
--num-prompts 512 \
--random-input-len 1024 \
--random-output-len 128 \
--request-rate 128 \
--max-concurrency 128
工程价值:✅✅ 极高(评测命令即拷即用,是框架选型的实操必备工具) 建议:纳入 LLM 部署标准 SOP 文档
条目 3:RAG 系统隐私泄露风险(ACL 2024 论文解读)
来源:【RAG安全】【ACL】The Good and The Bad: Exploring Privacy Issues in RAG · CSDN · 2024
可信度:⭐⭐⭐⭐⭐(顶会论文解读,ACL 2024,GitHub 验证代码:phycholosogy/RAG-privacy)
核心发现
RQ1:检索数据可被提取 - 攻击方式:复合结构化提示攻击(information 引导检索 + command 指令输出上下文) - 实验结果:Llama2-7b-Chat 和 GPT-3.5-turbo 以 ~50% 概率 输出与原始记录完全相同或高度相似内容 - 结论:医疗 RAG 等高敏感场景极度脆弱
RQ2:检索数据影响 LLM 记忆行为 - 有检索数据时,LLM 输出训练数据倾向显著降低 - 效果优于噪声注入或系统提示等传统方法 - 从训练数据安全视角:RAG 架构可能比单独 LLM 更安全
防御方向:输入净化(规则检测 + LLM 审核)、结构化输入、输出结构化、工具接口白名单
后续核验建议:阅读原论文 + 验证 GitHub: phycholosogy/RAG-privacy 代码
工程价值:✅ 高(RAG 部署安全必读,影响隐私合规设计)
条目 4:DuoAttention — 长上下文 LLM 高效推理(MIT/清华/NVIDIA)
来源:DuoAttention: 高效长上下文LLM推理 · CSDN · 2024-11-22
可信度:⭐⭐⭐⭐⭐(MIT 团队 + 韩松,清华、上海交大、NVIDIA 联合,arXiv 论文)
核心创新
问题:传统 KV Cache 压缩(如 H2O、SnapKV)按 Token 重要性剪枝,导致语义碎片化——关键信息分布在多个中等重要性 Token 上被整体丢弃
DuoAttention 方案: - 将注意力头分为检索头(Retrieval Heads)和流式头(Streaming Heads) - 检索头:需要全部 KV Cache(回答需要精确回忆) - 流式头:只需最近 K 个 Token(流式生成) - 基于 Logit 距离识别两类头,无需训练即可判断
效果:困惑度不变情况下,KV Cache 显存减少 2 倍以上
后续核验:直接读 arXiv 原文 + 复现实验
条目 5:MediaPipe LLM Inference — 浏览器端跑 Gemma(完整复现指南)
来源:MediaPipe LLM Inference:在WEB浏览器中"裸跑"大语言模型 · CSDN
可信度:⭐⭐⭐⭐(Google MediaPipe 官方示例,含源码 + 完整模型下载/转换步骤)
核心价值
无需后端、无需显卡、零 API 成本,纯前端 SDK 在浏览器跑 Gemma 2/ Gemma 3 270M
已验证模型:Gemma 2 2B (int8/int4)、Phi-2、Gemma 3 270M int8
关键命令:
mkdir -p model/gemma-3-tflite-gemma3-1b-it-int4-v1
cd model/gemma-3-tflite-gemma3-1b-it-int4-v1
wget -O gemma3-1B-it-int4.task \
'https://www.kaggle.com/.../gemma3-1b-it-int4.task'
工程价值:✅✅ 高(端侧 AI 验证 Demo 最佳方案,代码即拷即用)
条目 6:张量并行通信计算重叠(2025 年技术重点)
来源:大模型推理张量并行的4种模式 · CSDN
可信度:⭐⭐⭐⭐(结合最新论文介绍通信计算重叠方法)
核心观点
2025 年张量并行通信计算重叠是所有开源框架的必备功能。文章介绍了 4 种张量并行模式: 1. 数据并行(Data Parallelism) 2. 张量并行(Tensor Parallelism) 3. 流水线并行(Pipeline Parallelism) 4. 序列并行(Sequence Parallelism)
结合论文讲解了通信与计算重叠的具体做法,对理解 vLLM/SGLang 分布式部署有帮助。
工程价值:✅ 中(概念梳理为主,落地需要结合源码阅读)
分类标签
LLM推理框架SGLangvLLM性能评测张量并行RAG隐私安全ACL2024防护策略长上下文推理KV CacheDuoAttention端侧AIMediaPipeWebGPUCSDN高价值工程复现
建议写入路径
/shared/research-kb/inbox/jay/2026-08-23-csdn-llm-inference-rag.md← 本草稿
后续行动建议
- ⬜ 精读 SGLang/vLLM 对比原文(条目1),补充 benchmark 原始数据链接
- ⬜ 核验 RAG 隐私论文 GitHub 代码(phycholosogy/RAG-privacy)
- ⬜ 下载 DuoAttention arXiv 原文,对比 H2O/SnapKV 量化指标
- ⬜ 制作 LLM 推理框架选型决策树(基于条目1、2、3)
- ⬜ 将 bench_serving 命令纳入部署 SOP 文档
草稿版本:v1.0 · 生成时间:2026-08-23 08:20 CST · Jay · 未经审稿,请勿直接引用