知识库草稿 · Jay · 2026-08-23

主题:LLM 推理框架(SGLang/vLLM)对比 & RAG 系统安全 & 长上下文推理


条目 1:SGLang vs vLLM 推理框架选型(2026年高质量对比)

来源LLM推理框架选型实战:SGLang与vLLM的架构哲学与场景适配 · CSDN · 2026-02-07

可信度:⭐⭐⭐⭐⭐(含 benchmark 数据,框架版本对应关系清晰)

核心摘要

SGLang 核心技术:RadixAttention

  • 采用基数树(Radix Tree)管理 KV 缓存,跨请求自动前缀匹配与复用
  • 多轮对话场景缓存命中率提升 3-5 倍
  • 支持约束解码(FSM + 正则)强制 JSON/XML 格式化输出

vLLM 核心技术:PagedAttention

  • 借鉴 OS 虚拟内存分页机制,将 KV 缓存分割为固定大小块,动态分配
  • Continuous Batching 实时将新请求动态加入处理队列,GPU 持续工作
  • 显存利用率超 90%

性能对比(Llama3-70B-FP8 · 2×H100)

场景 SGLang vLLM
顺序请求吞吐 38 tokens/s 35 tokens/s
并发请求吞吐(稳定值) 30-31 tokens/s 16 tokens/s(下降)
首字延迟(TTFT)Llama3.1-8B 340ms 123ms
高并发(batch=64) 460 tokens/s 落后

选型建议

  • 选 SGLang:Agent 多轮交互、工具调用、强制结构化输出(JSON)、高并发下吞吐量稳定性优先
  • 选 vLLM:首字延迟敏感场景(TTFT)、MoE 模型通用高并发、成熟生态优先

关键洞察

  • vLLM 和 SGLang 已互相借鉴(vLLM 计划引入 RadixAttention),但短期差异化竞争持续
  • 企业级可组合:vLLM 底层引擎 + SGLang 上层编排,兼顾性能与灵活性

工程价值:✅ 高(benchmark 数据完整,场景建议明确,适合生产选型决策) 复现价值:✅ 高(含完整推理服务启动命令示例)


条目 2:SGLang/vLLM 性能评测工具 bench_serving 实战命令

来源sglang/VLLM性能评测: bench_serving工具 · CSDN · 2025

可信度:⭐⭐⭐⭐⭐(可直接复制运行的评测脚本命令,含完整参数说明)

核心内容

文章提供了 SGLang 内置 bench_serving 工具的完整使用方式,含多场景命令示例:

# SGLang backend 评测
python3 -m sglang.bench_serving \
    --backend sglang \
    --dataset-name random \
    --dataset-path /root/ShareGPT_V3_unfiltered_cleaned_split.json \
    --num-prompts 1024 \
    --random-input 1024 \
    --random-output 128 \
    --request-rate 128 \
    --max-concurrency 128 \
    --warmup-requests 16 \
    --base-url http://localhost:30000

# vLLM backend 评测
python3 -m sglang.bench_serving \
    --backend vllm \
    --model Qwen/Qwen3-32B-FP8 \
    --dataset-name random \
    --dataset-path /root/ShareGPT_V3_unfiltered_cleaned_split.json \
    --num-prompts 1024 \
    --random-input 2048 \
    --random-output 512 \
    --max-concurrency 512 \
    --pd-separated \
    --base-url http://localhost:9000

# vLLM 官方 benchmark_serving
python3 benchmarks/benchmark_serving.py \
    --backend vllm \
    --dataset-name random \
    --base-url http://localhost:8000 \
    --model /DATA/disk1/models/Qwen/Qwen3-32B-AWQ \
    --num-prompts 512 \
    --random-input-len 1024 \
    --random-output-len 128 \
    --request-rate 128 \
    --max-concurrency 128

工程价值:✅✅ 极高(评测命令即拷即用,是框架选型的实操必备工具) 建议:纳入 LLM 部署标准 SOP 文档


条目 3:RAG 系统隐私泄露风险(ACL 2024 论文解读)

来源【RAG安全】【ACL】The Good and The Bad: Exploring Privacy Issues in RAG · CSDN · 2024

可信度:⭐⭐⭐⭐⭐(顶会论文解读,ACL 2024,GitHub 验证代码:phycholosogy/RAG-privacy)

核心发现

RQ1:检索数据可被提取 - 攻击方式:复合结构化提示攻击(information 引导检索 + command 指令输出上下文) - 实验结果:Llama2-7b-Chat 和 GPT-3.5-turbo 以 ~50% 概率 输出与原始记录完全相同或高度相似内容 - 结论:医疗 RAG 等高敏感场景极度脆弱

RQ2:检索数据影响 LLM 记忆行为 - 有检索数据时,LLM 输出训练数据倾向显著降低 - 效果优于噪声注入或系统提示等传统方法 - 从训练数据安全视角:RAG 架构可能比单独 LLM 更安全

防御方向:输入净化(规则检测 + LLM 审核)、结构化输入、输出结构化、工具接口白名单

后续核验建议:阅读原论文 + 验证 GitHub: phycholosogy/RAG-privacy 代码

工程价值:✅ 高(RAG 部署安全必读,影响隐私合规设计)


条目 4:DuoAttention — 长上下文 LLM 高效推理(MIT/清华/NVIDIA)

来源DuoAttention: 高效长上下文LLM推理 · CSDN · 2024-11-22

可信度:⭐⭐⭐⭐⭐(MIT 团队 + 韩松,清华、上海交大、NVIDIA 联合,arXiv 论文)

核心创新

问题:传统 KV Cache 压缩(如 H2O、SnapKV)按 Token 重要性剪枝,导致语义碎片化——关键信息分布在多个中等重要性 Token 上被整体丢弃

DuoAttention 方案: - 将注意力头分为检索头(Retrieval Heads)流式头(Streaming Heads) - 检索头:需要全部 KV Cache(回答需要精确回忆) - 流式头:只需最近 K 个 Token(流式生成) - 基于 Logit 距离识别两类头,无需训练即可判断

效果:困惑度不变情况下,KV Cache 显存减少 2 倍以上

后续核验:直接读 arXiv 原文 + 复现实验


条目 5:MediaPipe LLM Inference — 浏览器端跑 Gemma(完整复现指南)

来源MediaPipe LLM Inference:在WEB浏览器中"裸跑"大语言模型 · CSDN

可信度:⭐⭐⭐⭐(Google MediaPipe 官方示例,含源码 + 完整模型下载/转换步骤)

核心价值

无需后端、无需显卡、零 API 成本,纯前端 SDK 在浏览器跑 Gemma 2/ Gemma 3 270M

已验证模型:Gemma 2 2B (int8/int4)、Phi-2、Gemma 3 270M int8

关键命令

mkdir -p model/gemma-3-tflite-gemma3-1b-it-int4-v1
cd model/gemma-3-tflite-gemma3-1b-it-int4-v1
wget -O gemma3-1B-it-int4.task \
  'https://www.kaggle.com/.../gemma3-1b-it-int4.task'

工程价值:✅✅ 高(端侧 AI 验证 Demo 最佳方案,代码即拷即用)


条目 6:张量并行通信计算重叠(2025 年技术重点)

来源大模型推理张量并行的4种模式 · CSDN

可信度:⭐⭐⭐⭐(结合最新论文介绍通信计算重叠方法)

核心观点

2025 年张量并行通信计算重叠是所有开源框架的必备功能。文章介绍了 4 种张量并行模式: 1. 数据并行(Data Parallelism) 2. 张量并行(Tensor Parallelism) 3. 流水线并行(Pipeline Parallelism) 4. 序列并行(Sequence Parallelism)

结合论文讲解了通信与计算重叠的具体做法,对理解 vLLM/SGLang 分布式部署有帮助。

工程价值:✅ 中(概念梳理为主,落地需要结合源码阅读)


分类标签

  • LLM推理框架 SGLang vLLM 性能评测 张量并行
  • RAG 隐私安全 ACL2024 防护策略
  • 长上下文推理 KV Cache DuoAttention
  • 端侧AI MediaPipe WebGPU
  • CSDN高价值 工程复现

建议写入路径

  • /shared/research-kb/inbox/jay/2026-08-23-csdn-llm-inference-rag.md ← 本草稿

后续行动建议

  1. ⬜ 精读 SGLang/vLLM 对比原文(条目1),补充 benchmark 原始数据链接
  2. ⬜ 核验 RAG 隐私论文 GitHub 代码(phycholosogy/RAG-privacy)
  3. ⬜ 下载 DuoAttention arXiv 原文,对比 H2O/SnapKV 量化指标
  4. ⬜ 制作 LLM 推理框架选型决策树(基于条目1、2、3)
  5. ⬜ 将 bench_serving 命令纳入部署 SOP 文档

草稿版本:v1.0 · 生成时间:2026-08-23 08:20 CST · Jay · 未经审稿,请勿直接引用