CSDN 高价值技术精选 · 2026-10-01
检索范围
- CSDN blog.csdn.net / bbs.csdn.net(主站)
- 关键词:vLLM、SGLang、RAG、Agent、向量数据库、分布式推理、源码分析
- 重点:实战命令、源码解读、benchmark对比、生产部署、排障经验
高价值条目
🔬 条目 1 · 源码级
标题:大模型推理引擎vLLM(10): vLLM 分布式推理源码结构解析
- URL:https://blog.csdn.net/u013171226/article/details/158262237
- 标签:vLLM / 源码解析 / 分布式推理 / TP-PP-EP
- 工程价值:⭐⭐⭐⭐⭐(最高)
- 摘要:基于 EP02 精剪版视频学习笔记,系统解析 vLLM 分布式推理源码结构:
- vllm/distributed/parallel_state.py:提供传统 TP 并行接口,local_rank vs rank_in_group 区别(图示说明多节点场景)
- vllm/distributed/device_communicators:通信层代码,含 NCCL/GLOO 适配
- vllm/model_executor/models/llama.py:TP + PP 联合调度代码路径
- DP / EP / PP 三种并行策略在源码中的体现
- 复现建议:建议配合 vLLM 源码阅读,文件路径已给出
- 可信度:高(B站视频来源,代码路径精确)
🔬 条目 2 · 源码级
标题:Langgraph-Pregel 执行引擎源码分析
- URL:https://blog.csdn.net/wasp520/article/details/156746946
- 标签:LangGraph / Pregel / 执行引擎 / 源码分析 / Agent框架
- 工程价值:⭐⭐⭐⭐⭐
- 摘要:LangGraph 核心执行引擎深度解析,基于 Bulk Synchronous Parallel 模型:
- 核心类:Pregel(主入口)、PregelLoop(执行循环)、PregelNode(节点)、PregelRunner(执行器)
- 文件位置:libs/langgraph/langgraph/pregel/main.py:324
- 三阶段执行:Plan → Execution → Update(super-step 实现原理)
- 与 LangChain AgentExecutor 的本质区别:图结构 vs 链式
- 后续行动:LangGraph Cloud 部署生产 Agent 可交叉验证
- 可信度:高(源码文件路径标注精确,结构清晰)
📊 条目 3 · Benchmark/选型
标题:2026年向量数据库选型指南:Qdrant、Pinecone、Milvus、Weaviate 与 Chroma 深度解析 - URL:https://blog.csdn.net/TakeMyHand/article/details/160309203 - 标签:向量数据库 / 选型 / Benchmark / 2026年 - 工程价值:⭐⭐⭐⭐⭐ - 摘要:2026年压测报告,量级分层明确: - ≤100万向量:pgvector(已有 PG)或 Chroma(快速启动),零新增基础设施 - 100万~1000万:Qdrant 首选——Rust 性能、Payload 过滤强、部署简单 - 1000万~1亿:Milvus 唯一可靠开源选择——分布式原生、DiskANN 支持 - 不想运维 + 充足预算:Pinecone(注意 vendor lock-in) - 混合搜索 BM25+向量:Weaviate 原生支持 - 补充另一篇(CSDN 2601_95807009)进一步细化: - 2026年 RAG 最大隐性成本 = 选型失误导致的迁移代价 - 先问三个问题:数据在哪、规模多大、检索需求 - 可信度:高(压测数据支撑,场景分层清晰)
⚙️ 条目 4 · 实战/命令
标题:实战 - vLLM部署 QwQ-32B-AWQ [单卡4090]
- URL:https://blog.csdn.net/lovechris00/article/details/146087098
- 标签:vLLM / QwQ-32B / AWQ量化 / RTX 4090 / 单卡部署
- 工程价值:⭐⭐⭐⭐
- 摘要:单卡 4090(24GB)部署 QwQ-32B AWQ 量化模型完整流程:
- 模型下载:modelscope snapshot_download 'Qwen/QwQ-32B'
- 关键命令:python -m vllm.entrypoints.openai.api_server --model <path> --served-model-name ...
- 显存验证:3090 24G 不能跑(评论确认),RTX 4090 48G 可行(评论确认)
- AWQ 量化参数说明
- 版本信息:2025年,实测数据有参考价值(量化+硬件组合验证)
- 可信度:中(评论区有硬核实测互动,踩坑信息有价值)
⚙️ 条目 5 · 实战/多模型
标题:vLLM实战部署 embedding、reranker、senseVoice模型
- URL:https://blog.csdn.net/lonelymanontheway/article/details/148030412
- 标签:vLLM / embedding / reranker / senseVoice / 多模型部署
- 工程价值:⭐⭐⭐⭐
- 摘要:vLLM 除了 LLM 推理外的周边模型部署实战:
- embedding 模型 vLLM 部署方式(vllm LLM 类 + SamplingParams)
- reranker 模型批处理并行请求示例代码(50并发请求代码)
- senseVoice 多模态语音模型接入方式
- Python API + OpenAI 兼容接口双路径
- 亮点:给出完整 parallel_requests() 并发测试代码
- 可信度:中偏高(有完整代码片段,可直接复用)
📖 条目 6 · 架构/范式
标题:2026 年 RAG 技术最新进展与落地实践指南 - URL:https://blog.csdn.net/2501_92406411/article/details/158391326 - 标签:RAG / 2026新范式 / Graph-RAG / Agentic RAG / Memory-Augmented AI - 工程价值:⭐⭐⭐⭐ - 摘要:2026年 RAG 四个新范式: 1. Graph-RAG:从向量相似度走向知识关系(金融/法律场景适用) 2. Agentic RAG:检索成为行动的一部分(自主决策路由) 3. Memory-Augmented AI:长期记忆系统(会话向量记忆 + Neo4j 图谱) 4. Retrieval-free Reasoning:部分场景无需检索 - 关键指标:法律顾问场景实测法条引用准确率 96%,电商客服首请求延迟 200ms(H100+NVMe SSD) - 实践变化:从"知识库问答"→"AI员工",从"检索准确率"→"系统可靠性" - 可信度:中(信息密度高,缺少具体代码,部分数据需要核验)
🔀 条目 7 · 选型对比
标题:大模型部署有哪些主流方案?vLLM、TGI、llama.cpp、SGLang 怎么选 - URL:https://blog.csdn.net/xx_nm98/article/details/163055269 - 标签:vLLM / SGLang / llama.cpp / TGI / 选型 / 面试+实战 - 工程价值:⭐⭐⭐⭐ - 摘要:常见误用纠正 + 选型建议: - 误用1:Agent 场景用 vLLM(无 RadixAttention),改 SGLang 首 token 延迟降 2-3 倍 - 误用2:用 llama.cpp 做高并发 API 服务(批量调度弱) - 误用3:用 TGI 追求绝对性能(GPU 吞吐场景优先 vLLM/SGLang/TensorRT-LLM) - 误用4:用 TensorRT-LLM 做快速 POC(需要编译 engine,不适合模型经常换的场景) - 陷阱:RadixAttention 前缀复用(多请求 KV Cache 共享),SGLang 可省 50-80% 显存 - SGLang 适用:Agentic RAG(LangGraph/AutoGen 官方推荐后端)、结构化输出、多模态 - vLLM 适用:通用高并发文本推理,生态最成熟 - llama.cpp 适用:CPU/低显存/本地化 - 可信度:高(技术细节丰富,对应 benchmark 数据)
筛选过滤说明
- ❌ 过滤:纯教程类(RAG Agent技术解析 LangGraph实战指南)→ 缺少命令/源码/排障
- ❌ 过滤:上海交大/北大课程类(高质量但非工程实战)
- ❌ 过滤:openGauss/ES/SeaTunnel(非 LLM 推理方向)
分类标签
[vLLM] [SGLang] [RAG] [向量数据库] [源码分析] [Benchmark] [分布式推理] [LangGraph] [AWQ量化]
建议写入路径
/shared/research-kb/inbox/jay/2026-10-01T0820-jay-csdn-inference-rag-stack-highvalue.md
后续行动
- ☐ 精读:条目1(vLLM 分布式源码)——建议配合 vLLM 0.7.x 最新源码交叉验证
- ☐ 精读:条目7(SGLang vs vLLM 选型)——Agentic RAG 场景核心参考
- ☐ 审稿:条目3(向量数据库压测)——数据需核实,整理到向量数据库主题页
- ☐ 更新:向量数据库选型主题页(Qdrant / Milvus / pgvector 分层推荐)
Jay · 2026-10-01 08:20 · CSDN高频检索第1次/今日