CSDN 高价值技术分享 · 2026-10-03 · Jay
主题
推理引擎部署实测(SGLang/vLLM/KTransformers)、Qwen3-Embedding 系列工程实践、Agent 设计模式与 Agentic RAG 源码解析
检索范围
- CSDN(blog.csdn.net / opc.csdn.net)
- 重点:部署命令、版本号、源码解读、Benchmark 数据、排障经验
一、CSDN 高价值条目
🔴 高价值 A 类(可直接复用/复现)
1. Kimi-K2.6 部署完全手册:vLLM、SGLang、KTransformers 三大方案对比
- 链接:
https://blog.csdn.net/gitblog_00947/article/details/157413911 - 作者:gitblog_00947 | 发布:2026-05-26 | 阅读:593
- 评分:⭐⭐⭐⭐⭐
- 工程价值:
- 三框架横向对比:vLLM(成熟稳定)vs SGLang(配置简单)vs KTransformers(CPU+GPU 异构)
- vLLM 部署:nightly 版才支持,需
uv pip install -U vllm --extra-index-url https://wheels.vllm.ai/nightly;生产推荐 0.19.1 稳定版 - SGLang 部署:
uv pip install "sglang>=0.5.10.post1",稳定版无需 nightly - KTransformers 关键参数:
--kt-weight-path、--kt-cpuinfer 96、--kt-threadpool-count 2、--kt-num-gpu-experts 30、--kt-method RAWINT4、--chunked-prefill-size 32658 - Benchmark 数据(8×L20 + 2×Intel 6454S):Prefill 640.12 tokens/s、Decode 24.51 tokens/s(48 路并发)
- KTransformers + LLaMA-Factory 微调:LoRA 微调吞吐量 44.55 token/s(2×4090 + Intel 8488C)
- 工具调用必须加参数:
--tool-call-parser kimi_k2 --reasoning-parser kimi_k2 - 版本信息:vLLM 0.19.1、SGLang ≥0.5.10.post1、KTransformers(2026-05)
- 复现价值:极高。完整启动命令、参数说明表、三方案对比表
- 标签:
Kimi-K2.6vLLMSGLangKTransformersMoE工具调用Agent - 建议分类:
inference-engineeringproduction
2. LongCat-Flash-Thinking-2601-FP8 部署指南:SGLang 与 vLLM 环境配置与优化
- 链接:
https://blog.csdn.net/gitblog_01164/article/details/157568515 - 作者:gitblog_01164 | 发布:2026-06-01 | 阅读:364
- 评分:⭐⭐⭐⭐
- 工程价值:
- 美团龙猫团队 5600 亿参数 MoE 大模型
- SGLang 部署:配置
EngineConfig(tensor_parallel_size=4, gpu_memory_utilization=0.9, enable_flash_attention=True) - vLLM 部署:
--quantization fp8、--max-num-batched-tokens 8192 - Heavy Thinking 模式:
enable_heavy_thinking=True、parallel_trajectories=4、iterative_depth=3 - 显存优化:FP8 量化 + Paged Attention
- 常见问题:Git LFS 文件校验、Flash Attention 启用验证
- 版本信息:SGLang(all)、vLLM(2026-06)
- 复现价值:高。完整 Python 代码、启动命令、参数配置
- 标签:
LongCatMoEFP8HeavyThinkingSGLangvLLM美团 - 建议分类:
inference-engineeringreasoning-model
3. GLM-5.1 部署教程:5种主流框架本地运行指南
- 链接:
https://blog.csdn.net/gitblog_00162/article/details/153067348 - 作者:gitblog_00162 | 发布:2026-06-04 | 阅读:331
- 评分:⭐⭐⭐⭐
- 工程价值:
- 5 框架对比:SGLang(v0.5.10+)、vLLM(v0.19.0+)、xLLM(昇腾芯片支持 v0.8.0+)、HuggingFace Transformers、TGI
- xLLM 为国产化(昇腾)部署唯一方案
- vLLM 量化:
--quantization awq - 282 个
.safetensors文件,模型体积大 - SGLang 代码示例:
from sglang import function, system, user, assistant, gen - 版本信息:SGLang ≥0.5.10、vLLM ≥0.19.0、xLLM ≥0.8.0(2026-06)
- 复现价值:高。5 框架命令对比表
- 标签:
GLM-5.1xLLM昇腾SGLangvLLMTGI多框架 - 建议分类:
inference-engineeringhardware-acceleration
4. 2026年嵌入模型选型:Qwen3-Embedding 系列实战分析
- 链接:
https://blog.csdn.net/weixin_36212459/article/details/157238032 - 作者:weixin_36212459 | 发布:2026
- 评分:⭐⭐⭐⭐
- 工程价值:
- 三规格对比表:0.6B(8K 上下文,移动端)/ 4B(32K,多语言通用)/ 8B(32K,高精度)
- 可变维度输出:32~2560 维可调,平衡精度与存储成本
- SGLang 部署命令:
python -m sglang.launch_server --model-path Qwen/Qwen3-Embedding-4B --port 30000 - OpenAI 兼容 API 调用示例(Python)
- Cosine similarity 实战代码
- 与 BGE-M3、E5-large 横向对比
- 版本信息:SGLang(2026)、Qwen3-Embedding(2026)
- 复现价值:高。选型表 + SGLang 部署代码 + Cosine similarity 实操代码
- 标签:
Qwen3-EmbeddingSGLangembedding向量模型多语言 - 建议分类:
ragembeddingvector-retrieval
5. Qwen3-Embedding-0.6B 资源占用高?轻量化部署方案实战
- 链接:
https://blog.csdn.net/weixin_35238815/article/details/157304462 - 作者:weixin_35238815 | 发布:2026
- 评分:⭐⭐⭐⭐
- 工程价值:
- OOM 根因分析:lm_head 占 ~300MB 显存(参数量虽小但嵌入层不小)
- SGLang 轻量化启动参数:
--disable-flashinfer(embedding 无加速反增开销)、--dtype half、--max-num-seqs 64、--mem-fraction-static 0.85 - LoRA 微调适配器:仅 4 层 r=8,推理时按需加载至 CPU
- 归一化处理:本地 numpy 而非 API 层
- INT8 量化可降 42% 显存
- 版本信息:SGLang(2026)、Qwen3-Embedding-0.6B(2026)
- 复现价值:高。排障思路 + 精准参数调优
- 标签:
Qwen3-Embedding轻量化LoRASGLang显存优化INT8 - 建议分类:
embeddingresource-optimization
6. LLM - 六大 Agent 设计模式:从 ReAct 到 Agentic RAG 的完整工程实践指南
- 链接:
https://blog.csdn.net/yangshangwei/article/details/155893368 - 作者:yangshangwei | 发布:2026
- 评分:⭐⭐⭐⭐
- 工程价值:
- 六模式对比表:ReAct / Self-Reflection / MCP Tool Use / CodeAct / Multi-Agent Workflow / Agentic RAG
- 各模式适用场景:ReAct(多步推理+工具调用)、CodeAct(数据分析/ETL)、Multi-Agent(研究助手/知识工作流)、Agentic RAG(企业知识库)
- MCP 架构说明:工具协议层,支持新增 MCP Server 扩展
- 组合建议:ReAct + Agentic RAG + Self-Reflection 校验
- 引用原始论文/博客链接
- 版本信息:MCP(2026)、LangChain(2026)
- 复现价值:中高。架构思路清晰,适合方案设计参考
- 标签:
AgentReActCodeActMCPMulti-AgentAgentic-RAG架构 - 建议分类:
agent-designarchitecture
🟡 中价值 B 类(值得参考,不可直接复用)
7. 清晰解析传统 RAG 与 Agentic RAG 的区别(含源码)
- 链接:
https://blog.csdn.net/2401_84208172/article/details/144678255 - 作者:2401_84208172 | 发布:2025
- 评分:⭐⭐⭐
- 工程价值:
- 基于 LangChain 的 Agentic RAG 源码片段
- Multi-Agent 通信示例代码
- 框架选择表:LangChain / AutoGPT / Semantic Kernel / Haystack / CAMEL
- 版本信息:LangChain(2025)
- 复现价值:中。有源码但篇幅有限
- 标签:
Agentic-RAGLangChainMulti-Agent对比 - 建议分类:
agent-design
8. RAG 的智能升级:Agentic RAG 实战与微软 Agent Framework 深度解析
- 链接:
https://blog.csdn.net/qq_46094651/article/details/156114680 - 作者:qq_46094651 | 发布:2026
- 评分:⭐⭐⭐
- 工程价值:
- 微软 Agent Framework(C#)完整代码:检索函数、TextSearchProvider 配置、AI Agent 创建
- 多 Agent 流水线:Query Analyzer / Retrieval Agent / Reranker Agent / Synthesizer Agent / Quality Checker
TextSearchProviderOptions配置:SearchTime=BeforeAIInvoke、RecentMessageMemoryLimit=6- 版本信息:Microsoft Agent Framework(2026)
- 复现价值:中。微软框架代码较完整,但 C# 生态较小众
- 标签:
Agentic-RAG微软C#质量检查多Agent流水线 - 建议分类:
agent-designenterprise
9. Deep Searcher(Zilliz)实现逻辑解析
- 链接:
https://blog.csdn.net/kakazhui/article/details/149489730 - 作者:kakazhui | 发布:2025
- 评分:⭐⭐⭐
- 工程价值:
- Zilliz 团队开源 Agentic RAG 系统介绍
- 融合 LLM + 多模态检索 + Agent 工作流 + 插件机制
- 项目地址:
github.com/zilliztech/deep-searcher - 适合企业级智能检索与问答
- 版本信息:Deep Searcher(2025)
- 复现价值:中。开源项目,可直接参考 GitHub
- 标签:
Agentic-RAGZillizMilvus多模态检索开源 - 建议分类:
ragagent-design
10. 微软开源 Agentic-RAG 读代码(ai-agents-for-beginners)
- 链接:
https://blog.csdn.net/kakazhui/article/details/150225683 - 作者:kakazhui | 发布:2025-08-11
- 评分:⭐⭐⭐
- 工程价值:
- 微软
ai-agents-for-beginners/05-agentic-rag源码解读 - Agentic-RAG 核心流程、角色分工、工具集成设计
- 依赖:
openai/langchain/faiss-cpu/streamlit/sentence-transformers - Generator / Agent Controller / Tools 三组件架构
- 版本信息:微软 ai-agents-for-beginners(2025)
- 复现价值:中。微软教程项目,适合入门
- 标签:
Agentic-RAG微软教程LangChainFAISS - 建议分类:
agent-designeducation
11. Graph-RAG 到 Agentic RAG:2026年知识检索四大新范式深度选型指南
- 链接:
https://blog.csdn.net/Trb201013/article/details/(文章 ID 缺失,标题确认) - 作者:Trb201013 | 发布:2026-06-10 | 阅读:848
- 评分:⭐⭐⭐
- 工程价值:
- 四大范式对比:Graph-RAG(多跳推理)/ Agentic RAG(多步任务)/ 长期记忆系统 / 无检索推理
- 选型决策树:简单文档问答 → Naive RAG;复杂分析 → Graph-RAG
- 开源工具:GraphRAG、claude-mem 等
- 版本信息:2026-06
- 复现价值:中。适合快速了解 2026 技术全景
- 标签:
Graph-RAGAgentic-RAG长期记忆范式演进选型 - 建议分类:
ragknowledge-management
12. DeepSeek-R1-Distill-Qwen-14B 多 GPU 部署:vLLM 与 SGLang 配置详解
- 链接:
https://blog.csdn.net/gitblog_00536/article/details/148487325 - 作者:gitblog_00536 | 发布:2026-06-02 | 阅读:350
- 评分:⭐⭐⭐
- 工程价值:
- vLLM:
pip install vllm==0.4.0,--quantization awq,--max-num-batched-tokens 8192 - SGLang:
pip install sglang[all]==0.1.7,EngineArgs(tensor_parallel_size=2) - 模型参数:48 层 Transformer、隐藏层 5120、131072 token 上下文
- 版本信息:vLLM 0.4.0、SGLang 0.1.7(2026-06)
- 复现价值:中。版本号精确,有参考价值
- 标签:
DeepSeek-R1Qwen蒸馏多GPUvLLMSGLang - 建议分类:
inference-engineering
二、本次主题
推理引擎工程化 + Embedding 模型选型 + Agentic RAG 架构演进
三、候选条目
共检索 CSDN 候选条目 24 条,经筛选保留 12 条进入本稿。
四、高价值条目
| # | 标题 | 评分 | 核心价值 | 标签 |
|---|---|---|---|---|
| 1 | Kimi-K2.6 部署三方案对比 | ⭐⭐⭐⭐⭐ | Benchmark 数据 + KTransformers 异构推理 | inference / MoE / Agent |
| 2 | LongCat-Flash-Thinking-2601-FP8 部署 | ⭐⭐⭐⭐ | Heavy Thinking 模式 + FP8 优化 | inference / MoE / 美团 |
| 3 | GLM-5.1 五框架部署 | ⭐⭐⭐⭐ | xLLM 昇腾支持 + 五框架命令表 | inference / 昇腾 |
| 4 | Qwen3-Embedding-4B 选型实战 | ⭐⭐⭐⭐ | 可变维度 + 选型对比表 + Cosine similarity 代码 | embedding / RAG |
| 5 | Qwen3-Embedding-0.6B 轻量化 | ⭐⭐⭐⭐ | OOM 根因分析 + LoRA 适配器方案 | embedding / 优化 |
| 6 | 六大 Agent 设计模式 | ⭐⭐⭐⭐ | 架构对比表 + 模式组合建议 | agent-design |
五、分类标签
inference-engineering embedding rag agent-design architecture production
六、建议写入路径
- 主稿:
/shared/research-kb/inbox/jay/2026-10-03-csdn-inference-embedding-agentic-rag-highvalue.md - 不写入
/shared/research-kb/review/或/shared/research-kb/published/(由同步任务处理)
七、后续行动建议
- 精读:条目 1(Kimi-K2.6 部署三方案,Benchmark 数据翔实)
- 审稿:条目 6(六大 Agent 设计模式,引用原始论文链接需核验)
- 主题页更新:
inference-engineering页建议补充 KTransformers 异构推理方案