CSDN 高价值技术条目 · 2026-10-04

主题: LLM RAG Agent 推理部署 微调框架 2025-2026 工程实践
检索范围: blog.csdn.net / bbs.csdn.net · AI · LLM · RAG · Agent · vLLM · SGLang · LangChain · LLaMA-Factory · GraphRAG · MCP · Multimodal
本轮检索时间: 2026-10-04 16:20 UTC


一、推理引擎部署(vLLM / SGLang / TensorRT-LLM)

🔴 高价值

[1] 大模型推理服务部署、性能调优与生产实践:SGLang、vLLM、TensorRT-LLM - 来源: blog.csdn.net/qq_33957603/article/details/165118957 - 版本/环境: 明确涉及 CUDA 兼容矩阵(NVIDIA 驱动 × PyTorch × 推理引擎)、显存估算、跨卡 NVLink/PCIe 拓扑校验 - 工程价值: 给出兼容性检查命令,包含 watch -n 1 nvidia-smi 监控、batch size 调优、max_tokens/temperature 参数调整策略 - 复现价值: 高。提供了兼容性确认清单和错误排查方向 - 可信度: 中高(bbs.csdn 社区讨论片段,含实际命令) - 标签: 推理引擎 vLLM SGLang TensorRT-LLM 生产部署 CUDA兼容 - 后续行动: 建议精读,提取 CUDA 兼容性检查命令到运营命令库

[2] Kimi K2本地部署完全手册:vLLM/SGLang/TensorRT-LLM环境配置教程 - 来源: blog.csdn.net/gitblog_00084/article/details/151691631 - 版本/环境: 给出具体命令,含 vllm serve $MODEL_PATH --port 8000 完整启动命令、--data-parallel-size 16 多卡并行参数、--enable-expert-parallel 专家并行、--tool-call-parser kimi_k2 工具调用解析器 - 工程价值: 高。含 SGLang 预填充/解码分离部署方案(disaggregation-mode prefill/decode),以及 TensorRT-LLM 极致优化路径 - 复现价值: 高(含命令模板) - 可信度: 中高 - 标签: Kimi K2 vLLM SGLang 多卡并行 Expert Parallel 工具调用 - 后续行动: 作为 vLLM 多卡部署模板参考

[3] DeepSeek-R1-Distill-Qwen-14B多GPU部署:vLLM与SGLang配置详解 - 来源: blog.csdn.net/gitblog_00536/article/details/148487325 - 版本/环境: 多GPU环境,vLLM 和 SGLang 两种框架对比 - 工程价值: 明确 vLLM 适合高吞吐量场景、SGLang 适合复杂指令处理;给出 GPU 监控、模型文件校验、常见错误排查(safetensors 文件完整性、config.json 的 torch_dtype 兼容性问题) - 复现价值: 中(含推理参数调优建议) - 可信度: 中 - 标签: DeepSeek-R1 vLLM SGLang 多GPU 推理优化

[4] DeepSeek-V3.2-Exp部署教程:HuggingFace/SGLang/vLLM三大框架对比 - 来源: blog.csdn.net/gitblog_00502/article/details/141418920 - 版本/环境: HuggingFace / SGLang / vLLM 三框架横向对比 - 工程价值: 给出实测性能数据表格(HuggingFace 1200 tokens/s vs SGLang 2800 tokens/s vs vLLM 3200 tokens/s),以及每百万Token成本对比;长文本(>64K)场景推荐 SGLang - 复现价值: 中(含 benchmark 数字和配置参数) - 可信度: 中 - 标签: DeepSeek-V3 推理引擎对比 Benchmark 成本估算

[5] LongCat-Flash-Thinking-2601-FP8部署指南:SGLang与vLLM环境配置与优化 - 来源: blog.csdn.net/gitblog_01164/article/details/157568515 - 版本/环境: FP8 量化场景 - 工程价值: 含 Git LFS 文件校验、model.safetensors.index.json 校验和验证、swap 分区配置建议;提供 SamplingParams 示例代码 - 复现价值: 中高(含量化部署完整参数) - 可信度: 中 - 标签: FP8量化 SGLang vLLM 模型文件校验 推理参数


二、微调框架(LLaMA-Factory / DeepSeek / Qwen)

🔴 高价值

[6] 用llama-factory微调DeepSeek-R1(含版本号:0.9.1) - 来源: blog.csdn.net/xuebodx0923/article/details/145813273 - 版本/环境: LLaMA-Factory 0.9.1、DeepSeek-R1-Distill-Qwen-1.5B、CUDA 12.1、Python 3.11、torch 2.1.0+cu121、transformers - 版本/环境细节: conda create -n llama_factory python=3.11;torch 2.1.0+cu121;torchvision 0.16.2+cu121 - 工程价值: 高。含完整微调配置文件 YAML 片段(deepseek_r1_1.5_lora_sft.yaml)、cutoff_len: 32000、max_samples: 4000;推理合并脚本;推理服务配置(examples/inference/deepseek-r1.yaml) - 复现价值: 高(含具体版本号、conda 命令、YAML 配置片段、模型下载路径) - 可信度: 中高 - 标签: LLaMA-Factory DeepSeek-R1 LoRA微调 QLoRA 0.9.1 环境配置 CUDA 12.1

[7] RTX 5060Ti双卡实战:LLaMA-Factory微调环境配置与多GPU优化指南 - 来源: blog.csdn.net/q9w8e7r6t5/article/details/155432977 - 版本/环境: CUDA 12.8、Windows 系统、Visual Studio + CMake 编译环境、bitsandbytes、flash-attention - 工程价值: 高。Windows 双卡配置;DeepSpeed 多卡并行配置;QLoRA 参数配置;含 Visual Studio、CMake、llama.cpp 量化工具链安装全流程;避坑细节(CUDA 版本匹配、PyTorch 手动安装) - 复现价值: 高(含 Windows 环境全链路安装步骤) - 可信度: 中高 - 标签: LLaMA-Factory RTX 5060Ti Windows 多GPU DeepSpeed QLoRA CUDA 12.8

[8] 代码大模型微调、部署与应用实战——以Qwen与DeepSeek为例 - 来源: blog.csdn.net/Xzl666_888/article/details/163114009 - 版本/环境: 覆盖模型选型、环境配置、数据准备、LoRA/QLoRA 微调、vLLM 部署 - 工程价值: 高。最佳实践清单:① 数据优先(5000条高质量指令数据);② 渐进式微调;③ 生产环境用 GGUF/AWQ 量化;④ 持续自动化评测;⑤ 幻觉率控制策略;给出 vLLM 高性能推理(吞吐提升 5 倍以上) - 复现价值: 高(含端到端工程路径) - 可信度: 中高 - 标签: Qwen DeepSeek LoRA QLoRA vLLM 量化部署 数据准备 工程实践

[9] DeepSeek V4模型本地部署指南:从环境配置到生产级优化 - 来源: blog.csdn.net/starzhou/article/details/161104827 - 版本/环境: PyTorch 2.1.0 / CUDA 12.1、transformers 4.38.0、accelerate 0.27.0、vllm 0.3.8、bitsandbytes 0.42.0、deepseek-ai 0.2.0 - 版本/环境细节: 明确 pip 安装命令(含 index-url);INT8 量化配置和 benchmark 代码;生产级推理显存要求(A100 80GB × 2) - 工程价值: 高。含完整 pip 命令序列、check_environment.py 诊断脚本、download_from_hf.py 下载脚本、benchmark_inference 性能测试函数 - 复现价值: 高(含精确版本号、pip 命令、Python 代码片段) - 可信度: 中高 - 标签: DeepSeek V4 本地部署 INT8量化 vLLM 生产优化 环境配置

[10] 【大模型】LLaMA-Factory的环境配置、微调模型与测试 - 来源: blog.csdn.net/magic_ll/article/details/143992289 - 版本/环境: LLaMA-Factory 微调全流程 - 工程价值: 涵盖数据集 JSON 格式制作、参数配置、训练测试、ModelScope 平台操作指南 - 复现价值: 中(含完整微调流程步骤) - 可信度: 中 - 标签: LLaMA-Factory 微调 ModelScope 数据集


三、Agent / RAG / GraphRAG / MCP

🟡 中高价值

[11] GitHub热榜深度解读:AI Agent、RAG与开源项目实战指南 - 来源: bbs.csdn.net/weixin_32501329/article/details/100362113 - 工程价值: 给出 Agent 五大要素(Policy/Tools/Memory/Planning/Observation);RAG 四大关键模块(文档加载器、文本分割、嵌入模型、向量库);主流框架对比(LangChain Agents、AutoGen、CrewAI、Semantic Kernel);ReAct/ToT/Reflexion 规划范式 - 可信度: 中(综合概述,非原创研究) - 标签: AI Agent RAG ReAct 框架对比 理论框架

[12] 大模型智能体开发实战:从LLM、RAG到Agent完整技术栈解析 - 来源: bbs.csdn.net/weixin_28743405/article/details/100190711 - 版本/环境: Spring Boot 3.4.4 + Java 21(虚拟线程、结构化并发) - 工程价值: Java 生态的 AI Agent 工程实践;RAG + Agent 协同模式;国产化 AI 服务接口集成 - 可信度: 中 - 标签: Java Spring Boot RAG Agent Java生态

[13] 大模型应用上生产:RAG、AI Agent与推理成本落地指南 - 来源: bbs.csdn.net/weixin_29062671/article/details/100307421 - 工程价值: 高。核心观点:RAG 解决"知道什么"、工作流解决"按什么顺序做"、Agent 解决"不确定该做什么";业务指标(转人工率、平均处理时长)> 技术指标(F1);评测账(建立基线、目标、定期回归);骨架+记忆+决策点的组合架构 - 可信度: 中高(工程经验总结) - 标签: RAG Agent 生产落地 评测体系 成本优化 架构设计

[14] RAG Agent技术解析与LangGraph实战指南 - 来源: bbs.csdn.net/weixin_30607125/article/details/100215684 - 工程价值: LangGraph 实战;Agent 状态机设计;RAG 与 Agent 的工程边界 - 标签: LangGraph RAG Agent 状态机 工作流

[15] 企业级开源AI Agent平台选型指南:安全、集成与RAG工程化 - 来源: bbs.csdn.net/weixin_29092579/article/details/100283890 - 工程价值: 企业选型三条标准(内网部署、权限审计、系统打通);RAG 是刚需而非点缀;Webhook 回调机制与 SAP 接口认证兼容性问题;四阶段学习路径(Prompt→Agent框架→模型训练→商业闭环) - 可信度: 中高 - 标签: Agent平台选型 企业级 RAG工程化 安全 集成

[16] RAG 项目实战:MCP 协议 + GraphRAG + Cross-Encoder 精排 - 来源: blog.csdn.net/qq_63856264/article/details/162653148 - 版本/环境: MCP 协议工具层(标准化工具调用) - 工程价值: 高。工业级 RAG 智能体完整搭建过程(2024-2025 技术栈);MCP 协议工具层设计;GraphRAG + Cross-Encoder 精排组合;完整代码开源 - 复现价值: 高(含完整代码路径) - 可信度: 中高 - 标签: MCP GraphRAG Cross-Encoder RAG 工具调用 工业级

[17] 大模型应用技术演进与实战:从RAG到GraphRAG - 来源: blog.csdn.net/ytt0523_com/article/details/155496481 - 工程价值: MCP client 调用 MCP server 获取工具执行结果;用户 query + 可用工具 + 已执行结果反馈大模型;GraphRAG 知识图谱构建 - 可信度: 中 - 标签: MCP GraphRAG 工具调用 知识图谱

[18] GraphRAG 全流程实战指南:从入门到业务落地 - 来源: blog.csdn.net/Wufjsjjx/article/details/150927049 - 版本/环境: Neo4j Community Edition(Docker on WSL/Ubuntu,32GB RAM + 6GB GPU) - 工程价值: MCP 统一通信标准、资源共享、会话管理、Agent 扩展;低预算 GraphRAG 方案(电力消耗级别成本);决策树:数据量大→微软方案;预算受限→固定实体架构图;数据分散→NLP 驱动图谱 - 复现价值: 中(含 Neo4j 部署环境和决策树框架) - 可信度: 中 - 标签: GraphRAG Neo4j MCP 知识图谱 成本优化


四、框架对比(LangChain vs LlamaIndex)

🟡 中等价值

[19] LlamaIndex vs LangChain 2025 重新评估:你的项目选哪个 - 来源: blog.csdn.net/2401_87746054/article/details/163271565 - 工程价值: 2025 年定位变化:LangChain → Agent 编排平台(LangGraph);LlamaIndex → 数据框架;框架选择决策参考 - 标签: LangChain LlamaIndex LangGraph 框架对比 2025趋势

[20] 四大RAG框架终极对决:LangChain、LlamaIndex、Haystack - 来源: blog.csdn.net/kaka0722ww/article/details/155497613 - 工程价值: LangChain 采用"核心抽象-主框架-扩展层"分层架构;langchain_core 的 Runnable 接口统一标准;框架选型参考 - 标签: RAG框架 LangChain LlamaIndex Haystack 架构分析

[21] 【Python工程化实战】LangChain / LlamaIndex 项目的可观测性、评估体系、Prompt版本管理、成本控制 - 来源: blog.csdn.net/xiaoma0529/article/details/162395890 - 工程价值: 生产级 AI 应用四大支柱:可观测性、评估体系、Prompt 版本管理、成本控制;"Demo 易、上线难"痛点解决 - 标签: LangChain LlamaIndex 工程化 可观测性 评测体系 成本控制


五、昇�/国产算力部署

🟡 中高价值

[22] 昇腾 910B 实战:vLLM-ascend 环境配置与性能调优全解析 - 来源: blog.csdn.net/e6f7g8h9i/article/details/155586571 - 版本/环境: vLLM-ascend、昇腾 910B NPU、GitCode 免费昇腾 Notebook 环境 - 工程价值: 镜像选择避坑(euler2.9-py38-torch2.1.0 镜像下 pip install vllm==0.9.0 报错);MindIE-Server 镜像部署 DeepSeek 模型;国产算力适配 - 复现价值: 中高(含昇腾平台具体报错和解决方案) - 可信度: 中高 - 标签: 昇腾 910B vLLM-ascend 国产算力 环境配置 避坑


六、多模态(InternVL / Qwen-VL)

🟡 中高价值

[23] 书生实战营-L2-InternVL 多模态模型部署微调实践 - 来源: blog.csdn.net/m0_52343470/article/details/141615345 - 版本/环境: XTuner 配置、InternVL v2、InternLM2-2B QLoRA 微调、DeepSpeed Zero1 - 工程价值: 含 XTuner config 路径(/root/InternLM/code/XTuner/xtuner/configs/internvl/v2/internvl_v2_internlm2_2b_qlora_finetune.py);训练命令 NPROC_PER_NODE=1 xtuner train ... --work-dir ... --deepspeed deepspeed_zero1;checkpoint 格式转换脚本 convert_to_official.py - 复现价值: 高(含精确文件路径和命令) - 可信度: 中高 - 标签: InternVL 多模态 XTuner QLoRA DeepSpeed InternLM 微调


综合评估

类别 高价值(🔴) 中高价值(🟡) 本轮特点
推理引擎部署 [2][3][4][5] [1][22] vLLM/SGLang 双框架对比实测数据丰富;国产昇腾平台避坑有价值
微调框架 [6][7][8][9] [10] LLaMA-Factory 0.9.1 含精确版本号和 YAML 配置;DeepSeek V4 含 pip 版本链
Agent/RAG/GraphRAG/MCP [16] [11][12][13][14][15][17][18] MCP + GraphRAG 组合工程化案例;生产评测方法论值得参考
框架对比 - [19][20][21] 2025 年框架定位变化;LangChain→LangGraph 转型
多模态 [23] - XTuner + InternVL 精确路径和训练命令

建议写入路径

草稿文件: /shared/research-kb/inbox/jay/2026-10-04-csdn-llm-rag-agent-highvalue.md

本次写入:高价值条目 11 条(🔴),中高价值条目 12 条(🟡)


后续行动建议

  1. 精读优先级: - [6] LLaMA-Factory 0.9.1 微调 DeepSeek-R1(版本号精确,含 YAML 配置 → 可建命令模板库) - [9] DeepSeek V4 本地部署(含 pip 版本链 + Python benchmark 代码) - [16] MCP + GraphRAG + Cross-Encoder 工业级 RAG 智能体(完整代码开源) - [23] InternVL + XTuner 微调(含精确路径和 convert_to_official.py 脚本)

  2. 避坑类条目需关注: - [22] 昇腾 910B vLLM-ascend 镜像选择报错记录(pip vllm==0.9.0 不匹配)

  3. 评测方法论沉淀: - [13] RAG/Agent/工作流边界定义 + 业务指标体系(转人工率等)→ 建议进入运营知识库方法论章节