知识库草稿 · Jay · 2026-08-08

主题:CSDN 高价值 LLM / RAG / MLOps / Agent 技术分享(第三轮检索)


一、高价值条目清单

🔥 优先精读(工程价值高 + 含源码/命令/版本)

1. 《告别OOM!大模型微调显存优化秘籍:QLoRA+DeepSpeed实战全解析》

  • URL: https://blog.csdn.net/weixin_39907681/article/details/147556835
  • 作者: weixin_39907681
  • 发布时间: 2025-09-11(最新推荐 2025-09-11)
  • 分类标签: LLM微调 QLoRA DeepSpeed OOM排查 显存优化
  • 工程价值: ⭐⭐⭐⭐⭐
  • 版本/环境: PyTorch, DeepSpeed, QLoRA; 涉及 ZeRO 1/2/3 配置
  • 核心内容摘要:
  • 全量微调 vs 增量微调 vs 局部微调的技术对比
  • LoRA 数学原理:ΔW = B×A,r=16 时参数量从 16M → 131K(减少128倍)
  • ZeRO Stage 1/2/3 分阶段切分模型状态原理
  • 实战:ChatGLM-6B + DeepSpeed LoRA 精调代码示例
  • 附 ds_config_zero3.json 配置模板
  • 复现价值: 高。含完整配置文件和命令示例
  • 可信度评估: 高。原创博客,CC BY-SA 协议,代码可验证
  • 后续行动: 可纳入"LLM微调与显存优化"主题页;建议核验 DeepSpeed ZeRO 配置文档

2. 《推理引擎使用与实践:vLLM × DeepSpeed × TensorRT 全流程拆解》

  • URL: https://blog.csdn.net/sinat_28461591/article/details/147316371
  • 作者: sinat_28461591
  • 分类标签: 推理引擎 vLLM DeepSpeed-Inference TensorRT PagedAttention
  • 工程价值: ⭐⭐⭐⭐⭐
  • 版本/环境: PyTorch 2.1 / TensorRT 8.6 / DeepSpeed 0.12 / vLLM(latest)
  • 核心内容摘要:
  • vLLM = Token调度专家(PagedAttention + KV Cache + 动态批处理)
  • DeepSpeed-Inference = 多GPU协同推理(张量并行)
  • TensorRT = 极致吞吐 + 结构化输入优化
  • 三引擎选型决策树:对话型→vLLM;固定输入高吞吐→TensorRT;多卡大模型→DeepSpeed
  • 端到端推理服务架构图(API Gateway → Model Router → 引擎层)
  • 复现价值: 高。含架构图、对比基准测试、部署命令
  • 可信度评估: 高。AI系统专家视角,含实测数据对比
  • 后续行动: 纳入"LLM推理优化"主题页;对比同期 vLLM 官方 benchmark

3. 《零代码玩转大模型微调:LLaMA-Factory 全栈实战指南》

  • URL: https://ascendai.csdn.net/69646fbaea53844658f6350c.html
  • 作者: 傲傲娇(昇腾开源生态专区)
  • 分类标签: LLaMA-Factory QLoRA 微调 vLLM部署 DeepSpeed
  • 工程价值: ⭐⭐⭐⭐⭐
  • 版本/环境: Python 3.10, LLaMA-Factory (最新), 18GB 显存可跑 7B
  • 核心内容摘要:
  • 5行代码 vs 500+行脚本对比;18GB 显存跑 7B QLoRA
  • WebUI 傻瓜化操作:数据准备 → 模型训练 → 评估 → 导出单文件 → vLLM 部署
  • 支持 SFT/RLHF/DPO/PPO 全流程
  • 一键安装脚本(conda + git clone + pip install)
  • 微信聊天记录转训练数据示例
  • 断点续传 + DeepSpeed Zero-3 + TensorBoard 可视化
  • 常见报错速查表:loss爆炸/OOM/乱码/续传失败
  • 复现价值: 极高。完整命令链,可直接上手
  • 可信度评估: 高。昇腾官方社区,镜像预装验证
  • 后续行动: 纳入"LLaMA-Factory"专项页面;补充 LlamaFactory 官方文档链接

4. 《vLLM-Ascend 实战指南:从环境部署到性能调优的完整避坑手册》

  • URL: https://hwcomputing.csdn.net/6960a952ea53844658f5a272.html
  • 作者: 几何心凉(鲲鹏昇腾开发者社区)
  • 分类标签: vLLM Ascend NPU 环境部署 排错
  • 工程价值: ⭐⭐⭐⭐
  • 版本/环境: vLLM V1 架构(Ascend 必须), CANN, expandable_segments:True
  • 核心内容摘要:
  • 昇腾 NPU 环境变量配置:VLLM_USE_V1=1, PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
  • 常见排错速查表:Permission denied / ImportError / OOM / 乱码
  • TorchAir 图模式优化(算子融合)
  • 昇腾 vs 英伟达架构对比
  • 复现价值: 高。含排错表和环境变量清单
  • 可信度评估: 高。鲲鹏昇腾官方社区,实测避坑
  • 后续行动: 纳入"推理部署"主题页;跨平台对比笔记

5. 《RAG 检索增强生成实战指南》(综合推荐帖,多篇汇总)

  • URL: https://blog.csdn.net/xie__jin__cheng/article/details/156954761
  • 作者: xie__jin__cheng
  • 分类标签: RAG 检索增强 LangChain 向量数据库 重排序
  • 工程价值: ⭐⭐⭐⭐
  • 版本/环境: bge-large-zh-v1.5, Elasticsearch, LangChain, bge-reranker
  • 核心内容摘要:
  • RAG 五组件架构:文档加载 → 分块 → 向量化 → 检索 → 生成
  • 块大小建议 256–1024 tokens
  • 混合检索:BM25 + 向量检索(HyDE、RRF 融合)
  • 嵌入模型推荐:bge-large-zh-v1.5 / text-embedding-3-large
  • 评估指标:Recall@k, MRR@k, Hit Rate
  • 工具链:LangChain / LlamaIndex / DSPy
  • 复现价值: 高。含架构图和配置建议
  • 可信度评估: 中高。综合概述型,部分为 AI 辅助生成
  • 后续行动: 纳入"RAG 系统设计"主题页;建议核验 DSPy 官方文档

6. 《Llama Factory进阶:如何用Deepspeed Z3配置微调超大模型》

  • URL: https://modelers.csdn.net/69a78a967bbde9200b9d12d3.html
  • 作者: GoldenleafRaven13(魔乐社区)
  • 分类标签: LLaMA-Factory DeepSpeed-Z3 72B模型 微调 OOM解决
  • 工程价值: ⭐⭐⭐⭐
  • 核心内容摘要:
  • 72B 模型全参数微调:单卡 >100GB → <20GB(Z3 offload)
  • 8卡 A100 可完成 72B 全参数微调
  • ds_z3_offload_config.json 完整配置示例
  • 实战命令:deepspeed --num_gpus=8 train_bash.py ...
  • 常见报错:RuntimeError(device不一致)解决方案
  • 复现价值: 高。含完整 JSON 配置和命令
  • 可信度评估: 中高。魔乐社区原创
  • 后续行动: 纳入"分布式训练"主题页

7. 《SpringBoot整合LangChain4j实现RAG》(Java 方向补充)

  • URL: https://blog.csdn.net/m0_71741473/article/details/148499407
  • 作者: m0_71741473
  • 分类标签: RAG LangChain4j SpringBoot Elasticsearch Java
  • 工程价值: ⭐⭐⭐
  • 核心内容摘要:
  • Elasticsearch 8.15.5 向量存储配置(Docker 部署)
  • LangChain4j 0.35.0 + SpringBoot 2.6.5
  • 流式输出改造方案
  • 多索引分知识库查询策略
  • 复现价值: 中高。含 pom 依赖和 yml 配置
  • 可信度评估: 中。Java 生态 RAG 补充场景
  • 后续行动: 补充至"RAG工程实践";Java 同学可参考

8. 《大模型微调技术完全指南:从原理到实践的系统性入门(2026版)》

  • URL: https://blog.csdn.net/huang9604/article/details/161566729
  • 作者: huang9604
  • 分类标签: 微调 LoRA QLoRA DPO GRPO RLHF 对齐训练
  • 工程价值: ⭐⭐⭐⭐⭐
  • 核心内容摘要:
  • LoRA 数学推导:ΔW = B×A,r=16 参数量降低128倍
  • 对齐方法演进:RLHF → DPO → SimPO → ORPO → KTO → GRPO
  • 2025 DeepSeek-R1:纯 GRPO + 结果奖励 → 推理能力涌现
  • 2025–2026 小模型革命:1B–9B 微调后可匹敌 120B 闭源模型
  • Evolution Strategies(无梯度微调,仅需推理)
  • Agentic 微调 / SLM 微调 新兴方向
  • 复现价值: 高。系统梳理,配公式和代码片段
  • 可信度评估: 高。2026版系统性梳理,覆盖全面
  • 后续行动: 纳入"LLM微调技术全景"主题页;建议对比 arXiv:2501.12948 原文

9. 《2026年开源多模态(VLM)模型,谁最能打?》

  • URL: https://blog.csdn.net/m0_59235245/article/details/162560472
  • 作者: m0_59235245
  • 分类标签: 多模态 VLM Qwen2.5-VL Kimi-VL 端侧部署 选型指南
  • 工程价值: ⭐⭐⭐⭐
  • 核心内容摘要:
  • 旗舰级:Kimi-VL-A3B-Thinking(MoE 28B活跃参数,支持长视频/PDF/屏幕截图)
  • 中坚级:Qwen2.5 VL(消费级显卡可跑)
  • 端侧:手机部署 VLM 方案
  • 选型指南和避坑建议
  • 复现价值: 中。偏选型分析,代码较少
  • 可信度评估: 中高。2026年最新榜单对比
  • 后续行动: 纳入"多模态模型选型"主题页

二、分类标签汇总

标签 出现次数 代表条目
LLM微调 4 QLoRA+DeepSpeed, LLaMA-Factory, 微调技术完全指南
vLLM 3 推理引擎对比, vLLM-Ascend
RAG 3 检索增强生成实战, LangChain4j, RAG评测
DeepSpeed 3 ZeRO, Z3配置, 多GPU微调
MLOps 2 MLOps实战指南, 机器学习系统监控
Agent 2 LangChain Agent, 多智能体
多模态 2 VLM选型, MLLM技术发展
量化 1 vLLM量化技术全解析
LangChain4j 1 SpringBoot+RAG

三、建议写入路径

写入文件: /shared/research-kb/inbox/jay/2026-08-08-csdn-llm-rag-mlops.md

草稿状态: ✅ 草稿已完成,待审稿后推送 review


四、精读/审稿/主题页更新建议

🔍 待精读(需核验论文/代码)

  1. DeepSeek-R1 GRPO 推理涌现 → 核验 arXiv:2501.12948
  2. vLLM PagedAttention 源码级原理 → 核验 vLLM 官方 GitHub
  3. LLaMA-Factory QLoRA 实测数据 → 核验 GitHub README benchmark

📝 待审稿

  • 大模型微调技术完全指南(对齐方法演进部分)
  • 推理引擎使用与实践(三引擎对比数据)

🗂️ 建议主题页更新

  1. 新建「LLM微调与显存优化」主题页(含 QLoRA/ZeRO/DekoSpeed)
  2. 更新「RAG系统设计」主题页(补充 DSPy 和 RAGAS 评测)
  3. 更新「推理引擎选型」主题页(vLLM vs DeepSpeed vs TensorRT)

五、Substack 线索记录(待后续跟进)

本轮 CSDN 检索中未发现 Substack 原文,但以下主题值得在 Substack 检索中跟进: - DeepSeek-R1 GRPO 原理(可能见于 Substack AI research newsletter) - LLMOps / 推理监控(LangSmith / Langfuse 实践) - Agentic RAG 前沿(Multi-Agent RAG 架构)


本条草稿由 Jay 实例自动生成 · 2026-08-08 · 请勿直接提交 GitHub