知识库草稿 · Jay · 2026-08-08
主题:CSDN 高价值 LLM / RAG / MLOps / Agent 技术分享(第三轮检索)
一、高价值条目清单
🔥 优先精读(工程价值高 + 含源码/命令/版本)
1. 《告别OOM!大模型微调显存优化秘籍:QLoRA+DeepSpeed实战全解析》
- URL: https://blog.csdn.net/weixin_39907681/article/details/147556835
- 作者: weixin_39907681
- 发布时间: 2025-09-11(最新推荐 2025-09-11)
- 分类标签:
LLM微调QLoRADeepSpeedOOM排查显存优化 - 工程价值: ⭐⭐⭐⭐⭐
- 版本/环境: PyTorch, DeepSpeed, QLoRA; 涉及 ZeRO 1/2/3 配置
- 核心内容摘要:
- 全量微调 vs 增量微调 vs 局部微调的技术对比
- LoRA 数学原理:ΔW = B×A,r=16 时参数量从 16M → 131K(减少128倍)
- ZeRO Stage 1/2/3 分阶段切分模型状态原理
- 实战:ChatGLM-6B + DeepSpeed LoRA 精调代码示例
- 附 ds_config_zero3.json 配置模板
- 复现价值: 高。含完整配置文件和命令示例
- 可信度评估: 高。原创博客,CC BY-SA 协议,代码可验证
- 后续行动: 可纳入"LLM微调与显存优化"主题页;建议核验 DeepSpeed ZeRO 配置文档
2. 《推理引擎使用与实践:vLLM × DeepSpeed × TensorRT 全流程拆解》
- URL: https://blog.csdn.net/sinat_28461591/article/details/147316371
- 作者: sinat_28461591
- 分类标签:
推理引擎vLLMDeepSpeed-InferenceTensorRTPagedAttention - 工程价值: ⭐⭐⭐⭐⭐
- 版本/环境: PyTorch 2.1 / TensorRT 8.6 / DeepSpeed 0.12 / vLLM(latest)
- 核心内容摘要:
- vLLM = Token调度专家(PagedAttention + KV Cache + 动态批处理)
- DeepSpeed-Inference = 多GPU协同推理(张量并行)
- TensorRT = 极致吞吐 + 结构化输入优化
- 三引擎选型决策树:对话型→vLLM;固定输入高吞吐→TensorRT;多卡大模型→DeepSpeed
- 端到端推理服务架构图(API Gateway → Model Router → 引擎层)
- 复现价值: 高。含架构图、对比基准测试、部署命令
- 可信度评估: 高。AI系统专家视角,含实测数据对比
- 后续行动: 纳入"LLM推理优化"主题页;对比同期 vLLM 官方 benchmark
3. 《零代码玩转大模型微调:LLaMA-Factory 全栈实战指南》
- URL: https://ascendai.csdn.net/69646fbaea53844658f6350c.html
- 作者: 傲傲娇(昇腾开源生态专区)
- 分类标签:
LLaMA-FactoryQLoRA微调vLLM部署DeepSpeed - 工程价值: ⭐⭐⭐⭐⭐
- 版本/环境: Python 3.10, LLaMA-Factory (最新), 18GB 显存可跑 7B
- 核心内容摘要:
- 5行代码 vs 500+行脚本对比;18GB 显存跑 7B QLoRA
- WebUI 傻瓜化操作:数据准备 → 模型训练 → 评估 → 导出单文件 → vLLM 部署
- 支持 SFT/RLHF/DPO/PPO 全流程
- 一键安装脚本(conda + git clone + pip install)
- 微信聊天记录转训练数据示例
- 断点续传 + DeepSpeed Zero-3 + TensorBoard 可视化
- 常见报错速查表:loss爆炸/OOM/乱码/续传失败
- 复现价值: 极高。完整命令链,可直接上手
- 可信度评估: 高。昇腾官方社区,镜像预装验证
- 后续行动: 纳入"LLaMA-Factory"专项页面;补充 LlamaFactory 官方文档链接
4. 《vLLM-Ascend 实战指南:从环境部署到性能调优的完整避坑手册》
- URL: https://hwcomputing.csdn.net/6960a952ea53844658f5a272.html
- 作者: 几何心凉(鲲鹏昇腾开发者社区)
- 分类标签:
vLLMAscendNPU环境部署排错 - 工程价值: ⭐⭐⭐⭐
- 版本/环境: vLLM V1 架构(Ascend 必须), CANN, expandable_segments:True
- 核心内容摘要:
- 昇腾 NPU 环境变量配置:
VLLM_USE_V1=1,PYTORCH_NPU_ALLOC_CONF=expandable_segments:True - 常见排错速查表:Permission denied / ImportError / OOM / 乱码
- TorchAir 图模式优化(算子融合)
- 昇腾 vs 英伟达架构对比
- 复现价值: 高。含排错表和环境变量清单
- 可信度评估: 高。鲲鹏昇腾官方社区,实测避坑
- 后续行动: 纳入"推理部署"主题页;跨平台对比笔记
5. 《RAG 检索增强生成实战指南》(综合推荐帖,多篇汇总)
- URL: https://blog.csdn.net/xie__jin__cheng/article/details/156954761
- 作者: xie__jin__cheng
- 分类标签:
RAG检索增强LangChain向量数据库重排序 - 工程价值: ⭐⭐⭐⭐
- 版本/环境: bge-large-zh-v1.5, Elasticsearch, LangChain, bge-reranker
- 核心内容摘要:
- RAG 五组件架构:文档加载 → 分块 → 向量化 → 检索 → 生成
- 块大小建议 256–1024 tokens
- 混合检索:BM25 + 向量检索(HyDE、RRF 融合)
- 嵌入模型推荐:bge-large-zh-v1.5 / text-embedding-3-large
- 评估指标:Recall@k, MRR@k, Hit Rate
- 工具链:LangChain / LlamaIndex / DSPy
- 复现价值: 高。含架构图和配置建议
- 可信度评估: 中高。综合概述型,部分为 AI 辅助生成
- 后续行动: 纳入"RAG 系统设计"主题页;建议核验 DSPy 官方文档
6. 《Llama Factory进阶:如何用Deepspeed Z3配置微调超大模型》
- URL: https://modelers.csdn.net/69a78a967bbde9200b9d12d3.html
- 作者: GoldenleafRaven13(魔乐社区)
- 分类标签:
LLaMA-FactoryDeepSpeed-Z372B模型微调OOM解决 - 工程价值: ⭐⭐⭐⭐
- 核心内容摘要:
- 72B 模型全参数微调:单卡 >100GB → <20GB(Z3 offload)
- 8卡 A100 可完成 72B 全参数微调
- ds_z3_offload_config.json 完整配置示例
- 实战命令:
deepspeed --num_gpus=8 train_bash.py ... - 常见报错:RuntimeError(device不一致)解决方案
- 复现价值: 高。含完整 JSON 配置和命令
- 可信度评估: 中高。魔乐社区原创
- 后续行动: 纳入"分布式训练"主题页
7. 《SpringBoot整合LangChain4j实现RAG》(Java 方向补充)
- URL: https://blog.csdn.net/m0_71741473/article/details/148499407
- 作者: m0_71741473
- 分类标签:
RAGLangChain4jSpringBootElasticsearchJava - 工程价值: ⭐⭐⭐
- 核心内容摘要:
- Elasticsearch 8.15.5 向量存储配置(Docker 部署)
- LangChain4j 0.35.0 + SpringBoot 2.6.5
- 流式输出改造方案
- 多索引分知识库查询策略
- 复现价值: 中高。含 pom 依赖和 yml 配置
- 可信度评估: 中。Java 生态 RAG 补充场景
- 后续行动: 补充至"RAG工程实践";Java 同学可参考
8. 《大模型微调技术完全指南:从原理到实践的系统性入门(2026版)》
- URL: https://blog.csdn.net/huang9604/article/details/161566729
- 作者: huang9604
- 分类标签:
微调LoRAQLoRADPOGRPORLHF对齐训练 - 工程价值: ⭐⭐⭐⭐⭐
- 核心内容摘要:
- LoRA 数学推导:ΔW = B×A,r=16 参数量降低128倍
- 对齐方法演进:RLHF → DPO → SimPO → ORPO → KTO → GRPO
- 2025 DeepSeek-R1:纯 GRPO + 结果奖励 → 推理能力涌现
- 2025–2026 小模型革命:1B–9B 微调后可匹敌 120B 闭源模型
- Evolution Strategies(无梯度微调,仅需推理)
- Agentic 微调 / SLM 微调 新兴方向
- 复现价值: 高。系统梳理,配公式和代码片段
- 可信度评估: 高。2026版系统性梳理,覆盖全面
- 后续行动: 纳入"LLM微调技术全景"主题页;建议对比 arXiv:2501.12948 原文
9. 《2026年开源多模态(VLM)模型,谁最能打?》
- URL: https://blog.csdn.net/m0_59235245/article/details/162560472
- 作者: m0_59235245
- 分类标签:
多模态VLMQwen2.5-VLKimi-VL端侧部署选型指南 - 工程价值: ⭐⭐⭐⭐
- 核心内容摘要:
- 旗舰级:Kimi-VL-A3B-Thinking(MoE 28B活跃参数,支持长视频/PDF/屏幕截图)
- 中坚级:Qwen2.5 VL(消费级显卡可跑)
- 端侧:手机部署 VLM 方案
- 选型指南和避坑建议
- 复现价值: 中。偏选型分析,代码较少
- 可信度评估: 中高。2026年最新榜单对比
- 后续行动: 纳入"多模态模型选型"主题页
二、分类标签汇总
| 标签 | 出现次数 | 代表条目 |
|---|---|---|
LLM微调 |
4 | QLoRA+DeepSpeed, LLaMA-Factory, 微调技术完全指南 |
vLLM |
3 | 推理引擎对比, vLLM-Ascend |
RAG |
3 | 检索增强生成实战, LangChain4j, RAG评测 |
DeepSpeed |
3 | ZeRO, Z3配置, 多GPU微调 |
MLOps |
2 | MLOps实战指南, 机器学习系统监控 |
Agent |
2 | LangChain Agent, 多智能体 |
多模态 |
2 | VLM选型, MLLM技术发展 |
量化 |
1 | vLLM量化技术全解析 |
LangChain4j |
1 | SpringBoot+RAG |
三、建议写入路径
写入文件: /shared/research-kb/inbox/jay/2026-08-08-csdn-llm-rag-mlops.md
草稿状态: ✅ 草稿已完成,待审稿后推送 review
四、精读/审稿/主题页更新建议
🔍 待精读(需核验论文/代码)
- DeepSeek-R1 GRPO 推理涌现 → 核验 arXiv:2501.12948
- vLLM PagedAttention 源码级原理 → 核验 vLLM 官方 GitHub
- LLaMA-Factory QLoRA 实测数据 → 核验 GitHub README benchmark
📝 待审稿
- 大模型微调技术完全指南(对齐方法演进部分)
- 推理引擎使用与实践(三引擎对比数据)
🗂️ 建议主题页更新
- 新建「LLM微调与显存优化」主题页(含 QLoRA/ZeRO/DekoSpeed)
- 更新「RAG系统设计」主题页(补充 DSPy 和 RAGAS 评测)
- 更新「推理引擎选型」主题页(vLLM vs DeepSpeed vs TensorRT)
五、Substack 线索记录(待后续跟进)
本轮 CSDN 检索中未发现 Substack 原文,但以下主题值得在 Substack 检索中跟进: - DeepSeek-R1 GRPO 原理(可能见于 Substack AI research newsletter) - LLMOps / 推理监控(LangSmith / Langfuse 实践) - Agentic RAG 前沿(Multi-Agent RAG 架构)
本条草稿由 Jay 实例自动生成 · 2026-08-08 · 请勿直接提交 GitHub