CSDN 高价值技术分享 · 2026-10-01 · Jay

主题

本地部署框架(vLLM/Ollama)实测对比、LoRA/QLoRA 微调工程实践、Dify 2026 微调框架、Substack AI Agent Stack 2026

检索范围

  • CSDN(blog.csdn.net / opc.csdn.net)
  • Substack(AI Agent Stack、RAG/LLM systems)
  • 学术平台辅助参考

一、CSDN 高价值条目

🔴 高价值 A 类(可直接复用/复现)

1. DeepSeek 本地部署 + API 调用实战:从 Ollama 到 vLLM,我踩过的坑全在这

  • 链接:https://blog.csdn.net/baidu_32885171/article/details/159783743
  • 作者:baidu_32885171 | 发布:2026-04-03 | 阅读:597
  • 评分:⭐⭐⭐⭐⭐
  • 工程价值:
  • 两台机器(CPUonly + RTX 4090)完整实测数据
  • Ollama vs vLLM 并发性能对比:RTX 4090 上 vLLM 处理 20 并发 vs Ollama 5 并发即瓶颈
  • R1 1.5B~32B 各版本显存/内存/tokens/s 实测表
  • 踩坑:DeepSeek-R1 蒸馏版不支持 Function Call,只能用 V3(deepseek-chat);R1 是 reasoning 模型
  • 完整 API 调用代码(OpenAI 兼容格式)
  • 版本信息:Ollama 最新版、vLLM、DeepSeek-V3/R1(2025-03)
  • 复现价值:高。提供 docker-compose.yml、vLLM 启动命令、并发测试方法
  • 标签:vLLM Ollama DeepSeek 本地部署 API 并发性能 FunctionCall
  • 建议分类:inference-engineering production llmops

2. 大模型本地部署全攻略:VLLM 与 Ollama 实战指南,从入门到生产环境

  • 链接:https://blog.csdn.net/Trb701012/article/details/157362251
  • 作者:Trb701012 | 发布:2026 | 阅读:高
  • 评分:⭐⭐⭐⭐
  • 工程价值:
  • vLLM 常用参数详解表:--gpu-memory-utilization(0.8-0.95)、--tensor-parallel-size、多卡配置
  • 4×GPU Qwen3-32B 负载均衡配置示例
  • Ollama Windows 安装 + 图形界面说明
  • OpenAI 兼容 API 调用 Python 代码
  • 量化科普:Ollama 模型大小仅原始 30%(GGUF 量化)
  • 版本信息:vLLM、Ollama(2026)、Qwen3/Qwen3-4B
  • 复现价值:高。vLLM serve 命令、参数表、Nginx 负载均衡方案
  • 标签:vLLM Ollama 量化 GGUF Qwen3 生产环境 多GPU
  • 建议分类:inference-engineering production llmops

3. 【Dify 2026 微调实战白皮书】LoRA + QLoRA + Adapter 三模协同

  • 链接:https://blog.csdn.net/CompiLume/article/details/160335261
  • 作者:CompiLume | 发布:2026
  • 评分:⭐⭐⭐⭐
  • 工程价值:
  • LoRA 数学建模:ΔW = A·B,r ≪ min(d,k),参数量 O(r(d+k)) vs 原始 O(d·k)
  • LoRA 配置参数体系:rank、alpha、dropout、target_modules
  • alpha/rank 比值敏感性实验:>2 时 F1 波动 ±3.2%
  • QLoRA NF4 量化核心代码片段
  • 多任务 LoRA 并行训练策略
  • 版本信息:Dify 2026、peft 库、bitsandbytes
  • 复现价值:中高。代码级实现,参数敏感性数据有参考价值
  • 标签:LoRA QLoRA Adapter Dify PEFT 微调 NF4量化
  • 建议分类:finetuning llmops engineering

4. SFT 微调实战:LoRA / QLoRA / 全参微调对比

  • 链接:https://blog.csdn.net/m0_59235245/article/details/161752934
  • 作者:m0_59235245 | 发布:2026
  • 评分:⭐⭐⭐⭐
  • 工程价值:
  • 完整显存计算表:70B 模型全参 ~840GB vs QLoRA ~70GB(单卡可训)
  • SFT loss 只计算"响应"部分 token,不计算"指令"部分
  • 决策树:Prompt → RAG → SFT → RLHF(降维使用原则)
  • LoRA 学习率 1e-4 ~ 3e-4(比全参高 10-20 倍)
  • QLoRA paged_adamw_8bit 优化器配置
  • 产物大小对比:全参 140GB vs LoRA/QLoRA 100-500MB
  • 版本信息:Qwen3-7B、transformers、peft、bitsandbytes
  • 复现价值:高。显存计算公式、三种方法完整对比表格
  • 标签:SFT LoRA QLoRA 全参微调 显存计算 决策树
  • 建议分类:finetuning llmops engineering

5. 微服务 RAG 重构:Nacos + RocketMQ + Milvus + Spring AI Alibaba

  • 链接:https://blog.csdn.net/xx_nm98/article/details/166492569
  • 作者:xx_nm98 | 发布:2026-09-23 | 阅读:174
  • 评分:⭐⭐⭐⭐
  • 工程价值:
  • OverAllState 状态管理设计
  • 踩坑记录:
    • ES Java Client _source 字段查询需用 includes 对象而非数组
    • Rerank 降级:DashScope 异常时自动切换 RRF 融合排序
    • 知识库重新导入时先删 Milvus+ES 数据防止重复
  • 相关性阈值拦截(<0.15 触发拒答)
  • 流式输出 SSE 实现方案
  • 版本信息:Spring AI Alibaba、Milvus(推测 2.x/3.x)、ES Java Client
  • 复现价值:中高。生产环境排障经验有直接参考价值
  • 标签:RAG Milvus SpringAI 微服务 生产环境 排障
  • 建议分类:RAG production engineering

6. LangGraph 文档问答 RAG 的完整工程复盘

  • 链接:https://blog.csdn.net/ll1414277/article/details/164401474
  • 作者:ll1414277 | 发布:2026
  • 评分:⭐⭐⭐⭐
  • 工程价值:
  • langchain-milvus 0.4.0 + pymilvus 3.0.1 版本兼容性验证
  • langchain_milvus.Milvus 建库/写入/检索全链路测试
  • LangGraph ReAct 循环 + Milvus 向量库集成
  • 版本信息:langchain-milvus 0.4.0、pymilvus 3.0.1、LangGraph
  • 复现价值:高。版本兼容性是生产部署关键,该文提供实测验证
  • 标签:LangGraph LangChain Milvus RAG 版本兼容性
  • 建议分类:RAG inference-engineering production

🟡 中等价值 B 类(参考性条目)

7. 【2026最新版】Milvus 3.0 向量数据库:新特性深度解析 + RAG

  • 链接:https://blog.csdn.net/mashibingjiaoyu/article/details/163706206
  • 评分:⭐⭐⭐
  • 工程价值:Milvus 3.0 新特性解析 + RAG 集成,架构级升级说明
  • 注意:需核实实际发布版本(Milvus 3.0 截至 2026-10 尚无官方发布,以官方为准)

8. RAG应用必备!10种向量数据库全解析

  • 链接:https://blog.csdn.net/m0_59163425/article/details/148499688
  • 评分:⭐⭐⭐
  • 工程价值:Milvus(28%)/pgvector(22%)/Qdrant(15%)使用率对比
  • 标签:向量数据库 选型 RAG

9. 大模型落地实战:深度解析 Transformers、vLLM、Ollama 等 6 大主流部署框架

  • 链接:https://blog.csdn.net/2401_85373396/article/details/159159650
  • 评分:⭐⭐⭐
  • 工程价值:6 种框架横向对比,含 Transformers pip install、TGI 部署命令

10. peft lora 微调代码解析,llama2-7b lora 微调实战

  • 链接:https://blog.csdn.net/weixin_45761030/article/details/140685452
  • 评分:⭐⭐⭐
  • 工程价值:peft 库源码解析,target_modules 定位逻辑,ModuleNotFoundError 降版本解决

二、Substack 来源

1. The AI Agents Stack: LLM to Production (2026 Edition)

  • 链接:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 作者:The AI Engineer
  • 可信度:高
  • 核心观点:
  • 2024 年 Memory = 向量数据库+RAG;2026 年 Memory 是三级架构原语(短期/中期/长期)
  • Agent Guardrails vs LLM Guardrails:2024 年是输入/输出过滤,2026 年需覆盖工具授权、速率限制、实时行为约束
  • 评测从最终答案扩展到整条轨迹(含选错工具、重复调用、越权尝试等)
  • Zero Trust Agent 安全范式转变
  • 后续行动:建议核验 Agent Guardrails 实现方案(MCP 工具授权部分),对比实际框架支持情况
  • 标签:Agent Memory Guardrails Evaluation Production

2. The 2026 AI Agent Stack, Drawn from Scratch

  • 链接:https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
  • 作者:Eric Roby / codingwithroby
  • 可信度:中高
  • 核心观点:
  • 2026 年生产 Agent 罕见单模型路由:分类/调度用小模型,复杂推理用前沿模型,嵌入/评测用专用模型
  • RouteLLM 研究:路由可显著降低成本同时保持质量
  • Agent 中间步骤需要持久状态(跨步骤状态管理)
  • 零信任认知边界:无边界时 LLM 会混淆内部完成度与外部状态转换
  • 后续行动:验证 RouteLLM 路由效果,结合本知识库已有 vLLM 多模型路由实践
  • 标签:Agent Model-Routing Zero-Trust Production

3. The Complete Guide to LLM Evaluation Tools in 2026

  • 链接:https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation
  • 作者:FutureAGI
  • 可信度:中
  • 核心观点:
  • Arize AI(企业级 RAG 评测)、MLflow(开源统一评测)、Patronus AI(幻觉检测)
  • Opik by Comet(异步日志、低延迟)
  • RAG 评测指标体系
  • 后续行动:对比本知识库已有评测工具建议(LangSmith、RAGAS),补充 Patronus AI
  • 标签:Evaluation RAG MLflow Patronus-AI Observability

4. LLM Evaluation: Frameworks, Metrics, and Best Practices (2026 Edition)

  • 链接:https://futureagi.substack.com/p/llm-evaluation-frameworks-metrics
  • 作者:FutureAGI(同一来源)
  • 可信度:中
  • 核心观点:组件级评测 vs 端到端评测区分,多轮对话 vs 单轮评测差异
  • 标签:Evaluation Metrics RAG Agent

三、分类标签体系(本轮新增/确认)

维度 标签 说明
主题 inference-engineering 推理引擎部署/优化
主题 finetuning SFT/LoRA/QLoRA 微调
主题 RAG 检索增强生成
主题 production 生产环境实战
主题 llmops LLM 工程化运维
主题 Agent Agent 系统
主题 Guardrails 安全护栏/评测
来源 CSDN CSDN 高价值文章
来源 Substack Substack 技术 newsletter
工程价值 排障 含真实错误/异常处理
工程价值 实测数据 含 Benchmark 数据

四、建议写入路径

/shared/research-kb/inbox/jay/2026-10-01-csdn-vllm-ollama-lora-dify-substack-highvalue.md

(已写入)


五、后续行动建议

  1. 精读:《DeepSeek 本地部署+API 调用实战》完整实测数据,特别是 R1 Function Call 踩坑记录,可纳入推理引擎选型 SOP
  2. 审稿:《SFT 微调实战:LoRA/QLoRA/全参对比》显存计算表,可作为本知识库微调选型标准
  3. 主题页更新:inference-engineering 页补充 Ollama vs vLLM 并发性能对比表(来自条目 1)
  4. 核验:《Dify 2026 微调白皮书》alpha/rank 比值实验数据,建议在 QLoRA 调参实践中验证

六、可复制草稿

如本轮未写入文件,直接输出以下内容:

# 2026-10-01 CSDN 高价值技术分享 · Jay

## 高价值条目
1. DeepSeek 本地部署实测(Ollama vs vLLM 并发对比,R1 FunctionCall 踩坑)
2. vLLM+Ollama 生产部署指南(参数详解 + 多 GPU 配置)
3. Dify 2026 LoRA+QLoRA+Adapter 三模微调白皮书
4. SFT 完整对比(LoRA/QLoRA/全参显存计算表)
5. 微服务 RAG 生产排障(Milvus+SpringAI)
6. LangGraph+Milvus 版本兼容性验证

## Substack
- The AI Agents Stack 2026(Memory 三级架构、Guardrails 演进)
- 2026 AI Agent Stack(多模型路由、Zero Trust Agent)

## 标签
`inference-engineering` `finetuning` `RAG` `production` `llmops` `Agent`