CSDN 高价值技术分享 · 2026-10-01 · Jay
主题
本地部署框架(vLLM/Ollama)实测对比、LoRA/QLoRA 微调工程实践、Dify 2026 微调框架、Substack AI Agent Stack 2026
检索范围
- CSDN(blog.csdn.net / opc.csdn.net)
- Substack(AI Agent Stack、RAG/LLM systems)
- 学术平台辅助参考
一、CSDN 高价值条目
🔴 高价值 A 类(可直接复用/复现)
1. DeepSeek 本地部署 + API 调用实战:从 Ollama 到 vLLM,我踩过的坑全在这
- 链接:
https://blog.csdn.net/baidu_32885171/article/details/159783743 - 作者:baidu_32885171 | 发布:2026-04-03 | 阅读:597
- 评分:⭐⭐⭐⭐⭐
- 工程价值:
- 两台机器(CPUonly + RTX 4090)完整实测数据
- Ollama vs vLLM 并发性能对比:RTX 4090 上 vLLM 处理 20 并发 vs Ollama 5 并发即瓶颈
- R1 1.5B~32B 各版本显存/内存/tokens/s 实测表
- 踩坑:DeepSeek-R1 蒸馏版不支持 Function Call,只能用 V3(deepseek-chat);R1 是 reasoning 模型
- 完整 API 调用代码(OpenAI 兼容格式)
- 版本信息:Ollama 最新版、vLLM、DeepSeek-V3/R1(2025-03)
- 复现价值:高。提供 docker-compose.yml、vLLM 启动命令、并发测试方法
- 标签:
vLLMOllamaDeepSeek本地部署API并发性能FunctionCall - 建议分类:
inference-engineeringproductionllmops
2. 大模型本地部署全攻略:VLLM 与 Ollama 实战指南,从入门到生产环境
- 链接:
https://blog.csdn.net/Trb701012/article/details/157362251 - 作者:Trb701012 | 发布:2026 | 阅读:高
- 评分:⭐⭐⭐⭐
- 工程价值:
- vLLM 常用参数详解表:
--gpu-memory-utilization(0.8-0.95)、--tensor-parallel-size、多卡配置 - 4×GPU Qwen3-32B 负载均衡配置示例
- Ollama Windows 安装 + 图形界面说明
- OpenAI 兼容 API 调用 Python 代码
- 量化科普:Ollama 模型大小仅原始 30%(GGUF 量化)
- 版本信息:vLLM、Ollama(2026)、Qwen3/Qwen3-4B
- 复现价值:高。vLLM serve 命令、参数表、Nginx 负载均衡方案
- 标签:
vLLMOllama量化GGUFQwen3生产环境多GPU - 建议分类:
inference-engineeringproductionllmops
3. 【Dify 2026 微调实战白皮书】LoRA + QLoRA + Adapter 三模协同
- 链接:
https://blog.csdn.net/CompiLume/article/details/160335261 - 作者:CompiLume | 发布:2026
- 评分:⭐⭐⭐⭐
- 工程价值:
- LoRA 数学建模:ΔW = A·B,r ≪ min(d,k),参数量 O(r(d+k)) vs 原始 O(d·k)
- LoRA 配置参数体系:
rank、alpha、dropout、target_modules - alpha/rank 比值敏感性实验:>2 时 F1 波动 ±3.2%
- QLoRA NF4 量化核心代码片段
- 多任务 LoRA 并行训练策略
- 版本信息:Dify 2026、peft 库、bitsandbytes
- 复现价值:中高。代码级实现,参数敏感性数据有参考价值
- 标签:
LoRAQLoRAAdapterDifyPEFT微调NF4量化 - 建议分类:
finetuningllmopsengineering
4. SFT 微调实战:LoRA / QLoRA / 全参微调对比
- 链接:
https://blog.csdn.net/m0_59235245/article/details/161752934 - 作者:m0_59235245 | 发布:2026
- 评分:⭐⭐⭐⭐
- 工程价值:
- 完整显存计算表:70B 模型全参 ~840GB vs QLoRA ~70GB(单卡可训)
- SFT loss 只计算"响应"部分 token,不计算"指令"部分
- 决策树:Prompt → RAG → SFT → RLHF(降维使用原则)
- LoRA 学习率 1e-4 ~ 3e-4(比全参高 10-20 倍)
- QLoRA paged_adamw_8bit 优化器配置
- 产物大小对比:全参 140GB vs LoRA/QLoRA 100-500MB
- 版本信息:Qwen3-7B、transformers、peft、bitsandbytes
- 复现价值:高。显存计算公式、三种方法完整对比表格
- 标签:
SFTLoRAQLoRA全参微调显存计算决策树 - 建议分类:
finetuningllmopsengineering
5. 微服务 RAG 重构:Nacos + RocketMQ + Milvus + Spring AI Alibaba
- 链接:
https://blog.csdn.net/xx_nm98/article/details/166492569 - 作者:xx_nm98 | 发布:2026-09-23 | 阅读:174
- 评分:⭐⭐⭐⭐
- 工程价值:
- OverAllState 状态管理设计
- 踩坑记录:
- ES Java Client
_source字段查询需用includes对象而非数组 - Rerank 降级:DashScope 异常时自动切换 RRF 融合排序
- 知识库重新导入时先删 Milvus+ES 数据防止重复
- ES Java Client
- 相关性阈值拦截(<0.15 触发拒答)
- 流式输出 SSE 实现方案
- 版本信息:Spring AI Alibaba、Milvus(推测 2.x/3.x)、ES Java Client
- 复现价值:中高。生产环境排障经验有直接参考价值
- 标签:
RAGMilvusSpringAI微服务生产环境排障 - 建议分类:
RAGproductionengineering
6. LangGraph 文档问答 RAG 的完整工程复盘
- 链接:
https://blog.csdn.net/ll1414277/article/details/164401474 - 作者:ll1414277 | 发布:2026
- 评分:⭐⭐⭐⭐
- 工程价值:
- langchain-milvus 0.4.0 + pymilvus 3.0.1 版本兼容性验证
- langchain_milvus.Milvus 建库/写入/检索全链路测试
- LangGraph ReAct 循环 + Milvus 向量库集成
- 版本信息:langchain-milvus 0.4.0、pymilvus 3.0.1、LangGraph
- 复现价值:高。版本兼容性是生产部署关键,该文提供实测验证
- 标签:
LangGraphLangChainMilvusRAG版本兼容性 - 建议分类:
RAGinference-engineeringproduction
🟡 中等价值 B 类(参考性条目)
7. 【2026最新版】Milvus 3.0 向量数据库:新特性深度解析 + RAG
- 链接:
https://blog.csdn.net/mashibingjiaoyu/article/details/163706206 - 评分:⭐⭐⭐
- 工程价值:Milvus 3.0 新特性解析 + RAG 集成,架构级升级说明
- 注意:需核实实际发布版本(Milvus 3.0 截至 2026-10 尚无官方发布,以官方为准)
8. RAG应用必备!10种向量数据库全解析
- 链接:
https://blog.csdn.net/m0_59163425/article/details/148499688 - 评分:⭐⭐⭐
- 工程价值:Milvus(28%)/pgvector(22%)/Qdrant(15%)使用率对比
- 标签:
向量数据库选型RAG
9. 大模型落地实战:深度解析 Transformers、vLLM、Ollama 等 6 大主流部署框架
- 链接:
https://blog.csdn.net/2401_85373396/article/details/159159650 - 评分:⭐⭐⭐
- 工程价值:6 种框架横向对比,含 Transformers pip install、TGI 部署命令
10. peft lora 微调代码解析,llama2-7b lora 微调实战
- 链接:
https://blog.csdn.net/weixin_45761030/article/details/140685452 - 评分:⭐⭐⭐
- 工程价值:peft 库源码解析,target_modules 定位逻辑,
ModuleNotFoundError降版本解决
二、Substack 来源
1. The AI Agents Stack: LLM to Production (2026 Edition)
- 链接:
https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 作者:The AI Engineer
- 可信度:高
- 核心观点:
- 2024 年 Memory = 向量数据库+RAG;2026 年 Memory 是三级架构原语(短期/中期/长期)
- Agent Guardrails vs LLM Guardrails:2024 年是输入/输出过滤,2026 年需覆盖工具授权、速率限制、实时行为约束
- 评测从最终答案扩展到整条轨迹(含选错工具、重复调用、越权尝试等)
- Zero Trust Agent 安全范式转变
- 后续行动:建议核验 Agent Guardrails 实现方案(MCP 工具授权部分),对比实际框架支持情况
- 标签:
AgentMemoryGuardrailsEvaluationProduction
2. The 2026 AI Agent Stack, Drawn from Scratch
- 链接:
https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from - 作者:Eric Roby / codingwithroby
- 可信度:中高
- 核心观点:
- 2026 年生产 Agent 罕见单模型路由:分类/调度用小模型,复杂推理用前沿模型,嵌入/评测用专用模型
- RouteLLM 研究:路由可显著降低成本同时保持质量
- Agent 中间步骤需要持久状态(跨步骤状态管理)
- 零信任认知边界:无边界时 LLM 会混淆内部完成度与外部状态转换
- 后续行动:验证 RouteLLM 路由效果,结合本知识库已有 vLLM 多模型路由实践
- 标签:
AgentModel-RoutingZero-TrustProduction
3. The Complete Guide to LLM Evaluation Tools in 2026
- 链接:
https://futureagi.substack.com/p/the-complete-guide-to-llm-evaluation - 作者:FutureAGI
- 可信度:中
- 核心观点:
- Arize AI(企业级 RAG 评测)、MLflow(开源统一评测)、Patronus AI(幻觉检测)
- Opik by Comet(异步日志、低延迟)
- RAG 评测指标体系
- 后续行动:对比本知识库已有评测工具建议(LangSmith、RAGAS),补充 Patronus AI
- 标签:
EvaluationRAGMLflowPatronus-AIObservability
4. LLM Evaluation: Frameworks, Metrics, and Best Practices (2026 Edition)
- 链接:
https://futureagi.substack.com/p/llm-evaluation-frameworks-metrics - 作者:FutureAGI(同一来源)
- 可信度:中
- 核心观点:组件级评测 vs 端到端评测区分,多轮对话 vs 单轮评测差异
- 标签:
EvaluationMetricsRAGAgent
三、分类标签体系(本轮新增/确认)
| 维度 | 标签 | 说明 |
|---|---|---|
| 主题 | inference-engineering |
推理引擎部署/优化 |
| 主题 | finetuning |
SFT/LoRA/QLoRA 微调 |
| 主题 | RAG |
检索增强生成 |
| 主题 | production |
生产环境实战 |
| 主题 | llmops |
LLM 工程化运维 |
| 主题 | Agent |
Agent 系统 |
| 主题 | Guardrails |
安全护栏/评测 |
| 来源 | CSDN |
CSDN 高价值文章 |
| 来源 | Substack |
Substack 技术 newsletter |
| 工程价值 | 排障 |
含真实错误/异常处理 |
| 工程价值 | 实测数据 |
含 Benchmark 数据 |
四、建议写入路径
/shared/research-kb/inbox/jay/2026-10-01-csdn-vllm-ollama-lora-dify-substack-highvalue.md
(已写入)
五、后续行动建议
- 精读:《DeepSeek 本地部署+API 调用实战》完整实测数据,特别是 R1 Function Call 踩坑记录,可纳入推理引擎选型 SOP
- 审稿:《SFT 微调实战:LoRA/QLoRA/全参对比》显存计算表,可作为本知识库微调选型标准
- 主题页更新:
inference-engineering页补充 Ollama vs vLLM 并发性能对比表(来自条目 1) - 核验:《Dify 2026 微调白皮书》alpha/rank 比值实验数据,建议在 QLoRA 调参实践中验证
六、可复制草稿
如本轮未写入文件,直接输出以下内容:
# 2026-10-01 CSDN 高价值技术分享 · Jay
## 高价值条目
1. DeepSeek 本地部署实测(Ollama vs vLLM 并发对比,R1 FunctionCall 踩坑)
2. vLLM+Ollama 生产部署指南(参数详解 + 多 GPU 配置)
3. Dify 2026 LoRA+QLoRA+Adapter 三模微调白皮书
4. SFT 完整对比(LoRA/QLoRA/全参显存计算表)
5. 微服务 RAG 生产排障(Milvus+SpringAI)
6. LangGraph+Milvus 版本兼容性验证
## Substack
- The AI Agents Stack 2026(Memory 三级架构、Guardrails 演进)
- 2026 AI Agent Stack(多模型路由、Zero Trust Agent)
## 标签
`inference-engineering` `finetuning` `RAG` `production` `llmops` `Agent`