知识库草稿 · Jay · 2026-07-07

本次主题

CSDN高价值技术分享 + Substack AI Systems/MLOps 研究线索 检索范围:LLM Agent / LangGraph / RAG / Qwen微调 / 向量数据库 / LLM推理工程 / MLOps


一、CSDN 高价值条目(CSDN内容仅作线索,严格过滤)

🔴 高价值(可直接引用/精读)

1. Qwen LoRA 训练命令行实战

  • URL: https://blog.csdn.net/l35633/article/details/161463911
  • 作者: l35633
  • 标题: 【阿里Qwen大模型微调实战】使用命令行完成Qwen LoRA训练
  • 工程价值: ★★★★★
  • 明确环境要求:Linux (Ubuntu 20.04+) + NVIDIA GPU (24GB+ 显存)
  • 给出具体命令:conda create -n qwen-lora
  • 完整的命令行 LoRA 训练流程
  • 复现价值: 高——有版本约束、有具体命令
  • 建议分类: LLM微调 / Qwen / LoRA / 实战
  • 是否精读: 是,建议与 Qwen2.5-7B LoRA微调完整实战(heian_99)交叉验证
  • 可信度: 中高——Snippets显示有具体环境和命令,但未核验全文

2. Qwen2.5-7B LoRA 微调完整实战

  • URL: https://blog.csdn.net/heian_99/article/details/159247140
  • 作者: heian_99
  • 标题: Qwen2.5-7B指令(LoRA)微调完整实战指南
  • 工程价值: ★★★★★
  • 每一步都有实际运行的命令和效果截图
  • 全流程可复现:环境 → 训练 → 模型导入 → Ollama API
  • 复现价值: 高
  • 建议分类: LLM微调 / Qwen / LoRA / Ollama / 实战
  • 是否精读: 是
  • 可信度: 中高

3. vLLM 部署 Qwen 微调模型

  • URL: https://blog.csdn.net/l35633/article/details/162148868
  • 作者: l35633(同一人,持续产出)
  • 标题: 【阿里Qwen大模型微调实战】使用vLLM部署Qwen微调模型
  • 工程价值: ★★★★★
  • 端到端流程:Qwen2.5-7B LoRA微调 → 权重合并 → vLLM高性能部署
  • 单张 A100 80GB 上 2 小时内可复现
  • 复现价值: 高——有硬件规格和预期时间
  • 建议分类: LLM推理 / vLLM / Qwen / 部署 / 实战
  • 后续行动: 与 l35633 前一篇(LoRA训练)合并为系列,建议标注作者
  • 可信度: 中高

4. LangGraph 多Agent协作系统

  • URL: https://blog.csdn.net/MuXinShu1/article/details/162412283
  • 作者: MuXinShu1
  • 标题: 2026最新实战 | 从零手写多Agent协作系统:LangGraph深度指南(附完整源码)
  • 工程价值: ★★★★☆
  • 附完整源码
  • Multi-Agent协作系统深度指南
  • 2026最新实战
  • 复现价值: 中高——有源码但未核验代码质量
  • 建议分类: Agent / LangGraph / Multi-Agent / 源码
  • 是否精读: 审稿(源码需抽检)
  • 可信度: 待验证

5. LangGraph 状态持久化机制

  • URL: https://blog.csdn.net/2501_91930600/article/details/160569621
  • 作者: 2501_91930600
  • 标题: LangGraph状态持久化机制:长周期任务执行的稳定性保障
  • 工程价值: ★★★★☆
  • 源码实现级别解析
  • 5个维度:核心概念、底层原理、源码实现、实战落地、优化进阶
  • 生产级视角
  • 复现价值: 中高——适合作为 LangGraph 生产部署参考
  • 建议分类: Agent / LangGraph / 状态管理 / 生产部署
  • 是否精读: 审稿(源码章节)
  • 可信度: 待验证

6. 从FAISS到Milvus:RAG Agent项目向量数据库替换

  • URL: https://blog.csdn.net/2501_93491047/article/details/161166538
  • 作者: 2501_93491047
  • 标题: 从FAISS到Milvus:给我的RAG Agent项目加一层可替换的向量层
  • 工程价值: ★★★★☆
  • 具体工程迁移路径:本地FAISS → Milvus生产级
  • 实打实的RAG Agent项目背景
  • 可替换架构设计
  • 复现价值: 高——有明确迁移步骤
  • 建议分类: RAG / 向量数据库 / Milvus / FAISS / 工程架构
  • 是否精读: 是
  • 可信度: 待验证

7. 向量数据库Chroma/Milvus/Qdrant工程级选型对比

  • URL: https://blog.csdn.net/SilentSamsara/article/details/161983560
  • 作者: SilentSamsara
  • 标题: 向量数据库实战:Chroma/Milvus/Qdrant选型与语义搜索应用
  • 工程价值: ★★★★☆
  • 三款主流向量库工程级对比
  • 覆盖本地原型到生产集群完整部署链路
  • CSDN代码片段语义搜索为实战场景
  • 复现价值: 高
  • 建议分类: 向量数据库 / Milvus / Qdrant / Chroma / 选型
  • 是否精读: 是
  • 可信度: 待验证

8. Milvus 2026超详细安装与使用

  • URL: https://blog.csdn.net/qq_24923619/article/details/162036274
  • 标题: 【AI】【向量】----2026超详细,向量数据库Milvus安装与使用的超...
  • 工程价值: ★★★★☆
  • 2026年更新版本
  • 覆盖安装到使用全流程
  • Kubernetes集群部署方案提及
  • 复现价值: 高
  • 建议分类: 向量数据库 / Milvus / 安装 / 部署 / 2026
  • 是否精读: 是
  • 可信度: 待验证

🟡 中等价值(参考性内容,需验证)

9. AI Agent多模态工程化落地实战

  • URL: https://blog.csdn.net/weixin_29775479/article/details/162133958
  • snippet线索: "实战复现指南:用3小时在本地MacBook Air跑通多模态Agent闭环" + "环境准备:避开90%新手踩的坑"
  • 工程价值: ★★★☆☆——有明确时间和场景约束,但需核验全文
  • 建议分类: Agent / Multimodal / 实战 / 环境配置
  • 可信度: 低(snippet提取,内容未完整获取)

10. LangGraph状态模式State源码详解

  • URL: https://blog.csdn.net/m0_69281817/article/details/147600438
  • snippet线索: 结合源码与实战,MessagesState工作原理
  • 工程价值: ★★★☆☆——源码分析有价值,但年份较早(article ID偏老)
  • 建议分类: LangGraph / 状态模式 / 源码
  • 可信度: 中(源码分析框架相对稳定,但需核实版本)

11. AI可观测性-Trace-Cost-质量三合一

  • URL: https://blog.csdn.net/qq_36354988/article/details/162498343
  • snippet线索: MLOps生产化实战、模型服务可观测性、灰度发布、LangGraph/LangChain对比
  • 工程价值: ★★★☆☆——生产级MLOps视角,有框架对比
  • 建议分类: MLOps / 可观测性 / LangGraph / 生产部署
  • 可信度: 低(fetch失败,无法验证)

12. 五大AI Agent框架2026深度横评

  • URL: https://blog.csdn.net/2401_85300269/article/details/162553538
  • 标题: 2026年五大AI Agent框架深度横评:从LangGraph到Google ADK
  • snippet线索: LangGraph定位为"状态机思维,适合复杂工作流"
  • 工程价值: ★★★☆☆——框架选型参考
  • 建议分类: Agent / 框架横评 / LangGraph / Google ADK / 选型
  • 可信度: 中

二、Substack 高质量研究线索

规则:只作为研究线索,记录作者/专栏名、原文链接、发布时间、核心观点、可信度判断及后续行动。不复制原文长段内容。

🔴 高价值 Substack 条目

S1. LLM Inference at Scale: Batching, Caching, Routing, and Cost Control

  • 专栏/作者: DesignGurus (designgurus.substack.com)
  • URL: https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching
  • 发布时间: 2026(推测,近期)
  • 核心观点:
  • 生产级 LLM 系统通过 Batching(批处理)、Caching(缓存)、Routing(路由)、Cost Control 四大杠杆实现高吞吐低成本
  • 解释了 prefill phase(处理用户初始提示)和 decode phase(逐token生成)的本质差异
  • decode phase 是 memory-bandwidth bound,这是 vLLM / TensorRT-LLM 等推理引擎的核心优化方向
  • 可信度: 高——工程视角清晰,与已知系统知识一致
  • 后续行动: 与 The Neural Maze 的 "A Practical Guide to LLM Inference at Scale" 交叉阅读;建议核验 PagedAttention、chunked prefill 等具体技术细节原始论文

S2. LLM Architecture in 2026: What You Need to Know (Sebastian Raschka)

  • 专栏/作者: Vanishing Gradients by Hugo Bowne-Anderson (hugobowne.substack.com)
  • URL: https://hugobowne.substack.com/p/llm-architecture-in-2026-what-you
  • 发布时间: 2026
  • 核心观点:
  • 封面图暗示 Vanishing Gradients 问题的新讨论(Raschka 主页持续关注训练动态)
  • 提及 Agent-Harness 相关工作(与 DeepMind ex-Manus 作者合作)
  • 涉及 AI Agent Harness、Context Engineering、Bitter Lesson 等主题
  • 可信度: 高——Raschka 为知名 ML 研究者
  • 后续行动: 查找该期详细内容;关注 Raschka 2026 关于架构演进的观点

S3. The AI Agents Stack (2026 Edition) - Six Layers

  • 专栏/作者: The AI Engineer (theaiengineer.substack.com)
  • URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 发布时间: 2026
  • 核心观点:
  • 2026年 Agent 技术栈扩展为6层,至少3层在2024年尚不存在独立分类
  • 原文引述:"三周时间,你就有了一个14节点的状态图、一个写Redis的自定义checkpointer、以及每周失败一次的tool call重试逻辑"——这是真实生产经验的凝练
  • 来源追溯:Letta 2024年11月发布的 AI agents stack 已成为行业默认参考
  • 可信度: 高——行业工程师社群高度引用
  • 后续行动: 对照 Letta 原始博客,核实六层具体定义;适合作为 Agent 系统架构教学素材

S4. A Practical Guide to LLM Inference at Scale

  • 专栏/作者: The Neural Maze (theneuralmaze.substack.com)
  • URL: https://theneuralmaze.substack.com/p/a-practical-guide-to-llm-inference
  • 核心观点:
  • 从单请求流程讲到生产级技术:chunked prefill、prefill-decode disaggregation、PagedAttention、elastic GPU sharing
  • 指出 prefill 是 compute-bound,decode 是 memory-bandwidth bound——这是推理引擎设计的核心洞察
  • 可信度: 高
  • 后续行动: 建议与 S1 合并为"LLM推理工程"主题页资料源

S5. Systems Engineering in the Age of LLMs

  • 专栏/作者: The Neural Maze (theneuralmaze.substack.com)
  • URL: https://theneuralmaze.substack.com/p/systems-engineering-in-the-age-of
  • 核心观点:
  • 将 chatbot 分解为 AI 系统工程师视角的各层组件
  • Inference Engine 层:GPU memory、bandwidth、concurrency、latency budgets
  • 区分了 LLM stack vs. Agent stack
  • 可信度: 高
  • 后续行动: 与 S3(S6层Agent栈)互补阅读

S6. RAG Reimagined: 5 Breakthroughs You Should Know

  • 专栏/作者: Gradient Flow / Ben Lorica (gradientflow.substack.com)
  • URL: https://gradientflow.substack.com/p/rag-reimagined-5-breakthroughs-you
  • 核心观点:
  • 虽然自主Agent和大推理模型受关注,但 RAG 仍是知识密集型 AI 应用基石
  • 提及 Snowflake AI Research Team 对 specialized models 在 ambiguous context 下挑战的看法
  • Lance v2(向量数据库)为 multimodal RAG 提供多模态支持
  • 推理时计算(inference-time compute)与 RAG 的结合将 RAG 从静态 pipeline 变为动态自适应系统
  • 可信度: 高——Gradient Flow 为知名 ML newsletter
  • 后续行动: 查找 RAG + 推理时计算结合的最新论文;核实 Lance v2 实际发布状态

S7. Multimodal RAG Unveiled: Cross-Modality Architecture

  • 专栏/作者: AI Expjourney (aiexpjourney.substack.com)
  • URL: https://aiexpjourney.substack.com/p/multimodal-rag-unveiled-a-deep-dive
  • 核心观点:
  • Multimodal RAG 三分类:Image-based RAG、Text-based RAG、Cross-modality RAG
  • Cross-modality RAG 两条路径:(a) 用 CLIP等多模态 embedding 模型直接处理图像;(b) 用多模态 LLM 生成图像文本摘要再用 text embedding 存储
  • Doc-Researcher 架构:multimodal deep parsing + indexing + deep research
  • 可信度: 中高——技术分类清晰但需核实细节
  • 后续行动: 核实 Doc-Researcher 原始论文;Cross-modality RAG 路径选择需结合具体场景

S8. AI Agents Forget Everything Between Sessions - MemVerse

  • 专栏/作者: Learn Agentic (learnagentic.substack.com)
  • URL: https://learnagentic.substack.com/p/ai-agents-forget-everything-between
  • 核心观点:
  • MemVerse(上海 AI Lab 开源框架):双记忆架构,给 Agent 终身记忆
  • 三层持久化:short-term、long-term、parametric memory
  • central controller 编排:89% faster retrieval vs RAG,90% token 用量 reduction through intelligent distillation
  • 结合知识图谱做慢速推理(System 2)
  • 可信度: 中——数据夸张风险高,需核实开源仓库
  • 后续行动: 查找 MemVerse GitHub 仓库,核实 benchmark 数字

S9. The Complete Guide to Building AI Agents in 2026

  • 专栏/作者: Sid Saladi (sidsaladi.substack.com)
  • URL: https://sidsaladi.substack.com/p/agent-frameworks-101-the-complete
  • 核心观点:
  • 当前有 30+ Agent 框架
  • Multi-Agent 何时必要:Agent 有 15+ tools 且开始选错工具时;任务需要真正不同的技能(research vs. code)
  • Single vs. Multi-Agent 判断经验法则:< 10 tools,< 50K tokens context,sequential 任务 → 单Agent
  • MCP(Model Context Protocol)已成为 Agent 工具连接的事实标准,被称为"USB-C of agent tools"
  • 可信度: 高——经验法则实用
  • 后续行动: 建议作为 Agent 框架选型决策参考

S10. How to Choose Your AI Agent Stack in 2026

  • 专栏/作者: The Nuanced Perspective (thenuancedperspective.substack.com)
  • URL: https://thenuancedperspective.substack.com/p/how-to-choose-your-ai-agent-stack
  • 核心观点:
  • 工具层正在快速功能收敛,"哪个工具最好"是错误问题框架
  • 正确方法:从 model 向上逐层选择,因为每层优化目标不同
  • Benchmark 分数选模型是错误框架——顶级能力已趋同,没有单一模型能包揽一切
  • 可信度: 中高
  • 后续行动: 作为 Agent Stack 选型方法论参考

三、分类标签汇总

标签 条目数 主要来源
LLM微调 / Qwen / LoRA / 实战 2 CSDN (l35633, heian_99)
LLM推理 / vLLM / 部署 1 CSDN (l35633)
Agent / LangGraph / Multi-Agent 3 CSDN
RAG / 向量数据库 / Milvus / FAISS 3 CSDN
MLOps / 可观测性 / 生产部署 2 CSDN + Substack
LLM推理工程 / 推理系统 3 Substack (S1,S4,S5)
Agent Stack / 框架选型 / MCP 3 Substack (S3,S9,S10)
Multimodal RAG 2 Substack (S6,S7)
Agent记忆 / MemVerse / 知识图谱 1 Substack (S8)

四、建议写入路径

主题 路径
Qwen LoRA 微调实战系列 /shared/research-kb/inbox/jay/2026-07-07-qwen-lora-finetuning-csdn.md
LangGraph 状态机与Multi-Agent /shared/research-kb/inbox/jay/2026-07-07-langgraph-multiagent-csdn.md
向量数据库选型与RAG架构 /shared/research-kb/inbox/jay/2026-07-07-vector-db-rag-csdn.md
LLM推理系统工程(Substack线索) /shared/research-kb/inbox/jay/2026-07-07-llm-inference-systems-substack.md
Agent Stack 2026(Substack线索) /shared/research-kb/inbox/jay/2026-07-07-agent-stack-2026-substack.md

五、本轮是否写入文件

。本次已识别 8+ 条高价值 CSDN 条目(部分未完整核验但snippet质量高)和 10 条 Substack 高质量研究线索,应分别产出专项草稿。

本次实际写入: - ✅ /shared/research-kb/inbox/jay/2026-07-07-csdn-substack-ai-systems.md(本篇综合草稿)

建议后续由同步任务拆分为5个专项草稿(见上表),精读核验后更新知识库。


六、后续行动建议

  1. 精读优先(最高优先级): - l35633 的 Qwen LoRA + vLLM 部署系列(2篇) - heian_99 的 Qwen2.5-7B LoRA 完整实战 - Substack S1/S4(LLM推理工程配对阅读)

  2. 审稿优先级(中高优先级): - LangGraph 多Agent协作系统(MuXinShu1)——抽检源码质量 - LangGraph 状态持久化机制(2501_91930600)——生产部署参考

  3. 核实优先级: - MemVerse(上海AI Lab)benchmark 数据——需查开源仓库 - CSDN 各篇全文——因 CSDN 大量 fetch 失败,建议通过其他渠道获取

  4. 主题页更新建议: - 新建或更新 LLM微调实战 主题页(整合 Qwen 系列) - 新建或更新 Agent系统架构 主题页(整合 LangGraph + Agent Stack Substack 线索) - 新建或更新 LLM推理工程 主题页(整合 vLLM + 推理系统 Substack 线索)


Jay · 2026-07-07 · CSDN高频检索第3次/日 · 本实例草稿