知识库草稿 · Jay · 2026-07-07
本次主题
CSDN高价值技术分享 + Substack AI Systems/MLOps 研究线索 检索范围:LLM Agent / LangGraph / RAG / Qwen微调 / 向量数据库 / LLM推理工程 / MLOps
一、CSDN 高价值条目(CSDN内容仅作线索,严格过滤)
🔴 高价值(可直接引用/精读)
1. Qwen LoRA 训练命令行实战
- URL:
https://blog.csdn.net/l35633/article/details/161463911 - 作者: l35633
- 标题: 【阿里Qwen大模型微调实战】使用命令行完成Qwen LoRA训练
- 工程价值: ★★★★★
- 明确环境要求:Linux (Ubuntu 20.04+) + NVIDIA GPU (24GB+ 显存)
- 给出具体命令:
conda create -n qwen-lora - 完整的命令行 LoRA 训练流程
- 复现价值: 高——有版本约束、有具体命令
- 建议分类:
LLM微调 / Qwen / LoRA / 实战 - 是否精读: 是,建议与 Qwen2.5-7B LoRA微调完整实战(heian_99)交叉验证
- 可信度: 中高——Snippets显示有具体环境和命令,但未核验全文
2. Qwen2.5-7B LoRA 微调完整实战
- URL:
https://blog.csdn.net/heian_99/article/details/159247140 - 作者: heian_99
- 标题: Qwen2.5-7B指令(LoRA)微调完整实战指南
- 工程价值: ★★★★★
- 每一步都有实际运行的命令和效果截图
- 全流程可复现:环境 → 训练 → 模型导入 → Ollama API
- 复现价值: 高
- 建议分类:
LLM微调 / Qwen / LoRA / Ollama / 实战 - 是否精读: 是
- 可信度: 中高
3. vLLM 部署 Qwen 微调模型
- URL:
https://blog.csdn.net/l35633/article/details/162148868 - 作者: l35633(同一人,持续产出)
- 标题: 【阿里Qwen大模型微调实战】使用vLLM部署Qwen微调模型
- 工程价值: ★★★★★
- 端到端流程:Qwen2.5-7B LoRA微调 → 权重合并 → vLLM高性能部署
- 单张 A100 80GB 上 2 小时内可复现
- 复现价值: 高——有硬件规格和预期时间
- 建议分类:
LLM推理 / vLLM / Qwen / 部署 / 实战 - 后续行动: 与 l35633 前一篇(LoRA训练)合并为系列,建议标注作者
- 可信度: 中高
4. LangGraph 多Agent协作系统
- URL:
https://blog.csdn.net/MuXinShu1/article/details/162412283 - 作者: MuXinShu1
- 标题: 2026最新实战 | 从零手写多Agent协作系统:LangGraph深度指南(附完整源码)
- 工程价值: ★★★★☆
- 附完整源码
- Multi-Agent协作系统深度指南
- 2026最新实战
- 复现价值: 中高——有源码但未核验代码质量
- 建议分类:
Agent / LangGraph / Multi-Agent / 源码 - 是否精读: 审稿(源码需抽检)
- 可信度: 待验证
5. LangGraph 状态持久化机制
- URL:
https://blog.csdn.net/2501_91930600/article/details/160569621 - 作者: 2501_91930600
- 标题: LangGraph状态持久化机制:长周期任务执行的稳定性保障
- 工程价值: ★★★★☆
- 源码实现级别解析
- 5个维度:核心概念、底层原理、源码实现、实战落地、优化进阶
- 生产级视角
- 复现价值: 中高——适合作为 LangGraph 生产部署参考
- 建议分类:
Agent / LangGraph / 状态管理 / 生产部署 - 是否精读: 审稿(源码章节)
- 可信度: 待验证
6. 从FAISS到Milvus:RAG Agent项目向量数据库替换
- URL:
https://blog.csdn.net/2501_93491047/article/details/161166538 - 作者: 2501_93491047
- 标题: 从FAISS到Milvus:给我的RAG Agent项目加一层可替换的向量层
- 工程价值: ★★★★☆
- 具体工程迁移路径:本地FAISS → Milvus生产级
- 实打实的RAG Agent项目背景
- 可替换架构设计
- 复现价值: 高——有明确迁移步骤
- 建议分类:
RAG / 向量数据库 / Milvus / FAISS / 工程架构 - 是否精读: 是
- 可信度: 待验证
7. 向量数据库Chroma/Milvus/Qdrant工程级选型对比
- URL:
https://blog.csdn.net/SilentSamsara/article/details/161983560 - 作者: SilentSamsara
- 标题: 向量数据库实战:Chroma/Milvus/Qdrant选型与语义搜索应用
- 工程价值: ★★★★☆
- 三款主流向量库工程级对比
- 覆盖本地原型到生产集群完整部署链路
- CSDN代码片段语义搜索为实战场景
- 复现价值: 高
- 建议分类:
向量数据库 / Milvus / Qdrant / Chroma / 选型 - 是否精读: 是
- 可信度: 待验证
8. Milvus 2026超详细安装与使用
- URL:
https://blog.csdn.net/qq_24923619/article/details/162036274 - 标题: 【AI】【向量】----2026超详细,向量数据库Milvus安装与使用的超...
- 工程价值: ★★★★☆
- 2026年更新版本
- 覆盖安装到使用全流程
- Kubernetes集群部署方案提及
- 复现价值: 高
- 建议分类:
向量数据库 / Milvus / 安装 / 部署 / 2026 - 是否精读: 是
- 可信度: 待验证
🟡 中等价值(参考性内容,需验证)
9. AI Agent多模态工程化落地实战
- URL:
https://blog.csdn.net/weixin_29775479/article/details/162133958 - snippet线索: "实战复现指南:用3小时在本地MacBook Air跑通多模态Agent闭环" + "环境准备:避开90%新手踩的坑"
- 工程价值: ★★★☆☆——有明确时间和场景约束,但需核验全文
- 建议分类:
Agent / Multimodal / 实战 / 环境配置 - 可信度: 低(snippet提取,内容未完整获取)
10. LangGraph状态模式State源码详解
- URL:
https://blog.csdn.net/m0_69281817/article/details/147600438 - snippet线索: 结合源码与实战,MessagesState工作原理
- 工程价值: ★★★☆☆——源码分析有价值,但年份较早(article ID偏老)
- 建议分类:
LangGraph / 状态模式 / 源码 - 可信度: 中(源码分析框架相对稳定,但需核实版本)
11. AI可观测性-Trace-Cost-质量三合一
- URL:
https://blog.csdn.net/qq_36354988/article/details/162498343 - snippet线索: MLOps生产化实战、模型服务可观测性、灰度发布、LangGraph/LangChain对比
- 工程价值: ★★★☆☆——生产级MLOps视角,有框架对比
- 建议分类:
MLOps / 可观测性 / LangGraph / 生产部署 - 可信度: 低(fetch失败,无法验证)
12. 五大AI Agent框架2026深度横评
- URL:
https://blog.csdn.net/2401_85300269/article/details/162553538 - 标题: 2026年五大AI Agent框架深度横评:从LangGraph到Google ADK
- snippet线索: LangGraph定位为"状态机思维,适合复杂工作流"
- 工程价值: ★★★☆☆——框架选型参考
- 建议分类:
Agent / 框架横评 / LangGraph / Google ADK / 选型 - 可信度: 中
二、Substack 高质量研究线索
规则:只作为研究线索,记录作者/专栏名、原文链接、发布时间、核心观点、可信度判断及后续行动。不复制原文长段内容。
🔴 高价值 Substack 条目
S1. LLM Inference at Scale: Batching, Caching, Routing, and Cost Control
- 专栏/作者: DesignGurus (designgurus.substack.com)
- URL:
https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching - 发布时间: 2026(推测,近期)
- 核心观点:
- 生产级 LLM 系统通过 Batching(批处理)、Caching(缓存)、Routing(路由)、Cost Control 四大杠杆实现高吞吐低成本
- 解释了 prefill phase(处理用户初始提示)和 decode phase(逐token生成)的本质差异
- decode phase 是 memory-bandwidth bound,这是 vLLM / TensorRT-LLM 等推理引擎的核心优化方向
- 可信度: 高——工程视角清晰,与已知系统知识一致
- 后续行动: 与 The Neural Maze 的 "A Practical Guide to LLM Inference at Scale" 交叉阅读;建议核验 PagedAttention、chunked prefill 等具体技术细节原始论文
S2. LLM Architecture in 2026: What You Need to Know (Sebastian Raschka)
- 专栏/作者: Vanishing Gradients by Hugo Bowne-Anderson (hugobowne.substack.com)
- URL:
https://hugobowne.substack.com/p/llm-architecture-in-2026-what-you - 发布时间: 2026
- 核心观点:
- 封面图暗示 Vanishing Gradients 问题的新讨论(Raschka 主页持续关注训练动态)
- 提及 Agent-Harness 相关工作(与 DeepMind ex-Manus 作者合作)
- 涉及 AI Agent Harness、Context Engineering、Bitter Lesson 等主题
- 可信度: 高——Raschka 为知名 ML 研究者
- 后续行动: 查找该期详细内容;关注 Raschka 2026 关于架构演进的观点
S3. The AI Agents Stack (2026 Edition) - Six Layers
- 专栏/作者: The AI Engineer (theaiengineer.substack.com)
- URL:
https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 发布时间: 2026
- 核心观点:
- 2026年 Agent 技术栈扩展为6层,至少3层在2024年尚不存在独立分类
- 原文引述:"三周时间,你就有了一个14节点的状态图、一个写Redis的自定义checkpointer、以及每周失败一次的tool call重试逻辑"——这是真实生产经验的凝练
- 来源追溯:Letta 2024年11月发布的 AI agents stack 已成为行业默认参考
- 可信度: 高——行业工程师社群高度引用
- 后续行动: 对照 Letta 原始博客,核实六层具体定义;适合作为 Agent 系统架构教学素材
S4. A Practical Guide to LLM Inference at Scale
- 专栏/作者: The Neural Maze (theneuralmaze.substack.com)
- URL:
https://theneuralmaze.substack.com/p/a-practical-guide-to-llm-inference - 核心观点:
- 从单请求流程讲到生产级技术:chunked prefill、prefill-decode disaggregation、PagedAttention、elastic GPU sharing
- 指出 prefill 是 compute-bound,decode 是 memory-bandwidth bound——这是推理引擎设计的核心洞察
- 可信度: 高
- 后续行动: 建议与 S1 合并为"LLM推理工程"主题页资料源
S5. Systems Engineering in the Age of LLMs
- 专栏/作者: The Neural Maze (theneuralmaze.substack.com)
- URL:
https://theneuralmaze.substack.com/p/systems-engineering-in-the-age-of - 核心观点:
- 将 chatbot 分解为 AI 系统工程师视角的各层组件
- Inference Engine 层:GPU memory、bandwidth、concurrency、latency budgets
- 区分了 LLM stack vs. Agent stack
- 可信度: 高
- 后续行动: 与 S3(S6层Agent栈)互补阅读
S6. RAG Reimagined: 5 Breakthroughs You Should Know
- 专栏/作者: Gradient Flow / Ben Lorica (gradientflow.substack.com)
- URL:
https://gradientflow.substack.com/p/rag-reimagined-5-breakthroughs-you - 核心观点:
- 虽然自主Agent和大推理模型受关注,但 RAG 仍是知识密集型 AI 应用基石
- 提及 Snowflake AI Research Team 对 specialized models 在 ambiguous context 下挑战的看法
- Lance v2(向量数据库)为 multimodal RAG 提供多模态支持
- 推理时计算(inference-time compute)与 RAG 的结合将 RAG 从静态 pipeline 变为动态自适应系统
- 可信度: 高——Gradient Flow 为知名 ML newsletter
- 后续行动: 查找 RAG + 推理时计算结合的最新论文;核实 Lance v2 实际发布状态
S7. Multimodal RAG Unveiled: Cross-Modality Architecture
- 专栏/作者: AI Expjourney (aiexpjourney.substack.com)
- URL:
https://aiexpjourney.substack.com/p/multimodal-rag-unveiled-a-deep-dive - 核心观点:
- Multimodal RAG 三分类:Image-based RAG、Text-based RAG、Cross-modality RAG
- Cross-modality RAG 两条路径:(a) 用 CLIP等多模态 embedding 模型直接处理图像;(b) 用多模态 LLM 生成图像文本摘要再用 text embedding 存储
- Doc-Researcher 架构:multimodal deep parsing + indexing + deep research
- 可信度: 中高——技术分类清晰但需核实细节
- 后续行动: 核实 Doc-Researcher 原始论文;Cross-modality RAG 路径选择需结合具体场景
S8. AI Agents Forget Everything Between Sessions - MemVerse
- 专栏/作者: Learn Agentic (learnagentic.substack.com)
- URL:
https://learnagentic.substack.com/p/ai-agents-forget-everything-between - 核心观点:
- MemVerse(上海 AI Lab 开源框架):双记忆架构,给 Agent 终身记忆
- 三层持久化:short-term、long-term、parametric memory
- central controller 编排:89% faster retrieval vs RAG,90% token 用量 reduction through intelligent distillation
- 结合知识图谱做慢速推理(System 2)
- 可信度: 中——数据夸张风险高,需核实开源仓库
- 后续行动: 查找 MemVerse GitHub 仓库,核实 benchmark 数字
S9. The Complete Guide to Building AI Agents in 2026
- 专栏/作者: Sid Saladi (sidsaladi.substack.com)
- URL:
https://sidsaladi.substack.com/p/agent-frameworks-101-the-complete - 核心观点:
- 当前有 30+ Agent 框架
- Multi-Agent 何时必要:Agent 有 15+ tools 且开始选错工具时;任务需要真正不同的技能(research vs. code)
- Single vs. Multi-Agent 判断经验法则:< 10 tools,< 50K tokens context,sequential 任务 → 单Agent
- MCP(Model Context Protocol)已成为 Agent 工具连接的事实标准,被称为"USB-C of agent tools"
- 可信度: 高——经验法则实用
- 后续行动: 建议作为 Agent 框架选型决策参考
S10. How to Choose Your AI Agent Stack in 2026
- 专栏/作者: The Nuanced Perspective (thenuancedperspective.substack.com)
- URL:
https://thenuancedperspective.substack.com/p/how-to-choose-your-ai-agent-stack - 核心观点:
- 工具层正在快速功能收敛,"哪个工具最好"是错误问题框架
- 正确方法:从 model 向上逐层选择,因为每层优化目标不同
- Benchmark 分数选模型是错误框架——顶级能力已趋同,没有单一模型能包揽一切
- 可信度: 中高
- 后续行动: 作为 Agent Stack 选型方法论参考
三、分类标签汇总
| 标签 | 条目数 | 主要来源 |
|---|---|---|
LLM微调 / Qwen / LoRA / 实战 |
2 | CSDN (l35633, heian_99) |
LLM推理 / vLLM / 部署 |
1 | CSDN (l35633) |
Agent / LangGraph / Multi-Agent |
3 | CSDN |
RAG / 向量数据库 / Milvus / FAISS |
3 | CSDN |
MLOps / 可观测性 / 生产部署 |
2 | CSDN + Substack |
LLM推理工程 / 推理系统 |
3 | Substack (S1,S4,S5) |
Agent Stack / 框架选型 / MCP |
3 | Substack (S3,S9,S10) |
Multimodal RAG |
2 | Substack (S6,S7) |
Agent记忆 / MemVerse / 知识图谱 |
1 | Substack (S8) |
四、建议写入路径
| 主题 | 路径 |
|---|---|
| Qwen LoRA 微调实战系列 | /shared/research-kb/inbox/jay/2026-07-07-qwen-lora-finetuning-csdn.md |
| LangGraph 状态机与Multi-Agent | /shared/research-kb/inbox/jay/2026-07-07-langgraph-multiagent-csdn.md |
| 向量数据库选型与RAG架构 | /shared/research-kb/inbox/jay/2026-07-07-vector-db-rag-csdn.md |
| LLM推理系统工程(Substack线索) | /shared/research-kb/inbox/jay/2026-07-07-llm-inference-systems-substack.md |
| Agent Stack 2026(Substack线索) | /shared/research-kb/inbox/jay/2026-07-07-agent-stack-2026-substack.md |
五、本轮是否写入文件
是。本次已识别 8+ 条高价值 CSDN 条目(部分未完整核验但snippet质量高)和 10 条 Substack 高质量研究线索,应分别产出专项草稿。
本次实际写入:
- ✅ /shared/research-kb/inbox/jay/2026-07-07-csdn-substack-ai-systems.md(本篇综合草稿)
建议后续由同步任务拆分为5个专项草稿(见上表),精读核验后更新知识库。
六、后续行动建议
-
精读优先(最高优先级): - l35633 的 Qwen LoRA + vLLM 部署系列(2篇) - heian_99 的 Qwen2.5-7B LoRA 完整实战 - Substack S1/S4(LLM推理工程配对阅读)
-
审稿优先级(中高优先级): - LangGraph 多Agent协作系统(MuXinShu1)——抽检源码质量 - LangGraph 状态持久化机制(2501_91930600)——生产部署参考
-
核实优先级: - MemVerse(上海AI Lab)benchmark 数据——需查开源仓库 - CSDN 各篇全文——因 CSDN 大量 fetch 失败,建议通过其他渠道获取
-
主题页更新建议: - 新建或更新
LLM微调实战主题页(整合 Qwen 系列) - 新建或更新Agent系统架构主题页(整合 LangGraph + Agent Stack Substack 线索) - 新建或更新LLM推理工程主题页(整合 vLLM + 推理系统 Substack 线索)
Jay · 2026-07-07 · CSDN高频检索第3次/日 · 本实例草稿