知识库草稿 · Jay · 2026-08-02
任务:高频 CSDN 技术检索 · LLM / Agent / RAG / MLOps
一、高价值 CSDN 条目(按工程价值排序)
🔴 高价值 A 级(源码/版本/命令/复现步骤)
A1. vLLM V1 源码学习(基于 0.8.2)
- URL:
https://blog.csdn.net/qq_35166730/article/details/147222691 - 作者: qq_35166730
- 标签: vLLM | 源码分析 | 版本 0.8.2 | Python
- 核心内容: vLLM V1 源码结构解析,含虚拟环境激活命令 (
venv/bin/activate)、vllm serve启动链路、Continuous Batching 和 PagedAttention 源码走读 - 工程价值: 版本明确(0.8.2),有源码级分析,可用于复现 vLLM 请求调度链路
- 可信度: 中高(原创源码注释博客,需核验代码行号与官方 0.8.2 tag 对应)
- 建议: 精读,与官方 vLLM 0.8.2 Release Notes 交叉核验调度器变更
A2. 深度解析主流大模型推理部署框架(vLLM / SGLang / TensorRT-LLM)
- URL:
https://blog.csdn.net/xuebinding/article/details/150924452 - 作者: xuebinding
- 标签: vLLM | SGLang | TensorRT-LLM | 推理部署 | 命令行
- 核心内容:
- SGLang 安装命令:
pip install sglang[all]或源码安装git clone https://github.com/sgl-project/sglang.git && pip install -e "python[all]" - 三大框架选型决策矩阵
- PagedAttention vs RadixAttention vs TensorRT 内核对比
- 工程价值: 命令可复现,选型决策矩阵适合生产环境决策参考
- 可信度: 中高
- 建议: 精读 SGLang 安装部分,与官方 README 核验最新版本命令变化
A3. QLoRA 微调实战指南:从零跑通业务级大模型适配
- URL:
https://blog.csdn.net/handawei_5/article/details/83521213 - 作者: handawei_5
- 标签: QLoRA | 微调 | 环境搭建 | 验证命令
- 核心内容: 明确要求列出具体命令和验证方式,例如
python -c "from transformers import AutoModel; print('OK')";业务级 QLoRA 全流程 - 工程价值: 环境验证命令可复用,符合"版本+命令+验证"标准
- 可信度: 待核验(需确认发布日期和框架版本)
- 建议: 精读,核验 transformers / peft 版本
A4. 构建上亿请求量的 AI Agent 系统:2026 生产级架构白皮书深度解读
- URL:
https://blog.csdn.net/weixin_35774598/article/details/162381479 - 作者: weixin_35774598
- 标签: Agent | 生产架构 | LangGraph | Kubernetes HPA | 性能基准
- 核心内容:
- LangGraph 状态图定义 + ReAct 循环核心代码片段
- Agent 执行时间分解:LLM 推理 ~55%、工具执行 ~30%、网络/序列化 ~10%
- Kubernetes HPA 配置示例、Redis 语义缓存策略、Task Complexity Triage 三档路由
max_tokens分段配置(简单问答 256 / 代码生成 2048 / 分析报告 4096)- 工程价值: 生产级架构,含性能数据、配置示例、K8s HPA,可直接落地参考
- 可信度: 中高(架构描述与已知生产实践一致)
- 建议: 精读,核验 LangGraph API 版本
🟡 高价值 B 级(框架对比/系统性梳理/有复现路径)
B1. LLM Harness Engineering 大模型驾驭工程完整精通指南
- URL:
https://blog.csdn.net/ailiandeziwei/article/details/161979669 - 作者: ailiandeziwei
- 标签: MHA | MQA | GQA | 位置编码 | vLLM | TensorRT-LLM
- 核心内容:
- MHA / MQA / GQA 变体对比表(KV 共享策略、显存节省、吞吐影响)
- GQA 成为 2025-2026 主流的原因:8B 模型 KV Cache 从 80MB/seq 降至 20MB/seq
- 选型决策矩阵(含 Cobol 格式分支图)
- 框架组合策略表(开发/本地 → Ollama+vLLM;生产通用 → vLLM;生产 Agent → SGLang;批量离线 → TensorRT-LLM)
- 工程价值: 系统性框架对比,适合做技术选型文档
- 可信度: 中
- 建议: 参考框架对比表,核验数值与对应论文/官方 benchmark
B2. WeKnora 企业知识库部署与排障实录
- URL:
https://blog.csdn.net/sinat_26917383/article/details/155273943 - 作者: sinat_26917383(资深博主,157 篇 LLM 文章)
- 标签: WeKnora | 排障 | 混合检索 | 企业知识库 | 向量数据库
- 核心内容:
- 真实排障案例:"文档解析成功但检索为空" → 根因:文档未正确生成向量索引
- WeKnora 混合检索架构(BM25 + 向量 + 图谱)
- 排障流程:客户端脚本 → 文档解析状态 → 向量库索引检查
- 企业级多租户设计
- 工程价值: 排障实录稀缺,有真实故障定位路径,工程价值高
- 可信度: 高(老牌技术博主,附实战截图)
- 建议: 精读,纳入 RAG 排障经验库
B3. LightRAG vs GraphRAG 2025 终极对比
- URL:
https://blog.csdn.net/YoungOne2333/article/details/156607420 - 作者: YoungOne2333
- 标签: LightRAG | GraphRAG | 多模态 | 成本效率 | RAG 选型
- 核心内容:
- 索引构建策略对比
- 多模态能力对比(LightRAG 已集成 RAG-Anything + VideoRAG;GraphRAG 仍以文本为主)
- 成本与效率优化路线图
- 一句话总结:LightRAG = 特种部队(高时效精确打击);GraphRAG = 战略情报中心(全局复杂决策)
- 工程价值: RAG 框架选型参考,含多模态 roadmap
- 可信度: 中
- 建议: 参考,核验与各框架官方文档的最新功能对照
B4. 企业级 RAG 系统从入门到高精度优化全攻略
- URL:
https://blog.csdn.net/2301_76168381/article/details/157215628 - 作者: 2301_76168381
- 标签: RAG | 企业级 | 精度优化 | 数据时效性 | 上下文断裂
- 核心内容: 五大挑战(数据时效性、上下文断裂、检索局限、多模态理解不足、流程僵化)及高精度优化方案;精选 LLM 与嵌入模型建议
- 工程价值: 系统性 RAG 优化思路,适合架构设计阶段参考
- 可信度: 中
- 建议: 参考,核验嵌入模型选型建议与 MTEB 2026 最新榜单对照
B5. 大模型微调实战指南:从 LoRA/QLoRA 到 API 部署全流程解析
- URL:
https://blog.csdn.net/weixin_30607125/article/details/162616680 - 作者: weixin_30607125
- 标签: QLoRA | 自定义指令微调 | Qwen2.5 | API 部署
- 核心内容: QLoRA + Qwen2.5 本地微调实战,含指令数据集准备、训练环境搭建步骤
- 工程价值: 有实战路径,与 Qwen 官方文档可交叉核验
- 可信度: 待核验
- 建议: 参考,核验 Qwen2.5 微调命令与官方示例一致性
B6. 企业级 LLM Agent 实战:从 RAG 到业务闭环
- URL:
https://adg.csdn.net/6a522430662f9a54cb8e637c.html - 标签: Agentic RAG | LangGraph | 状态机 | Multi-Agent
- 核心内容:
- Agent 六状态生命周期模型:START → Planning → Running → Waiting → Retry → Finish
- 状态流转、断点恢复、异步等待代码实现方案
- Zulu / Plan / Architect 三层 Agent 矩阵(文心快码)
- ReAct + Reflect 双循环
- 工程价值: 状态机设计模式有复现价值,可与 LangGraph 官方示例对照
- 可信度: 中高
- 建议: 精读,与 LangGraph 官方文档核验状态图实现 API
B7. AI Agent 开发常见问题与快速排查指南(2026 最新版)
- URL:
https://blog.csdn.net/fenglingguitar/article/details/160250496 - 标签: Agent | 排障 | 常见问题
- 核心内容: Agent 开发高频痛点与排查方案(需进一步读取原文确认深度)
- 工程价值: 排障类内容,稀缺性高
- 可信度: 待核验
- 建议: 读取原文评估内容深度
二、Substack 研究线索
S1. ODSC · Our 2026 AI Outlook
- URL:
https://odsc.substack.com/p/our-2026-ai-outlook-emerging-job - 作者/机构: ODSC(Open Data Science Conference)
- 核心观点: 2026 AI Outlook——Agentic 系统治理、多模态 AI、生产级可靠系统构建;新兴职位包括 Context Engineers、Chief AI Officers;Agent 工程师核心能力:模型行为理解、API 设计、状态管理、错误处理
- 可信度判断: 高(ODSC 是知名 AI 教育会议品牌)
- 后续行动: 与 ACL 2026 / ICLR 2026 论文交叉验证 Agent 工程能力要求
S2. AI Horizons Newsletter · April 2026
- URL:
https://schlamkowitz.substack.com/p/ai-horizons-newsletter-april-2026 - 作者: 独立研究者(ICLR 投稿背景)
- 核心观点: ICLR 2026 重点关注 long-context behavior、multimodal reasoning、evaluation、retrieval、post-training;ACL 2026 关注 LLM evaluation、RAG、multilingual AI、tool-using LLM、alignment
- 可信度判断: 中高(研究者视角,兼顾学术与工程)
- 后续行动: 记录为学术会议关注线索,2026-07 关注 ACL 投稿方向
S3. RecSys Newsletter · Is Agentic RAG Worth It?
- URL:
https://recsys.substack.com/p/the-journey-to-embedding-based-retrieval - 作者: Sumit(RecSys 领域专业 newsletter)
- 核心观点: Airbnb embedding-based retrieval 实战、Ferrazzi et al. Agentic RAG vs Naive RAG 实验对比;Meta Self-Evolving Search Agents;Kuaishou LLM-Based Recommendation
- 可信度判断: 高(RecSys 顶会圈专业作者)
- 后续行动: 追踪 Agentic RAG 对比论文
Ferrazzi et al.原始论文;Airbnb 检索架构核验
S4. AgentOps: Lessons from Over 1,400 Production Deployments
- URL:
https://hugobowne.substack.com/p/agentops-lessons-from-over-1400-production - 作者: Hugo Bowne-Anderson + Alex Strick van Linschoten
- 核心观点: 2026 是 Agent 元年;LLMOps 数据库显示从简单 RAG 到自主系统的转变;上下文工程、Silent Failures、每周重建现象;传统 MLOps 预算向 GenAI/Agentic 团队迁移
- 可信度判断: 高(大规模生产数据支撑,1400+ 部署样本)
- 后续行动: 重点关注"Silent Failures"和"上下文工程"两个主题,可做专题页
S5. Jam with AI · The 2026 Roadmap: Production AI/ML Systems
- URL:
https://jamwithai.substack.com/p/the-2026-roadmap-production-aiml - 作者: Shantanu Ladhwe + Shirin Khosravi(~38000 订阅者社区)
- 核心观点: 生产 AI 系统演进路径:basic RAG → Graph RAG with Neo4j → ColPali/VLM visual document retrieval;NLP Course: Zero to Fine-tuning;RecSys with MLOps
- 可信度判断: 中高(社区驱动,有课程体系支撑)
- 后续行动: 追踪 ColPali 多模态文档检索进展;核验 Neo4j Graph RAG 集成路径
三、分类标签汇总
| 标签 | 条目数 | 代表条目 |
|---|---|---|
| vLLM / SGLang / TensorRT-LLM | 3 | A1, A2, B1 |
| RAG / GraphRAG / LightRAG | 4 | A4, B2, B3, B4 |
| Agent / Agentic RAG / 状态机 | 3 | A4, B6, B7 |
| QLoRA / LoRA / 微调 | 2 | A3, B5 |
| 排障实录 | 1 | B2 |
| MLOps / 生产架构 | 2 | A4, B1 |
| 多模态 RAG | 1 | B3 |
| Substack 研究线索 | 5 | S1-S5 |
四、本次写入路径
建议写入路径(等待后续 GitHub 同步任务执行):
- /shared/research-kb/inbox/jay/2026-08-02-csdn-llm-agent-rag-mlops.md
不去重直接覆盖(本任务为首次执行,无历史条目)。
五、后续行动建议
- A1 精读计划:vLLM 0.8.2 源码分析条目,建议对照官方 Release Notes 核验 PagedAttention 实现变更
- A4 重点关注:生产级 Agent 架构含 Kubernetes HPA + Redis 缓存配置,可直接纳入基础设施参考
- S4 专题线索:AgentOps Silent Failures 和上下文工程,建议扩展为专题页
- B2 排障案例:WeKnora 排障路径建议纳入 RAG 排障知识库
- S3 论文追踪:Ferrazzi et al. Agentic RAG 对比研究,建议追踪原始 arXiv 论文
草稿生成时间:2026-08-02 08:20 (CST) · Jay · 高频 CSDN 检索任务