知识库草稿 · Jay · 2026-08-07
主题
CSDN 高价值 AI/LLM/Agent/RAG 技术分享 + Substack 线索 + arXiv 2026 新动态
一、CSDN 高价值条目
条目 1:vLLM 大模型部署与推理加速实战指南
- 来源:CSDN 论坛 · weixin_29094775,发布于 2026-07-28
- URL:https://bbs.csdn.net/weixin_29094775/article/details/100236199
- 评分:⭐⭐⭐⭐⭐(工程价值高,含版本/命令/环境)
- 摘要:PagedAttention 核心原理、单卡→多卡部署命令、Dockerfile 示例、参数调优对照表。实测 A100 单卡吞吐量达传统方案 3-5 倍。提供 Windows WSL 配置路径。
- 版本信息:pip install vllm、vllm-0.3.2.tar.gz、flash-attn-2.5.0.tar.gz、CUDA 12.1
- 工程价值:可直接复现,含
--tensor-parallel-size、--gpu-memory-utilization等关键参数说明 - 建议分类:MLOps / 推理部署 / vLLM / 复现级
条目 2:DeepSeek V4-Flash 本地化部署实战:vLLM 推理服务从单卡到多卡,量化配置全攻略
- 来源:CSDN 博客 · qq_73472828,2026-06-04
- URL:https://blog.csdn.net/qq_73472828/article/details/160575527
- 评分:⭐⭐⭐⭐(复现价值高,踩坑点 + 量化方案)
- 摘要:从环境检查到 API 服务封装的完整流程。显存需求速查表、FP8 量化配置、张量并行部署命令、踩坑点 3 个(显存优化/多卡并行/API 封装)。强调硬件前置检查和虚拟环境隔离。
- 工程价值:国产模型(DeepSeek)私有部署,含量化精度损失评估
- 建议分类:推理部署 / 量化 / DeepSeek / 复现级
条目 3:AI Agent 开发技术完全学习指南(2026-07 基线版)
- 来源:CSDN AI Agent 专区 · agent.csdn.net
- URL:https://agent.csdn.net/6a52fd2f662f9a54cb8e8279.html
- 评分:⭐⭐⭐⭐⭐(体系完整,含面试映射表)
- 摘要:35 章按岗位(P5/P7/架构师/PM)重排;多 Agent 协作与 A2A 协议;CUA vs RPA 对比;模态路由架构(去中心化部署)。含面试映射表(知识点→面试问题→高分回答要点)。
- 技术细节:
- 模态路由代码骨架:
route_modality(user_input, signal)路由到专用小模型 - CUA 商业化路径:客服自动化/数据录入/跨 SaaS/测试自动化
- 语音链路 Barge-in 打断机制、VAD end-of-speech
- 工程价值:体系化学习路径 + 工程实践复盘(坑 1/坑 2)
- 建议分类:Agent / 多智能体 / CUA / 学习路径
条目 4:LangGraph 项目 Docker 容器化 + 云端服务器部署 + 前后端联调
- 来源:CSDN openEuler 社区 · Lu家兴,2026-07
- URL:https://openeuler.csdn.net/6a31f469662f9a54cb801d47.html
- 评分:⭐⭐⭐⭐(Docker + 云部署 + 运维命令全)
- 摘要:Docker 容器化、云端服务器部署、Nginx 反向代理、域名 HTTPS、7×24 常驻运行。含完整 docker run/dockerg logs/dockerrestart 命令;安全组端口放行步骤;多实例扩容方案。
- 工程价值:生产级部署命令,可直接操作
- 建议分类:DevOps / Docker / 云部署 / LangGraph
条目 5:2026年AI工程师必备的8层工具栈架构
- 来源:CSDN 博客 · InstrGap
- URL:https://blog.csdn.net/InstrGap/article/details/161193640
- 评分:⭐⭐⭐⭐(架构全景图,含源码/配置)
- 摘要:从本地推理到 MLOps 闭环的全链路 8 层架构。含 FastAPI 进程 vs Ray Serve 对比表;P95 延迟打点源码;向量缓存三级分层(L1 CPU/L2 SSD/L3 HDD)及命中率数据;Backpressure 动态调节参数表。
- 工程价值:MLOps 架构设计参考,含真实压测数据
- 建议分类:MLOps / 架构 / 推理优化
条目 6:vLLM / SGLang 大模型推理框架实战
- 来源:CSDN openEuler 社区
- URL:https://openeuler.csdn.net/6a508ec510ee7a33f28c08ff.html
- 评分:⭐⭐⭐⭐(docker-compose + nginx + 分布式架构图)
- 摘要:PagedAttention、并行采样、docker-compose 生产部署、nginx 负载均衡配置、多节点分布式部署命令。含 NCCL 多节点
torchrun命令示例。 - 工程价值:SGLang 对比参考,分布式推理架构图
- 建议分类:推理框架 / SGLang / 分布式
条目 7:AI Agent 开发常见问题与快速排查指南(2026 最新版)
- 来源:CSDN 博客 · fenglingguitar,2026-07
- URL:https://blog.csdn.net/fenglingguitar/article/details/160250496
- 评分:⭐⭐⭐(排障指南,含 Harness Engineering / Hermes Agent)
- 摘要:Harness Engineering 产品形态演变;专属身份/环境感知/自主执行三个维度;AI Agent 留住用户的信息缺口设计思路。排障内容涉及 OpenClaw 链路、记忆检索等。
- 工程价值:中等,复仇速度快但缺乏详细命令
- 建议分类:Agent / 排障
条目 8:MLflow 在 LLM 评估中的工程实践
- 来源:CSDN 博客 · weixin_29161785
- URL:https://blog.csdn.net/weixin_29161785/article/details/162618538
- 评分:⭐⭐⭐(可追溯/可比较评估)
- 摘要:MLOps 全生命周期闭环;MLflow 对接 LLM 评估流水线。
- 工程价值:中等
- 建议分类:MLOps / 评估
条目 9:vLLM-Ascend 推理部署与性能调优(鲲鹏昇腾 NPU)
- 来源:CSDN 鲲鹏昇腾开发者社区
- URL:https://hwcomputing.csdn.net/694bc0dbbf6b0e4b285e0d72.html
- 评分:⭐⭐⭐⭐(国产硬件 + NPU 适配,含源码编译命令)
- 摘要:Ascend NPU 上源码编译 vLLM;SHM_SIZE=50g 共享内存配置;VLLM_TARGET_DEVICE=empty 避免 nvcc 依赖;Docker 镜像构建完整脚本。含 ModelScope 下载模型配置。
- 工程价值:国产化推理部署路径,高价值但偏小众
- 建议分类:推理部署 / Ascend / NPU / 国产硬件
条目 10:多模态大模型 MLOps 流水线重构指南(SITS2026 认证级)
- 来源:CSDN 博客 · FuncFun
- URL:https://blog.csdn.net/FuncFun/article/details/160144923
- 评分:⭐⭐⭐(MLOps 架构认证体系)
- 摘要:SITS2026 认证级 MLOps 架构;大模型工程化模型仓库管理方案。
- 工程价值:中等,付费内容较多但有目录结构可参考
- 建议分类:MLOps / 认证体系
二、Substack 高价值线索
线索 1:The AI Agents Stack (2026 Edition)
- 来源:The AI Engineer(substack)
- URL:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 作者:The AI Engineer(Paolo Perrone)
- 发布时间:2026-03-11
- 核心观点:
- Agent Stack ≠ LLM Stack:聊天机器人只需推理+RAG;Agent 需要状态管理、工具协议、持久记忆、自主推理循环、实时护栏
- Agent Guardrails 已成为独立于 LLM Guardrails 的独立学科(2024 → 2026 演变)
- Guardrails 现在意味着:工具调用授权、速率限制、结果验证
- 可信度:高(AI Engineer 专业 newsletter,作者有工程背景)
- 后续行动:建议核验文中 Agent Stack 分层模型,与 OpenClaw 架构做对比
- 建议分类:Agent / 工程架构 / Stack
线索 2:Build a Multimodal Agentic RAG
- 来源:Daily Dose of Data Science(substack)
- URL:https://blog.dailydoseofds.com/p/build-a-multimodal-agentic-rag
- 作者:Avi Chawla
- 核心观点:Spotify/YouTube/Amazon Music 生产多模态 RAG 实践;CrewAI Flow 实现数据发现和转录流程;AssemblyAI 转录音频 + Milvus 向量库。
- 可信度:中高(工程导向,有代码示例)
- 后续行动:提取多模态 RAG 架构设计,补充进知识库
- 建议分类:RAG / Multimodal / 工程实践
线索 3:Context Engineering: Path towards better Agent Engineering
- 来源:substack.com
- URL:https://substack.com/home/post/p-166983119
- 核心观点:Context Engineering 包含 RAG、Prompting、State/History、Memory、Structured Outputs 五大组件;Technical Context Engineering(面向 AI 工程师)和 User Context Engineering(面向普通用户)分层。
- 可信度:中(概念梳理型,有 Venn 图)
- 后续行动:可作为知识库 Topic 页「Context Engineering」词条补充
- 建议分类:Agent / Context Engineering / 概念梳理
线索 4:RAG Reimagined: 5 Breakthroughs You Should Know
- 来源:Gradient Flow(substack)
- URL:https://gradientflow.substack.com/p/rag-reimagined-5-breakthroughs-you
- 作者:Ben Lorica(ODSC 主办方)
- 核心观点:RAG 从简单检索向多模态/推理型演进;文档处理质量被低估;长上下文做近场、RAG 做远场的分层趋势。
- 可信度:高(行业资深人士)
- 后续行动:精读原文,提取 RAG 2026 新范式对比表
- 建议分类:RAG / 行业洞察
三、arXiv 2026 新动态
论文 1:A-RAG: Scaling Agentic RAG via Hierarchical Retrieval Interfaces
- 来源:arXiv:2602.03442,2026-02
- 核心贡献:Agentic RAG 三原则;分层检索接口;Scaling Agentic RAG
- 建议分类:RAG / Agentic RAG / arXiv
论文 2:VimRAG: Navigating Massive Visual Context via Multimodal Memory Graph
- 来源:arXiv:2602.12735,2026-02
- 核心贡献:视觉上下文导航;多模态记忆图
- 建议分类:Multimodal / RAG / arXiv
论文 3:SoK: Agentic Retrieval-Augmented Generation (RAG)
- 来源:arXiv:2603.07379v1
- 核心贡献:Agentic RAG 系统化研究;POMDP 公式化;多阶段检索循环;Scientific Research 场景强调引用可追溯性
- 建议分类:RAG / Survey / Agent
论文 4:Memory for Autonomous LLM Agents: Mechanisms
- 来源:arXiv:2603.07670v1
- 核心贡献:2022-2026 记忆机制综述;Write-Manage-Read 三维分类法;Temporal Scope × Representational Substrate × Control Policy;Agentic Memory(Yu et al., 2026)用 GRPO 训练记忆操作为 RL Action
- 建议分类:Agent / Memory / Survey
论文 5:LLM Research Papers 2026 List (Sebastian Raschka)
- 来源:Sebastian Raschka Newsletter(substack/magazine)
- URL:https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
- 覆盖:Jan-May 2026;含 Agent Systems & Tool Use、Coding Agents 等分类;提及 Nemotron 3 Super(MoE+Mamba2 混合架构)、Qwen3.6(Gated DeltaNet)、Long Context Efficiency 在 Agent 场景的重要性
- 建议分类:LLM / Survey / 论文列表
四、分类标签汇总
| 标签 | 条目数 |
|---|---|
| MLOps | 4 |
| 推理部署/vLLM | 5 |
| Agent/多智能体 | 5 |
| RAG/Agentic RAG | 4 |
| Multimodal | 2 |
| 架构设计 | 2 |
| 学习路径 | 1 |
| Docker/云部署 | 2 |
| 评估/MLflow | 1 |
| 国产硬件/Ascend | 1 |
| arXiv 2026 | 5 |
| Substack 行业洞察 | 4 |
五、建议写入路径
主草稿路径:/shared/research-kb/inbox/jay/2026-08-07-csdn-llm-agent-rag-research.md
如需拆分专题,可考虑:
- YYYY-MM-DD-vllm-deployment-guide.md(推理部署专题)
- YYYY-MM-DD-agentic-rag-systems.md(RAG/Agentic RAG 专题)
- YYYY-MM-DD-agent-stack-2026.md(Stack 架构专题)
六、后续行动建议
精读(高优先级)
- vLLM 大模型部署与推理加速实战(CSDN,版本/命令齐全,可直接复现)
- AI Agent 开发技术完全学习指南(体系最完整,含面试映射)
- The AI Agents Stack (2026 Edition)(Substack,工程视角 Stack 分层)
- SoK: Agentic RAG(arXiv,系统化 RAG Survey)
审稿(建议)
- RAG 2026 新范式对比表(LazyGraphRAG / Agentic RAG / GraphRAG v2)
- Context Engineering vs Prompt Engineering vs RAG 边界定义
知识库 Topic 页更新建议
- 新增/更新:
Agent Stack 2026、Agentic RAG、vLLM 部署、Memory in LLM Agents