知识库草稿 · Jay · 2026-08-07

主题

CSDN 高价值 AI/LLM/Agent/RAG 技术分享 + Substack 线索 + arXiv 2026 新动态


一、CSDN 高价值条目

条目 1:vLLM 大模型部署与推理加速实战指南

  • 来源:CSDN 论坛 · weixin_29094775,发布于 2026-07-28
  • URL:https://bbs.csdn.net/weixin_29094775/article/details/100236199
  • 评分:⭐⭐⭐⭐⭐(工程价值高,含版本/命令/环境)
  • 摘要:PagedAttention 核心原理、单卡→多卡部署命令、Dockerfile 示例、参数调优对照表。实测 A100 单卡吞吐量达传统方案 3-5 倍。提供 Windows WSL 配置路径。
  • 版本信息:pip install vllm、vllm-0.3.2.tar.gz、flash-attn-2.5.0.tar.gz、CUDA 12.1
  • 工程价值:可直接复现,含 --tensor-parallel-size--gpu-memory-utilization 等关键参数说明
  • 建议分类:MLOps / 推理部署 / vLLM / 复现级

条目 2:DeepSeek V4-Flash 本地化部署实战:vLLM 推理服务从单卡到多卡,量化配置全攻略

  • 来源:CSDN 博客 · qq_73472828,2026-06-04
  • URL:https://blog.csdn.net/qq_73472828/article/details/160575527
  • 评分:⭐⭐⭐⭐(复现价值高,踩坑点 + 量化方案)
  • 摘要:从环境检查到 API 服务封装的完整流程。显存需求速查表、FP8 量化配置、张量并行部署命令、踩坑点 3 个(显存优化/多卡并行/API 封装)。强调硬件前置检查和虚拟环境隔离。
  • 工程价值:国产模型(DeepSeek)私有部署,含量化精度损失评估
  • 建议分类:推理部署 / 量化 / DeepSeek / 复现级

条目 3:AI Agent 开发技术完全学习指南(2026-07 基线版)

  • 来源:CSDN AI Agent 专区 · agent.csdn.net
  • URL:https://agent.csdn.net/6a52fd2f662f9a54cb8e8279.html
  • 评分:⭐⭐⭐⭐⭐(体系完整,含面试映射表)
  • 摘要:35 章按岗位(P5/P7/架构师/PM)重排;多 Agent 协作与 A2A 协议;CUA vs RPA 对比;模态路由架构(去中心化部署)。含面试映射表(知识点→面试问题→高分回答要点)。
  • 技术细节
  • 模态路由代码骨架:route_modality(user_input, signal) 路由到专用小模型
  • CUA 商业化路径:客服自动化/数据录入/跨 SaaS/测试自动化
  • 语音链路 Barge-in 打断机制、VAD end-of-speech
  • 工程价值:体系化学习路径 + 工程实践复盘(坑 1/坑 2)
  • 建议分类:Agent / 多智能体 / CUA / 学习路径

条目 4:LangGraph 项目 Docker 容器化 + 云端服务器部署 + 前后端联调

  • 来源:CSDN openEuler 社区 · Lu家兴,2026-07
  • URL:https://openeuler.csdn.net/6a31f469662f9a54cb801d47.html
  • 评分:⭐⭐⭐⭐(Docker + 云部署 + 运维命令全)
  • 摘要:Docker 容器化、云端服务器部署、Nginx 反向代理、域名 HTTPS、7×24 常驻运行。含完整 docker run/dockerg logs/dockerrestart 命令;安全组端口放行步骤;多实例扩容方案。
  • 工程价值:生产级部署命令,可直接操作
  • 建议分类:DevOps / Docker / 云部署 / LangGraph

条目 5:2026年AI工程师必备的8层工具栈架构

  • 来源:CSDN 博客 · InstrGap
  • URL:https://blog.csdn.net/InstrGap/article/details/161193640
  • 评分:⭐⭐⭐⭐(架构全景图,含源码/配置)
  • 摘要:从本地推理到 MLOps 闭环的全链路 8 层架构。含 FastAPI 进程 vs Ray Serve 对比表;P95 延迟打点源码;向量缓存三级分层(L1 CPU/L2 SSD/L3 HDD)及命中率数据;Backpressure 动态调节参数表。
  • 工程价值:MLOps 架构设计参考,含真实压测数据
  • 建议分类:MLOps / 架构 / 推理优化

条目 6:vLLM / SGLang 大模型推理框架实战

  • 来源:CSDN openEuler 社区
  • URL:https://openeuler.csdn.net/6a508ec510ee7a33f28c08ff.html
  • 评分:⭐⭐⭐⭐(docker-compose + nginx + 分布式架构图)
  • 摘要:PagedAttention、并行采样、docker-compose 生产部署、nginx 负载均衡配置、多节点分布式部署命令。含 NCCL 多节点 torchrun 命令示例。
  • 工程价值:SGLang 对比参考,分布式推理架构图
  • 建议分类:推理框架 / SGLang / 分布式

条目 7:AI Agent 开发常见问题与快速排查指南(2026 最新版)

  • 来源:CSDN 博客 · fenglingguitar,2026-07
  • URL:https://blog.csdn.net/fenglingguitar/article/details/160250496
  • 评分:⭐⭐⭐(排障指南,含 Harness Engineering / Hermes Agent)
  • 摘要:Harness Engineering 产品形态演变;专属身份/环境感知/自主执行三个维度;AI Agent 留住用户的信息缺口设计思路。排障内容涉及 OpenClaw 链路、记忆检索等。
  • 工程价值:中等,复仇速度快但缺乏详细命令
  • 建议分类:Agent / 排障

条目 8:MLflow 在 LLM 评估中的工程实践

  • 来源:CSDN 博客 · weixin_29161785
  • URL:https://blog.csdn.net/weixin_29161785/article/details/162618538
  • 评分:⭐⭐⭐(可追溯/可比较评估)
  • 摘要:MLOps 全生命周期闭环;MLflow 对接 LLM 评估流水线。
  • 工程价值:中等
  • 建议分类:MLOps / 评估

条目 9:vLLM-Ascend 推理部署与性能调优(鲲鹏昇腾 NPU)

  • 来源:CSDN 鲲鹏昇腾开发者社区
  • URL:https://hwcomputing.csdn.net/694bc0dbbf6b0e4b285e0d72.html
  • 评分:⭐⭐⭐⭐(国产硬件 + NPU 适配,含源码编译命令)
  • 摘要:Ascend NPU 上源码编译 vLLM;SHM_SIZE=50g 共享内存配置;VLLM_TARGET_DEVICE=empty 避免 nvcc 依赖;Docker 镜像构建完整脚本。含 ModelScope 下载模型配置。
  • 工程价值:国产化推理部署路径,高价值但偏小众
  • 建议分类:推理部署 / Ascend / NPU / 国产硬件

条目 10:多模态大模型 MLOps 流水线重构指南(SITS2026 认证级)

  • 来源:CSDN 博客 · FuncFun
  • URL:https://blog.csdn.net/FuncFun/article/details/160144923
  • 评分:⭐⭐⭐(MLOps 架构认证体系)
  • 摘要:SITS2026 认证级 MLOps 架构;大模型工程化模型仓库管理方案。
  • 工程价值:中等,付费内容较多但有目录结构可参考
  • 建议分类:MLOps / 认证体系

二、Substack 高价值线索

线索 1:The AI Agents Stack (2026 Edition)

  • 来源:The AI Engineer(substack)
  • URL:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 作者:The AI Engineer(Paolo Perrone)
  • 发布时间:2026-03-11
  • 核心观点
  • Agent Stack ≠ LLM Stack:聊天机器人只需推理+RAG;Agent 需要状态管理、工具协议、持久记忆、自主推理循环、实时护栏
  • Agent Guardrails 已成为独立于 LLM Guardrails 的独立学科(2024 → 2026 演变)
  • Guardrails 现在意味着:工具调用授权、速率限制、结果验证
  • 可信度:高(AI Engineer 专业 newsletter,作者有工程背景)
  • 后续行动:建议核验文中 Agent Stack 分层模型,与 OpenClaw 架构做对比
  • 建议分类:Agent / 工程架构 / Stack

线索 2:Build a Multimodal Agentic RAG

  • 来源:Daily Dose of Data Science(substack)
  • URL:https://blog.dailydoseofds.com/p/build-a-multimodal-agentic-rag
  • 作者:Avi Chawla
  • 核心观点:Spotify/YouTube/Amazon Music 生产多模态 RAG 实践;CrewAI Flow 实现数据发现和转录流程;AssemblyAI 转录音频 + Milvus 向量库。
  • 可信度:中高(工程导向,有代码示例)
  • 后续行动:提取多模态 RAG 架构设计,补充进知识库
  • 建议分类:RAG / Multimodal / 工程实践

线索 3:Context Engineering: Path towards better Agent Engineering

  • 来源:substack.com
  • URL:https://substack.com/home/post/p-166983119
  • 核心观点:Context Engineering 包含 RAG、Prompting、State/History、Memory、Structured Outputs 五大组件;Technical Context Engineering(面向 AI 工程师)和 User Context Engineering(面向普通用户)分层。
  • 可信度:中(概念梳理型,有 Venn 图)
  • 后续行动:可作为知识库 Topic 页「Context Engineering」词条补充
  • 建议分类:Agent / Context Engineering / 概念梳理

线索 4:RAG Reimagined: 5 Breakthroughs You Should Know

  • 来源:Gradient Flow(substack)
  • URL:https://gradientflow.substack.com/p/rag-reimagined-5-breakthroughs-you
  • 作者:Ben Lorica(ODSC 主办方)
  • 核心观点:RAG 从简单检索向多模态/推理型演进;文档处理质量被低估;长上下文做近场、RAG 做远场的分层趋势。
  • 可信度:高(行业资深人士)
  • 后续行动:精读原文,提取 RAG 2026 新范式对比表
  • 建议分类:RAG / 行业洞察

三、arXiv 2026 新动态

论文 1:A-RAG: Scaling Agentic RAG via Hierarchical Retrieval Interfaces

  • 来源:arXiv:2602.03442,2026-02
  • 核心贡献:Agentic RAG 三原则;分层检索接口;Scaling Agentic RAG
  • 建议分类:RAG / Agentic RAG / arXiv

论文 2:VimRAG: Navigating Massive Visual Context via Multimodal Memory Graph

  • 来源:arXiv:2602.12735,2026-02
  • 核心贡献:视觉上下文导航;多模态记忆图
  • 建议分类:Multimodal / RAG / arXiv

论文 3:SoK: Agentic Retrieval-Augmented Generation (RAG)

  • 来源:arXiv:2603.07379v1
  • 核心贡献:Agentic RAG 系统化研究;POMDP 公式化;多阶段检索循环;Scientific Research 场景强调引用可追溯性
  • 建议分类:RAG / Survey / Agent

论文 4:Memory for Autonomous LLM Agents: Mechanisms

  • 来源:arXiv:2603.07670v1
  • 核心贡献:2022-2026 记忆机制综述;Write-Manage-Read 三维分类法;Temporal Scope × Representational Substrate × Control Policy;Agentic Memory(Yu et al., 2026)用 GRPO 训练记忆操作为 RL Action
  • 建议分类:Agent / Memory / Survey

论文 5:LLM Research Papers 2026 List (Sebastian Raschka)

  • 来源:Sebastian Raschka Newsletter(substack/magazine)
  • URL:https://magazine.sebastianraschka.com/p/llm-research-papers-2026-part1
  • 覆盖:Jan-May 2026;含 Agent Systems & Tool Use、Coding Agents 等分类;提及 Nemotron 3 Super(MoE+Mamba2 混合架构)、Qwen3.6(Gated DeltaNet)、Long Context Efficiency 在 Agent 场景的重要性
  • 建议分类:LLM / Survey / 论文列表

四、分类标签汇总

标签 条目数
MLOps 4
推理部署/vLLM 5
Agent/多智能体 5
RAG/Agentic RAG 4
Multimodal 2
架构设计 2
学习路径 1
Docker/云部署 2
评估/MLflow 1
国产硬件/Ascend 1
arXiv 2026 5
Substack 行业洞察 4

五、建议写入路径

主草稿路径/shared/research-kb/inbox/jay/2026-08-07-csdn-llm-agent-rag-research.md

如需拆分专题,可考虑: - YYYY-MM-DD-vllm-deployment-guide.md(推理部署专题) - YYYY-MM-DD-agentic-rag-systems.md(RAG/Agentic RAG 专题) - YYYY-MM-DD-agent-stack-2026.md(Stack 架构专题)


六、后续行动建议

精读(高优先级)

  1. vLLM 大模型部署与推理加速实战(CSDN,版本/命令齐全,可直接复现)
  2. AI Agent 开发技术完全学习指南(体系最完整,含面试映射)
  3. The AI Agents Stack (2026 Edition)(Substack,工程视角 Stack 分层)
  4. SoK: Agentic RAG(arXiv,系统化 RAG Survey)

审稿(建议)

  • RAG 2026 新范式对比表(LazyGraphRAG / Agentic RAG / GraphRAG v2)
  • Context Engineering vs Prompt Engineering vs RAG 边界定义

知识库 Topic 页更新建议

  • 新增/更新:Agent Stack 2026Agentic RAGvLLM 部署Memory in LLM Agents