CSDN 高价值技术检索 + Substack 研究线索

Jay · 2026-08-17 上午 检索范围:CSDN / Substack / 学术平台 标签:LLM推理 · RAG · Agent · vLLM · SGLang · LangGraph · MCP · KV Cache · 安全


一、CSDN 高价值条目

🔥 高价值 — 源码级 / 实测数据 / 生产案例

1. vLLM vs SGLang 推理框架性能横评(2026 最新实测)

  • 来源blog.csdn.net/yu808454/article/details/163394780
  • 作者:yu808454
  • 发布日期:2026-07(最新推荐)
  • 阅读量:~436(低传播,但内容深度高)
  • 工程价值:⭐⭐⭐⭐⭐
  • 覆盖 2026 年最新版本,覆盖多场景量化实测
  • 含前缀重复场景(RAG/多轮对话)、低延迟敏感场景(TTFT)、超大模型张量并行
  • 功能生态与稳定性对比,附落地选型建议
  • 核心结论:SGLang 在前缀共享/RAG/多轮对话场景吞吐量优势明显;vLLM 在通用批量生成场景更稳
  • 涉及版本:vLLM 2026最新版 / SGLang 0.5.x
  • 建议分类LLM推理 框架选型 生产部署
  • 后续行动:精读——提取实测数据表格,补充进推理框架对比知识节点

2. 三大主流推理框架汇总:vLLM · SGLang · FlashInfer

  • 来源blog.csdn.net/weixin_47196664/article/details/161349331
  • 作者:weixin_47196664
  • 发布日期:2026-05-23(推荐至 2026-07-18)
  • 阅读量:~689
  • 工程价值:⭐⭐⭐⭐⭐
  • 系统三层架构解析(PagedAttention / RadixAttention / Compressed FSM / Overlap Scheduler)
  • DeepSeek MLA + MTP 支持分析
  • 多模型端侧部署推荐优先级
  • 框架选型建议
  • 涉及版本:SGLang 0.4.3+ / FlashInfer 2026
  • 建议分类LLM推理 系统架构 框架对比
  • 后续行动:精读——提取关键优化点性能提升数据

3. SGLang + vLLM + Qwen3.5 企业级部署实操案例

  • 来源blog.csdn.net/starzhou/article/details/158290747
  • 作者:starzhou
  • 发布日期:2026-02-22(最新推荐 2026-08-13)
  • 阅读量:2.2k
  • 工程价值:⭐⭐⭐⭐⭐
  • 真实产线落地经验
  • 覆盖 CUDA 环境配置、Qwen3.5 部署调优
  • JSON Schema 约束与词汇表裁剪实现结构化输出
  • 长上下文(131K)、多跳推理、政务/金融强结构化任务实践
  • 涉及版本:Qwen3.5 / SGLang / vLLM
  • 建议分类LLM推理 Qwen 生产部署 结构化输出
  • 后续行动:归档——补充进 Qwen 部署知识节点

4. LangGraph + MCP 多 Agent 工作流(TS 全代码真实运行验证)

  • 来源blog.csdn.net/m0_37988015/article/details/162930380
  • 发布日期:2026
  • 阅读量:未公开
  • 工程价值:⭐⭐⭐⭐⭐
  • 明确注明:全部代码在真实环境运行验证(@langchain/langgraph@1.4.8 + @langchain/mcp-adapters@1.1.3
  • 文中所有输出均为真实运行输出,非模拟
  • 30分钟阅读时长
  • TS 全代码——MCP Server 编排进多 Agent 工作流
  • 涉及版本:LangGraph 1.4.8 / langchain-mcp-adapters 1.1.3
  • 建议分类Agent LangGraph MCP 多Agent
  • 后续行动:精读——提取关键代码模式和 MCP 编排逻辑

5. vLLM 源码解析(四):模型权重加载与 KV Cache 初始化

  • 来源blog.csdn.net/weixin_42479327/article/details/141718951
  • 发布日期:2024-09-08(持续推荐至 2026-08-11)
  • 阅读量:1w+
  • 工程价值:⭐⭐⭐⭐⭐
  • 源码级解析:Block 大小计算、KV Cache 内存布局、vllm/worker/cache_engine.py / vllm/engine/llm_engine.py 代码路径
  • 公式推导:每个 block 空间 = block_size × 2 × num_heads × head_size × num_layers × dtype_size
  • 持续高推荐,说明是同类中常青树
  • 建议分类LLM推理 vLLM源码 KVCache 内存管理
  • 后续行动:归档——补充进 vLLM 源码解读知识体系

6. KV-Cache 压缩技术综述(2026 最新)

  • 来源blog.csdn.net/weixin_44762713/article/details/162072927
  • 发布日期:2026
  • 工程价值:⭐⭐⭐⭐
  • 从显存优化到系统级协同的全链路综述
  • 截至 2026 年,主流推理框架未提供标准化 KV 缓存压缩插件 API(重要工程判断)
  • 大量优质算法(KVzip 等)需深度修改源码才能部署
  • 生态兼容性差是当前核心痛点
  • 建议分类KVCache 推理优化 内存优化
  • 后续行动:归档——关注框架原生压缩 API 进展

7. GTC 2026 解读:KV Cache 存储系统加速 LLM 推理

  • 来源blog.csdn.net/csdnnews/article/details/159433070
  • 发布日期:2026-03
  • 工程价值:⭐⭐⭐⭐
  • 阿里云张为在 GTC 2026 Session 分享核心内容复盘
  • 存算协同:存储层从"辅助支撑"向"核心驱动"转变
  • NVIDIA GTC 揭示:Vera Rubin 全栈 codesign,Fabric 可编程性成为百万 token 关键
  • 范式转移:从"孤立应用架构"到"模型即服务超级应用"
  • 建议分类KVCache GTC2026 存算协同 AI基础设施
  • 后续行动:归档——关注阿里云 Tair 在 KV Cache 存储方向进展

8. RAG 2026 实战指南:从 Naive 到 Agentic/Graph 混合架构

  • 来源blog.csdn.net/m0_69581581/article/details/162674291
  • 发布日期:2026
  • 工程价值:⭐⭐⭐⭐
  • End-to-End RAG 演进方向:嵌入模型+检索器+重排序器+生成器联合训练
  • 强化学习(RL)优化整个检索-生成链路
  • 多模态 RAG(图像/表格/视频)和边缘 RAG(本地部署)下一波工程热点
  • 端到端 RAG 是 2026 年底主流方向
  • 建议分类RAG AgenticRAG GraphRAG 2026趋势
  • 后续行动:精读——提取四代架构对比和工程化建议

9. 从手写 Agent 到 LangChain/LangGraph(源码级对照)

  • 来源blog.csdn.net/zzz_2368/article/details/162240112
  • 发布日期:2026
  • 工程价值:⭐⭐⭐⭐
  • 源码级对照:从手写 Agent 迁移到 LangChain/LangGraph 框架的完整逻辑
  • 工业级 Agent 架构设计思路
  • LangChain/LangGraph 表述按 2026 年最新框架版本
  • 建议分类Agent LangChain LangGraph 框架迁移
  • 后续行动:归档——提取手写到框架的迁移路径

10. RAG 2026 全面升级:Naive → Agentic RAG

  • 来源blog.csdn.net/weixin_47547625/article/details/161535116
  • 发布日期:2026-06-02
  • 工程价值:⭐⭐⭐⭐
  • 四代架构(Naive→Advanced→Modular→Agentic)系统梳理
  • RAG 在长上下文时代三大不可替代优势
  • Milvus/Chroma/FAISS 三大向量库选型指南
  • LangChain+Milvus 实战 + 12条性能优化技巧
  • 建议分类RAG 向量数据库 LangChain Milvus
  • 后续行动:归档

二、Substack 研究线索

1. The AI Engineer:AI Agents Stack 2026 Edition

  • 来源theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
  • 作者:The AI Engineer
  • 可信度:高——专业 AI Engineer 技术媒体
  • 核心观点
  • Agent Stack ≠ LLM Stack:Agent 需要状态管理、工具访问协议、跨会话持久记忆、自主推理循环、实时护栏,LLM Stack 不覆盖这些
  • 2026 Guardrails 已成为独立学科:不再是输入/输出过滤,而是工具调用授权、限速、实际操作验证
  • Agent 安全和 LLM 安全是两套不同问题
  • 后续行动:值得精读,结合 OWASP Top 10 Agents 2026 一起审稿

2. Pragmatic Engineer:What is Inference Engineering?

  • 来源open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering
  • 作者:Gergely Orosz
  • 可信度:高
  • 核心观点
  • Decode 阶段是内存带宽瓶颈,compute 在中低 batch size 下处于闲置状态
  • 2026 年 AI 遍地,inference 工程化成独立岗位
  • LLM 推理优化的核心矛盾:内存 vs 计算
  • 后续行动:归档——提取与 inference 相关知识节点

3. OWASP Top 10 Agents & AI Vulnerabilities (2026)

  • 来源open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents
  • 作者:Alex Ewerlof
  • 可信度:中高——OWASP 社区标准
  • 核心观点(高价值):
  • LLM04 数据投毒:攻击者污染 RAG 底层数据,LLM 会将其当作ground truth
  • LLM01/ASI01 提示注入 = AI 版 SQL 注入
  • LLM06 过度授权:最小权限原则 + JIT 临时 Token + Human-in-the-loop
  • RAG 系统中,数据和指令被拼接进同一字符串——这是根本性架构弱点
  • 后续行动:结合之前已归档的 OWASP Top 10 一起更新知识节点

4. AI Engineer:vLLM vs Ollama vs SGLang vs TensorRT-LLM

  • 来源theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
  • 可信度:高
  • 核心观点
  • TGI(HuggingFace Text Generation Inference)已于 2026 年进入维护模式,不再是主推
  • vLLM vs SGLang vs LMDeploy 三者 2026 年 fastest inference engine 对比数据
  • SGLang GitHub 和 vLLM 在 Agent 场景的差异化定位
  • 后续行动:归档——补充进推理框架选型知识节点

三、分类标签总览

标签 条目数 代表
LLM推理 6 vLLM/SGLang横评、KV Cache 综述、GTC 2026
RAG 4 Agentic/Graph混合、Naive→Agentic、RAG评估
Agent 4 LangGraph+MCP、手写→LangGraph、AI Agents Stack
LangGraph/MCP 3 TS全代码验证、源码对照、企业级多Agent
KVCache 3 vLLM源码、LMCache、压缩技术综述
框架选型 3 vLLM vs SGLang、端侧部署、三大框架汇总
安全 1 OWASP Top 10 Agents 2026
存算协同 1 GTC 2026 阿里云分享

四、写入路径与行动建议

本次实际写入路径/shared/research-kb/inbox/jay/2026-08-17-csdn-substack-inference-rag-agent-highvalue.md

是否需要精读: - 高优先级精读: 1. m0_37988015 — LangGraph + MCP TS 全代码(真实运行验证) 2. yu808454 — vLLM vs SGLang 2026 横评实测数据 3. OWASP Top 10 Agents 2026(结合已有归档更新) 4. The AI Engineer: AI Agents Stack 2026(与 OWASP 交叉审稿)

  • 次优先级归档
  • weixin_47196664 — 三大框架系统解析
  • starzhou — Qwen3.5 企业级部署
  • m0_69581581 — RAG 2026 演进指南
  • GTC 2026 KV Cache 存储

建议主题页更新: - LLM推理框架 知识节点:补充 2026 横评数据和 TGI 停更信息 - Agent安全 知识节点:合并 OWASP Top 10 Agents 2026 新增条目 - RAG 知识节点:更新四代架构演进和端到端 RAG 趋势