CSDN 高价值技术检索 + Substack 研究线索
Jay · 2026-08-17 上午 检索范围:CSDN / Substack / 学术平台 标签:LLM推理 · RAG · Agent · vLLM · SGLang · LangGraph · MCP · KV Cache · 安全
一、CSDN 高价值条目
🔥 高价值 — 源码级 / 实测数据 / 生产案例
1. vLLM vs SGLang 推理框架性能横评(2026 最新实测)
- 来源:
blog.csdn.net/yu808454/article/details/163394780 - 作者:yu808454
- 发布日期:2026-07(最新推荐)
- 阅读量:~436(低传播,但内容深度高)
- 工程价值:⭐⭐⭐⭐⭐
- 覆盖 2026 年最新版本,覆盖多场景量化实测
- 含前缀重复场景(RAG/多轮对话)、低延迟敏感场景(TTFT)、超大模型张量并行
- 功能生态与稳定性对比,附落地选型建议
- 核心结论:SGLang 在前缀共享/RAG/多轮对话场景吞吐量优势明显;vLLM 在通用批量生成场景更稳
- 涉及版本:vLLM 2026最新版 / SGLang 0.5.x
- 建议分类:
LLM推理框架选型生产部署 - 后续行动:精读——提取实测数据表格,补充进推理框架对比知识节点
2. 三大主流推理框架汇总:vLLM · SGLang · FlashInfer
- 来源:
blog.csdn.net/weixin_47196664/article/details/161349331 - 作者:weixin_47196664
- 发布日期:2026-05-23(推荐至 2026-07-18)
- 阅读量:~689
- 工程价值:⭐⭐⭐⭐⭐
- 系统三层架构解析(PagedAttention / RadixAttention / Compressed FSM / Overlap Scheduler)
- DeepSeek MLA + MTP 支持分析
- 多模型端侧部署推荐优先级
- 框架选型建议
- 涉及版本:SGLang 0.4.3+ / FlashInfer 2026
- 建议分类:
LLM推理系统架构框架对比 - 后续行动:精读——提取关键优化点性能提升数据
3. SGLang + vLLM + Qwen3.5 企业级部署实操案例
- 来源:
blog.csdn.net/starzhou/article/details/158290747 - 作者:starzhou
- 发布日期:2026-02-22(最新推荐 2026-08-13)
- 阅读量:2.2k
- 工程价值:⭐⭐⭐⭐⭐
- 真实产线落地经验
- 覆盖 CUDA 环境配置、Qwen3.5 部署调优
- JSON Schema 约束与词汇表裁剪实现结构化输出
- 长上下文(131K)、多跳推理、政务/金融强结构化任务实践
- 涉及版本:Qwen3.5 / SGLang / vLLM
- 建议分类:
LLM推理Qwen生产部署结构化输出 - 后续行动:归档——补充进 Qwen 部署知识节点
4. LangGraph + MCP 多 Agent 工作流(TS 全代码真实运行验证)
- 来源:
blog.csdn.net/m0_37988015/article/details/162930380 - 发布日期:2026
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐⭐
- 明确注明:全部代码在真实环境运行验证(
@langchain/langgraph@1.4.8+@langchain/mcp-adapters@1.1.3) - 文中所有输出均为真实运行输出,非模拟
- 30分钟阅读时长
- TS 全代码——MCP Server 编排进多 Agent 工作流
- 涉及版本:LangGraph 1.4.8 / langchain-mcp-adapters 1.1.3
- 建议分类:
AgentLangGraphMCP多Agent - 后续行动:精读——提取关键代码模式和 MCP 编排逻辑
5. vLLM 源码解析(四):模型权重加载与 KV Cache 初始化
- 来源:
blog.csdn.net/weixin_42479327/article/details/141718951 - 发布日期:2024-09-08(持续推荐至 2026-08-11)
- 阅读量:1w+
- 工程价值:⭐⭐⭐⭐⭐
- 源码级解析:Block 大小计算、KV Cache 内存布局、
vllm/worker/cache_engine.py/vllm/engine/llm_engine.py代码路径 - 公式推导:每个 block 空间 =
block_size × 2 × num_heads × head_size × num_layers × dtype_size - 持续高推荐,说明是同类中常青树
- 建议分类:
LLM推理vLLM源码KVCache内存管理 - 后续行动:归档——补充进 vLLM 源码解读知识体系
6. KV-Cache 压缩技术综述(2026 最新)
- 来源:
blog.csdn.net/weixin_44762713/article/details/162072927 - 发布日期:2026
- 工程价值:⭐⭐⭐⭐
- 从显存优化到系统级协同的全链路综述
- 截至 2026 年,主流推理框架未提供标准化 KV 缓存压缩插件 API(重要工程判断)
- 大量优质算法(KVzip 等)需深度修改源码才能部署
- 生态兼容性差是当前核心痛点
- 建议分类:
KVCache推理优化内存优化 - 后续行动:归档——关注框架原生压缩 API 进展
7. GTC 2026 解读:KV Cache 存储系统加速 LLM 推理
- 来源:
blog.csdn.net/csdnnews/article/details/159433070 - 发布日期:2026-03
- 工程价值:⭐⭐⭐⭐
- 阿里云张为在 GTC 2026 Session 分享核心内容复盘
- 存算协同:存储层从"辅助支撑"向"核心驱动"转变
- NVIDIA GTC 揭示:Vera Rubin 全栈 codesign,Fabric 可编程性成为百万 token 关键
- 范式转移:从"孤立应用架构"到"模型即服务超级应用"
- 建议分类:
KVCacheGTC2026存算协同AI基础设施 - 后续行动:归档——关注阿里云 Tair 在 KV Cache 存储方向进展
8. RAG 2026 实战指南:从 Naive 到 Agentic/Graph 混合架构
- 来源:
blog.csdn.net/m0_69581581/article/details/162674291 - 发布日期:2026
- 工程价值:⭐⭐⭐⭐
- End-to-End RAG 演进方向:嵌入模型+检索器+重排序器+生成器联合训练
- 强化学习(RL)优化整个检索-生成链路
- 多模态 RAG(图像/表格/视频)和边缘 RAG(本地部署)下一波工程热点
- 端到端 RAG 是 2026 年底主流方向
- 建议分类:
RAGAgenticRAGGraphRAG2026趋势 - 后续行动:精读——提取四代架构对比和工程化建议
9. 从手写 Agent 到 LangChain/LangGraph(源码级对照)
- 来源:
blog.csdn.net/zzz_2368/article/details/162240112 - 发布日期:2026
- 工程价值:⭐⭐⭐⭐
- 源码级对照:从手写 Agent 迁移到 LangChain/LangGraph 框架的完整逻辑
- 工业级 Agent 架构设计思路
- LangChain/LangGraph 表述按 2026 年最新框架版本
- 建议分类:
AgentLangChainLangGraph框架迁移 - 后续行动:归档——提取手写到框架的迁移路径
10. RAG 2026 全面升级:Naive → Agentic RAG
- 来源:
blog.csdn.net/weixin_47547625/article/details/161535116 - 发布日期:2026-06-02
- 工程价值:⭐⭐⭐⭐
- 四代架构(Naive→Advanced→Modular→Agentic)系统梳理
- RAG 在长上下文时代三大不可替代优势
- Milvus/Chroma/FAISS 三大向量库选型指南
- LangChain+Milvus 实战 + 12条性能优化技巧
- 建议分类:
RAG向量数据库LangChainMilvus - 后续行动:归档
二、Substack 研究线索
1. The AI Engineer:AI Agents Stack 2026 Edition
- 来源:
theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition - 作者:The AI Engineer
- 可信度:高——专业 AI Engineer 技术媒体
- 核心观点:
- Agent Stack ≠ LLM Stack:Agent 需要状态管理、工具访问协议、跨会话持久记忆、自主推理循环、实时护栏,LLM Stack 不覆盖这些
- 2026 Guardrails 已成为独立学科:不再是输入/输出过滤,而是工具调用授权、限速、实际操作验证
- Agent 安全和 LLM 安全是两套不同问题
- 后续行动:值得精读,结合 OWASP Top 10 Agents 2026 一起审稿
2. Pragmatic Engineer:What is Inference Engineering?
- 来源:
open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering - 作者:Gergely Orosz
- 可信度:高
- 核心观点:
- Decode 阶段是内存带宽瓶颈,compute 在中低 batch size 下处于闲置状态
- 2026 年 AI 遍地,inference 工程化成独立岗位
- LLM 推理优化的核心矛盾:内存 vs 计算
- 后续行动:归档——提取与 inference 相关知识节点
3. OWASP Top 10 Agents & AI Vulnerabilities (2026)
- 来源:
open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents - 作者:Alex Ewerlof
- 可信度:中高——OWASP 社区标准
- 核心观点(高价值):
- LLM04 数据投毒:攻击者污染 RAG 底层数据,LLM 会将其当作ground truth
- LLM01/ASI01 提示注入 = AI 版 SQL 注入
- LLM06 过度授权:最小权限原则 + JIT 临时 Token + Human-in-the-loop
- RAG 系统中,数据和指令被拼接进同一字符串——这是根本性架构弱点
- 后续行动:结合之前已归档的 OWASP Top 10 一起更新知识节点
4. AI Engineer:vLLM vs Ollama vs SGLang vs TensorRT-LLM
- 来源:
theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt - 可信度:高
- 核心观点:
- TGI(HuggingFace Text Generation Inference)已于 2026 年进入维护模式,不再是主推
- vLLM vs SGLang vs LMDeploy 三者 2026 年 fastest inference engine 对比数据
- SGLang GitHub 和 vLLM 在 Agent 场景的差异化定位
- 后续行动:归档——补充进推理框架选型知识节点
三、分类标签总览
| 标签 | 条目数 | 代表 |
|---|---|---|
| LLM推理 | 6 | vLLM/SGLang横评、KV Cache 综述、GTC 2026 |
| RAG | 4 | Agentic/Graph混合、Naive→Agentic、RAG评估 |
| Agent | 4 | LangGraph+MCP、手写→LangGraph、AI Agents Stack |
| LangGraph/MCP | 3 | TS全代码验证、源码对照、企业级多Agent |
| KVCache | 3 | vLLM源码、LMCache、压缩技术综述 |
| 框架选型 | 3 | vLLM vs SGLang、端侧部署、三大框架汇总 |
| 安全 | 1 | OWASP Top 10 Agents 2026 |
| 存算协同 | 1 | GTC 2026 阿里云分享 |
四、写入路径与行动建议
本次实际写入路径:/shared/research-kb/inbox/jay/2026-08-17-csdn-substack-inference-rag-agent-highvalue.md
是否需要精读:
- 高优先级精读:
1. m0_37988015 — LangGraph + MCP TS 全代码(真实运行验证)
2. yu808454 — vLLM vs SGLang 2026 横评实测数据
3. OWASP Top 10 Agents 2026(结合已有归档更新)
4. The AI Engineer: AI Agents Stack 2026(与 OWASP 交叉审稿)
- 次优先级归档:
weixin_47196664— 三大框架系统解析starzhou— Qwen3.5 企业级部署m0_69581581— RAG 2026 演进指南- GTC 2026 KV Cache 存储
建议主题页更新:
- LLM推理框架 知识节点:补充 2026 横评数据和 TGI 停更信息
- Agent安全 知识节点:合并 OWASP Top 10 Agents 2026 新增条目
- RAG 知识节点:更新四代架构演进和端到端 RAG 趋势