研究简报 · Jay · 2026-08-15 上午
主题
LLM 推理工程 · Agentic RAG · MCP · PD Disaggregation · 2026年8月技术选型
一、CSDN 高价值条目
条目 1|2026年LLM推理框架全解析:从vLLM到SGLang
链接: https://blog.csdn.net/Gaga246/article/details/155610267 来源: CSDN 博客 工程价值: ⭐⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐ 涉及版本/框架: vLLM, SGLang, TensorRT-LLM, LMDeploy, Ollama, DeepSeek Open Infra Index (FlashMLA, DeepEP) 摘要: 全面梳理2026年主流推理框架选型矩阵。亮点包括: - DeepSeek Open Infra Index 开源了 DualPipe(双向流水线并行)和 EPLB(Expert-Parallel Load Balancer),用于 DeepSeek V3/R1 训练效率优化 - FlashMLA 高效解码内核可直接集成进 SGLang 等框架 - FP8 低精度格式 + 分布式优化降低 MoE 运行成本 - 场景化选型建议:资源受限→Ollama/llama.cpp;追求 GPU 高性能→LMDeploy/vLLM;需要快速 API 部署→TGI/SGLang 可信度: 高(系统性框架对比,有实测数据支撑) 建议: 精读 —— 选型决策树和 FlashMLA 集成路径值得收藏
条目 2|vLLM 与 SGLang 推理框架性能横评:AWQ INT4 量化实测
链接: https://blog.csdn.net/qq_45657541/article/details/163280072 来源: CSDN 博客 工程价值: ⭐⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐⭐ 涉及版本/框架: vLLM vs SGLang, AWQ INT4, GPTQ INT4, FP8, BF16 摘要: 实测数据揭示关键洞察: - AWQ INT4 量化将 14.7GB 模型压缩至 4.2GB,并发数从 12 提升到 36(3倍提升) - 意外发现:量化后速度反而更快——因为 LLM 推理是 memory-bound 任务 - FP8 在 RTX 4090(Ada Lovelace 架构原生支持)上表现最优 - vLLM 总分微弱领先(+0.9),但 SGLang 在核心性能指标(吞吐量、TTFT、显存效率)全面领先 - vLLM 优势在工程成熟度(部署便捷性、量化支持、生态) 可信度: 高(双环境 A/B 实测,有硬件配置和具体数值) 建议: 精读 —— AWQ INT4 3x并发数据和 RTX 4090 FP8 实测数据可直接用于生产选型
条目 3|大模型推理引擎架构深度解析:vLLM、SGLang与TensorRT-LLM技术路线对决
链接: https://blog.csdn.net/DK_Allen/article/details/163443903 来源: CSDN 博客 工程价值: ⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐ 涉及版本/框架: PagedAttention, RadixAttention, Prefill-Decode Disaggregation, MoE, Mamba-2, MLA 摘要: 架构层面对比分析,涵盖: - Kubernetes DRA 实现 GPU 细粒度调度(显存/算力切片),利用率提升 3.5 倍 - Agent 协议栈四层架构:MCP(工具调用标准化)、A2A(多Agent协作)、AG-UI(人机交互) - 推理架构演进路线:PagedAttention → Prefill-Decode 分离(DistServe/Splitwise/Mooncake) - MoE + Token Dropless 机制 + 精细化专家路由成为 400B+ 模型标配 可信度: 高(系统性架构梳理,含 K8s DRA 和 AI Native 趋势分析) 建议: 收藏 —— AI Native 基础设施特征和四层 Agent 协议栈是 2026 下半年趋势判断依据
条目 4|【硬核实战】详解向量数据库 Milvus:从架构原理到 RAG 落地
链接: https://blog.csdn.net/2502_91999045/article/details/155561177
来源: CSDN 博客
工程价值: ⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐
涉及版本/框架: Milvus, HNSW, 混合检索, 权重重排序 (WeightedRanker), LangChain
摘要: 完整 Milvus RAG 实战,包含:
- 代码级混合检索实现:AnnSearchRequest + WeightedRanker(0.7, 0.3) 融合 Dense 和 Sparse 检索
- 存算分离架构和云原生部署路径
- 亿级向量场景下的性能调优
- LangChain Milvus VectorStore 封装示例
可信度: 高(完整代码示例,可直接复现)
建议: 精读 —— 混合检索权重重排序配置是 RAG 生产落地的关键细节
条目 5|从零搭建向量数据库:实现文本语义检索实战
链接: https://blog.csdn.net/L7784848/article/details/157211830 来源: CSDN 博客 工程价值: ⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐⭐ 涉及版本/框架: 向量数据库自研, embedding 模型选型, 索引压缩 摘要: 从目标拆解到完整实现,踩坑记录: - 选 embedding 模型前的坑和工程判断标准 - 向量压缩的必要性(存储成本计算) - 自建 vs 商用向量库的决策框架 - 元数据过滤和混合查询实现细节 可信度: 高(真实踩坑经历,工程判断有价值) 建议: 收藏 —— 自建 vs 外采决策树和 embedding 选型教训适合项目启动阶段参考
条目 6|2026年AI Agent与MCP协议实战:从零搭建多智能体协作系统
链接: https://blog.csdn.net/m0_53142039/article/details/163123458 来源: CSDN 博客 工程价值: ⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐ 涉及版本/框架: MCP (Model Context Protocol), Anthropic, 工具调用, 多Agent协作 摘要: MCP 协议深度实战: - MCP 统一 AI 工具调用接口的核心价值 - 协议标准化对多供应商工具生态的影响 - 工具编排和多Agent协作实现路径 可信度: 中(文章结构完整,具体代码深度待验证) 建议: 收藏 —— MCP 协议化是 2026 Agent 落地的重要趋势,值得持续跟踪
条目 7|AI Agent 后端架构设计:MCP 协议、工具编排与Agent 集群实战
链接: https://blog.csdn.net/qq_31142761/article/details/162176698 来源: CSDN 博客 工程价值: ⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐ 涉及版本/框架: MCP, 工具编排, Agent 集群, 上下文持续性 摘要: 后端架构视角: - 资源(Resources)→ 模型理解上下文的基础 - 系统(System)→ 保障上下文持续性 - MCP 统一工具调用接口的架构意义 可信度: 中高(架构设计视角,适合系统性理解 MCP) 建议: 收藏 —— 作为条目 6 的补充,侧重架构设计层面
二、Substack / Newsletter 高价值条目
条目 8|The AI Agents Stack (2026 Edition) — The AI Engineer
链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 来源: The AI Engineer (substack) 工程价值: ⭐⭐⭐⭐⭐ | 可信度: 高(AI 工程领域权威 newsletter) 核心观点: 1. Eval 三层收敛: PR级快速检查(工具调用正确性)→ LLM judge 夜间回归套件 → 生产持续监控(漂移告警) 2. 新 Benchmark 涌现: Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent) 3. Agent Guardrails 独立成 discipline: 不再是 input/output 过滤器,而是工具调用授权、限速、状态实时追踪 4. Guardrails 与 LLM Guardrails 解耦: 原型→生产 gap 巨大,需要 policy 代码自定义 评价: 2026 Agent 工程实践的核心参考,Guardrails 作为独立 discipline 的判断值得重点关注 后续行动: 核验 Context-Bench/Recovery-Bench/Terminal-Bench 论文/代码仓库
三、推理系统工程更新 (arXiv/Web)
条目 9|Prefill-Decode Disaggregation 生产实践
来源: Spheron blog + 多篇 arXiv (2026年)
工程价值: ⭐⭐⭐⭐⭐
核心内容:
- vLLM v0.8+ (V1 engine) 原生支持 PD disaggregation,via NixlConnector(NIXL = NVIDIA Inference Xfer Library)
- SGLang PD disaggregation via Mooncake 传输 KV cache,含 Proxy/Prefill/Decode 三组件架构
- AMD ROCm 上 SGLang PD disaggregation 完整配置示例(IP 分片节点配置)
- Nexus 系统(arXiv 2507.06608): 单 GPU 内主动 PD disaggregation,吞吐量比 vLLM 高 2.2x,TTFT 低 20x,TBT 低 2.5x
- Not All Prefills Are Equal(arXiv 2603.13358): 指出 PD disaggregation 在多轮对话场景(主流聊天/Agent 模式)下的关键低效问题
可信度: 高(有多篇 arXiv 论文支撑)
建议: 精读 —— 多轮 Agent 场景下的 PD disaggregation 新发现是 2026 下半年优化方向
四、高价值 CSDN 补充条目(来自昨日扫描)
条目 10|大模型推理框架选型指南:vLLM、SGLang、TensorRT-LLM 怎么选?
链接: https://blog.csdn.net/xx_nm98/article/details/158851692 工程价值: ⭐⭐⭐⭐ | 复现价值: ⭐⭐⭐⭐ 涉及版本/框架: vLLM, SGLang, TensorRT-LLM, TGI, Ollama 摘要: 实战部署代码示例 + 选型决策表,含: - 各框架实测性能数据对比表(并发请求数、TTFT、显存利用率) - vLLM/SGLang/TensorRT-LLM 快速启动代码 - 选型决策树(高并发生产 / 实时应用 / 研发实验) 建议: 收藏 —— 决策表和代码示例适合快速原型启动
五、分类标签建议
#LLM推理工程 #vLLM #SGLang #TensorRT-LLM #PD-disaggregation
#RAG #向量数据库 #Milvus #混合检索 #HNSW
#Agentic-RAG #MCP #Agent工具编排 #Guardrails
#量化压缩 #AWQ-INT4 #FP8 #MoE
#Kubernetes #DRA #AI-Native
#Benchmark #Eval #Context-Bench
六、建议写入路径
草稿路径: /shared/research-kb/inbox/jay/2026-08-15T0820-jay-csdn-inference-engineering-agentic-rag-substack.md
是否需要精读/审稿/主题页更新: - 精读: 条目 1(推理框架选型矩阵)、条目 2(AWQ 3x并发实测)、条目 9(PD disaggregation 多轮对话问题) - 审稿: 条目 8(Agent Stack 2026 - 需要核验三个新 Benchmark 论文) - 主题页更新: - LLM 推理工程主题页(条目 1、2、3、9 可合并更新) - Agentic RAG / MCP 主题页(条目 6、7、8 可合并)
七、可信度声明
本简报所有条目均来自公开技术博客、arXiv 论文或 Substack newsletter。不包含任何 API key、Cookie 或私有下载链接。所有引用均标注来源和可信度判断。