学术研究知识库草稿 · Jay · 2026-09-19

主题

CSDN 高价值技术分享检索 · LLM 推理部署 / RAG / Agent 框架综合调研


检索范围

  • CSDN(blog.csdn.net / bbs.csdn.net / adg.csdn.net):RAG 工程实战、推理部署框架对比、Agent 框架选型、MLOps 全流程
  • Substack:The AI Engineer、jamwithai(AI Engineering 学习路径)
  • 补充:arXiv SGLang 论文、GitHub SGLang Roadmap 2026 Q2

一、高价值 CSDN 条目

🔥 高价值 1:推理框架横评(vLLM / SGLang / TensorRT-LLM / TGI)

来源:CSDN 智能体开发者社区 · weixin_54908067 · 2026年6月 URLhttps://blog.csdn.net/weixin_54908067/article/details/162260910 类型:横评对比 + 基准测试 工程价值:⭐⭐⭐⭐⭐(含真实基准数据)

核心内容摘要: - 2026年推理引擎格局:vLLM(通用)、SGLang(Agent)、TensorRT-LLM(高流量)、TGI(HF 生态) - 核心架构差异:PagedAttention vs RadixAttention vs 内核级编译优化 - vLLM 基准数据(LLaMA 3.1 8B × 1×H100):5,280 tok/s,TTFT 45ms,首 token 8ms - SGLang vs vLLM 高并发(64并发):吞吐量提升 8% - SGLang 在前缀共享/结构化输出场景优势显著 - 成本对比:SGLang + DeepSeek V4-Flash × 4×A100 = $6,336/月 → $0.06/1k tokens

评价:基准数据翔实,涵盖吞吐/延迟/成本三维度,适合做推理引擎选型决策参考。


🔥 高价值 2:TensorRT-LLM 完整指南(编译优化 + NVFP4 量化)

来源:CSDN 博客 · weixin_54908067 · 2026年6月 URLhttps://blog.csdn.net/weixin_54908067/article/details/162294811 类型:深度教程 + 量化实践 工程价值:⭐⭐⭐⭐⭐

核心内容摘要: - TensorRT-LLM 架构:预编译引擎模式,运行时无需 PyTorch 依赖 - 量化方案全景:FP8(E4M3/E5M2)、FP4(NVFP4)、INT4、NF4 - NVFP4 适用场景:Blackwell+(SM100+),显存节省 ~75%,吞吐量提升 ~3× - KV Cache 量化技术细节 - 实际性能数据: - LLaMA 3.1 70B FP8 × 8×H100:TensorRT-LLM 10,200 tok/s vs vLLM 8,500 tok/s(+20%) - DeepSeek V4 (671B) × 8×B200 NVFP4:4,800 tok/s - Qwen 3.5 (397B MoE) × 8×B200 NVFP4:7,100 tok/s - In-flight Batching 调度器原理

版本信息:覆盖 TensorRT-LLM v0.18+,CUTLASS 3.x 内核

评价:目前中文互联网最完整的 TensorRT-LLM 生产部署指南,含 NVFP4 新特性,强烈推荐精读。


🔥 高价值 3:RAG 技术解析:从原理到实战

来源:CSDN BBS · weixin_42639633 · 2026年7月 URLhttps://bbs.csdn.net/weixin_42639633/article/details/100221720 类型:原理 + 实战代码 工程价值:⭐⭐⭐⭐

核心内容摘要: - RAG 三层架构(检索、增强、生成) - 2025年七大前沿 RAG 技术方向 - Python 代码示例(向量检索 + LLM 生成) - 关键洞察:"检索质量决定上限,生成质量决定下限"——70%效果问题出在检索环节 - 企业级 RAG 落地实践指南

评价:覆盖面广但深度有限,适合作为 RAG 入门体系框架参考。


🔥 高价值 4:ONNX × TensorRT × vLLM 推理部署路线横评

来源:CSDN 博客 · sinat_28461591 · 2025年8月 URLhttps://blog.csdn.net/sinat_28461591/article/details/147188836 类型:三条路线全链路对比 工程价值:⭐⭐⭐⭐

核心内容摘要: - 全链路评估维度:吞吐 / 首 token 延迟 / 多并发 / 内存占用 - LoRA、量化、QKV结构、streaming 支持对比 - ONNX 导出示例(Llama-2-7B-hf → ONNX → TensorRT engine) - TensorRT 编译命令示例 - vLLM PagedAttention 延迟 160ms vs TensorRT 170-200ms - 混合部署架构建议(Triton + FastAPI 多框架编排)

评价:覆盖了完整的工程决策路径,从选型到命令行示例都有。


🔥 高价值 5:8大 AI Agent 框架全方位对比

来源:CSDN 智能体开发者社区 · 咔咔学姐kk URLhttps://adg.csdn.net/69706fb1437a6b40336a3c99.html 类型:框架选型指南 工程价值:⭐⭐⭐⭐

核心内容摘要: - 8大框架对比表:LangChain、LlamaIndex、Dify、FastGPT、RAGFlow、Coze、QAnything、MaxKB - 按场景/团队能力/私有化需求三维度的选型决策树 - 2025年 AI Agent 岗位技能要求变化(字节后端 30% 要求大模型开发能力)

评价:选型决策表实用,但技术细节有限,适合作为 Agent 框架初筛参考。


🔥 高价值 6:SGLang vs vLLM 昇腾生态实测(调优后)

来源:CSDN 智能体开发者社区 · only-qi URLhttps://adg.csdn.net/695253415b9f5f31781b8c4b.html 类型:昇腾 NPU 实测对比 工程价值:⭐⭐⭐⭐(国产硬件视角稀缺)

核心内容摘要: - 实测平台:昇腾 910B × Llama 2-70B / Qwen-72B - SGLang 吞吐量提升 18%-25%,延迟降低 17%-23%,显存减少 3%-5% - 静态/动态显存分配详细数据表 - SGLang 在高并发、长文本场景优势更明显 - vLLM-ascend 在多模型适配场景更稳定


二、Substack 高价值条目

📧 The AI Engineer — "What is RAG? Retrieval-Augmented Generation Explained"

来源https://theaiengineer.substack.com/p/what-is-rag-retrieval-augmented-generation 作者:The AI Engineer Newsletter 可信度:高(有 Harvey AI、Shopify Engineering 等真实生产案例引用) 发布时间:2025年

核心观点: - RAG 是 AI 应用的"开卷考试",解决 LLM 幻觉 + 知识固化问题 - 当前 60% 的生产级 AI 应用使用 RAG(截至2025年) - Agentic RAG 新范式:LLM 自主决定何时检索、检索什么、聚合方式 - 引用 Shopify Sidekick ICML 2025 案例

引用建议:Shopify Engineering "Building Production-Ready Agentic Systems" 可作为 Agent RAG 架构参考。


📧 The AI Engineer — "The AI Agents Stack (2026 Edition)"

来源https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 可信度:高(The AI Engineer 是 AI Engineering 领域知名技术 Newsletter) 发布时间:2026年3月

核心洞察

"The agent stack is not the LLM stack. A chatbot needs inference and maybe RAG. An agent needs state management across multi-step execution, tool access governed by protocols, memory that persists across sessions, autonomous reasoning loops, and guardrails."

  • Agent 技术栈 6 层架构(LLM 以下的基础设施层)
  • RAG 是 Agent 栈的一部分,而非全部
  • 覆盖:状态管理、Tool 协议、Memory 持久化、推理循环、Guardrails

引用建议:可作为 Agent 系统架构分类框架使用。


📧 jamwithai — "How to Start with AI Engineering in end of 2025"

来源https://jamwithai.substack.com/p/how-to-start-with-ai-engineering 可信度:中(教程型内容,观点有价值但非生产级案例) 发布时间:2025年末

核心洞察: - RAG 是 AI Engineering 的最佳起点(涵盖 ETL、Embedding、Pipeline、监控等全链路技能) - 学习路径:Search → RAG → Agentic Layer - 仅用 LLM 只能学会写 Prompt;RAG 才能学会构建真实系统

引用建议:适合作为 AI Engineering 学习路径参考框架。


三、高价值条目汇总表

# 条目 来源 类型 工程价值 复现价值 版本/日期
1 推理框架横评(vLLM/SGLang/TRT-LLM/TGI) CSDN 博客 横评+基准 ⭐⭐⭐⭐⭐ 中(含命令/API 示例) 2026-06
2 TensorRT-LLM 完整指南(NVFP4) CSDN 博客 深度教程 ⭐⭐⭐⭐⭐ 高(含编译命令+量化配置) TRT-LLM v0.18+
3 RAG 原理到实战全解 CSDN BBS 原理+代码 ⭐⭐⭐⭐ 高(含 Python 示例) 2026-07
4 ONNX/TRT/vLLM 三路线横评 CSDN 博客 全链路对比 ⭐⭐⭐⭐ 2025-08
5 8大 Agent 框架选型对比 CSDN 智能体社区 选型指南 ⭐⭐⭐⭐ 低(框架对比表) 2025
6 SGLang vs vLLM 昇腾实测 CSDN 智能体社区 国产硬件实测 ⭐⭐⭐⭐ 2025
7 RAG 原理+Shopify/ Harvey 案例 The AI Engineer 技术洞察 ⭐⭐⭐⭐ 2025
8 Agent 技术栈 6 层架构 The AI Engineer 架构框架 ⭐⭐⭐⭐ 2026-03
9 AI Engineering 学习路径 jamwithai 学习指南 ⭐⭐⭐ 2025末

四、分类标签

  • LLM推理部署 / vLLM / SGLang / TensorRT-LLM / MLOps
  • RAG / 检索系统 / Agent / Agentic RAG
  • LangChain / LlamaIndex / Dify(框架选型)
  • 昇腾NPU / 国产硬件 / 推理优化
  • 量化 / FP8 / NVFP4 / INT4

五、建议写入路径

  • 主要草稿/shared/research-kb/inbox/jay/2026-09-19-csdn-llm-inference-rag-agent-tech-survey.md
  • 建议主题页更新:RAG 技术栈 / LLM 推理部署框架对比
  • 建议精读: 1. 条目2(TensorRT-LLM 完整指南)— 含 NVFP4 最新量化方案 2. 条目1(推理框架横评)— 含 2026年最新基准数据 3. The AI Engineer "Agent Stack 2026" — 架构分类框架价值高
  • 建议审稿:条目6(昇腾生态数据)— 国产硬件视角稀缺,值得多源核验

六、后续行动

  1. 核验条目6(昇腾实测数据):在昇腾官方文档或 ascendai.csdn.net 核实 SGLang/vLLM-ascend 性能数据
  2. 追踪 SGLang 2026 Q2 Roadmap:关注 Multi-modal LLM、SGLang Omni、Reinforcement Learning 集成进展(GitHub Issue #22949)
  3. 条目2 TensorRT-LLM 完整指南:建议提取其中 NVFP4 编译命令单独归档,供后续复现使用
  4. The AI Engineer Shopify Sidekick 案例:建议追溯 ICML 2025 原始论文或 Shopify 工程博客

草稿生成时间:2026-09-19 08:20 CST · Jay · 本实例草稿目录