学术研究知识库草稿 · Jay · 2026-09-19
主题
CSDN 高价值技术分享检索 · LLM 推理部署 / RAG / Agent 框架综合调研
检索范围
- CSDN(blog.csdn.net / bbs.csdn.net / adg.csdn.net):RAG 工程实战、推理部署框架对比、Agent 框架选型、MLOps 全流程
- Substack:The AI Engineer、jamwithai(AI Engineering 学习路径)
- 补充:arXiv SGLang 论文、GitHub SGLang Roadmap 2026 Q2
一、高价值 CSDN 条目
🔥 高价值 1:推理框架横评(vLLM / SGLang / TensorRT-LLM / TGI)
来源:CSDN 智能体开发者社区 · weixin_54908067 · 2026年6月
URL:https://blog.csdn.net/weixin_54908067/article/details/162260910
类型:横评对比 + 基准测试
工程价值:⭐⭐⭐⭐⭐(含真实基准数据)
核心内容摘要: - 2026年推理引擎格局:vLLM(通用)、SGLang(Agent)、TensorRT-LLM(高流量)、TGI(HF 生态) - 核心架构差异:PagedAttention vs RadixAttention vs 内核级编译优化 - vLLM 基准数据(LLaMA 3.1 8B × 1×H100):5,280 tok/s,TTFT 45ms,首 token 8ms - SGLang vs vLLM 高并发(64并发):吞吐量提升 8% - SGLang 在前缀共享/结构化输出场景优势显著 - 成本对比:SGLang + DeepSeek V4-Flash × 4×A100 = $6,336/月 → $0.06/1k tokens
评价:基准数据翔实,涵盖吞吐/延迟/成本三维度,适合做推理引擎选型决策参考。
🔥 高价值 2:TensorRT-LLM 完整指南(编译优化 + NVFP4 量化)
来源:CSDN 博客 · weixin_54908067 · 2026年6月
URL:https://blog.csdn.net/weixin_54908067/article/details/162294811
类型:深度教程 + 量化实践
工程价值:⭐⭐⭐⭐⭐
核心内容摘要: - TensorRT-LLM 架构:预编译引擎模式,运行时无需 PyTorch 依赖 - 量化方案全景:FP8(E4M3/E5M2)、FP4(NVFP4)、INT4、NF4 - NVFP4 适用场景:Blackwell+(SM100+),显存节省 ~75%,吞吐量提升 ~3× - KV Cache 量化技术细节 - 实际性能数据: - LLaMA 3.1 70B FP8 × 8×H100:TensorRT-LLM 10,200 tok/s vs vLLM 8,500 tok/s(+20%) - DeepSeek V4 (671B) × 8×B200 NVFP4:4,800 tok/s - Qwen 3.5 (397B MoE) × 8×B200 NVFP4:7,100 tok/s - In-flight Batching 调度器原理
版本信息:覆盖 TensorRT-LLM v0.18+,CUTLASS 3.x 内核
评价:目前中文互联网最完整的 TensorRT-LLM 生产部署指南,含 NVFP4 新特性,强烈推荐精读。
🔥 高价值 3:RAG 技术解析:从原理到实战
来源:CSDN BBS · weixin_42639633 · 2026年7月
URL:https://bbs.csdn.net/weixin_42639633/article/details/100221720
类型:原理 + 实战代码
工程价值:⭐⭐⭐⭐
核心内容摘要: - RAG 三层架构(检索、增强、生成) - 2025年七大前沿 RAG 技术方向 - Python 代码示例(向量检索 + LLM 生成) - 关键洞察:"检索质量决定上限,生成质量决定下限"——70%效果问题出在检索环节 - 企业级 RAG 落地实践指南
评价:覆盖面广但深度有限,适合作为 RAG 入门体系框架参考。
🔥 高价值 4:ONNX × TensorRT × vLLM 推理部署路线横评
来源:CSDN 博客 · sinat_28461591 · 2025年8月
URL:https://blog.csdn.net/sinat_28461591/article/details/147188836
类型:三条路线全链路对比
工程价值:⭐⭐⭐⭐
核心内容摘要: - 全链路评估维度:吞吐 / 首 token 延迟 / 多并发 / 内存占用 - LoRA、量化、QKV结构、streaming 支持对比 - ONNX 导出示例(Llama-2-7B-hf → ONNX → TensorRT engine) - TensorRT 编译命令示例 - vLLM PagedAttention 延迟 160ms vs TensorRT 170-200ms - 混合部署架构建议(Triton + FastAPI 多框架编排)
评价:覆盖了完整的工程决策路径,从选型到命令行示例都有。
🔥 高价值 5:8大 AI Agent 框架全方位对比
来源:CSDN 智能体开发者社区 · 咔咔学姐kk
URL:https://adg.csdn.net/69706fb1437a6b40336a3c99.html
类型:框架选型指南
工程价值:⭐⭐⭐⭐
核心内容摘要: - 8大框架对比表:LangChain、LlamaIndex、Dify、FastGPT、RAGFlow、Coze、QAnything、MaxKB - 按场景/团队能力/私有化需求三维度的选型决策树 - 2025年 AI Agent 岗位技能要求变化(字节后端 30% 要求大模型开发能力)
评价:选型决策表实用,但技术细节有限,适合作为 Agent 框架初筛参考。
🔥 高价值 6:SGLang vs vLLM 昇腾生态实测(调优后)
来源:CSDN 智能体开发者社区 · only-qi
URL:https://adg.csdn.net/695253415b9f5f31781b8c4b.html
类型:昇腾 NPU 实测对比
工程价值:⭐⭐⭐⭐(国产硬件视角稀缺)
核心内容摘要: - 实测平台:昇腾 910B × Llama 2-70B / Qwen-72B - SGLang 吞吐量提升 18%-25%,延迟降低 17%-23%,显存减少 3%-5% - 静态/动态显存分配详细数据表 - SGLang 在高并发、长文本场景优势更明显 - vLLM-ascend 在多模型适配场景更稳定
二、Substack 高价值条目
📧 The AI Engineer — "What is RAG? Retrieval-Augmented Generation Explained"
来源:https://theaiengineer.substack.com/p/what-is-rag-retrieval-augmented-generation
作者:The AI Engineer Newsletter
可信度:高(有 Harvey AI、Shopify Engineering 等真实生产案例引用)
发布时间:2025年
核心观点: - RAG 是 AI 应用的"开卷考试",解决 LLM 幻觉 + 知识固化问题 - 当前 60% 的生产级 AI 应用使用 RAG(截至2025年) - Agentic RAG 新范式:LLM 自主决定何时检索、检索什么、聚合方式 - 引用 Shopify Sidekick ICML 2025 案例
引用建议:Shopify Engineering "Building Production-Ready Agentic Systems" 可作为 Agent RAG 架构参考。
📧 The AI Engineer — "The AI Agents Stack (2026 Edition)"
来源:https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
可信度:高(The AI Engineer 是 AI Engineering 领域知名技术 Newsletter)
发布时间:2026年3月
核心洞察:
"The agent stack is not the LLM stack. A chatbot needs inference and maybe RAG. An agent needs state management across multi-step execution, tool access governed by protocols, memory that persists across sessions, autonomous reasoning loops, and guardrails."
- Agent 技术栈 6 层架构(LLM 以下的基础设施层)
- RAG 是 Agent 栈的一部分,而非全部
- 覆盖:状态管理、Tool 协议、Memory 持久化、推理循环、Guardrails
引用建议:可作为 Agent 系统架构分类框架使用。
📧 jamwithai — "How to Start with AI Engineering in end of 2025"
来源:https://jamwithai.substack.com/p/how-to-start-with-ai-engineering
可信度:中(教程型内容,观点有价值但非生产级案例)
发布时间:2025年末
核心洞察: - RAG 是 AI Engineering 的最佳起点(涵盖 ETL、Embedding、Pipeline、监控等全链路技能) - 学习路径:Search → RAG → Agentic Layer - 仅用 LLM 只能学会写 Prompt;RAG 才能学会构建真实系统
引用建议:适合作为 AI Engineering 学习路径参考框架。
三、高价值条目汇总表
| # | 条目 | 来源 | 类型 | 工程价值 | 复现价值 | 版本/日期 |
|---|---|---|---|---|---|---|
| 1 | 推理框架横评(vLLM/SGLang/TRT-LLM/TGI) | CSDN 博客 | 横评+基准 | ⭐⭐⭐⭐⭐ | 中(含命令/API 示例) | 2026-06 |
| 2 | TensorRT-LLM 完整指南(NVFP4) | CSDN 博客 | 深度教程 | ⭐⭐⭐⭐⭐ | 高(含编译命令+量化配置) | TRT-LLM v0.18+ |
| 3 | RAG 原理到实战全解 | CSDN BBS | 原理+代码 | ⭐⭐⭐⭐ | 高(含 Python 示例) | 2026-07 |
| 4 | ONNX/TRT/vLLM 三路线横评 | CSDN 博客 | 全链路对比 | ⭐⭐⭐⭐ | 高 | 2025-08 |
| 5 | 8大 Agent 框架选型对比 | CSDN 智能体社区 | 选型指南 | ⭐⭐⭐⭐ | 低(框架对比表) | 2025 |
| 6 | SGLang vs vLLM 昇腾实测 | CSDN 智能体社区 | 国产硬件实测 | ⭐⭐⭐⭐ | 中 | 2025 |
| 7 | RAG 原理+Shopify/ Harvey 案例 | The AI Engineer | 技术洞察 | ⭐⭐⭐⭐ | 低 | 2025 |
| 8 | Agent 技术栈 6 层架构 | The AI Engineer | 架构框架 | ⭐⭐⭐⭐ | 低 | 2026-03 |
| 9 | AI Engineering 学习路径 | jamwithai | 学习指南 | ⭐⭐⭐ | 低 | 2025末 |
四、分类标签
LLM推理部署/vLLM/SGLang/TensorRT-LLM/MLOpsRAG/检索系统/Agent/Agentic RAGLangChain/LlamaIndex/Dify(框架选型)昇腾NPU/国产硬件/推理优化量化/FP8/NVFP4/INT4
五、建议写入路径
- 主要草稿:
/shared/research-kb/inbox/jay/2026-09-19-csdn-llm-inference-rag-agent-tech-survey.md - 建议主题页更新:RAG 技术栈 / LLM 推理部署框架对比
- 建议精读: 1. 条目2(TensorRT-LLM 完整指南)— 含 NVFP4 最新量化方案 2. 条目1(推理框架横评)— 含 2026年最新基准数据 3. The AI Engineer "Agent Stack 2026" — 架构分类框架价值高
- 建议审稿:条目6(昇腾生态数据)— 国产硬件视角稀缺,值得多源核验
六、后续行动
- 核验条目6(昇腾实测数据):在昇腾官方文档或 ascendai.csdn.net 核实 SGLang/vLLM-ascend 性能数据
- 追踪 SGLang 2026 Q2 Roadmap:关注 Multi-modal LLM、SGLang Omni、Reinforcement Learning 集成进展(GitHub Issue #22949)
- 条目2 TensorRT-LLM 完整指南:建议提取其中 NVFP4 编译命令单独归档,供后续复现使用
- The AI Engineer Shopify Sidekick 案例:建议追溯 ICML 2025 原始论文或 Shopify 工程博客
草稿生成时间:2026-09-19 08:20 CST · Jay · 本实例草稿目录