CSDN 高价值技术检索 + Substack 研究线索
Jay · 2026-08-17 午间(12:20) 检索范围:CSDN / Substack / 学术平台 标签:LLM推理 · 量化压缩 · Agent/MCP · SGLang/FlashInfer · DeepSeek MoE · CUDA Graph
一、CSDN 高价值条目
🔥 高价值 — 源码级 / 实测数据 / 生产案例
1. SGLang 项目中 CUDA Graph 解码阶段性能优化分析(源码级)
- 来源:
blog.csdn.net/gitblog_00554/article/details/151436503 - 发布日期:2025(持续推荐)
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐⭐
- 实测 Qwen2.5-32B-Instruct + CUDA Graph,每轮图重放前有约 2ms GPU 空闲时间气泡
- 使用 Nsight Systems 性能分析工具,揭示了 FlashInfer 注意力后端下解码峰值吞吐 3713 tokens/s(延迟 17.24ms)
- 去除 NVTX 性能工具影响后,GPU 利用率最优配置得以还原
- 结论:CUDA Graph 在解码阶段有效,但需根据注意力后端选择做权衡
- 涉及版本:SGLang + FlashInfer + Qwen2.5-32B-Instruct
- 建议分类:
LLM推理CUDA GraphSGLang性能优化 - 后续行动:精读——提取 CUDA Graph 气泡根因分析,补充进推理性能调优知识节点
2. SGLang 项目中 FlashInfer 版本兼容性问题分析(排障级)
- 来源:
blog.csdn.net/gitblog_00885/article/details/151437102 - 发布日期:2025-09-10(最新推荐至 2026-08)
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐⭐
- 明确记录:SGLang 0.4.5 依赖 FlashInfer 0.2.3,使用 0.2.5 会导致 API 不匹配
- 根因:FlashInfer 0.2.5 移除了 CUDA 流参数,但 SGLang 代码仍尝试传递
- 错误信息完整记录:
batch_prefill_with_kv_cache_dtype_q_f16...plan() expected at most 15 argument(s) but received 16 - 解决路径:降级到 0.2.3 或等 SGLang 更新兼容版本
- 涉及版本:SGLang 0.4.5 / FlashInfer 0.2.3 vs 0.2.5
- 建议分类:
LLM推理SGLangFlashInfer版本兼容性排障经验 - 后续行动:归档——纳入 SGLang 部署排障知识库
3. vLLM 源码阅读系列(1)—— V1 Engine Core step 宏观流程
- 来源:
blog.csdn.net/m0_49133355/article/details/150391619 - 发布日期:2025(持续高推荐)
- 工程价值:⭐⭐⭐⭐⭐
- 源码级解析
vllm/vllm/v1/engine/core.py→EngineCore.step() - step() 三职责:调度(schedule)、执行(execute)、产出(output)
- 源码注释直接引用:"Schedule, execute, and make output. Returns tuple of outputs and a flag indicating whether the model was executed."
- 宏观视角清晰,适合作为 vLLM V1 架构入门跳板
- 涉及版本:vLLM V1(0.8.2+)
- 建议分类:
LLM推理vLLM源码V1架构EngineCore - 后续行动:归档——纳入 vLLM 源码解读知识体系
4. DeepSeek-V3 推理框架性能排行:2025Q1 最新测试数据(吞吐量/延迟)
- 来源:
blog.csdn.net/gitblog_00609/article/details/152102983 - 发布日期:2025Q1(持续推荐至 2026)
- 工程价值:⭐⭐⭐⭐⭐
- SGLang + DeepSeek-V3 671B:2856 tokens/s 最高吞吐(FP8 KV Cache + DP Attention)
- 核心优化:专家路由预计算 + 动态批处理 + FP8 KV Cache + DP Attention(解决 MoE 通信瓶颈)
- TensorRT-LLM:首 token 延迟 82.7ms(低延迟优化),INT4 量化下 GPU 利用率 89%
- MoE 专家负载均衡:route_scale 从 1.0→2.5 后,标准差降低 62%,吞吐量提升 15.3%,P99 延迟减少 28%
- 部署命令:
python -m sglang.launch_server --model-path /path/to/DeepSeek-V3 --tensor-parallel-size 8 --enable-fp8 --use-dp-attention - 涉及版本:DeepSeek-V3 671B / SGLang / TensorRT-LLM
- 建议分类:
LLM推理MoEDeepSeekSGLangTensorRT-LLM性能对比 - 后续行动:精读——提取性能数据表格,更新 DeepSeek MoE 部署知识节点
5. 大模型量化终极对决:FP8 vs AWQ INT4(2026 新增数据)
- 来源:
blog.csdn.net/ghjckjkjk/article/details/154137885 - 发布日期:2026-01(最新推荐至 2026-08)
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐
- FP8:H100 原生支持,E4M3(精度优先)/ E5M2(动态范围优先)两种格式
- AWQ INT4:内存占用仅 FP16 的 25%,兼容老旧设备,但需手动调参
- 关键差异:FP8 动态范围大、精度损失小,依赖新硬件;AWQ INT4 压缩更极致,部署灵活
- 选型建议:新硬件选 FP8,边缘设备选 AWQ INT4
- 涉及版本:H100 / A100 / TensorRT-LLM / vLLM
- 建议分类:
量化压缩FP8INT4AWQ推理优化 - 后续行动:归档——纳入量化选型决策树
6. LLM 推理量化评估:FP8 vs INT8 vs INT4 全面对比(学术+工程)
- 来源:
blog.csdn.net/m0_59235699/article/details/144274900 - 发布日期:2025(持续推荐)
- 工程价值:⭐⭐⭐⭐
- 基于 Llama-3.1 全系列实测,评估学术基准和现实任务
- FP8:精度损失最小(1-2%),H100/H200 原生支持
- INT8:中间方案,GPTQ 压缩率高,生态成熟
- INT4:压缩率最高(8x),但精度损失约 5%,适合延迟敏感场景
- 量化噪声方差公式:
σ² ≈ (max-min)² / (12 × 4^n),n=4 时噪声最大 - 建议分类:
量化压缩FP8INT8INT4LLM评估 - 后续行动:归档——补充进量化知识节点对比数据
7. 突破 LLM 推理瓶颈:TensorRT-LLM FP8 量化深度优化指南(2025 下半年版)
- 来源:
blog.csdn.net/gitblog_01013/article/details/151556605 - 发布日期:2025-09
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐
- 实测 Llama 3 70B + H100:FP8 推理速度提升 2.58 倍,显存减少 50%,PPL 仅增加 0.04
- KV Cache FP8 量化可减少约 50% KV 显存占用,对生成质量影响极小
- 混合精度策略:LM Head 保持 FP16,其他层用 FP8
- 校准数据集建议:128-512 个样本,与目标任务分布相似
- FP8 Rowwise 量化模式可提升精度,适合对精度敏感场景
- 涉及版本:TensorRT-LLM 0.10.0 / CUDA 12.2 / H100
- 建议分类:
量化压缩FP8TensorRT-LLMH100推理优化 - 后续行动:精读——提取 FP8 校准和混合精度策略,补充进推理优化知识节点
8. AI Agent 基础设施演进:从 MCP 协议到多智能体协作(2026 最新)
- 来源:
blog.csdn.net/DK_Allen/article/details/163127959 - 发布日期:2026-08-05
- 阅读量:765
- 工程价值:⭐⭐⭐⭐⭐
- 2026 云原生 AI Native 范式:Kubernetes DRA 实现 GPU 细粒度调度(利用率提升 3.5 倍)
- Agent 协议栈四层架构:MCP(工具层)+ A2A(多 Agent 协作层)+ AG-UI(人机交互层)
- 五大生产级 Agent 框架深度对比(完整表格)
- 多智能体协作四种编排模式,含 Swarm 子模式和生产教训
- 参考文献覆盖:Google A2A Protocol / HAL Benchmark / LangGraph v1.1 / Microsoft Agent Framework v1.0 GA / Dify v1.14
- 涉及版本:MCP 2026 / A2A / LangGraph / Dify / Kubernetes KServe
- 建议分类:
AgentMCPA2A多AgentAI基础设施2026趋势 - 后续行动:精读——提取四层协议架构图和五大框架对比表,合并更新 Agent 基础设施知识节点
9. MCP Tasks 到底解决了什么?(异步 Agent 架构级)
- 来源:
blog.csdn.net/qq_41678239/article/details/160283352 - 发布日期:2026(最新推荐)
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐
- 核心问题:同步工具调用无法处理长时任务(生成报告需 30 分钟)
- MCP 长任务设计:Tool Call → Create Task → Return taskId → 后台执行 → Notify Result
- 异步任务模式解决了 HTTP 长时间等待问题
- MCP 无状态革命(2026-07-28):让 AI Agent 工具链构建和部署变得更简单
- 建议分类:
AgentMCP异步任务架构设计 - 后续行动:归档——补充进 MCP 协议知识节点
10. AI Agent 生产链路联调:MCP 工具调用与严格验收(2026-07 月)
- 来源:
blog.csdn.net/NNNightCcc/article/details/163193444 - 发布日期:2026-07(2026 最新)
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐
- 生产链路联调视角:MCP 工具调用 + OpenAI 接口 + 严格验收流程
- 提供方法与清单指引,适合生产级 Agent 系统落地
- 涉及版本:MCP / OpenAI API
- 建议分类:
AgentMCP生产部署验收测试 - 后续行动:归档——补充进 Agent 生产落地知识节点
11. 《MCP 协议开发实战:从零搭建 AI Agent 工具链》(2026 最新全代码)
- 来源:
blog.csdn.net/qq_41581588/article/details/162914871 - 发布日期:2026(最新推荐)
- 工程价值:⭐⭐⭐⭐⭐
- 全代码实战:TypeScript 层、Service 层、Tool 层完整分层
- JSON-RPC 请求生命周期详解(含
tools/list、tools/call完整流程图) - MCP 长任务异步设计(taskId + status: "running")
- 企业封装 MCP Framework 结构:Tool SDK / Auth SDK / Registry / Gateway / Monitor / Deployment
- 涉及版本:MCP 2026 最新版
- 建议分类:
AgentMCPTypeScript工具链开发实战 - 后续行动:精读——提取完整 MCP 开发模式,补充进 MCP 协议知识节点
12. 从 N×M 到 N+M:用 MCP 协议统一 AI Agent 工具集成(协议设计级)
- 来源:
blog.csdn.net/qq_21886255/article/details/163438554 - 发布日期:2026(最新推荐)
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐
- MCP 解决了传统 M×N 集成噩梦,实现工具一次对接、生态共享
- 核心价值:工具发现标准化、客户端/服务端连接模式
- 建议分类:
AgentMCP协议设计集成架构 - 后续行动:归档——补充进 MCP 协议定位分析
13. LLM 压缩技术综述:Awesome-LLM-Compression 精选(2025 最新)
- 来源:
blog.csdn.net/gitblog_00806/article/details/141982069 - 发布日期:2026-03(最新推荐至 2026-08)
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐
- 收录 2025 年最新压缩论文精选:BitNet v2(1 位权重,40 倍压缩)、LayerPruner(30% 层数减少)、KVZip(10 万 token 95% 压缩率)
- 工具推荐:llama.cpp / vLLM / AutoFP8 / LLMC / FlashAttention-3
- 三大方向:硬件感知压缩、多技术融合(量化+剪枝+蒸馏)、动态自适应压缩
- 挑战:极端压缩性能损失控制、压缩模型泛化能力、多模态统一压缩框架
- 建议分类:
量化压缩剪枝知识蒸馏LLM压缩2025趋势 - 后续行动:归档——纳入 LLM 压缩知识节点,关注 BitNet v2 和 KVZip 最新进展
14. 大模型量化:理论、工具与决策——企业级模型压缩体系(2026 最新综合)
- 来源:
blog.csdn.net/yang2330648064/article/details/157653811 - 发布日期:2026(持续推荐)
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐⭐
- 全框架量化支持对比表(vLLM / SGLang / llama.cpp / TensorRT-LLM / TGI / Transformers)
- GPTQ vs AWQ vs FP8 选型决策树完整
- 场景化推荐:CPU 路径(llama.cpp + GGUF)、GPU 高吞吐(GPTQ + vLLM)、GPU 长上下文(EXL2 + ExLlamaV2)
- AWQ(Activation-aware Weight Quantization)核心原理:根据激活值重要性差异化处理权重
- 涉及版本:vLLM / SGLang / llama.cpp / TensorRT-LLM / TGI 2026 最新
- 建议分类:
量化压缩框架选型企业级部署决策树 - 后续行动:精读——提取完整框架对比表,纳入推理优化知识节点核心
15. vLLM 0.17.1 完整指南:源码编译 + 自定义 CUDA 内核优化
- 来源:
blog.csdn.net/weixin_34640289/article/details/155366361 - 发布日期:2025(持续推荐至 2026)
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐
- 编译源码 + 自定义 CUDA 内核的完整操作手册
- CUDA/HIP 图优化:通过预编译执行图减少内核启动开销
- 多重量化支持:GPTQ / AWQ / INT4 / INT8
- 涉及版本:vLLM 0.17.1
- 建议分类:
LLM推理vLLMCUDA内核源码编译 - 后续行动:归档——纳入 vLLM 工程化知识节点
16. DeepSeek-V2 跨平台部署:云服务器到边缘设备(MoE + MLA)
- 来源:
blog.csdn.net/gitblog_00968/article/details/154672187 - 发布日期:2025-11(持续推荐)
- 阅读量:未公开
- 工程价值:⭐⭐⭐⭐
- MLA(多头潜在注意力)+ DeepSeekMoE:2360 亿参数,每 token 仅激活 210 亿
- vLLM 优化需专用 PR #4650
- 4-bit 量化示例 + 模型蒸馏(DeepSeek-V2-Lite 16B)
- 边缘设备部署路径:量化 + 蒸馏 + 混合部署策略
- 涉及版本:DeepSeek-V2 / vLLM / MLA
- 建议分类:
LLM推理MoEDeepSeekMLA边缘部署 - 后续行动:归档——补充进 DeepSeek 部署知识节点
二、分类标签总览
| 标签 | 条目数 | 代表 |
|---|---|---|
| LLM推理 | 6 | CUDA Graph / vLLM V1 / DeepSeek-V3 排行 / DeepSeek-V2 跨平台 |
| 量化压缩 | 5 | FP8 vs INT4 / TensorRT-LLM FP8 / LLM压缩综述 / 企业级量化决策 |
| Agent/MCP | 5 | MCP协议栈 / MCP开发实战 / MCP长任务 / 生产链路联调 |
| SGLang/FlashInfer | 2 | CUDA Graph气泡 / FlashInfer版本兼容性 |
| MoE | 2 | DeepSeek-V3 性能排行 / DeepSeek-V2 跨平台 |
| 推理优化 | 2 | vLLM CUDA编译 / DeepSeek MoE 路由调参 |
| AI基础设施 | 1 | Kubernetes DRA GPU调度 / A2A协议 |
| 框架选型 | 1 | 企业级量化体系全表 |
三、写入路径与行动建议
本次实际写入路径:/shared/research-kb/inbox/jay/2026-08-17T1220-jay-csdn-inference-quantization-agent-2026.md
是否需要精读:
- 高优先级精读:
1. DK_Allen — AI Agent 基础设施四层协议架构 + 五大框架对比(2026-08-05 最新)
2. gitblog_00609 — DeepSeek-V3 推理框架排行(MoE + SGLang + TensorRT-LLM 实测数据)
3. qq_41581588 — MCP 协议开发实战全代码(2026 最新版)
4. yang2330648064 — 企业级量化压缩体系全框架对比表
5. gitblog_00554 — SGLang CUDA Graph 性能气泡分析
- 次优先级归档:
gitblog_00885— FlashInfer 版本兼容性排障(必入库)m0_49133355— vLLM V1 EngineCore step 源码gitblog_01013— TensorRT-LLM FP8 深度优化gitblog_00806— LLM 压缩综述 BitNet v2 / KVZip
建议主题页更新:
- LLM推理框架 知识节点:补充 SGLang CUDA Graph 气泡分析 + FlashInfer 版本兼容性排障
- Agent/MCP 知识节点:合并 MCP 四层协议架构 + A2A 协议 + 五大框架对比(2026-08 更新)
- 量化压缩 知识节点:更新 FP8 vs INT4 选型决策树 + 企业级量化体系全表
- DeepSeek MoE 知识节点:补充 DeepSeek-V3 671B 实测吞吐排行 + route_scale 调参数据