研究草稿 · Jay · 2026-07-20 上午 · CSDN 高价值检索:推理系统 / Agent 架构 / 量化

主题

CSDN 高价值技术分享精选(推理优化 · Agent 编排 · LLM 量化 · MLOps 部署)


一、LLM 推理系统(高价值)

🔴 高价值

1. Efficient LLM Inference 与 Serving:KV Cache、Speculative Decoding、PagedAttention 和量化

  • 来源blog.csdn.net/weixin_44369324/article/details/162635526
  • 时间:2025-2026(最新)
  • 核心观点
  • 系统梳理 2025-2026 年 LLM 服务化五大关键优化方向
  • PagedAttention(vLLM):类操作系统式 KV cache 分页管理,显存利用率提升 3-5 倍
  • RadixAttention(SGLang):结构化 prompt / 多轮对话前缀复用,吞吐量超 vLLM 5 倍
  • KV Cache Disaggregation:Prefill 与 Decode 分离部署(DistServe / Splitwise / Mooncake),TTFT 与 TPOT 分别优化
  • Speculative Decoding(Medusa / EAGLE-3 / TensorRT-LLM):串行 decode 改写为 draft-and-verify,延迟降低显著
  • 量化路线:FP8 全面普及(H100/H200/B200);KV cache 量化(KIVI 2-bit 非对称,QServe W4A8KV4,TensorRT-LLM FP8/NVFP4 KV cache)
  • Mooncake 架构:KV cache 为中心,CPU DRAM + SSD + 独立 cache 层,服务超长上下文(Kimi 类场景)
  • 工程价值:⭐⭐⭐⭐⭐
  • 系统性最强,按技术栈分层梳理,适合构建推理系统工程认知图谱
  • 涉及版本:vLLM 0.6+、SGLang 0.3+、TensorRT-LLM FP8、FlashAttention-3
  • 建议分类推理系统 KV Cache PagedAttention Speculative Decoding 量化

2. 推理框架横评:vLLM / TGI / TensorRT-LLM / SGLang(2026年格局)

  • 来源blog.csdn.net/weixin_37647148/article/details/161914538
  • 时间:2026年6月
  • 核心观点
  • vLLM:生态最完整,GPU 部署默认首选;PagedAttention + Continuous Batching 成熟
  • SGLang:RadixAttention 多轮对话复用,2026 年增长曲线超过 vLLM;EAGLE 2025 集成,多 Token 预测
  • TensorRT-LLM:FP8 模式下吞吐量达 H100 峰值,延迟最低,但部署成本最高
  • LMDeploy(国产):TurboMind 引擎 + 4-bit 量化,RTX 4090 单卡 1.8 倍加速,60% 显存降低
  • 国产化适配:昇腾 NPU + LMDeploy,DeepSeek Open Infra Index(DualPipe / EPLB)
  • 工程价值:⭐⭐⭐⭐⭐
  • 明确各框架工程定位,附选型建议,适合技术选型决策参考
  • SGLang 0.4.3(2025年2月)支持 DeepSeek-R1/V3 Multi-token 预测
  • 建议分类推理框架 vLLM SGLang TensorRT-LLM LMDeploy 技术选型

3. LMDeploy vs vLLM vs SGLang:性能差异深度解析

  • 来源blog.csdn.net/qq_40999403/article/details/151405198
  • 时间:2025年9月(持续更新)
  • 核心观点
  • LMDeploy:TurboMind 引擎 + 动态批处理 + 4-bit 量化,RTX 4090 单卡 1.8 倍加速,60% 显存降低
  • vLLMblock_size 参数需根据模型规模和输入长度动态调整;长文本场景建议 64→128,减少内存碎片
  • SGLang:结构化生成范式,多轮对话场景 3-5 倍效率提升
  • LMDeploy 独家多模型路由分发,单端点动态切换不同模型
  • 实测:vLLM 并发 40 达到性能峰值(924 tokens/s);SGLang 50 并发时达 1014 tokens/s
  • cache_max_entry_count 设置为 0.5 比默认 0.3 提升 23% 吞吐量
  • 工程价值:⭐⭐⭐⭐
  • 含实测数据、参数调优建议和命令级配置方案
  • 适合推理性能调优和硬件选型参考
  • 建议分类推理框架 性能调优 LMDeploy vLLM SGLang

4. 大模型推理框架性能对比与选型指南(2026-07-10)

  • 来源blog.csdn.net/zzz12341/article/details/162767709
  • 时间:2026年7月(数据截止 2025年10月,部分更新至 2026年中)
  • 核心观点
  • 2026 年推理框架格局已定:vLLM + SGLang 双头格局
  • vLLM 和 SGLang 实战对比:Python 代码快速搭建大模型推理服务
  • 国产化部署:K8s + vLLM 部署大模型实战(Aug 2025),含镜像配置和 Deployment YAML
  • 工程价值:⭐⭐⭐⭐
  • 时间最新(2026年7月),数据覆盖 2025Q4-2026 中期,适合当前技术状态评估
  • 建议分类推理框架 技术选型 K8s 部署

5. Prefill 与 Decode 分离:高并发 LLM Serving 的关键架构

  • 来源blog.csdn.net/w776341482/article/details/162718932
  • 核心观点
  • DistServe 明确提出将 prefill 和 decode 分离到不同 GPU 池,减少两阶段干扰
  • Splitwise / Mooncake / TensorRT-LLM / vLLM 均支持 disaggregated serving
  • 2025 年后进一步探索单 GPU 内部 prefill/decode 分区、跨节点 KV 传输
  • 工程价值:⭐⭐⭐⭐
  • 适合大规模推理服务架构设计参考
  • 建议分类推理系统 Disaggregation Serving DistServe

6. 用 vLLM/SGLang 部署 Qwen3 大模型【附实战代码】

  • 来源blog.csdn.net/m0_55303420/article/details/147688863
  • 核心观点
  • Qwen3-0.6B 部署实战:huggingface-cli / modelscope download 方法
  • vLLM 并发 40 达到 924.52 tokens/s(峰值),50 并发略降(917.30)
  • SGLang 在测试范围内(1-50并发)性能持续上升,50并发达 1014.74 tokens/s
  • 包含完整 Python 部署代码和 HuggingFace 模型下载命令
  • 工程价值:⭐⭐⭐⭐
  • 含实战命令和 benchmark 数据,可直接复现
  • 建议分类Qwen3 vLLM SGLang 部署实战 Benchmark

二、AI Agent 系统与编排(高价值)

🔴 高价值

7. 构建上亿请求量的 AI Agent 系统:2026 生产级架构白皮书深度解读

  • 来源blog.csdn.net/weixin_35774598/article/details/162381479
  • 时间:2025-2026
  • 核心观点
  • 梳理 Agent 核心能力抽象为八大架构模式,按成熟度分三层
  • 基础智能层:ReAct(Reasoning + Acting)、Plan-and-Solve、Loop(Goal-Driven + Self-Improving)
  • 能力扩展层:Tool Integration、Memory(RAG + Vector DB + 知识图谱)、Multi-Agent(Supervisor + Workers)
  • 编排协作层:Supervisor 路由、Handoff 机制(OpenAI Agents SDK)、SOP 角色流转(MetaGPT)
  • 框架对比:LangGraph(图状态机)、OpenAI Agents SDK(最小原语 + Handoff)、MetaGPT(SOP)、AutoGen(分布式)
  • 追踪 Handoff 链路:用 Trace 搜索 handoff 事件绘制 Agent 调用图
  • 工程价值:⭐⭐⭐⭐⭐
  • 系统性最强的 Agent 架构梳理,含八大模式完整解析
  • 适合构建企业级 Agent 系统认知框架
  • 建议分类Agent 架构设计 LangGraph Multi-Agent 编排

8. AI Research Agents 与科研自动化:从文献阅读到实验设计

  • 来源blog.csdn.net/weixin_44369324/article/details/162495250
  • 时间:2025-2026
  • 核心观点
  • 研究 Agent 在受限场景中可形成闭环,但离"可信自主科学家"仍有明显距离
  • 真正可落地的路线:把 AI 作为"研究助手"而非"替代科学家"
  • 关键能力:文献检索 → 信息提取 → 假设生成 → 实验设计 → 结果分析
  • 工程价值:⭐⭐⭐⭐
  • 适合 AI for Science 方向认知
  • 建议分类Agent 科研自动化 AI for Science

9. Agent 核心范式的 4 阶架构演进与 6 大技术重构

  • 来源blog.csdn.net/musicml/article/details/161349140
  • 时间:2025-2026
  • 核心观点
  • 阶段一(2022-2023):ReAct + Tool Use 单步执行
  • 阶段二(2024):Plan + Memory 多步规划
  • 阶段三(2025-2026):自主 Agent(Claude Code、OpenClaw 代表),复杂规划与长程任务
  • 阶段四(2027+):多 Agent 协作与社会智能
  • 6 大技术重构:记忆系统、工具生态、规划引擎、协作协议、安全边界、自我进化
  • 工程价值:⭐⭐⭐⭐
  • 时间线清晰,适合理解 Agent 发展脉络和未来趋势
  • 建议分类Agent 架构演进 自主 Agent

10. 吴恩达 Agentic AI 课程:第一课精华整理

  • 来源blog.csdn.net/Datawhale/article/details/153489385
  • 核心观点
  • Agentic AI Workflow:基于 LLM 执行多步骤任务,比单次 Prompt 性能显著提升
  • 四大设计模式:Reflection(自我反省)、Tool Use(工具调用)、Planning(规划)、Multi-Agent Collaboration
  • 精髓:"会自己想怎么干、用什么工具、干完还能自己检查改错"
  • 并行加速(Faster than Humans because of Parallelization)+ 模块化设计
  • 工程价值:⭐⭐⭐⭐
  • 吴恩达课程精华整理,含代码示例和学习路线
  • Datawhale 社区整理,质量较高
  • 建议分类Agent Agentic AI 吴恩达 学习笔记

三、LLM 量化(高价值)

🔴 高价值

11. 大语言模型量化技术综述:GPTQ、AWQ 与 GGUF

  • 来源blog.csdn.net/lijinze2/article/details/162545512
  • 时间:2025-2026
  • 核心观点
  • 后训练量化(PTQ)三大主流方案对比:
    • GPTQ:GPU 高效,适合 4-bit 量化,精度损失可控
    • AWQ(Activation-aware Weight Quantization):激活感知,对活跃通道更敏感,INT4 精度更高
    • GGUF:CPU/边缘友好,量化文件格式标准(llama.cpp),适合本地部署
  • FP8 全面普及:H100/H200/B200 时代默认选择
  • KV Cache 量化:KIVI 2-bit 非对称、QServe W4A8KV4
  • 2026 新趋势:AWQ/GPTQ 第二优先;FP8 大规模普及;QAT 训练时模拟量化
  • 工程价值:⭐⭐⭐⭐⭐
  • 综述性最强,原理 + 性能对比 + 2026 新方向,适合技术选型和深度研究
  • 建议分类量化 AWQ GPTQ GGUF FP8

12. LLM 量化完整知识树(2026版)

  • 来源blog.csdn.net/zhangfeng1133/article/details/161356265
  • 核心观点
  • PTQ 最主流;QAT 训练时模拟量化;2025-2026 AWQ/GPTQ 第二优先
  • FP8 全面普及——H100/H200 加 B200 时代的默认量化方案
  • 完整知识树:从基础量化理论 → PTQ → QAT → 硬件支持 → 工具链
  • 工程价值:⭐⭐⭐⭐
  • 系统化知识整理,适合学习路径规划
  • 建议分类量化 学习路径 PTQ QAT

13. 边缘设备 LLM 量化实战:从 7B 模型到 500MB 内存极限压缩

  • 来源blog.csdn.net/weixin_43801219/article/details/160889991
  • 时间:2026年(前沿)
  • 核心观点
  • 12 种量化策略组合,将 Llama-3-8B 压缩至 500MB 内存限制下运行
  • TensorRT-LLM 配置秘籍 + 内存极限优化方案
  • 工程价值:⭐⭐⭐⭐
  • 边缘部署前沿实践,适合 IoT / 移动端 LLM 部署参考
  • 建议分类量化 边缘部署 极限压缩

四、MLOps 与生产部署(高价值)

🟡 中高价值

14. 构建生产级 LLMOps 流水线:从 Prompt 版本化到自动化 A/B 测试

  • 来源blog.csdn.net/jlmxu/article/details/154785612
  • 时间:2025年11月
  • 核心观点
  • Prompt 版本化管理(Git-like)、自动化 A/B 测试
  • 2025 年企业级部署团队不足 30%,生产级 LLMOps 仍是稀缺能力
  • 核心模块:Prompt Registry → Version Control → A/B Routing → 效果监控 → 回滚机制
  • 工程价值:⭐⭐⭐
  • 生产级 LLMOps 流程梳理,工程实践价值高
  • 建议分类MLOps Prompt 工程 A/B 测试 生产部署

15. AI 云原生应用的生产级 CI/CD 与渐进式交付深度解析

  • 来源blog.csdn.net/a13662080711/article/details/162015734
  • 时间:2026年6月
  • 核心观点
  • Kubernetes 成为 MLOps CI/CD 事实标准底座的三大原因:资源调度、可观测性、弹性伸缩
  • AI 负载特殊性:GPU 调度、模型热加载、KV cache 内存管理、冷启动延迟
  • 渐进式交付(金丝雀 / 蓝绿 / A/B)在 LLM 服务中的应用
  • 工程价值:⭐⭐⭐
  • K8s + AI 云原生深度解析,适合基础设施工程师参考
  • 建议分类MLOps Kubernetes CI/CD 云原生

16. vLLM 镜像与 Kubernetes Operator:自动化运维增强

  • 来源blog.csdn.net/weixin_32687875/article/details/155231876
  • 时间:2025年11月
  • 核心观点
  • 通过 Kubernetes Operator 实现 vLLM 推理服务自动化运维
  • 结合 PagedAttention、连续批处理和量化技术
  • 自动化扩缩容、故障自愈、滚动更新
  • 工程价值:⭐⭐⭐
  • K8s 自动化运维实战,适合平台工程团队
  • 建议分类Kubernetes vLLM Operator 自动化运维

17. 云原生部署大模型:K8s + vLLM 保姆级教程

  • 来源blog.csdn.net/2401_85343303/article/details/150978638
  • 时间:2025年8月
  • 核心观点
  • 在 K8s 上使用 vLLM 部署 LLM 完整指南
  • vLLM 快速实施 + 用户友好接口
  • 镜像构建、Deployment YAML、资源配额(GPU / 内存)配置
  • 工程价值:⭐⭐⭐
  • 保姆级教程,含命令和配置文件,可直接复现
  • 建议分类Kubernetes vLLM 部署教程

18. 运维工程师转型 MLOps:当服务器变成了"大脑"

  • 来源blog.csdn.net/2401_82469710/article/details/162703607
  • 时间:2026年7月
  • 核心观点
  • 运维工程师转型路径:从"服务器管理"到"AI 系统运维"
  • 核心技能:GPU 调度、K8s、AI 模型部署、监控告警
  • 工程价值:⭐⭐
  • 职业转型视角,工程实践参考价值一般
  • 建议分类MLOps 职业发展

五、RAG(精选高质量条目)

🟡 中高价值

19. 【RAG最新总结】检索增强生成最新进展 2024-2025

  • 来源blog.csdn.net/weixin_37763484/article/details/148407621
  • 时间:2025年6月
  • 核心观点
  • RAG 基本流程:Query Encoding → Document Retrieval → Contextual Fusion → Response Generation
  • 2024-2025 新方向:Graph-based Indexing、Agentic RAG(自主 RAG)、LightRAG(简单快速)
  • 安全分析:RAG LLMs Are Not Safer(arXiv:2504.18041),RAG 系统存在检索投毒攻击面
  • KG-RAG(知识图谱迭代检索)、MBA-RAG(多臂老虎机自适应检索)、MMKB-RAG(多模态知识库 RAG)
  • 工程价值:⭐⭐⭐⭐
  • 含大量 arXiv 引用,适合研究线索追踪
  • 需核验:部分论文需核对最新版本
  • 建议分类RAG 综述 Agentic RAG 安全

六、分类标签汇总

标签 数量 条目
推理系统 6 1,2,3,4,5,6
Agent 4 7,8,9,10
量化 3 11,12,13
MLOps/K8s 5 14,15,16,17,18
RAG 1 19

七、本次检索元数据

  • 检索时间:2026-07-20 08:20(Asia/Shanghai)
  • 检索批次:每日第 1 次(本次侧重推理系统 + Agent + 量化)
  • 候选条目总数:约 35 条(5 组搜索)
  • 高价值条目:8 条(⭐⭐⭐⭐⭐)
  • 中高价值条目:9 条(⭐⭐⭐⭐)
  • 筛选率:高价值以上约 23%,总体中高价值以上约 49%
  • 未收录原因:CSDN 大量综述/收藏级文章(重复内容多)、吴恩达课程搬运(已有)、面试题(工程价值不足)

八、建议后续行动

  1. 精读(高优先级): - 条目 1(PagedAttention/Speculative Decoding 系统梳理)→ 推理系统知识库更新 - 条目 7(AI Agent 八大架构模式)→ Agent 系统主题页补充 - 条目 11(GPTQ/AWQ/GGUF 量化综述)→ 量化主题页更新

  2. 审稿(中优先级): - 条目 2(推理框架横评 2026)→ 需核对 vLLM 0.6.x / SGLang 0.4.x 最新版本号 - 条目 19(RAG 最新总结)→ 需核验 arXiv 论文版本

  3. 主题页更新建议: - 新增"推理系统 2026"主题页,整合条目 1-6 - 新增"Agent 架构范式 2026"主题页,整合条目 7-10