LLM 推理系统工程文献筛选 · 2026-09-16

轮次信息

  • 筛选角色:Jay(工程筛选视角)
  • 时间:2026-09-16 10:50 UTC(+0800 第三轮)
  • 筛选标准:真实环境、命令、错误、源码、性能数据、可复现步骤
  • 检索范围:arXiv、GitHub、官方技术博客、vLLM/SGLang 社区、MLOps 平台

一、高价值条目

1. ⭐ Prefill-Decode Disaggregation 生产工程(★★★★★)

来源cloudai.pt — Prefill Decode Disaggregation Doubles Your LLM Throughput(2026-06-14)
来源spheron.network — Prefill-Decode Disaggregation on GPU Cloud(2026-06)

核心工程数据: - 生产部署实测吞吐提升:1.5x–2.5x - Together AI CPD 缓存感知版本提升达 40% 额外增益 - vLLM GB200 基准(2026-02):26,200 prefill tokens/GPU-s10,100 decode tokens/GPU-s(DeepSeek R1/V3) - 单次 32K token prefill 可导致同 GPU batch 内所有 decode 流 stall 2–30x - disaggregation 配置:4 prefill 实例(各 2× GB200)+ 1 decode 实例(8× GB200)

GPU 选型框架(2026): | 节点类型 | 需求特征 | 推荐 GPU | |---|---|---| | Prefill 节点 | 计算密集(FP8 TFLOPS) | H100 SXM5, B200, B300 | | Decode 节点 | 内存带宽+容量 | H200 SXM5 141GB HBM3e | | 小模型 Decode | 成本敏感 | A100 80GB SXM4 |

KV Cache 传输机制: - vLLM:NIXL(NVIDIA Inference Xfer Library) - AMD MI300X:MORI-IO connector - 底层:RDMA 或 TCP

保留理由:含真实 benchmark 数据、GPU 选型矩阵、部署拓扑、KV 传输协议细节,属于高密度工程内容。
后续行动:建议精读 vLLM disaggregation 配置文档(--disaggregation-mode),核对 NIXL 接口版本。


2. ⭐ SGLang vs vLLM Benchmark 对比(★★★★★)

来源particula.tech — SGLang vs vLLM in 2026: Benchmarks and When to Use Each(2026-06)
来源atomic.chat — SGLang vs vLLM: Which Inference Engine Should You Use?

核心 Benchmark(H100 并发测试): | 指标 | SGLang | vLLM | 差异 | |---|---|---|---| | 总吞吐 | ~16,200 tok/s | ~12,500 tok/s | SGLang +29% | | 输出 token 吞吐 | 894 tok/s | 413 tok/s | SGLang +117% | | TTFT(首 token 延迟) | 79 ms | 103 ms | SGLang 快 23% | | ITL(token 间延迟) | 6.0 ms | 7.1 ms | SGLang 快 15% |

并发扩展性(tok/s): | 并发数 | vLLM | SGLang | |---|---|---| | 1 | 120 | 125 | | 10 | 650 | 680 | | 50 | 1,850 | 1,920 | | 100 | 2,400 | 2,460 |

SGLang 优势场景:DeepSeek 系列(3.1x faster)、前缀共享负载(RAG、多轮对话)、结构化输出
vLLM 优势场景:多硬件(TPUs/Trainium/Gaudi)、encoder-decoder 模型、batch 处理、开发者生态

DeepSeek V3 特定数据(SGLang): - EAGLE 投机解码:batch=1 时 1.8x decode 加速,batch=32 时 1.5x - MLA(Multi-head Latent Attention)优化后端:FlashAttention3、FlashInfer、FlashMLA、CutlassMLA - 官方推荐引擎:DeepSeek 明确推荐 SGLang

RadixAttention(vs PagedAttention):在共享前缀工作负载中,SGLang 减少冗余 prefill 计算,prefix-heavy 场景可达 6.4x 收益

保留理由:含标准化 benchmark 数据、场景选型决策树、具体加速比数字。
后续行动:建议对比 vLLM 官方 benchmark 页面核验数据一致性;关注两者在长上下文场景的 KV-cache eviction 策略差异。


3. ⭐ vLLM vs TensorRT-LLM vs SGLang 工程决策框架(★★★★)

来源spheron.network — LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework (2026)(2026-08-19)
来源yottalabs.ai — vLLM vs TensorRT-LLM: Which Inference Engine Should You Use in 2026?(2026-06-09)
来源introl.com — TensorRT-LLM Optimization: Mastering NVIDIA's Inference Stack

核心权衡矩阵: | 维度 | vLLM | TensorRT-LLM | SGLang | |---|---|---|---| | 部署复杂度 | 低(无需编译) | 高(需编译步骤) | 中 | | 吞吐量 | 中 | 高(编译后峰值最优) | 高 | | 硬件覆盖 | 广(NVIDIA/AMD/TPU/Trainium) | 仅 NVIDIA | 主要 NVIDIA | | 量化格式支持 | GPTQ/AWQ/SqueezeLLM/bnb | INT8/FP8 | INT8/FP8 | | 适用场景 | 快速上线、多硬件 | 最大硬件效率 | DeepSeek/对话/结构化输出 |

推理工程师关键指标(三层权衡): 1. 吞吐量(tokens/s) 2. 延迟(TTFT / ITL / TPOT) 3. 内存(KV-cache 管理)

堆叠优化收益:模型级(量化/剪枝/蒸馏)+ 系统级(continuous batching/PagedAttention/投机解码)+ 应用级(context compression/prompt caching)综合可降低推理成本 80%+

保留理由:决策框架清晰、权衡维度具体、Triton + TensorRT-LLM 集成有生产部署步骤(trtllm-bench 基准测试命令)。
后续行动:关注 TensorRT-LLM 编译时间对迭代效率的影响;建议记录各自量化精度损失实测数据。


4. ⭐ Context Engineering 企业多智能体架构(★★★★)

来源arXiv:2603.09619 — Context Engineering: From Prompts to Corporate Multi-Agent Architecture(arXiv:2603.09619v2,2026-03-13)
来源Atlan — Context Engineering for Multi-Agent Systems: Guide 2026

五维 Context 质量标准: 1. Relevance(相关性):上下文与当前任务的相关程度 2. Sufficiency(充分性):上下文是否足够支撑决策 3. Isolation(隔离性):不同任务上下文不相互干扰 4. Economy(经济性):token 消耗与信息价值的平衡 5. Provenance(可溯源):上下文来源可追踪

Context Engineering 成熟度金字塔(四层累积模型):

                    [Specification Engineering]
                              ↑
                    [Intent Engineering]
                              ↑
                    [Context Engineering]
                              ↑
                    [Prompt Engineering]
  • Prompt Engineering(PE):单查询级
  • Context Engineering(CE):管理 Agent 决策的完整信息环境(核心参考文献:arXiv:2507.13334 — A Survey of Context Engineering,ICLR 2026,1400+ 论文)
  • Intent Engineering(IE):将组织目标、价值观、权衡层级编码进 Agent 基础设施
  • Specification Engineering(SE):构建机器可读的企业策略标准语料库,支撑大规模多智能体自主运行

多智能体 Context 四大新增挑战(vs 单智能体): - Handoff(交接) - Role boundaries(角色边界) - Shared state(共享状态) - Cross-agent accountability(跨 Agent 问责)

企业数据:75% 企业计划两年内部署 Agentic AI(Deloitte 2026),但实际部署遭遇规模化复杂性瓶颈(KPMG 2026)

内存架构 2026(4 类并行): | 类型 | 用途 | 存储 | |---|---|---| | Working Memory | 当前 session 上下文 | LLM prompt window | | Episodic Memory | 用户交互历史 | Vector DB + 结构化 DB | | Semantic Memory | 通用知识/企业文档 | Vector DB + chunking | | Procedural Memory | 典型问题 SOP | 结构化(决策树/BPMN/markdown) |

保留理由:成熟度模型可作为企业 Agent 系统架构评估框架;五维标准具备工程可操作性。
后续行动:建议核验原论文完整框架;关注 Intent Engineering 与组织 KRI(关键风险指标)的映射方式。


5. ⭐ AIRE(AI Reliability Engineering)五大工程原则(★★★★)

来源exospherehost/ai-reliability-standards — Architectural standards and best practices for building reliable AI Agents and LLM workflows(GitHub,2026 持续更新)

五大原则:

① 分配专用工程时间

建议: sprint 20% 用于可靠性工作(golden dataset 更新、eval pipeline 维护、incident review)

② 量化而非假设

关键指标:幻觉率 <0.1%,HITL(人机协作)率 <10%,可用性 >99.9% 触发条件:指标劣化时自动阻断部署

③ 优雅失败、信息失败 - 保存检查点 - 记录 Chain of Thought reasoning - 返回用户友好错误 - 支持故障后恢复

④ 人类是兜底而非依赖

设计目标:自主运行;人类升格是安全网,不是系统可靠性依赖

⑤ 接受非确定性

相同输入会产生不同输出;设计要在这种方差下成功,而非假设一致性

OWASP Agentic Top 10 2026(已发布 peer-reviewed 版本 ASI01–ASI10):目标 hijack、工具滥用、身份/权限滥用、记忆投毒、恶意 Agent

保留理由:有具体数字目标(0.1% 幻觉率)、架构约束(无 silent failure)、工程时序建议(sprint 20%)。
后续行动:需核验 OWASP ASI 系列原文;关注 HITL 率 10% 与具体业务场景的匹配性。


6. ⭐ Agentic RAG 系统化综述(★★★★)

来源arXiv:2501.09136v4 — Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG

RAG 范式演进:

Vanilla RAG → Planning-based RAG → Iterative RAG → Agentic RAG
     ↓              ↓                  ↓             ↓
  静态线性      规划步骤          多步迭代          动态路由+自主决策

Agentic RAG 核心能力: - LLM Controller 在运行时决定:是否检索、何时检索、是否迭代 - 自适应检索(Adaptive RAG):用分类器评估查询复杂度,动态选择策略(单步/多步/跳过检索) - 超越静态 RAG 的多步推理、深度上下文理解、迭代响应优化

评估维度:Factual grounding、Relevance、Timeliness

保留理由:RAG 系统化演进路线图,为架构选型提供依据;自适应检索策略对工程落地有直接指导价值。
后续行动:建议阅读原论文 Section 4(Agentic Pipeline 设计模式);关注与 LangChain/LlamaIndex 实现路径的对比。


7. ⭐ RAG-Stack 联合优化框架(★★★★)

来源arXiv:2608.03487v1 — RAG-Stack: Co-Optimizing RAG Serving Performance and Quality

核心贡献:将 RAG 系统配置选择(检索索引、模型选择、检索调用时机)统一建模为质量调优问题

Benchmark 数据(RAGEval / MS MARCO,优化时间 hours): | Optimizer | RAGEval (h) | MS MARCO (h) | |---|---|---| | Greedy-Forward (2026) | 2.25±0.23 | 3.16±0.06 | | RAG-Stack (ours) | 4.59±0.51 | 3.60±1.79 | | GP+LogNEHVI | 5.60±0.40 | 5.68±0.51 | | SMAC | 8.03±0.42 | 7.03±0.37 |

保留理由:首个将 RAG serving 性能与质量联合优化的系统化工作;Greedy-Forward 新基准值得关注。
后续行动:建议查阅原论文方法论;关注与 FlashRAG 框架的集成方式。


8. ⭐ Higress-RAG 企业 RAG 全链路优化框架(★★★)

来源arXiv:2602.23374 — Higress-RAG: A Holistic Optimization Framework for Enterprise RAG via Dual Hybrid Retrieval, Adaptive Routing, and CRAG

关键词:Dual Hybrid Retrieval、Adaptive Routing、CRAG(Corrective RAG)

保留理由:企业级 RAG 全链路优化思路,与当前 RAG 工程实践高度相关。
后续行动:关注 CRAG 与标准 RAG 路径的对比实验数据。


9. ⭐ GitHub Enterprise Agentic Engineering System(★★★)

来源github.com/resources — September '26 Enterprise Roundup

核心框架:GitHub Agentic Engineering System (AES) - 决策模型:Agent 加速区域 vs 人类判断必需区域 - 三核心:Shared Knowledge + Guardrails + Outcome-based Measurement - 治理要求:Quality/Security/Human Approval 全链路嵌入

保留理由:企业级 Agent 工程实践框架,代表当前行业主流认知。
后续行动:建议对照企业内部 Agent 部署现状做 Gap Analysis。


二、降级/丢弃条目

条目 理由
大部分 Medium/CSDN MLOps 综述类文章 缺性能数据、命令、代码路径;为概述性内容
Udemy 课程推荐类文章 无工程内容,纯商业导流
AI Maker Space / rafaeltuelho LLM-Engineering-Foundations 缺乏具体工程数据,仅为课程目录
javabuddy/best-ai-and-llm-engineering-resource 引用列表而非原创工程内容
Prompt Engineering 技巧汇总类(无实测对比) 缺乏可复现命令和性能数据
大部分 Medium Substack 工程笔记(非深度技术分享) 提炼价值不足;建议有具体代码段再收录

三、分类标签

LLM-Inference RAG Multi-Agent Context-Engineering MLOps vLLM SGLang TensorRT-LLM Inference-Optimization AIRE Agentic-RAG Production-Engineering


四、建议写入路径

/shared/research-kb/inbox/jay/2026-09-16-llm-inference-engineering.md

五、后续行动

优先级 行动 目标
P0 核验 vLLM GB200 26,200 prefill tok/GPU-s 数据来源 官方 benchmark 或论文
P1 阅读 arXiv:2603.09619 完整版(五维标准 + 成熟度金字塔细节) 工程化落地检查清单
P1 阅读 RAG-Stack 原文方法论 确认 HPO 与 serving 协同优化可行性
P2 对比 SGLang/vLLM 官方 GitHub benchmark 页面数据 交叉验证
P2 调研 OWASP ASI01-ASI10 具体定义 安全评估矩阵
P3 更新 LLMOps 工具选型矩阵(含 AgentOps 2026 新变化) 知识库主题页

Jay · 工程筛选草稿 · 2026-09-16T02:50Z · 请勿直接提交 GitHub