推理调度 · LLMOps · Agentic RAG 工程筛选 · 2026-08-31 下午场
实例: Jay 时间: 2026-08-31 14:50 (Asia/Shanghai) 检索范围: arXiv 推理调度论文 / KV Cache 优化综述 / vLLM vs SGLang vs TRT-LLM 工程对比 / AI Agents Stack 2026 / AI Engineer 职位分析 / Agentic RAG 生产模式 去重参考: - 08-31 早场(vLLM v0.28.0、Kimi-K3/Sliding-window、SGLang commits、llama.cpp、HF 模型动态) - 08-31 午场(CSDN vLLM 源码系列、torch.compile、Ollama 本地部署、LangChain+RAG、LangGraph 1.0) - Tom(08-31 09:00 HF daily、RSS Yannic Kilcher、Lex Fridman) - Stephen(08-31 10:01 Gradient Flow、10:02 Chip Huyen) - Flyp(08-31 10:02 RSS Interconnects、Two Minute Papers、AI Explained)
一、工程筛选判断:保留条目
① UniBoost:LLM 推理尾延迟感知调度框架(arXiv:2606.18431)⭐⭐⭐ 极高
- 链接: https://arxiv.org/html/2606.18431v1
- 来源: arXiv(cs.LG)
- 发布时间: 2026-06(v1)
- 工程价值: 预测无关的 LLM 尾延迟优化框架;核心贡献是与 KV Cache 驱逐策略联合设计;对生产级推理引擎(vLLM/SGLang)的调度策略有直接工程意义
- 核心工程内容:
- 问题: 传统 LLM 调度(FCFS / JSQ)忽视 KV Cache 内存约束;无差别优先级提升会导致驱逐重算,反而拉高尾延迟
- 方案: UniBoost — 软连续优先级塑形 + KV-Cost 感知抢占式驱逐联合设计
- 信号: 仅用可观测轻量信号(已解码 token 数、历史请求延迟分布)驱动,无需精确预测
- 集成路径: 与连续 batching、p/d 分离、chunk-prefill 系统(vLLM / SGLang)无缝集成
- 实测结果: 尾延迟(TTLT)显著优于 FCFS 和 vanilla boosting;重负载下甚至超越预测式策略
- 未来方向: 多模型/多副本联合路由 + 缓存协同调度
- 复现可行性: 高(有开源实现计划,arXiv 可直接访问)
- 可信度判断: 高;理论支撑清晰(排队论 + 轻量信号),与 vLLM/SGLang 实际系统集成路径明确
- 分类标签:
推理调度LLM-Serving尾延迟KV-CacheUniBoostarXiv调度算法 - 建议: 精读;与 vLLM v0.28.0 Model Runner V2 E/P/D 分离对照;调度器开发者必读
- 保留理由: 论文提出 LLM 推理调度的核心工程矛盾(优先级提升 vs KV 重算),提供了可落地的联合设计框架,工程价值高于纯理论排队论论文
② KV Cache 优化全景综述(arXiv:2603.20397)⭐⭐⭐ 极高
- 链接: https://arxiv.org/html/2603.20397v1
- 来源: arXiv(cs.LG),Dell Technologies 工业研究
- 发布时间: 2026-03(v1)
- 作者: Yichun Xu, Navjot K. Khaira, Tejinder Singh(Dell Technologies)
- 工程价值: 工业级 KV Cache 优化全景图,覆盖学术界 + 工业界 5 大方向;是 2026 年 KV Cache 领域最系统的参考文献
- 核心工程内容:
- 五大优化方向:
- Cache Eviction(缓存淘汰): LRU / LFU / 动态淘汰;NACL(arXiv 2024)、PagedAttention
- Cache Compression(缓存压缩): 量化(FP8/INT4/FP4)+ 稀疏化 + KV 重新计算
- Hybrid Memory(混合内存): GPU-CPU-NVMe 分级卸载;分层存储架构
- Novel Attention(新型注意力): FlashAttention 系列、Linear Attention、Mamba SSM
- Combination Strategies(组合策略): 上述方法联合使用
- 生产级发现: v0.28.0 tiered offloading 方向与本文 hybrid memory 方向高度一致;Minimax/字节/DeepSeek 均有相关内部工作
- Benchmark 数据: 各策略在 Llama-2-7B A100 80GB 上的显存 / 延迟 trade-off 量化
- 关键工程数据点: Llama-2-7B FP16 KV Cache 每 token ≈ 0.5 MiB(见 arXiv:2504.11320v4)
- 复现可行性: 高;系统综述,含 50+ 引用,方法论完整
- 可信度判断: 高;Dell Technologies 工业研究,有代码引用,arXiv 开放
- 分类标签:
KV-Cache推理优化内存管理arXiv混合存储FlashAttention量化 - 建议: 精读;建议作为「推理引擎 · KV Cache 专题」核心参考文献;与 vLLM v0.28.0 分级卸载路线图交叉验证
- 保留理由: Dell 工业研究团队出品,覆盖 2024-2026 年 KV Cache 主流技术路线;是少有的学术+工程结合的综述文章
③ vLLM vs SGLang vs TensorRT-LLM 工程对比指南 ⭐⭐⭐ 极高
- 链接: https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm
- 来源: inferenceengineering.tech(专业推理工程博客)
- 发布时间: 2026(持续更新)
- 工程价值: 2026 年推理引擎选型最实用的工程对比指南;H100 实测数据 + 配置参数 + 决策框架
- 核心工程内容:
H100 SXM 80GB 实测吞吐数据(Llama-3.1 70B,TP=4,FP8): | 引擎 | 吞吐 | 配置 | |------|------|------| | TensorRT-LLM | ~3,400 tok/s | TP=4, FP8, compiled | | SGLang | ~2,900 tok/s | TP=4, FP8 | | vLLM | ~2,800 tok/s | TP=4, FP8 |
DeepSeek-R1 671B(EP=8, FP8, 8×H100): ~1,100 tok/s
高并发特征(SGLang vs vLLM,5,980 请求,TP=2): - 100+ 并发时,SGLang C++/CUDA 调度开销低于 vLLM Python 调度器 - RadixAttention 在高共享前缀命中率场景额外提升 10-20% - vLLM Python 调度器每步额外开销约 200-500 μs(高并发时显著)
调度器工程细节(vLLM):
- GPU memory utilization 配置建议:7B→0.95,13B→0.85,70B→0.90
- PagedAttention 固定页管理:短上下文少页,GPU 可同时 batch 更多请求
TensorRT-LLM 工程门槛: - 编译时间成本高(引擎编译数分钟到数十分钟) - 新模型/新精度需要重新编译 - 生产环境迭代速度 vs 极致性能权衡
决策框架总结:
- 吞吐量优先 + NVIDIA: TensorRT-LLM(投入工程时间换极致性能)
- 快速迭代 + 宽模型支持: vLLM(Python-first,社区活跃)
- 高并发 + 共享前缀场景: SGLang(RadixAttention + C++ 调度优势)
- 复现可行性: 高;Benchmark 方法论透明,H100 配置参数明确
- 可信度判断: 高;专业推理工程博客,作者有 SGLang/vLLM 实际部署经验
- 分类标签: 推理引擎 vLLM SGLang TensorRT-LLM Benchmark H100 调度 工程选型
- 建议: 精读存档;建议作为 2026Q3 推理引擎选型决策树的核心参考;配合 v0.28.0 release notes 交叉验证
- 保留理由: 2026 年最实用的推理引擎三路对比;实测数据 + 工程门槛 + 决策框架三项全齐;避免了泛泛介绍,直接给工程选型判断
④ AI Agents Stack 2026(Substack · The AI Engineer)⭐⭐ 较高
- 链接: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 来源: Substack(The AI Engineer,Paolo Perrone)
- 发布时间: 2026(近月)
- 工程价值: AI Agent 生产架构六层栈,2026 年行业共识;特别强调 Guardrails 独立学科化、Context Engineering 替代 Prompt Engineering、评估基础设施三层收敛
- 核心工程洞察: 1. Agent Guardrails ≠ LLM Guardrails: 2024 年 Guardrails = 输入/输出过滤器;2026 年 = 工具调用授权 + 费率限制 + 行为验证;"Guardrails before action" 模式成为行业共识(防止 Agent 已执行危险操作后再过滤) 2. OWASP MCP Top 10(beta)发布: 首个工具连接型 Agent 安全检查清单(2026 年重要基础设施) 3. 评估基础设施三层收敛: ① PR 级快速检查(工具调用正确性);② 夜间回归套件(LLM judge 评估质量);③ 生产持续监控(漂移告警) 4. Context Engineering 替代 Prompt Engineering: 架构化信息供给,而非写更好的提示词;Memory Blocks(命名结构化字段)成为状态管理标准 5. 新 Benchmark: Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 Agent) 6. 部署现状: FastAPI + 自建 infra 仍是主流;LangGraph Cloud / Bedrock Agents 存在但未主导
- Substack 元数据:
- 作者:Paolo Perrone(The AI Engineer)
- 原文链接:theaiengineer.substack.com
- 可信度:中高;行业观察文章,观点有代表性,但非一手研究数据
- 分类标签:
AI-AgentGuardrailsContext-EngineeringEvaluationOWASPMCPSubstackAgent-Stack - 建议: 泛读存档;OWASP MCP Top 10 值得专项追踪;"Guardrails before action" 模式建议加入 AI Agent 开发规范
- 保留理由: 2026 年 Agent 生产工程共识的清晰总结;Guardrails 独立学科化和评估三层收敛是重要的工程范式转变;Substack 属于线索类,不复制原文
⑤ AI Engineer 职位数据:1000+ JD 分析(Substack · Alexey On Data)⭐⭐ 较高
- 链接: https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal
- 来源: Substack(Alexey On Data,Alexey Grigorev & Valeriia Kuka)
- 发布时间: 2026(近月)
- 工程价值: AI Engineer 角色市场定义;揭示该角色本质是"拥有基础模型系统设计、评估和生产运营能力的工程师"
- 核心工程洞察:
- 三种角色类型: AI-first(~70%,直接做 LLM/GenAI 系统)、AI-support(~28.5%,基础设施/平台)、AI-adjacent(少量,ML 但非 GenAI)
- 技能栈: Python 主导(98%+)、云原生(容器化/K8s)、LLM 集成 / RAG / Agent 架构理解
- 生产焦点: 95.6% 的 JD 要求生产经验,而非模型研究
- 核心能力: RAG 系统设计、Agent 工作流、API 部署、监控、护栏、评估(LLM-as-Judge)
- 工具链: LangChain/LangGraph(编排)、Langfuse/LlamaIndex(可观测性/检索)、FastAPI(部署)、Docker/Kubernetes(容器化)
- Substack 元数据:
- 作者:Alexey Grigorev(知名 ML 讲师,Applied ML 社区)
- 原文链接:alexeyondata.substack.com
- 可信度:中高;1000+ JD 样本,方法论清晰
- 分类标签:
AI-EngineeringCareerMLOpsRAGAgentSubstackJob-Market - 建议: 泛读存档;AI Engineer 角色定义可作为团队技能树参考;值得对照 OWASP MCP Top 10 安全需求
- 保留理由: 揭示 AI Engineer 角色从"会用 LangChain"到"端到端拥有生产系统"的能力迁移;为技能树规划提供数据依据;Substack 属线索类
⑥ Agentic RAG 生产失败模式 & 2026 架构(工程指南)⭐⭐ 较高
- 链接: https://www.teacherandtask.com/blog/advanced-rag-patterns-2026-production-engineering-guide
- 来源: teacherandtask.com(MarsDevs 技术博客)
- 发布时间: 2026
- 工程价值: 30 分钟 Demo → 3 个月生产失败弧线的工程指南;7 种 RAG 失败模式 + 5 种生产 Agentic RAG 架构
- 核心工程内容:
- 7 种 RAG 失败模式: ① 上下文窗口污染;② 块级检索粒度错误;③ 缺少语义元数据;④ 引用溯源缺失;⑤ 检索与生成不对齐;⑥ 图谱关系断裂;⑦ Agentic 循环开销失控
- 2026 生产 Agentic RAG 默认栈: LangGraph(编排)+ LlamaIndex Workflows(检索)+ Ragas + Phoenix + Langfuse(评估)
- 成本数据: Agentic RAG token 消耗是 one-pass RAG 的 3-10x,延迟增加 2-5x;仅在高风险多跳场景(法律/医疗/金融)值得付出此成本
- 构建报价参考: 生产 RAG 系统 $8,000-$50,000(3-16 周);Agentic 复杂度 $25,000-$50,000(8-16 周)
- GraphRAG 生产部署: 微软客服、Thomson Reuters/Casetext(法律)、医学文献检索
- 分类标签:
RAGAgentic-RAGGraphRAGProductionFailure-ModesLangGraphEvaluation - 建议: 泛读存档;失败模式清单建议加入 RAG 开发 checklist;GraphRAG 生产案例值得专项调研
- 保留理由: 覆盖真实生产失败弧线;成本量化对工程预算决策有价值;Ragas + Phoenix + Langfuse 评估栈是 2026 年 Agentic RAG 评估标准组合
二、工程筛选判断:丢弃条目
| 条目 | 丢弃原因 |
|---|---|
| MarsDevs Agentic RAG 2026 Guide(site:marsdevs.com) | 营销感强;构建报价($8,000-$50,000)无技术细节;与 teacherandtask 版重复且更浅 |
| Rakesh Gohel LinkedIn "7 RAG types" 帖 | LinkedIn 帖子,框架总结价值低;原文来自 MarsDevs;无新信息 |
| EduInx Agentic RAG 指南 | 复制/翻译来源;分析价值低于 teacherandtask 原版 |
| TowardsAI "Why 90% Agentic RAG Fails" | 概述性质;失败原因无工程深度;复用 teacherandtask 框架但更浅 |
| Medium DataDo Agentic RAG Part 1 | 技术内容有价值(Docling + adaptive OCR + HybridChunker + BGE-M3);但内容与 teacherandtask 重复且深度相当;本次已选 teacherandtask |
| MDPI MLOps Survey(arXiv 2506.02032) | 综述性文章;无新的工程数据或可复现步骤;引用 2024 年前论文为主 |
| Galileo MLOps Guide | 通用 MLOps 原则;无具体 LLM 生产工程细节 |
| Javarevisited Substack "AI Engineer 路线图" 系列 | 付费内容为主;免费预览无新工程价值;与 Alexey On Data JD 分析重复但更浅 |
| Emerging AI "2026 AI Engineer Roadmap" | 付费锁定;免费预览无具体工程内容 |
| AI Engineering Insider Substack "LLM Inference Roadmap 2026" | 转发内容为主(非一手研究);知识图谱式罗列而非工程分析;与 inferenceengineering.tech 质量差距大 |
三、低优先级归档(可跳过,线索保存)
| 条目 | 说明 |
|---|---|
| UniBoost Future Work(arXiv:2606.18431) | 多模型/多副本联合路由;与 vLLM v0.28.0 Model Runner V2 E/P/D 分离方向一致,值得后续追踪 |
| arXiv 2605.01280 "LLM Serving Needs Mathematical Optimization, Not Heuristics" | 位置论文;指出 vLLM/SGLang 核心算法(JSQ/FIFO/LRU)仍是通用策略;对 KV Cache 调度优化有参考价值 |
| ARXIV 2504.11320 "Fluid-Guided Online Scheduling" | Vidur 仿真器 + fluid approximation;与 UniBoost 互补;Llama-2-7B A100 0.5 MiB/token 数据点可引用 |
| DeployBase vLLM vs SGLang vs TGI benchmark | H100 基准数据较旧(2026 初),与 inferenceengineering.tech 最新数据重复 |
| AIMultiple H100 benchmark | 16,215 tok/s SGLang vs 16,132 tok/s LMDeploy(statistical noise);数据方向与 PremAI blog 一致 |
| PremAI blog vLLM vs SGLang vs LMDeploy | 2026 年引擎横向;benchmark 方法论不够透明;推理工程精度低于 inferenceengineering.tech |
四、本次核心发现总结
高价值新增条目(3 条):
- UniBoost(arXiv:2606.18431) — 首个 LLM 推理调度 + KV Cache 驱逐联合设计框架;生产引擎调度器优化必读
- KV Cache 优化全景综述(arXiv:2603.20397,Dell) — 2026 年 KV Cache 领域最系统的参考文献;五大方向 + 工业数据
- vLLM vs SGLang vs TRT-LLM 工程对比(inferenceengineering.tech) — H100 实测数据 + 配置参数 + 决策树;推理引擎选型必备
Substack 条目(2 条):
- The AI Engineer · AI Agents Stack 2026 — Guardrails 独立学科化、评估三层收敛;Agent 生产工程范式转变信号
- Alexey On Data · AI Engineer JD 分析 — 角色市场数据;AI Engineer 技能树规划参考
五、分类标签总览
| 标签 | 条目数 | 代表 |
|---|---|---|
推理调度 KV-Cache LLM-Serving |
3 | UniBoost、KV Cache 综述、inference comparison |
推理引擎 vLLM SGLang TensorRT-LLM |
2 | inference comparison、KV Cache 综述 |
AI-Agent Agentic-RAG Guardrails |
2 | AI Agents Stack 2026、Agentic RAG 生产模式 |
Evaluation OWASP MCP |
1 | AI Agents Stack 2026 |
AI-Engineering Career MLOps |
1 | AI Engineer JD 分析 |
Substack |
2 | AI Engineer、Alexey On Data |
arXiv |
2 | UniBoost、KV Cache 综述 |
六、建议写入路径
草稿路径: /shared/research-kb/inbox/jay/2026-08-31T1450-jay-afternoon-inference-scheduling-llmops-agentic.md
核心可复现工程数据(建议单独归档到推理引擎主题页):
H100 SXM 80GB 推理引擎吞吐(Llama-3.1 70B, TP=4, FP8):
TensorRT-LLM: ~3,400 tok/s(需引擎编译)
SGLang: ~2,900 tok/s(RadixAttention 共享前缀场景 +10-20%)
vLLM: ~2,800 tok/s(Python 调度器额外开销 200-500 μs/步)
vLLM GPU memory utilization 配置:
7B → 0.95
13B → 0.85
70B → 0.90
KV Cache 内存数据点:
Llama-2-7B FP16: 每 token ≈ 0.5 MiB(A100 80GB)
(来源:arXiv 2504.11320v4)
Agentic RAG vs One-pass RAG 成本:
Token 消耗:3-10×
延迟:2-5×
适用场景:法律/医疗/金融多跳问答
AI Engineer JD 关键数据:
角色类型:AI-first ~70% / AI-support ~28.5%
生产经验要求:95.6%
主导语言:Python 98%+
评估工具:Ragas + Phoenix + Langfuse(2026 标准组合)
本轮无 GitHub 写入操作。