Jay 工程筛选笔记 · 2026-09-25

主题

LLM 推理引擎工程实践 + AI Agent 生产架构(第二轮高频扫描)


一、检索范围

平台 关键词 时间范围
arXiv / Semantic Scholar vLLM, SGLang, inference, agent, training 近1个月
GitHub Trending inference, agent, MLOps 近1个月
Turion.ai / Medium / DEV vLLM SGLang TensorRT-LLM benchmark 近1个月
Substack (The AI Engineer, Latent Space, Nuanced Perspective) inference engineering, agent stack 近1个月

二、候选条目 & 筛选判断


✅ 保留 #1 — Turion.ai: "vLLM and SGLang Are Converging — and That Changes the Inference Stack"

URL: https://turion.ai/blog/vllm-sglang-convergence-inference-ecosystem-2026
来源类型: 工程博客
可信度: 高 — 引用 LinkedIn 生产工程师讨论、vLLM 0.19.0 发布记录(2026-03)、MLPerf Inference v6.0

核心工程洞察: - FlashInfer 内核共享: 2026年4月 NVIDIA 通过 FlashInfer 开源了原本只有 TensorRT-LLM 才有的内核,vLLM 和 SGLang 现在直接消费同一套内核,注意力计算质量趋于一致 - 调度器战争取代内核战争: 同样 FlashInfer 内核下,SGLang 仍比 vLLM 保持吞吐量优势,根本瓶颈在引擎内部调度开销而非内核质量 - 分离式推理(Disaggregated Serving): 将 prefill 和 decode 部署在不同 GPU 类型上,生产环境可获得 30-50% 吞吐量提升 — 这比换引擎更有价值 - KV Cache 优化四维度: Paged / Compressed / Offloaded / Shared,可将并发请求量提升 2-4x - vLLM 治理模式: 属于 Linux Foundation 社区项目,无单一企业控制,每周安装量约 200 万次(2026-03)

保留理由:
✅ 包含真实架构决策分析(非泛泛而谈),✅ 定量数据(30-50% 提升),✅ 生产工程视角,✅ 为后续技术选型提供依据
❌ 无命令/源码,但架构分析有高度工程参考价值

标签: 推理引擎 vLLM SGLang 架构 KV-Cache
建议: 精读,重点补充到推理引擎对比主题页


✅ 保留 #2 — misar.blog: "vLLM vs SGLang vs TensorRT-LLM: LLM Inference Benchmark 2026"

URL: https://www.misar.blog/@synor/articles/vllm-vs-sglang-vs-tensorrt-llm
来源类型: 独立技术博客(有真实 benchmark 数据)
可信度: 中高 — 具体模型版本、GPU 配置、并发级别,但具体 tok/s 数值需对照原文

核心工程数据: - L40S 单卡测试: vLLM TTFT 834ms (c=8) vs SGLang 2029ms vs TensorRT-LLM 2541ms - 多节点扩展衰减: vLLM 1→4 节点时,Llama 3.1 70B 吞吐量预期下降 20-30%(kv cache 跨节点通信瓶颈) - SGLang 优势场景: RAG 和 chat 工作负载,RadixAttention prefix caching 可倍增吞吐量 - TensorRT-LLM: 原始吞吐量最高,但需要专项工程投入做编译+profiling+硬件优化 - c32-64 吞吐量天花板: 三引擎在 c32→c64 几乎无额外吞吐量提升,TTFT 反而翻倍

保留理由:
✅ 真实 benchmark 配置(模型/GPU/并发),✅ 定量比较,✅ 包含扩展性讨论
❌ 无命令/复现步骤,但数字对容量规划有直接参考价值

标签: 推理引擎 benchmark vLLM SGLang TensorRT-LLM 性能
建议: 收录为推理引擎 benchmark 数据点


✅ 保留 #3 — Medium (@wojdylak.michal): "LLM Inference Benchmarks: vLLM vs SGLang vs TensorRT-LLM on a Single L40S"

URL: https://medium.com/@wojdylak.michal/llm-inference-benchmarks-vllm-vs-sglang-vs-tensorrt-llm-on-a-single-l40s-8976d46a7ef3
来源类型: Medium 技术博客
可信度: 中 — 2026-08 发表,具体实验参数,Qwen3-32B-FP8 配置

核心工程数据: - Qwen3-32B-FP8 @ L40S, ISL=8000, OSL=512, c=8: vLLM 41.0 tok/s / TTFT 63.8s; SGLang 38.2 tok/s / TTFT 68.6s - 低并发延迟优势: c=8 时 vLLM TTFT 834ms,2.4x 快于 SGLang (2029ms),3x 快于 TensorRT-LLM (2541ms) - SGLang ITL 一致性: 全并发级别 Inter-token latency 最低 (60.6→76.6→77.8ms),流式输出最平滑 - 并发天花板: c=32→c64 vLLM/SGLang 吞吐量增益 <1%,TensorRT-LLM 仍提取 18% 增益(但 ITL 升至 124.4ms)

保留理由:
✅ Qwen3 具体量化数据,✅ L40S 特定硬件实测,✅ 延迟/吞吐量 trade-off 分析
❌ Medium 非学术平台,但数据具体

标签: 推理引擎 benchmark Qwen3 L40S 延迟 吞吐量
建议: 收录


✅ 保留 #4 — The AI Engineer Substack: "The AI Agents Stack: LLM to Production (2026 Edition)"

URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
来源类型: Substack 专栏(Paolo Perrone)
可信度: 中高 — 工程导向,有具体分层框架,引用 LangChain Agent Engineering Survey 数据

核心工程洞察: - 六层 Agent Stack: Models/Inference → Protocols&Tools → Memory → State → Frameworks → Production - Eval gap: 89% 生产 Agent 团队有 observability,但仅 52% 有 evals — 37point 差距是生产质量死亡区 - 三层 Eval 基础设施: 每 PR 快速检查(工具调用正确性)→ LLM-judge 夜间回归套件 → 生产持续监控(性能漂移告警) - 新 benchmark: Context-Bench(记忆管理)/ Recovery-Bench(错误恢复)/ Terminal-Bench(编码 Agent) - Cursor 案例: Layer 1 路由 Claude/GPT-4/自微调模型;Layer 2 MCP 连接编辑器/终端/文件系统;Layer 4 自建 RL 编排(非 LangGraph) - 多 Agent 硬教训: 两个 Agent 传上下文已经难调试,五个 Agent 没有 trace-level eval 就无法定位问题

保留理由:
✅ 真实生产案例(Cursor),✅ 分层可操作框架,✅ Eval 基础设施缺口分析,✅ 2026年更新
⚠️ 属 Newsletter 性质,无命令/源码,但洞察质量高

标签: AI-Agent 生产架构 Eval MLOps Stack Substack
建议: 精读,可作为 Agent 工程实践主题页框架


✅ 保留 #5 — The Nuanced Perspective Substack: "Inference Engineering for Agents: Spend Compute where it Helps"

URL: https://thenuancedperspective.substack.com/p/inference-engineering-for-agents
来源类型: Substack(Aishwarya Reganti)
可信度: 中 — 引用 Berkeley/Stanford 联合评测(8个前沿推理模型 x 12任务),Shadow Price of Reasoning 论文,SPORK 论文

核心工程洞察: - 模型选型陷阱: Gemini 3 Flash 标价比 GPT 5.4 低 80%,但实测 38% 成本更高 — 实际成本必须基于真实工作负载测量 - 推理效用 S 曲线: 推理 tokens 效用非线性,存在三阶段,均匀分配不如基于难度的动态分配 - CLEAR Framework(Constrained Latent-utility Equilibrium Allocation for Reasoning): 将推理 tokens 视为有限资源进行边际效用最大化分配,比均匀分配精度提升 3x - SPORK(Self-Speculative Forking): 模型对工具调用预测准确率 74-99%,可提前创建轻量 fork 线程复用主线程 prefix + KV cache - 三层难度分级: 普通工作走廉价路径,失败时升级到前沿模型 — 已在生产验证

保留理由:
✅ 成本/推理效率工程视角,✅ 有量化结论,✅ 对推理优化实践有直接指导
⚠️ Substack,无源码,但方法论有工程价值

标签: 推理优化 成本优化 Agent CLEAR SPORK Substack
建议: 收录,特别是推理 token 分配策略部分


✅ 保留 #6 — arXiv: Belayer: Efficient Fault Tolerance for LLM Agentic RL Training (2608.14635)

URL: https://arxiv.org/html/2608.14635v1
来源类型: arXiv 论文
可信度: 高 — 具体系统描述,H200 集群配置,代码级实现思路

核心工程洞察: - 问题: LLM RL 训练中基础设施故障(工具调用失败、GPU 故障)被暴露为普通任务反馈,导致模型对基础设施错误做出反应而非任务本身,产生不一致训练轨迹 - Belayer 架构: 三平面执行 — Rollout Cluster(LLM 推理)/ Environment Cluster(沙盒交互)/ Training Cluster(策略优化) - 部署配置: Nvidia H200 × 4节点 × 32GPU,RoCE 400Gbps × 8 互联,Ubuntu 24.04 - 评估模型: Qwen3-4B/8B/32B Math 工作负载,Qwen3-32B SWE 工作负载(4K 单步最大响应,32K 最大上下文) - 故障容忍设计: 只需少量配置变更即可启用 Belayer 容错机制(继承 Slime API 兼容性)

保留理由:
✅ 有硬件配置(GPU型号/数量/互联带宽),✅ 有明确故障场景,✅ 真实 RL 训练系统设计
❌ 论文尚未经过同行评审,但系统描述详细

标签: RL训练 Agent 容错 H200 Qwen3 arXiv
建议: 收录 RL 训练基础设施设计参考


✅ 保留 #7 — arXiv: AgentCompass: Unified Evaluation Infrastructure for Agent Capabilities (2607.13705)

URL: https://arxiv.org/html/2607.13705v1
来源类型: arXiv 论文
可信度: 高 — 开源基础设施,解耦设计,有 GitHub

核心工程洞察: - 解耦架构: AgentCompass 将评估管道分为独立的 Model / Benchmark / Harness / Environment 四层,消除紧耦合 - 原生集成 20+ benchmarks: 支持多 Benchmark × 多 Harness × 多 Environment 灵活配置,无需重写复杂执行逻辑 - 容错异步运行时: 支持轨迹级别分析,可诊断 reward-hacking 等复杂行为(超越传统标量评分) - 可扩展性: 新增数据集无需重新实现执行逻辑,只需配置接口

保留理由:
✅ 开源,✅ 有架构图,✅ 对 Agent Eval 基础设施选型有直接参考
❌ 框架刚发布,生产验证有限

标签: Agent Eval 基础设施 开源 arXiv
建议: 收录,作为 Agent 评测工具选型参考


✅ 保留 #8 — arXiv: From Prompt–Response to Goal-Directed Systems: Evolution of Agentic AI Software Architecture (2602.10479)

URL: https://arxiv.org/html/2602.10479v1
来源类型: arXiv 论文(全景综述)
可信度: 中高 — 综述性质,有架构层次图,引用丰富

核心工程洞察: - 分层参考架构: Human Actor → Agent Interface → Agent Core (LLM reasoning) → Control Layer (planner/policy/state-machine/retry/circuit breaker) → Memory Layer → Tooling Layer → Governance - 认知与执行分离: Control Layer 实现规划/策略/状态机/重试/断路器,与 LLM 推理核心解耦 - Memory Layer 组成: Working context / Episodic store / Semantic KB + Vector stores / User preferences - Tooling Layer: Tool registry + schemas / Connectors & adapters / Sandboxed execution / RAG - 生产需求: Observability + Evaluation + Security + Reproducibility 四位一体 - 多 Agent 协调: 架构层面梳理 manager vs. decentralized handoffs

保留理由:
✅ 完整分层架构图,✅ 可作为 Agent 系统设计 checklist,✅ 生产部署视角
⚠️ 综述性质,偏理论但框架清晰

标签: AI-Agent 架构 生产 综述 arXiv
建议: 收录作为架构设计参考


✅ 保留 #9 — DEV Community: "The Complete Guide to Local LLM Inference Tools in July 2026"

URL: https://dev.to/sreeraj-sreenivasan/the-complete-guide-to-local-llm-inference-tools-in-july-2026-llamacpp-ollama-vllm-sglang-and-4mh1
来源类型: DEV Community 技术博客
可信度: 中 — 工具对比框架,具体吞吐量倍数(16-20x Ollama),有各工具定位分析

核心工程洞察: - vLLM: PagedAttention,16-20x Ollama 并发吞吐,事实生产标准 - SGLang: RadixAttention,RAG 管道 6x 加速,2026 增长最快框架 - LMDeploy: 视觉-语言模型和 A100/A800 INT4 最佳 - mlx-lm: Apple Silicon 本地推理+微调唯一路径 - Aphrodite: vLLM 分支,量化格式支持最广

保留理由:
✅ 2026年最新工具对比框架,✅ 各引擎定位清晰,✅ 有量化相对性能
❌ 无原创 benchmark 数据

标签: 推理引擎 工具对比 vLLM SGLang llama.cpp
建议: 收录作为推理引擎选型入门参考


✅ 保留 #10 — GitHub: microsoft/Build26-BRK241

URL: https://github.com/microsoft/Build26-BRK241-from-prototype-to-production-build-and-run-agents-at-scale
来源类型: GitHub(Microsoft Build 2026 官方资源)
可信度: 高 — 官方工程 Session,PPT + 代码仓库

核心工程议题: - 从原型到生产的 Agent 工程模式 - 工具设计、Memory、长时运行工作流 - Human-in-the-loop 和可观测性

保留理由:
✅ 官方资源,✅ 工程实践导向,✅ 可下载 PPT/代码
⚠️ GitHub 仓库需进一步查看内容深度

标签: AI-Agent Microsoft 生产 GitHub
建议: 精读,查看仓库实际内容


三、丢弃条目及理由

条目 来源 丢弃理由
packet.ai decision guide 技术博客 结论与其他 benchmark 来源高度重复,无新增数据点
decodefuture.org vLLM vs SGLang 技术博客 泛泛而谈,版本号罗列,无具体 benchmark 数据
Himanshu Roadmap Substack Substack 通用学习路径,无工程实践原创内容
Aqs Azafar Roadmap Substack 通用学习路径,同上
Java Revisited 书籍推荐 Substack 书籍清单,无原创工程内容
awesome-harness-engineering GitHub list 仅汇总链接,无原创分析

四、分类标签汇总

标签 数量
推理引擎 5
AI-Agent 5
benchmark 3
vLLM 4
SGLang 4
生产架构 4
Eval 3
Substack 3
arXiv 4
成本优化 1
RL训练 1
容错 1
KV-Cache 1

五、建议写入路径

/shared/research-kb/inbox/jay/2026-09-25-inference-agents-engineering.md

六、后续行动

需精读/审稿: 1. turion.ai vLLM/SGLang convergence — 补充推理引擎主题页架构章节 2. The AI Engineer Substack — 补充 Agent Stack 主题页 3. Belayer arXiv — 补充 RL 训练基础设施主题 4. AgentCompass arXiv — 补充 Agent Eval 工具选型

待核验: - GitHub microsoft/Build26 仓库实际内容深度 - 各 benchmark 来源的具体数值(建议直接访问页面确认)

本轮写入状态: 本文件即草稿,写入 /shared/research-kb/inbox/jay/2026-09-25-inference-agents-engineering.md