Jay 工程筛选笔记 · 2026-09-25
主题
LLM 推理引擎工程实践 + AI Agent 生产架构(第二轮高频扫描)
一、检索范围
| 平台 | 关键词 | 时间范围 |
|---|---|---|
| arXiv / Semantic Scholar | vLLM, SGLang, inference, agent, training | 近1个月 |
| GitHub Trending | inference, agent, MLOps | 近1个月 |
| Turion.ai / Medium / DEV | vLLM SGLang TensorRT-LLM benchmark | 近1个月 |
| Substack (The AI Engineer, Latent Space, Nuanced Perspective) | inference engineering, agent stack | 近1个月 |
二、候选条目 & 筛选判断
✅ 保留 #1 — Turion.ai: "vLLM and SGLang Are Converging — and That Changes the Inference Stack"
URL: https://turion.ai/blog/vllm-sglang-convergence-inference-ecosystem-2026
来源类型: 工程博客
可信度: 高 — 引用 LinkedIn 生产工程师讨论、vLLM 0.19.0 发布记录(2026-03)、MLPerf Inference v6.0
核心工程洞察: - FlashInfer 内核共享: 2026年4月 NVIDIA 通过 FlashInfer 开源了原本只有 TensorRT-LLM 才有的内核,vLLM 和 SGLang 现在直接消费同一套内核,注意力计算质量趋于一致 - 调度器战争取代内核战争: 同样 FlashInfer 内核下,SGLang 仍比 vLLM 保持吞吐量优势,根本瓶颈在引擎内部调度开销而非内核质量 - 分离式推理(Disaggregated Serving): 将 prefill 和 decode 部署在不同 GPU 类型上,生产环境可获得 30-50% 吞吐量提升 — 这比换引擎更有价值 - KV Cache 优化四维度: Paged / Compressed / Offloaded / Shared,可将并发请求量提升 2-4x - vLLM 治理模式: 属于 Linux Foundation 社区项目,无单一企业控制,每周安装量约 200 万次(2026-03)
保留理由:
✅ 包含真实架构决策分析(非泛泛而谈),✅ 定量数据(30-50% 提升),✅ 生产工程视角,✅ 为后续技术选型提供依据
❌ 无命令/源码,但架构分析有高度工程参考价值
标签: 推理引擎 vLLM SGLang 架构 KV-Cache
建议: 精读,重点补充到推理引擎对比主题页
✅ 保留 #2 — misar.blog: "vLLM vs SGLang vs TensorRT-LLM: LLM Inference Benchmark 2026"
URL: https://www.misar.blog/@synor/articles/vllm-vs-sglang-vs-tensorrt-llm
来源类型: 独立技术博客(有真实 benchmark 数据)
可信度: 中高 — 具体模型版本、GPU 配置、并发级别,但具体 tok/s 数值需对照原文
核心工程数据: - L40S 单卡测试: vLLM TTFT 834ms (c=8) vs SGLang 2029ms vs TensorRT-LLM 2541ms - 多节点扩展衰减: vLLM 1→4 节点时,Llama 3.1 70B 吞吐量预期下降 20-30%(kv cache 跨节点通信瓶颈) - SGLang 优势场景: RAG 和 chat 工作负载,RadixAttention prefix caching 可倍增吞吐量 - TensorRT-LLM: 原始吞吐量最高,但需要专项工程投入做编译+profiling+硬件优化 - c32-64 吞吐量天花板: 三引擎在 c32→c64 几乎无额外吞吐量提升,TTFT 反而翻倍
保留理由:
✅ 真实 benchmark 配置(模型/GPU/并发),✅ 定量比较,✅ 包含扩展性讨论
❌ 无命令/复现步骤,但数字对容量规划有直接参考价值
标签: 推理引擎 benchmark vLLM SGLang TensorRT-LLM 性能
建议: 收录为推理引擎 benchmark 数据点
✅ 保留 #3 — Medium (@wojdylak.michal): "LLM Inference Benchmarks: vLLM vs SGLang vs TensorRT-LLM on a Single L40S"
URL: https://medium.com/@wojdylak.michal/llm-inference-benchmarks-vllm-vs-sglang-vs-tensorrt-llm-on-a-single-l40s-8976d46a7ef3
来源类型: Medium 技术博客
可信度: 中 — 2026-08 发表,具体实验参数,Qwen3-32B-FP8 配置
核心工程数据: - Qwen3-32B-FP8 @ L40S, ISL=8000, OSL=512, c=8: vLLM 41.0 tok/s / TTFT 63.8s; SGLang 38.2 tok/s / TTFT 68.6s - 低并发延迟优势: c=8 时 vLLM TTFT 834ms,2.4x 快于 SGLang (2029ms),3x 快于 TensorRT-LLM (2541ms) - SGLang ITL 一致性: 全并发级别 Inter-token latency 最低 (60.6→76.6→77.8ms),流式输出最平滑 - 并发天花板: c=32→c64 vLLM/SGLang 吞吐量增益 <1%,TensorRT-LLM 仍提取 18% 增益(但 ITL 升至 124.4ms)
保留理由:
✅ Qwen3 具体量化数据,✅ L40S 特定硬件实测,✅ 延迟/吞吐量 trade-off 分析
❌ Medium 非学术平台,但数据具体
标签: 推理引擎 benchmark Qwen3 L40S 延迟 吞吐量
建议: 收录
✅ 保留 #4 — The AI Engineer Substack: "The AI Agents Stack: LLM to Production (2026 Edition)"
URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
来源类型: Substack 专栏(Paolo Perrone)
可信度: 中高 — 工程导向,有具体分层框架,引用 LangChain Agent Engineering Survey 数据
核心工程洞察: - 六层 Agent Stack: Models/Inference → Protocols&Tools → Memory → State → Frameworks → Production - Eval gap: 89% 生产 Agent 团队有 observability,但仅 52% 有 evals — 37point 差距是生产质量死亡区 - 三层 Eval 基础设施: 每 PR 快速检查(工具调用正确性)→ LLM-judge 夜间回归套件 → 生产持续监控(性能漂移告警) - 新 benchmark: Context-Bench(记忆管理)/ Recovery-Bench(错误恢复)/ Terminal-Bench(编码 Agent) - Cursor 案例: Layer 1 路由 Claude/GPT-4/自微调模型;Layer 2 MCP 连接编辑器/终端/文件系统;Layer 4 自建 RL 编排(非 LangGraph) - 多 Agent 硬教训: 两个 Agent 传上下文已经难调试,五个 Agent 没有 trace-level eval 就无法定位问题
保留理由:
✅ 真实生产案例(Cursor),✅ 分层可操作框架,✅ Eval 基础设施缺口分析,✅ 2026年更新
⚠️ 属 Newsletter 性质,无命令/源码,但洞察质量高
标签: AI-Agent 生产架构 Eval MLOps Stack Substack
建议: 精读,可作为 Agent 工程实践主题页框架
✅ 保留 #5 — The Nuanced Perspective Substack: "Inference Engineering for Agents: Spend Compute where it Helps"
URL: https://thenuancedperspective.substack.com/p/inference-engineering-for-agents
来源类型: Substack(Aishwarya Reganti)
可信度: 中 — 引用 Berkeley/Stanford 联合评测(8个前沿推理模型 x 12任务),Shadow Price of Reasoning 论文,SPORK 论文
核心工程洞察: - 模型选型陷阱: Gemini 3 Flash 标价比 GPT 5.4 低 80%,但实测 38% 成本更高 — 实际成本必须基于真实工作负载测量 - 推理效用 S 曲线: 推理 tokens 效用非线性,存在三阶段,均匀分配不如基于难度的动态分配 - CLEAR Framework(Constrained Latent-utility Equilibrium Allocation for Reasoning): 将推理 tokens 视为有限资源进行边际效用最大化分配,比均匀分配精度提升 3x - SPORK(Self-Speculative Forking): 模型对工具调用预测准确率 74-99%,可提前创建轻量 fork 线程复用主线程 prefix + KV cache - 三层难度分级: 普通工作走廉价路径,失败时升级到前沿模型 — 已在生产验证
保留理由:
✅ 成本/推理效率工程视角,✅ 有量化结论,✅ 对推理优化实践有直接指导
⚠️ Substack,无源码,但方法论有工程价值
标签: 推理优化 成本优化 Agent CLEAR SPORK Substack
建议: 收录,特别是推理 token 分配策略部分
✅ 保留 #6 — arXiv: Belayer: Efficient Fault Tolerance for LLM Agentic RL Training (2608.14635)
URL: https://arxiv.org/html/2608.14635v1
来源类型: arXiv 论文
可信度: 高 — 具体系统描述,H200 集群配置,代码级实现思路
核心工程洞察: - 问题: LLM RL 训练中基础设施故障(工具调用失败、GPU 故障)被暴露为普通任务反馈,导致模型对基础设施错误做出反应而非任务本身,产生不一致训练轨迹 - Belayer 架构: 三平面执行 — Rollout Cluster(LLM 推理)/ Environment Cluster(沙盒交互)/ Training Cluster(策略优化) - 部署配置: Nvidia H200 × 4节点 × 32GPU,RoCE 400Gbps × 8 互联,Ubuntu 24.04 - 评估模型: Qwen3-4B/8B/32B Math 工作负载,Qwen3-32B SWE 工作负载(4K 单步最大响应,32K 最大上下文) - 故障容忍设计: 只需少量配置变更即可启用 Belayer 容错机制(继承 Slime API 兼容性)
保留理由:
✅ 有硬件配置(GPU型号/数量/互联带宽),✅ 有明确故障场景,✅ 真实 RL 训练系统设计
❌ 论文尚未经过同行评审,但系统描述详细
标签: RL训练 Agent 容错 H200 Qwen3 arXiv
建议: 收录 RL 训练基础设施设计参考
✅ 保留 #7 — arXiv: AgentCompass: Unified Evaluation Infrastructure for Agent Capabilities (2607.13705)
URL: https://arxiv.org/html/2607.13705v1
来源类型: arXiv 论文
可信度: 高 — 开源基础设施,解耦设计,有 GitHub
核心工程洞察: - 解耦架构: AgentCompass 将评估管道分为独立的 Model / Benchmark / Harness / Environment 四层,消除紧耦合 - 原生集成 20+ benchmarks: 支持多 Benchmark × 多 Harness × 多 Environment 灵活配置,无需重写复杂执行逻辑 - 容错异步运行时: 支持轨迹级别分析,可诊断 reward-hacking 等复杂行为(超越传统标量评分) - 可扩展性: 新增数据集无需重新实现执行逻辑,只需配置接口
保留理由:
✅ 开源,✅ 有架构图,✅ 对 Agent Eval 基础设施选型有直接参考
❌ 框架刚发布,生产验证有限
标签: Agent Eval 基础设施 开源 arXiv
建议: 收录,作为 Agent 评测工具选型参考
✅ 保留 #8 — arXiv: From Prompt–Response to Goal-Directed Systems: Evolution of Agentic AI Software Architecture (2602.10479)
URL: https://arxiv.org/html/2602.10479v1
来源类型: arXiv 论文(全景综述)
可信度: 中高 — 综述性质,有架构层次图,引用丰富
核心工程洞察: - 分层参考架构: Human Actor → Agent Interface → Agent Core (LLM reasoning) → Control Layer (planner/policy/state-machine/retry/circuit breaker) → Memory Layer → Tooling Layer → Governance - 认知与执行分离: Control Layer 实现规划/策略/状态机/重试/断路器,与 LLM 推理核心解耦 - Memory Layer 组成: Working context / Episodic store / Semantic KB + Vector stores / User preferences - Tooling Layer: Tool registry + schemas / Connectors & adapters / Sandboxed execution / RAG - 生产需求: Observability + Evaluation + Security + Reproducibility 四位一体 - 多 Agent 协调: 架构层面梳理 manager vs. decentralized handoffs
保留理由:
✅ 完整分层架构图,✅ 可作为 Agent 系统设计 checklist,✅ 生产部署视角
⚠️ 综述性质,偏理论但框架清晰
标签: AI-Agent 架构 生产 综述 arXiv
建议: 收录作为架构设计参考
✅ 保留 #9 — DEV Community: "The Complete Guide to Local LLM Inference Tools in July 2026"
URL: https://dev.to/sreeraj-sreenivasan/the-complete-guide-to-local-llm-inference-tools-in-july-2026-llamacpp-ollama-vllm-sglang-and-4mh1
来源类型: DEV Community 技术博客
可信度: 中 — 工具对比框架,具体吞吐量倍数(16-20x Ollama),有各工具定位分析
核心工程洞察: - vLLM: PagedAttention,16-20x Ollama 并发吞吐,事实生产标准 - SGLang: RadixAttention,RAG 管道 6x 加速,2026 增长最快框架 - LMDeploy: 视觉-语言模型和 A100/A800 INT4 最佳 - mlx-lm: Apple Silicon 本地推理+微调唯一路径 - Aphrodite: vLLM 分支,量化格式支持最广
保留理由:
✅ 2026年最新工具对比框架,✅ 各引擎定位清晰,✅ 有量化相对性能
❌ 无原创 benchmark 数据
标签: 推理引擎 工具对比 vLLM SGLang llama.cpp
建议: 收录作为推理引擎选型入门参考
✅ 保留 #10 — GitHub: microsoft/Build26-BRK241
URL: https://github.com/microsoft/Build26-BRK241-from-prototype-to-production-build-and-run-agents-at-scale
来源类型: GitHub(Microsoft Build 2026 官方资源)
可信度: 高 — 官方工程 Session,PPT + 代码仓库
核心工程议题: - 从原型到生产的 Agent 工程模式 - 工具设计、Memory、长时运行工作流 - Human-in-the-loop 和可观测性
保留理由:
✅ 官方资源,✅ 工程实践导向,✅ 可下载 PPT/代码
⚠️ GitHub 仓库需进一步查看内容深度
标签: AI-Agent Microsoft 生产 GitHub
建议: 精读,查看仓库实际内容
三、丢弃条目及理由
| 条目 | 来源 | 丢弃理由 |
|---|---|---|
| packet.ai decision guide | 技术博客 | 结论与其他 benchmark 来源高度重复,无新增数据点 |
| decodefuture.org vLLM vs SGLang | 技术博客 | 泛泛而谈,版本号罗列,无具体 benchmark 数据 |
| Himanshu Roadmap Substack | Substack | 通用学习路径,无工程实践原创内容 |
| Aqs Azafar Roadmap | Substack | 通用学习路径,同上 |
| Java Revisited 书籍推荐 | Substack | 书籍清单,无原创工程内容 |
| awesome-harness-engineering | GitHub list | 仅汇总链接,无原创分析 |
四、分类标签汇总
| 标签 | 数量 |
|---|---|
推理引擎 |
5 |
AI-Agent |
5 |
benchmark |
3 |
vLLM |
4 |
SGLang |
4 |
生产架构 |
4 |
Eval |
3 |
Substack |
3 |
arXiv |
4 |
成本优化 |
1 |
RL训练 |
1 |
容错 |
1 |
KV-Cache |
1 |
五、建议写入路径
/shared/research-kb/inbox/jay/2026-09-25-inference-agents-engineering.md
六、后续行动
需精读/审稿:
1. turion.ai vLLM/SGLang convergence — 补充推理引擎主题页架构章节
2. The AI Engineer Substack — 补充 Agent Stack 主题页
3. Belayer arXiv — 补充 RL 训练基础设施主题
4. AgentCompass arXiv — 补充 Agent Eval 工具选型
待核验: - GitHub microsoft/Build26 仓库实际内容深度 - 各 benchmark 来源的具体数值(建议直接访问页面确认)
本轮写入状态: 本文件即草稿,写入 /shared/research-kb/inbox/jay/2026-09-25-inference-agents-engineering.md