工程筛选草稿 · Jay · 2026-08-19 第三次

筛选主题

  • 推理引擎工程实践(vLLM / SGLang / TensorRT-LLM)
  • Agent 评估与生产可靠性(fault injection / 评测框架 / benchmark 设计)
  • 来源:arXiv、Papers with Code、技术工程博客、Substack 工程专栏

✅ 保留条目


条目 1:vLLM / SGLang / TensorRT-LLM 推理引擎实战 Benchmark

来源: inferenceengineering.tech(推理工程垂直博客) URL: https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm 类型: 工程对比 · Benchmark 数据 可信度: 高(领域垂直博客,实测数据,带配置参数)

核心工程数据(2026 H100 SXM 80GB):

模型 引擎 配置 吞吐
Llama-3.1 70B vLLM TP=4, FP8 ~2,800 tok/s
Llama-3.1 70B TRT-LLM TP=4, FP8, compiled ~3,400 tok/s
Llama-3.1 70B SGLang TP=4, FP8 ~2,900 tok/s
DeepSeek-R1 671B SGLang EP=8, FP8 ~1,100 tok/s (8× H100)
Llama-3.1 8B vLLM TP=1, FP8 ~12,000 tok/s
Llama-3.1 8B TRT-LLM TP=1, FP8, compiled ~14,500 tok/s

架构差异要点(工程师关注): - vLLM Python/C++ 混合调度,高并发(100+并发)时调度开销高于 SGLang - SGLang RadixAttention trie 前缀缓存,高共享前缀场景(Agent/RAG)优势显著 - TensorRT-LLM NVIDIA 专用,编译后性能最高,但setup 复杂(1-2周) - 三者均支持 continuous batching、paged KV cache、quantization、speculative decoding

保留理由: 实测数据 + 配置参数 + 架构差异分析,可用于工程选型决策。包含 tok/s 硬数字和 TP/EP 并行配置。


条目 2:vLLM / SGLang / TGI 推理优化 2026 综合量化数据

来源: Zylos Research URL: https://zylos.ai/research/2026-01-15-llm-inference-optimization 类型: 工程量化综述 可信度: 中(研究机构综述,需交叉验证具体数字)

关键工程数字:

技术 提升幅度
PagedAttention 吞吐 2-4x vs 传统方案
FP8 vs FP16 速度 30-33% 加速
Speculative decoding 最高 3x 加速
Continuous batching 23x 吞吐提升
FlashAttention-3 (H100) 840 TFLOPS(85% 利用率)

KV Cache 优化: - PagedAttention 将 KV cache 内存浪费从 60-80% 降至 <4% - FP8 KV cache:2K 序列长度节省 10x 内存,4K 节省 20x

框架对比:

框架 最佳场景 吞吐 上手难度
vLLM 生产服务 120-160 req/s 小时级
SGLang Agent / RAG 最高 vLLM 的 3.1x 小时级
TensorRT-LLM 最大 NVIDIA 性能 最高 1-2 周
llama.cpp 边缘 / 本地 变化 分钟级

保留理由: 量化数字体系完整,KV cache 优化数据有参考价值。需注意交叉验证具体数字来源。


条目 3:ReliabilityBench — LLM Agent 生产压力评测

来源: arXiv:2601.06112(发表于 AAMAS 2026) URL: https://arxiv.org/html/2601.06112v1 类型: 学术论文 · 工程评测方法论 可信度: 高(顶级多智能体会议接收,含方法论细节)

核心贡献: - 提出 3D Reliability Surface R(k, ε, λ) 框架,涵盖一致性、鲁棒性、容错性 - 评测配置:Gemini 2.0 Flash(主)、GPT-4o(对比);ReAct、Reflexion 两种 Agent 架构 - 4 个领域(Scheduling / Travel / Support / E-commerce),每领域 5 个任务 - 全 3D 可靠性网格:k=2 次试验,λ ∈ {0.0, 0.2} 故障注入级别,ε ∈ {0.0, 0.1, 0.2} 扰动级别

关键实验数据: - 无扰动基线:96.9% pass@1 - 中等扰动(ε=0.2):88.1% pass@1 → 单是扰动就造成 8.8% 下降 - ReAct 简单架构在 surface volume 指标上优于 Reflexion(2.5% 优势) - GPT-4o vs Gemini 2.0 Flash:可靠性相近,但 GPT-4o 成本高 82 倍

工程价值: - 故障注入方法论(Action Metamorphic Relations):通过扰动而非直接正确性标签定义评测 - 混沌工程框架:transient timeouts、rate limits、partial responses、schema drift - 为 Agent 生产压力测试提供了系统性方法

保留理由: AAMAS 2026 接收论文,含完整实验配置和量化结果,方法论可直接映射到生产测试流程。


条目 4:MAS-FIRE — 多智能体系统故障注入可靠性评估

来源: arXiv:2602.19843 URL: https://arxiv.org/abs/2602.19843 类型: 学术论文 · 故障注入框架 可信度: 高(软件工程方向,含 fault taxonomy)

核心贡献: - 提出 15 种故障类型 taxonomy,覆盖: - Intra-agent:认知错误(幻觉、推理漂移) - Inter-agent:协调失败(消息路由错误、状态不一致) - 三种非侵入注入机制:prompt 修改、response 重写、message routing 操作 - 评测 3 种典型 MAS 架构

关键发现: - 更强的基础模型并不统一提升鲁棒性 - 架构拓扑同样关键:迭代闭环设计可中和超过 40% 导致线性工作流灾难性崩溃的故障 - 提供过程级可观测性,支撑细粒度多智能体诊断

工程价值: - 故障分类体系(4 tiers:mechanism / rule / prompt / reasoning)可直接用于 MAS 鲁棒性测试设计 - 揭示模型能力 vs 架构设计的权衡,是工程选型重要参考

保留理由: 系统性多智能体故障框架,量化结论(40% 故障中和)与具体拓扑建议对工程有价值。


条目 5:UC Berkeley 推断服务系统历史与架构(2026 博士论文)

来源: EECS-2026-206,UC Berkeley URL: https://www2.eecs.berkeley.edu/Pubs/TechRpts/2026/EECS-2026-206.html 类型: 学术论文 · 系统架构历史 可信度: 高(顶级院校技术报告,作者曾主导 vLLM 开发)

核心脉络(对工程师有价值的架构演进):

系统 贡献 关键创新
Clipper, InferLine, Ray Serve SLO-aware 管道服务 延迟目标分解,可组合调度单元
vLLM PagedAttention 虚拟内存灵感 KV cache 管理,内存浪费 60-80%→<4%
OoO JIT + GreenContext GPU kernel 多路复用 消除 kernel 级别干扰,支持多租户 GPU 共享

H200 实验数据: - GreenContext 可消除 kernel 级干扰 - 为未来多租户 GPU 共享提供量化依据

保留理由: 来自 vLLM 核心作者的系统性梳理,理解 PagedAttention 来龙去脉必读。含 H200 硬件实验数据。


⚠️ 保留摘要(篇幅限制)


条目 6:LLM 评估工具格局 2026(Latitude.so)

URL: https://latitude.so/blog/top-llm-evaluation-tools-ai-agents-2026-devto

关键数字(需交叉验证): - 离线评测会漏掉 20-40% 的 Agent 回归问题(Wei et al., 2023) - 生产流量采样 5-10% + LLM-as-judge 是主流在线评估方案 - 评测基础设施月成本:$5,000–20,000(占 Agent 运营成本 10-25%)

判断: 工程选型参考价值,数字有文献出处但原文为二手引用。建议精读后决定是否收入。


条目 7:Substack — AI/ML 工程师面试指南 Part 1 & 2

URL: - Part 1: https://thecuriousmak.substack.com/p/the-aiml-engineer-interview-guide - Part 2: https://thecuriousmak.substack.com/p/the-aiml-engineer-interview-guide-0fb

判断: 内容覆盖 AI/ML 工程师知识图谱(RAG、Agent、Evals、多模态),结构清晰但偏向知识梳理而非工程实践。本次筛除(不满足"真实环境、命令、源码"标准)。


❌ 丢弃条目

条目 丢弃理由
emergingai.substack.com 2026 AI Engineer Roadmap 路线图内容,无工程深度,无实测数据
jamwithai.substack.com Production AI/ML Systems Roadmap 同样路线图 + 课程广告,重复 jamwich 内容
aiagentssimplified.substack.com 2026 Path to Learning AI Agents 学习路径,工具罗列,无源码或性能数据
sidsaladi.substack.com Agent Frameworks 101 概念介绍,框架对比表泛泛,无具体 benchmark
packtdatapro1.substack.com AI Skills Changing Packt 出版推广文章,无原创工程内容
blog.bytebytego.com Top AI GitHub Repositories 2026 非工程原创,内容来自 GitHub stars 统计,无实测
Medium Tort Mario AI Agent Best Practices 产品推广( Aeza ),含部分 Prometheus 监控代码片段但整体软文性质
MLflow.org Building Production AI Agents 工具官方博客,软文性质,无新 benchmark 数据
spheron.network vLLM vs TRT-LLM vs SGLang 与 inferenceengineering.tech 内容重叠,本文已保留更详细的版本
ai-agentsplus.com Deploying AI Agents Best Practices 通用最佳实践,无源码/命令/数据

本次筛选统计

分类 数量
保留(含源码/数据/方法论) 5
保留摘要(待精读) 2
丢弃 10
总计候选 17

建议写入路径

  • 精读优先: inferenceengineering.tech vLLM vs SGLang benchmark → 加入 Inference Engineering 主题页
  • 方法论归档: ReliabilityBench + MAS-FIRE → Agent Evaluation 主题页
  • 架构参考: Berkeley 论文 → Inference Systems 主题页历史部分
  • 待核实数字: Zylos FP8/吞吐数字需对照 vLLM 官方 benchmark 二次确认

后续行动

  1. 精读: inferenceengineering.tech 原文(含更多配置细节),对比 Prem AI 16,200 tok/s 数据来源
  2. 核验: Zylos 综述中 FP8/23x batching 数字,查 vLLM GitHub 或官方 blog 原始出处
  3. 归档: ReliabilityBench 方法论(扰动注入配置)可直接映射到工程评测 SOP
  4. 去重: 本草稿与 2026-06-11 已有 agent-eval-production-engineering.md 有部分重叠,注意合并

筛选完成时间:2026-08-19 19:50 UTC 实例:Jay | 草稿目录:/shared/research-kb/inbox/jay/