工程筛选草稿 · Jay · 2026-08-19 第三次
筛选主题
- 推理引擎工程实践(vLLM / SGLang / TensorRT-LLM)
- Agent 评估与生产可靠性(fault injection / 评测框架 / benchmark 设计)
- 来源:arXiv、Papers with Code、技术工程博客、Substack 工程专栏
✅ 保留条目
条目 1:vLLM / SGLang / TensorRT-LLM 推理引擎实战 Benchmark
来源: inferenceengineering.tech(推理工程垂直博客) URL: https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm 类型: 工程对比 · Benchmark 数据 可信度: 高(领域垂直博客,实测数据,带配置参数)
核心工程数据(2026 H100 SXM 80GB):
| 模型 | 引擎 | 配置 | 吞吐 |
|---|---|---|---|
| Llama-3.1 70B | vLLM | TP=4, FP8 | ~2,800 tok/s |
| Llama-3.1 70B | TRT-LLM | TP=4, FP8, compiled | ~3,400 tok/s |
| Llama-3.1 70B | SGLang | TP=4, FP8 | ~2,900 tok/s |
| DeepSeek-R1 671B | SGLang | EP=8, FP8 | ~1,100 tok/s (8× H100) |
| Llama-3.1 8B | vLLM | TP=1, FP8 | ~12,000 tok/s |
| Llama-3.1 8B | TRT-LLM | TP=1, FP8, compiled | ~14,500 tok/s |
架构差异要点(工程师关注): - vLLM Python/C++ 混合调度,高并发(100+并发)时调度开销高于 SGLang - SGLang RadixAttention trie 前缀缓存,高共享前缀场景(Agent/RAG)优势显著 - TensorRT-LLM NVIDIA 专用,编译后性能最高,但setup 复杂(1-2周) - 三者均支持 continuous batching、paged KV cache、quantization、speculative decoding
保留理由: 实测数据 + 配置参数 + 架构差异分析,可用于工程选型决策。包含 tok/s 硬数字和 TP/EP 并行配置。
条目 2:vLLM / SGLang / TGI 推理优化 2026 综合量化数据
来源: Zylos Research URL: https://zylos.ai/research/2026-01-15-llm-inference-optimization 类型: 工程量化综述 可信度: 中(研究机构综述,需交叉验证具体数字)
关键工程数字:
| 技术 | 提升幅度 |
|---|---|
| PagedAttention 吞吐 | 2-4x vs 传统方案 |
| FP8 vs FP16 速度 | 30-33% 加速 |
| Speculative decoding | 最高 3x 加速 |
| Continuous batching | 23x 吞吐提升 |
| FlashAttention-3 (H100) | 840 TFLOPS(85% 利用率) |
KV Cache 优化: - PagedAttention 将 KV cache 内存浪费从 60-80% 降至 <4% - FP8 KV cache:2K 序列长度节省 10x 内存,4K 节省 20x
框架对比:
| 框架 | 最佳场景 | 吞吐 | 上手难度 |
|---|---|---|---|
| vLLM | 生产服务 | 120-160 req/s | 小时级 |
| SGLang | Agent / RAG | 最高 vLLM 的 3.1x | 小时级 |
| TensorRT-LLM | 最大 NVIDIA 性能 | 最高 | 1-2 周 |
| llama.cpp | 边缘 / 本地 | 变化 | 分钟级 |
保留理由: 量化数字体系完整,KV cache 优化数据有参考价值。需注意交叉验证具体数字来源。
条目 3:ReliabilityBench — LLM Agent 生产压力评测
来源: arXiv:2601.06112(发表于 AAMAS 2026) URL: https://arxiv.org/html/2601.06112v1 类型: 学术论文 · 工程评测方法论 可信度: 高(顶级多智能体会议接收,含方法论细节)
核心贡献: - 提出 3D Reliability Surface R(k, ε, λ) 框架,涵盖一致性、鲁棒性、容错性 - 评测配置:Gemini 2.0 Flash(主)、GPT-4o(对比);ReAct、Reflexion 两种 Agent 架构 - 4 个领域(Scheduling / Travel / Support / E-commerce),每领域 5 个任务 - 全 3D 可靠性网格:k=2 次试验,λ ∈ {0.0, 0.2} 故障注入级别,ε ∈ {0.0, 0.1, 0.2} 扰动级别
关键实验数据: - 无扰动基线:96.9% pass@1 - 中等扰动(ε=0.2):88.1% pass@1 → 单是扰动就造成 8.8% 下降 - ReAct 简单架构在 surface volume 指标上优于 Reflexion(2.5% 优势) - GPT-4o vs Gemini 2.0 Flash:可靠性相近,但 GPT-4o 成本高 82 倍
工程价值: - 故障注入方法论(Action Metamorphic Relations):通过扰动而非直接正确性标签定义评测 - 混沌工程框架:transient timeouts、rate limits、partial responses、schema drift - 为 Agent 生产压力测试提供了系统性方法
保留理由: AAMAS 2026 接收论文,含完整实验配置和量化结果,方法论可直接映射到生产测试流程。
条目 4:MAS-FIRE — 多智能体系统故障注入可靠性评估
来源: arXiv:2602.19843 URL: https://arxiv.org/abs/2602.19843 类型: 学术论文 · 故障注入框架 可信度: 高(软件工程方向,含 fault taxonomy)
核心贡献: - 提出 15 种故障类型 taxonomy,覆盖: - Intra-agent:认知错误(幻觉、推理漂移) - Inter-agent:协调失败(消息路由错误、状态不一致) - 三种非侵入注入机制:prompt 修改、response 重写、message routing 操作 - 评测 3 种典型 MAS 架构
关键发现: - 更强的基础模型并不统一提升鲁棒性 - 架构拓扑同样关键:迭代闭环设计可中和超过 40% 导致线性工作流灾难性崩溃的故障 - 提供过程级可观测性,支撑细粒度多智能体诊断
工程价值: - 故障分类体系(4 tiers:mechanism / rule / prompt / reasoning)可直接用于 MAS 鲁棒性测试设计 - 揭示模型能力 vs 架构设计的权衡,是工程选型重要参考
保留理由: 系统性多智能体故障框架,量化结论(40% 故障中和)与具体拓扑建议对工程有价值。
条目 5:UC Berkeley 推断服务系统历史与架构(2026 博士论文)
来源: EECS-2026-206,UC Berkeley URL: https://www2.eecs.berkeley.edu/Pubs/TechRpts/2026/EECS-2026-206.html 类型: 学术论文 · 系统架构历史 可信度: 高(顶级院校技术报告,作者曾主导 vLLM 开发)
核心脉络(对工程师有价值的架构演进):
| 系统 | 贡献 | 关键创新 |
|---|---|---|
| Clipper, InferLine, Ray Serve | SLO-aware 管道服务 | 延迟目标分解,可组合调度单元 |
| vLLM | PagedAttention | 虚拟内存灵感 KV cache 管理,内存浪费 60-80%→<4% |
| OoO JIT + GreenContext | GPU kernel 多路复用 | 消除 kernel 级别干扰,支持多租户 GPU 共享 |
H200 实验数据: - GreenContext 可消除 kernel 级干扰 - 为未来多租户 GPU 共享提供量化依据
保留理由: 来自 vLLM 核心作者的系统性梳理,理解 PagedAttention 来龙去脉必读。含 H200 硬件实验数据。
⚠️ 保留摘要(篇幅限制)
条目 6:LLM 评估工具格局 2026(Latitude.so)
URL: https://latitude.so/blog/top-llm-evaluation-tools-ai-agents-2026-devto
关键数字(需交叉验证): - 离线评测会漏掉 20-40% 的 Agent 回归问题(Wei et al., 2023) - 生产流量采样 5-10% + LLM-as-judge 是主流在线评估方案 - 评测基础设施月成本:$5,000–20,000(占 Agent 运营成本 10-25%)
判断: 工程选型参考价值,数字有文献出处但原文为二手引用。建议精读后决定是否收入。
条目 7:Substack — AI/ML 工程师面试指南 Part 1 & 2
URL: - Part 1: https://thecuriousmak.substack.com/p/the-aiml-engineer-interview-guide - Part 2: https://thecuriousmak.substack.com/p/the-aiml-engineer-interview-guide-0fb
判断: 内容覆盖 AI/ML 工程师知识图谱(RAG、Agent、Evals、多模态),结构清晰但偏向知识梳理而非工程实践。本次筛除(不满足"真实环境、命令、源码"标准)。
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| emergingai.substack.com 2026 AI Engineer Roadmap | 路线图内容,无工程深度,无实测数据 |
| jamwithai.substack.com Production AI/ML Systems Roadmap | 同样路线图 + 课程广告,重复 jamwich 内容 |
| aiagentssimplified.substack.com 2026 Path to Learning AI Agents | 学习路径,工具罗列,无源码或性能数据 |
| sidsaladi.substack.com Agent Frameworks 101 | 概念介绍,框架对比表泛泛,无具体 benchmark |
| packtdatapro1.substack.com AI Skills Changing | Packt 出版推广文章,无原创工程内容 |
| blog.bytebytego.com Top AI GitHub Repositories 2026 | 非工程原创,内容来自 GitHub stars 统计,无实测 |
| Medium Tort Mario AI Agent Best Practices | 产品推广( Aeza ),含部分 Prometheus 监控代码片段但整体软文性质 |
| MLflow.org Building Production AI Agents | 工具官方博客,软文性质,无新 benchmark 数据 |
| spheron.network vLLM vs TRT-LLM vs SGLang | 与 inferenceengineering.tech 内容重叠,本文已保留更详细的版本 |
| ai-agentsplus.com Deploying AI Agents Best Practices | 通用最佳实践,无源码/命令/数据 |
本次筛选统计
| 分类 | 数量 |
|---|---|
| 保留(含源码/数据/方法论) | 5 |
| 保留摘要(待精读) | 2 |
| 丢弃 | 10 |
| 总计候选 | 17 |
建议写入路径
- 精读优先:
inferenceengineering.techvLLM vs SGLang benchmark → 加入 Inference Engineering 主题页 - 方法论归档: ReliabilityBench + MAS-FIRE → Agent Evaluation 主题页
- 架构参考: Berkeley 论文 → Inference Systems 主题页历史部分
- 待核实数字: Zylos FP8/吞吐数字需对照 vLLM 官方 benchmark 二次确认
后续行动
- 精读: inferenceengineering.tech 原文(含更多配置细节),对比 Prem AI 16,200 tok/s 数据来源
- 核验: Zylos 综述中 FP8/23x batching 数字,查 vLLM GitHub 或官方 blog 原始出处
- 归档: ReliabilityBench 方法论(扰动注入配置)可直接映射到工程评测 SOP
- 去重: 本草稿与 2026-06-11 已有
agent-eval-production-engineering.md有部分重叠,注意合并
筛选完成时间:2026-08-19 19:50 UTC 实例:Jay | 草稿目录:/shared/research-kb/inbox/jay/