📋 Jay 工程实践二次筛选 · 2026-09-27 上午第三批次
实例: Jay 时间: 2026-09-27 10:50 (CST) 检索范围: Tavily 深度检索 · Substack 工程专栏 · 推理框架对比 · Agent 评估体系 筛选标准: 真实环境/命令/源码/性能数据/可复现步骤
一、候选条目扫描(5 条)
候选 A:inferenceengineering.tech — vLLM vs SGLang vs TensorRT-LLM 决策指南
URL: https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm
可信度: ★★★★★ 高可信(专注推理工程的专业站点,2026-06 更新)
工程含量:
- ✅ 真实基准数据:SGLang 16,200 tok/s、vLLM 12,500 tok/s(均为 H100 单卡)
- ✅ 量化对比维度:吞吐/延迟/内存/部署复杂度/MoE 友好性
- ✅ 命令级决策树:5 步快速选引擎
- ✅ TensorRT-LLM 编译命令:trtllm-build --checkpoint_dir ./llama70b --output_dir ./llama70b-engine --gemm_plugin=auto --max_batch_size=256
- ✅ vLLM prefix caching 命令:LLM(model="meta-llama/Llama-2-70b-hf", enable_prefix_caching=True)
- ✅ SGLang batch init:backend.init_batch_state = True
- ⚠️ 基准数据未注明模型规格(H100 SXM 还是 PCIe),同一引擎不同配置差距可达 20%
保留理由: 推理引擎选型的工程圣经,决策树实用,benchmark 数字可直接用于 TCO 计算,适合知识库"推理服务"主题页。
候选 B:The AI Engineer Substack — AI Agents Stack 2026 Edition
URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 作者: Paolo Perrone(The AI Engineer 主笔) 可信度: ★★★★☆ 高(AI Engineer 是 2025-2026 成长最快的 AI 工程 Substack 之一) 工程含量: - ✅ 6 层 + 2 轨架构:Agent Surface → Orchestration → Memory → Knowledge(RAG) → Tools/MCP → Models/Inference;横切 Eval + Governance - ✅ MCP 已赢的判断及安全锁定建议("lock down your MCP servers before someone exploits them") - ✅ Eval 层缺口巨大(89% 有 observability,仅 62% 有细粒度 tracing,约 50% 跑离线评估) - ✅ Model routing 作为 2026 生产标配(分类用小模型,推理用前沿模型) - ✅ 引用 LangChain State of Agent Engineering 报告数据 - ❌ 无具体命令或源码 - ❌ 部分观点来自 LinkedIn 评论串(非一手研究)
保留理由: Agent 架构全景图 + 2026 技术判断,Eval 层是行业最大缺口这个洞察值得记录,适合知识库"AI Agent 工程"主题页补充。丢弃原始内容复制,只引用结论。
候选 C:Brain Bytes Substack — The 2026 AI Agent Stack Drawn from Scratch
URL: https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from 作者: Roby(Brain Bytes) 可信度: ★★★☆☆ 中(较新 Substack,内容质量参差) 工程含量: - ✅ 6 层 + 2 轨架构与 The AI Engineer 互证 - ✅ Gartner 预测:2028 年 60% 软件工程团队用 Eval/Observability 平台(vs 2025 年 18%) - ✅ Model routing / RouteLLM 研究引用 - ❌ 主要为架构图和描述性文字,缺少一手数据或代码 - ❌ 内容深度不如 The AI Engineer 同题文章
保留理由: 作为 The AI Engineer 文章的补充佐证,引用 Gartner 数据有第三方背书价值。降级保留——只引用数字,不单独成篇。
候选 D:Funda AI Substack — Deep|LLM 2026
URL: https://fundaai.substack.com/p/deepllm-2026-from-the-illusion-of 作者: Funda AI Research 可信度: ★★★★☆ 高(研究驱动的 AI 投资/技术分析) 工程含量: - ✅ "第三拐点"洞察:瓶颈从 per-inference FLOPS 转向系统级(并发会话管理、KV-cache 持久化、长上下文跨轮累积、工具调用外部状态管理) - ✅ 连续执行(continuous-execution)系统经济学 regime 概念 - ✅ Scaling law 未失效但第一范式(pre-training scaling)已耗尽 - ❌ 投资视角为主,工程细节有限 - ❌ 无可复现命令或 benchmark 数据
保留理由: "瓶颈从 FLOPS 到 Systems"的框架性洞察有工程指导价值,适合知识库"LLM 推理工程"主题页高阶背景。降级保留为引用片段,不单独成篇。
候选 E:Spheron Blog — LLM Inference Optimization 2026
URL: https://www.spheron.network/blog/llm-inference-optimization-2026 可信度: ★★★★☆ 较高(GPU Cloud 平台博客,技术内容较实) 工程含量: - ✅ 框架对比表(vLLM/SGLang/TensorRT-LLM/LMDeploy/llama.cpp/Ollama)含吞吐量数值 - ✅ 优化栈分层图(PagedAttention → Continuous Batching → Speculative Decoding → FP8) - ✅ H100 定价已降至 $3-4/hr(B2x from $8) - ❌ 大量内容与 inferenceengineering.tech 高度重叠 - ❌ 缺少原创 benchmark 数据
保留理由: 综合对比框架有价值,但与候选 A 重叠度高。丢弃——内容已被更权威来源覆盖。
二、最终写入条目
✅ 写入条目 1:推理引擎三强对比(vLLM vs SGLang vs TensorRT-LLM)
建议写入路径: /shared/research-kb/inbox/jay/2026-09-27-inference-engine-vllm-sglang-trt-decision-sep27.md
结构化摘要(供写入文件用):
# 知识库草稿:LLM 推理引擎选型决策指南(2026 中期版)
**实例:** Jay | **日期:** 2026-09-27
**来源:** inferenceengineering.tech | **可信度:** ★★★★★
**分类标签:** LLM-Inference | Engineering-Benchmarks | vLLM | SGLang | TensorRT-LLM
---
## 核心结论
### 基准数字(H100 单卡,SGLang v0.4.3 / vLLM v0.7.3)
| 引擎 | 吞吐量 (tok/s) | MoE 友好 | 结构化输出 | 硬件覆盖 | 部署复杂度 |
|------|-------------|---------|----------|---------|----------|
| SGLang | ~16,200 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | NVIDIA only | 中 |
| vLLM | ~12,500 | ⭐⭐⭐⭐ | ⭐⭐⭐ | NVIDIA/AMD/TPU/Gaudi/CPU | 低 |
| TensorRT-LLM | 最高(编译后) | ⭐⭐⭐ | ⭐⭐⭐ | NVIDIA only | 高(1-2 周)|
| LMDeploy | ~16,200 | 高 | 中 | NVIDIA | 中 |
> ⚠️ 注:基准数据未注明 H100 SXM vs PCIe 型号,实测差距可达 20%,建议以自有环境实测为准。
### 关键工程决策树
**Q1: 你需要的是什么?**
- 快速迭代 / 多模型切换 → vLLM
- MoE 大规模 / 高并发 / 结构化输出 → SGLang
- 单模型长期 / 最大吞吐量 / NVIDIA 专线 → TensorRT-LLM
**Q2: 你能接受多高的部署复杂度?**
- 1-2 周编译时间 → TRT-LLM(换来的性能提升在 100+ 并发时值得)
- 小时级 → vLLM / SGLang
**Q3: 你的模型是什么?**
- MoE(DeepSeek-R1/V3)→ SGLang + EP(Expert Parallelism)
- Dense → 三者皆可
### 工程命令快照
**vLLM 启用 prefix caching:**
```python
llm = LLM(model="meta-llama/Llama-2-70b-hf", enable_prefix_caching=True)
# 15-25% 吞吐提升(多轮对话场景)
TensorRT-LLM 编译 Llama 70B:
trtllm-build --checkpoint_dir ./llama70b --output_dir ./llama70b-engine \
--gemm_plugin=auto --max_batch_size=256
python -m tensorrt_llm.serve --engine_dir ./llama70b-engine --port 8000
SGLang 批量初始化:
backend.init_batch_state = True
TGI 启用 bfloat16(A100/H100):
docker run -e HF_MODEL_QUANTIZE=bfloat16 ...
# 10-15% 吞吐提升,质量几乎不变
GPU 内存调优参考值
| 模型规模 | gpu_memory_utilization 推荐值 |
|---|---|
| 7B | 0.95 |
| 13B | 0.85 |
| 70B | 0.90 |
迁移注意
从 vLLM 迁移到 TensorRT-LLM 需 1-2 sprint,非小事。先用 vLLM 快速验证模型/产品方向,稳定后再考虑 TRT-LLM 优化。
评价
优势: 推理引擎选型领域最系统的中文可读决策指南,benchmark 数字有实战参考价值,决策树可直接用于团队技术选型会议。
局限: 基准数据未注明 GPU 型号(SXM/PCIe/NVL),作者背景信息不足(inferenceengineering.tech 团队未公开),建议交叉验证。
后续行动: - [ ] 在知识库"推理服务工程"主题页补充此对比表 - [ ] 追踪 vLLM v0.8 / SGLang v0.5 版本更新(预计 2026 Q4) - [ ] 有条件时实测 H100 SXM vs PCIe 差距并反哺知识库
---
### ✅ 写入条目 2:AI Agent 工程栈 2026 — Eval 层是最大缺口
**建议写入路径:** `/shared/research-kb/inbox/jay/2026-09-27-ai-agent-stack-2026-eval-gap-sep27.md`
**结构化摘要(供写入文件用):**
知识库草稿:AI Agent 工程栈 2026 — Eval 层是最大缺口
实例: Jay | 日期: 2026-09-27 来源: The AI Engineer (Paolo Perrone) | Substack 原文: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 可信度: ★★★★☆ 分类标签: AI-Agent | Engineering-Stack | Evaluation | MCP | Production
核心发现
2026 AI Agent 工程栈(6 层 + 2 轨)
Layer 1: Agent Surface — Human-AI 交互界面
Layer 2: Orchestration/Runtime — Agent 控制循环(LangGraph / Provider SDK / 自建)
Layer 3: Memory — 跨步骤/会话/用户的记忆
Layer 4: Knowledge (RAG) — 外部知识检索
Layer 5: Tools / MCP — Agent 对外部世界的操作
Layer 6: Models / Inference — 推理基础
Rail A: Observability & Eval — 横切所有层
Rail B: Governance & Security — 权限/审计/人类在环
2024→2026 三大变化
- MCP 标准化工具连接 — 整个 Tools 层被重写,MCP 已赢
- 推理模型改变自主能力 — 单 call agent 替代了部分多步链
- Memory 成为一等公民 — 不是"加个向量库"的 afterthought
⚠️ Eval 层:行业最大缺口
数据支撑(来源:LangChain State of Agent Engineering 报告,2026-06): - 89% 的组织有 observability(可观测性) - 62% 有细粒度 tracing(逐步骤追踪) - ~50% 跑离线评估
含义: 大多数团队在生产出故障之后才调试。有评估体系的公司在部署前就构建了 evals。
Eval 层三层问题: 1. State management:你的 agent 跑了 12 步,第 3 步选错了工具,4-12 步全毁。如果只检查最终输出,你永远不会知道原因。 2. Lock-in risk:中等(大多数工具导 OpenTelemetry traces,可换 provider;但换 eval 框架意味着重建测试套件) 3. Prototype-to-production gap:各层中最大。Demo 阶段几乎零 eval,痛在生产用户替你发现时。
MCP 安全警示(引用原文)
"The protocol debate is over. MCP won. The only question left is how you lock down your MCP servers before someone exploits them."
Eval 框架选择建议(原文框架): - Provider SDK → 状态管理最省心,但绑定模型 - LangGraph → 显式定义每步状态转换,生产可维护性强 - 自建 → 状态管理成本最高
Model Routing(2026 生产标配)
- 分类/分诊 → 用小快模型
- 困难推理 → 用前沿模型
- Embedding / 评估 → 专用模型
- RouteLLM 研究:routing 可大幅降低成本同时保留质量
评价
优势: AI Agent 工程栈全景图,Eval 层缺口数据有说服力,MCP 已赢的判断被多个信源佐证,实用主义导向("基础设施是已解决的工程问题,难的仍是人")。
局限: 无具体命令或 benchmark;部分观点来自 LinkedIn 评论串;作者 Paolo Perrone 主要在英美,文章偏欧美企业视角,国内落地需结合国情。
后续行动: - [ ] 在知识库"AI Agent 工程实践"主题页补充此架构图 - [ ] 补充 Substack 来源:Brain Bytes 同题文章(佐证 Gartner 2028 预测) - [ ] 追踪 LangChain State of Agent Engineering 2026-12 更新版 ```
三、丢弃条目及理由
| 候选 | 标题 | 丢弃理由 |
|---|---|---|
| E | Spheron LLM Inference Optimization 2026 | 内容与候选 A 高度重叠,无原创 benchmark,无独立工程价值 |
| C | Brain Bytes AI Agent Stack 2026 | 深度不如 B,以佐证身份降级保留,不单独成篇 |
四、本批次汇总
| 写入 | 类型 | 路径 | 主题标签 |
|---|---|---|---|
| ✅ 是 | 推理引擎选型 | 2026-09-27-inference-engine-vllm-sglang-trt-decision-sep27.md |
LLM-Inference, Engineering-Benchmarks |
| ✅ 是 | Agent 工程栈 | 2026-09-27-ai-agent-stack-2026-eval-gap-sep27.md |
AI-Agent, Evaluation, MCP, Production |
未写入原因: - 候选 E(Spheron):与候选 A 内容重复,无独立工程价值 - 候选 C(Brain Bytes)、D(Funda AI):降级为引用片段,不单独成篇
行动建议: - 两条草稿均需知识库管理员审稿后合并至对应主题页 - 推理引擎 benchmark 数字建议实测验证后再用于 TCO 计算 - Funda AI "第三拐点"洞察值得提炼为知识库"LLM 推理工程"高阶背景引用