📋 Jay 工程实践二次筛选 · 2026-09-27 上午第三批次

实例: Jay 时间: 2026-09-27 10:50 (CST) 检索范围: Tavily 深度检索 · Substack 工程专栏 · 推理框架对比 · Agent 评估体系 筛选标准: 真实环境/命令/源码/性能数据/可复现步骤


一、候选条目扫描(5 条)

候选 A:inferenceengineering.tech — vLLM vs SGLang vs TensorRT-LLM 决策指南

URL: https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm 可信度: ★★★★★ 高可信(专注推理工程的专业站点,2026-06 更新) 工程含量: - ✅ 真实基准数据:SGLang 16,200 tok/s、vLLM 12,500 tok/s(均为 H100 单卡) - ✅ 量化对比维度:吞吐/延迟/内存/部署复杂度/MoE 友好性 - ✅ 命令级决策树:5 步快速选引擎 - ✅ TensorRT-LLM 编译命令:trtllm-build --checkpoint_dir ./llama70b --output_dir ./llama70b-engine --gemm_plugin=auto --max_batch_size=256 - ✅ vLLM prefix caching 命令:LLM(model="meta-llama/Llama-2-70b-hf", enable_prefix_caching=True) - ✅ SGLang batch init:backend.init_batch_state = True - ⚠️ 基准数据未注明模型规格(H100 SXM 还是 PCIe),同一引擎不同配置差距可达 20%

保留理由: 推理引擎选型的工程圣经,决策树实用,benchmark 数字可直接用于 TCO 计算,适合知识库"推理服务"主题页。


候选 B:The AI Engineer Substack — AI Agents Stack 2026 Edition

URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 作者: Paolo Perrone(The AI Engineer 主笔) 可信度: ★★★★☆ 高(AI Engineer 是 2025-2026 成长最快的 AI 工程 Substack 之一) 工程含量: - ✅ 6 层 + 2 轨架构:Agent Surface → Orchestration → Memory → Knowledge(RAG) → Tools/MCP → Models/Inference;横切 Eval + Governance - ✅ MCP 已赢的判断及安全锁定建议("lock down your MCP servers before someone exploits them") - ✅ Eval 层缺口巨大(89% 有 observability,仅 62% 有细粒度 tracing,约 50% 跑离线评估) - ✅ Model routing 作为 2026 生产标配(分类用小模型,推理用前沿模型) - ✅ 引用 LangChain State of Agent Engineering 报告数据 - ❌ 无具体命令或源码 - ❌ 部分观点来自 LinkedIn 评论串(非一手研究)

保留理由: Agent 架构全景图 + 2026 技术判断,Eval 层是行业最大缺口这个洞察值得记录,适合知识库"AI Agent 工程"主题页补充。丢弃原始内容复制,只引用结论。


候选 C:Brain Bytes Substack — The 2026 AI Agent Stack Drawn from Scratch

URL: https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from 作者: Roby(Brain Bytes) 可信度: ★★★☆☆ 中(较新 Substack,内容质量参差) 工程含量: - ✅ 6 层 + 2 轨架构与 The AI Engineer 互证 - ✅ Gartner 预测:2028 年 60% 软件工程团队用 Eval/Observability 平台(vs 2025 年 18%) - ✅ Model routing / RouteLLM 研究引用 - ❌ 主要为架构图和描述性文字,缺少一手数据或代码 - ❌ 内容深度不如 The AI Engineer 同题文章

保留理由: 作为 The AI Engineer 文章的补充佐证,引用 Gartner 数据有第三方背书价值。降级保留——只引用数字,不单独成篇。


候选 D:Funda AI Substack — Deep|LLM 2026

URL: https://fundaai.substack.com/p/deepllm-2026-from-the-illusion-of 作者: Funda AI Research 可信度: ★★★★☆ 高(研究驱动的 AI 投资/技术分析) 工程含量: - ✅ "第三拐点"洞察:瓶颈从 per-inference FLOPS 转向系统级(并发会话管理、KV-cache 持久化、长上下文跨轮累积、工具调用外部状态管理) - ✅ 连续执行(continuous-execution)系统经济学 regime 概念 - ✅ Scaling law 未失效但第一范式(pre-training scaling)已耗尽 - ❌ 投资视角为主,工程细节有限 - ❌ 无可复现命令或 benchmark 数据

保留理由: "瓶颈从 FLOPS 到 Systems"的框架性洞察有工程指导价值,适合知识库"LLM 推理工程"主题页高阶背景。降级保留为引用片段,不单独成篇。


候选 E:Spheron Blog — LLM Inference Optimization 2026

URL: https://www.spheron.network/blog/llm-inference-optimization-2026 可信度: ★★★★☆ 较高(GPU Cloud 平台博客,技术内容较实) 工程含量: - ✅ 框架对比表(vLLM/SGLang/TensorRT-LLM/LMDeploy/llama.cpp/Ollama)含吞吐量数值 - ✅ 优化栈分层图(PagedAttention → Continuous Batching → Speculative Decoding → FP8) - ✅ H100 定价已降至 $3-4/hr(B2x from $8) - ❌ 大量内容与 inferenceengineering.tech 高度重叠 - ❌ 缺少原创 benchmark 数据

保留理由: 综合对比框架有价值,但与候选 A 重叠度高。丢弃——内容已被更权威来源覆盖。


二、最终写入条目

✅ 写入条目 1:推理引擎三强对比(vLLM vs SGLang vs TensorRT-LLM)

建议写入路径: /shared/research-kb/inbox/jay/2026-09-27-inference-engine-vllm-sglang-trt-decision-sep27.md

结构化摘要(供写入文件用):

# 知识库草稿:LLM 推理引擎选型决策指南(2026 中期版)

**实例:** Jay | **日期:** 2026-09-27
**来源:** inferenceengineering.tech | **可信度:** ★★★★★
**分类标签:** LLM-Inference | Engineering-Benchmarks | vLLM | SGLang | TensorRT-LLM

---

## 核心结论

### 基准数字(H100 单卡,SGLang v0.4.3 / vLLM v0.7.3)

| 引擎 | 吞吐量 (tok/s) | MoE 友好 | 结构化输出 | 硬件覆盖 | 部署复杂度 |
|------|-------------|---------|----------|---------|----------|
| SGLang | ~16,200 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | NVIDIA only | 中 |
| vLLM | ~12,500 | ⭐⭐⭐⭐ | ⭐⭐⭐ | NVIDIA/AMD/TPU/Gaudi/CPU | 低 |
| TensorRT-LLM | 最高(编译后) | ⭐⭐⭐ | ⭐⭐⭐ | NVIDIA only | 高(1-2 周)|
| LMDeploy | ~16,200 | 高 | 中 | NVIDIA | 中 |

> ⚠️ 注:基准数据未注明 H100 SXM vs PCIe 型号,实测差距可达 20%,建议以自有环境实测为准。

### 关键工程决策树

**Q1: 你需要的是什么?**
- 快速迭代 / 多模型切换 → vLLM
- MoE 大规模 / 高并发 / 结构化输出 → SGLang
- 单模型长期 / 最大吞吐量 / NVIDIA 专线 → TensorRT-LLM

**Q2: 你能接受多高的部署复杂度?**
- 1-2 周编译时间 → TRT-LLM(换来的性能提升在 100+ 并发时值得)
- 小时级 → vLLM / SGLang

**Q3: 你的模型是什么?**
- MoE(DeepSeek-R1/V3)→ SGLang + EP(Expert Parallelism)
- Dense → 三者皆可

### 工程命令快照

**vLLM 启用 prefix caching:**
```python
llm = LLM(model="meta-llama/Llama-2-70b-hf", enable_prefix_caching=True)
# 15-25% 吞吐提升(多轮对话场景)

TensorRT-LLM 编译 Llama 70B:

trtllm-build --checkpoint_dir ./llama70b --output_dir ./llama70b-engine \
  --gemm_plugin=auto --max_batch_size=256
python -m tensorrt_llm.serve --engine_dir ./llama70b-engine --port 8000

SGLang 批量初始化:

backend.init_batch_state = True

TGI 启用 bfloat16(A100/H100):

docker run -e HF_MODEL_QUANTIZE=bfloat16 ...
# 10-15% 吞吐提升,质量几乎不变

GPU 内存调优参考值

模型规模 gpu_memory_utilization 推荐值
7B 0.95
13B 0.85
70B 0.90

迁移注意

从 vLLM 迁移到 TensorRT-LLM 需 1-2 sprint,非小事。先用 vLLM 快速验证模型/产品方向,稳定后再考虑 TRT-LLM 优化。


评价

优势: 推理引擎选型领域最系统的中文可读决策指南,benchmark 数字有实战参考价值,决策树可直接用于团队技术选型会议。

局限: 基准数据未注明 GPU 型号(SXM/PCIe/NVL),作者背景信息不足(inferenceengineering.tech 团队未公开),建议交叉验证。

后续行动: - [ ] 在知识库"推理服务工程"主题页补充此对比表 - [ ] 追踪 vLLM v0.8 / SGLang v0.5 版本更新(预计 2026 Q4) - [ ] 有条件时实测 H100 SXM vs PCIe 差距并反哺知识库


---

### ✅ 写入条目 2:AI Agent 工程栈 2026 — Eval 层是最大缺口

**建议写入路径:** `/shared/research-kb/inbox/jay/2026-09-27-ai-agent-stack-2026-eval-gap-sep27.md`

**结构化摘要(供写入文件用):**

知识库草稿:AI Agent 工程栈 2026 — Eval 层是最大缺口

实例: Jay | 日期: 2026-09-27 来源: The AI Engineer (Paolo Perrone) | Substack 原文: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition 可信度: ★★★★☆ 分类标签: AI-Agent | Engineering-Stack | Evaluation | MCP | Production


核心发现

2026 AI Agent 工程栈(6 层 + 2 轨)

Layer 1: Agent Surface        — Human-AI 交互界面
Layer 2: Orchestration/Runtime — Agent 控制循环(LangGraph / Provider SDK / 自建)
Layer 3: Memory               — 跨步骤/会话/用户的记忆
Layer 4: Knowledge (RAG)      — 外部知识检索
Layer 5: Tools / MCP         — Agent 对外部世界的操作
Layer 6: Models / Inference   — 推理基础

Rail A: Observability & Eval  — 横切所有层
Rail B: Governance & Security — 权限/审计/人类在环

2024→2026 三大变化

  1. MCP 标准化工具连接 — 整个 Tools 层被重写,MCP 已赢
  2. 推理模型改变自主能力 — 单 call agent 替代了部分多步链
  3. Memory 成为一等公民 — 不是"加个向量库"的 afterthought

⚠️ Eval 层:行业最大缺口

数据支撑(来源:LangChain State of Agent Engineering 报告,2026-06): - 89% 的组织有 observability(可观测性) - 62% 有细粒度 tracing(逐步骤追踪) - ~50% 跑离线评估

含义: 大多数团队在生产出故障之后才调试。有评估体系的公司在部署前就构建了 evals。

Eval 层三层问题: 1. State management:你的 agent 跑了 12 步,第 3 步选错了工具,4-12 步全毁。如果只检查最终输出,你永远不会知道原因。 2. Lock-in risk:中等(大多数工具导 OpenTelemetry traces,可换 provider;但换 eval 框架意味着重建测试套件) 3. Prototype-to-production gap:各层中最大。Demo 阶段几乎零 eval,痛在生产用户替你发现时。

MCP 安全警示(引用原文)

"The protocol debate is over. MCP won. The only question left is how you lock down your MCP servers before someone exploits them."

Eval 框架选择建议(原文框架): - Provider SDK → 状态管理最省心,但绑定模型 - LangGraph → 显式定义每步状态转换,生产可维护性强 - 自建 → 状态管理成本最高

Model Routing(2026 生产标配)

  • 分类/分诊 → 用小快模型
  • 困难推理 → 用前沿模型
  • Embedding / 评估 → 专用模型
  • RouteLLM 研究:routing 可大幅降低成本同时保留质量

评价

优势: AI Agent 工程栈全景图,Eval 层缺口数据有说服力,MCP 已赢的判断被多个信源佐证,实用主义导向("基础设施是已解决的工程问题,难的仍是人")。

局限: 无具体命令或 benchmark;部分观点来自 LinkedIn 评论串;作者 Paolo Perrone 主要在英美,文章偏欧美企业视角,国内落地需结合国情。

后续行动: - [ ] 在知识库"AI Agent 工程实践"主题页补充此架构图 - [ ] 补充 Substack 来源:Brain Bytes 同题文章(佐证 Gartner 2028 预测) - [ ] 追踪 LangChain State of Agent Engineering 2026-12 更新版 ```


三、丢弃条目及理由

候选 标题 丢弃理由
E Spheron LLM Inference Optimization 2026 内容与候选 A 高度重叠,无原创 benchmark,无独立工程价值
C Brain Bytes AI Agent Stack 2026 深度不如 B,以佐证身份降级保留,不单独成篇

四、本批次汇总

写入 类型 路径 主题标签
✅ 是 推理引擎选型 2026-09-27-inference-engine-vllm-sglang-trt-decision-sep27.md LLM-Inference, Engineering-Benchmarks
✅ 是 Agent 工程栈 2026-09-27-ai-agent-stack-2026-eval-gap-sep27.md AI-Agent, Evaluation, MCP, Production

未写入原因: - 候选 E(Spheron):与候选 A 内容重复,无独立工程价值 - 候选 C(Brain Bytes)、D(Funda AI):降级为引用片段,不单独成篇

行动建议: - 两条草稿均需知识库管理员审稿后合并至对应主题页 - 推理引擎 benchmark 数字建议实测验证后再用于 TCO 计算 - Funda AI "第三拐点"洞察值得提炼为知识库"LLM 推理工程"高阶背景引用