Jay 工程实践筛选 · 2026-09-04

任务概述

  • 主题: LLM 推理引擎与 Agent 生产工程
  • 检索范围: Tavily 全网搜索 + Substack + 技术博客 + 工程手册
  • 高频轮次: 每天 3 次(本次第 2 次)

候选条目汇总(11 条)


🔴 保留 1 — SGLang vs vLLM 2026: 完整基准对比(Particula Tech)

URL: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
来源: 技术博客(Particula Engineering)
时间: 2026-06 更新
可信度: 高(独立工程团队实测)

核心工程数据

指标 SGLang vLLM 差值
总吞吐 ~16,200 tok/s ~12,500 tok/s SGLang +29%
输出 token 吞吐 894 tok/s 413 tok/s SGLang +117%
TTFT(首 token 时间) 79 ms 103 ms SGLang 快 23%
Token 间延迟(ITL) 6.0 ms 7.1 ms SGLang 快 15%

架构对比(高价值)

  • SGLang RadixAttention: 前缀复用,跨请求 KV 缓存,缓存树开销更高但前缀共享场景下优势明显
  • vLLM PagedAttention: 每请求独立缓存,<4% 内存碎片,长上下文友好
  • 并发扩展数据:50 并发时 SGLang 1,920 vs vLLM 1,850(差距仅 4%,前缀共享为零时)
  • 生产落地: xAI Grok 3、LinkedIn AI 功能、Cursor 代码补全均用 SGLang;vLLM 仍是大多数云 API 后端默认

保留理由

✅ 真实 H100 基准数据,含并发扩展曲线
✅ 架构差异分析有工程深度
✅ 包含生产环境落地案例
✅ 给出"混合路由"实操建议(不同负载类型路由到不同引擎)
⚠️ 无命令行示例和配置文件模板(轻微缺憾)

后续行动

  • 建议作为推理引擎选型决策页的核心引用
  • 补充 SGLang 和 vLLM 的 Docker 启动命令对比

🔴 保留 2 — vLLM/SGLang/TensorRT-LLM 三引擎完整指南(Inference Engineering)

URL: https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm
来源: 专业推理工程博客
时间: 2026
可信度: 高

核心工程数据(H100,实测)

模型 引擎 配置 吞吐
Llama-3.1 70B vLLM TP=4, FP8 ~2,800 tok/s
Llama-3.1 70B TRT-LLM TP=4, FP8, compiled ~3,400 tok/s
Llama-3.1 70B SGLang TP=4, FP8 ~2,900 tok/s
DeepSeek-R1 671B SGLang EP=8, FP8 ~1,100 tok/s (8× H100)
Llama-3.1 8B vLLM TP=1, FP8 ~12,000 tok/s
Llama-3.1 8B TRT-LLM TP=1, FP8, compiled ~14,500 tok/s

决策精华

  • vLLM: 最易上手,pip install + 一行 CLI,400+ 模型架构,AMD ROCm/Intel Gaudi/CPU 均支持
  • SGLang: MoE/高并发最优,DeepSeek-R1/V3 配合 EP(Expert Parallelism)效果最佳
  • TensorRT-LLM: 峰值最高但需要 1-2 周编译调优;适合长期固定模型的高吞吐场景
  • TGI 状态: HuggingFace 官方已将 TGI 置于维护模式,建议迁移到 vLLM/SGLang

保留理由

✅ 实测基准数字(带配置参数)
✅ 明确给出选型决策表
✅ 覆盖 TGI 维护状态(重要工程信号)
✅ 每个引擎有明确适用场景描述


🔴 保留 3 — LLM 推理优化完整指南:成本 5-10x 降低,延迟 3-5x 降低(MyEngineeringPath)

URL: https://myengineeringpath.dev/genai-engineer/inference-optimization
来源: 工程博客
时间: 2026
可信度: 高

核心工程内容

  • KV Cache 优化: PagedAttention / RadixAttention 详解,命中率分析
  • 量化: INT8(内存减半,质量损失<1%)、INT4 AWQ/GPTQ(内存减少 75%,70B 单卡运行)
  • 连续批处理(Continuous Batching): 静态批处理 → 动态批处理,吞吐提升最高 23x
  • 投机解码(Speculative Decoding): EAGEL3 draft model,2-3x 加速
  • Flash Attention-3: 已集成到 vLLM 和 SGLang
  • 生产 vLLM 配置示例(有部分配置代码片段)
  • 量化实战: Llama 3 70B + AWQ + vLLM 实战数据

保留理由

✅ 覆盖 5 大优化技术的原理 + 实战数值
✅ 连续批处理 23x 提升数据有说服力
✅ 有量化实战案例(AWQ)
⚠️ 需核实文中 vLLM 生产配置代码片段是否完整可复现


🔴 保留 4 — The AI Agents Stack(2026 版)| The AI Engineer(Substack)

URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
来源: Substack · The AI Engineer(高质量作者群)
时间: 2026
可信度: 高(行业工程师社群背书)

高价值洞察

  • 2024→2026 重大变化: 1. Agent Guardrails 从"输入/输出过滤器"演变为"工具执行授权层"("guardrails before action" 模式) 2. OWASP 发布 MCP Top 10(Beta)—— 首个工具连接 Agent 安全清单 3. 评估框架三层化:PR 级快速检查 → 夜间回归套件(LLM 判分) → 生产持续监控 4. 新基准出现:Context-Bench、Recovery-Bench、Terminal-Bench
  • Eval Gap 数据: 89% 的生产 Agent 团队有可观测性,但只有 52% 有评估体系(37 点差距 = 生产质量死亡区)
  • 框架选择警告: "大多数团队选了太多框架"——调用模型 + 几个工具不需要 LangGraph

保留理由

✅ 来自真实生产经验的数据(89%/52% eval gap)
✅ OWASP MCP Top 10 是重要安全资源
✅ 评估体系三层架构有直接工程指导价值
✅ Substack 高质量社群验证


🔴 保留 5 — Hidden Technical Debt in Agentic Systems | The Neural Maze(Substack)

URL: https://theneuralmaze.substack.com/p/hidden-technical-debt-in-agentic
来源: Substack · The Neural Maze
时间: 2026
可信度: 中高

高价值洞察

  • Markdown 配置 = 源代码: 80% 的 Agent 构建工作本质是编辑文本(系统提示词、工具描述、few-shot 示例、skill 定义),这些 md 文件才是 Agent 的"源码"
  • 工程实践建议:
  • Prompt 放独立文件树,不写进 Python 字符串
  • 所有 prompt 变更走 PR review diff
  • 每个版本关联 eval 套件得分
  • Prompt 变更走 feature flag 灰度发布
  • Provider 无关抽象: 推荐 LiteLLM/OpenRouter/Vercel AI Gateway 构建多提供商兜底方案
  • 引用经典: Sculley et al. (2015) Hidden Technical Debt in ML Systems + Chip Huyen AI Engineering (2024)

保留理由

✅ "Markdown 即源码"的框架思维极具工程价值
✅ Prompt 版本控制 + eval 关联的方法论可直接落地
✅ 引用了经典论文,构建了知识连续性
⚠️ 缺少具体命令或代码片段(概念性强)


🟡 降级保留 6 — LLM 推理优化完整指南(MorphLLM)

URL: https://www.morphllm.com/llm-inference-optimization
来源: 工程博客
时间: 2026
可信度: 中

内容质量

  • SGLang v0.4.3 / LMDeploy / vLLM v0.7.3 横向对比表格
  • 各引擎吞吐均为 16,200 tok/s(H100)
  • 投机解码:EAGEL3 draft 典型 2-3x,特殊优化可达 5x
  • 成本计算:有 29% 吞吐差距 → 每月约 $15,000 GPU 节省(百万请求/天)

降级原因

🟡 与保留 1/2 内容高度重叠
🟡 无独特工程数据
🟡 主要是已有数据的重新整理
决策: 合并到推理引擎选型页参考来源,不单独收录


🟡 降级保留 7 — 6 Production-Tested Optimization Strategies(BentoML)

URL: https://www.bentoml.com/blog/6-production-tested-optimization-strategies-for-high-performance-llm-inference
来源: BentoML 官方博客
时间: 2026-01-15
可信度: 中

价值

  • Prefill/Decode 分离优化思路清晰
  • 有生产案例(Neurolabs 加速 9 个月产品发布)

降级原因

🟡 主要针对 BentoML 平台,偏产品推广
🟡 与其他推理优化文章内容重叠
🟡 缺少硬核基准数据
决策: 作为补充参考,不单独建档


🟡 降级保留 8 — RAG, Agents & MLOps:从 Pilot 到 Production(DeployFlow)

URL: https://deployflow.co/blog/rag-agents-mlops
来源: 公司博客
时间: 2026
可信度: 中

价值

  • Ramp 2026 数据:token 使用量 Jan 2025→Apr 2026 增长 1,001%
  • 成本失控主要原因:团队悄悄切换到更贵的前沿模型
  • LLMOps 三层职责框架

降级原因

🟡 主要是概念和趋势分析,工程细节不足
🟡 无可复现步骤或命令
决策: 行业数据引用来源,不单独建档


🟡 降级保留 9 — ActiveWizards 系列(Context Engineering、Memory Layer、Agent 安全)

URL: https://activewizards.com/blog/...
来源: 公司博客
时间: 2026
可信度: 中

降级原因

🟡 主要面向付费邮件订阅(The Engineering Intelligence Brief)
🟡 公开内容摘要深度有限
🟡 部分文章需要邮件确认
决策: 暂不收录,等待完全公开版本


🟠 丢弃 10 — AI Agent Engineer Skills Stack(Great Learning)

URL: https://www.mygreatlearning.com/blog/the-complete-ai-agent-engineer-skills-stack-you-need-in-2026
时间: 2026-08-11
丢弃理由: ❌ 课程营销页,无原创工程数据,技能清单罗列无深度


🟠 丢弃 11 — 各 LinkedIn 帖子(Shantanu Ladhwe / AliAzad 等)

丢弃理由: ❌ 社交媒体讨论串,非原创内容,无可复现工程步骤


最终分类标签

#LLM-Inference #vLLM #SGLang #TensorRT-LLM #推理优化 #Agent工程
#MLOps #LLMOps #连续批处理 #KV-Cache #投机解码 #量化
#Agent评估 #OWASP-MCP #技术债 #Prompt工程 #RAG

建议写入路径

主文件: /shared/research-kb/inbox/jay/2026-09-04-inference-agent-engineering.md

推荐精读/审稿: 1. 保留 1 (Particula SGLang vs vLLM) — 推理引擎选型页核心参考 2. 保留 2 (Inference Engineering 三引擎) — 推理引擎对比页核心参考
3. 保留 4 (AI Agents Stack 2026) — Agent 工程实践页核心参考 4. 保留 5 (Hidden Technical Debt) — Agent 架构设计页核心参考

建议主题页更新: - 新建/更新 "LLM 推理引擎选型(2026)" 页:整合保留 1+2+3 - 更新 "Agent 生产工程" 页:整合保留 4+5


本次未写入文件说明

✅ 已写入草稿:/shared/research-kb/inbox/jay/2026-09-04-engineering-filter.md

本次为二次筛选报告,草稿本身即为产出物。如需产出完整知识条目(带标题 + 正文摘要格式),请告知,可继续生成结构化条目。