Jay 工程实践筛选 · 2026-09-04
任务概述
- 主题: LLM 推理引擎与 Agent 生产工程
- 检索范围: Tavily 全网搜索 + Substack + 技术博客 + 工程手册
- 高频轮次: 每天 3 次(本次第 2 次)
候选条目汇总(11 条)
🔴 保留 1 — SGLang vs vLLM 2026: 完整基准对比(Particula Tech)
URL: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
来源: 技术博客(Particula Engineering)
时间: 2026-06 更新
可信度: 高(独立工程团队实测)
核心工程数据
| 指标 | SGLang | vLLM | 差值 |
|---|---|---|---|
| 总吞吐 | ~16,200 tok/s | ~12,500 tok/s | SGLang +29% |
| 输出 token 吞吐 | 894 tok/s | 413 tok/s | SGLang +117% |
| TTFT(首 token 时间) | 79 ms | 103 ms | SGLang 快 23% |
| Token 间延迟(ITL) | 6.0 ms | 7.1 ms | SGLang 快 15% |
架构对比(高价值)
- SGLang RadixAttention: 前缀复用,跨请求 KV 缓存,缓存树开销更高但前缀共享场景下优势明显
- vLLM PagedAttention: 每请求独立缓存,<4% 内存碎片,长上下文友好
- 并发扩展数据:50 并发时 SGLang 1,920 vs vLLM 1,850(差距仅 4%,前缀共享为零时)
- 生产落地: xAI Grok 3、LinkedIn AI 功能、Cursor 代码补全均用 SGLang;vLLM 仍是大多数云 API 后端默认
保留理由
✅ 真实 H100 基准数据,含并发扩展曲线
✅ 架构差异分析有工程深度
✅ 包含生产环境落地案例
✅ 给出"混合路由"实操建议(不同负载类型路由到不同引擎)
⚠️ 无命令行示例和配置文件模板(轻微缺憾)
后续行动
- 建议作为推理引擎选型决策页的核心引用
- 补充 SGLang 和 vLLM 的 Docker 启动命令对比
🔴 保留 2 — vLLM/SGLang/TensorRT-LLM 三引擎完整指南(Inference Engineering)
URL: https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm
来源: 专业推理工程博客
时间: 2026
可信度: 高
核心工程数据(H100,实测)
| 模型 | 引擎 | 配置 | 吞吐 |
|---|---|---|---|
| Llama-3.1 70B | vLLM | TP=4, FP8 | ~2,800 tok/s |
| Llama-3.1 70B | TRT-LLM | TP=4, FP8, compiled | ~3,400 tok/s |
| Llama-3.1 70B | SGLang | TP=4, FP8 | ~2,900 tok/s |
| DeepSeek-R1 671B | SGLang | EP=8, FP8 | ~1,100 tok/s (8× H100) |
| Llama-3.1 8B | vLLM | TP=1, FP8 | ~12,000 tok/s |
| Llama-3.1 8B | TRT-LLM | TP=1, FP8, compiled | ~14,500 tok/s |
决策精华
- vLLM: 最易上手,pip install + 一行 CLI,400+ 模型架构,AMD ROCm/Intel Gaudi/CPU 均支持
- SGLang: MoE/高并发最优,DeepSeek-R1/V3 配合 EP(Expert Parallelism)效果最佳
- TensorRT-LLM: 峰值最高但需要 1-2 周编译调优;适合长期固定模型的高吞吐场景
- TGI 状态: HuggingFace 官方已将 TGI 置于维护模式,建议迁移到 vLLM/SGLang
保留理由
✅ 实测基准数字(带配置参数)
✅ 明确给出选型决策表
✅ 覆盖 TGI 维护状态(重要工程信号)
✅ 每个引擎有明确适用场景描述
🔴 保留 3 — LLM 推理优化完整指南:成本 5-10x 降低,延迟 3-5x 降低(MyEngineeringPath)
URL: https://myengineeringpath.dev/genai-engineer/inference-optimization
来源: 工程博客
时间: 2026
可信度: 高
核心工程内容
- KV Cache 优化: PagedAttention / RadixAttention 详解,命中率分析
- 量化: INT8(内存减半,质量损失<1%)、INT4 AWQ/GPTQ(内存减少 75%,70B 单卡运行)
- 连续批处理(Continuous Batching): 静态批处理 → 动态批处理,吞吐提升最高 23x
- 投机解码(Speculative Decoding): EAGEL3 draft model,2-3x 加速
- Flash Attention-3: 已集成到 vLLM 和 SGLang
- 生产 vLLM 配置示例(有部分配置代码片段)
- 量化实战: Llama 3 70B + AWQ + vLLM 实战数据
保留理由
✅ 覆盖 5 大优化技术的原理 + 实战数值
✅ 连续批处理 23x 提升数据有说服力
✅ 有量化实战案例(AWQ)
⚠️ 需核实文中 vLLM 生产配置代码片段是否完整可复现
🔴 保留 4 — The AI Agents Stack(2026 版)| The AI Engineer(Substack)
URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
来源: Substack · The AI Engineer(高质量作者群)
时间: 2026
可信度: 高(行业工程师社群背书)
高价值洞察
- 2024→2026 重大变化: 1. Agent Guardrails 从"输入/输出过滤器"演变为"工具执行授权层"("guardrails before action" 模式) 2. OWASP 发布 MCP Top 10(Beta)—— 首个工具连接 Agent 安全清单 3. 评估框架三层化:PR 级快速检查 → 夜间回归套件(LLM 判分) → 生产持续监控 4. 新基准出现:Context-Bench、Recovery-Bench、Terminal-Bench
- Eval Gap 数据: 89% 的生产 Agent 团队有可观测性,但只有 52% 有评估体系(37 点差距 = 生产质量死亡区)
- 框架选择警告: "大多数团队选了太多框架"——调用模型 + 几个工具不需要 LangGraph
保留理由
✅ 来自真实生产经验的数据(89%/52% eval gap)
✅ OWASP MCP Top 10 是重要安全资源
✅ 评估体系三层架构有直接工程指导价值
✅ Substack 高质量社群验证
🔴 保留 5 — Hidden Technical Debt in Agentic Systems | The Neural Maze(Substack)
URL: https://theneuralmaze.substack.com/p/hidden-technical-debt-in-agentic
来源: Substack · The Neural Maze
时间: 2026
可信度: 中高
高价值洞察
- Markdown 配置 = 源代码: 80% 的 Agent 构建工作本质是编辑文本(系统提示词、工具描述、few-shot 示例、skill 定义),这些 md 文件才是 Agent 的"源码"
- 工程实践建议:
- Prompt 放独立文件树,不写进 Python 字符串
- 所有 prompt 变更走 PR review diff
- 每个版本关联 eval 套件得分
- Prompt 变更走 feature flag 灰度发布
- Provider 无关抽象: 推荐 LiteLLM/OpenRouter/Vercel AI Gateway 构建多提供商兜底方案
- 引用经典: Sculley et al. (2015) Hidden Technical Debt in ML Systems + Chip Huyen AI Engineering (2024)
保留理由
✅ "Markdown 即源码"的框架思维极具工程价值
✅ Prompt 版本控制 + eval 关联的方法论可直接落地
✅ 引用了经典论文,构建了知识连续性
⚠️ 缺少具体命令或代码片段(概念性强)
🟡 降级保留 6 — LLM 推理优化完整指南(MorphLLM)
URL: https://www.morphllm.com/llm-inference-optimization
来源: 工程博客
时间: 2026
可信度: 中
内容质量
- SGLang v0.4.3 / LMDeploy / vLLM v0.7.3 横向对比表格
- 各引擎吞吐均为 16,200 tok/s(H100)
- 投机解码:EAGEL3 draft 典型 2-3x,特殊优化可达 5x
- 成本计算:有 29% 吞吐差距 → 每月约 $15,000 GPU 节省(百万请求/天)
降级原因
🟡 与保留 1/2 内容高度重叠
🟡 无独特工程数据
🟡 主要是已有数据的重新整理
决策: 合并到推理引擎选型页参考来源,不单独收录
🟡 降级保留 7 — 6 Production-Tested Optimization Strategies(BentoML)
URL: https://www.bentoml.com/blog/6-production-tested-optimization-strategies-for-high-performance-llm-inference
来源: BentoML 官方博客
时间: 2026-01-15
可信度: 中
价值
- Prefill/Decode 分离优化思路清晰
- 有生产案例(Neurolabs 加速 9 个月产品发布)
降级原因
🟡 主要针对 BentoML 平台,偏产品推广
🟡 与其他推理优化文章内容重叠
🟡 缺少硬核基准数据
决策: 作为补充参考,不单独建档
🟡 降级保留 8 — RAG, Agents & MLOps:从 Pilot 到 Production(DeployFlow)
URL: https://deployflow.co/blog/rag-agents-mlops
来源: 公司博客
时间: 2026
可信度: 中
价值
- Ramp 2026 数据:token 使用量 Jan 2025→Apr 2026 增长 1,001%
- 成本失控主要原因:团队悄悄切换到更贵的前沿模型
- LLMOps 三层职责框架
降级原因
🟡 主要是概念和趋势分析,工程细节不足
🟡 无可复现步骤或命令
决策: 行业数据引用来源,不单独建档
🟡 降级保留 9 — ActiveWizards 系列(Context Engineering、Memory Layer、Agent 安全)
URL: https://activewizards.com/blog/...
来源: 公司博客
时间: 2026
可信度: 中
降级原因
🟡 主要面向付费邮件订阅(The Engineering Intelligence Brief)
🟡 公开内容摘要深度有限
🟡 部分文章需要邮件确认
决策: 暂不收录,等待完全公开版本
🟠 丢弃 10 — AI Agent Engineer Skills Stack(Great Learning)
URL: https://www.mygreatlearning.com/blog/the-complete-ai-agent-engineer-skills-stack-you-need-in-2026
时间: 2026-08-11
丢弃理由: ❌ 课程营销页,无原创工程数据,技能清单罗列无深度
🟠 丢弃 11 — 各 LinkedIn 帖子(Shantanu Ladhwe / AliAzad 等)
丢弃理由: ❌ 社交媒体讨论串,非原创内容,无可复现工程步骤
最终分类标签
#LLM-Inference #vLLM #SGLang #TensorRT-LLM #推理优化 #Agent工程
#MLOps #LLMOps #连续批处理 #KV-Cache #投机解码 #量化
#Agent评估 #OWASP-MCP #技术债 #Prompt工程 #RAG
建议写入路径
主文件: /shared/research-kb/inbox/jay/2026-09-04-inference-agent-engineering.md
推荐精读/审稿:
1. 保留 1 (Particula SGLang vs vLLM) — 推理引擎选型页核心参考
2. 保留 2 (Inference Engineering 三引擎) — 推理引擎对比页核心参考
3. 保留 4 (AI Agents Stack 2026) — Agent 工程实践页核心参考
4. 保留 5 (Hidden Technical Debt) — Agent 架构设计页核心参考
建议主题页更新: - 新建/更新 "LLM 推理引擎选型(2026)" 页:整合保留 1+2+3 - 更新 "Agent 生产工程" 页:整合保留 4+5
本次未写入文件说明
✅ 已写入草稿:/shared/research-kb/inbox/jay/2026-09-04-engineering-filter.md
本次为二次筛选报告,草稿本身即为产出物。如需产出完整知识条目(带标题 + 正文摘要格式),请告知,可继续生成结构化条目。