2026-07-18 工程实践筛选报告

执行实例: Jay
筛选原则: 重点保留含真实环境、命令、错误、源码、性能数据、可复现步骤的条目
本次主题: LLM 推理引擎选型 · Agent 框架生产对比 · AI 工程实践


一、高价值条目(建议保留)

1. Q2 2026 LLM Inference Benchmark: vLLM vs TGI vs SGLang vs Triton

保留理由: - 含具体 benchmark 数据表:Llama-3.3-70B on 8×H200,GPTQ 4-bit - 5 种负载(Chat Low/Med、RAG 4K ctx、Code Bursty、Batch)下 token/s 对比 - vLLM 配 Llama-2-7B drafter 对 Llama-3.3-70B target 实现 15–25% decode 加速 - 明确标注 TGI 已进入维护模式(2025 年 12 月),建议迁移至 vLLM 或 SGLang

可信度: 中高(benchmark 数据具体,但报告声明 benchmark 代码为 placeholder,需核验原始代码来源)

核心数据摘录: | Workload | Concurrency | vLLM | TGI | SGLang | Triton-TRT | |---|---|---|---|---|---| | Chat (Med) | 32 | 4250 tok/s | 3120 tok/s | 4880 tok/s | 5210 tok/s | | Batch (16 req) | 16 | 5100 tok/s | 4200 tok/s | 5300 tok/s | 5450 tok/s |

后续行动: 建议核验 benchmark 代码仓库是否真实存在;可对比 Spheron 和 TechSy 的同类数据交叉验证


2. vLLM vs TensorRT-LLM vs SGLang: H100 Benchmarks (2026)

保留理由: - 同一硬件(H100 80GB)+ 同一模型(Llama 3.3 70B FP8)下的三引擎对比 - 含冷启动时间(vLLM ~62s vs TensorRT-LLM ~28min)——工程部署决策关键数据 - 含吞吐量、TTFT p50 表格 - 提供各引擎"最佳场景"决策建议

可信度: 中高(Spheron 技术博客,硬件配置明确,有后续部署指南)

核心数据: | Engine | Throughput (50 req) | TTFT p50 (10 req) | Cold Start | |---|---|---|---| | vLLM | 1,850 tok/s | 120 ms | ~62 sec | | TensorRT-LLM | 2,100 tok/s | 105 ms | ~28 min | | SGLang | 1,920 tok/s | 112 ms | ~58 sec |

后续行动: 可归档至"推理引擎选型"主题页;三引擎对比适合作为工程决策参考


3. vLLM vs SGLang 2026: We Benchmarked Both on H100s — TechSy

保留理由: - 含 SGLang +29% throughput vs vLLM 的具体数据(16,200 vs 12,500 tok/s) - structured output / guided decoding 性能差异分析(vLLM 在 batch=8 时显著降速,SGLang 通过 FSM 重叠隐藏开销) - 包含 speculative decoding 在两引擎的表现对比(近似 tie) - 明确提及 Hugging Face TGI 2025 年 12 月进入维护模式

可信度: 中高(TechSy 技术博客,Mert Batur Gürbüz 署名,有具体数值和对比维度)

后续行动: 可与 particula.tech 数据交叉验证;structured output 性能差异适合作为 Agent 系统选型依据


4. SGLang vs vLLM in 2026: Benchmarks, Architecture, and When to Use Each

保留理由: - 含详细性能数据:SGLang 16,200 tok/s vs vLLM 12,500 tok/s(+29%) - 含并发扩展性数据(1/10/50/100 并发下两引擎对比) - 含架构差异说明(RadixAttention prefix reuse vs PagedAttention KV paging) - 含 structured output FSM 实现细节(3x faster than guided decoding) - 含 DeepSeek V3 inference 3.1x faster 案例

可信度: 中高(Particlea 技术博客,Sebastian Mondragon 署名,有具体 benchmark 数据)

后续行动: 适合作为 RAG/多轮对话场景的推理引擎选型依据;可关联 RAG 主题页


5. LLM Inference Optimization and Quantization 2026 — Zylos Research

保留理由: - 含框架对比表:vLLM/SGLang/TensorRT-LLM/llama.cpp/Ollama,含吞吐量、setup 时间、最佳场景 - 含量化方法对比表(4-bit 量化/2-bit k-means/2:4 Sparsity/Knowledge Distillation) - 含 PagedAttention 2-4x、FP8 vs FP16 30-33% faster、FlashAttention-3 H100 840 TFLOPS 等具体性能数字 - 含实际命令:pip install vllm + 启动命令示例

可信度: 中(Zylos Research 博客,2026 年 1 月数据偏旧,但框架对比框架有价值)

后续行动: 建议核验数据是否与 2026 年 7 月最新版本匹配;可作为推理优化技术索引


6. OWASP Top 10 Agents & AI Vulnerabilities (2026 Cheat Sheet)

作者: Alex Ewerlof
专栏: Substack(open)

保留理由: - 覆盖 LLM01–LLM10(OWASP Top 10 LLM)和 ASI01–ASI10(OWASP Top 10 Agents 2026) - 含具体漏洞利用场景描述和缓解措施(如 Semantic Firewall、Principle of Least Privilege on tools) - Agent 安全问题对生产部署有直接指导价值 - 格式为 cheat sheet,便于存档查阅

可信度: 高(Alex Ewerlof 为安全工程师,内容基于 OWASP 官方标准)

后续行动: 建议写入"AI 安全"主题页;可交叉比对 Anon 上月 agent security 条目去重


7. My LLM coding workflow going into 2026 — Addy Osmani (Substack)

作者: Addy Osmani(Google 工程师,Chrome 团队)
专栏: Substack

保留理由: - 含真实工程数据:Anthropic 工程师用 Claude Code 编写 Claude Code 本身 90% 的代码量 - 含 AI 编码最佳实践:treat LLM as powerful pair programmer requiring clear direction + context + oversight - 对 AI-native 软件工程有实操洞察,非泛泛而谈

可信度: 高(Addy Osmani 为 Google 工程师,实名可查)

后续行动: 适合作为 AI 工程实践 / 开发者工作流主题补充


8. LLM Inference Optimization: Cut Cost & Latency at Every Layer — MorphLLM

保留理由: - 含具体问题分析:context bloat(30 轮对话后输入 token 膨胀 5–10x)、Redundant computation - Agentic workflows 成本问题:50–200 LLM calls/task,cheap per-token 变成 expensive per-task - 含 token 优化策略和成本-质量权衡框架

可信度: 中(MorphLLM 博客,有具体数字和场景描述)

后续行动: 适合作为成本优化主题补充;可关联上月的 inference engineering 条目


二、丢弃条目及理由

候选条目 丢弃理由
medium.com/@sanjeebmeister/the-complete-mlops-llmops-roadmap-for-2026 概览型汇总,无新数据,仅框架/工具罗列,缺少命令/错误/性能细节
eitt.academy/ai-agents-2026-guide-from-llm-to-multi-agent-systems 五层架构图+框架选型,无工程数据,类似于付费课程目录
medium.com/codex/mlops-in-2026-from-mlflow-to-llmops 市场概览文,85% 模型未上线的说法无原始研究引用,缺 benchmark
medium.com/@pratik-rupareliya/top-15-vector-databases-in-2026 pgvector 50M 向量结论有参考价值,但内容与 Salt/AlphaCorp 高度重复,无新数据
pub.towardsai.net/top-ai-agent-frameworks-in-2026-a-production-ready-comparison 有 62%/93%/2.4% 等生产数据,但 Intuz Agentic Framework 偏向营销文,缺技术细节
linkedin.com 多篇(AliAzad/Krishna Reddy 等) LinkedIn 内容偏社交媒体,非深度技术文章,无可复现步骤
youtube 各视频 视频形式无法提取结构化数据;封面数据在正文中已找到更完整的文字版本

三、分类标签

LLM-Inference vLLM SGLang TensorRT-LLM Quantization Agent-Framework Multi-Agent Agentic-AI RAG Vector-DB MLOps LLMOps Security Benchmark Engineering-Practice AI-Workflow


四、建议写入路径

/shared/research-kb/inbox/jay/2026-07-18-inference-engineering-agent-frameworks.md

本次写入:上述 8 个高价值条目的中文摘要、评价、链接和建议行动,共 1 个文件。


五、后续行动建议

  1. 精读优先级(高): techsy.io vLLM vs SGLang + particula.tech —— 含最具体 H100 benchmark 数据,可直接用于工程选型决策
  2. 跨实例协调: 检查 /shared/research-kb/inbox/ 下其他实例是否已有 vLLM/SGLang benchmark 对比条目,避免重复归档
  3. Substack 质量控制: Addy Osmani + Alex Ewerlof 两篇 Substack 均来自实名工程师,建议纳入"工程实践"专栏收藏
  4. 待核验项: iotdigitaltwinplm 的 benchmark 代码仓库是否为 placeholder(当前无法访问),如无法核验则降级参考

本报告由 Jay 实例自动生成,仅为草稿,待审稿后归档知识库。