Jay 工程实践筛选 · 2026-08-28 10:50 (UTC+8) · 第 1 次/天

筛选范围

  • LLM 推理引擎 Benchmark / Agent 编码评估 / Multi-Agent 评测 / Substack 高质量专栏
  • 重点: 真实环境、命令、错误、源码、性能数据、可复现步骤
  • 今日来源: arXiv · Particula Tech · atomic.chat · Spheron · inferenceengineering.tech · AIMultiple · vals.ai · benchlm.ai · SWE-bench GitHub · MLflow

保留条目 (Keep)

1. SGLang vs vLLM Benchmark 2026(H100 实测)⭐⭐⭐⭐⭐

链接: https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
来源: Particula Tech · 2026 · Benchmark with actual commands
检索来源: Tavily · 2026-08-28

保留理由: - ✅ 完整 Benchmark 表格: H100 80GB · Llama 3.3 70B FP8 · TP=4 - SGLang: ~2,900 tok/s total; vLLM: ~2,800 tok/s total; TRT-LLM: ~3,400 tok/s - DeepSeek-R1 671B: SGLang EP=8 → ~1,100 tok/s - ✅ SGLang 对 DeepSeek 的专项优化: MLA + FlashAttention3/FlashInfer/FlashMLA/CutlassMLA 栈 - ✅ EAGLE/Multi-Token Prediction: SGLang 1.8x decode speedup @ batch=1; 1.5x @ batch=32 on H200 - ✅ Prefill-Decode Disaggregation: SGLang 再现 DeepSeek 生产方案,跨 GPU 池分离 - ⚠️ 核验建议: 并发 50 时 SGLang vs vLLM 仅差 4%,独特 prompt 下几乎无差距;真正差异在重复前缀场景(agent 系统);命令参数对照官方文档

工程价值: 推理引擎选型决策表;SGLang 适合 DeepSeek MoE + 长前缀 agent 工作负载;vLLM 适合高吞吐无共享场景。


2. SGLang vs vLLM: Agent 前缀缓存专项数据 ⭐⭐⭐⭐⭐

链接: https://atomic.chat/blog/llm-updates/sglang-vs-vllm
来源: atomic.chat · 2026 · H100 实测
检索来源: Tavily · 2026-08-28

保留理由: - ✅ 实测数字: 高前缀复用场景(SGLang): - 吞吐量: ~16,200 vs ~12,500 tok/s (+29%) - TTFT 1请求: ~42ms vs ~45ms - TTFT 100并发: ~710ms vs ~740ms - ✅ 独特 prompt 场景: 两者几乎无差异(+3.8%) - ✅ Agent 系统影响: system prompt + tool definitions + 对话历史共享 → SGLang RadixAttention 显著优势

工程价值: 对 agent 系统部署有直接选型意义;多 agent 共享前缀场景直接参考此数据决策。


3. vLLM long context (32K input) vs SGLang 实测数字 ⭐⭐⭐⭐

链接: https://github.com/sgl-project/sglang/issues/3471
来源: SGLang GitHub Issue · 实际 benchmark runner 输出
检索来源: Tavily · 2026-08-28

保留理由: - ✅ 原始输出数字(可直接引用): - vLLM chunked prefill (2K): TTFT P99=27,604ms; TPOT=94ms; E2E=49,099ms - vLLM default: TTFT P99=7,798ms; TPOT=74ms; E2E=51,092ms - SGLang chunked prefill (8K): TTFT P99=17,141ms; TPOT=72ms; E2E=57,135ms - ✅ 实测配置: 50 并发,1860000 总 input tokens,31K output tokens,79-91s benchmark duration - ✅ 关键洞察: chunked prefill 在长 context 下会显著拉高 P99 TTFT;vLLM default 在长 context 反而 TTFT 更稳定 - ⚠️ 适用条件: 32K input 场景;短 context 不需要 chunked prefill

工程价值: 长 context 部署时 chunked prefill 参数调优直接参考;避坑指南。


4. SWE-bench 2026 评估体系全解析(含置信度问题)⭐⭐⭐⭐

链接: https://vals.ai/benchmarks/swebench · https://benchlm.ai/benchmarks/swe-bench-verified
来源: vals.ai · benchlm.ai · 2026-08-19 更新
检索来源: Tavily · 2026-08-28

保留理由: - ✅ Leaderboard 真实数字(2026-08-19): - Claude Opus 5: 96-97% (vals.ai), 96% (benchlm.ai) - Claude Mythos 5: 95.5% - DeepSeek V4 Pro 0813: 96.4% (开模型第一) - Kimi K3: 93.4% (超越 Claude Opus 4.8 的 88.6%) - o3-mini: 52.8%; DeepSeek V3: 49%; GPT-4.1 mini: 42% - ✅ Benchmark 质量问题: 2025 分析发现 top-30 中 19.78% "solved" 为假阳性(巧合通过测试,非真正修复) - ✅ SWE-bench Verified: 500 样本人工审核版本(OpenAI 资助);Docker grading - ✅ Senior SWE-Bench: 100 任务,50 public/50 private,来自 12 真实仓库的 PR,覆盖复杂功能/迁移/bug/性能问题

工程价值: Agent 编码能力选型必读;Benchmark 局限性(假阳性率)对于评估体系建设有重要意义。


5. SWE-bench Pro + Multi-Benchmark 生态 ⭐⭐⭐⭐

链接: https://www.kdnuggets.com/top-10-open-source-benchmarks-for-ai-coding-agents-in-2026
来源: KDnuggets · 2026 · 综述
检索来源: Tavily · 2026-08-28

保留理由: - ✅ Benchmark 完整清单(含规模/类型/年份): - SWE-bench: 2,294 tasks, 12 repos - SWE-bench Lite: 300 tasks - SWE-bench Verified: 500 tasks - SWE-bench Pro: 1,865 tasks, 41 repos (企业级) - Terminal-Bench: CLI 工具使用 - OSWorld: 真实 OS 环境 - Tau-Bench: 多步骤 agent 任务 - GAIA: 通用 AI 助手 - ✅ 工程选型建议: 按场景(small well-scoped vs long-horizon enterprise)选 Benchmark

工程价值: Benchmark 选型决策表,避免用错评测基准。


6. EngiAI: Multi-Agent Benchmark Suite(含 HPC 调度)⭐⭐⭐⭐⭐

链接: https://arxiv.org/html/2605.19743v1
来源: arXiv · ICML 2026 投稿
检索来源: Tavily · 2026-08-28

保留理由: - ✅ 三个评测维度: 1. Workflow benchmark: 7 种 prompt 风格 → 直接工具使用/语义消歧/条件分支/工作记忆 2. RAG benchmark: 门控评分,隔离检索对参数选择的影响 3. HPC benchmark: SLURM 集群端到端 ML 训练编排 - ✅ 参考实现: EngiAI — LangGraph 构建的多 agent 系统(含 SSH/SLURM/3D 打印 MCP server) - ✅ Benchmark 可复现: 含 RAG agent、ArXiv agent(MMORE 框架)、HPC agent、CLI agent

工程价值: 多 agent 系统评测方法论;HPC 调度 agent 评测基准稀缺性高;LangGraph 参考实现可直接使用。


7. Multi-Agent LLM 百万规模光链路管理(工业首例)⭐⭐⭐⭐

链接: https://arxiv.org/list/cs.MA/recent(ICML 2026)
来源: arXiv · ICML 2026 · PMLR 306
检索来源: Tavily · 2026-08-28

保留理由: - ✅ 首个百万规模生产多 agent 系统: AIDC(AI 数据中心)光链路管理 - ✅ 多 agent 协作模式: 分解 + 协调 - ⚠️ 待核验: 需查看完整论文确认是否有足够工程细节

工程价值: 工业级多 agent 规模证明;工程架构参考。


8. MLflow: Building Production-Ready AI Agents ⭐⭐⭐⭐

链接: https://mlflow.org/articles/building-production-ready-ai-agents-in-2026
来源: MLflow 官方博客 · 2026 · 工程实战
检索来源: Tavily · 2026-08-28

保留理由: - ✅ 核心观点: "可靠性来自模块化设计 + 严格状态管理 + 确定性 guardrails,而非更好的 prompt" - ✅ 关键生产要素: 分布式系统工程、runtime governance、严格评估 - ✅ 框架选择: LangChain + AGT 或 MLflow(小型团队用标准平台;企业用可定制 governance) - ✅ 与 Agentic RAG 结合: 提到 RAG + agent 结合的模块化设计

工程价值: Agent 生产落地 checklist;架构决策参考;避免常见"demo 好用 prod 烂"问题。


9. The AI Engineer Substack: TGI 废弃指南 ⭐⭐⭐⭐

链接: https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
来源: The AI Engineer · 2026-04
检索来源: Tavily · 2026-08-28

保留理由: - ✅ TGI 正式进入维护模式: README 明确推荐 vLLM、SGLang、llama.cpp - ✅ 决策流程图: 按工作负载(吞吐量优先 / 延迟优先 / DeepSeek MoE / 结构化输出 / 框架兼容性)给出选择建议 - ✅ HuggingFace TGI → vLLM/SGLang 迁移指南: 含必要命令行转换

工程价值: 推理引擎迁移路线图;仍在用 TGI 的团队可直接参考。


10. Prefill-Decode Disaggregation 2026 指南 ⭐⭐⭐⭐

链接: https://spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
来源: Spheron · 2026-03 · 工程教程
检索来源: Tavily · 2026-08-28

保留理由: - ✅ Prefill-Decode 分离: 2x 吞吐提升,tail latency 稳定 - ✅ H100 实测数字(完整表格): - Llama 3.1 70B TP=4 FP8: vLLM ~2,800 tok/s; TRT-LLM ~3,400 tok/s; SGLang ~2,900 tok/s - ✅ H200 DeepSeek-R1 671B EP=8: ~1,100 tok/s - ✅ Benchmark 方法论: batch=1/8/32, context=512 tokens, output=128 tokens, 10 runs

工程价值: 生产部署参数配置直接参考;Benchmark 方法论可复用于自测。


丢弃条目 (Discard)

# 条目 丢弃理由
1 Inference Engineering 对比 (inferenceengineering.tech) 有数字表格但无命令/源码;整体概述性文章,无新增工程细节
2 The Right Order to Learn Agentic AI (YouTube/JastTech) 学习路线,非工程实战;无命令/代码/错误/性能数据
3 2026 AI Engineer Roadmap (Reddit) 路线图类内容,无工程细节
4 MLOps Community: Agent Memory Layer Engineering 概念性文章,内存层设计讨论,无可复现命令
5 Multimodal RAG Survey GitHub (llm-lab-org) ACL 2025 论文仓库,无新增 2026 内容
6 Karan Shingde: Agentic MLOps System Design (Substack) 架构讨论,无实际部署命令
7 arXiv: 2606.05608 "The End of Software Engineering" 概念性论文,无工程命令或复现数据
8 arXiv: 2602.24068 Hierarchical Multi-Agent for Payments PAKDD 2026,只知标题,无实际评测数据
9 Medium: MLOps/LLMOps Roadmap for 2026 路线图/学习内容,非工程实战
10 CloudLearnAI: Agentic AI Course 课程推广内容,无工程价值

今日筛选摘要

类别 保留 丢弃
推理引擎 Benchmark 3 1
Agent 编码评估 2 0
Multi-Agent 评测 2 2
生产工程 1 2
Substack/博客 2 4
合计 10 9

建议写入路径

  • /shared/research-kb/inbox/jay/2026-08-28-inference-benchmark-sglang-vllm-swebench.md(合并推理+Benchmark 新条目)
  • /shared/research-kb/inbox/jay/2026-08-28-agent-eval-swebench-production.md(编码评估+Benchmark 生态)

待核验

  • [ ] EngiAI HPC benchmark 具体命令(需访问 arXiv HTML 全文)
  • [ ] Multi-Agent 百万规模链路管理论文(需确认工程细节丰富度)
  • [ ] SWE-bench 假阳性 19.78% 具体来源论文