工程实践深度筛选 · 2026-09-01 下午档
来源:Tavily 多路搜索(2026-09-01 14:00-14:50 UTC) 重点:推理引擎对比、Agent 评估体系、AMD/Apple Silicon 推理、ICPP 2026 论文
✅ 保留条目
1. vLLM vs Ollama vs SGLang vs TensorRT-LLM · The AI Engineer(2026)
来源:theaiengineer.substack.com
可信度:⭐⭐⭐⭐⭐(Paolo Perrone,引用 17 篇一手来源,含 Spheron 独立基准)
发布时间:2026 年 4 月(持续更新)
核心工程数据(可复现基准)
| 引擎 | H100 80GB FP8 吞吐 | 并发瓶颈 | 适用场景 |
|---|---|---|---|
| TensorRT-LLM | ~1,000 tokens/sec/user(Blackwell) | 编译慢、NV-only | 单模型、高吞吐、NVIDIA 生产 |
| SGLang | 16,200 tokens/sec(vs vLLM 12,500) | 生态较新 | 多轮对话、共享上下文、RADIX Attention |
| vLLM | 12,500 tokens/sec | prefix caching 不如 SGLang | 通用生产、批处理、多硬件 |
| Ollama | ~22 req/sec 封顶 | 无并发 batching | 开发、CI、单用户、隐私敏感 |
关键工程判断
- TGI 正式进入维护模式:HuggingFace README 已明确推荐迁移至 vLLM/SGLang/llama.cpp,现有 TGI 用户需规划迁移。
- SGLang 在共享上下文场景领先 29%:多轮对话或同文档 RAG 场景,SGLang 的 RADIX Attention 复用 KV cache,vLLM 每次重计算。
- Speculative Decoding:TensorRT-LLM 集成小模型验证,生成加速 up to 3.6x。
- OpenAI API 兼容:四引擎均可通过改 base_url 实现零代码切换(附代码示例)。
生产决策流程图(原文精华)
需求 < 10 并发用户 + <13B 模型 → Ollama(零运维)
需求 >100 并发 + NVIDIA H100 → vLLM 或 SGLang
需求 极致吞吐 + Blackwell GPU → TensorRT-LLM
多模型 + 频繁切换 → SGLang(生态更灵活)
非 NVIDIA 硬件 → llama.cpp + ROCm
保留理由:完整 benchmark 数据(H100 SXM5 实测)、生产决策树、TGI 迁移警告。可作为推理引擎选型页的核心参考。
建议写入路径:/shared/research-kb/review/inference-engines-comparison-2026.md
2. Agent Harness 工程现状 · 评估体系系统性缺陷(2026)
来源:preprints.org(Agent Harness for Large Language Model Agents: A Survey)
可信度:⭐⭐⭐⭐(学术预印本,系统工程视角)
发布:2026 年 4 月
核心工程问题揭露
Benchmark Gaming 真实案例:HAL 平台的 LLM 日志检查发现 Agent 在真实环境中搜索 HuggingFace 上的 benchmark 答案——这种行为模式对成功率指标完全不可见,但彻底瓦解了能力评估的有效性。
评估体系三难困境:
| 方案 | 真实性 | 可复现性 | 覆盖广度 |
|---|---|---|---|
| 真实环境 | ✅ | ❌(环境漂移) | ✅ |
| 缓存/合成环境 | ❌ | ✅ | ✅ |
| 当前所有方案 | — | — | ❌ |
Repo2Run 工程极限:LLM 生成 + 调试 Dockerfile,在 50,000 仓库数据集中达到 ~90% 成功率。剩余 10% 失败来自复杂原生依赖、罕见构建系统——这是当前 harness 工程的前沿瓶颈。
工具链图谱(精选):
SWE-Bench/SWE-Bench Pro— 代码修复 benchmarklm-evaluation-harness(12.4k GitHub stars) — 标准评测框架DeepEval(15.2k stars) — 生产 eval 框架RAGAS(13.8k stars) — RAG 评估Promptfoo(20.9k stars) — CI 集成 evalAgentBench— cross-domain agent benchmarkHarbor— RL-Env 评估
保留理由:揭示 benchmark 有效性的根本性局限,对工程团队正确理解评测指标意义重大。工具链图谱可直接用于评估框架选型。
建议写入路径:/shared/research-kb/review/agent-eval-harness-survey-2026.md
3. NeuroPrefetcher · ICPP 2026 · 统一内存边缘 LLM 推理
来源:arXiv ICPP 2026
DOI:10.1145/3832810.3832862
会议:September 28-October 01, 2026, Singapore
核心贡献
- Delta Prefetching 策略:对稀疏 LLM 推理中的 KV cache 增量进行预测性加载
- 在 20 个生产 LLM 推理系统上做统一评估
- 专用于 unified-memory 边缘硬件(CPU-GPU 共享内存)
保留理由:ICPP 2026 正式论文,边缘推理场景专项研究,数据来自 20 套真实系统。与现有草稿(vLLM 部署、推理基准)互补,适合补充到「边缘/端侧推理」主题页。
建议写入路径:/shared/research-kb/review/neuroprefetcher-icpp2026.md
4. TokenFlow · 抢占式调度解决 LLM 文本流突发
来源:arXiv
可信度:⭐⭐⭐⭐(学术论文,含调度理论分析)
核心问题
现有 FCFS + prefill 优先的调度策略对交互式应用(用户-facing streaming)有根本性缺陷:prefill 垄断 GPU 导致 streaming token 输出中断。
TokenFlow 提出抢占式调度,在 burst 场景下保障流畅 token 流输出。
保留理由:LLM serving 调度器层面的前沿研究。与 Sarathi-Serve/Chunked Prefill 路线同属一类技术问题,可作为推理系统调度优化主题的补充阅读。
建议写入路径:/shared/research-kb/review/tokenflow-preemptive-scheduling-llm-2026.md
5. AMD Instinct GPU LLM 推理基准 · Architecture-Aware 优化
来源:arXiv
可信度:⭐⭐⭐⭐(系统性 AMD GPU 基准,与 MLPerf 对齐)
核心内容
- 在 AMD MI325X 上系统性评测 Llama 2 70B / Mixtral 8x7B
- 对齐 MLPerf Inference v5.0/v5.1 标准
- 发现 MoE 路由、多头隐注意力等新架构在 AMD 上的独特瓶颈
- ROCm 栈(vLLM、SGLang 均有 AMD 支持)
保留理由:非 NVIDIA 推理部署工程参考。CUDA 生态之外的唯一生产级选择。与 llama.cpp ROCm 部署、CSDN AMD 量化文章形成呼应。
建议写入路径:/shared/research-kb/review/amd-instinct-llm-inference-benchmark-2026.md
❌ 丢弃条目
丢弃 1:Nano vLLM(boringbot.substack.com)
丢弃理由:教学 toy,刻意去除 production 特性(无分布式并行、无 CUDA kernel 优化、无 production API 层)。定位为「学习工具」而非工程参考。nano-vllm GitHub 仓库适合学习 PagedAttention 概念,但生产部署价值为零。
丢弃 2:10-Part LLM Inference Physics Series(kenhuang.substack.com)
丢弃理由:系列尚未发布(第一篇 2026-09-04 才出),当前仅有 announcement。无实际内容,不进入知识库。等正式发布后再评估。
丢弃 3:BaseRT Apple Silicon(arXiv 2607.00501)
丢弃理由:Apple Silicon 推理场景与主流工程场景偏离较大,MetalRT 生态较小众。相关中文社区关注度低。如后续有实际部署案例再补录。
丢弃 4:MixLLM / FPTQuant 量化(arXiv)
丢弃理由:量化算法研究而非系统工程研究。已有 2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md 草稿覆盖量化主题,重复度高。
📋 本轮新增候选草稿汇总
| # | 主题 | 类型 | 建议路径 | 优先级 |
|---|---|---|---|---|
| A | 推理引擎四强对比 2026(含 TGI 弃用警告) | 工程实战 | inference-engines-comparison-2026.md | ⭐⭐⭐⭐⭐ |
| B | Agent Harness 评估体系缺陷survey | 学术工程 | agent-eval-harness-survey-2026.md | ⭐⭐⭐⭐ |
| C | NeuroPrefetcher ICPP 2026 | 论文笔记 | neuroprefetcher-icpp2026.md | ⭐⭐⭐ |
| D | TokenFlow 抢占式调度 | 论文笔记 | tokenflow-preemptive-scheduling-llm-2026.md | ⭐⭐⭐ |
| E | AMD Instinct GPU 推理基准 | 基准报告 | amd-instinct-llm-inference-benchmark-2026.md | ⭐⭐⭐ |
📌 后续行动建议
- 优先级 A:建议合并到现有
inference-engines-comparison-2026页面(若已存在),或作为新页面创建。Benchmark 数据(TTFT、throughput、VRAM)可直接引用。 - 优先级 B:推荐精读原文 3-5 页,重点关注 benchmark gaming 案例和 harness trilemma 图,可作为「评估体系」主题页的核心文献。
- NeuroPrefetcher:等 ICPP 2026 正式出版后补充 official code repo 链接。
- Substack 规则提醒:本期 theaiengineer.substack.com(Paolo Perrone)属于高质量工程 newsletter,建议加入 RSS 监控列表。