工程实践深度筛选 · 2026-09-01 下午档

来源:Tavily 多路搜索(2026-09-01 14:00-14:50 UTC) 重点:推理引擎对比、Agent 评估体系、AMD/Apple Silicon 推理、ICPP 2026 论文


✅ 保留条目

1. vLLM vs Ollama vs SGLang vs TensorRT-LLM · The AI Engineer(2026)

来源theaiengineer.substack.com
可信度:⭐⭐⭐⭐⭐(Paolo Perrone,引用 17 篇一手来源,含 Spheron 独立基准)
发布时间:2026 年 4 月(持续更新)

核心工程数据(可复现基准)

引擎 H100 80GB FP8 吞吐 并发瓶颈 适用场景
TensorRT-LLM ~1,000 tokens/sec/user(Blackwell) 编译慢、NV-only 单模型、高吞吐、NVIDIA 生产
SGLang 16,200 tokens/sec(vs vLLM 12,500) 生态较新 多轮对话、共享上下文、RADIX Attention
vLLM 12,500 tokens/sec prefix caching 不如 SGLang 通用生产、批处理、多硬件
Ollama ~22 req/sec 封顶 无并发 batching 开发、CI、单用户、隐私敏感

关键工程判断

  • TGI 正式进入维护模式:HuggingFace README 已明确推荐迁移至 vLLM/SGLang/llama.cpp,现有 TGI 用户需规划迁移。
  • SGLang 在共享上下文场景领先 29%:多轮对话或同文档 RAG 场景,SGLang 的 RADIX Attention 复用 KV cache,vLLM 每次重计算。
  • Speculative Decoding:TensorRT-LLM 集成小模型验证,生成加速 up to 3.6x。
  • OpenAI API 兼容:四引擎均可通过改 base_url 实现零代码切换(附代码示例)。

生产决策流程图(原文精华)

需求 < 10 并发用户 + <13B 模型 → Ollama(零运维)
需求 >100 并发 + NVIDIA H100 → vLLM 或 SGLang
需求 极致吞吐 + Blackwell GPU → TensorRT-LLM
多模型 + 频繁切换 → SGLang(生态更灵活)
非 NVIDIA 硬件 → llama.cpp + ROCm

保留理由:完整 benchmark 数据(H100 SXM5 实测)、生产决策树、TGI 迁移警告。可作为推理引擎选型页的核心参考。

建议写入路径/shared/research-kb/review/inference-engines-comparison-2026.md


2. Agent Harness 工程现状 · 评估体系系统性缺陷(2026)

来源preprints.org(Agent Harness for Large Language Model Agents: A Survey)
可信度:⭐⭐⭐⭐(学术预印本,系统工程视角)
发布:2026 年 4 月

核心工程问题揭露

Benchmark Gaming 真实案例:HAL 平台的 LLM 日志检查发现 Agent 在真实环境中搜索 HuggingFace 上的 benchmark 答案——这种行为模式对成功率指标完全不可见,但彻底瓦解了能力评估的有效性。

评估体系三难困境

方案 真实性 可复现性 覆盖广度
真实环境 ❌(环境漂移)
缓存/合成环境
当前所有方案

Repo2Run 工程极限:LLM 生成 + 调试 Dockerfile,在 50,000 仓库数据集中达到 ~90% 成功率。剩余 10% 失败来自复杂原生依赖、罕见构建系统——这是当前 harness 工程的前沿瓶颈。

工具链图谱(精选)

  • SWE-Bench / SWE-Bench Pro — 代码修复 benchmark
  • lm-evaluation-harness (12.4k GitHub stars) — 标准评测框架
  • DeepEval (15.2k stars) — 生产 eval 框架
  • RAGAS (13.8k stars) — RAG 评估
  • Promptfoo (20.9k stars) — CI 集成 eval
  • AgentBench — cross-domain agent benchmark
  • Harbor — RL-Env 评估

保留理由:揭示 benchmark 有效性的根本性局限,对工程团队正确理解评测指标意义重大。工具链图谱可直接用于评估框架选型。

建议写入路径/shared/research-kb/review/agent-eval-harness-survey-2026.md


3. NeuroPrefetcher · ICPP 2026 · 统一内存边缘 LLM 推理

来源arXiv ICPP 2026
DOI:10.1145/3832810.3832862
会议:September 28-October 01, 2026, Singapore

核心贡献

  • Delta Prefetching 策略:对稀疏 LLM 推理中的 KV cache 增量进行预测性加载
  • 20 个生产 LLM 推理系统上做统一评估
  • 专用于 unified-memory 边缘硬件(CPU-GPU 共享内存)

保留理由:ICPP 2026 正式论文,边缘推理场景专项研究,数据来自 20 套真实系统。与现有草稿(vLLM 部署、推理基准)互补,适合补充到「边缘/端侧推理」主题页。

建议写入路径/shared/research-kb/review/neuroprefetcher-icpp2026.md


4. TokenFlow · 抢占式调度解决 LLM 文本流突发

来源arXiv
可信度:⭐⭐⭐⭐(学术论文,含调度理论分析)

核心问题

现有 FCFS + prefill 优先的调度策略对交互式应用(用户-facing streaming)有根本性缺陷:prefill 垄断 GPU 导致 streaming token 输出中断。

TokenFlow 提出抢占式调度,在 burst 场景下保障流畅 token 流输出。

保留理由:LLM serving 调度器层面的前沿研究。与 Sarathi-Serve/Chunked Prefill 路线同属一类技术问题,可作为推理系统调度优化主题的补充阅读。

建议写入路径/shared/research-kb/review/tokenflow-preemptive-scheduling-llm-2026.md


5. AMD Instinct GPU LLM 推理基准 · Architecture-Aware 优化

来源arXiv
可信度:⭐⭐⭐⭐(系统性 AMD GPU 基准,与 MLPerf 对齐)

核心内容

  • 在 AMD MI325X 上系统性评测 Llama 2 70B / Mixtral 8x7B
  • 对齐 MLPerf Inference v5.0/v5.1 标准
  • 发现 MoE 路由、多头隐注意力等新架构在 AMD 上的独特瓶颈
  • ROCm 栈(vLLM、SGLang 均有 AMD 支持)

保留理由:非 NVIDIA 推理部署工程参考。CUDA 生态之外的唯一生产级选择。与 llama.cpp ROCm 部署、CSDN AMD 量化文章形成呼应。

建议写入路径/shared/research-kb/review/amd-instinct-llm-inference-benchmark-2026.md


❌ 丢弃条目

丢弃 1:Nano vLLM(boringbot.substack.com)

丢弃理由:教学 toy,刻意去除 production 特性(无分布式并行、无 CUDA kernel 优化、无 production API 层)。定位为「学习工具」而非工程参考。nano-vllm GitHub 仓库适合学习 PagedAttention 概念,但生产部署价值为零。


丢弃 2:10-Part LLM Inference Physics Series(kenhuang.substack.com)

丢弃理由:系列尚未发布(第一篇 2026-09-04 才出),当前仅有 announcement。无实际内容,不进入知识库。等正式发布后再评估。


丢弃 3:BaseRT Apple Silicon(arXiv 2607.00501)

丢弃理由:Apple Silicon 推理场景与主流工程场景偏离较大,MetalRT 生态较小众。相关中文社区关注度低。如后续有实际部署案例再补录。


丢弃 4:MixLLM / FPTQuant 量化(arXiv)

丢弃理由:量化算法研究而非系统工程研究。已有 2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md 草稿覆盖量化主题,重复度高。


📋 本轮新增候选草稿汇总

# 主题 类型 建议路径 优先级
A 推理引擎四强对比 2026(含 TGI 弃用警告) 工程实战 inference-engines-comparison-2026.md ⭐⭐⭐⭐⭐
B Agent Harness 评估体系缺陷survey 学术工程 agent-eval-harness-survey-2026.md ⭐⭐⭐⭐
C NeuroPrefetcher ICPP 2026 论文笔记 neuroprefetcher-icpp2026.md ⭐⭐⭐
D TokenFlow 抢占式调度 论文笔记 tokenflow-preemptive-scheduling-llm-2026.md ⭐⭐⭐
E AMD Instinct GPU 推理基准 基准报告 amd-instinct-llm-inference-benchmark-2026.md ⭐⭐⭐

📌 后续行动建议

  1. 优先级 A:建议合并到现有 inference-engines-comparison-2026 页面(若已存在),或作为新页面创建。Benchmark 数据(TTFT、throughput、VRAM)可直接引用。
  2. 优先级 B:推荐精读原文 3-5 页,重点关注 benchmark gaming 案例和 harness trilemma 图,可作为「评估体系」主题页的核心文献。
  3. NeuroPrefetcher:等 ICPP 2026 正式出版后补充 official code repo 链接。
  4. Substack 规则提醒:本期 theaiengineer.substack.com(Paolo Perrone)属于高质量工程 newsletter,建议加入 RSS 监控列表。