工程实践筛选 · Jay · 2026-10-04 14:50

本次主题: Inference Engine Benchmark / Agent Bug Patterns / RAG Benchmarking 检索范围: Winder AI benchmark、arXiv(RAGPerf/Agent Bug/Inference Control Plane)、GitHub benchmark 数据


✅ 保留条目

1. vLLM vs SGLang vs Ollama Benchmark 2026(Winder AI)

  • 来源: https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison
  • 可信度: 高(独立咨询公司,含原始数据)
  • 发布时间: 2026-09
  • 工程维度: 真实 H100 benchmark,量化数据,命令行可验证

Benchmark 数据(Llama 3.1 8B,FP16):

Engine Tokens/s @ 1/10/50 并发 P50 TTFT @ 50 $/M output tokens @ 50
vLLM 150 / 1,235 / 3,688 0.68s $0.26
SGLang 154 / 1,233 / 3,617 0.73s $0.27
TensorRT-LLM 141 / 1,127 / 3,219 0.54s $0.30
llama.cpp 185 / 539 / 703 0.98s $1.38
Ollama 79 / 239 / 277 1.7s $3.50

Benchmark 数据(Qwen3.8-27B,hybrid linear-attention):

Engine Tokens/s @ 50 并发 备注
SGLang(state cache sized for 50) 1,725 需调参才能发挥
vLLM 1,610 开箱即用
SGLang(defaults) 982 默认 20 并发上限
Ollama 33 差距极大

关键工程结论: - 并发 >5 用户 → 选 vLLM 或 SGLang,放弃 Ollama - 混合注意力新模型(Qwen3.8-27B 类)→ SGLang 小幅领先但需调参 - 单用户桌面推理 → llama.cpp/Ollama - 生产成本:vLLM/SGLang/TensorRT-LLM 差距小($0.26-$0.30/M output tokens)

可复现性: 中(有 benchmark 配置说明,无完整复现脚本) 是否需要精读: ✅ 是(工程选型直接参考) 后续行动: 提取 benchmark 配置参数,写入 LLMOps 性能数据节点


2. When Agents Fail: LLM Agent Bug Study(arXiv)

  • 来源: 引用自 https://github.com/VoltAgent/awesome-ai-agent-papers
  • 可信度: 高(arXiv 论文,1,187 真实 bug 报告,7 个框架)
  • 发布时间: 2026(待核原始 arXiv ID)
  • 核心观点:
  • 1,187 bug reports 来自 7 个 LLM agent 软件框架
  • 分类维度:错误类型 / 根因 / 影响 / 自动化测试方法
  • ReAct agent 自动标注 bug 实验
  • 工程价值: 直接指导 Agent 防御性编程和测试策略
  • 是否需要精读: ✅ 是(需核验原始 arXiv ID 并提取 bug taxonomy)
  • 后续行动: 查找原始 arXiv 链接;提取 bug 分类体系写入 Agent 工程反模式专题

3. RAGPerf: End-to-End RAG Benchmarking Framework(arXiv:2603.10765)

  • 来源: https://arxiv.org/html/2603.10765v1
  • 可信度: 高(arXiv,2026-03,系统论文)
  • 发布时间: 2026-03
  • 工程维度: 标准 benchmark 框架,真实数据集,跨模态

Benchmark 数据集配置:

数据集 类型 规模
Wikipedia (Foundation, 2025) Text 19.3 GB / 6.41M entries
Arxiv (Kandpal et al., 2025) PDF 48 GB / 30K
github-code (codepattot, 2026) Code 32 GB / 11M
The People's Speech Audio 35.5 GB / 0.3M

可复现性: 高(有数据集 + 模型 + 向量库配置) 是否需要精读: ✅ 是(生产 RAG 选型必备参考) 后续行动: 提取 benchmark 配置写入 RAG 评测专题;对比 Qdrant/Milvus/Pinecone 实际表现


4. Inference Control Plane: vLLM/llm-d 生产实践(arXiv:2609.23130)

  • 来源: https://arxiv.org/html/2609.23130v1
  • 可信度: 高(arXiv 系统综述,2026-09)
  • 发布时间: 2026-09
  • 工程维度: 生产部署案例,量化数据,可指导 LLMOps 架构

关键生产数据:

案例 量化结果 条件
Prefix-cache-aware routing(Tesla/Red Hat) 3× throughput 提升,2× TTFT 改善 Llama 3.1 70B,4× AMD MI300X
P2P KV sharing TTFT 7.85s → 2.56s;req/s 3.80 → 10.10 GLM-5.2
Heterogeneous llm-d pool 峰值 14.2k vs 9.6k tok/s;TTFT 6.8s vs 36.4s 20-pod,3-vendor Granite-4.1-8B

工程预警: - 控制平面 CPU 可成为瓶颈(heterogeneous pool 场景) - Prefix-cache-aware routing 将负载均衡问题转化为缓存管理问题

是否需要精读: ✅ 是(LLMOps 生产架构直接参考) 后续行动: 写入 LLMOps 生产案例库;补充 kserve/llm-d 集成路径


❌ 丢弃条目

条目 丢弃理由
hindsight(GitHub 40K+ stars,agent memory) 社区热度高但无工程细节/命令/性能数据,纯 demo 性质
LLM-Engineering GitHub Roadmap 汇总路线图,无新工程数据;适合参考区,非精读
Vector DB Benchmark 对比文(AlphaCorp/Braintrust/TiDB) 供应商评测为主,缺乏独立 benchmark;RAGPerf 已提供量化替代
The AI Engineer Substack(AI Agents Stack 2026) 已在 2026-10-04-1335-jay-research-briefing-oct04.md 覆盖,本轮不重复

🏷️ 分类标签

inference-engine vLLM SGLang benchmark LLMOps RAG RAGPerf agent-debugging bug-patterns production


📋 后续行动

  1. [ ] 核验 When Agents Fail 原始 arXiv ID,提取 bug taxonomy
  2. [ ] 对比 vLLM/SGLang benchmark 配置参数(GPU型号/数量/精度)
  3. [ ] 写入 RAG 评测专题(benchmark 配置节点)
  4. [ ] 写入 LLMOps 生产案例库(prefix routing / P2P KV / heterogeneous pool)

本文件为草稿,待合并至知识库