工程实践筛选 · Jay · 2026-10-04 14:50
本次主题: Inference Engine Benchmark / Agent Bug Patterns / RAG Benchmarking 检索范围: Winder AI benchmark、arXiv(RAGPerf/Agent Bug/Inference Control Plane)、GitHub benchmark 数据
✅ 保留条目
1. vLLM vs SGLang vs Ollama Benchmark 2026(Winder AI)
- 来源: https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison
- 可信度: 高(独立咨询公司,含原始数据)
- 发布时间: 2026-09
- 工程维度: 真实 H100 benchmark,量化数据,命令行可验证
Benchmark 数据(Llama 3.1 8B,FP16):
| Engine | Tokens/s @ 1/10/50 并发 | P50 TTFT @ 50 | $/M output tokens @ 50 |
|---|---|---|---|
| vLLM | 150 / 1,235 / 3,688 | 0.68s | $0.26 |
| SGLang | 154 / 1,233 / 3,617 | 0.73s | $0.27 |
| TensorRT-LLM | 141 / 1,127 / 3,219 | 0.54s | $0.30 |
| llama.cpp | 185 / 539 / 703 | 0.98s | $1.38 |
| Ollama | 79 / 239 / 277 | 1.7s | $3.50 |
Benchmark 数据(Qwen3.8-27B,hybrid linear-attention):
| Engine | Tokens/s @ 50 并发 | 备注 |
|---|---|---|
| SGLang(state cache sized for 50) | 1,725 | 需调参才能发挥 |
| vLLM | 1,610 | 开箱即用 |
| SGLang(defaults) | 982 | 默认 20 并发上限 |
| Ollama | 33 | 差距极大 |
关键工程结论: - 并发 >5 用户 → 选 vLLM 或 SGLang,放弃 Ollama - 混合注意力新模型(Qwen3.8-27B 类)→ SGLang 小幅领先但需调参 - 单用户桌面推理 → llama.cpp/Ollama - 生产成本:vLLM/SGLang/TensorRT-LLM 差距小($0.26-$0.30/M output tokens)
可复现性: 中(有 benchmark 配置说明,无完整复现脚本) 是否需要精读: ✅ 是(工程选型直接参考) 后续行动: 提取 benchmark 配置参数,写入 LLMOps 性能数据节点
2. When Agents Fail: LLM Agent Bug Study(arXiv)
- 来源: 引用自 https://github.com/VoltAgent/awesome-ai-agent-papers
- 可信度: 高(arXiv 论文,1,187 真实 bug 报告,7 个框架)
- 发布时间: 2026(待核原始 arXiv ID)
- 核心观点:
- 1,187 bug reports 来自 7 个 LLM agent 软件框架
- 分类维度:错误类型 / 根因 / 影响 / 自动化测试方法
- ReAct agent 自动标注 bug 实验
- 工程价值: 直接指导 Agent 防御性编程和测试策略
- 是否需要精读: ✅ 是(需核验原始 arXiv ID 并提取 bug taxonomy)
- 后续行动: 查找原始 arXiv 链接;提取 bug 分类体系写入 Agent 工程反模式专题
3. RAGPerf: End-to-End RAG Benchmarking Framework(arXiv:2603.10765)
- 来源: https://arxiv.org/html/2603.10765v1
- 可信度: 高(arXiv,2026-03,系统论文)
- 发布时间: 2026-03
- 工程维度: 标准 benchmark 框架,真实数据集,跨模态
Benchmark 数据集配置:
| 数据集 | 类型 | 规模 |
|---|---|---|
| Wikipedia (Foundation, 2025) | Text | 19.3 GB / 6.41M entries |
| Arxiv (Kandpal et al., 2025) | 48 GB / 30K | |
| github-code (codepattot, 2026) | Code | 32 GB / 11M |
| The People's Speech | Audio | 35.5 GB / 0.3M |
可复现性: 高(有数据集 + 模型 + 向量库配置) 是否需要精读: ✅ 是(生产 RAG 选型必备参考) 后续行动: 提取 benchmark 配置写入 RAG 评测专题;对比 Qdrant/Milvus/Pinecone 实际表现
4. Inference Control Plane: vLLM/llm-d 生产实践(arXiv:2609.23130)
- 来源: https://arxiv.org/html/2609.23130v1
- 可信度: 高(arXiv 系统综述,2026-09)
- 发布时间: 2026-09
- 工程维度: 生产部署案例,量化数据,可指导 LLMOps 架构
关键生产数据:
| 案例 | 量化结果 | 条件 |
|---|---|---|
| Prefix-cache-aware routing(Tesla/Red Hat) | 3× throughput 提升,2× TTFT 改善 | Llama 3.1 70B,4× AMD MI300X |
| P2P KV sharing | TTFT 7.85s → 2.56s;req/s 3.80 → 10.10 | GLM-5.2 |
| Heterogeneous llm-d pool | 峰值 14.2k vs 9.6k tok/s;TTFT 6.8s vs 36.4s | 20-pod,3-vendor Granite-4.1-8B |
工程预警: - 控制平面 CPU 可成为瓶颈(heterogeneous pool 场景) - Prefix-cache-aware routing 将负载均衡问题转化为缓存管理问题
是否需要精读: ✅ 是(LLMOps 生产架构直接参考) 后续行动: 写入 LLMOps 生产案例库;补充 kserve/llm-d 集成路径
❌ 丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| hindsight(GitHub 40K+ stars,agent memory) | 社区热度高但无工程细节/命令/性能数据,纯 demo 性质 |
| LLM-Engineering GitHub Roadmap | 汇总路线图,无新工程数据;适合参考区,非精读 |
| Vector DB Benchmark 对比文(AlphaCorp/Braintrust/TiDB) | 供应商评测为主,缺乏独立 benchmark;RAGPerf 已提供量化替代 |
| The AI Engineer Substack(AI Agents Stack 2026) | 已在 2026-10-04-1335-jay-research-briefing-oct04.md 覆盖,本轮不重复 |
🏷️ 分类标签
inference-engine vLLM SGLang benchmark LLMOps RAG RAGPerf agent-debugging bug-patterns production
📋 后续行动
- [ ] 核验 When Agents Fail 原始 arXiv ID,提取 bug taxonomy
- [ ] 对比 vLLM/SGLang benchmark 配置参数(GPU型号/数量/精度)
- [ ] 写入 RAG 评测专题(benchmark 配置节点)
- [ ] 写入 LLMOps 生产案例库(prefix routing / P2P KV / heterogeneous pool)
本文件为草稿,待合并至知识库