工程文章筛选报告 · Jay · 2026-08-14 第三次(10:50 AM)
筛选主题
LLM Inference 工程实践 / Agent 生产失败模式 / RAG 工程优化 / MLOps 推理框架对比
检索范围
- 引擎对比:vLLM vs SGLang vs Ollama vs TensorRT-LLM(H100 实测数据)
- Agent 工程:生产失败统计、Tool Calling 错误、无限循环、权限边界
- RAG 工程:Hybrid Search、Parent-Child Chunking、Agentic RAG、Reranker
- KV Cache 工程:FP8 量化、TurboQuant、PagedAttention 内存配置
- 多模态 LLM 工程:生产部署、视觉编码器连接方案
高价值条目(保留)
🔴 A 级 — 真实 Benchmark + 可复现命令
1. Sherlocks AI · Why AI Agents Fail in Production: The Agent Failure Stack
- 链接:https://www.sherlocks.ai/blog/why-ai-agents-fail-in-production
- 发布时间:2026-06-05
- 作者:Akshat Sandhaliya(Sherlocks AI CTO)
- 工程价值:73 个生产事故分析,六层失败栈,每层频率 + MTTD + MTTR 数据
- Tool-call drift:31%,MTTD 18min,MTTR 54min
- Retrieval quality:26%,MTTD 34min,MTTR 41min
- Memory drift:9%,MTTD 62min,MTTR 78min
- Planning failure:19%,MTTD 28min,MTTR 67min
- Permission violations:5%,MTTD 11min,MTTR 23min
- Observability gaps:10%,MTTD 4.2hrs
- 保留理由:真实生产事故统计,非模拟数据,六层框架可直接映射到监控告警体系
- 可信度:高(基于 2026.01–05 客户环境数据)
- 后续行动:建议核验论文对照;可作为 Agent SRE 监控指标设计参考
2. GitHub vLLM Discussion · vLLM vs SGLang Memory Benchmark(Qwen2.5-7B / A10)
- 链接:https://github.com/vllm-project/vllm/discussions/17221
- 发布时间:2026-02(持续更新至 08)
- 作者:社区贡献者(qiulang 等)
- 工程价值:真实 GPU 内存数据 + 复现命令
- SGLang 占用 7GB VRAM,vLLM 占用 21GB(A10 24GB 上)
- vLLM 调优命令:
vllm serve qwen2.5-7b --gpu-memory-utilization 0.3 --max-model-len 2048 --max-num-seqs 8 - 根因:SGLang 惰性 KV 分配 vs vLLM 预分配;vLLM 默认 gpu_memory_utilization=0.9
- 保留理由:唯一同时包含实测数据、命令参数和根因分析的直接对比帖
- 可信度:高(社区多参与者交叉验证)
- 后续行动:值得写入"推理引擎选型"主题页
3. aimultiple.com · LLM Inference Engines: vLLM vs LMDeploy vs SGLang(H100 实测)
- 链接:https://aimultiple.com/inference-engines
- 发布时间:持续更新
- 作者:AI/Market Research 团队
- 工程价值:Benchmark 方法论 + 实际 Crash 率数据
- 环境:H100 80GB HBM3 / CUDA 12.8.1 / PyTorch 2.8.0 / vLLM 0.11.0
gpu_memory_utilization与 Crash 率关系:- 0.95 → 100% crash rate
- 0.9 → 30% crash rate
- 0.8 → 0% crash rate
- pip 安装命令:
pip install "sglang[all]" && pip uninstall flashinfer -y && pip install flashinfer==0.2.0.post1 --no-deps - SGLang Python Engine 配置代码:
mem_fraction_static=0.8, context_length=8192, tp_size=1 - 保留理由:完整 Benchmark 方法论 + CUDA Graph 内存分配缺陷的实测数据,可直接指导生产配置
- 可信度:高(具体版本号、环境参数、测试步骤均有记录)
- 后续行动:建议精读完整 Benchmark 部分
4. The AI Engineer Substack · vLLM vs Ollama vs SGLang vs TensorRT-LLM
- 链接:https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
- 发布时间:2026(持续)
- 作者:The AI Engineer Newsletter
- 工程价值:SGLang RadixAttention Prefix Caching 实测效果
- Few-shot learning 场景:85–95% 缓存命中率
- Multi-turn 聊天:75–90% 缓存命中率
- Agentic 工具定义:75–95%(每请求重复工具定义)
- H100 上 SGLang 16,200 tokens/sec vs vLLM 12,500 tokens/sec(+29%)
- Structured output(SGLang):JSON 合规率从 90–94% → 96–98.2%(FSM 并行校验)
- 保留理由:缓存命中率量化数据,区分了不同工作负载类型,工程选型必读
- 可信度:中高(引用 Spheron 完整 Benchmark + n1n.ai 数据)
- 后续行动:Substack 需全文验证;建议核验 Spheron 原文
5. Medium @adityaj5400 · The KV Cache is Killing Your LLM at Scale
- 链接:https://medium.com/@adityaj5400/the-kv-cache-is-killing-your-llm-at-scale-heres-the-low-level-physics-nobody-talks-about-b577c4c7549e
- 发布时间:2026
- 作者:Aditya J.(独立技术博客)
- 工程价值:量化 KV Cache 内存数据
- BF16 KV Cache:~42 GB 基线(70B 模型)
- FP8 E4M3:~21 GB(2× 压缩),ITL 斜率降至 BF16 的 54%
- INT4:~10.5 GB(4× 压缩)
- TurboQuant 3-bit:~8 GB(5.3× 压缩,Google Research,arXiv 2504.19874)
- Break-even 开始于 ~7k tokens
- 保留理由:Prefill vs Decode 瓶颈分离,KV Cache 量化分级数据,H100 生产配置参考
- 可信度:中高(引用 vLLM 2026.04 benchmarks 和 Google Research arXiv)
- 后续行动:需核验 vLLM 官方 benchmark 数据;TurboQuant(arXiv 2504.19874)待官方实现
🟡 B 级 — 工程洞察,局部数据
6. Spheron Blog · From Prototype to Production: A Complete LLM Deployment Guide
- 链接:https://www.spheron.network/blog/llm-deployment-guide
- 作者:Mitrasish(Spheron CTO),2026-04-15
- 工程价值:云端 GPU 成本 + 吞吐数据
- L40S(48GB VRAM):$0.72/hr on-demand(2026-04)
- 7B 模型 + vLLM + L40S:80–120 并发请求,2,000–4,000 tokens/sec
- 每百万 Token 成本:$0.067(Spheron)vs $2–4/hr AWS 等价 GPU
- 丢弃理由:侧重成本计算而非工程细节,无具体命令或错误案例
- 保留理由:成本参考有价值,生产选型辅助数据
- 分类标签:[inference-engineering] [cost-analysis] [vllm-deployment]
7. Zylos Research · Tool-Augmented LLM Agents: Production Architecture Patterns
- 链接:https://zylos.ai/research/2026-04-16-tool-augmented-llm-agents-production-architecture
- 发布时间:2026-04-16
- 作者:Zylos Research
- 工程价值:Tool Calling 失败分类 + 恢复模式;AutoTool(arXiv/AAAI 2026)工具选择图算法
- 丢弃理由:概述性强,无实测数据或命令
- 保留理由:AutoTool 论文值得追踪;Tool Calling 架构模式整理有价值
- 分类标签:[agent-engineering] [tool-calling] [production-architecture]
8. OpenLayer · AI Agent Failure Modes: Tool-Calling Errors, Infinite Loops & Propagation
- 链接:https://www.openlayer.com/blog/ai-agent-failure-modes-tool-calling-loops-propagation
- 发布时间:2026-07-21
- 作者:OpenLayer
- 工程价值:非确定性导致的规格漂移(Specification Drift)分析,概率性 Agent 测试方法
- 丢弃理由:概念性讨论为主,缺乏量化数据
- 保留理由:Specification Drift 是 Agent 生产失败的重要概念,可补充进 Agent 失败栈
- 分类标签:[agent-engineering] [debugging] [agent-testing]
9. Spheron Blog · vLLM vs TensorRT-LLM vs SGLang: Which Is Fastest? H100 Benchmarks
- 链接:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
- 作者:Mitrasish,2026-03-23
- 工程价值:Llama 3.3 70B FP8 + H100 SXM5 80GB 三引擎完整对比,含 TTFT、吞吐、VRAM 测量
- 丢弃理由:Benchmark 结果摘要,无实测错误或命令
- 保留理由:H100 生产选型参考;引用来源可追踪
- 分类标签:[inference-engineering] [benchmark] [h100] [vllm] [sglang]
10. arXiv 2603.20397 · KV Cache Optimization Strategies for Scalable LLM Inference
- 链接:https://arxiv.org/html/2603.20397v1
- 发布时间:2026(v1)
- 工程价值:KV Cache 优化策略综述,含 FP8、PagedAttention、Tiered Compression、Deadline-Aware Scheduling
- 保留理由:学术工程化综述,引用了 XQuant(KV Rematerialization,NeurIPS 2025)等关键工作
- 可信度:高(arXiv 同行评审前论文)
- 后续行动:精读;XQuant(NeurIPS 2025)值得单独追踪
- 分类标签:[kv-cache] [inference-optimization] [arxiv] [survey]
11. Zylos Research · LLM Inference Optimization and Quantization 2026
- 链接:https://zylos.ai/research/2026-01-15-llm-inference-optimization
- 作者:Zylos Research,2026-01-15
- 工程价值:年度量化总结(FP8 H100 标准、PagedAttention KV 浪费 60–80% → <4%、Continuous Batching 23× 吞吐提升)
- 丢弃理由:2026-01 数据较旧,本轮有更新来源;概述性强
- 保留理由:系统性整理,目录结构可参考
- 分类标签:[inference-engineering] [quantization] [survey]
12. mlflow.org · Building Production-Ready AI Agents in 2026
- 链接:https://mlflow.org/articles/building-production-ready-ai-agents-in-2026
- 工程价值:Agent SRE 实践(SLO 定义、健康检查、熔断器、审计日志)
- 丢弃理由:框架文档风格,无实测数据
- 保留理由:SLO + 熔断器组合对 Agent 生产监控有参考价值
- 分类标签:[agent-engineering] [mlops] [production-ready]
13. AY Automate · 9 Best Multi-Agent Frameworks for Production 2026
- 链接:https://www.ayautomate.com/blog/best-multi-agent-frameworks
- 工程价值:LangGraph vs CrewAI 生产可靠性对比;"原型用 CrewAI,规模化迁 LangGraph" 规律
- 丢弃理由:综述,无实测数据
- 保留理由:框架选型决策逻辑有价值;与 Sherlocks Agent Failure Stack 互补
- 分类标签:[multi-agent] [framework-selection] [langgraph] [crewai]
丢弃条目
| 条目 | 丢弃理由 |
|---|---|
| pub.towardsai.net · LLM Inference Handbook 2026 | 覆盖全面但偏概念,无实测命令或错误案例;2026 年已有更多具体数据源 |
| LangChain Blog · AI Agent Frameworks 2026 | 框架能力列表,无工程深度;LangChain 自身是入口而非工程知识源 |
| Medium @basukori8463 · RAG Systems Complete Guide 2025/2026 | 综述性质,无代码、无错误、无可复现步骤 |
| augmentcode.com · The 80% Problem | 主题偏移(AI 生成代码质量),非 LLM 推理或 RAG 工程 |
| youtube · LLM Engineering Full Course 2026 | 课程目录,非工程文章 |
| simo-online.com · RAG Enterprise Guide 2026 | 概念为主;Reranker 工具列表(Cohere、Jina、Voyage)有价值但无需写入 |
| promptingguide.ai · RAG / Function Calling | 参考文档,非原创工程数据 |
Substack 线索追踪
| 专栏 | 条目 | 状态 | 备注 |
|---|---|---|---|
| The AI Engineer | vLLM vs Ollama vs SGLang vs TensorRT-LLM | 🔴 需全文验证 | 高价值,但 Substack 节选需核验原文数据 |
| Aishwarya Srinivasan | All you need to know about RAG 2026 | 🟡 需全文 | Parent-Child Chunking 架构有价值;付费墙限制 |
分类标签汇总
[inference-engineering] [vllm] [sglang] [kv-cache] [quantization] [benchmark] [h100] [agent-engineering] [tool-calling] [production-architecture] [agent-failure] [multi-agent] [rag-engineering] [reranker] [mlops] [arxiv] [cost-analysis]
建议写入路径
/shared/research-kb/inbox/jay/2026-08-14-inference-agent-rag-engineering.md
后续行动
精读(待核验): 1. arXiv 2603.20397(KV Cache 优化综述) 2. aimultiple.com 完整 Benchmark 部分(0.8 utilization safe zone + flashinfer 安装细节) 3. GitHub vllm-project/vllm/discussions/17221 全文
论文追踪: - arXiv 2504.19874(TurboQuant,ICLR 2026)— Google 官方实现未发布,持续关注 - XQuant(KV Rematerialization,NeurIPS 2025) - AutoTool(AAAI 2026)— 图工具选择算法
主题页更新建议: - "LLM 推理引擎选型" 主题页:补充 A10 GPU 实测(SGLang 7GB vs vLLM 21GB)+ H100 crash rate 数据 - "Agent 生产监控" 主题页:整合 Sherlocks Agent Failure Stack 六层框架 + OpenLayer Specification Drift
筛选人:Jay · 实例 · 2026-08-14 10:50 AM (UTC+8) 本次共检索 ~50 条候选,去重后评估 30+ 条,保留 13 条(4×A + 9×B),丢弃 8 条