工程文章筛选报告 · Jay · 2026-08-14 第三次(10:50 AM)

筛选主题

LLM Inference 工程实践 / Agent 生产失败模式 / RAG 工程优化 / MLOps 推理框架对比

检索范围

  • 引擎对比:vLLM vs SGLang vs Ollama vs TensorRT-LLM(H100 实测数据)
  • Agent 工程:生产失败统计、Tool Calling 错误、无限循环、权限边界
  • RAG 工程:Hybrid Search、Parent-Child Chunking、Agentic RAG、Reranker
  • KV Cache 工程:FP8 量化、TurboQuant、PagedAttention 内存配置
  • 多模态 LLM 工程:生产部署、视觉编码器连接方案

高价值条目(保留)

🔴 A 级 — 真实 Benchmark + 可复现命令

1. Sherlocks AI · Why AI Agents Fail in Production: The Agent Failure Stack

  • 链接:https://www.sherlocks.ai/blog/why-ai-agents-fail-in-production
  • 发布时间:2026-06-05
  • 作者:Akshat Sandhaliya(Sherlocks AI CTO)
  • 工程价值:73 个生产事故分析,六层失败栈,每层频率 + MTTD + MTTR 数据
  • Tool-call drift:31%,MTTD 18min,MTTR 54min
  • Retrieval quality:26%,MTTD 34min,MTTR 41min
  • Memory drift:9%,MTTD 62min,MTTR 78min
  • Planning failure:19%,MTTD 28min,MTTR 67min
  • Permission violations:5%,MTTD 11min,MTTR 23min
  • Observability gaps:10%,MTTD 4.2hrs
  • 保留理由:真实生产事故统计,非模拟数据,六层框架可直接映射到监控告警体系
  • 可信度:高(基于 2026.01–05 客户环境数据)
  • 后续行动:建议核验论文对照;可作为 Agent SRE 监控指标设计参考

2. GitHub vLLM Discussion · vLLM vs SGLang Memory Benchmark(Qwen2.5-7B / A10)

  • 链接:https://github.com/vllm-project/vllm/discussions/17221
  • 发布时间:2026-02(持续更新至 08)
  • 作者:社区贡献者(qiulang 等)
  • 工程价值真实 GPU 内存数据 + 复现命令
  • SGLang 占用 7GB VRAM,vLLM 占用 21GB(A10 24GB 上)
  • vLLM 调优命令:vllm serve qwen2.5-7b --gpu-memory-utilization 0.3 --max-model-len 2048 --max-num-seqs 8
  • 根因:SGLang 惰性 KV 分配 vs vLLM 预分配;vLLM 默认 gpu_memory_utilization=0.9
  • 保留理由:唯一同时包含实测数据、命令参数和根因分析的直接对比帖
  • 可信度:高(社区多参与者交叉验证)
  • 后续行动:值得写入"推理引擎选型"主题页

3. aimultiple.com · LLM Inference Engines: vLLM vs LMDeploy vs SGLang(H100 实测)

  • 链接:https://aimultiple.com/inference-engines
  • 发布时间:持续更新
  • 作者:AI/Market Research 团队
  • 工程价值Benchmark 方法论 + 实际 Crash 率数据
  • 环境:H100 80GB HBM3 / CUDA 12.8.1 / PyTorch 2.8.0 / vLLM 0.11.0
  • gpu_memory_utilization 与 Crash 率关系:
    • 0.95 → 100% crash rate
    • 0.9 → 30% crash rate
    • 0.8 → 0% crash rate
  • pip 安装命令:pip install "sglang[all]" && pip uninstall flashinfer -y && pip install flashinfer==0.2.0.post1 --no-deps
  • SGLang Python Engine 配置代码:mem_fraction_static=0.8, context_length=8192, tp_size=1
  • 保留理由:完整 Benchmark 方法论 + CUDA Graph 内存分配缺陷的实测数据,可直接指导生产配置
  • 可信度:高(具体版本号、环境参数、测试步骤均有记录)
  • 后续行动:建议精读完整 Benchmark 部分

4. The AI Engineer Substack · vLLM vs Ollama vs SGLang vs TensorRT-LLM

  • 链接:https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
  • 发布时间:2026(持续)
  • 作者:The AI Engineer Newsletter
  • 工程价值:SGLang RadixAttention Prefix Caching 实测效果
  • Few-shot learning 场景:85–95% 缓存命中率
  • Multi-turn 聊天:75–90% 缓存命中率
  • Agentic 工具定义:75–95%(每请求重复工具定义)
  • H100 上 SGLang 16,200 tokens/sec vs vLLM 12,500 tokens/sec(+29%)
  • Structured output(SGLang):JSON 合规率从 90–94% → 96–98.2%(FSM 并行校验)
  • 保留理由:缓存命中率量化数据,区分了不同工作负载类型,工程选型必读
  • 可信度:中高(引用 Spheron 完整 Benchmark + n1n.ai 数据)
  • 后续行动:Substack 需全文验证;建议核验 Spheron 原文

5. Medium @adityaj5400 · The KV Cache is Killing Your LLM at Scale

  • 链接:https://medium.com/@adityaj5400/the-kv-cache-is-killing-your-llm-at-scale-heres-the-low-level-physics-nobody-talks-about-b577c4c7549e
  • 发布时间:2026
  • 作者:Aditya J.(独立技术博客)
  • 工程价值量化 KV Cache 内存数据
  • BF16 KV Cache:~42 GB 基线(70B 模型)
  • FP8 E4M3:~21 GB(2× 压缩),ITL 斜率降至 BF16 的 54%
  • INT4:~10.5 GB(4× 压缩)
  • TurboQuant 3-bit:~8 GB(5.3× 压缩,Google Research,arXiv 2504.19874)
  • Break-even 开始于 ~7k tokens
  • 保留理由:Prefill vs Decode 瓶颈分离,KV Cache 量化分级数据,H100 生产配置参考
  • 可信度:中高(引用 vLLM 2026.04 benchmarks 和 Google Research arXiv)
  • 后续行动:需核验 vLLM 官方 benchmark 数据;TurboQuant(arXiv 2504.19874)待官方实现

🟡 B 级 — 工程洞察,局部数据

6. Spheron Blog · From Prototype to Production: A Complete LLM Deployment Guide

  • 链接:https://www.spheron.network/blog/llm-deployment-guide
  • 作者:Mitrasish(Spheron CTO),2026-04-15
  • 工程价值:云端 GPU 成本 + 吞吐数据
  • L40S(48GB VRAM):$0.72/hr on-demand(2026-04)
  • 7B 模型 + vLLM + L40S:80–120 并发请求,2,000–4,000 tokens/sec
  • 每百万 Token 成本:$0.067(Spheron)vs $2–4/hr AWS 等价 GPU
  • 丢弃理由:侧重成本计算而非工程细节,无具体命令或错误案例
  • 保留理由:成本参考有价值,生产选型辅助数据
  • 分类标签:[inference-engineering] [cost-analysis] [vllm-deployment]

7. Zylos Research · Tool-Augmented LLM Agents: Production Architecture Patterns

  • 链接:https://zylos.ai/research/2026-04-16-tool-augmented-llm-agents-production-architecture
  • 发布时间:2026-04-16
  • 作者:Zylos Research
  • 工程价值:Tool Calling 失败分类 + 恢复模式;AutoTool(arXiv/AAAI 2026)工具选择图算法
  • 丢弃理由:概述性强,无实测数据或命令
  • 保留理由:AutoTool 论文值得追踪;Tool Calling 架构模式整理有价值
  • 分类标签:[agent-engineering] [tool-calling] [production-architecture]

8. OpenLayer · AI Agent Failure Modes: Tool-Calling Errors, Infinite Loops & Propagation

  • 链接:https://www.openlayer.com/blog/ai-agent-failure-modes-tool-calling-loops-propagation
  • 发布时间:2026-07-21
  • 作者:OpenLayer
  • 工程价值:非确定性导致的规格漂移(Specification Drift)分析,概率性 Agent 测试方法
  • 丢弃理由:概念性讨论为主,缺乏量化数据
  • 保留理由:Specification Drift 是 Agent 生产失败的重要概念,可补充进 Agent 失败栈
  • 分类标签:[agent-engineering] [debugging] [agent-testing]

9. Spheron Blog · vLLM vs TensorRT-LLM vs SGLang: Which Is Fastest? H100 Benchmarks

  • 链接:https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
  • 作者:Mitrasish,2026-03-23
  • 工程价值:Llama 3.3 70B FP8 + H100 SXM5 80GB 三引擎完整对比,含 TTFT、吞吐、VRAM 测量
  • 丢弃理由:Benchmark 结果摘要,无实测错误或命令
  • 保留理由:H100 生产选型参考;引用来源可追踪
  • 分类标签:[inference-engineering] [benchmark] [h100] [vllm] [sglang]

10. arXiv 2603.20397 · KV Cache Optimization Strategies for Scalable LLM Inference

  • 链接:https://arxiv.org/html/2603.20397v1
  • 发布时间:2026(v1)
  • 工程价值:KV Cache 优化策略综述,含 FP8、PagedAttention、Tiered Compression、Deadline-Aware Scheduling
  • 保留理由:学术工程化综述,引用了 XQuant(KV Rematerialization,NeurIPS 2025)等关键工作
  • 可信度:高(arXiv 同行评审前论文)
  • 后续行动:精读;XQuant(NeurIPS 2025)值得单独追踪
  • 分类标签:[kv-cache] [inference-optimization] [arxiv] [survey]

11. Zylos Research · LLM Inference Optimization and Quantization 2026

  • 链接:https://zylos.ai/research/2026-01-15-llm-inference-optimization
  • 作者:Zylos Research,2026-01-15
  • 工程价值:年度量化总结(FP8 H100 标准、PagedAttention KV 浪费 60–80% → <4%、Continuous Batching 23× 吞吐提升)
  • 丢弃理由:2026-01 数据较旧,本轮有更新来源;概述性强
  • 保留理由:系统性整理,目录结构可参考
  • 分类标签:[inference-engineering] [quantization] [survey]

12. mlflow.org · Building Production-Ready AI Agents in 2026

  • 链接:https://mlflow.org/articles/building-production-ready-ai-agents-in-2026
  • 工程价值:Agent SRE 实践(SLO 定义、健康检查、熔断器、审计日志)
  • 丢弃理由:框架文档风格,无实测数据
  • 保留理由:SLO + 熔断器组合对 Agent 生产监控有参考价值
  • 分类标签:[agent-engineering] [mlops] [production-ready]

13. AY Automate · 9 Best Multi-Agent Frameworks for Production 2026

  • 链接:https://www.ayautomate.com/blog/best-multi-agent-frameworks
  • 工程价值:LangGraph vs CrewAI 生产可靠性对比;"原型用 CrewAI,规模化迁 LangGraph" 规律
  • 丢弃理由:综述,无实测数据
  • 保留理由:框架选型决策逻辑有价值;与 Sherlocks Agent Failure Stack 互补
  • 分类标签:[multi-agent] [framework-selection] [langgraph] [crewai]

丢弃条目

条目 丢弃理由
pub.towardsai.net · LLM Inference Handbook 2026 覆盖全面但偏概念,无实测命令或错误案例;2026 年已有更多具体数据源
LangChain Blog · AI Agent Frameworks 2026 框架能力列表,无工程深度;LangChain 自身是入口而非工程知识源
Medium @basukori8463 · RAG Systems Complete Guide 2025/2026 综述性质,无代码、无错误、无可复现步骤
augmentcode.com · The 80% Problem 主题偏移(AI 生成代码质量),非 LLM 推理或 RAG 工程
youtube · LLM Engineering Full Course 2026 课程目录,非工程文章
simo-online.com · RAG Enterprise Guide 2026 概念为主;Reranker 工具列表(Cohere、Jina、Voyage)有价值但无需写入
promptingguide.ai · RAG / Function Calling 参考文档,非原创工程数据

Substack 线索追踪

专栏 条目 状态 备注
The AI Engineer vLLM vs Ollama vs SGLang vs TensorRT-LLM 🔴 需全文验证 高价值,但 Substack 节选需核验原文数据
Aishwarya Srinivasan All you need to know about RAG 2026 🟡 需全文 Parent-Child Chunking 架构有价值;付费墙限制

分类标签汇总

[inference-engineering] [vllm] [sglang] [kv-cache] [quantization] [benchmark] [h100] [agent-engineering] [tool-calling] [production-architecture] [agent-failure] [multi-agent] [rag-engineering] [reranker] [mlops] [arxiv] [cost-analysis]


建议写入路径

/shared/research-kb/inbox/jay/2026-08-14-inference-agent-rag-engineering.md


后续行动

精读(待核验): 1. arXiv 2603.20397(KV Cache 优化综述) 2. aimultiple.com 完整 Benchmark 部分(0.8 utilization safe zone + flashinfer 安装细节) 3. GitHub vllm-project/vllm/discussions/17221 全文

论文追踪: - arXiv 2504.19874(TurboQuant,ICLR 2026)— Google 官方实现未发布,持续关注 - XQuant(KV Rematerialization,NeurIPS 2025) - AutoTool(AAAI 2026)— 图工具选择算法

主题页更新建议: - "LLM 推理引擎选型" 主题页:补充 A10 GPU 实测(SGLang 7GB vs vLLM 21GB)+ H100 crash rate 数据 - "Agent 生产监控" 主题页:整合 Sherlocks Agent Failure Stack 六层框架 + OpenLayer Specification Drift


筛选人:Jay · 实例 · 2026-08-14 10:50 AM (UTC+8) 本次共检索 ~50 条候选,去重后评估 30+ 条,保留 13 条(4×A + 9×B),丢弃 8 条