Jay 工程筛选报告 · 2026-10-01

检索范围: tavily_search · 近一月工程内容 · 含 Substack 路由规则 重点: 真实环境、命令、错误、性能数据、可复现步骤


筛选结论汇总

条目 来源 保留/丢弃 理由
vLLM vs Ollama vs SGLang benchmark Winder.ai / winder.ai 保留 真实 benchmark 数据 + 实际错误日志 + 修复命令
企业 RAG 错误分类(27% 错误率) Splunk / splunk.com 保留 EACL 2026 论文数据,16 类错误类型
LLM 基础设施 GPU 成本分析 Substack / bhavishyapandit9 保留 具体数字:4.2x tokens/GPU,$3.6M capex 节省
Awesome Harness Engineering GitHub / ai-boost 保留 Claude Code 回归根因分析,harness 变更三要素
AI Systems 可靠性工程 arXiv 2609.35316 保留(参考) FMEA/FRACAS 框架,AI 可靠性工程分类
LLMOps vs AgentOps 完整指南 Substack / intellibytes 丢弃 概念综述,无工程细节
MLOps 学习资源列表 Substack / marvelousmlops 丢弃 书单/博客推荐,无可复现步骤
MCP 协议工业应用市场报告 Verdantix 丢弃 市场分析,非工程实现
Agentic AI 工业用例 多来源 丢弃 行业概述,无技术深度

保留条目详评

1. vLLM vs Ollama vs SGLang: LLM Inference Compared 2026

来源: Winder.ai (Dr. Phil Winder, CEO) · https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison 发布: 2026 年 9 月 · 可信度: 高(实测基准)

核心工程数据: - 测试环境: 1×H100, Llama 3.1 8B 和 Qwen3.8-27B(混合线性注意力模型) - Qwen3.8-27B @ 50 并发: SGLang 1,725 tokens/s vs vLLM 1,610 tokens/s(差距 ~7%) - Ollama @ 50 并发: 仅 33 tokens/s(与 vLLM/SGLang 差 50 倍) - 实际 Bug 案例: Helix 集群 8×NVIDIA RTX PRO 6000 上,SGLang 引擎全部在 12 个请求时停止 - 根因: Mamba state cache 默认以 bfloat16 存储,cache 大小被自动限制为 12 个请求 - 日志证据: SGLang 启动时打印 max_running_requests is capped to 12 by the mamba state cache - 修复: 切换状态存储格式(推测为降低精度或改变分配策略),throughput 从 3,833 → 7,883 tokens/s(+106%) - 该 bug 在单卡 H100 基准测试中同样复现

保留理由: 真实生产故障 + 完整复现链路(错误日志→根因→修复→验证数据),工程教育价值极高。SGLang 用户需注意 Mamba 状态 cache 配置。

丢弃内容: 文中 General-int 赛道 Ollama 排第四的对比,模型版本差异不具时效性,丢弃。

建议行动: - SGLang 用户排查 max_running_requests 配置项 - RAG/Inference 性能对比记录此基准框架 - 审稿后入库 engineering/inference/


2. 企业 RAG 错误分类: 16 类错误,27% 错误率

来源: Splunk 博客 · https://www.splunk.com/en_us/blog/artificial-intelligence/enterprise-rag-system.html 发布: 2026 年 9 月 · 可信度: 高(引用 EACL 2026 Leung et al.)

核心工程数据: - DragonBall-EN 评测集错误率: 27% - Leung et al. (EACL 2026) 将错误扩展为 16 种类型,覆盖: - Chunking(分块)错误 - Retrieval(检索)错误 - Reranking(重排)错误 - Generation(生成)错误 - 关键发现: 幻觉(fabricated content)在 RAG 系统中相对罕见,主要错误集中在检索和分块阶段 - Splunk 建议优先级: 检索诊断 > Chunk 相关性优化 > Prompt 调整(即不要优先改 prompt)

Splunk 企业 RAG 架构层次: 1. Authentication(认证) 2. Guardrails(防护栏) 3. Retrieval(检索) 4. Generation(生成) 5. Observability(可观测性)

生产延迟预算建议: 对 Guardrails、Retrieval、Query rewriting 等阻塞阶段建立明确 SLO。

保留理由: 提供了 RAG 生产失败的经验优先级排序,27% 错误率和 16 类分类是实打实的生产数据。可作为 RAG 调试清单使用。

建议行动: 补充 EACL 2026 Leung et al. 原文链接;入库 engineering/rag/


3. LLM 基础设施隐性成本: GPU 资源浪费案例

来源: Substack / bhavishyapandit9 · https://bhavishyapandit9.substack.com/p/mlops-gpu-cost-llm-infrastructure 发布: 2026 · 可信度: 中(需核验原始论文/代码)

核心工程数据: | 指标 | Baseline | 优化架构 | 改善 | |------|---------|---------|------| | 单请求延迟 | 1,000+ μs | 100–200 μs | 10x | | 每 GPU Tokens | 1x | 4.2x | 320% | | 每请求重计算成本 | ~$0.03 | near zero | ~100% 节省 |

架构改进要点: - State disaggregation(状态分离): GPU 与 session 解绑 - Kernel-bypass networking: 降低网络延迟 - Automated resource reclamation: 清理 zombie jobs - Memory-tiered caching: NVMe 作为 GPU 内存扩展

CapEx 影响: 如果 tokens/GPU 提升 4.2x,相同输出可用 24 GPU 而非 100 GPU → 节省 ~$3.6M capex(100→24 GPU 差值,按云端定价估算)

保留理由: 量化了 LLM 基础设施浪费的具体金额,提供了架构层面的改进方向。$3.6M 数字是强工程信号。

注意事项: 具体节省金额需结合实际云定价和部署规模,不宜直接引用;需核验出处。

建议行动: 标记为待核验条目;入库 engineering/inference/infrastructure-costs/


4. Awesome Harness Engineering(精选列表)

来源: GitHub / ai-boost · https://github.com/ai-boost/awesome-harness-engineering 更新时间: 持续更新 · 可信度: 高(精选编辑质量)

本轮新增高价值内容:

Claude Code 质量回归根因分析 (Anthropic, 2026-04): - 三个独立 harness 级变更导致质量下降: 1. 默认 reasoning-effort 降级 2. 缓存优化 bug:stale sessions 中持续丢弃 thinking history 3. 过于激进的长度限制 system prompt - 诊断方法: 透明 postmortem + 三条独立变更逐一隔离验证 - 工程教训: harness 调整(prompt 措辞、cache headers、默认参数)会复合放大为可见的 agent 回归

Agent Error Taxonomy (AgentDebug, ICLR 2026): - 模块化错误分类:Memory、Reflection、Planning、Action、System-level - Agent Error Benchmark:ALFWorld、GAIA、WebShop 标注轨迹 - +24% all-correct accuracy(通过隔离根因+纠正反馈)

The Design Space of Today's AI Agent Systems (2026-04 reverse engineering): - Claude Code 五阶段 progressive compaction(budget reduction → snip → microcompact → context collapse → auto-compact) - 子 agent 隔离 + 权限上下文重建 - 27-event-type hook pipeline

保留理由: 提供了 harness 工程的系统性知识结构;Claude Code 回归案例是 harness 级变更风险的教科书级案例。

建议行动: 建议加入知识库 engineering/harness/ 目录;精读 AgentDebug ICLR 2026 论文


5. Reliability Engineering for AI Systems: Challenges, Methods, and Directions

来源: arXiv 2609.35316 · https://arxiv.org/html/2609.35316v1 可信度: 高(学术论文)

核心工程框架: - Predictability(可预测性): 校准度、区分度、弃权能力 - Safety(安全性): 违规概率、严重程度、阻止率 - Recoverability(可恢复性): MTTD/MTTR、rollback/no-regression - Governability(可治理性): 审计 lineage、数据删除合规

FMEA 方法应用于 AI: - Stress 类型: 输入扰动、类别不平衡、语料变化、恶意内容 - Repair 类型: 再训练、策略修订、更严格控制门 - Exposure 测量: 里程、任务小时、工具调用数

关键引用: - Tan et al. (ASE 2026): AgentChaos: chaos engineering for agent systems via programmatic fault injection (arXiv 2608.06790) - FRACAS 框架应用于 AI 失败闭环

保留理由: 提供了 AI 系统可靠性工程的系统性术语框架,适合作为工程 checklist 使用。

建议行动: 入库 systems/reliability/;补充 AgentChaos (ASE 2026) 根论文


本轮丢弃条目

丢弃 1: LLMOps vs AgentOps 完整指南

来源: intellibytes.substack.com 丢弃理由: 概念定义性综述,DevOps/MLOps/LLMOps/AIOps/AgentOps 五者对比,无工程命令、错误日志或性能数据。属于科普级别,不符合本知识库筛选标准。

丢弃 2: MLOps 学习资源列表

来源: marvelousmlops.substack.com 丢弃理由: 书籍/课程/博客推荐清单,无原创工程内容,不含真实环境数据。

丢弃 3: MPS 协议工业应用(Verdantix 报告)

来源: verdantix.com 丢弃理由: 市场分析报告,非工程实现细节。Gartner 40% 数据已在知识库中多次出现,无新工程信息。

丢弃 4: "4 Books to Deepen Your Understanding of LLMs"

来源: youssefh.substack.com / todatabeyond.substack.com 丢弃理由: 书籍推荐+简介,无原创分析,无工程细节。


分类标签

inference-engineering vllm sglang rag harness-engineering mcp reliability benchmark gpu-cost agent-debugging


建议写入路径

  • engineering/inference/2026-10-01-vllm-sglang-benchmark-winder.md
  • engineering/rag/2026-10-01-rag-error-taxonomy-27percent.md
  • engineering/inference/infrastructure-costs/2026-10-01-llm-gpu-cost-analysis.md
  • engineering/harness/2026-10-01-awesome-harness-engineering-update.md
  • systems/reliability/2026-10-01-ai-reliability-fmea-fracas.md

是否需要精读/审稿/主题页更新

  • 精读: AgentDebug (ICLR 2026) 论文;Claude Code postmortem 原文
  • 审稿: $3.6M capex 节省数字来源(bhavishyapandit9)
  • 主题页更新: inference-engineering 主题页补充 SGLang Mamba state cache bug 案例

Jay · 2026-10-01 14:50 CST · Tavily 搜索 + 本地草稿审查