Jay 工程实践筛选报告 · 2026-06-27 第 3 轮

轮次信息

  • 筛选时间: 2026-06-27 19:50 (UTC+8)
  • 角色: Jay · 工程实践二次筛选
  • 总候选条目: 14 条
  • 高价值条目: 4 条(进入精读队列)
  • 可参考条目: 5 条
  • 丢弃条目: 5 条(理由附后)

🔴 高价值条目(精读队列)

1. A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime

字段 内容
来源 arXiv · 2026-06-11
作者 OpenClaw 团队(公开仓库 openclaw-model-bridge)
可信度 ★★★★★ 第一手生产数据
主题标签 LLM-runtime silent-failure observability incident-postmortem
核心概念 fail-plausible:系统将内部错误转换为"流畅但错误"的输出,欺骗人类监控者。类比云时代的 gray failure,但更危险
数据规模 8 周,22 起真实 incident,每个都有完整 postmortem;4,286 单元测试;8 个 LLM 提供商
关键发现 单一 meta-pattern(错误信号从未以可操作形式到达人类)出现 ≥28 次;错误链跨层时每层"合理地"剥离原因,最终告警含 0 可操作比特
工程教训 错误链必须在层间保留上游原因(经典分布式追踪原则的 LLM 版,但"客户端"常常是另一个 LLM prompt)
可复现性 直接可复现:作者公开了完整 postmortem 模板 "exception-analysis constitution"
是否需要核验 是:建议对照作者公开仓库 openclaw-model-bridge 源码核实 root-cause 描述

评价: 本轮最高价值条目。生产系统第一手 incident 数据,fail-plausible 概念对所有 LLM 应用开发者都有警示意义。保留。


2. Prompt Engineering Isn't Enough — I Built a Control Layer That Works in Production

字段 内容
来源 Towards Data Science · 2026
可信度 ★★★★☆ 工程实现,有 benchmark 数据
主题标签 production-architecture guardrails circuit-breaker token-budget
核心组件 InputGuard(微秒级拦截,7/8 注入成功阻断);TokenBudget(使用 tiktoken 而非"1 token ≈ 4 字符"经验法则,代码/非拉丁语误差可达 40%);CircuitBreakerRetryEngine
实测数据 Naive system: 0% Pass rate → Control layer: 100% Pass rate(结构化输出 benchmark)
测试覆盖 69 tests,含集成测试验证:首次成功、重试触发、fallback 路由、熔断拒绝、注入安全
是否含源码 是:组件级描述,测试用例名称明确(TestInputGuard, TestCircuitBreaker 等)
是否需要核验 是:建议 clone 其 GitHub 仓库运行 benchmark 命令验证

评价: 真实可运行的生产控制层架构,TokenBudget 的 tiktoken 纠错数据有说服力。保留。


3. The AI Agents Stack: LLM to Production (2026 Edition)

字段 内容
来源 The AI Engineer · Substack · 2026
可信度 ★★★★☆ 行业调研综合(LangChain Agent Engineering Survey 89% 有监控 vs 52% 有评估)
主题标签 agent-architecture memory observability MCP evaluation
关键数据 评估差距: 89% 团队有监控,但仅 52% 有评估——37 个百分点的差距是生产质量死亡带
三层评估架构 PR 时快速检查(工具调用正确性)→ 夜间回归套件(LLM judge)→ 生产持续监控(漂移告警)
新 benchmark Context-Bench(记忆管理)、Recovery-Bench(错误恢复)、Terminal-Bench(编码 agent)
MCP 安全 OWASP MCP Top 10(beta)发布;agent guardrails 从输入/输出过滤升级为"操作授权"
是否需要核验 是:建议对照 LangChain State of Agent Engineering Survey 原始数据

评价: 行业架构全景图,数据具体(89% vs 52%),对团队技术选型有直接参考价值。保留。


4. Why Do Multi-Agent LLM Systems Fail (And How to Fix) — 2026 Guide

字段 内容
来源 FutureAGI Substack · 2026
作者 FutureAGI
可信度 ★★★★☆ 研究引用(UC Berkeley 数据)+ 工程分类框架
主题标签 multi-agent coordination-failure MCP context-collapse
核心数据 UC Berkeley:多 agent 系统在标准 benchmark 上失败率 41%–86.7%
MAST 分类 42% 规格错误(spec failures)+ 37% 协调失败(coordination breakdowns)+ 21% 验证不足(weak verification)
失败模式 Context collapse(上下文窗口耗尽导致决策丢失);Format mismatch(YAML vs JSON 不一致);Conflicting objectives(资源竞争);自然语言歧义
解法 MCP(JSON-RPC 2.0 schema 验证);显式资源所有权(每资源唯一 owner)
是否需要核验 是:建议对照 UC Berkeley 原始研究确认 41%–86.7% 区间

评价: 多 agent 系统失败率有具体来源(UC Berkeley),MAST 分类可操作性强。保留。


🟡 可参考条目(按需查阅)

5. The Untold Pains About Building AI Agents On Production

  • 保留理由: pgvector 够用不必上 Pinecone;model upgrade 会导致响应膨胀(verbosity tripled);observability 关键是定义 binary criteria;安全是 least-privilege 原则
  • 丢弃理由: 深度不足,缺乏具体命令或可复现步骤;更接近经验分享帖
  • 标签: production-pains pgvector model-update

6. How Grab Uses AI Agents to Reclaim Hundreds of Engineering Hours a Month

  • 保留理由: FastAPI + LangGraph 真实生产案例,提到 Opik 观测、prompt caching 成本优化
  • 丢弃理由: 工程细节不够具体,依赖 Grab 官方博客二次整理
  • 标签: fastapi langgraph finops

7. LLM Ops Explained: How to Build Scalable AI Systems in 2026

  • 保留理由: 视频提纲完整(18:20),涵盖 LLM Ops 演进、guardrails、评估、FAANG+ 部署案例
  • 丢弃理由: YouTube 视频,无法提取可引用文本
  • 标签: llmops scaling

8. State of Context Engineering in 2026

  • 保留理由: Anthropic 上下文工程方法论;hybrid routing 权衡分析(accuracy/latency/token cost/maintainability/reliability)
  • 丢弃理由: 主要是框架描述,缺乏命令或代码
  • 标签: context-engineering hybrid-routing

9. Building a Production-Grade AI Agent in .NET

  • 保留理由: Microsoft Agent Framework + OpenAI + MCP + Ollama 完整技术栈;model provider 可替换架构设计
  • 丢弃理由: 付费订阅墙;技术方向(.NET)对 AI 研究知识库受众较窄
  • 标签: .net mcp ollama

🟢 丢弃条目(及理由)

# 条目 丢弃理由
D1 Why Your LLM Keeps Breaking Production (GoPenAI/Medium) Medium 付费墙;文章仅 5 分钟阅读,snippet 可见内容浅薄;无源码、无命令
D2 LLM Systems Engineering Roadmap (GitHub h9-tec) 内容为 roadmap 结构,无具体环境、错误或命令;适合作为导航页而非工程参考
D3 I've been building production AI systems for 3 years (LinkedIn Harish Neel) 纯职业建议帖;roadmap 摘要,无工程细节
D4 11 Workshops to Build Production AI Agents (Alexey Grigorev Substack) -workshop 索引帖;内容为课程导航,无具体工程步骤
D5 How to become an AI engineer in 2026 (Jugaldb Substack) 入门学习路径帖;step-by-step 教育内容,非工程实践深度

📊 分类标签汇总

LLM-runtime, silent-failure, observability, incident-postmortem,
production-architecture, guardrails, circuit-breaker, token-budget,
agent-architecture, memory, MCP, evaluation, multi-agent,
coordination-failure, context-collapse, pgvector, fastapi,
langgraph, llmops, context-engineering, hybrid-routing

📁 建议写入路径

/shared/research-kb/inbox/jay/2026-06-27-engineering-practice-screening.md  ← 本文件

精读队列优先级排序: 1. arxiv/2606.14589 — fail-plausible 概念 + 22 incident postmortem(最高优先) 2. Control Layer 架构 — InputGuard/CircuitBreaker/RetryEngine 组件化实现 3. AI Agents Stack 2026 — 89% vs 52% 评估差距的行业数据 4. MAST Multi-Agent — 41%–86.7% 失败率 + 分类框架


⚠️ 待核验项

  • [ ] arxiv/2606.14589:对照 openclaw-model-bridge 仓库核实 postmortem 细节
  • [ ] UC Berkeley 多 agent 失败率 41%–86.7%:需找原始论文确认
  • [ ] Control Layer benchmark:需 clone 仓库运行 pytest 验证 0% → 100% 数据
  • [ ] LangChain Survey 89% vs 52%:需找原始调研报告核实

Jay · 工程筛选报告 · 2026-06-27 第 3 轮