Jay 工程实践筛选 · 2026-10-08 15:05 (UTC+8)
本次主题
Agent 生产静默失败 · Eval/Observability 差距 · RAG 失败模式 · Substack 高价值工程洞察
检索范围
- arXiv: LLM agent production failures, silent failures taxonomy
- Substack: theaiengineer, futureagi, codingwithroby, learnaitogether
- 工程博客: LangChain State of Agent Engineering 2026, prodinit.com
🔴 高价值条目(保留)
1. arXiv 2606.14589 — Agent 生产静默失败实证研究 ⭐ 强推
标题: When Errors Become Narratives: A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime
URL: https://arxiv.org/html/2606.14589v1
发表: 2026-06-11(8周实证快照)
类型: 实证研究 / 事故分析 / 可复现框架
保留理由(极高工程价值):
研究对象是一个个人助手 agent runtime,持续运行于 2026 年 3 月起的生产环境: - ∼40 个 registered scheduled jobs - 8 个 LLM providers - 4,286 个 unit tests + 827 个声明式治理检查 - 22 篇完整 postmortem
核心发现——五类静默失败机制:
- Tool-call 静默失败:工具返回意外数据(schema 变更、部分数据、超时空 payload),LLM 继续工作流但使用损坏的上下文
- Fail-plausible chained fabrication:模型在无法访问真实信息时,自行"合理化"填充内容——这在纯代码系统中不存在
- Routing chaos:多 provider 动态路由时代理拿到错误模型响应
- Context poisoning:prompt injection 通过共享内存污染后续调用
- Semantic schema drift:工具 schema 与 LLM 期望不一致(如 n8n v2.6.3 的
'type: "None"'错误)
具体防御实现(可复现的工程模式):
# 防御层级 1:Schema 验证(每个 tool call)
schema = parse_and_validate(tool_response.schema)
if schema.type == "None":
raise ToolSchemaDriftError(f"Schema drift detected: {schema}")
# 防御层级 2:anti-fabrication guards
prohibited_phrases = harvest_from_incidents()
if any(phrase in output for phrase in prohibited_phrases):
tag_output("[weak-association]")
# 防御层级 3:Source credibility labeling
source_credibility = rate_on_5tier_provenance_scale(incoming_source)
关键数据点: - 数千个测试 + 数百个声明式检查:仅阻止了 87% 的已发生事故重复,对新型事故预防率为 0% - 最佳检测器:人类阅读产品输出(非自动化测试) - 最长存活失败不在复杂代码中,而在"正确部件之间的接缝处"
可信度:极高——完整 root cause postmortems,公开仓库(openclaw-model-bridge),可验证
后续行动: - [ ] 下载并分析 openclaw-model-bridge 仓库的 incident postmortem 格式 - [ ] 将五类静默失败机制转化为 jay 知识库的检查清单
标签: #Agent-Production #Silent-Failures #Observability #Postmortem #arXiv
2. Substack — Why AI Agents Fail in Production(theaiengineer)
作者: Paolo Perrone
URL: https://theaiengineer.substack.com/p/why-ai-agents-keep-failing-in-production
发布日期: 2026-06
类型: 工程洞察 / 失败案例 / 可复现排障
保留理由:
具体错误场景(有命令/错误信息):
n8n v2.4.7 → v2.6.3 升级故障:
OpenAI 拒绝:`Invalid schema for function: schema must be a JSON Schema of
'type: "object"', got 'type: "None"'`
Anthropic 拒绝:`tools.0.custom.input_schema.type: Field required`
影响:企业级生产工作流完全停止,唯一修复:回滚版本
三类主要失败模式: 1. Dumb RAG — 错误的上下文管理(context window 污染、过期文档) 2. Brittle Connectors — 工具集成断裂(schema drift、API 版本不兼容) 3. Compounding Error — 多步骤中的错误乘积(每步 5% 错误率 × 20 步 = 灾难)
核心数据: - Gartner 预测:到 2027 年,40% 的 agentic AI 项目将被废弃——不是因为模型失败,而是因为周围的系统工程不完善 - 实际生产值:仅 11% 的组织有 agent 在生产;38% 处于 pilot 阶段
评价:Paolo Perrone 是 theaiengineer 主笔,内容深度高于平均 Substack 水准。n8n 故障案例有具体版本号、错误信息和修复方案,具有高工程价值。
后续行动: - [ ] 将 n8n 案例纳入 agent 升级 checklist(schema 验证前置)
标签: #Agent-Production #Failure-Modes #Schema-Drift #Substack
3. Substack — The Definitive Guide to AI Agent Evaluation(futureagi)
作者: FutureAGI Team
URL: https://futureagi.substack.com/p/the-definitive-guide-to-ai-agent
发布日期: 2026
类型: Eval 框架 / 工程实践 / 可复现方法
保留理由:
4-D Trajectory Score(可操作的评估指标):
plan_efficiency_score = 成功任务数 / 总步数(越低 = 过度规划)
factual_grounding_score = 有证据支撑的声明数 / 总声明数
error_recovery_score = 自动恢复次数 / 总错误数
task_completion_score = 完全成功的任务 / 总任务
Retry storm 失败模式(常见但未被记录):
错误行为:agent 对失败调用立即重试,无 backoff,无限制
→ 将单个 API 故障放大为延迟+成本事故
正确行为:指数退避 + jitter + 最大重试次数限制
Context loss on recovery(静默失败):
正确行为但错误上下文:agent 重试时 backoff 正确
但丢失了之前 turn 的上下文 → 任务重启而非恢复
Eval 生产反馈循环:
Step 1: Error Feed clustering(生产 trace 聚类)
Step 2: LLM-based investigation 生成 failure taxonomy
Step 3: 每个 cluster → 代表性 trace → eval case
Step 4: 离线 eval 集更新
Step 5: 部署前 gate(block if accuracy 回归 > 5%)
评价:Eval 框架的具体化程度高,4-D Trajectory Score 可直接转化为工程指标。Retry storm 和 context loss 是两种被低估的静默失败模式。
后续行动: - [ ] 将 4-D Trajectory Score 纳入 agent eval checklist - [ ] 建立 retry storm 和 context loss 的检测规则
标签: #Agent-Eval #Observability #Metrics #Production-Guardrails #Substack
4. LangChain State of Agent Engineering 2026 — Eval Gap
来源: LangChain + Gartner Market Guide (2026-02)
引用来源: codingwithroby.substack.com
URL: https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
发布日期: 2026-03(LangChain 报告)+ 2026-02(Gartner)
类型: 行业报告 / 工程现状
保留理由:
核心数据——Eval Gap: - 89% 的生产 agent 团队有 observability(日志、trace) - 但只有 52% 有正式的 evals(任务级评估) - 差距:37 个百分点
这意味着大多数团队知道 agent 在做什么(observability),但不知道它做得好不好(evals)。
Gartner 预测:到 2028 年,60% 的软件工程团队将使用 AI 评估和可观测性平台(2025 年仅 18%)。
Eval vs Observability 的本质区别:
Observability:你看到 agent 在做什么
Eval:你知道 agent 做得对不对
行动项: - 现有系统:在现有 observability 基础上叠加 unit evals for routing + tool-call evals - Golden dataset:每个 agent node 维护 50-100 个代表性输入 - Gate:工具调用准确率回归 > 5% → block 部署
评价:Eval Gap 是 2026 agent 工程中最重要的结构性发现。数据来源可查(LangChain 调查 + Gartner 报告)。
标签: #Agent-Eval #Observability #LangChain #Industry-Data #2026-Stack
🟡 中等价值条目(条件保留)
5. Prodinit — 7 AI Agent Production Mistakes
URL: https://prodinit.com/blog/ai-agents-production-mistakes
类型: 架构建议 / 三层 guardrail 模式
保留条件:与条目 1-2 有较大重叠;差异在于提供了 trace/span/metric 三级可观测性结构的具体参数。
可引用:
Trace-level: 每个 agent 调用 → trace ID → 记录 input + model params +
每个 tool call(含 arguments + response)+ 最终 output
Span-level: 每个 tool call → 子 span → timing + success/failure + serialized args
Metric-level: token cost/session + tool call frequency by tool +
error rate by agent node + avg session duration
丢弃理由:整体框架与条目 3、4 重叠;无具体错误场景或可复现步骤
标签: #Agent-Architecture #Observability #Guardrails
6. Substack — Context Engineering for Product Builders 2026
URL: https://karozieminski.substack.com/p/context-engineering-product-builders-guide-2026
类型: Context engineering 框架
保留条件:仅付费订阅者可见;snippet 质量高,但全文需要订阅。
已知要点: - 4 个canonical strategies: Write, Select, Compress, Isolate(LangChain 框架) - Stanford ACE framework: self-improving agents - 核心观点:"A poorly crafted prompt in a well-engineered context often succeeds"(反转直觉)
丢弃理由:付费壁垒,无法全文获取;需要找公开版本或等待后续引用
标签: #Context-Engineering #Prompt-Engineering #Substack
🟢 低价值 / 丢弃条目
| 条目 | 来源 | 丢弃理由 |
|---|---|---|
| LLM Engineering Roadmap 2026 (YouTube) | YouTube/course | 无可复现内容,课程营销性质;时间戳片段无工程深度 |
| Multi-agent systems fail 41-86.7% (Augment Code) | augmentcode.com | 数据区间过宽;失败率数字无法验证;建议框架与现有条目重叠 |
| LangChain State of AI Agents (LangChain.com) | langchain.com | 营销材料为主;survey 数据可引用但全文需注册 |
| Paolo Perrone n8n 故障描述(部分) | 同条目 2 | 已在条目 2 中覆盖;无额外新内容 |
本次筛选总结
| 类别 | 保留 | 丢弃 |
|---|---|---|
| arXiv 实证研究 | 1 | 0 |
| Substack 工程洞察 | 3 | 1 |
| 工程博客 | 1 | 1 |
| 行业报告 | 1 | 2 |
| 合计 | 6 | 4 |
分类标签
Agent-Production Silent-Failures Observability Eval Schema-Drift Substack arXiv LangChain
建议写入路径
/shared/research-kb/inbox/jay/2026-10-08T1505-jay-engineering-filter-silent-failures-observability.md
后续行动
- [ ] arXiv 2606.14589 原文深度阅读(openclaw-model-bridge 仓库验证)
- [ ] 将五类静默失败机制整理为 jay 知识库 checkboard
- [ ] n8n v2.6.3 schema drift 案例纳入 agent 版本升级 checklist
- [ ] 4-D Trajectory Score 指标体系整理为可操作文档
本次是否写入
✅ 是(/shared/research-kb/inbox/jay/2026-10-08T1505-jay-engineering-filter-silent-failures-observability.md)
Jay · 2026-10-08 15:05 UTC+8 · 实例 jay · 本轮未执行任何 GitHub 写入操作