工程实践筛选 · 2026-08-25 下午场
本次主题
LLM Agent / RAG 工程实践:Evaluation + Debugging + Production Reliability
检索范围
- Tavily Web Search(主)
- Substack(The AI Engineer、Future AGI 等)
- GitHub 工程相关仓库
- Datadog State of AI Engineering 报告
✅ 保留条目
1. Datadog State of AI Engineering(2026)
- 来源: datadoghq.com
- URL: https://www.datadoghq.com/state-of-ai-engineering
- 作者: Datadog Research
- 发布时间: 2026(具体月份待精确)
- 核心观点:
- 2026年2月:LLM 调用 span 中 5% 报错,其中 60% 是 rate limit 错误
- 2026年3月:约 840 万次 rate limit 错误
- 容量天花板是生产环境中 LLM 调用失败的首要原因
- 纯基础设施监控(uptime)无法反映输出质量
- 可信度判断: ⭐⭐⭐⭐⭐(Datadog 第一方生产 trace 数据,样本量大)
- 是否需核验: 建议交叉验证 Datadog 官方博客原文获取完整命令/图表
- 行动建议: 关注 rate limit 处理策略(exponential backoff、请求排队)
2. AgentDebug GitHub(UIUC)
- 来源: github.com/ulab-uiuc/AgentDebug
- URL: https://github.com/ulab-uiuc/AgentDebug
- 作者: UIUC NLP/SE Lab
- 发布时间: 2026(持续更新)
- 核心观点:
- 提出 AgentErrorTaxonomy:17种错误类型 × 5模块(memory/reflection/planning/action/system)
- AgentErrorBench:ALFWorld、GAIA、WebShop 失败轨迹标注数据集
- 两阶段调试 pipeline:隔离根因 + 纠正反馈
- Action 模块错误:misalignment、invalid_action、format_error、parameter_error
- System 模块错误:step_limit、tool_execution_error、llm_limit、environment_error
- 可信度判断: ⭐⭐⭐⭐(UIUC 学术背景,MIT license,有源码和数据集)
- 是否需核验: 建议拉取源码验证错误分类覆盖度
- 行动建议: 可作为 Agent 错误分类的工程 checklist 参考
3. awesome-harness-engineering GitHub
- 来源: github.com/ai-boost/awesome-harness-engineering
- URL: https://github.com/ai-boost/awesome-harness-engineering
- 作者: ai-boost 社区
- 发布时间: 2026(活跃更新)
- 核心观点:
- TraceCoder(ICSE 2026):多 Agent 调试框架,Instrumentation Agent → Analysis Agent(HLLM)→ Repair Agent,Pass@1 提升 34.43%
- AgentStepper(2026):交互式调试工具,NASA TLX 挫败感评分 5.4→2.4
- 按层次组织:harness/eval/memory/MCP/security/orchestration
- 收录 Braintrust(Full-trace search without sampling)、Langfuse、Opik 等工程工具对比
- 可信度判断: ⭐⭐⭐⭐(聚合 + 学术来源标注,覆盖全面)
- 是否需核验: TraceCoder 需查 arXiv 原文确认 ICSE 接收状态
- 行动建议: 作为 Agent 工程工具链选型的主要参考列表
4. The AI Agents Stack(2026 Edition)- The AI Engineer
- 来源: Substack · theaiengineer.substack.com
- URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition
- 作者: The AI Engineer Newsletter
- 发布时间: 2026
- 核心观点:
- MCP(Model Context Protocol)标准化工具连接,整个 tools 层重新定义
- 推理模型改变 Agent 自主能力边界(单步 Agent 替代部分多步链)
- Memory 成为第一等架构原语,非 vector DB 后加
- Agent guardrails ≠ LLM guardrails:2026 新认知——guardrails 现在涵盖工具调用授权、限速、事后验证
- "guardrails before action" 模式:授权在工具执行层做,而非输出层
- OWASP MCP Top 10(beta)——首个 MCP 安全清单
- 评估"基础设施化"三收敛:PR fast check → nightly regression → production monitoring
- 可信度判断: ⭐⭐⭐⭐(AI Engineering 垂直领域高质量 Newsletter)
- 是否需核验: OWASP MCP Top 10 需查官方文档确认最新版本
- 行动建议: Agent 架构设计时优先参考此 Stack 分层模型
5. AI Evaluation Engineering Handbook(freeCodeCamp)
- 来源: freecodecamp.org
- URL: https://www.freecodecamp.org/news/ai-evaluation-engineering-build-a-production-grade-llm-evaluation-platform-handbook
- 作者: Aayostem(freeCodeCamp contributor)
- 发布时间: 2026
- 核心观点:
- 完整可复现代码:
evaluate_agent()函数集成 Opik、BaseMetric自定义扩展 - summary density heuristic:自定义评估指标(评估响应简洁性+信息量)
- 三类 Agent 轨迹评估指标:正确答案 + 正确推理路径 + 工具调用效率
- 工具链:RAGAS + DeepEval + MLflow + OpenTelemetry
- 配套 GitHub:
github.com/aayostem/ai-evals-platform - 可信度判断: ⭐⭐⭐⭐(有配套可执行源码仓库,工程实践导向)
- 是否需核验: 建议 clone 仓库验证环境搭建步骤
- 行动建议: 作为搭建内部 Eval Platform 的参考实现
6. Why AI Agents Fail in Production(DEV Community)
- 来源: dev.to
- URL: https://dev.to/hadil/why-ai-agents-fail-in-production-and-how-engineering-teams-are-fixing-it-in-2026-job
- 作者: Hadil Ben Abdallah
- 发布时间: 2026
- 核心观点:
- Silent Tool Call Failures(静默工具调用失败):服务器健康但 agent 静默产生灾难性输出
- Latency 指标正常但 agent 静默 hallucinate 的场景说明
- 核心论点:AI workflow as production infrastructure——可测量、可追踪、可调试
- 可信度判断: ⭐⭐⭐(工程社区经验分享,有场景描述但无实测数据)
- 是否需核验: 非必须,属工程警示类文章
- 行动建议: 作为生产 Agent 监控告警设计的思考素材
7. 7 Best Tools for Debugging AI Agents(2026)- Braintrust
- 来源: Braintrust 官方博客
- URL: https://www.braintrust.dev/articles/best-ai-agent-debugging-tools-2026
- 作者: Braintrust Team
- 发布时间: 2026
- 核心观点:
- 工具对比表:Agenta vs LangSmith vs Phoenix vs Braintrust,含生产集成度评分
- Agenta:开源(MIT),pytest 风格,模型无关
- LLM observability → debugging → regression → CI/CD quality gates 完整工作流
- Domain expert annotation + LLM-as-judge 协作调试模式
- 可信度判断: ⭐⭐⭐⭐(工具官方文档,工程选型参考价值高)
- 是否需核验: 建议试用各工具对比实际集成体验
- 行动建议: 作为 Agent 调试工具链选型的主要参考
8. TraceCoder(ICSE 2026)
- 来源: awesome-harness-engineering 引用 → arXiv
- URL: 待精确(引用中 arXiv:2603.XXXXX)
- 作者: (待查)
- 发布时间: ICSE 2026
- 核心观点:
- 多 Agent 协作调试:Instrumentation Agent → Analysis Agent(HLLM 历史经验)→ Repair Agent(含 rollback)
- Pass@1 提升 34.43%
- 可信度判断: ⭐⭐⭐⭐⭐(ICSE 顶会接收,有具体性能数字)
- 是否需核验: 需查 arXiv 原文确认论文编号和代码仓库
- 行动建议: 作为 multi-agent debugging 方向的前沿参考追踪
❌ 丢弃条目(工程价值不足)
| 条目 | 丢弃理由 |
|---|---|
| Adaline AI LLM Evaluation Guide 2026 | 产品推广为主,无真实命令/代码/性能数据 |
| SuperAnnotate RAG Evaluation Guide | 基础概念介绍,无工程实现细节 |
| Maxim AI RAG Tools 2026 | 工具罗列,营销性质,无源码/性能对比 |
| EITT AI Agents 2026 Guide | 教育入门向,无具体工程实现 |
| YouTube LLM Engineering Full Course | 视频内容,无法提取可执行步骤 |
| Javarevisited 2026 AI Engineer Roadmap | 学习路径,有付费墙,非工程实践 |
分类标签汇总
production-data LLM-errors rate-limit observability error-taxonomy agent-debugging benchmark agent-tooling multi-agent-debugging evaluation-stack ICSE-2026 agent-stack MCP guardrails eval-pipeline OWASP eval-platform code-implementation production-failures silent-errors ci-cd tracing
后续行动建议
- TraceCoder 精确查证:搜索 ICSE 2026 论文编号和 GitHub 仓库
- AgentDebug 源码验证:clone 后验证错误分类实际覆盖范围
- ai-evals-platform 复现:按 Handbook 搭建本地 eval pipeline
- OWASP MCP Top 10 追踪:关注安全 checklist 正式版发布
- Datadog 报告原文:获取完整图表数据特别是 2026年3月 rate limit 细分
筛选时间: 2026-08-25 14:50 CST · 筛选者: Jay · 优先级: 高(Evaluation/Debugging/Production Reliability 三角)