工程筛选草稿 · 2026-09-02 · Jay
主题
Harness Engineering / Agent Chaos Engineering / Coding Agent 可靠性工程
检索范围
| 渠道 | 关键词 | 时间 |
|---|---|---|
| Tavily | LLM agent engineering harness reliability 2026 | 近一月 |
| Tavily | AgentChaos reliability benchmark arxiv 2026 | 近一月 |
| Tavily | Substack AI engineering production agent | 近一月 |
| arXiv cs.AI/cs.SE | (关键词驱动 + 列表扫描) | 近一月 |
候选条目(7条)
1. AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection
- 来源: arXiv ASE 2026 (2608.06790)
- URL: https://arxiv.org/abs/2608.06790
- 核心观点: 多边界故障注入框架(tool/LLM/guardrail/agent/inter-agent),在 Langfuse 分布式追踪下做无标签故障诊断。Benchmark 为 AgentChaosBench,覆盖 4 框架 × 多故障类型。
- 工程价值: ⭐⭐⭐⭐⭐
真实复现了生产中多框架多 agent 系统的跨边界故障场景,含程序化注入 Pipeline,有工具链(Langfuse)和评分协议。保留。 - 可复现性: 高 — 提供了 artifact 和 pipeline,工具链清晰
2. Engineering Reliable Coding Agents: Evaluating and Operating the System Around the Model
- 来源: arXiv cs.SE (2608.13867),314 页工程专论
- URL: https://arxiv.org/abs/2608.13867
- 核心观点: 重新定义 coding agent 可靠性 = 每次解决 issue 的同时,留下可审查、可维护、可扩展的 diff,而非仅通过测试。强调 harness 工程(上下文管理/工具权限/观测/反馈闭环)。
- 工程价值: ⭐⭐⭐⭐⭐
配套 206 条可靠性记录和可运行协议。极高价值 — 必读。 - 可复现性: 高 — 配套 GitHub 仓库 sjarmak/engineering-reliable-coding-agents
3. ReliabilityBench: Evaluating LLM Agent Reliability Under Production-Like Stress Conditions
- 来源: arXiv (2601.06112)
- 核心观点: 在扰动和工具故障注入下评估 agent 一致性、鲁棒性和容错性。与 AgentChaos 互补。
- 工程价值: ⭐⭐⭐⭐
混沌工程方法论在 LLM agent 领域的系统化落地。保留。
4. When Agentic Executions Fail: Detecting and Localizing (AgentChaosBench 配套)
- 来源: arXiv (2608.14680)
- 核心观点: 跨异构边界的故障定位,trace 脱敏后诊断评分预测。
- 工程价值: ⭐⭐⭐⭐
与 AgentChaos 成套,实用性强。保留。
5. Towards Risk-free AI Agent Deployment
- 来源: arXiv (2608.16411)
- 核心观点: 覆盖 MCP 工具描述气味、SE-agent 自演化、AgentRx 失败轨迹诊断等多个子方向。
- 工程价值: ⭐⭐⭐
宽泛综述,缺乏单一突出亮点。降级保留:参考价值一般。
6. Harness Engineering — "只有 5% 的企业 AI agent 真正到达生产环境"
- 来源: Aishwarya Srinivasan Substack (Paid)
- URL: https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-harness
- 核心观点: 95% agent 死于原型;真正的工程量在 harness(上下文编排、工具权限、治理边界、评估观测)。Agent = Model + Harness(引用 Mitchell Hashimoto 2026 年定义)。
- 工程价值: ⭐⭐⭐
观点聚合,统计数字缺乏原始引用。作为工程趋势背景参考,不深度引用正文。
7. The Physics & Engineering of Frontier LLM Inference (Substack 10-part series)
- 来源: Ken Huang Substack
- URL: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
- 核心观点: 2026 推理架构蓝图:API Gateway / Semantic Router / Disaggregated P-D Nodes / XGrammar FSM 约束解码 / Edge SLM 部署(DeepSeek-V4 / Llama-3.2 / Phi-4)。
- 工程价值: ⭐⭐⭐⭐
生产蓝图视角,有 TCO/GPU 计数数学公式和具体工具链。保留 — 推理基础设施参考。
高价值条目(筛选结论)
| # | 条目 | 价值 | 理由 |
|---|---|---|---|
| 1 | AgentChaos (ASE 2026) | ⭐⭐⭐⭐⭐ | 多边界故障注入Benchmark + Langfuse追踪,有artifact |
| 2 | Engineering Reliable Coding Agents (314p) | ⭐⭐⭐⭐⭐ | 重新定义coding agent可靠性,206条可靠性记录 |
| 3 | ReliabilityBench | ⭐⭐⭐⭐ | 混沌工程+agent容错评估 |
| 4 | AgentChaosBench 诊断 (2608.14680) | ⭐⭐⭐⭐ | 故障定位 + trace脱敏诊断协议 |
| 7 | Ken Huang LLM Inference 2026 Stack | ⭐⭐⭐⭐ | 生产蓝图 + 具体工具链公式 |
分类标签
#agent-reliability #chaos-engineering #harness-engineering #coding-agents #evaluation #observability #llm-inference #fault-injection #ase2026
建议写入路径
/shared/research-kb/inbox/jay/2026-09-02-1050-engineering-filter-harness-chaos-arxiv.md
后续行动建议
-
精读优先级(本周)
- AgentChaos (2608.06790) PDF — 重点看 fault injection pipeline 和 Langfuse 集成方式
- Engineering Reliable Coding Agents (2608.13867) — 配套 GitHub artifactsjarmak/engineering-reliable-coding-agents -
主题页更新建议
-agent-reliability主题页需新增:ReliabilityBench、AgentChaos、harness engineering 定义(Agent=Model+Harness)
-chaos-engineering标签建议合并入agent-reliability -
CSDN 核查
- 本轮无高价值 CSDN 候选(候选条目全为 arXiv/Substack)
- 今日 CSDN 条目需单独审查(已有 2026-09-02 RSS 条目待二次筛选) -
下一步检索
- arXiv: 关注cs.SE/cs.AI近两周新提交,关键词:multi-agent fault、agent observability、LLM agent benchmark
- GitHub trending: 搜索awesome-llm-agent-papers/agent-harness相关仓库
- Papers with Code: 搜索 "AgentChaos" 和 "ReliabilityBench" 的官方实现
本轮是否写入:是 → 已写入 /shared/research-kb/inbox/jay/2026-09-02-1050-engineering-filter-harness-chaos-arxiv.md
GitHub 写入:未执行(本任务规则禁止并发写仓库)
草稿状态:待 Tom 审稿后合并至 review 目录