工程筛选草稿 · 2026-09-02 · Jay

主题

Harness Engineering / Agent Chaos Engineering / Coding Agent 可靠性工程


检索范围

渠道 关键词 时间
Tavily LLM agent engineering harness reliability 2026 近一月
Tavily AgentChaos reliability benchmark arxiv 2026 近一月
Tavily Substack AI engineering production agent 近一月
arXiv cs.AI/cs.SE (关键词驱动 + 列表扫描) 近一月

候选条目(7条)

1. AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection

  • 来源: arXiv ASE 2026 (2608.06790)
  • URL: https://arxiv.org/abs/2608.06790
  • 核心观点: 多边界故障注入框架(tool/LLM/guardrail/agent/inter-agent),在 Langfuse 分布式追踪下做无标签故障诊断。Benchmark 为 AgentChaosBench,覆盖 4 框架 × 多故障类型。
  • 工程价值: ⭐⭐⭐⭐⭐
    真实复现了生产中多框架多 agent 系统的跨边界故障场景,含程序化注入 Pipeline,有工具链(Langfuse)和评分协议。保留。
  • 可复现性: 高 — 提供了 artifact 和 pipeline,工具链清晰

2. Engineering Reliable Coding Agents: Evaluating and Operating the System Around the Model

  • 来源: arXiv cs.SE (2608.13867),314 页工程专论
  • URL: https://arxiv.org/abs/2608.13867
  • 核心观点: 重新定义 coding agent 可靠性 = 每次解决 issue 的同时,留下可审查、可维护、可扩展的 diff,而非仅通过测试。强调 harness 工程(上下文管理/工具权限/观测/反馈闭环)。
  • 工程价值: ⭐⭐⭐⭐⭐
    配套 206 条可靠性记录和可运行协议。极高价值 — 必读。
  • 可复现性: 高 — 配套 GitHub 仓库 sjarmak/engineering-reliable-coding-agents

3. ReliabilityBench: Evaluating LLM Agent Reliability Under Production-Like Stress Conditions

  • 来源: arXiv (2601.06112)
  • 核心观点: 在扰动和工具故障注入下评估 agent 一致性、鲁棒性和容错性。与 AgentChaos 互补。
  • 工程价值: ⭐⭐⭐⭐
    混沌工程方法论在 LLM agent 领域的系统化落地。保留。

4. When Agentic Executions Fail: Detecting and Localizing (AgentChaosBench 配套)

  • 来源: arXiv (2608.14680)
  • 核心观点: 跨异构边界的故障定位,trace 脱敏后诊断评分预测。
  • 工程价值: ⭐⭐⭐⭐
    与 AgentChaos 成套,实用性强。保留。

5. Towards Risk-free AI Agent Deployment

  • 来源: arXiv (2608.16411)
  • 核心观点: 覆盖 MCP 工具描述气味、SE-agent 自演化、AgentRx 失败轨迹诊断等多个子方向。
  • 工程价值: ⭐⭐⭐
    宽泛综述,缺乏单一突出亮点。降级保留:参考价值一般。

6. Harness Engineering — "只有 5% 的企业 AI agent 真正到达生产环境"

  • 来源: Aishwarya Srinivasan Substack (Paid)
  • URL: https://aishwaryasrinivasan.substack.com/p/all-you-need-to-know-about-harness
  • 核心观点: 95% agent 死于原型;真正的工程量在 harness(上下文编排、工具权限、治理边界、评估观测)。Agent = Model + Harness(引用 Mitchell Hashimoto 2026 年定义)。
  • 工程价值: ⭐⭐⭐
    观点聚合,统计数字缺乏原始引用。作为工程趋势背景参考,不深度引用正文。

7. The Physics & Engineering of Frontier LLM Inference (Substack 10-part series)

  • 来源: Ken Huang Substack
  • URL: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
  • 核心观点: 2026 推理架构蓝图:API Gateway / Semantic Router / Disaggregated P-D Nodes / XGrammar FSM 约束解码 / Edge SLM 部署(DeepSeek-V4 / Llama-3.2 / Phi-4)。
  • 工程价值: ⭐⭐⭐⭐
    生产蓝图视角,有 TCO/GPU 计数数学公式和具体工具链。保留 — 推理基础设施参考。

高价值条目(筛选结论)

# 条目 价值 理由
1 AgentChaos (ASE 2026) ⭐⭐⭐⭐⭐ 多边界故障注入Benchmark + Langfuse追踪,有artifact
2 Engineering Reliable Coding Agents (314p) ⭐⭐⭐⭐⭐ 重新定义coding agent可靠性,206条可靠性记录
3 ReliabilityBench ⭐⭐⭐⭐ 混沌工程+agent容错评估
4 AgentChaosBench 诊断 (2608.14680) ⭐⭐⭐⭐ 故障定位 + trace脱敏诊断协议
7 Ken Huang LLM Inference 2026 Stack ⭐⭐⭐⭐ 生产蓝图 + 具体工具链公式

分类标签

#agent-reliability #chaos-engineering #harness-engineering #coding-agents #evaluation #observability #llm-inference #fault-injection #ase2026


建议写入路径

/shared/research-kb/inbox/jay/2026-09-02-1050-engineering-filter-harness-chaos-arxiv.md

后续行动建议

  1. 精读优先级(本周)
    - AgentChaos (2608.06790) PDF — 重点看 fault injection pipeline 和 Langfuse 集成方式
    - Engineering Reliable Coding Agents (2608.13867) — 配套 GitHub artifact sjarmak/engineering-reliable-coding-agents

  2. 主题页更新建议
    - agent-reliability 主题页需新增:ReliabilityBench、AgentChaos、harness engineering 定义(Agent=Model+Harness)
    - chaos-engineering 标签建议合并入 agent-reliability

  3. CSDN 核查
    - 本轮无高价值 CSDN 候选(候选条目全为 arXiv/Substack)
    - 今日 CSDN 条目需单独审查(已有 2026-09-02 RSS 条目待二次筛选)

  4. 下一步检索
    - arXiv: 关注 cs.SE / cs.AI 近两周新提交,关键词:multi-agent fault、agent observability、LLM agent benchmark
    - GitHub trending: 搜索 awesome-llm-agent-papers / agent-harness 相关仓库
    - Papers with Code: 搜索 "AgentChaos" 和 "ReliabilityBench" 的官方实现


本轮是否写入 → 已写入 /shared/research-kb/inbox/jay/2026-09-02-1050-engineering-filter-harness-chaos-arxiv.md
GitHub 写入:未执行(本任务规则禁止并发写仓库)
草稿状态:待 Tom 审稿后合并至 review 目录