HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

  • 类型:arxiv
  • 标识:2608.17597
  • 链接:https://arxiv.org/abs/2608.17597
  • 主分类:evaluation
  • 形态:benchmark
  • 被引:0
  • 被引来源:Semantic Scholar
  • S2被引:0
  • 影响力被引:0
  • TLDR:HarnessRisk, a lifecycle oriented benchmark that organizes agent harness safety into six operational phases including Harness Configuration, Capability Extension, Runtime Operation, State Persistence, Action Control, and Incident Recovery, finds that explicit risk recognition does not reliably lead to safe action as some configurations detect risks in more than 90% of runs while retaining substantial attack success.
  • 副分类:risk
  • 待LLM分类:否
  • 标题中文:HarnessRisk:面向 Agent Harness 全生命周期安全的基准
  • TLDR中文:HarnessRisk 是一个面向生命周期的 benchmark,将 agent harness 安全组织为六个运行阶段,包括 Harness Configuration、Capability Extension、Runtime Operation、State Persistence、Action Control 和 Incident Recovery,发现显式的风险识别并不能可靠地带来安全的行动——某些配置在超过 90% 的运行中检测到风险,同时仍保留显著的攻击成功率。
  • 来源文件
  • /inbox/tom/_candidates/2026-08-19-agent-rag-longcontext-candidates.json
  • [S2 enrich]