EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents

  • 类型:arxiv
  • 标识:2609.05903
  • 链接:https://arxiv.org/abs/2609.05903
  • 主分类:evaluation
  • 形态:application
  • 被引:0
  • 被引来源:OpenAlex
  • OpenAlex被引:0
  • TLDR:Large Language Model (LLM) agents are turning language into real-world effects, making safety necessary against both indirect prompt injections and direct harmful requests. System-level safety harnesses add an enforcement layer beyond model-level defenses, but existing harnesses are usually designed once by experts and applied across heterogeneous models and domains. Effective protection is deployment-dependent: models differ in how much enforcement they need before utility declines, while domains differ in the effects, state, and action sequences that must be governed. A harness that is stric
  • OpenAlex ID:W7212001064
  • OpenAlex DOI:10.48550/arxiv.2609.05903
  • DOI:10.48550/arxiv.2609.05903
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://arxiv.org/pdf/2609.05903
  • OpenAlex更新:2026-09-12
  • 副分类:agent
  • 待LLM分类:否
  • 标题中文:EvoSafeHarness:面向 Agent 安全防护的演进式模型与领域专属 Harness
  • TLDR中文:大语言模型(LLM)agent 正将语言转化为现实世界影响,因此必须同时防御间接提示注入与直接有害请求,安全防护不可或缺。系统级安全 harness 在模型级防御之上增加了一层强制执行机制,但现有 harness 通常由专家一次性设计后便通用于异构模型与领域。有效的保护具有部署依赖性:不同模型在效用下降前所能承受的强制程度不同,不同领域在需要被管控的影响、状态与动作序列上也各不相同。过于严苛的 harness……
  • 来源文件
  • /inbox/tom/_candidates/2026-09-11-agent-rag-longcontext-candidates.json
  • [OpenAlex backfill]