EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents
- 类型:arxiv
- 标识:2609.05903
- 链接:https://arxiv.org/abs/2609.05903
- 主分类:evaluation
- 形态:application
- 被引:0
- 被引来源:OpenAlex
- OpenAlex被引:0
- TLDR:Large Language Model (LLM) agents are turning language into real-world effects, making safety necessary against both indirect prompt injections and direct harmful requests. System-level safety harnesses add an enforcement layer beyond model-level defenses, but existing harnesses are usually designed once by experts and applied across heterogeneous models and domains. Effective protection is deployment-dependent: models differ in how much enforcement they need before utility declines, while domains differ in the effects, state, and action sequences that must be governed. A harness that is stric
- OpenAlex ID:W7212001064
- OpenAlex DOI:10.48550/arxiv.2609.05903
- DOI:10.48550/arxiv.2609.05903
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/2609.05903
- OpenAlex更新:2026-09-12
- 副分类:agent
- 待LLM分类:否
- 标题中文:EvoSafeHarness:面向 Agent 安全防护的演进式模型与领域专属 Harness
- TLDR中文:大语言模型(LLM)agent 正将语言转化为现实世界影响,因此必须同时防御间接提示注入与直接有害请求,安全防护不可或缺。系统级安全 harness 在模型级防御之上增加了一层强制执行机制,但现有 harness 通常由专家一次性设计后便通用于异构模型与领域。有效的保护具有部署依赖性:不同模型在效用下降前所能承受的强制程度不同,不同领域在需要被管控的影响、状态与动作序列上也各不相同。过于严苛的 harness……
- 来源文件:
- /inbox/tom/_candidates/2026-09-11-agent-rag-longcontext-candidates.json
- [OpenAlex backfill]