SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
- 类型:arxiv
- 标识:2608.21500
- 链接:https://arxiv.org/abs/2608.21500
- 主分类:agent
- 形态:method
- 被引:5
- 被引来源:Semantic Scholar
- S2被引:5
- OpenAlex被引:0
- 影响力被引:1
- TLDR:This paper proposes Secure On-Policy Distillation (SecOPD) that provides token-level feedback to guide defensive fine-tuning, and generalizes to domains completely unseen in training.
- OpenAlex ID:W7204194015
- OpenAlex DOI:10.48550/arxiv.2608.21500
- DOI:10.48550/arxiv.2608.21500
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://arxiv.org/pdf/2608.21500
- OpenAlex更新:2026-09-01
- 待LLM分类:否
- 标题中文:SecOPD:通过 On-Policy Distillation 缓解自适应 Prompt 注入
- TLDR中文:本文提出 Secure On-Policy Distillation (SecOPD),提供 token 级反馈以指导防御性微调,并能泛化到训练中完全未见过的领域。
- 来源文件:
- /inbox/tom/_candidates/2026-08-27-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]