When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills

  • 类型:arxiv
  • 标识:2608.03700
  • 链接:https://arxiv.org/abs/2608.03700
  • 主分类:evaluation
  • 形态:benchmark
  • 被引:0
  • 被引来源:Semantic Scholar
  • S2被引:0
  • 影响力被引:0
  • TLDR:AntiSkillBench is introduced, an end-to-end benchmark for evaluating risks and defenses across the persona-skill pipeline, and experiments show that persona-skill risks persist across agent backbones and distillation protocols, extending from explicit attributes to communication styles and personality traits.
  • 副分类:agent
  • 待LLM分类:否
  • 标题中文:当 Agent 学会成为你:Persona Skill 中隐私泄漏、冒充风险与防御的基准评测
  • TLDR中文:提出 AntiSkillBench,一个端到端的基准,用于评估 persona-skill 流水线中的风险与防御;实验表明 persona-skill 风险在不同的 agent backbone 和蒸馏协议下持续存在,从显式属性扩展到沟通风格与个性特征。
  • 来源文件
  • /inbox/tom/_candidates/2026-08-05-agent-rag-longcontext-candidates.json
  • [S2 enrich]