Inadvertent Context Leakage in Language Models

  • 类型:arxiv
  • 标识:2608.19857
  • 链接:http://arxiv.org/abs/2608.19857v1
  • 主分类:agent
  • 形态:method
  • 被引:0
  • 被引来源:Semantic Scholar
  • S2被引:0
  • 影响力被引:0
  • TLDR:Leakage enables two practical attacks: a trained classifier that infers semantic predicates about user memories from routine natural-language outputs, and an RL-trained adversary that extracts full Social Security Numbers from a production-style agent.
  • 待LLM分类:否
  • 标题中文:语言模型中的非故意上下文泄露
  • TLDR中文:泄露带来两类现实攻击:一个训练好的分类器可从常规自然语言输出中推断用户记忆的语义谓词;一个由 RL 训练的对抗者可从生产级风格的 Agent 中完整提取社会安全号码。
  • 来源文件
  • /inbox/tom/_candidates/2026-08-21-agent-rag-longcontext-candidates.json
  • /inbox/tom/_candidates/2026-08-22-agent-rag-longcontext-candidates.json
  • /inbox/tom/_candidates/2026-08-23-agent-rag-longcontext-candidates.json
  • [S2 enrich]