越流行越难遗忘:面向 LLM 遗忘的自适应流行度方法 AdaPop
- 关联论文:2608.14229
- 作者:flyP
- 更新:2026-08-21
一句话结论
AdaPop 把 LLM 遗忘(unlearning)的梯度强度改成与"事实流行度"挂钩的自适应形式:流行事实(被预训练高频重复的实体)会被分配更大的遗忘指数,同时一个 dual-ascent 控制器每 epoch 自动调整"保留集"惩罚,使遗忘-保留平衡不再依赖人工调参。
解决什么真问题
LLM 遗忘最近从合规需求(GDPR / CCPA 删除权)下沉到工程现实——一旦模型上线,开发者会反复面对「让模型忘掉一段事实、同时不能丢掉其它能力」的双目标压力。现有 SOTA 路径(NPO、GradDiff、PMU 等)几乎都用统一的梯度压力:每条 forget 样本一视同仁,按相同的权重去推离原参数。
论文点出一个被忽视但日常可见的不对称:预训练时高频出现的事实在模型内部被"嵌得更深"——它们出现的 token 跨度更长、激活更稳、被更多下游任务依赖。论文用"popular facts are memorised more deeply during pretraining and resist removal longer than rare ones" 直接陈述这一观察(来自论文摘要),并把它落到形式化损失函数里。如果用统一遗忘压力,流行事实要么没被擦掉(评估时仍能泄露),要么被擦过头(连带破坏 retain 集能力)。
核心方法
AdaPop 由三块组成:流行度估计、局部 token 置信度、以及 dual-ascent 控制器。三者合在一张目标函数里,对每条 forget 样本做 per-fact 自适应权重。
1) 流行度代理(popularity proxy)
AdaPop 接受一个外部流行度信号 pop(f),对每条 forget 样本 f 计算一个标量。论文给出的两种工程化代理:
- Wikidata sitelinks:用实体在 Wikidata 上的入站链接数作为流行度(覆盖人物/地点/事件类硬事实最稳)。
- LLM-as-Judge:用一个 LLM 给 forget 样本打 1–5 流行度分(适合 Wikidata 覆盖不到的私有事实)。
⚠️ Wikidata sitelinks 的偏向(英文条目远多于非英文;流行度会随时间漂移)原文未明确给出量化偏差;LLM-as-Judge 与人类标注的一致率原文未明确。
2) 自适应指数(popularity-dependent exponent)
AdaPop 在标准 NPO 类遗忘损失上插入一个 per-fact 指数 α(pop(f)):
L_forget(f) = -α(pop(f)) * E[ log σ(-h_θ(f) / τ) ]
L_retain(g) = λ * L_NLL(g)
h_θ(f):模型对 forget 样本f当前的对数几率(越大代表模型越"记得")。α(pop(f)):随流行度单调递增的指数,流行事实 → 更大梯度。λ:retain 惩罚系数,由 dual-ascent 控制器自动调节。
伪代码示意(不依赖具体可导入包):
for epoch in range(E):
forget_batch, retain_batch = sample(d_forget), sample(d_retain)
pop = popularity_proxy(forget_batch) # Wikidata / LLM-as-Judge
alpha = alpha_schedule(pop) # 单调递增映射
loss_forget = adaptive_npo(forget_batch, alpha, tau)
loss_retain = lambda_t * nll(retain_batch)
loss = loss_forget + loss_retain
step(loss)
# dual-ascent controller: 根据 retain 性能调节 λ
if retain_metric < retain_target:
lambda_t = lambda_t * (1 + eta_up) # 加大保留压力
elif retain_metric > retain_target * margin:
lambda_t = lambda_t * (1 - eta_down) # 减小保留压力
⚠️
α_schedule的具体形式(线性 / 多项式 / sigmoid)原文未明确;只描述了「单调递增依赖流行度」。
3) Dual-ascent 控制器
传统 unlearning 需要手动 sweep λ 才能找到"既忘得干净、又不塌 retain"的平衡点。AdaPop 引入 dual-ascent:在每个 epoch 结束后观察 retain 集的指标(如 retain 困惑度 / 通用 QA 准确率),并按规则调整 λ,把人工 sweep 替换为在线自适应。论文把这个控制器描述为"automates the forget-retain balance via a dual-ascent controller that adjusts the retain penalty each epoch"。
关键实验与数据
论文在三类模型系列、两个基准上做评估。摘要里直接可核验的两个数字:
- 在 paraphrase 查询下:AdaPop 的"被遗忘内容泄露量"比 competing methods 减少约 5×。
- 在 adversarial reformulation 查询下:减少约 1.6×。
论文内部度量(用于佐证机制成立):
- forget-set hidden states 在 AdaPop 下距离 pre-unlearning 模型更远,说明被推得更干净。
- retain-set 表征仍接近原模型,说明保留能力没被破坏。
⚠️ 摘要未列出具体模型名/规模、基准名(如 TOFU / WMDP 等)、评估集大小与硬件条件——这些细节在 PDF 正文里,但本解读只读公开 abstract,未深入到正文表格。读者若要做复现需打开 PDF §5 实验段。
亮点与局限
亮点:
- 把"流行度"从一个含糊直觉变成损失函数里的具体指数,把 unlearning 从"统一擦"升级为"按记忆深度擦"。
- dual-ascent 控制器消除了人工 sweep
λ的成本,使方法在工程上更接近"开箱即用"。 - 在内部度量上同时验证了 forget 推得远、retain 推得近,证明方向正确而不是靠"塌 retain 来作弊"。
局限:
- 流行度代理有偏向:Wikidata sitelinks 严重偏向英文条目与历史悠久条目;LLM-as-Judge 会引入 judge 模型的偏置。
- 摘要只报 5× / 1.6× 两个比值,绝对数字(如 forget 集成功率、retain 集退化幅度)原文未明确给出。
- 双控制器对 retain 目标值的选择是新的超参;论文没说"目标值如何自动定"。
- 摘要未涉及MIA(成员推断攻击)评测——unlearning 评估需要 MIA 才完整。
对工程落地的启发
- 删权合规:做 RAG / 个人助理时遇到 GDPR 删除请求,先用 Wikidata sitelinks 或 LLM-as-Judge 给要删的事实打流行度分,再上 AdaPop,比统一 NPO 在遗忘质量上更有保障(流行内容不再被统一梯度漏掉)。
- 数据净化:准备新版本模型要抹掉某批训练语料(例如撤稿论文、被误标的版权内容),用 AdaPop 可以更彻底地处理高频重复的硬事实,但需要额外维护流行度信号管道。
- 可调阀门:dual-ascent 控制器的 retain 目标值可以接到业务 SLA 上(如"通用 QA 准确率掉不超过 X%"),实现自动平衡。
与同方向工作的关系
- 属于 LLM unlearning 谱系,与 NPO(Negative Preference Optimization)、GradDiff、PMU、Task Vector 等方法同源。
- 与 TOFU、WMDP、MUSE 等 benchmark 直接对接——这些 benchmark 设计 forget/retain split,AdaPop 拿来即用。
- 与"membership inference / 隐私审计"形成互补:AdaPop 让 forget 更彻底,但审计侧仍需 MIA 来证实。
- 与"selective forgetting / 概念编辑"(ROME、MEMIT、Knowledge Neurons)的关系:AdaPop 走梯度路径而非定位-编辑路径,更适合大批量事实批量遗忘;概念编辑更适合少量关键事实的精确修改。
适合谁读
- 做 LLM 合规 / 数据治理的工程师:评估 AdaPop 是否能替代当前的 NPO 流程。
- LLM 安全 / 隐私研究人员:理解"流行度依赖遗忘"这个新轴如何打开研究方向。
- 模型运维 / MLOps:把 dual-ascent 控制器的思路迁移到"防止灾难性遗忘"的 retain 平衡里。
- 不适合:只想做单条事实精确编辑的(用 ROME / MEMIT 更合适);以及想要可证明遗忘保证的(unlearning 目前都没有严格可证明的形式保证)。
工程落地与核查(Jay)
事实核查
| 核查项 | 结论 | 评估 |
|---|---|---|
| "越流行越难遗忘"核心假设 | 原文摘要:"popular facts are memorised more deeply during pretraining and resist removal longer than rare ones" | ✅ 准确 |
| α(pop(f)) 随流行度单调递增 | 原文:"a popularity-dependent exponent" | ✅ 准确 |
| dual-ascent 控制器自动调节 λ | 原文:"automates the forget-retain balance via a dual-ascent controller" | ✅ 准确 |
| 5× / 1.6× 遗忘泄露减少 | 原文摘要给出这两个比值(paraphrase / adversarial reformulation 查询) | ✅ 准确 |
| forget 集 hidden states 距离更远 | 原文内部度量,验证机制 | ✅ 有原文支持 |
| retain 集表征接近原模型 | 原文内部度量,验证机制 | ✅ 有原文支持 |
| Wikidata sitelinks / LLM-as-Judge 两种代理 | 原文明确提出两种 popularity proxy | ✅ 准确 |
| 特定模型规模/基准名称 | ⚠️ 原文摘要未给出具体模型规模(1B/7B 等);解读件未虚构,标注为"需查正文" | ✅ 无虚构 |
| 绝对数字(成功率/退化幅度) | ⚠️ 原文摘要只给 5×/1.6× 比值,无绝对百分比;解读件如实标注 | ✅ 无虚构 |
| MIA 评测覆盖 | ⚠️ 原文摘要未涉及 MIA;解读件局限节已如实标注 | ✅ 已标注 |
| "比统一 NPO 快得多" | ❌ 原文字面比较的是遗忘质量(5× 泄露减少),非训练/推理速度;原文无速度对比结论 | ⚠️ 需修正(已修正:改为"在遗忘质量上更有保障") |
实际系统怎么用
适用场景判断:AdaPop 适合有多样化流行度遗忘需求 + 有 Wikidata 或等效流行度信号的团队。若只需删除单条精确事实,ROME/MEMIT 更合适。
工程集成路径:
输入:需要遗忘的事实集(forget set)+ 需保留的能力集(retain set)
│
▼
Step 1:流行度信号构建
├─ 公共事实 → Wikidata sitelinks(API 批量拉取,筛选 pop(f) > 阈值)
└─ 私有事实 → LLM-as-Judge 打分(prompt engineering 确保一致性)
│
▼
Step 2:AdaPop 遗忘训练(基于 NPO 类损失 + α(pop(f)) 指数)
├─ α_schedule:单调递增,可从线性开始调
└─ dual-ascent:设 retain 目标值(SLA),在线调节 λ
│
▼
Step 3:MIA 验证(建议额外跑 membership inference attack 确认遗忘彻底性)
主要坑位:
-
Wikidata 偏向放大流行事实偏差:英文/历史实体 sitelinks 数远高于非英文/当代实体,用作流行度信号会系统性高估前者。工程上建议对 sitelinks 做语言/时间标准化(如除以该语言/该年代条目总数),而非直接用原始链接数。
-
LLM-as-Judge 一致性问题:不同 LLM 版本对"流行"的判断差异大,且 1-5 分的边界本身主观。工程上建议至少用 3 个不同模型做投票,并用人工标注子集做校准。
-
α_schedule 形式对结果影响大但原文未明确:线性 vs sigmoid 可能在尾部产生截然不同的梯度。复现时建议从线性开始,逐步加非线性做 ablation——尤其是高流行度区间的梯度是否需要 cap。
-
dual-ascent 控制器收敛稳定性:η_up / η_down 参数若设置不当,λ 可能在 retain 指标附近震荡。工程建议加入 momentum 或 pipelined smoothing,而非每 epoch 纯暴力调节。
-
retain 目标值如何定是新的超参调优问题:原文未给出自动方案。实践中建议先用 baseline NPO sweep 一次找到可接受 retain 退化上限,以此作为 AdaPop dual-ascent 的 retain_target。
-
MIA 评测缺失是安全合规盲点:AdaPop 在 forgetting 质量上优于竞品,但无 MIA 数据意味着无法向监管机构证明"已充分遗忘"。建议在 AdaPop 基础上补充 LiRA 或其他 MIA 工具做验证。
是否值得上线:
| 维度 | 评估 |
|---|---|
| 成熟度 | 中低(仅 abstract 验证,具体模型规模/基准未公开) |
| 上线价值 | 适合研究级合规落地;生产需先跑通正文实验数字 |
| ROI | 高,尤其在多事实批量遗忘场景(vs 逐条 ROME 编辑) |
| 跟进建议 | 等 PDF 正文公开后核验 5×/1.6× 绝对数字;关注 TOFU/WMDP 上的 SOTA 更新 |