2607-21051 · Experience Distillation 短视频脚本镜像

日期与轮次:2026-07-25 R1 arXiv 链接:https://arxiv.org/abs/2607.21051 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-07-25_R1_experience-distillation-agent-weight-persistence-short-video-script.md

1. 标题与观众

标题:ED · 把 Agent 经验蒸进模型权重 目标观众:Agent 系统工程师 / RL × LLM 交叉研究者 一句话核心观点:ICL 出 Context 增益就消失,直接 SFT 只剩 3.8%,ED 用 hindsight relabeling 把经验固化进权重,保留至少 64.8%。

3. 45-90 秒口播稿

Agent 在重复任务里几乎不进步,问题不在模型不够强,而在学习方式。

In-Context Learning 能从交互历史中高效学习,可一旦历史退出 Context,增益立刻消失。换成 Direct SFT 把经验直接当训练数据,只保留 3.8% 的 ICL 增益——等于没学。

论文提出 Experience Distillation:不再塞历史进 Context,而是用 hindsight relabeling 把已有轨迹按实际结果重标记,再走 SFT 把知识固化进模型权重。整个过程不额外调用一次环境。

效果:在 749 个 SWE-Bench 任务和 6 个文字冒险游戏里,ED 保留至少 64.8% 的 ICL 增益,而 Direct SFT 只有 3.8%。相比 Classical RL,用 9.6 倍更少的环境样本就追平性能。

今天能带走的:如果你的 Agent 卡在「重复任务却不积累」,先把轨迹持久化到权重而不是 Context。具体三步——保留交互轨迹,按实际结果做经验重标记,在重标记后的轨迹上做监督微调。提醒一句:direct SFT 仅 3.8% 是核心对比点,不可外推为所有任务,工程落地前请在自有轨迹上做小规模验证。

4. 镜头分镜

scene-1 hero · 标题卡(8s)

  • 时长:8s
  • 屏幕文字:ED · 把 Agent 经验蒸进模型权重(主标题 12 字)
  • 画面元素:深色背景 + 主标题大字居中 + 副标题小字 "arXiv 2607.21051 v1 · Sample-Efficient Learning from Agent Experience"
  • 运动方式:主标题从下往上滑入,副标题淡入

scene-2 judgment · 三个判断点(8s)

  • 时长:8s
  • 屏幕文字:卡片一「ICL 出 Context 增益消失」/ 卡片二「Direct SFT 仅 3.8%」/ 卡片三「ED 保留 64.8%」
  • 画面元素:三张判断卡横向排列,卡片边框亮起依次高亮
  • 运动方式:三卡淡入 + 当前卡边框脉冲放大

scene-3 evidence · 数字证据卡(8s)

  • 时长:8s
  • 屏幕文字:64.8% 3.8% 9.6× 749 6
  • 画面元素:5 个数字圆环并排,圆环底色 = 主分类 cs.CL 蓝
  • 运动方式:数字从中心放大弹出,后四个依次延时 0.4s 出现

scene-4 architecture · Pipeline 流程图(8s)

  • 时长:8s
  • 屏幕文字:交互 → 重标记 → SFT → 蒸馏后模型
  • 画面元素:四节点横向流程图,箭头连接,每个节点配图标(对话 / 循环 / 训练 / 权重)
  • 运动方式:流程图从左向右绘制,箭头依次点亮

scene-5 risk · 风险卡三件套(8s)

  • 时长:8s
  • 屏幕文字:
  • 主行 GitHub 0 命中 + 副行 无官方仓库(W7)
  • 主行 主分类 cs.CL + 副行 Agent 学习口径(W11)
  • 主行 数字 3 件 verbatim + 副行 实验论文路径(W4)
  • 画面元素:三张风险卡竖排,每卡主行大字 + 副行小字双行排版,边框警示色
  • 运动方式:三卡依次滑入,每张停顿 2.5s

scene-6 comparison · 三角对比表(8s)

  • 时长:8s
  • 屏幕文字:表头 样本效率 / 持久性 / 免额外交互,行 ICL 高 ✗ ✗ / Direct SFT 高 ✓ ✗ / Classical RL 低 ✓ ✓ / ED 高 ✓ ✗(注:Classical RL 需额外交互)
  • 画面元素:2×4 网格表,ED 行用主色高亮
  • 运动方式:表格行依次出现,ED 行最后高亮 + 边框脉冲

scene-7 closing · 落版卡(8s)

  • 时长:8s
  • 屏幕文字:ED = weight-level persistence · 与 runtime context 管理完全不同视角 · hindsight relabeling 策略未详细披露 · 工程落地细节待社区验证
  • 画面元素:落版卡 + 行动清单点(把轨迹从 Context 升级到权重)
  • 运动方式:行动点逐条打勾,字幕层最后一行小字 disclaimer 淡入