2607-21051 · Experience Distillation 短视频脚本镜像
日期与轮次:2026-07-25 R1 arXiv 链接:https://arxiv.org/abs/2607.21051 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-07-25_R1_experience-distillation-agent-weight-persistence-short-video-script.md
1. 标题与观众
标题:ED · 把 Agent 经验蒸进模型权重 目标观众:Agent 系统工程师 / RL × LLM 交叉研究者 一句话核心观点:ICL 出 Context 增益就消失,直接 SFT 只剩 3.8%,ED 用 hindsight relabeling 把经验固化进权重,保留至少 64.8%。
3. 45-90 秒口播稿
Agent 在重复任务里几乎不进步,问题不在模型不够强,而在学习方式。
In-Context Learning 能从交互历史中高效学习,可一旦历史退出 Context,增益立刻消失。换成 Direct SFT 把经验直接当训练数据,只保留 3.8% 的 ICL 增益——等于没学。
论文提出 Experience Distillation:不再塞历史进 Context,而是用 hindsight relabeling 把已有轨迹按实际结果重标记,再走 SFT 把知识固化进模型权重。整个过程不额外调用一次环境。
效果:在 749 个 SWE-Bench 任务和 6 个文字冒险游戏里,ED 保留至少 64.8% 的 ICL 增益,而 Direct SFT 只有 3.8%。相比 Classical RL,用 9.6 倍更少的环境样本就追平性能。
今天能带走的:如果你的 Agent 卡在「重复任务却不积累」,先把轨迹持久化到权重而不是 Context。具体三步——保留交互轨迹,按实际结果做经验重标记,在重标记后的轨迹上做监督微调。提醒一句:direct SFT 仅 3.8% 是核心对比点,不可外推为所有任务,工程落地前请在自有轨迹上做小规模验证。
4. 镜头分镜
scene-1 hero · 标题卡(8s)
- 时长:8s
- 屏幕文字:
ED · 把 Agent 经验蒸进模型权重(主标题 12 字) - 画面元素:深色背景 + 主标题大字居中 + 副标题小字 "arXiv 2607.21051 v1 · Sample-Efficient Learning from Agent Experience"
- 运动方式:主标题从下往上滑入,副标题淡入
scene-2 judgment · 三个判断点(8s)
- 时长:8s
- 屏幕文字:卡片一「ICL 出 Context 增益消失」/ 卡片二「Direct SFT 仅 3.8%」/ 卡片三「ED 保留 64.8%」
- 画面元素:三张判断卡横向排列,卡片边框亮起依次高亮
- 运动方式:三卡淡入 + 当前卡边框脉冲放大
scene-3 evidence · 数字证据卡(8s)
- 时长:8s
- 屏幕文字:
64.8%3.8%9.6×7496 - 画面元素:5 个数字圆环并排,圆环底色 = 主分类 cs.CL 蓝
- 运动方式:数字从中心放大弹出,后四个依次延时 0.4s 出现
scene-4 architecture · Pipeline 流程图(8s)
- 时长:8s
- 屏幕文字:
交互 → 重标记 → SFT → 蒸馏后模型 - 画面元素:四节点横向流程图,箭头连接,每个节点配图标(对话 / 循环 / 训练 / 权重)
- 运动方式:流程图从左向右绘制,箭头依次点亮
scene-5 risk · 风险卡三件套(8s)
- 时长:8s
- 屏幕文字:
- 主行
GitHub 0 命中+ 副行无官方仓库(W7) - 主行
主分类 cs.CL+ 副行Agent 学习口径(W11) - 主行
数字 3 件 verbatim+ 副行实验论文路径(W4) - 画面元素:三张风险卡竖排,每卡主行大字 + 副行小字双行排版,边框警示色
- 运动方式:三卡依次滑入,每张停顿 2.5s
scene-6 comparison · 三角对比表(8s)
- 时长:8s
- 屏幕文字:表头
样本效率 / 持久性 / 免额外交互,行ICL 高 ✗ ✗/Direct SFT 高 ✓ ✗/Classical RL 低 ✓ ✓/ED 高 ✓ ✗(注:Classical RL 需额外交互) - 画面元素:2×4 网格表,ED 行用主色高亮
- 运动方式:表格行依次出现,ED 行最后高亮 + 边框脉冲
scene-7 closing · 落版卡(8s)
- 时长:8s
- 屏幕文字:
ED = weight-level persistence·与 runtime context 管理完全不同视角·hindsight relabeling 策略未详细披露 · 工程落地细节待社区验证 - 画面元素:落版卡 + 行动清单点(把轨迹从 Context 升级到权重)
- 运动方式:行动点逐条打勾,字幕层最后一行小字 disclaimer 淡入