date: 2026-08-07 round: R2 arxiv: 2608.05102 arxiv_url: https://arxiv.org/abs/2608.05102 video_kb_script: /shared/video-kb/scripts/tom/2026-08-07_R2_short-video-script.md

1. 标题与观众

标题: ABSeeker · 步骤级信用 目标观众: AI 工程师 / LLM Agent 训练与 RL 实践者 一句话核心观点: 用答案回溯给长程搜索 agent 的每一步发细粒度信用

3. 45-90 秒口播稿

ABC 把"对/错"的二元奖励翻成步骤级稠密监督。 长程搜索 agent 一跑十几步,关键动作只占 2-3 步。 ABSeeker 从标准答案反推"中间线索集",给每步打分。 ABC-SFT 用线索做 teacher forcing。 ABC-GRPO 用线索做组内相对优势。 只靠 8.5k 样本,4B 模型在 BrowseComp 接近 30B。 论文未给官方代码 release,三件套命中 1/3。 训练长程 agent,先看奖励信号是不是步骤级稠密。 如果还是轨迹级二元奖励,这就是 ABC 的切入点。

4. 镜头分镜

镜头 1 · 标题卡

  • 时长: 7s
  • 屏幕文字: ABSeeker · 步骤级信用
  • 画面元素: 论文标题卡 + arXiv ID 2608.05102
  • 运动方式: 标题从中央放大,arXiv ID 副标淡入

镜头 2 · 问题流程卡

  • 时长: 10s
  • 屏幕文字: 30 步里只有 2 步有用
  • 画面元素: 流程图:轨迹 → 答案 → 线索集 → 每步打分
  • 运动方式: 流程节点从左到右展开,箭头依次亮起

镜头 3 · 方法对比卡

  • 时长: 12s
  • 屏幕文字: ABC / ABC-SFT / ABC-GRPO
  • 画面元素: 三方法卡片横向并列对比
  • 运动方式: 卡片从下至上滑入,中间卡片高亮

镜头 4 · 数字矩阵卡

  • 时长: 10s
  • 屏幕文字: 8.5k / 4B / 37.3% → 55.3%
  • 画面元素: 数字矩阵:样本数 / 模型规模 / 评测分数
  • 运动方式: 数字依次跳入,关键分数触发高亮

镜头 5 · 风险限定卡

  • 时长: 10s
  • 屏幕文字: 这五类说法要谨慎
  • 画面元素: 限定语清单:规模有限 / 评测 Gap / 默认 RL 基线 / 对照未做 / context 实现未拆
  • 运动方式: 清单逐行出现,每行配小图标

镜头 6 · 启发等式卡

  • 时长: 8s
  • 屏幕文字: 步骤级监督 = 数据效率优势
  • 画面元素: 等式卡:步骤级监督 → 数据效率优势
  • 运动方式: 等式两端同步亮起

镜头 7 · 行动清单卡

  • 时长: 8s
  • 屏幕文字: 训练长程 agent 先看奖励信号
  • 画面元素: 行动清单:看奖励信号 / 看线索对齐
  • 运动方式: 清单逐项弹出,结尾定格