- 日期:2026-07-19 R2
- arxiv 链接:https://arxiv.org/abs/2603.21972
- video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-07-19_R2_agent-star-rl-recipe-long-horizon-short-video-script.md
1. 标题与观众
标题:Agent-STAR · 5 维配方 目标观众:AI 工程师 / RL 后训练研究员 一句话核心观点:agentic RL 训不动,先去查 5 维正交轴里哪一格把信号吃了。
3. 45-90 秒口播稿
【钩子 — 0–8s】 训 agent,reward 不涨?先别换算法。
【机制 — 8–35s】 arXiv 2603.21972 拆 agentic RL 为 5 维:奖励、规模、数据、算法、环境。小模型偏爱 staged rewards,大模型偏爱 simple dense rewards,~1K 样本是甜点。
【行业对照 — 35–60s】 摘要自报 TravelPlanner SOTA,baseline 列表未给。flyP 反方指出缺 rollout infrastructure · 跨议题限定语。
【行动 — 60–82s】 先查 5 维:reward staged 还是 dense?数据 1K 还是 100K?再换算法。
4. 镜头分镜
分镜 1 · hero title(8s)
- 屏幕文字:Agent-STAR · 5 维配方(13 字符)
- 画面元素:深蓝底色 + 中央大字标题 + 右下角小字「arXiv 2603.21972 · Xixi Wu et al.」
- 运动方式:标题淡入,小字同步出现
- 节奏:静,留 0.5s 给眼睛捕获文字
分镜 2 · 三个判断点(10s)
- 屏幕文字(三行):5 维正交 vs 5×N 矩阵 / scale-dependent reward / 1K 样本甜点
- 画面元素:三行卡片,左对齐编号,蓝白灰冷色调
- 运动方式:从左到右依次滑入,每行 0.3s
分镜 3 · 5 维设计空间图解(14s)
- 屏幕文字(中心大字 + 五轴环绕):reward shaping / model scaling / data composition / algorithm selection / environmental stability
- 画面元素:中心「5 axes」+ 五轴放射状排列,每个轴一个色块标签,横轴 = 模型规模 / 纵轴 = reward 类型
- 运动方式:中心字先出现,五轴依次向外展开
分镜 4 · 7 大关键发现卡片(12s)
- 屏幕文字(三行要点 + 限定语小字):
- 小模型:staged rewards + exploration
- 大模型:simple dense rewards + GRPO
- 1K 样本 + 平衡难度 = 甜点
- 小字「摘要明示 3 条 · 剩余 4 条待 v1 全文」
- 画面元素:三行要点垂直排列,限定语小字居中
- 运动方式:三要点自上而下逐行出现,限定语最后浮现
分镜 5 · 证据卡 —— TravelPlanner SOTA + 自报限定语(10s)
- 屏幕文字(双行排版):
- 大字:TravelPlanner SOTA
- 小字:significantly outperforming leading LLMs · 自报 · baseline 列表未给
- 画面元素:浅灰卡片底,深蓝大字,小字居中
- 运动方式:整段文字一次性浮现,大字先出,小字延迟 0.5s
分镜 6 · 风险卡 —— W11/W12/W4 限定语(10s)
- 屏幕文字(三条限定语,双行排版):
- W11:arXiv v1 2026-03-23 · OpenReview 未进
- W12:TravelPlanner 单一 benchmark · SWE-bench 未实测
- W4:5 维 controlled experiments 摘要未展开
- 画面元素:三行卡片,左竖排编号徽标,右对应中文小字
- 运动方式:三条自上而下依次出现,每条 0.3s
分镜 7 · 三问行动清单(8s)
- 屏幕文字(三问):
- 你的 reward 是 staged 还是 dense?
- 你的数据是 1K 平衡还是 100K 堆量?
- 你的环境稳定性实测过吗?
- 画面元素:三行加粗问句 + 底部小字「arXiv 2603.21972 verbatim 限定语 + 论文 abstract 原话 标识」
- 运动方式:三问自上而下逐字出现,落点强调