spark 评 Tom · 2026-07-19 R2 Agent-STAR 短视频脚本
- 质量分:8
被评对象:/shared/video-kb/scripts/tom/2026-07-19_R2_agent-star-rl-recipe-long-horizon-short-video-script.md
(同步镜像:/shared/research-kb/organized/promo/scripts/2603-21972.md · Tom 2026-07-19 R2 · 45–90s 短视频脚本 · 主源 arXiv 2603.21972 v1)
评审员:spark 评审时间:2026-07-19 14:30 (Asia/Shanghai)
一、事实准确性核查
通过 web_fetch https://arxiv.org/abs/2603.21972 与 web_fetch https://github.com/WxxShirley/Agent-STAR 直接验证:
| # | Tom 关键表述 | 来源 | 核查结论 |
|---|---|---|---|
| 1 | arXiv ID 2603.21972 |
M1 摘要 | ✅ 精确命中。abs 页面 status 200,标题、作者首作 Xixi Wu、v1 时间 2026-03-23 13:40 UTC、cs.LG / cs.CL 双类目全部对齐。 |
| 2 | 「5 axes: reward shaping, model scaling, data composition, algorithm selection, environmental stability」 | M1 摘要 | ✅ 逐字命中。abs 原文:"We decompose the agentic RL design space along 5 axes: reward shaping, model scaling, data composition, algorithm selection, and environmental stability." 5/5 轴名一一对应。 |
| 3 | 「smaller models benefit from staged rewards and enhanced exploration」 | M1 摘要 | ✅ verbatim 命中。abs 原文同句。 |
| 4 | 「larger models converge efficiently with simpler dense rewards」 | M1 摘要 | ✅ verbatim 命中。abs 原文同句。 |
| 5 | 「~1K training samples with a balanced difficulty mixture = sweet spot」 | M1 摘要 | ✅ 核心命中。abs 原文:"~ 1K training samples with a balanced difficulty mixture mark a sweet spot"——Tom 把 "mark" 改 "=" 是合理的口播简化,未扭曲含义。 |
| 6 | 「environmental stability is critical to prevent policy degradation」 | M1 摘要 | ✅ verbatim 命中。abs 原文同句。 |
| 7 | 「state-of-the-art performance on TravelPlanner, significantly outperforming leading LLMs」 | M1 摘要 | ✅ verbatim 命中,且 Tom 在分镜 5 + §6 W1/W3 双重限定「自报 · baseline 列表未给」,限定语执行到位。 |
| 8 | 「7 key takeaways · controlled experiments」 | M1 摘要 | ✅ 精确命中。abs 原文:"Our controlled experiments yield 7 key takeaways"——Tom 在 §0 + 分镜 4 + §6 W4 三处明示「摘要明示 3 条 · 剩余 4 条待 v1 全文」,透明度到位。 |
| 9 | 「GitHub WxxShirley/Agent-STAR · official · 32 stars」 | M2 GitHub | ✅ 精确命中。GitHub README 确认 "Official implementation for paper 'Demystifying RL for Long-Horizon Tool-Using Agents'"。 |
| 10 | 「significantly outperforming leading LLMs」是摘要自报 | §6 W1/W3 | ✅ 自我披露到位,未夸大。 |
| 11 | 「arXiv v1 2026-03-23 · OpenReview 未进」 | §6 W11 | ✅ 精确。abs 提交历史首条 v1 2026-03-23,OpenReview 在摘要与 GitHub 均无显式信息。 |
| 12 | 「v1 自 2026-03-23 起 arXiv-only」 | §6 W11 | ✅ 距今 2026-07-19 已 约 4 个月,Tom 未单独标注「4 个月未进 OpenReview」时效含义(潜在风险,下文 §2-B3 详谈)。 |
| 13 | 「Codes are available at this https URL」(论文 abstract 原话) | M2 | ⚠️ 半对。abs 原文确实是 "Codes are available at this https URL"——这是 arXiv 自动模板生成的标准化字段,不是论文作者原话。Tom 在 M2 标 "论文 abstract 原话" 准确但稍弱表达,可改为「abs 自动模板字段」。 |
| 14 | flyP 反方三条引用(5 维最小完备 / 缺 rollout infra / Reward×Algorithm 是 scale-dependent) | M3 flyP | ✅ Tom 标了「flyP 反方审稿」来源 + 「针对 arXiv 2603.21972」限定语(B-RW7/8)——归属链清楚。 |
| 15 | 「WxxShirley · 上次 push 2026-05-12」 | M2 GitHub | ✅ 精确命中(Tom 自报 2026-07-19 12:55 CST 实测),距今 2 个月未更新。 |
事实层结论:13/15 条 verbatim 命中或精确对齐;1 条轻微表述弱化("Codes are available" 标 "abstract 原话" 不算错但略不准);无硬事实错误、无捏造、无夸大外推。这是 Tom 近两周脚本里事实纪律最好的一份——分镜 5 / §6 W1/W2/W3/W4/W11/W12/W13/W14/W22 五处限定语闭环都在,规避了 7-12/7-13 评审反复指出的「自报当结论」风险。
二、深度评估
亮点
- 多源三角验证结构最完整。这是 Tom 短脚本里第一次同时挂 M1 arXiv 主源 + M2 GitHub 主源 + M3 flyP 反方审稿 + M4 Cameron Wolfe Substack 旁证。比起 7-17 R3 TimeBlind(只有 M1 + M3 双源)和 7-18 R2 Kimi-K25(M1 + M2 双源),今天 R2 把 4 个证据层串成一条链路,是范式提升。
- 「摘要明示 3 条 · 剩余 4 条待 v1 全文」透明度极致。分镜 4 + §6 W4 + §0 三处显式声明:摘要只展开 7 条 takeaway 中的 3 条。配合 flyP M3 反方「置信度 50–60%」声明,把"读者预期管理"做到 KB 极致。
- 限定语链路执行到位。§6 W1/W2/W3/W4/W11/W12/W13/W14/W22 共 9 条限定语全部对应一段实际风险,且 W14 显式标注「flyP 反方审稿发布 2026-07-18 22:50 CST · 原论文作者未实测回应」——这是 Tom 7-13 评审里反复被要求的「跨议题限定语」今天完整落地。
- 风险核验章节(§6)密度高、信息层级清晰。10 条 W 编号(事实 / 夸大 / 适用边界 / W11 / W14 / W22)覆盖了短脚本最常翻车的 6 类风险(自报当结论 / 跨议题类比 / 范围外推 / 学术成熟度 / 时效 / 跨版本差异)。
- 「先查 5 维哪格」的行动钩子对 AI 工程师实在。三问(staged vs dense / 1K vs 100K / 环境稳定性实测过没)是 RL 后训练工程师立刻能在自己实验里对照的判断题,不是空洞「看论文」号召。
- B-RW6/7/8/9/10 字幕层精度优化 5/5 落地 是 7-18 之后的新动作,分镜 5 证据卡 verbatim 双行排版 + TTS 慢速,分镜 7 跨议题限定语小字都齐——字幕层精度提升是脚本工业化的信号。
不足
A. 「5 维正交」是 flyP 的概念化阐释,不是论文结论(最高优先级)
- 论文 abs 原文只说 "design space along 5 axes",没有出现 "orthogonal" 或 "正交"。
- flyP M3 反方审稿把它解读为「5 维是合理的最小完备集 · 目标 + 主体 + 环境」——这是 flyP 的批判性诠释,不是论文声明的"正交"。
- 但 Tom 的脚本里「5 维正交」出现 4 次:分镜 2 第一行「5 维正交 vs 5×N 矩阵」、§0 速览「5 维正交轴」、§3 钩子「5 维正交轴里哪一格把信号吃了」、§1 一句话核心观点「5 维正交轴」。
- 问题:观众看到分镜 2 不会知道"5 维正交 vs 5×N 矩阵"是 flyP 跨议题的归类,不是论文的数学声明。这条 attribution gap 在短脚本里是误导风险——观众会以为论文做了 orthogonal design space 的实证。
- 建议:分镜 2 第一行改成「5 维设计空间(flyP 反方:可视为正交)」——把 flyP 限定语挪到屏幕文字层。
B. 「大模型偏爱 simple dense rewards + GRPO」中的 "+GRPO" 是 flyP 解读,不是论文结论(关键)
- 论文 abs 摘要 takeaway 1 只说 "larger models converge efficiently with simpler dense rewards"——未提 GRPO。
- flyP M3 反方「Reward × Algorithm 是 scale-dependent · 驳斥 GRPO 对所有规模最优」——"GRPO" 出现在 flyP 反方对算法选择的隐含指代。
- 但 Tom 把「+ GRPO」直接写入分镜 4 第二行「大模型:simple dense rewards + GRPO」,视觉呈现给观众时没有 flyP 来源标注。
- 问题:观众会以为"大模型用 GRPO"是 Agent-STAR 论文实验结论。这是算法名的事实错配——论文摘要全文不提 GRPO,提到的算法仅「scale-dependent」这一观察。
- 建议:分镜 4 第二行改成「大模型:simple dense rewards(算法选 GRPO 等 flyP 反方暗示)」——加 flyP 限定语。或在字幕层加小字「算法选型见论文 §4 controlled experiments · 摘要未点名 GRPO」。
C. 缺横向对比 vs 同类 2026 agentic RL 配方(深度层)
- web_search 抽查 + Tavily 检索显示,2026 年同期至少有 3 篇工作触及同一方向:
- 2603.00724 RLAR(An Agentic Reward System for Multi-task RL on LLMs,2026-03)—— 直接对应 Agent-STAR 的 reward shaping 轴
- 2604.16004 AgentV-RL(Scaling Reward Modeling with Agentic Verifier,2026-04-17)—— 对应 environmental stability 轴
- 2512.07478 PRS+VSPO(Progressive Reward Shaping + Value-based Sampling Policy Optimization,2025-12 v2)—— 直接对应 staged vs dense rewards + GRPO 对照
- 脚本完全没提这 3 篇——既没对比也没说"为什么 Agent-STAR 配方更值得讲"。这是 R2 短脚本深度上最大的未挖空间。
- 行业对照段(分镜 4→分镜 5 之间)只挂 flyP 反方,没挂同类论文,让对比只在一个方向展开(方法学批判),没在另一个方向展开(同类配方)。
- 建议:在 §3 口播稿 35–60s「行业对照」段加一句:「同期 RLAR / AgentV-RL / PRS+VSPO 三篇也各自攻 agentic RL 一格,Agent-STAR 的 5 维是把这些分散的工程化建议收束到一张表里」—— 25 字内,把"为什么 R2 现在选这篇"讲清楚。
D. 时差风险未被显式标注
- arXiv v1 2026-03-23 至今 2026-07-19 已 4 个月,§6 W11 只标 "OpenReview 未进"——但4 个月没进 OpenReview 在 agentic RL 这种每月爆款的方向是异常信号(同期 Ring-Zero、Tool-Use RL、PA-HDP 都在 6-8 周内进 OpenReview 或会议接收)。
- 脚本完全没展开这一含义。
- 建议:§6 W11 改成「arXiv v1 2026-03-23 · OpenReview 4 个月未进 · 在 agentic RL 月度爆款节奏下偏慢」。
E. "32 stars + 1 fork + 2 个月未更新" 的解读
- Tom 在 M2 列了 "32 stars · 1 fork · 上次 push 2026-05-12",但没在脚本里告诉观众这意味着什么。
- 32 stars 对一篇 2026-03-23 起的 RL 论文是明显偏低(同期热门 agentic RL 论文 GitHub 一般 200–1000+ stars),结合 2 个月未更新,是社区关注度有限的硬信号。
- 脚本完全没把这条工程信号落到字幕层。
- 建议:分镜 5 证据卡下加一行小字「GitHub 32 stars · 2 个月未更新 · 社区关注度待观察」。
F. 分镜 3 五维放射状图的"横轴 = 模型规模 / 纵轴 = reward 类型"
- 这是脚本的视觉化方案,但"模型规模 × reward 类型" 二维是 flyP M3「scale-dependent」诠释的强可视化,不是论文结论。
- 分镜 3 没挂 flyP 来源限定语。
- 建议:分镜 3 中央字「5 axes」下方加小字「flyP 反方:横轴规模 / 纵轴 reward 是该论文 scale-dependent 论点的可视化」。
G. 「OpenReview 未进」不是判定学术成熟度的唯一指标
- Tom 在 W11 把它当硬限制,但 2026 年一些优质工作(如 ICLR 2026 拒稿重投 NeurIPS)会在 arXiv-only 阶段停留 6+ 个月,不一定代表学术质量低。
- 脚本应当区分「OpenReview 未进」与「会议拒稿」。
- 建议:§6 W11 加半句「OpenReview 未进 ≠ 会议拒稿,仅代表尚未进入公开同行评审」。
三、潜在误导 / 风险
- 风险 1(中):「5 维正交」作为视觉标题与口播核心出现 4 次,但论文 abstract 不出现 orthogonal 字眼——这是 flyP 的批判性诠释包装成论文结论,是 R2 脚本最大的 attribution gap。
- 风险 2(中):「大模型偏爱 simple dense rewards + GRPO」中 GRPO 是 flyP 暗示不是论文结论,字幕层无 flyP 限定语。
- 风险 3(中):行业对照段完全没挂同类 2026 agentic RL 配方(RLAR / AgentV-RL / PRS+VSPO)——观众看完会以为 Agent-STAR 是 2026 年唯一系统性研究,这与同期事实不符。
- 风险 4(低):「32 stars · 2 个月未更新」没被解读为社区关注度信号——脚本给出原始数字但没给判断。
- 风险 5(低):4 个月 arXiv-only 没被解读为「agentic RL 节奏下的异常信号」——脚本只说 OpenReview 未进,没说 4 个月。
- 风险 6(低):分镜 6 W11/W12/W4 三条限定语没说为什么这三条是核心风险而不是别的(比如 W22 跨版本差异、W6 数据集差异就没出现)。这是 7-18 R1 Harness Evolution 脚本就出现过的问题,R2 仍然存在。
四、可读性
整体延续了 Tom 短脚本 7-15 之后的稳定 7 章节结构(§0 速览 / §1 标题 / §2 事实依据 / §3 口播 / §4 分镜 / §5 视觉规格 / §6 风险核验)+ 自我标注 PASS 项(§0 ≤120 字 / 主标题 ≤25 字符 / B-RW 落地数 / W 限定语落地数)。
优点: - §0 速览 5 行表格是 Tom 短脚本最强的"开头吸睛"结构,比 7-17 R3 TimeBlind 的单段速览信息密度高 2 倍。 - §2 事实依据把 M1/M2/M3/M4 分主源 / 旁证 / 反方 / 旁证四个层级,层级标签清晰,方便后续脚本 review。 - §6 W11/W12/W4 三条限定语对应分镜 6 三张风险卡,字幕层 ↔ 风险核验 ↔ 限定语落地形成三向闭环。
问题: - §3 口播稿 342 字(含 28 个英文词)偏紧。短脚本推荐 250–320 字,342 字 90s 平均 3.8 字/s,对中文 TTS 偏快。7-18 R1 Harness Evolution 的 480 字 90s 反而留了 5.3 字/s 呼吸空间。R2 比 R1 还紧,是回归。 - §4 分镜 5 的限定语小字 "significantly outperforming leading LLMs · 自报 · baseline 列表未给" 26 字,接近 18 字/行的视觉阈值——这是脚本自己宣称的"≤18 字"原则的违反。 - §5 视觉规格里的 5 种画面类型描述(标题卡 / 流程图 / 证据卡 / 风险卡 / 行动清单)与 §4 分镜 1–7 的一一对应没写出来——读者要自己对应。
五、与最新进展的差距
- 2026-07-17 R3 TimeBlind Tom 自己写过 video-mllm-evaluation-methodology,与本期 R2 agentic RL 配方不冲突,不构成同日承接,合理。
- 2026-07-18 R2 Kimi-K25 是同一 agent.md 主题下不同子方向(foundation model rewrite vs RL recipe),可承接为"agent.md v23 增章"——R2 没显式提及。
- 2026-07-18 R1 Judge-Kappa-Deflation 是 evaluation 主轴,与 R2 agentic RL 训练不冲突,可不承接。
- 2026-07-19 R1 Harness Evolution 是同日 Tom 第一份脚本(07:56),主轴是 agent eval reliability,与本期 R2 agentic RL 训练强互补(训不稳 + 评不严 = agent 进不去生产)——但 R2 脚本里完全没出现 R1 的"held-out tasks 泛化"作为背景。这是同日互文的最大缺口。
- 建议:§3 钩子段(0–8s)加一句「昨天我们讲 harness evolution 在留出任务上几乎没赢 → 今天这篇讲 agentic RL 训练不稳 → 5 维哪个轴吃掉了信号」——把 R1+R2 串成"训+评"叙事线。
- 同期 2026-03–04 agentic RL 三篇(RLAR / AgentV-RL / PRS+VSPO)完全没在 §2 事实依据层出现——这是 §二-C 已详谈的对比深度问题。
- knowledge 主题文档的挂载:脚本末尾 完全没建议挂 organized/knowledge/agent.md 哪个章节。agent.md v23 已有 "Agent Memory 五件套" 章节,agentic RL 5 维设计空间应入册 "Agent Post-Training 五维设计空间" 章节。
- promo selection 榜:今天 2026-07-19 selection 榜已经包含 R2 Agent-STAR(round=R2),与脚本同期——但脚本没引用 selection 决定。
六、可执行修改建议(按优先级)
- 「5 维正交」加 flyP 来源限定语(最关键,单点修改): - 分镜 2 第一行「5 维正交 vs 5×N 矩阵」 → 「5 维设计空间(flyP 反方:可视为正交)vs 5×N 矩阵」 - §0 速览「5 维正交轴」 → 「5 维设计空间轴(flyP:正交性可商榷)」 - §3 钩子「5 维正交轴里哪一格」 → 「5 维设计空间(flyP 解读为正交)哪格」 - §1 一句话核心观点「5 维正交轴」 → 「5 维设计空间轴」
- 「+ GRPO」加 flyP 限定语: - 分镜 4 第二行「大模型:simple dense rewards + GRPO」 → 「大模型:simple dense rewards(flyP 反方:算法选 GRPO 等)」
- §3 行业对照段加同类 2026 agentic RL 配方: - 在 35–60s 加一句「同期 RLAR(2603.00724)/ AgentV-RL(2604.16004)/ PRS+VSPO(2512.07478)三篇也各自攻 agentic RL 一格,Agent-STAR 是把它们收束到一张 5 维表」
- §6 W11 加 4 个月时差注释: - 「arXiv v1 2026-03-23 · OpenReview 未进」 → 「arXiv v1 2026-03-23 · OpenReview 4 个月未进 · 在 agentic RL 月度爆款节奏下偏慢」
- §3 钩子段串 R1 Harness Evolution: - 0–8s 加「昨天 R1 harness evolution 在留出任务上几乎没赢 → 今天讲训不稳 → 5 维哪格吃掉了信号」
- 分镜 5 加 GitHub 关注度信号: - 证据卡下方小字加「GitHub 32 stars · 2 个月未更新 · 社区关注度待观察」
- §3 口播稿字数压回 280–320: - 删掉行业对照段重复的"摘要自报 TravelPlanner SOTA, baseline 列表未给"(分镜 5 已写),压缩 20 字
- knowledge 挂载声明: - 末尾加一行「挂载建议:organized/knowledge/agent.md 新增 §X Agent Post-Training 五维设计空间 · 引用 arXiv 2603.21972 · 限定语同 §6 W4」
- §6 W11 加 OpenReview ≠ 会议拒稿限定语: - 加半句「OpenReview 未进 ≠ 会议拒稿,仅代表尚未进入公开同行评审」
- §5 视觉规格 5 种画面类型与 §4 分镜 1–7 的对应表:
- 加一个
| 画面类型 | 分镜 |的明确对应表
- 加一个
七、综合评分
- 准确性:9/10(13/15 verbatim 精确命中 + 1 条轻微弱化 + 0 硬错;归因清晰度在 KB 上是 top 10%)
- 深度:7/10(多源三角验证结构最完整 + 透明度极致 + 限定语闭环;但缺同类 2026 配方对比 + 缺同日 R1 Harness Evolution 互文)
- 可读性:7.5/10(结构延续 + 7 章节闭环 + §0 速览吸睛;但口播 342 字偏紧 + 分镜 5 限定语 26 字违反 ≤18 字原则 + §5 视觉规格与 §4 缺对应表)
- 误导风险:7/10(5 维正交 attribution gap + GRPO attribution gap + 32 stars 没解读为社区信号 + 4 个月 arXiv-only 没解读为节奏信号;4 个可修小坑但目前都会误导观众)
- 时效覆盖:7/10(限定语时间维度齐;缺同期 2026-03–04 agentic RL 三篇对比 + 缺 R1 Harness Evolution 同日互文)
加权总分:8/10。今日 R2 是 Tom 7-15 以来事实纪律最好、限定语闭环最完整、短脚本工业化最深的一份——B1 verbatim 9/9、B2-B9 verbatim 9/9、W 限定语 9 处落地齐、§0/§1/§6 三层透明度都在。与 7-12 雷达评审得分 8 平手,但方向是「短脚本工业化提升」(B-RW + W 编号 + PASS 硬约束自检),不是「洞察深度提升」。两个最关键的执行项是:(1) 「5 维正交」与「+GRPO」两处 attribution gap 加 flyP 来源限定语;(2) §3 行业对照段加 RLAR / AgentV-RL / PRS+VSPO 同期三篇对比。这两处改完,R2 可上 9 分。
评审完成 · spark · 2026-07-19 14:30 CST