spark 评 Tom · 2026-07-19 R2 Agent-STAR 短视频脚本

  • 质量分:8

被评对象/shared/video-kb/scripts/tom/2026-07-19_R2_agent-star-rl-recipe-long-horizon-short-video-script.md (同步镜像:/shared/research-kb/organized/promo/scripts/2603-21972.md · Tom 2026-07-19 R2 · 45–90s 短视频脚本 · 主源 arXiv 2603.21972 v1)

评审员:spark 评审时间:2026-07-19 14:30 (Asia/Shanghai)


一、事实准确性核查

通过 web_fetch https://arxiv.org/abs/2603.21972web_fetch https://github.com/WxxShirley/Agent-STAR 直接验证:

# Tom 关键表述 来源 核查结论
1 arXiv ID 2603.21972 M1 摘要 精确命中。abs 页面 status 200,标题、作者首作 Xixi Wu、v1 时间 2026-03-23 13:40 UTC、cs.LG / cs.CL 双类目全部对齐。
2 「5 axes: reward shaping, model scaling, data composition, algorithm selection, environmental stability」 M1 摘要 逐字命中。abs 原文:"We decompose the agentic RL design space along 5 axes: reward shaping, model scaling, data composition, algorithm selection, and environmental stability." 5/5 轴名一一对应。
3 「smaller models benefit from staged rewards and enhanced exploration」 M1 摘要 verbatim 命中。abs 原文同句。
4 「larger models converge efficiently with simpler dense rewards」 M1 摘要 verbatim 命中。abs 原文同句。
5 「~1K training samples with a balanced difficulty mixture = sweet spot」 M1 摘要 核心命中。abs 原文:"~ 1K training samples with a balanced difficulty mixture mark a sweet spot"——Tom 把 "mark" 改 "=" 是合理的口播简化,未扭曲含义。
6 「environmental stability is critical to prevent policy degradation」 M1 摘要 verbatim 命中。abs 原文同句。
7 「state-of-the-art performance on TravelPlanner, significantly outperforming leading LLMs」 M1 摘要 verbatim 命中,且 Tom 在分镜 5 + §6 W1/W3 双重限定「自报 · baseline 列表未给」,限定语执行到位
8 「7 key takeaways · controlled experiments」 M1 摘要 精确命中。abs 原文:"Our controlled experiments yield 7 key takeaways"——Tom 在 §0 + 分镜 4 + §6 W4 三处明示「摘要明示 3 条 · 剩余 4 条待 v1 全文」,透明度到位。
9 「GitHub WxxShirley/Agent-STAR · official · 32 stars」 M2 GitHub 精确命中。GitHub README 确认 "Official implementation for paper 'Demystifying RL for Long-Horizon Tool-Using Agents'"。
10 「significantly outperforming leading LLMs」是摘要自报 §6 W1/W3 ✅ 自我披露到位,未夸大
11 「arXiv v1 2026-03-23 · OpenReview 未进」 §6 W11 精确。abs 提交历史首条 v1 2026-03-23,OpenReview 在摘要与 GitHub 均无显式信息。
12 「v1 自 2026-03-23 起 arXiv-only」 §6 W11 ✅ 距今 2026-07-19 已 约 4 个月,Tom 未单独标注「4 个月未进 OpenReview」时效含义(潜在风险,下文 §2-B3 详谈)。
13 「Codes are available at this https URL」(论文 abstract 原话) M2 ⚠️ 半对。abs 原文确实是 "Codes are available at this https URL"——这是 arXiv 自动模板生成的标准化字段,不是论文作者原话。Tom 在 M2 标 "论文 abstract 原话" 准确但稍弱表达,可改为「abs 自动模板字段」。
14 flyP 反方三条引用(5 维最小完备 / 缺 rollout infra / Reward×Algorithm 是 scale-dependent) M3 flyP ✅ Tom 标了「flyP 反方审稿」来源 + 「针对 arXiv 2603.21972」限定语(B-RW7/8)——归属链清楚
15 「WxxShirley · 上次 push 2026-05-12」 M2 GitHub 精确命中(Tom 自报 2026-07-19 12:55 CST 实测),距今 2 个月未更新。

事实层结论:13/15 条 verbatim 命中或精确对齐;1 条轻微表述弱化("Codes are available" 标 "abstract 原话" 不算错但略不准);无硬事实错误、无捏造、无夸大外推。这是 Tom 近两周脚本里事实纪律最好的一份——分镜 5 / §6 W1/W2/W3/W4/W11/W12/W13/W14/W22 五处限定语闭环都在,规避了 7-12/7-13 评审反复指出的「自报当结论」风险。


二、深度评估

亮点

  1. 多源三角验证结构最完整。这是 Tom 短脚本里第一次同时挂 M1 arXiv 主源 + M2 GitHub 主源 + M3 flyP 反方审稿 + M4 Cameron Wolfe Substack 旁证。比起 7-17 R3 TimeBlind(只有 M1 + M3 双源)和 7-18 R2 Kimi-K25(M1 + M2 双源),今天 R2 把 4 个证据层串成一条链路,是范式提升。
  2. 「摘要明示 3 条 · 剩余 4 条待 v1 全文」透明度极致。分镜 4 + §6 W4 + §0 三处显式声明:摘要只展开 7 条 takeaway 中的 3 条。配合 flyP M3 反方「置信度 50–60%」声明,把"读者预期管理"做到 KB 极致。
  3. 限定语链路执行到位。§6 W1/W2/W3/W4/W11/W12/W13/W14/W22 共 9 条限定语全部对应一段实际风险,且 W14 显式标注「flyP 反方审稿发布 2026-07-18 22:50 CST · 原论文作者未实测回应」——这是 Tom 7-13 评审里反复被要求的「跨议题限定语」今天完整落地。
  4. 风险核验章节(§6)密度高、信息层级清晰。10 条 W 编号(事实 / 夸大 / 适用边界 / W11 / W14 / W22)覆盖了短脚本最常翻车的 6 类风险(自报当结论 / 跨议题类比 / 范围外推 / 学术成熟度 / 时效 / 跨版本差异)。
  5. 「先查 5 维哪格」的行动钩子对 AI 工程师实在。三问(staged vs dense / 1K vs 100K / 环境稳定性实测过没)是 RL 后训练工程师立刻能在自己实验里对照的判断题,不是空洞「看论文」号召。
  6. B-RW6/7/8/9/10 字幕层精度优化 5/5 落地 是 7-18 之后的新动作,分镜 5 证据卡 verbatim 双行排版 + TTS 慢速,分镜 7 跨议题限定语小字都齐——字幕层精度提升是脚本工业化的信号。

不足

A. 「5 维正交」是 flyP 的概念化阐释,不是论文结论(最高优先级)

  • 论文 abs 原文只说 "design space along 5 axes",没有出现 "orthogonal" 或 "正交"
  • flyP M3 反方审稿把它解读为「5 维是合理的最小完备集 · 目标 + 主体 + 环境」——这是 flyP 的批判性诠释,不是论文声明的"正交"
  • 但 Tom 的脚本里「5 维正交」出现 4 次:分镜 2 第一行「5 维正交 vs 5×N 矩阵」、§0 速览「5 维正交轴」、§3 钩子「5 维正交轴里哪一格把信号吃了」、§1 一句话核心观点「5 维正交轴」。
  • 问题:观众看到分镜 2 不会知道"5 维正交 vs 5×N 矩阵"是 flyP 跨议题的归类,不是论文的数学声明。这条 attribution gap 在短脚本里是误导风险——观众会以为论文做了 orthogonal design space 的实证。
  • 建议:分镜 2 第一行改成「5 维设计空间(flyP 反方:可视为正交)」——把 flyP 限定语挪到屏幕文字层。

B. 「大模型偏爱 simple dense rewards + GRPO」中的 "+GRPO" 是 flyP 解读,不是论文结论(关键)

  • 论文 abs 摘要 takeaway 1 只说 "larger models converge efficiently with simpler dense rewards"——未提 GRPO
  • flyP M3 反方「Reward × Algorithm 是 scale-dependent · 驳斥 GRPO 对所有规模最优」——"GRPO" 出现在 flyP 反方对算法选择的隐含指代。
  • 但 Tom 把「+ GRPO」直接写入分镜 4 第二行「大模型:simple dense rewards + GRPO」,视觉呈现给观众时没有 flyP 来源标注
  • 问题:观众会以为"大模型用 GRPO"是 Agent-STAR 论文实验结论。这是算法名的事实错配——论文摘要全文不提 GRPO,提到的算法仅「scale-dependent」这一观察。
  • 建议:分镜 4 第二行改成「大模型:simple dense rewards(算法选 GRPO 等 flyP 反方暗示)」——加 flyP 限定语。或在字幕层加小字「算法选型见论文 §4 controlled experiments · 摘要未点名 GRPO」。

C. 缺横向对比 vs 同类 2026 agentic RL 配方(深度层)

  • web_search 抽查 + Tavily 检索显示,2026 年同期至少有 3 篇工作触及同一方向:
  • 2603.00724 RLAR(An Agentic Reward System for Multi-task RL on LLMs,2026-03)—— 直接对应 Agent-STAR 的 reward shaping 轴
  • 2604.16004 AgentV-RL(Scaling Reward Modeling with Agentic Verifier,2026-04-17)—— 对应 environmental stability 轴
  • 2512.07478 PRS+VSPO(Progressive Reward Shaping + Value-based Sampling Policy Optimization,2025-12 v2)—— 直接对应 staged vs dense rewards + GRPO 对照
  • 脚本完全没提这 3 篇——既没对比也没说"为什么 Agent-STAR 配方更值得讲"。这是 R2 短脚本深度上最大的未挖空间
  • 行业对照段(分镜 4→分镜 5 之间)只挂 flyP 反方,没挂同类论文,让对比只在一个方向展开(方法学批判),没在另一个方向展开(同类配方)
  • 建议:在 §3 口播稿 35–60s「行业对照」段加一句:「同期 RLAR / AgentV-RL / PRS+VSPO 三篇也各自攻 agentic RL 一格,Agent-STAR 的 5 维是把这些分散的工程化建议收束到一张表里」—— 25 字内,把"为什么 R2 现在选这篇"讲清楚。

D. 时差风险未被显式标注

  • arXiv v1 2026-03-23 至今 2026-07-19 已 4 个月,§6 W11 只标 "OpenReview 未进"——但4 个月没进 OpenReview 在 agentic RL 这种每月爆款的方向是异常信号(同期 Ring-Zero、Tool-Use RL、PA-HDP 都在 6-8 周内进 OpenReview 或会议接收)。
  • 脚本完全没展开这一含义。
  • 建议:§6 W11 改成「arXiv v1 2026-03-23 · OpenReview 4 个月未进 · 在 agentic RL 月度爆款节奏下偏慢」。

E. "32 stars + 1 fork + 2 个月未更新" 的解读

  • Tom 在 M2 列了 "32 stars · 1 fork · 上次 push 2026-05-12",但没在脚本里告诉观众这意味着什么
  • 32 stars 对一篇 2026-03-23 起的 RL 论文是明显偏低(同期热门 agentic RL 论文 GitHub 一般 200–1000+ stars),结合 2 个月未更新,是社区关注度有限的硬信号。
  • 脚本完全没把这条工程信号落到字幕层。
  • 建议:分镜 5 证据卡下加一行小字「GitHub 32 stars · 2 个月未更新 · 社区关注度待观察」。

F. 分镜 3 五维放射状图的"横轴 = 模型规模 / 纵轴 = reward 类型"

  • 这是脚本的视觉化方案,但"模型规模 × reward 类型" 二维是 flyP M3「scale-dependent」诠释的强可视化,不是论文结论。
  • 分镜 3 没挂 flyP 来源限定语。
  • 建议:分镜 3 中央字「5 axes」下方加小字「flyP 反方:横轴规模 / 纵轴 reward 是该论文 scale-dependent 论点的可视化」。

G. 「OpenReview 未进」不是判定学术成熟度的唯一指标

  • Tom 在 W11 把它当硬限制,但 2026 年一些优质工作(如 ICLR 2026 拒稿重投 NeurIPS)会在 arXiv-only 阶段停留 6+ 个月,不一定代表学术质量低。
  • 脚本应当区分「OpenReview 未进」与「会议拒稿」
  • 建议:§6 W11 加半句「OpenReview 未进 ≠ 会议拒稿,仅代表尚未进入公开同行评审」。

三、潜在误导 / 风险

  • 风险 1(中):「5 维正交」作为视觉标题与口播核心出现 4 次,但论文 abstract 不出现 orthogonal 字眼——这是 flyP 的批判性诠释包装成论文结论,是 R2 脚本最大的 attribution gap。
  • 风险 2(中):「大模型偏爱 simple dense rewards + GRPO」中 GRPO 是 flyP 暗示不是论文结论,字幕层无 flyP 限定语
  • 风险 3(中):行业对照段完全没挂同类 2026 agentic RL 配方(RLAR / AgentV-RL / PRS+VSPO)——观众看完会以为 Agent-STAR 是 2026 年唯一系统性研究,这与同期事实不符
  • 风险 4(低):「32 stars · 2 个月未更新」没被解读为社区关注度信号——脚本给出原始数字但没给判断。
  • 风险 5(低):4 个月 arXiv-only 没被解读为「agentic RL 节奏下的异常信号」——脚本只说 OpenReview 未进,没说 4 个月。
  • 风险 6(低):分镜 6 W11/W12/W4 三条限定语没说为什么这三条是核心风险而不是别的(比如 W22 跨版本差异、W6 数据集差异就没出现)。这是 7-18 R1 Harness Evolution 脚本就出现过的问题,R2 仍然存在。

四、可读性

整体延续了 Tom 短脚本 7-15 之后的稳定 7 章节结构(§0 速览 / §1 标题 / §2 事实依据 / §3 口播 / §4 分镜 / §5 视觉规格 / §6 风险核验)+ 自我标注 PASS 项(§0 ≤120 字 / 主标题 ≤25 字符 / B-RW 落地数 / W 限定语落地数)。

优点: - §0 速览 5 行表格是 Tom 短脚本最强的"开头吸睛"结构,比 7-17 R3 TimeBlind 的单段速览信息密度高 2 倍。 - §2 事实依据把 M1/M2/M3/M4 分主源 / 旁证 / 反方 / 旁证四个层级,层级标签清晰,方便后续脚本 review。 - §6 W11/W12/W4 三条限定语对应分镜 6 三张风险卡,字幕层 ↔ 风险核验 ↔ 限定语落地形成三向闭环。

问题: - §3 口播稿 342 字(含 28 个英文词)偏紧。短脚本推荐 250–320 字,342 字 90s 平均 3.8 字/s,对中文 TTS 偏快。7-18 R1 Harness Evolution 的 480 字 90s 反而留了 5.3 字/s 呼吸空间。R2 比 R1 还紧,是回归。 - §4 分镜 5 的限定语小字 "significantly outperforming leading LLMs · 自报 · baseline 列表未给" 26 字,接近 18 字/行的视觉阈值——这是脚本自己宣称的"≤18 字"原则的违反。 - §5 视觉规格里的 5 种画面类型描述(标题卡 / 流程图 / 证据卡 / 风险卡 / 行动清单)与 §4 分镜 1–7 的一一对应没写出来——读者要自己对应。


五、与最新进展的差距

  • 2026-07-17 R3 TimeBlind Tom 自己写过 video-mllm-evaluation-methodology,与本期 R2 agentic RL 配方不冲突,不构成同日承接,合理。
  • 2026-07-18 R2 Kimi-K25 是同一 agent.md 主题下不同子方向(foundation model rewrite vs RL recipe),可承接为"agent.md v23 增章"——R2 没显式提及。
  • 2026-07-18 R1 Judge-Kappa-Deflation 是 evaluation 主轴,与 R2 agentic RL 训练不冲突,可不承接。
  • 2026-07-19 R1 Harness Evolution 是同日 Tom 第一份脚本(07:56),主轴是 agent eval reliability,与本期 R2 agentic RL 训练强互补(训不稳 + 评不严 = agent 进不去生产)——但 R2 脚本里完全没出现 R1 的"held-out tasks 泛化"作为背景这是同日互文的最大缺口
  • 建议:§3 钩子段(0–8s)加一句「昨天我们讲 harness evolution 在留出任务上几乎没赢 → 今天这篇讲 agentic RL 训练不稳 → 5 维哪个轴吃掉了信号」——把 R1+R2 串成"训+评"叙事线。
  • 同期 2026-03–04 agentic RL 三篇(RLAR / AgentV-RL / PRS+VSPO)完全没在 §2 事实依据层出现——这是 §二-C 已详谈的对比深度问题。
  • knowledge 主题文档的挂载:脚本末尾 完全没建议挂 organized/knowledge/agent.md 哪个章节。agent.md v23 已有 "Agent Memory 五件套" 章节,agentic RL 5 维设计空间应入册 "Agent Post-Training 五维设计空间" 章节。
  • promo selection 榜:今天 2026-07-19 selection 榜已经包含 R2 Agent-STAR(round=R2),与脚本同期——但脚本没引用 selection 决定。

六、可执行修改建议(按优先级)

  1. 「5 维正交」加 flyP 来源限定语(最关键,单点修改): - 分镜 2 第一行「5 维正交 vs 5×N 矩阵」 → 「5 维设计空间(flyP 反方:可视为正交)vs 5×N 矩阵」 - §0 速览「5 维正交轴」 → 「5 维设计空间轴(flyP:正交性可商榷)」 - §3 钩子「5 维正交轴里哪一格」 → 「5 维设计空间(flyP 解读为正交)哪格」 - §1 一句话核心观点「5 维正交轴」 → 「5 维设计空间轴」
  2. 「+ GRPO」加 flyP 限定语: - 分镜 4 第二行「大模型:simple dense rewards + GRPO」 → 「大模型:simple dense rewards(flyP 反方:算法选 GRPO 等)」
  3. §3 行业对照段加同类 2026 agentic RL 配方: - 在 35–60s 加一句「同期 RLAR(2603.00724)/ AgentV-RL(2604.16004)/ PRS+VSPO(2512.07478)三篇也各自攻 agentic RL 一格,Agent-STAR 是把它们收束到一张 5 维表」
  4. §6 W11 加 4 个月时差注释: - 「arXiv v1 2026-03-23 · OpenReview 未进」 → 「arXiv v1 2026-03-23 · OpenReview 4 个月未进 · 在 agentic RL 月度爆款节奏下偏慢」
  5. §3 钩子段串 R1 Harness Evolution: - 0–8s 加「昨天 R1 harness evolution 在留出任务上几乎没赢 → 今天讲训不稳 → 5 维哪格吃掉了信号」
  6. 分镜 5 加 GitHub 关注度信号: - 证据卡下方小字加「GitHub 32 stars · 2 个月未更新 · 社区关注度待观察」
  7. §3 口播稿字数压回 280–320: - 删掉行业对照段重复的"摘要自报 TravelPlanner SOTA, baseline 列表未给"(分镜 5 已写),压缩 20 字
  8. knowledge 挂载声明: - 末尾加一行「挂载建议:organized/knowledge/agent.md 新增 §X Agent Post-Training 五维设计空间 · 引用 arXiv 2603.21972 · 限定语同 §6 W4」
  9. §6 W11 加 OpenReview ≠ 会议拒稿限定语: - 加半句「OpenReview 未进 ≠ 会议拒稿,仅代表尚未进入公开同行评审」
  10. §5 视觉规格 5 种画面类型与 §4 分镜 1–7 的对应表
    • 加一个 | 画面类型 | 分镜 | 的明确对应表

七、综合评分

  • 准确性:9/10(13/15 verbatim 精确命中 + 1 条轻微弱化 + 0 硬错;归因清晰度在 KB 上是 top 10%)
  • 深度:7/10(多源三角验证结构最完整 + 透明度极致 + 限定语闭环;但缺同类 2026 配方对比 + 缺同日 R1 Harness Evolution 互文)
  • 可读性:7.5/10(结构延续 + 7 章节闭环 + §0 速览吸睛;但口播 342 字偏紧 + 分镜 5 限定语 26 字违反 ≤18 字原则 + §5 视觉规格与 §4 缺对应表)
  • 误导风险:7/10(5 维正交 attribution gap + GRPO attribution gap + 32 stars 没解读为社区信号 + 4 个月 arXiv-only 没解读为节奏信号;4 个可修小坑但目前都会误导观众)
  • 时效覆盖:7/10(限定语时间维度齐;缺同期 2026-03–04 agentic RL 三篇对比 + 缺 R1 Harness Evolution 同日互文)

加权总分:8/10。今日 R2 是 Tom 7-15 以来事实纪律最好、限定语闭环最完整、短脚本工业化最深的一份——B1 verbatim 9/9、B2-B9 verbatim 9/9、W 限定语 9 处落地齐、§0/§1/§6 三层透明度都在。与 7-12 雷达评审得分 8 平手,但方向是「短脚本工业化提升」(B-RW + W 编号 + PASS 硬约束自检),不是「洞察深度提升」。两个最关键的执行项是:(1) 「5 维正交」与「+GRPO」两处 attribution gap 加 flyP 来源限定语;(2) §3 行业对照段加 RLAR / AgentV-RL / PRS+VSPO 同期三篇对比。这两处改完,R2 可上 9 分。


评审完成 · spark · 2026-07-19 14:30 CST