批判性精读 · OraRL "Annotations as Rollouts" arXiv:2608.20492 · 视频 MLLM 强化学习样本效率新范式

角色:flyP · 2026-08-27 15:50 CST · 独立批判性精读棒(轻量精读模式 · 第 2 篇 / 全天 2 篇) 底本:tom 8-27 09:00 HF Daily #2 89▲ + flyp 8-27 09:40 multimodal-e1prep §增量 2 + alphaXiv abs 2608.20492 + arXiv HTML v1 + orarl.github.io + GitHub HVision-NKU/OraRL + HF papers 2608.20492 基线:今日 09:50 棒已精读 GigaBrain-0.7 VLA 方向;本棒做多模态 RL 后训练独立精读,与 09:50 棒方向不重叠,共享"立标信号 89▲/91▲"同窗候选 约束:不复制原文长段;不抓 PDF 全文(轻量精读);不执行 git 写入;只写 inbox/flyp/ 草稿


〇、本棒定位与边界

本棒 ≠ 复述 e1prep 棒: - e1prep 棒 §增量 2 已预备 v59 §2.39.245 候补级中-高档 ★★ + §3.3 #147 反方立基础 + §4 二十向 ㉔ + 立标池双向锚 v33 首次 14 向并存预备 - 本棒做独立批判性精读:① 拆方法 ② 标贡献 ③ 审实验风险 ④ 估复现难度 ⑤ 飞P 立场入库决策

本棒 ≠ 抓 PDF 全文: - 仅基于 arXiv abs/HTML 摘要 + orarl.github.io 项目页 + GitHub README + HF papers 元数据 - 未抓 PDF §3-§7 全文(轻量精读模式) - 实验数字以摘要级 + 项目页为主,具体 ablation 表与各任务子集表现待全文核验

沿用 e1prep 棒立标信号:OraRL 89▲ 立标信号 v33 以来 video MLLM RL 方向最高(vs ToolVerse 8-25 候选级中档 ★ 沿用 vs SemaPLC 候选级中-高档 ★★ 沿用)。


一、事实摘要(只摘不评)

1.1 论文元信息

字段 来源
arXiv ID 2608.20492v1 [cs.CV] arXiv abs
标题 Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs arXiv abs
提交日 2026-08-20 18:28 UTC arXiv submission history
通讯作者 Yunheng Li(南开大学 HVision-NKU 实验室) arXiv show-email
完整作者团队 Yunheng Li¹ · Guohong Mu¹ · Hao Li² · Shengsheng Qian³ · Dingwen Zhang² · Qibin Hou¹,⁴† · Ming-Ming Cheng¹,⁴ orarl.github.io
单位 ¹南开大学 · ²西北工业大学 · ³中科院自动化所 · ⁴NKIARI(南开人工智能学院) orarl.github.io
主分类 cs.CV(计算机视觉与模式识别) arXiv abs
顶会状态 arXiv submitted(未接收) orarl.github.io
项目页 https://orarl.github.io/ arXiv comments
代码 https://github.com/HVision-NKU/OraRL GitHub README
模型 OraRL/Video-ORA-4B(Qwen3.5-4B backbone)+ OraRL/Video-ORA-9B(Qwen3.5-9B backbone) HF papers + GitHub
数据集 OraRL/OraRL-Data(100k training prompts) HF papers
模型权重 "coming soon"(截至 2026-08-27 15:50 CST) GitHub README
硬件要求 NVIDIA H20/Hopper + CUDA 12.9 GitHub README
立标信号 89▲(HF Daily 8-27 #2) tom 8-27 HF Daily

冲突标记:无 arXiv ID 时序异常;提交时间、作者团队、代码仓库、项目页四源交叉一致;权重未释放是当前已知缺口。

1.2 核心方法(四件套)

Motivation(动因): - 视频 MLLM 在大规模多任务数据集上的 RL 后训练面临样本效率瓶颈——既有 GRPO 类方法即便有 CoT 生成,开销大但每组高质量 rollout 仍稀少 - 标注(annotation)在传统 RL 中仅用于给采样 rollout 打分——这是一个被低估的信号源

核心观察: - 每条标注可以被序列化(serialize)为 oracle rollout——即模型原生响应格式的"正确答案" - 直接当作正向优化目标引入 on-policy 组,理想上能解决样本稀疏问题

核心挑战(advantage inversion,优势倒置): - 直接混合 oracle rollout 会抬高组的基线(baseline)——因为 oracle 是高奖励 - 原本相对基线为正的策略 rollout 被推为负优势(penalized) - 这是形式化的失败模式,术语为"advantage inversion"

核心创新:decoupled advantage estimator(解耦优势估计器): 1. Policy rollouts 决定 oracle-free baseline:基线只来自 on-policy 奖励,不包含 oracle 2. Oracle-policy gap 调制双信号: - directional gain(有向增益):基于 oracle 与当前策略差距的有界方向调整 - detached oracle advantage(解耦 oracle 优势):作为独立的优化信号 3. Sign-balanced pruning(符号平衡剪枝):只保留每组中 oracle + 每个符号(正/负)最强的 rollout - 大幅降低每步所需 rollout 数 - 配合 H20/Hopper 硬件可实现 2.2× step time(vs SFT),而 GRPO+CoT 是 4.9×

1.3 评测与关键数字

效率数字(来自摘要 + 项目页)

指标 OraRL 对照
每步 step time(vs SFT 1×) 2.2× GRPO+CoT 4.9×
无 CoT 推理延迟(Video-ORA-9B) 130 ms 含 CoT 4,780 ms(36.8× 减速)
更新速度提升 1.48×
训练 prompts 100k

任务覆盖(7 类): - 视频定位(segmentation, temporal grounding, spatial grounding, visual tracking) - 视觉问答(QA) - 空间推理(spatial reasoning)

关键性能(vs 同任务下"先前最佳")

任务 / 指标 之前最佳 Video-ORA-9B 提升
Temporal mIoU 62.5 66.0 +3.5
Tracking AO 73.0 78.2 +5.2
Segmentation 64.3 70.4 +6.1
三基准空间智能 macro avg 51.0 56.1 +5.1
VSI-Bench(vs GPT-5 + Gemini-3-Pro) 55.0 / 55.1 73.1 +18.0

规模泛化: - 0.8B → 9B backbone 全程超越(摘要原话:"surpassing its backbone from 0.8B to 9B") - GRPO 在 100k prompts 时已被 OraRL 全面超越("surpassing GRPO up to 100k prompts")

VSI-Bench 73.1 vs Gemini-3-Pro 55.1 是摘要中最大的"立标冲击波"——但需核验:① 任务设置是否一致 ② 评测协议是否 apples-to-apples ③ VSI-Bench 是否 Gemini/GPT 系模型曾公开报告的数字。

1.4 工程上下文(GitHub 仓库可推断)

  • 框架基于 veRL 兼容运行时(README 明示)
  • 配置文件分轨:orarl_4b.yaml / orarl_9b.yaml
  • 强调 reproducibility + cluster validation + license
  • 明确"answer-only decoding on ten-minute videos without generated reasoning traces"——这是 OraRL 的核心卖点之一,能省掉 CoT 生成

二、方法拆解(批判性视角)

2.1 创新点 vs 既有 RL 后训练主线

维度 传统 GRPO/DPO 类方法 OraRL 飞P 批判
标注的角色 仅打分(scoring) 双重角色:打分 + oracle rollout 真有创新但需 PDF 看"双重角色"的工程是否引入 annotation noise——若 GT 标注有噪声,oracle rollout 就是污染信号
优势估计 组归一化(group normalization)含 oracle 解耦 oracle-free baseline + 间隙调制 "解耦"在 RL 理论上有依据(NEVER-PURE baseline + auxiliary signal),但"directional gain"是否是有界最优?
计算效率 CoT 必须 → 4.9× step time 无 CoT + sign-balanced pruning → 2.2× 真正的工程贡献——不需 CoT 即可在视频任务拿高 VSI-Bench
长尾分布 高质量 rollout 稀疏 每组都注入 oracle 正样本 结构性改善,但 oracle 注入是否打破 on-policy 假设?摘要承认这一点("preserving on-policy exploration"是关键卖点)
任务覆盖 多为单一任务(perception/grounding) 7 任务家族统一 统一架构贡献——但是否真的"统一"?需要 PDF 看 loss 设计是否真合一,还是多任务加权

2.2 "Decoupled advantage estimator" 的理论真伪

飞P 反方 5 条: 1. Oracle rollout 算"on-policy"吗:传统 on-policy 要求 rollout 来自当前策略 π_θ;oracle rollout 来自人工标注(不来自 π_θ)。摘要原话 "we identify an overlooked role for annotations" + "preserving on-policy exploration" 暗示这是定义扩展而非纯 on-policy。需 PDF 看是否仍属 PPO/GRPO 框架,或改写为 imitation learning + RL 混合范式。 2. Detached oracle advantage 的"分离"是否数学严格:摘要说"separate detached oracle advantage"。在 RL 文献中 "detached" 通常指 stop-gradient,但加上"oracle gap 调制"是否构成新的 policy gradient 形式?需 PDF 看推导。 3. Advantage inversion 的形式化:摘要给出"a high-reward oracle raises the group baseline and inverts otherwise positive policy advantages"——但为什么不在 baseline 计算时直接剔除 oracle? 这正是 OraRL 做的("policy rollouts determine an oracle-free baseline")。所以"advantage inversion"是被作者先故意构造的失败模式再被自己修补,不是真实场景下的必然陷阱。 4. Sign-balanced pruning 的样本保留率:摘要说"retaining only the oracle and the strongest rollouts of each sign"——每组保留多少个 rollout? 如果保留 1 oracle + 1 正 + 1 负 = 3 个,那 4 rollouts/组;如果是更多则每步信号更强但计算开销涨。需 PDF 看每个 group 大小 + 采样超参。 5. "Without chain-of-thought, ... decodes in 130 ms instead of 4,780 ms":这是延迟数字,不是吞吐。在视频多模态推理中,130 ms 是否真的实用?需看视频长度 + batch size + 硬件配置。130 ms 对 10 分钟视频意味着什么?摘要的时延数字可能基于特定硬件 + 短答案生成。

2.3 与撞名稿件关系

候选 / 已入库 与 OraRL 关系 飞P 判定
ToolVerse 8-25 §3.3 #122 "Turn-Aware Relative Advantage" 修补 GRPO credit assignment 稀疏 互补:ToolVerse 修补"训练时分配什么信号",OraRL 修补"训练时哪来足够好信号"
SemaPLC 8-22 候选级中-高档 ★★ "dynamic 行为 22.4→52.2" 评测方法学 不重叠:SemaPLC 是 evaluation harness 革新,OraRL 是 training 算法革新
GRPO / DPO / PPO 系基线 直接对照 OraRL 全面超越(摘要声明)——可信度待 PDF §5 实验验证
VideoChat / Video-LLaMA 系 MLLM 主干模型对照 OraRL 以 Qwen3.5-4B/9B 为 backbone,未与 VideoChat-Flash / VideoChat3 等长视频 MLLM 直接对照(待核)

2.4 立标冲击波的可信度审查

VSI-Bench 73.1 vs Gemini-3-Pro 55.1 / GPT-5 55.0: - 这是 OraRL 摘要里最大的"立标冲击波" - 但 VSI-Bench 是 Stanford 提出的空间智能评测基准(8-21 flyp multimodal-critical-read-SenseNova-SI 中已立) - 关键问题:摘要对比的 GPT-5 / Gemini-3-Pro 数字是从哪来?是这些厂商自己报告的,还是 OraRL 团队重新跑的? - 若为 OraRL 团队跑出来的,需要核验评测协议一致性(相同 prompt、相同 decoding config、相同 shot 数) - 若为厂商报告数字,则评测设置可能不同(厂商常用零样本 + 长 CoT,OraRL 是不用 CoT + RL 后训练)

飞P 立场"超越 GPT-5 / Gemini-3-Pro 18 分"的声明属于条件级贡献,必须在 PDF §5 + §appendix 中看到完整的 apples-to-apples 评测协议。


三、贡献判断(飞P 立场)

3.1 真贡献(确凿级)

  1. 样本效率结构性提升:从"GRPO+CoT 4.9× step time"降至"OraRL 2.2×",同时达到或超过性能——这是真正的工程效率贡献
  2. 无需 CoT 即可获得视频任务 SOTA:Video-ORA-9B 130 ms 无 CoT 解码是部署友好贡献,对生产视频理解系统是关键卖点(生产环境通常对延迟敏感)。
  3. "Advantage inversion" 概念的形式化:作者把一个真实存在的问题命名为"优势倒置",并提出解耦优势估计器作为修补——这是 RL 训练方法学的概念贡献
  4. 7 任务家族统一训练:单一模型同时在 segmentation / tracking / grounding / QA / spatial reasoning 提升——统一架构贡献
  5. 完整开源承诺:代码(HVision-NKU/OraRL)+ 数据(OraRL-Data)+ 配置(4B/9B YAML)+ 评测数据全部公开(权重 "coming soon" 是缺口)。

3.2 待核验贡献(条件级)

  1. VSI-Bench 73.1 vs Gemini-3-Pro 55.0 的立标冲击波:评测协议必须等 PDF §5 + 附录核验;若 apples-to-apples 不严格,冲击波降级为 "RL post-training in specific setup" 而非"超越最先进商用模型"。
  2. "0.8B → 9B 全程超越 backbone":是仅在 0.8B / 4B / 9B 三档测试,还是插值过的连续曲线?需 PDF §6 scaling 实验。
  3. Decoupled advantage estimator 的理论保证:是否给出收敛性证明 / 偏差-方差分解?需 PDF §3 + appendix。
  4. Annotation noise 鲁棒性:标注有错时 OraRL 是否会放大错误?需 PDF §4.5 噪声实验。

3.3 可疑贡献(潜在风险)

  1. "Decoupled" vs "Detached" 命名边界:摘要同时使用 "decoupled advantage estimator" 与 "detached oracle advantage"。"Detached" 通常在 RL 中意味着 stop-gradient,与"decoupled baseline"是否完全等价?需 PDF 看具体公式。
  2. Sign-balanced pruning 的极端设置:如果每组只保留 1 oracle + 1 正 + 1 负 = 3 rollout,这比标准 GRPO 的 8-16 rollout/组小很多。信号稀疏是否会引发方差爆炸?
  3. "answer-only decoding on ten-minute videos" 的实际延迟:130 ms 是项目页数字,可能在特定硬件(H20/Hopper)+ batch=1 + 短答案条件下成立。生产环境未必能复现。

3.4 飞P 评级

维度 评级 理由
学术原创性 A- "标注即 oracle rollout" + decoupled advantage estimator + sign-balanced pruning 三件套是真创新,但与既有 imitation-from-demonstration / self-imitation learning 文献有渊源(待核)
工程实用性 A 无 CoT + 2.2× step time + 7 任务统一 = 工业级友好,权重即将释出(虽然仍为 "coming soon")
实验完整性 B+ 摘要数字冲击力强,但 VSI-Bench 73.1 vs GPT-5/Gemini-3-Pro 的对照协议未公开核验
可复现性 B 代码 + 数据 + 评测数据 + YAML 全开,但权重未释 + 需 H20/Hopper + CUDA 12.9 硬件门槛
顶会潜力 A- arXiv submitted,未接收;若投 NeurIPS / ICLR / ICML 2027,接收概率高(飞P 估计)

综合A- 候选级中-高档 ★★(沿用 e1prep 棒预备)+ 立标信号 89▲(v33 以来 video MLLM RL 方向最高)+ 风险因子 = 权重未释 + 评测协议待核 + 理论保证未核。


四、实验风险与复现难度

4.1 实验风险

风险 等级 说明
VSI-Bench 73.1 vs 商用模型 55 的对照公平性 未公开评测协议;GPT-5/Gemini-3-Pro 数字可能来自不同 prompt template
100k prompts 数据集的多样性 OraRL-Data 100k 是否覆盖 7 任务家族均衡?还是以某任务为主?
"Sign-balanced pruning" 的超参稳定性 保留多少 rollout 决定信号密度,需 ablation
0.8B → 9B scaling claim 的实测曲线 摘要仅给出"全程超越",缺连续曲线数据
Annotation noise 鲁棒性 摘要未明示标注噪声下的性能衰减(待核)
H20/Hopper 硬件依赖 现成硬件约束,工业级用户有条件

4.2 复现难度

估算(基于 GitHub README + orarl 项目页):

资源 需求 难度
代码 HVision-NKU/OraRL 仓库完整开源
数据 OraRL-Data 100k + 评测数据 (待发布后下载)
权重 Video-ORA-4B / 9B ("coming soon")
硬件 NVIDIA H20 / Hopper GPU(≥ 4 卡 80G) 中高(普通实验室无 H20,需 A100 80G 替代 + 部分代码改)
CUDA 12.9(与最新驱动匹配)
训练时间 100k prompts × 2.2× step time × 9B backbone 极高(单次全训练估计 ≥ 1 周,8 卡 80G 估算)

总评复现难度"高"——主要是硬件门槛 + 权重未释 + 训练时长。

4.3 撞名 / 撞主题核查

候选 撞主题? 备注
ToolVerse 8-25 是(同窗口 RL 后训练) 互补关系,非撞名
SemaPLC 8-22 否(评测方法学 vs 训练算法)
EchoWM 8-27 #3 70▲ 否(视频生成 vs RL 后训练)
Self-Improving RL 8-20 (HF Daily) 部分(都涉及 self-improving / closed-loop) 待核
ChatVideo / VideoChat-Flash

立标冲击波 vs 同窗候选:OraRL 与 GigaBrain-0.7 共享 89▲/91▲ 立标信号同窗双峰,但方向不同(RL 算法 vs 具身基础模型),互不替代。


五、思想线索:撞名 / 撞主题 / Substack 思想(不复制原文)

5.1 与 inbox/flyp/ 既有方向的跨棒关系

主线 既有锚 OraRL 与主线关系
RL 后训练修补 ToolVerse §3.3 #122(credit assignment 修补)+ SemaPLC 评测方法学延革 #13 + General AgentBench v2 21:24 重写棒 verification gap OraRL = "训练侧样本高效"修补(样本来源端),与 ToolVerse "训练侧信号分配"修补(信号使用端)形成"RL 后训练方法学延革第 33-34 例"双锚
评测方法学延革系列(v33 完整 6 锚链) EnvHarness + Zetta + HarnessEval-W + StateM + Harness-Evolution-Eval-Rethink + Prime Agent 不直接重叠——OraRL 是训练算法而非评测方法
立标等级评估方法学延革反方立基础预备(v33 17 件) 多件 OraRL 立标"标注即 oracle rollout"预备触发 v59 §3.3 #147 反方立基础延展预备("训练侧样本高效 vs 评测侧 RL 信号分配"双锚预备)

5.2 与 inbox/ 其他实例的关系

  • 与 jay 8-27 0820 csdn 关联:OraRL 团队 Yunheng Li 来自 HVision-NKU,jay CSDN 早棒未提(无撞名)
  • 与 tom 8-27 09:00 HF Daily 关联:HF Daily #2 89▲ 立标信号沿用
  • 与 stephen 8-27 0910 news-x-vip-radar 关联:待核 stephen 是否独立跟踪

5.3 Substack 思想线索(不展开,仅记录)

  • 暂未在 OraRL 主题下找到独立 Substack 中文 AI 评论线索
  • 相关线索:Hugging Face papers 2608.20492 社区评论("Models citing this paper 2" + "Datasets citing this paper 1" + "Spaces citing this paper 0"——社区反馈尚浅
  • 不在本棒展开 Substack 多轮扩展搜索(符合 2026-06-10 稳定运行约束)

六、可信度总评与建议路径

6.1 可信度总评

维度 评级
方法创新度 A-(decoupled advantage estimator 是真创新,但与 imitation learning 有渊源待核)
实验冲击力 A(效率数字 + 7 任务统一 + VSI-Bench 立标冲击波)
实验严谨度 B+(VSI-Bench 73.1 vs GPT-5 协议未核 + 100k 数据集构成未核 + 噪声鲁棒未核)
复现可达性 B(代码全开 + 权重未释 + H20/Hopper 硬件门槛)
顶会潜力 A-(arXiv submitted;若投 NeurIPS 2027 接收概率高)
工业落地价值 A(无 CoT + 2.2× step time + 7 任务统一 = 部署友好)

综合可信度中高(A- 候选级中-高档 ★★ 沿用 e1prep 棒预备)

6.2 飞P 入库建议

边界声明:本棒(15:50)不直接写入 GitHub notes/ / reviews/ / topics/ / risk/;建议路径仅作"飞P 立场 + 入库优先级"参考,实际写入由后续同步任务串行处理

建议路径 优先级 验收标准
notes/multimodal/rl-post-training-OraRL-annotations-as-rollouts.md P1 ① VSI-Bench 73.1 vs GPT-5 协议已核 ② Video-ORA-4B/9B 权重已释 ③ 100k 数据集构成已核 ④ H20/Hopper 与 A100 兼容性已核
reviews/OraRL-decoupled-advantage-estimator-critical.md P2 同上 + ablation 表已核 + 噪声鲁棒实验已核
topics/rl-post-training-taxonomy.md(扩展) P2 与 ToolVerse / SemaPLC / Self-Improving RL 形成统一 RL 后训练分类

6.3 后续验证动作(截止日分级)

编号 动作 截止日 优先级
V1 VSI-Bench 73.1 vs GPT-5/Gemini-3-Pro 评测协议核验(PDF §5 + appendix) A1 2026-08-30 P1
V2 Video-ORA-4B / 9B 权重释出监测 A2 2026-09-05 P1
V3 100k OraRL-Data 任务分布核验 A2 2026-09-05 P2
V4 Decoupled advantage estimator 理论推导核验(PDF §3) A3 2026-09-10 P2
V5 Annotation noise 鲁棒性实验核验(PDF §4.5) A3 2026-09-10 P2
V6 Sign-balanced pruning 超参稳定性核验(ablation) A3 2026-09-10 P2
V7 与 ToolVerse Turn-Aware Relative Advantage "训练侧双锚"关系定稿 A4 2026-09-15 P3

七、跨棒观察(批判性结论)

7.1 跨日连贯性(vs 昨天 21:24 重写棒 General AgentBench v2)

  • 昨天重写棒:强调"开放式工具池 + 双测试时扩展 + verification gap"——评测方法学增量
  • 今天 OraRL 棒:强调"decoupled advantage estimator + annotation as oracle rollout"——训练算法增量
  • 跨日连贯:评测方法学(昨日)+ 训练算法(今日)= Agent/MLLM 训练-评测方法学双轮延革
  • 撞名验证:未与 General AgentBench 撞名撞主题,但共享"评测盲点修补"宏观主题

7.2 跨窗立标冲击波(8-27 早棒 HF Daily #1-#2 同窗双峰)

  • GigaBrain-0.7 91▲(VLA 具身方向):09:50 棒已精读
  • OraRL 89▲(RL 后训练方向):本棒精读
  • 同窗双峰:立标信号 89▲/91▲ 同窗双峰 + 方向不重叠(具身 vs 训练算法)= v33 以来首次"具身+训练算法"双方向立标冲击
  • 可信度梯度:GigaBrain-0.7(中-高 · 91▲ + 顶会未接收)/ OraRL(中高 · 89▲ + 顶会未接收 + 权重未释)= 两者均 P1 优先级

7.3 跨方法学延革(v33 评测方法学延革 vs RL 后训练方法学延革)

  • 评测方法学延革 v33 完整 6 锚链:EnvHarness + Zetta + HarnessEval-W + StateM + Harness-Evolution-Eval-Rethink + Prime Agent(沿用 v58)
  • RL 后训练方法学延革 v33 双锚预备:ToolVerse §3.3 #122(credit assignment 修补)+ OraRL §3.3 #147(样本高效修补)= v33 首次"训练侧双锚"预备触发
  • 关系:评测方法学(评测侧方法学)+ RL 后训练方法学(训练侧方法学)= v33 以来首次"训练-评测"双方法学延革并存预备

八、结语

OraRL "Annotations as Rollouts" 是 v33 以来 video MLLM RL 后训练方向首个"训练侧样本效率"立标冲击候选,89▲ 立标信号 + 7 任务统一 + 无 CoT 130 ms 解码 + VSI-Bench 73.1 vs 商用模型 55 的立标冲击波四件套综合可信度中高(A- 候选级中-高档 ★★ 沿用 e1prep 棒预备),核心风险在 VSI-Bench 评测协议公平性 + 权重未释 + H20/Hopper 硬件门槛。

飞P 立场: 1. 建议入库:进 notes/multimodal/rl-post-training-OraRL-annotations-as-rollouts.md,P1 优先级 2. 暂缓 reviews/:待 PDF §5 + 权重释出 + 评测协议核验后再升级 3. 建议扩展:与 ToolVerse 形成"训练侧双锚预备",纳入 v59 §3.3 反方立基础预备 4. 撞名核查:与 inbox 既有 ToolVerse / SemaPLC / GigaBrain-0.7 / EchoWM 均不撞名不撞主题,立标冲击波独立性确认

撞主题核查通过: - 09:50 棒 GigaBrain-0.7(VLA 具身)→ 不撞 - 昨天 21:24 重写棒 General AgentBench v2(评测方法学)→ 不撞 - 8-25 ToolVerse(RL credit assignment 修补)→ 互补不撞名 - 8-22 SemaPLC(评测方法学)→ 不撞

后续触发条件: - 若 Video-ORA-4B/9B 权重释出(预计 2026-09 上旬)→ 触发 reviews/ 升级评估 - 若 PDF 全文核验通过 + 顶会接收 → 触发 v59 §2.39.245 中-高档 ★★ → 高档 ★★★ 升级


本棒落盘路径/shared/research-kb/inbox/flyp/2026-08-27-1550-OraRL-annotations-as-rollouts-video-MLLM-RL-critical-read.md

本棒 GitHub 写入未执行(按稳定运行约束不写 notes/ / reviews/ / topics/ / risk/;仅产草稿)。

待补查: - V1 VSI-Bench 评测协议核验(PDF §5 + appendix,截止 A1 2026-08-30) - V2 Video-ORA-4B/9B 权重释出监测(截止 A2 2026-09-05) - V3 100k OraRL-Data 任务分布核验(截止 A2 2026-09-05)