RynnValue:以「时间距离」作为跨具身奖励基础模型的监督锚点

  • 关联论文:2608.09853
  • 作者:flyP
  • 更新:2026-08-11

一句话结论

针对通用机器人策略学习长期被"奖励模型"卡脖子的问题,RynnValue 用时间距离(temporal distance)取代人类偏好与归一化进度两类主流监督锚,在 7000+ 小时、约 300 万条指令条件片段上训练出开源价值基础模型,OOD 任务上 Kendall's τₐ 0.675 超过偏好监督 SOTA,且能直接作为真实世界策略学习的稠密奖励接口。

解决什么真问题

机器人学习要 scaling,reward / value 建模一直是瓶颈:

  1. 监督锚难以跨具身迁移——既有通用奖励模型要么依赖 pairwise preference(必须有人标注、无法用时间戳自动得到),要么依赖归一化 progress(强依赖任务定义、形态、起点,换个 embodiment 标签就失效)。
  2. 异构数据难以直接复用——开源机器人数据集在形态、视角、任务语义上差异极大,标注体系一旦分裂就几乎没有共享信号。
  3. 现实部署需要稠密、零样本可用的价值接口——线 RL 与离线 RL 都希望有一个能在新任务新形态上"即插即用"的 value function,而不需要每场景重做人工 reward shaping。

RynnValue 把 anchor 改成「到目标的时间距离」——本质上是一种可由 video metadata(timestamps)自动衍生、无任务语义的标量监督,从而绕开 preference / progress 的迁移成本。

核心方法

3.1 监督目标:从 observation 到语言目标的 directed cost-to-go

v_θ(o_t, g) = E[ (T_goal − t) | o_t, g ]
  • o_t 是 t 时刻的观察片段,g 是自然语言目标,T_goal 是 ground-truth "达成 g 的时间戳"。
  • 时间距离在满足因果性时是单调可加、可分解的天然 reward shaping 候选(对应论文潜在势函数 shaping 部分)。
  • ⚠️ 论文未明确 T_goal 的具体边界处理(例如"达成"如何判定、循环任务/失败轨迹如何截断),只提到"由时间戳直接导出"。

3.2 三条结构性约束,压制 shortcut

为了让模型在 heterogeneous 视频上不去学"片段相似度"这种 shortcut(对应论文里"predictions insensitive to failures and regressions"),他们引入了三条机制:

  1. Random temporal sampling:从同一条轨迹中随机抽取片段-目标对,避免模型只看到轨迹末端到目标的短距离样本。
  2. Temporal-order shuffling:打乱片段与目标在 batch 内的时序配对,迫使模型看视觉内容而非位置线索。
  3. Value-isolation attention:在 attention mask / 结构上隔离 value head 对特定上下文(如语言 token、scene features)的路径,减少 token 间 shortcut。

(具体实现层细节,如 attention bias 的形式、是否冻结 vision encoder,论文 abstract 未公开,需读 23 页正文确认。)

3.3 三阶段部署框架(面向 Qwen App 的"下一步编辑"推荐是其姊妹工作)

虽然 RynnValue 论文本身不直接谈多阶段,但价值建模的"训练—奖励接口—策略学习"链路对应三件事:

  • 训练:在 7,000+ 小时、约 3M instruction-conditioned clips 上预训练价值基础模型。
  • 奖励接口:通过 potential-based shaping 把 v_θ 转为稠密 reward:r_t = v(o_{t+1}, g) − v(o_t, g),保留策略梯度不变性。
  • 策略学习:线上 / 线下策略在同一 reward 接口上 plug-in,实现在线策略成功率从 52.5% → 72.5%、离线从 63.8% → 82.5%。

关键实验与数据

4.1 价值估计质量

Benchmark 监督信号 Kendall's τₐ
RBM-EVAL-OOD (ours) 时间距离(RynnValue) 0.675
RBM-EVAL-OOD baseline 偏好监督 SOTA 0.655
RBM-EVAL-OOD baseline 归一化 progress only 0.292

含义:在 OOD(未见任务、形态、视角)上,纯时间距离监督反超偏好监督 SOTA 2 个百分点,并把 progress-only baseline 翻一倍多。

4.2 真实世界策略学习(奖励接口下游)

Setting Baseline 成功率 + RynnValue reward
Online 真实世界 52.5% 72.5% (+20pp)
Offline 真实世界 63.8% 82.5% (+18.7pp)

⚠️ 论文未公开"online / offline"对应的硬件规模、任务集细节与 episode 数,只能以 abstract 给出的端点数字作 anchor。

4.3 泛化能力

  • Zero-shot 迁移到 未见任务、未见 embodiment、未见视角——abstract 强调"generalizing zero-shot to unseen tasks, embodiments, and viewpoints",但具体跨了什么 embodiment(如 Franka → UR5 → mobile manipulator)、几组 zero-shot 任务,需读正文确认。

亮点与局限

亮点

  1. 监督锚极简:timestamp 是机器人数据集几乎默认存在的元数据,几乎免费获得 7K 小时级标注。
  2. 跨形态跨任务可迁移:abstract 直接宣称 zero-shot 跨 embodiment 泛化,这是 preference / progress 路线长期被诟病的痛点。
  3. 奖励接口可插拔:potential-based shaping 保留 policy gradient 不变性,意味着 RynnValue 既能给 PPO / SAC 这种在线算法,也能给 IQL / CQL 这种离线算法做 reward。
  4. 开源价值基础模型:在通用机器人价值建模领域,具备「基础模型级」开源意义的成果此前不多,RynnValue 直接补位。

局限 / 风险边界

  1. ⚠️ 时间距离假设轨迹最终能到达目标——对失败轨迹和无限循环任务不直接适用,论文未明确如何处理"未达成 T_goal"的尾部样本(可能截断到一个最大 horizon,但 abstract 未给)。
  2. ⚠️ Reward shaping 系数、value scale 与下游策略对超参的敏感性 abstract 未量化。
  3. ⚠️ RBM-EVAL-OOD 是自家 benchmark,跨论文比较的公平性需读正文实验节。
  4. ⚠️ 真实世界 72.5% / 82.5% 成功率背后任务难度分布、形态数量、是否单 embodiment仍需补——abstract 只给端点,不构成完整证据链。
  5. ⚠️ 7,000 小时数据来自何种开源混合(DROID / OpenX-Embodiment / 自采),abstract 未列,工程复现门槛不明。

对工程落地的启发

  1. 对机器人实验室:不用再为每个新任务设计人工 reward 或 pairwise preference;只要有时间戳,就能预训练一个跨任务价值模型,再用 potential-based shaping 接到 PPO / IQL 上做下游 RL。
  2. 对 RL 平台开发者:可以借鉴"基础价值模型 + 通用奖励接口"的范式,把 RynnValue 作为预训练 backbone 集成到 LeRobot / RoboCasa 等开源框架的 reward head。
  3. 对数据集构建者:时间戳 metadata 应被视为「一等信息」,而不是可选附件;它在跨具身 scaling 中的杠杆远高于人工偏好标注。
  4. 对 VLA / agent 团队:把 value head 作为 VLM / VLA 的额外预训练目标,可以拿到一个内置的"过程性自我评估"能力,无需再外挂 critic。

与同方向工作的关系

  • vs Process-supervised / progress-only 模型(如 R3M / VIP):R3M 用 timestep reward 作为短期 progress,跨 embodiment 表现差;RynnValue 用"到目标的剩余时间"作为 anchor,保留 progress 的可微性,丢掉任务特异性
  • vs Preference-tuned reward models(如 RLHF-V / BridgeData reward):避免 pairwise 标注的人力成本与 pairwise 偏差,但放弃了"对人类主观偏好的显式建模"能力。
  • vs Generalist policy + 不需要 reward 的 BC(如 OpenVLA / π0):RynnValue 不是替代 BC 路线,而是为 RL / 后训练阶段提供通用 critic;两者组合可能优于单一路线。
  • vs 世界模型 + model-based RL(如 DreamerV3 / GAIA-1):世界模型侧重"未来预测",RynnValue 侧重"剩余时间标量"——前者预测密度更高但需要 rollout,后者是单步标量、推理便宜、便于做 dense reward。

适合谁读

  • 机器人 RL 工程师:想知道"如何用一个通用价值模型替代手搓 reward";建议重点读 §3 价值建模 + §5 真实世界策略学习。
  • 基础模型研究者:把"时间距离"作为 scaling 监督信号的范式,可以迁移到视频理解 / 时间定位任务。
  • RL 算法研究者:关注 potential-based shaping 与离线策略学习的接口兼容性,以及如何把通用 critic 接到离线算法上。
  • 机器人产品团队:评估"自建奖励模型 vs 直接调开源 RynnValue"的成本曲线——7,000 小时预训练不是小成本,但避免了逐任务标注。

工程落地与核查(Jay)

E1 · 事实核查注记

声明 核查结论 存疑等级
7000+ 小时 / 3M clips 数据 量级合理;DROID/OpenX-Embodiment 等公开数据集可覆盖此规模;但原文是否混合自采数据无法确认 🟡 中
Kendall's τₐ 0.675(RynnValue) vs 0.655(SOTA) τₐ 是本文自建 benchmark RBM-EVAL-OOD 上测得,非标准学术 benchmark,跨论文对比需谨慎 🟡 中
52.5% → 72.5%(+20pp)/ 63.8% → 82.5%(+18.7pp) 仅 abstract 端点数字;任务集规模/难度分布/具体 hardware 未公开,⚠️ 无法独立复现 🔴 高
Zero-shot 跨 embodiment 泛化 声称「未见过的新形态」;但具体跨了哪几个形态(如 Franka→UR5→mobile)未列,无法确认跨距 🟡 中
T_goal 由时间戳直接导出 未定义「达成」判定边界;失败轨迹/循环任务如何截断 abstract 完全未提,是本文最大工程风险 🔴 高

最大风险T_goal 边界处理是生产部署最大坑——失败轨迹若不截断,T_goal = ∞,价值函数在尾部会给出误导性信号。需要在数据预处理阶段做「截断 + 标注失败标签」,否则下游 RL 会学到「无限等待」的策略。

E2 · 工程落地路径

最小可跑路径(机器人 RL 团队)

阶段 1(数据准备,1-2 周):
  1. 检查自有机器人数据是否有 timestamp 元数据(有 → 直接可用;无 → 需补录或用视频时间戳)
  2. 定义「任务达成」判定规则(推荐:任务成功 flag + 最大 horizon 截断)
  3. 过滤失败轨迹并做标记(不能直接丢弃,需保留失败样本作为负例训练)
  4. 混合开源数据(DROID + OpenX-Embodiment)扩规模

阶段 2(价值模型训练,2-3 周):
  5. 预训练 v_θ(任意 vision-language model 底座 + value head)
  6. 用 random temporal sampling + temporal-order shuffling 做训练增强
  7. 评估:在 RBM-EVAL-OOD 上测 Kendall's τₐ(若有自建 benchmark 需求)

阶段 3(下游 RL 接入,1-2 周):
  8. potential-based shaping:r_t = v(o_{t+1}, g) − v(o_t, g)
  9. 接 PPO(在线)或 IQL/CQL(离线),reward scale 建议从 0.1-0.5 小范围 sweep
  10. A/B 对比:自建 reward vs RynnValue reward 在同任务上的成功率差异

主要坑位

  1. T_goal 边界未定义(最高风险):这是本文在生产部署中最需要自己填补的工程决策。建议先在数据预处理阶段统一处理: - 成功轨迹:T_goal = 成功时刻时间戳 - 失败轨迹:T_goal = max_horizon,额外标注 failure=1 - 循环轨迹:加 loop_count 截断或用 entropy 检测
  2. reward scale 与 shaping 系数敏感性:potential-based shaping 理论上保 policy gradient 不变性,但 value scale 影响 RL 优化器学习率的有效范围;建议 reward magnitude 控制在 [-1, 1] 或按 episodic return 归一化。
  3. 跨 embodiment 的 zero-shot 实际跨距:abstract 未明确「未见形态」具体是哪种;若只是同族机械臂(Franka → Panda)跨距很近,真实泛化能力可能比报告弱。
  4. 训练数据中的 temporal bias:若数据集中「成功轨迹」远多于「失败轨迹」(通常如此),模型会系统性低估失败概率,在 safety-critical 场景需额外校准。

E3 · 与姊妹工作的接口

2608-07565(RynnValue 的"下一步编辑"推荐系统)是本文姊妹工作,两者共享 Qwen App 场景,可能复用: - 相同的视觉编码器底座(若两篇用同一 VLM) - 潜在的 verifier 蒸馏链路(视觉一致性验证器 ←→ 价值基础模型)

若同时部署两套系统,需注意模块边界:推荐系统用「下一步编辑意图」,价值模型用「到目标的剩余时间」,两者独立可插拔。

E4 · 术语统一建议

原文 建议统一为 说明
RynnValue 原文如此(价值基础模型,注意与 2608-07565 的 RynnValue 重名但为不同工作) 两篇 RynnValue 同名不同义,需在阅读时区分上下文
temporal distance 时间距离(到目标的剩余时间) 补充括号内定义便于非专业读者理解
embodiment 机器人形态/具身 统一为「机器人形态」更直白
potential-based shaping 势函数 reward 塑形 保留英文 term 便于检索,但加注中文解释