RynnValue:以时间距离为监督目标的机器人价值基础模型 RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
用时间戳免费导出的时间距离取代偏好与进度标注,训练出可作稠密奖励的机器人价值基础模型。
前置知识
价值函数与 Cost-to-Go
在最优控制中,价值函数 $V(s)$ 表示从状态 $s$ 出发到达目标所需的期望累计成本(cost-to-go)。在最小时间目标下,它退化为到达目标所需的剩余时间(hitting time)。它是有向的、以目标为条件的:同一状态对不同任务、不同完成点取值不同。
本文的核心主张就是把奖励模型的监督目标从归一化进度换成这种标准价值语义——时间距离。理解 cost-to-go 才能明白它为什么比进度更符合控制论意义上的价值,以及为什么能经势能塑形转成稠密奖励。
基于势能的奖励塑形(Potential-based Reward Shaping)
Ng 等人证明,若以势函数 $\Phi(s)$ 构造塑形奖励 $r' = r + \gamma\Phi(s') - \Phi(s)$,可以保证最优策略不变。本文把价值模型预测的剩余时间取负号作为势 $\Phi_t = -v_t$,为策略学习提供稠密且不改变任务最优解的奖励信号。
RynnValue 不直接输出奖励,而是输出时间距离,再经势能塑形接入下游在线/离线 RL,这是论文全部真机实验闭环的关键接口,公式 $r'_t=\kappa(\gamma\Phi_{t+1}-\Phi_t)+$ 稀疏项贯穿第 4.5 节。
Kendall's τa(秩相关系数)
Kendall's τa 衡量两个排序的一致程度,取值 $[-1,1]$:完全一致为 1,完全相反为 -1,随机为 0。轨迹排序基准用『模型预测分值 induced 的排序』与『人工标注质量排序』之间的 τa 来评价奖励/价值模型的好坏。
RBM-EVAL-OOD 上 0.675 vs 0.655 等所有核心数值结论都用该指标度量,不理解它就无法判断这些数字的含义与量级。
Symlog 分箱与 Two-hot 分布式回归
把连续数值回归转成稳定分类:先用 symlog 变换压缩数值动态范围(大值压缩、近零保持不失真),划成 256 个 symlog 间距的分箱;每个连续目标由相邻两个箱按比例权重表示(two-hot 编码),使梯度大小与目标量纲解耦;推理时按 softmax 期望箱心经 symexp 反变换解码出连续值。
RynnValue 的绝对/相对时间头完全建立在这套机制上:绝对范围 $[0,512]$ 秒、相对范围 $[-256,256]$ 秒各 256 个 symlog 分箱,这是它能稳定输出连续秒数预测的技术基础。
捷径学习与注意力掩码
捷径学习指模型不学任务相关视觉证据,而利用输入中的虚假规律(如均匀采样间隔、观测展示顺序)直接推出标签。注意力掩码可以显式控制 Transformer 内部的信息流,阻断特定 token 之间的注意力连接,从架构层面堵死标签泄漏路径。
论文的时序打乱与『价值隔离注意力』正是针对三类捷径(采样间隔、序列位置、价值 token 外推)的系统性防御,消融显示去掉它们后 Kendall's τa 从 0.675 跌到 0.189/0.482,是理解本文贡献的关键。
研究动机
通用机器人策略越来越多靠强化学习训练,但真正卡住规模化的是奖励监督而非策略容量:手工设计的奖励无法覆盖开放任务,稀疏成功信号对长程行为几乎没有指导。现有通用奖励模型都绑定『任务内锚点』——要么需要人工构造轨迹偏好对(如 Robometer、RoboReward),要么依赖参考演示或局部状态比较,这些标注与特定轨迹或比较集绑定,难以跨本体、跨数据源复用。最常见的替代方案是把每条轨迹内的进度归一化到 $[0,1]$,但归一化进度本质上只是『轨迹内坐标』而非目标条件的 cost-to-go:10 秒任务中点处的 0.5 与 300 秒任务中点处的 0.5 语义完全不同,且无法区分倒退、失败等非单调事件,在不同时长、本体、执行速度之间难以保持一致。Robometer 论文自己的消融也显示,只用进度训练的模型在 RBM-EVAL-OOD 上平均 Kendall's τa 仅 0.292,说明进度作为监督目标存在根本缺陷。
本文的目标是本文要把『奖励模型给轨迹内部锚点打分』重构为『价值基础模型预测目标条件的时间距离』:给定语言指令与机器人观测,直接估计从当前状态到语义完成点的剩余时间(有向 cost-to-go),并以此作为统一、可复用的价值接口。具体目标有三层:其一,监督标签必须能从异构数据中免费获得——只需时间戳和完成截断点,无需任何偏好对或进度标注,从而把 10 个公开数据源、7000+ 小时、约 309 万条指令条件片段统一到同一监督之下;其二,大规模学习必须可靠,预测不能被采样间隔、序列位置等捷径污染,要对失败与倒退敏感;其三,预测出的时间距离必须能转化为实用的稠密奖励,在真实机器人的在线与离线 RL 中带来可测量的成功率提升。
与已有工作不同的是,独特切入在于监督目标的替换:与其为异构数据手工设计统一的进度尺度或构造偏好对,不如选一个所有数据源天然自带、且符合控制论价值语义的标签来源——时间戳。任何轨迹只要有指令和完成点,就能自动导出稠密的时间距离监督,这把数据扩展的瓶颈从『标注成本』转移到『数据多样性』本身。第二个独特视角是对多帧价值学习中捷径的系统剖析:作者指出模型可能利用规则采样间隔、观测展示顺序、以及从其他观测的价值查询 token 外推这三条捷径,使预测对失败与回归不敏感,并在视觉采样、时序顺序、注意力架构三个层面分别给出针对性防御。这种把『监督目标语义』与『反捷径架构设计』配对待之的思路,在此前的奖励/价值模型文献中很少被如此显式地处理。
核心方法
RynnValue 是语言条件化的视觉价值模型,骨干为多模态大模型 RynnBrain(主型号 8B,另有 4B 变体),并在大规模机器人数据上继续预训练。输入为任务指令 $\ell$、本体元数据 $m$ 和 $K=8$ 个在不规则时间戳采样的观测帧;模型把它们与查询 token 交织成多模态序列:每个观测 $I_{t_i}$ 后插入 $N=8$ 个绝对值查询组 $V_i$(类型 ),从第二个观测起再插入 $N=8$ 个相对值查询组 $R_{i-1}$(类型 ),组内 token 双向注意力、组间被注意力掩码隔离。两组查询的隐状态沿特征维拼接(保留不同查询位置捕获的互补信息)后,分别送入两个 BroNet 残差 MLP 分布头(隐藏宽 4096、深 8 层、ReLU),把绝对范围 $[0,512]$ 秒与相对范围 $[-256,256]$ 秒各离散为 256 个 symlog 分箱做 two-hot 分类,推理时按期望箱心加 symexp 反变换解码成连续秒数。原 LM 头只负责末尾自然语言输出:先生成视频描述,再输出 Match/Success 判断,不参与数值预测。
核心创新是监督目标的语义替换:以时间距离 $v^\star_i=\max(0, t_G - t_i)$(观测到重标注完成截断点 $t_G$ 的剩余时间)取代归一化进度。与已有方法的本质区别有二。第一,它是有向、目标条件的 cost-to-go,在最小时间目标下对应 hitting-time 语义,天然区分『离完成还剩 2 秒』与『进度 50%』这类被归一化抹平的状态,且可经势能塑形 $\Phi_t=-v_t$ 直接接入标准 RL 理论。第二,标签零构造成本——只依赖时间戳与完成点,不需要偏好对,也不需要为每个数据集定义进度归一化,异构数据由此统一到单一接口。配套的关键洞察是:数据规模本身不保证学到可靠的时间价值,必须同时封堵三类捷径——用随机时间采样破坏采样间隔规律、用时序打乱破坏『序列位置≈进度』的相关性、用价值隔离注意力禁止从未暴露观测的价值 token 外推——迫使每次预测真正依赖对应帧的视觉证据与任务语义。
方法步骤详情
第一步,数据配方:汇聚 AgiBot、EgoDex、Galaxea Open-World、InternData-A1、Open X-Embodiment、RDT、RoboCOIN、RoboMIND、RoboTwin、Soft-FOLD 十个数据源共 1,671,313 条原始 episode;先做指令验证(剔除占位符、数据质量标签、纯运动描述等)与动作相关性过滤(整体保留 83.35% 轨迹单元、98.99% 指令),再按原生子任务标注或整段粗切分,并做截断重标注(去掉完成后的多余动作),最终得到 3,091,969 个指令条件片段,覆盖单臂、双臂移动、灵巧手、仿真与第一人称人类演示;另用 Qwen3-VL-27B 生成片段级视频描述作语言监督。第二步,标签生成:截断点前观测标注剩余时间 $v^\star_i=\max(0,t_G-t_i)$,截断处为 0;相邻展示帧位移 $\Delta^\star_i=t_{i+1}-t_i$ 可正可负。第三步,训练:每样本随机采样 $K=8$ 帧,以 0.5 概率打乱时序(前向偏置游走、回退概率 0.3),对 10% 样本替换指令并掩蔽其绝对损失;总损失 $\mathcal{L}=\mathcal{L}_{abs}+\mathcal{L}_{rel}+\lambda_{lang}\mathcal{L}_{lang}$($\lambda_{lang}=2$),AdamW 学习率 $1\times10^{-6}$、bfloat16、FSDP 混合分片。第四步,推理与奖励:推理时观测按时间序排列但保留隔离掩码,取 $\Phi_t=-v_t$ 为势,经 $r'_t=\kappa(\gamma\Phi_{t+1}-\Phi_t)$ 加稀疏成功项接入离线 IQL 与在线 DSRL(RynnValue 取 $\kappa=0.1$)。
技术新颖性
技术新颖性体现在四个层面。监督目标层面:此前 GVL、VLAC、RoboDopamine、RoboReward、Robometer 均以进度或偏好为锚,本文首次在大规模异构语料上系统论证『时间距离是免偏好的可扩展价值目标』,并以实验证明零偏好数据可超过全偏好监督的 SOTA。架构层面:价值隔离注意力是新的掩码设计——不仅让不同观测的价值查询组互相不可见,还禁止上下文 token 反向注意价值 token,从正反两个方向切断价值信息沿序列传播和外推的路径,与标准因果掩码或前缀 LM 掩码均不同。训练层面:绝对+相对双头对称建模,相对位移可正可负,为非单调行为提供局部学习信号,与全局锚定的绝对目标互补;指令错配增强配合损失掩码教会模型识别『指令与视频不符』而非硬报平滑进度。评估层面:指令-轨迹混淆矩阵与归一化对角边际为『语言接地』提供了可量化诊断协议,暴露部分基线实际依赖通用视觉进度而非指令。
实验结果
基准评测(RBM-EVAL-OOD 轨迹排序,976 条轨迹、6 个分布外数据集,Kendall's τa):RynnValue-8B 平均 0.675(USC Franka 0.667、USC Koch 0.544、USC Trossen 1.000、USC xArm 0.500、MIT Franka 0.503、UTD SO101 0.833),4B 变体也有 0.670,均超过用偏好+进度全监督的 Robometer(RBM-1M) 的 0.655,更把 progress-only 版本的 0.292 甩开约 2.3 倍;对比方法中 GVL 仅 0.199、VLAC-8B 0.049、ReWiND 0.014。4B 到 8B 只涨 0.005,说明收益主要来自时间距离公式化而非模型规模。指令-轨迹对齐:统一协议重评所有基线,RynnValue 对角边际 0.79 最高(RoboReward-8B 0.67、Robometer 0.59、VLAC-8B -0.53),说明预测真正锚定语言目标而非通用视觉进度。消融:去时序打乱跌至 0.189(伤害最大)、均匀采样 0.379、去价值隔离 0.482、去语言监督 0.537、去相对头 0.627(USC Trossen 从 1.000 掉到 0.639)。扩展性:固定任务集加 episode 误差迅速饱和,固定量加任务数误差持续单调下降——多样性而非数据量驱动泛化。真机 RL(双臂 Franka、四任务、每任务 20 次试验):在线平均成功率 RynnValue 72.5% vs Robometer 52.5% vs 稀疏奖励 48.8%(Steak Serving +30pp、Bimanual Transfer +35pp);离线 82.5% vs Robometer 63.8%(SFT 仅 23.8%),并解出了 SFT 成功率为 0 的 Box-in-Drawer(90%)与 Bimanual Transfer(50%);Bread Basket 离线 100% 成功仅用 16.8 个 action chunk(Robometer 80%/18.9,SFT 70%/24.8)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 轨迹排序(RBM-EVAL-OOD,6 个分布外数据集、976 条轨迹) | Kendall's τa(平均) | RynnValue-8B:0.675(4B 变体 0.670) | Robometer (RBM-1M,偏好+进度全监督):0.655 | +0.020,且全程未使用任何偏好标签 |
| 轨迹排序(RBM-EVAL-OOD) | Kendall's τa(平均) | 0.675 | Robometer(Progress only 消融):0.292 | +0.383,约 2.3 倍 |
| 指令-轨迹对齐(instruction-trajectory 匹配诊断) | 归一化对角边际 | 0.79 | 最强基线 RoboReward-8B:0.67(Robometer 0.59,VLAC-8B -0.53) | +0.12 |
| 真实机器人在线 RL(DSRL,4 个双臂 Franka 任务×20 次试验) | 平均成功率 | 72.5% | Robometer 52.5%;稀疏奖励 48.8% | +20.0 个百分点 |
| 真实机器人离线 RL(IQL + π0.5,4 个任务) | 平均成功率 | 82.5% | Robometer 63.8%;SFT 基线 23.8% | 较 Robometer +18.7 个百分点,较 SFT +58.7 个百分点 |
局限与改进
作者承认的局限:其一,在需要精确抓取-抽屉对齐的 Box-in-Drawer 上在线提升有限(RynnValue 70% vs Robometer 65%,共享 50% 起点检查点),因为奖励模型只看第三人称 RGB,视觉相似配置可能对应截然不同的抓取稳定性与对齐质量;其二,模型只从短窗口(训练 $K=8$ 帧、奖励服务下采样到 4 帧)估计时间距离,长时程与流式推理尚未支持;其三,时间距离隐含『近似最小时间』目标假设,无法表达能耗、安全、精度等任务特定成本;其四,塑形奖励之外仍保留人工标注的成功判定作为稀疏项,完全自动化尚未实现。我的补充观察:完成截断点靠启发式修剪(比例/时长规则)确定,标签质量受子任务切分与截断选择影响,论文未量化截断标注误差如何传播到价值预测;基准评测只取最后一帧绝对时间距离做排序,未报告全程曲线一致性指标;训练数据以成功演示为主(四个真机任务采集成功率 96-99%),模型在大量失败探索数据上的行为尚不清楚;RynnValue-4B 与 8B 几乎同分(0.670 vs 0.675),提示该设定下继续堆参数收益有限,研究重心应转向数据与目标设计。
独立分析的弱点
独立分析的弱点与改进方向:(1) 视觉歧义场景奖励校准差——Box-in-Drawer 上仅凭第三人称 RGB 无法区分抓取稳定性,可融合本体感知、腕部相机或深度/点云输入,或让价值头显式条件化于力/接触信号;(2) 最小时间目标过于单一——真实任务常需在速度、安全、精度间权衡,可把时间距离推广为加权 cost-to-go $\sum_t c_t$,用可切换的成本函数扩展价值语义;(3) 短窗口记忆受限——$K=8$ 帧、推理仅 4 帧难以覆盖分钟级长程任务,可引入流式状态记忆或秒级+分钟级分层时间头;(4) 截断重标注启发式脆弱——不同数据集用不同比例/时长修剪规则近似语义完成点,可训练专门的完成边界检测器,或利用语言分支的 Success 判断自动校准截断;(5) 稀疏成功项仍需人工标注——可改用语言分支的 Match/Success 自动判定,但需先量化其可靠性与人工标注的一致率;(6) 相对头的收益部分依赖打乱策略(回退概率 0.3),而部署推理始终正序,训练-推理时序分布不一致对相对预测稳健性的影响值得专项检验。
未来方向
作者提出的方向:把 RynnValue 扩展到更长时间程与流式推理,使其成为真正的在线奖励源;在时间距离之外引入任务特定成本(能量、安全、精度),获得更丰富的价值语义;扩展到灵巧手等更多末端执行器以及移动操作,让长时程导航与交互统一在同一时间价值接口之下。基于其成果可自然延伸:其一,把时间距离势能用于策略预训练本身(value 引导的模仿学习或优势加权 BC),而不只作 RL 奖励;其二,利用绝对/相对时间估计做子目标分解与技能拼接,自动把长演示切成时间距离递减的技能链;其三,研究跨本体时间价值迁移的标度律,验证『任务多样性驱动泛化』在更大语料上是否持续成立;其四,把失败检测与指令错配判断接入在线恢复机制,触发人类干预或策略回退;其五,在奖励服务中引入不确定性估计(如分箱分布的熵),让 RL 代理对低置信奖励自动降权。
复现评估
复现条件总体友好但门槛分层。开源情况:代码(GitHub: alibaba-damo-academy/RynnValue)、模型权重(HuggingFace 与 ModelScope 合集)、项目主页均公开,透明度较好。数据方面:训练语料全部来自公开数据集(AgiBot、EgoDex、OXE 等十源),附录给出 curation 管线的量化报告(83.35% 轨迹单元保留、98.99% 指令保留)及来源级规则,可复现数据构造。评测方面:RBM-EVAL-OOD 公开,基准结论最容易复现,只需对每条轨迹跑一次绝对头推理;消融与 scaling 实验依赖 8B 骨干继续预训练,论文未披露预训练 GPU 时数,估算需要数十张 A100/H100 级别卡运行数周,这是最大成本项。真机 RL 难度最高:需要双臂 Franka、4 台 RealSense(2×D435 + 2×D405)与人工重置/成功标注;离线 IQL 可在 2×80GB GPU 上约 16 小时/任务复现,在线 DSRL 需 8×RTX 5090 约 1.5 小时/任务,附录 Table 9/10 提供了完整超参数(折扣、塑形系数 κ、网络结构等均已列明)。综合评估:benchmark 层面高置信可复现,真机 RL 结论需要可观的硬件与运维投入。
论文图表