RynnValue:机器人价值建模用「时间距离」撕开 7000 小时数据

> AI HOT 收录(arXiv 2608.09853,HuggingFace Daily Papers,2...

> AI HOT 收录(arXiv 2608.09853,HuggingFace Daily Papers,2026-08-10) > 二次源:arXiv cs.RO 论文 + HuggingFace 论文页

一、问题:机器人奖励模型卡在哪

通用机器人策略学习里,价值模型正卡在两个矛盾上:

监督信号难迁移:现有方法把监督信号锚定在任务内部——偏好(preference)或归一化进度(progress)。这些锚点跨 embodiment、跨数据源迁移时几乎全军覆没 – 标注成本不可扩展:偏好评注需要人对比两条轨迹,进度标注需要人定义阶段切分点。7000 小时的数据让人评一遍要多久?没人能算清楚

RynnValue(arXiv 2608.09853,23 页 5 图)的解法粗暴:扔掉偏好,扔掉进度,直接用时间戳做标签

二、时间距离为什么可作为监督信号

论文核心思路——把每条轨迹里每个 observation 到语言指定目标的有向 cost-to-go 视为标签——简单到不像能 work:

标签天然可生成:每条片段带时间戳,从时间戳直接算 cost-to-go,无需人工 – 跨 embodiment 通用:时间距离不依赖任何 embodiment-specific 的特征 – 零样本迁移:因为监督信号本身与 embodiment 解耦,学到的价值函数在未见任务、未知 embodiment、新视角上可直接泛化

但「时间距离直接做监督」有一个隐含失败模式:模型会走捷径——只看时间早晚,不看任务完成度。RynnValue 用三招压制这个失败:

1. 随机时序采样:训练时打乱轨迹顺序,强制模型看完整任务结构而非时间锚点 2. 时序重排:进一步打乱同一任务内的片段,强化对任务进度的判别 3. Value-isolation attention:在注意力层隔离价值信号通道,让预测对失败和回退敏感而非对时间点敏感

三、数据与基准的硬数字

RynnValue 跑的是 RBM-EVAL-OOD(Out-Of-Distribution 机器人操作评估基准)。数字很硬:

训练数据:7000+ 小时,约 300 万条指令条件片段,无偏好标注、无进度标注 – Kendall’s tau_a = 0.675:超过全偏好监督的 SOTA(0.655) – 进步倍数:相对纯进度监督基线(0.292),Kendall’s tau 提升超 2.3 倍 – 真实世界策略成功率: – 在线学习:52.5% → 72.5%(+20 个百分点) – 离线学习:63.8% → 82.5%(+18.7 个百分点) – 零样本迁移:未见任务 / 未见 embodiment / 新视角

用「时间戳直接做监督」跑出超过「人工偏好标注 SOTA」的结果,这是关键反转——它意味着具身智能价值建模的瓶颈不是模型架构,是数据标注成本。

四、从「偏好」到「时间」意味着什么

偏好标注是过去两年具身基础模型的主流路线——Collective Human Feedback 类工作、RLHF 风格的偏好对、Bradley-Terry 模型,全部依赖「人对比两条轨迹」。

RynnValue 走出了一条完全不同的数据获取路径

维度偏好标注路线时间距离路线
标签来源人对比两条轨迹轨迹自带时间戳
标注成本O(n²) 配对O(1) 直接生成
Embodiment 迁移差(偏好是 embodiment-specific)强(时间距离跨 embodiment 通用)
数据规模上限万小时级(人力限制)千万小时级(自动生成)
失败敏感度强(人能看出来失败)中(需模型设计压制)

最后一行是 RynnValue 的工程核心——它把失败敏感度的短板用 attention 设计补回来了。模型架构不复杂,价值-isolation attention 是核心 trick,把价值信号的预测通道跟「时间早晚的捷径预测」强制分开。

五、潜在奖励接口的连锁效应

RynnValue 的工程价值不只是基座模型本身,是它产出的 dense reward。

论文里把时间距离价值函数转成基于势函数的塑形奖励(potential-based shaping),这是 RL 里公认的「保形最优策略」塑形方法——能改路径不改变最优解。

这个接口带来的连锁效应:

可插入任何 RL 算法:PPO / SAC / IQL 全部能用,因为接口是标准 dense reward – 可与 VLA 模型组合:RynnValue 当 critic,π0 / OpenVLA 当 actor,分工清晰 – 可驱动 sim-to-real:仿真里跑时间距离价值模型,真机部署时不需重新训练

这跟 OpenAI o1 类推理模型用 process reward model 当 verifier 的设计一脉相承——奖励信号通用化是具身智能走向工业化的关键一步。

六、限制与下一步

RynnValue 不是银弹,三个真限制:

1. 时间戳可靠性:如果原始数据时间戳不准(比如不同机器人系统时钟不同步),标签会自带噪声。论文假设数据来自同一设备集群,但工业部署会跨厂商 2. 任务结构稳定性:价值模型假设任务有清晰的「从起点到目标」结构。如果任务目标本身模糊(比如「让用户满意」),时间距离信号会退化成时间长度预测 3. Embodiment OOD 极限:零样本在未见 embodiment 上 work,但跨形态(腿式→轮式→飞行)是否还稳定,论文没充分验证

下一步关键节点:

开源权重发布:论文是 8-10 提交,权重是否一并开源决定工业落地速度 – 跨厂商数据训练:如果英伟达 GR00T、谷歌 DeepMind RT-2、Physical Intelligence π0 团队愿意用同一时间距离路线做对照,价值建模会快速收敛 – 跟 VLA 模型的耦合实测:单独跑价值模型提升 20 个百分点是清晰的,但插到 OpenVLA / π0 / Helix 里提升多少是关键

核心数据:7000+ 小时训练数据、300 万条指令片段、Kendall’s tau_a 0.675 vs SOTA 0.655 vs progress-only 0.292、真实世界策略成功率在线 52.5%→72.5%、离线 63.8%→82.5%、23 页 5 图、8-10 提交 时间线:arXiv 2608.09853 v1(2026-08-11 01:09 UTC),cs.RO 类目,HuggingFace Daily Papers 收录 来源:arXiv、HuggingFace Daily Papers、智源/阿里论文讨论组

发表回复

人生梦想 - 关注前沿的计算机技术 acejoy.com 🐾 步子哥の博客 🐾 背多分论坛 🐾 借一步网 🐾 智柴网 沪ICP备2024052574号-1