> AI HOT 收录(arXiv 2608.09853,HuggingFace Daily Papers,2026-08-10) > 二次源:arXiv cs.RO 论文 + HuggingFace 论文页
一、问题:机器人奖励模型卡在哪
通用机器人策略学习里,价值模型正卡在两个矛盾上:
– 监督信号难迁移:现有方法把监督信号锚定在任务内部——偏好(preference)或归一化进度(progress)。这些锚点跨 embodiment、跨数据源迁移时几乎全军覆没 – 标注成本不可扩展:偏好评注需要人对比两条轨迹,进度标注需要人定义阶段切分点。7000 小时的数据让人评一遍要多久?没人能算清楚
RynnValue(arXiv 2608.09853,23 页 5 图)的解法粗暴:扔掉偏好,扔掉进度,直接用时间戳做标签。
二、时间距离为什么可作为监督信号
论文核心思路——把每条轨迹里每个 observation 到语言指定目标的有向 cost-to-go 视为标签——简单到不像能 work:
– 标签天然可生成:每条片段带时间戳,从时间戳直接算 cost-to-go,无需人工 – 跨 embodiment 通用:时间距离不依赖任何 embodiment-specific 的特征 – 零样本迁移:因为监督信号本身与 embodiment 解耦,学到的价值函数在未见任务、未知 embodiment、新视角上可直接泛化
但「时间距离直接做监督」有一个隐含失败模式:模型会走捷径——只看时间早晚,不看任务完成度。RynnValue 用三招压制这个失败:
1. 随机时序采样:训练时打乱轨迹顺序,强制模型看完整任务结构而非时间锚点 2. 时序重排:进一步打乱同一任务内的片段,强化对任务进度的判别 3. Value-isolation attention:在注意力层隔离价值信号通道,让预测对失败和回退敏感而非对时间点敏感
三、数据与基准的硬数字
RynnValue 跑的是 RBM-EVAL-OOD(Out-Of-Distribution 机器人操作评估基准)。数字很硬:
– 训练数据:7000+ 小时,约 300 万条指令条件片段,无偏好标注、无进度标注 – Kendall’s tau_a = 0.675:超过全偏好监督的 SOTA(0.655) – 进步倍数:相对纯进度监督基线(0.292),Kendall’s tau 提升超 2.3 倍 – 真实世界策略成功率: – 在线学习:52.5% → 72.5%(+20 个百分点) – 离线学习:63.8% → 82.5%(+18.7 个百分点) – 零样本迁移:未见任务 / 未见 embodiment / 新视角
用「时间戳直接做监督」跑出超过「人工偏好标注 SOTA」的结果,这是关键反转——它意味着具身智能价值建模的瓶颈不是模型架构,是数据标注成本。
四、从「偏好」到「时间」意味着什么
偏好标注是过去两年具身基础模型的主流路线——Collective Human Feedback 类工作、RLHF 风格的偏好对、Bradley-Terry 模型,全部依赖「人对比两条轨迹」。
RynnValue 走出了一条完全不同的数据获取路径:
| 维度 | 偏好标注路线 | 时间距离路线 |
|---|---|---|
| 标签来源 | 人对比两条轨迹 | 轨迹自带时间戳 |
| 标注成本 | O(n²) 配对 | O(1) 直接生成 |
| Embodiment 迁移 | 差(偏好是 embodiment-specific) | 强(时间距离跨 embodiment 通用) |
| 数据规模上限 | 万小时级(人力限制) | 千万小时级(自动生成) |
| 失败敏感度 | 强(人能看出来失败) | 中(需模型设计压制) |
最后一行是 RynnValue 的工程核心——它把失败敏感度的短板用 attention 设计补回来了。模型架构不复杂,价值-isolation attention 是核心 trick,把价值信号的预测通道跟「时间早晚的捷径预测」强制分开。
五、潜在奖励接口的连锁效应
RynnValue 的工程价值不只是基座模型本身,是它产出的 dense reward。
论文里把时间距离价值函数转成基于势函数的塑形奖励(potential-based shaping),这是 RL 里公认的「保形最优策略」塑形方法——能改路径不改变最优解。
这个接口带来的连锁效应:
– 可插入任何 RL 算法:PPO / SAC / IQL 全部能用,因为接口是标准 dense reward – 可与 VLA 模型组合:RynnValue 当 critic,π0 / OpenVLA 当 actor,分工清晰 – 可驱动 sim-to-real:仿真里跑时间距离价值模型,真机部署时不需重新训练
这跟 OpenAI o1 类推理模型用 process reward model 当 verifier 的设计一脉相承——奖励信号通用化是具身智能走向工业化的关键一步。
六、限制与下一步
RynnValue 不是银弹,三个真限制:
1. 时间戳可靠性:如果原始数据时间戳不准(比如不同机器人系统时钟不同步),标签会自带噪声。论文假设数据来自同一设备集群,但工业部署会跨厂商 2. 任务结构稳定性:价值模型假设任务有清晰的「从起点到目标」结构。如果任务目标本身模糊(比如「让用户满意」),时间距离信号会退化成时间长度预测 3. Embodiment OOD 极限:零样本在未见 embodiment 上 work,但跨形态(腿式→轮式→飞行)是否还稳定,论文没充分验证
下一步关键节点:
– 开源权重发布:论文是 8-10 提交,权重是否一并开源决定工业落地速度 – 跨厂商数据训练:如果英伟达 GR00T、谷歌 DeepMind RT-2、Physical Intelligence π0 团队愿意用同一时间距离路线做对照,价值建模会快速收敛 – 跟 VLA 模型的耦合实测:单独跑价值模型提升 20 个百分点是清晰的,但插到 OpenVLA / π0 / Helix 里提升多少是关键
—
核心数据:7000+ 小时训练数据、300 万条指令片段、Kendall’s tau_a 0.675 vs SOTA 0.655 vs progress-only 0.292、真实世界策略成功率在线 52.5%→72.5%、离线 63.8%→82.5%、23 页 5 图、8-10 提交 时间线:arXiv 2608.09853 v1(2026-08-11 01:09 UTC),cs.RO 类目,HuggingFace Daily Papers 收录 来源:arXiv、HuggingFace Daily Papers、智源/阿里论文讨论组
