TrustRoboReward:面向多范式机器人奖励模型的偏好序保序分数编辑
TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
摘要
奖励模型是具身AI强化学习的瓶颈。长程机器人操作需要超越手工奖励或任务特定标注的可扩展视觉反馈。RoboReward等现有开源VLM奖励裁判采用简单的1-5轨迹进度打分,缺乏RLHF、DPO与Bradley-Terry框架所需的成对偏好,且未能优化视频场景理解。用成对比较与视频问答监督增强RoboReward会导致成对偏好与逐点分数之间的不一致,引入训练噪声并损害下游性能——TrustJudge等聚合方法无法解决这一问题。为此,我们提出TrustRoboReward,一个配备偏好序保序分数编辑(POISE)的多范式奖励建模框架。我们构建统一四范式数据集,含轨迹进度打分(Score-A)、视频问答答案质量打分(Score-B)及其成对对应项(Pair-A、Pair-B)。成对标注比逐点分数更契合人类判断,这启发我们校准逐点分数,以避免与成对偏好相悖的分数对反转。POISE校正逐点分数并消除TrustJudge未能解决的跨范式反转冲突。理论上,POISE将分数对反转冲突从20.15%降至0%,而TrustJudge在同一语料上仍保留20.46%的冲突。在我们的基准上评估,经POISE训练的Qwen3-VL-4B取得77.96%的总体奖励分数,接近GPT-5-mini(78.09%,差距0.13%),并领先最强的RoboReward-4B基线10.13%。它还将测试时分数对一致性提升至71.90%,超过RoboReward-4B(57.26%)与GPT-5-mini(68.09%)。在推理时集成TrustJudge聚合将总体分数提升至78.57%,超越GPT-5-mini教师模型。
