论文

R2S-Eval:用视觉语言模型与真实到仿真校准评估机器人

R2S-Eval: Robot Evaluation with Real-to-Sim Calibration via Vision-Language Models

模型评测评测方法与指标

摘要

随着通用模型,特别是视觉-语言-动作(VLA)模型被部署在物理机器人上,评估机器人操纵策略变得越来越重要。然而,传统的现实世界评估仍然是劳动密集型、不稳定且信息不足。它需要重复的硬件试验、手动场景重置和持续的操作员监控,可能会在重复评估中产生不同的策略排名,并且主要依赖于提供有关执行质量的有限信息的成功率指标。相比之下,人类通过观察和比较完整的行为来评估机器人的性能,而不是仅仅依赖于二元的成功结果。为此,我们提出了 R2S-Eval,一种将真实到模拟校准与视觉语言模型 (VLM) 偏好评估相结合的评估管道。真实到模拟组件可在根据真实评估设置进行校准的模拟器中高效生成展示视频,从而减少重复硬件试验的需要。 VLM 评估器评估执行轨迹视频的执行质量并产生成对偏好,随后将其汇总到策略排名中。我们进一步引入了一个协议来评估所提出的评估管道是否产生经过验证的政策结论,同时减轻传统现实世界评估的关键挑战。模拟和现实环境中的实验表明,R2S-Eval 可以产生可靠且稳定的策略结论,与人类偏好一致,大大减少重复的硬件操作工作,并揭示二进制成功标签未捕获的行为质量差异。总的来说,R2S-Eval 将机器人评估从手动成功计数转向自动化、统计稳定和质量感知的机器人行为评估。项目页面:https://r2s-eval.github.io。