ReactHuman:基于物理的基准,用于在具体多模态中做出类人反应决策 LLM
ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs
摘要
对突然发生的物理危险(抓住打滑的盘子、躲避掉落的刀)做出反应既是对体现智能的有意义的测试,也是部署多模态 大语言模型(MLLM)作为家用机器人决策核心的硬性要求。然而,现有的评估是通过视频问答被动地探索直观物理,或者针对导航和重新排列等深思熟虑的长期任务;没有一个模型可以衡量模型是否可以将物理理解转化为立即的、安全关键的行动。我们引入了 ReactHuman,这是第一个基于物理的类人反应决策基准,其中评估的 MLLM 充当面临突发家庭危险的模拟人形机器人的大脑;它涵盖 17 个事件系列和超过 1,000 个逐位可重现场景,具有源自 240 Hz 刚体模拟的精确、无注释 真值,包括外观与其物理特性相矛盾的对抗物体(泡沫砧、钢苹果)。我们进一步设计了一个五度量套件,沿着三个轴对每个反应进行评分:合理、安全和物理基础。我们实际执行每一项承诺的计划,以便决策产生可观察到的后果。通过该工具,我们评估了七个具有代表性的 MLLM。结果表明,反应安全远未得到解决:模型错误处理了大约三分之一的危险,根据固定配置而不是观察到的场景采取行动,相信外观而不是运动,即使选择的行动是正确的,也会错过米级的拦截点;这些失败都不会随着模型规模的扩大而缩小。因此,ReactHuman 为以物理规律为依据、具有安全意识的实体提供了细粒度的诊断和可扩展的训练信号。该基准可以在这里找到:https://huggingface.co/datasets/Alan123/react human-benchmark-scaled