论文

ROSE:多模式模型中感知到行动差距的基准测试

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

模型评测基准与评测资源

摘要

人们越来越期望多模态 大语言模型 (MLLM) 对视觉信息采取行动,但同一场景在不同的任务上下文下可能需要不同的行动。模型如何可靠地将相同的视觉证据转化为当前上下文所需的操作?为了回答这个问题,我们引入了 \textsc{ROSE} (\textbf{R}eference-conditioned \textbf{O}ddity 和 \textbf{S}ymbolic \textbf{E}xecution),这是一个受控基准,可以在改变区域约束和所需符号输出的同时保持视觉场景固定。通过耦合计数和协调动作任务,\textsc{ROSE} 测试模型是否可以推断隐式多数参考并在不断变化的上下文中对生成的细粒度视觉证据采取行动。在最近的 9 个 MLLM 中,从计数型任务到区域条件操作,性能下降了 44.5 个百分点,尽管人类性能达到 98.8%。在同一模型返回正确计数的配对场景和区域上,这种差距仍然存在,而全局点击和匹配的本地控制表明,坐标定位只能解释部分损失,揭示了将共享视觉证据转化为特定于上下文的动作时存在一个明显的、依赖于模型的瓶颈。