论文
推进大型多模态模型的创造性物理智能
Advancing Creative Physical Intelligence in Large Multimodal Models
摘要
大型多模态模型(LMM)在感知与推理上进展迅速,然而这些能力能否超越模式识别、泛化到在开放环境中发现以视觉为依据的解决方案,仍不清楚。在这类场景中,智能不只是回答结构良好的问题,还涉及识别场景中的元素能以哪些非显而易见却物理可行的方式被重新利用。这种创造性问题解决是人类智能的核心,但在现有基准中基本未被检验。为评估这一能力,我们提出MM-CreativityBench,一个面向视觉丰富、物理受约束环境中基于可供性(affordance)的创造性工具使用的基准。每个实例提供一幅场景图像以及候选实体及其部件的结构化视图,从而能够对模型如何迭代检查场景、识别相关可供性并组合视觉与物理上都有依据的解决方案进行细粒度、交互式评估。实验表明,当前LMM常常表现不佳,并非因为缺乏生成能力,而是因为它们无法持续进行有据可依的探索。模型常常忽略相关实体、对关键部件检查不足,或幻觉出图像中缺乏依据的属性。受这一失效模式启发,我们提出基于可供性的对齐方法,将创造性工具使用转化为偏好学习问题。利用直接偏好优化(DPO),我们鼓励模型偏好以视觉证据为依据的属性-可供性推理,而非幻觉出来的替代方案。此外,我们引入源自可供性知识库的监督信号,引导更广泛的实体探索与多轮规划。结果显示,模型在选择正确实体与部件上获得一致提升,同时大幅减少幻觉与接地相关错误。
