论文
经视觉动作结果推理对齐桥接物理推理与任务泛化
Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
摘要
视觉语言模型(VLM)在交互式物理推理中难以泛化——尤其在未见任务与环境。两个关键失败模式突出:与物理现实矛盾的幻觉思维链推理,以及模型推理与动作之间的错位。我们提出VAORA(视觉动作结果推理对齐):直接解决这两个问题的新奖励设计。VAORA引入两个互补奖励:视觉对齐奖励——独立于智能体动作本身、把VLM推理锚定到视觉上下文;视觉—动作对齐奖励——把推理落地到模型动作诱导的视觉结果。两者共同抑制幻觉CoT并缩小推理与行为之间的差距。为改善训练稳定性,我们进一步用预训练域内专家智能体估计成功概率、施加平滑稠密奖励。PHYRE与Virtual Tool上的实验在novel-task与unseen-environment设定下支持其表现——确认VAORA可诱导落地且可泛化的物理智能。
