论文
Touch-R1:强化 MLLM 中的触摸推理
Touch-R1: Reinforcing Touch Reasoning in MLLMs
摘要
虽然基于规则的强化学习最近促进了多模态模型中的显式推理,但触觉推理在很大程度上仍未得到充分探索。现有的触觉语言模型主要依赖于监督或对比目标,这限制了它们根据物理证据进行预测或纠正误导性视觉先验的能力。触觉推理引入了两个特定于模态的挑战:物理属性(例如硬度、粗糙度)的顺序性质和光学触觉硬件固有的跨传感器分布变化。在这项工作中,我们介绍了 TouchReason-1M(一个大规模多模态数据集,包含四个不同传感器上超过 100 万个同步触觉对)和 TouchReason-Bench(一个用于评估触觉感知和视觉触觉冲突解决的严格框架)。在此基础上,我们提出了 Touch-R1,一种基于 Qwen2.5-VL-7B 的触觉推理 MLLM。 Touch-R1 通过触觉触觉证据关联 GRPO 目标进行训练,该目标结合了序数感知准确性、跨传感器物理一致性、结构化格式控制和输入侧触觉触觉证据关联目标。具体来说,只有当真实的触觉输入相对于触觉流被删除、打乱或噪声屏蔽的反事实控制产生更高的正确性时,触觉使用奖励才会分配信用。在 TouchReason-Bench 上,Touch-R1-7B 的平均性能优于 Octopi-13B 18.4%,平均优于 GPT-4o 24.7%。其结构化推理痕迹揭示了探究、比较和修正的涌现行为,表明 R1 式推理可以有效地建立在身体接触的基础上。