论文

MindZero:零标注学习在线心理推理

MindZero: Learning Online Mental Reasoning With Zero Annotations

模型训练强化学习

摘要

有效的现实辅助要求AI智能体具备稳健的心智理论(ToM):从人类行为推断其心理状态。尽管近期有所进展,若干关键挑战仍然存在,包括(1)在多个假设上进行稳健不确定性更新的在线推理;(2)适合实时辅助的高效推理;以及(3)现实领域中缺乏心理状态真值标注。为应对这些挑战,我们提出MindZero,一个自监督强化学习框架,用于训练多模态大语言模型(MLLM)实现高效且稳健的在线心理推理。训练过程中,模型因生成能最大化由规划器估计的观测动作似然的心理状态假设而获得奖励,这类似于基于模型的ToM推理。因此该方法免除了对显式心理状态标注的需求。训练后,MindZero将基于模型的推理内化为快速的单次前向推理。我们在网格世界与家庭领域的挑战性心理推理和AI辅助任务上,将MindZero与基线进行对比评估。我们发现仅靠LLM并不足够;基于模型的方法提高了准确性,但速度慢、开销大,且受限于主干MLLM的容量。相比之下,MindZero增强了MLLM内在的ToM能力,在准确性与效率上均显著超越基于模型的方法,表明心理推理可以有效作为一种自监督技能来学习。

MindZero:零标注学习在线心理推理:论文配图
图 1:主动协助的在线心理推理示例,其中辅助智能体同时推断主智能体的目标并帮助更快地实现目标。如本例所示,助手随着时间的推移观察主代理的行为,MindZero 不断更新多个目标假设的概率分布。根据每一步维护的多种可能假设,帮助者决定是否采取行动,并主动拿起相关餐具并将其放在桌子上。随着观察到新的行为,不同心理状态假设的概率会随着时间的推移而更新。特别是,从步骤 2 到步骤 3 的过渡表明,主代理抢到第二个盘子增加了步骤 2 中第二个假设的可能性。