论文

心智理论的提升真的有利于人机交互吗?来自交互式评估的实证发现

Does Theory of Mind Improvement Really Benefit Human-AI Interactions? Empirical Findings from Interactive Evaluations

模型评测评测方法与指标

摘要

提升大语言模型(LLM)的心智理论(ToM)能力对这些AI模型与人类之间的有效社交互动至关重要。然而,现有基准往往通过读故事、第三人称视角的选择题来衡量ToM能力的提升,忽视了人机(HAI)交互的第一人称、动态和开放式特性。为直接检验ToM提升技术如何有益于HAI交互,我们首先提出了兼具视角与指标转变的交互式ToM评估新范式。随后,依照该范式,我们使用四个真实世界数据集和一项用户研究,对四种代表性ToM增强技术开展系统研究,涵盖目标导向任务(如编程、数学)与体验导向任务(如心理咨询)。我们的发现揭示,静态基准上的提升并不总能转化为动态HAI交互中的更好表现。本文为ToM评估提供了关键洞见,表明在开发面向人机共生的下一代社会感知LLM时,基于交互的评估十分必要。

心智理论的提升真的有利于人机交互吗?来自交互式评估的实证发现:论文配图
图1:基于新的动态交互式评测范式,研究考察经心智理论(ToM)增强的LLM在人机共生交互中的实际效果。