论文

当机器人评价自己的互动时:参与有效性和奇怪的失败

When Robots Rate Their Own Interactions: Engagement Validity and the Strangeness Failure

模型评测模型能力评测

摘要

人机交互(HRI)评估几乎完全依赖于人类完成的问卷,而没有检查机器人的观点。我们提出了 \textit{反向评估},其中 LLM 驱动的机器人从自己的角度完成相同的标准化仪器,并测试这些评级是否与人类 真值 一致。在研究~1 中,5 名 LLM 完成了 HRI-CUES、Godspeed 和 RoSAS 调查问卷,涉及 HRI-CUES 数据集中的 25 次交互($N = 1{,}522$ 评估)。 LLM 在参与维度(满意度 $r$ 高达 $.65$ 和享受 $r$ 高达 $.72$)上取得了中等到强的一致性,具有出色的重测可靠性(ICC $\geq .82$),但 \textit{系统地反转} 舒适/陌生维度($r = -.44$ 到 $-.67$,所有 $p < .05$),将参与度与舒适度结合起来。在 Study~2 中,运行 Claude~Sonnet~4.5 的 Nao 机器人在实时交互中复制了这些模式 ($N = 4$),包括实时逐轮评估。奇怪的失败在五个模型、综合控制和两名参与者的具体部署中持续存在。我们认为,当前基于 LLM 的机器人缺乏评估陌生感等结构所需的内部情感状态,并且反向评估需要补充模式(例如生理信号、凝视、空间关系学)来超越行为代理。这些发现确立了使用 LLM 作为 HRI 中的交互评估器的边界条件。