论文

InterSocialBench:对人类和大语言模型对伴侣机器人社交行为的偏好进行基准测试

InterSocialBench: Benchmarking Human and LLM Preferences for Companion-Robot Social Behavior

模型评测基准与评测资源

摘要

伴侣机器人面临着日常情况,其中几种可行的行为可能是合适的,但不同的人喜欢不同的反应。我们引入了 InterSocialBench,它是 210 个家庭场景和 18 种高级行为的基准,将 100 名人类参与者的判断与来自 7 个大型语言模型在 16 种人格条件下的 23,520 个响应进行配对。每个人工注释都保留了首选操作以及明确合适和不合适的候选操作。结构化的施工管道涵盖了行为选择、竞争情境线索以及相关的历史和未来任务。评估使用可训练预测变量的场景分组分割来区分首选协议和明确拒绝。简单的频率和角色投票基线说明了这些目标。在测试的提示中,模型和人类的行为分布有所不同,并且在匹配响应计数后,多样性差距仍然存在:人类在每个场景中表现出 4.68 个不同的选择,而模型为 2.06--3.46 个。人类情景层面的多数一致性为 51.5%,描述的是分歧而不是通用预测上限。 InterSocialBench 支持评估社会行为选择,而无需用单一共识标签取代个人判断。