论文
FriendBench:人类和多模态的二元熟悉度推理基准 大语言模型
FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
摘要
解读社会情境往往取决于行为,而不仅仅是言语。我们推出了 FriendBench,这是一个基准,用于从一段 20 秒的破冰对话片段中推断两个人是已经熟悉还是以陌生人的身份见面。每对回答相同类型的提示,因此只有交互方式才能揭示答案。我们通过文本、音频和视频,将来自七家公司的 26 个模型与超过 96 个平衡二元组的匹配人类面板进行比较。最好的模型和人类群体在每种模式的准确性上在统计上都没有区别,但达到的效果不同:人类在两个答案中保持平衡,而最强的模型偏爱“陌生人”。这是有效先验的差异,而不是歧视的差异。更丰富的渠道对双方的帮助是不平等的,而且只有人类才能从言语之外的可见行为中获益。我们发布刺激、人类评分和模型预测。