论文

智力收益递减:短期开放式社交人机交互中 LLM 量表与用户感知之间的非线性关系

Diminishing Returns of Intelligence: The Non-Linear Relationship Between LLM Scale and User Perception in Short-Duration Open-Ended Social Human-Robot Interactions

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地用于驱动实体社交代理,但目前尚不清楚较大的模型是否可以改善用户在短暂的人机接触期间的感知。本文研究了 LLM 参数大小对与机器人界面的短期、开放式社交交互的影响。在一项受试者内部研究中,19 名参与者与 Qwen3-VL 模型驱动的机器人面部进行了交互,参数为 4B、8B 和 30B。参与者根据感知的智力、自然性、乐趣和幽默来评估互动。结果显示,与较小的变体相比,30B 模型总体上没有显着的偏好,包括在感知自然度或智能方面比 4B 模型没有显着优势。 30B 模型的 AI 交互频率与智力排名之间存在显着关系,这表明经验丰富的用户可能对模型能力的差异更敏感。总体而言,研究结果表明,在简短的开放式社交 HRI 中,模型扩展的回报递减,其中对话流、响应能力和社交适当行为可能与原始参数计数一样重要。