论文

LoSoNA:团体对话中当地社会规范适应的基准

LoSoNA: A Benchmark for Local Social Norm Adaptation in Group Conversations

模型评测基准与评测资源

摘要

在线群聊是具有当地对话规范的社交空间,但很少明确说明。基于 LLM 的智能体识别和适应这些规范的能力和意愿仍未得到探索。我们引入了 LoSoNA,这是多方聊天中本地社会规范适应的基准。每个场景都为受试者模型提供了一份精心策划的群聊记录,其中非受试者参与者展示了隐藏的本地规范,然后是最终的诱导者转向,迫使受试者作出反应,揭示受试者是否推断出该规范。我们在四种提示条件下评估了八个前沿和开放权重模型,这些条件改变了模型被告知将先前的对话视为其应如何回答的证据的明确程度。对于大多数模型来说,幼稚的提示仍然有限;明确的规范意识提示的帮助并不均衡,Gemini 3.1 Pro 达到 $84.2\%$,Claude Fable 5 达到 $81.6\%$,而其他几个模型则显示出小幅增长或回归。 LoSoNA 通过测试模型是否可以从先例中推断本地对话规范并将其用于一轮群聊响应中,为最近评估 LLM 社交能力的呼吁做出了贡献。