论文
有礼貌但不一致:根据人类务实规范评估大语言模型礼貌判断
Polite but Misaligned: Evaluating LLM Politeness Judgments Against Human Pragmatic Norms
摘要
尽管在标准基准上表现强劲,但仍不清楚大型语言模型(LLM)是否以符合人类判断的方式评估社会语用学。我们使用两个具有互补注释格式的英语数据集来评估大语言模型礼貌判断:连续人类评分和三向分类标签。在七个评估的模型中,我们发现模型间一致性比模型与人类的一致性更强。策略层面的分析表明,模型与人类的对齐与明确的语言线索相关,而一些建立融洽关系的策略在不一致的情况下更频繁地出现。在分类任务中,模型预测表现出系统的中性压缩,其特征是中性标签的过度生成和不礼貌标签的预测不足。当专家共识被用作诊断子集的参考时,这种模式仍然存在。我们的研究结果强调了通过检查模型的方向模式(不同人类参考之间的人类分歧)进行务实评估的必要性,这种评估超越了总体一致性指标。