论文
一致但不对齐:对题项敏感的语言模型表现与随机无异
Consistency Without Alignment: Item-Sensitive Language Models Indistinguishable From Random
摘要
项目敏感性,定义为模型的选择是否取决于特定输入而不是其自身的先验输出,被广泛报道为任务能力的证据。我们使用从棋盘游戏《欺骗:香港谋杀案》中抽象出来的强制选择信号任务来证明这一证据是必要的,但还不够充分。在这种环境中,判断坐标所依据的参考点(拟合最大化策略、后验最大化策略和均匀随机选择)都是可以以封闭形式计算的。在七种语言模型、两个模型系列、训练后消融和三个独立评分规则中,21 个逐个模型单元中的每一个都可靠地对项目敏感。然而,这 21 个单元格中的 8 个单元格与忽略该项目并随机选择的选择器在统计上没有区别,并且 5 个单元格在描述目标时得分比随机分数差。项目敏感性和随机距离仅在 r = 0.30 时相关。我们将这种一致性称为无对齐一致性,并认为它可以推广到任何依赖于项目敏感性、排列一致性或自我一致性而无需测量量的独立参考的评估。我们进一步发现,没有语用学的字面相似性基线优于大多数经过测试的语言模型,在两个基线相似性源上添加语用层会使选择器趋向随机而不是贝叶斯参考,并且标准标记的多项选择格式此处不携带可测量的内容信号。所有结果均代表预注册仪器的模型面;已设计并试用了匹配的人体条件,但尚未收集。