论文
模特说出的拒绝候选人的理由有用吗?
Does a model's stated reason for rejecting a candidate do any work?
摘要
当被要求在候选人之间进行选择并解释选择时,语言模型通常会通过指出其资料中缺乏的事实来拒绝竞争对手:没有导演,没有死亡日期。这句话是关于模型前面的文本的断言,可以在没有任何判断的情况下进行测试。我们将一个真实的语料库句子插入到竞争对手的个人资料中,说明指定的事实,并在贪婪解码下再次询问。两个控件将内容与位置分开:同一配置文件中的长度匹配的不相关句子,以及模型从未提及的第三个选项中的相同的两个句子。在最大的三轮运行中,2WikiMultihopQA 上有 6 个开放模型,在指定的配置文件中提供指定事实,该模型比不相关的控制移动其选择更多,优势比 3.57 [1.54, 8.26],Holm p=0.0210,并且在丢弃任何单个模型后仍然存在。该设计旨在检测的对比,在没有提及的选项中的相同事实,没有明确的校正,Holm p=0.2428。家族中最强的结果根本没有任何内容主张:相同的不相关句子对指定竞争对手的选择比对第三个选项 Holm p=0.0008 的选择影响更大。修复和控制在共同候选提及、关系模板和流畅性方面也有所不同;前两者的事后匹配保留了内容效果的方向,匹配的流畅性削弱了内容效果,因此内容对比是约束效果而不是建立效果。强制的单标记概率读取与相同对比下的自由文本选择的方向不一致,并且对这种分歧的三种候选解释没有得到支持。每个测量都是一个字符串规则,因此每个测量都根据它读取的记录进行验证;验证发现了八个缺陷。最大的选择解析规则返回了模型刚刚在 17.1% 的可裁决响应中拒绝的选项,该规则将报告六个幸存对比,而不是四个。