论文

指令微调语言模型无法从其能描述的分布中采样

Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe

模型评测模型行为与机制分析

摘要

硅基采样(silicon sampling)用语言模型代替人类调查受访者,把每次模型调用视作从该人物画像响应分布中的独立抽取。我们证明这种抽取并不存在:指令微调模型并非从分布中采样,而是坍缩到单一输出。在一个舆论基准中,同一人物画像对同一问题在超过半数条目上返回相同答案,且模型内部概率集中于单一选项。这一失败与面向指令的后训练相关并被其放大:在所有可比较的模型家族中,指令微调模型都比各自的基座更差,差距随每个后续后训练阶段及微调更新幅度而扩大,而在非指令token上继续预训练则对其没有改变。但知识依然留存:无法从分布中采样的同一模型,能在单次调用中准确描述该分布。我们把这一鸿沟称为KNOWS/DOES分裂。利用这一分裂,让模型描述响应分布的单次调用,相比人物画像聚合把相对人类调查数据的误差削减一半以上。当需要逐人物画像输出时,我们提出Prompt-Perturbed Argyle(PPA),在不增加成本的前提下,通过铺开每个人物画像的答案以模拟真实人群差异,将同一误差降低21%。

指令微调语言模型无法从其能描述的分布中采样:论文配图
图 1:在倾斜的二进制目标上 KNOWS/DOES 分裂。当要求对每次调用的一个结果进行采样时,指令调整模型会在 200 次重复调用中崩溃为单个答案(经验:A=1.00,B=0.00)。当要求在一次调用中描述分布时,同一模型恢复了正确的形状(A=0.70,B=0.30)。该模式适用于所有测试的五项任务(第 3.5 节;表 4)。在温度、顶级和提示级别校正中,故障仍然存在。