论文

风格中的理性:发现和控制语言模型中的风格

Reason in Style: Discovering and Controlling Style in Language Models

模型训练监督微调与指令调优

摘要

语言模型共同学习内容和风格,使得其输出的风格变化难以识别和控制。我们研究是否可以在没有监督和明确控制的情况下发现模型响应中重复出现的风格。我们设计了一种算法,可以学习将内容和风格的表示与语言模型的输出分开,并在受控环境中验证其对数学问题的有效性。通过将此方法应用于来自九个不同教师模型的超过 100K 个经过验证的痕迹,我们发现了六种重复出现但不平衡的风格。然后,我们对较小的学生模型进行微调,以在明确以这些风格为条件时遵循这些风格,使用重要性权重来平衡语料库中代表的风格的贡献。这种方法改进了 Pass@$k$ 在六个数学推理基准上对相同数据进行标准微调的方法,这表明我们可以有效地使答案风格多样化。我们确认,这也会导致请求的样式和实现的样式之间具有很强的对应性。我们发现风格影响正确性:解决问题的概率取决于我们所条件的风格,不同的问题受益于不同的风格。总之,我们的结果表明,模型生成的数据中的风格变化可以以无监督的方式发现并明确化,从而提供控制和改进推理性能的来源。