论文

隔离 LLM 词汇偏差:用于偏好阶段学习的无管理三角度量

Isolating LLM Lexical Bias: A Curation-Free Triangulated Metric for Preference-Stage Learning

模型评测评测方法与指标

摘要

近年来,各种语言领域发生了显着变化;这些转变很大程度上归因于 大语言模型 的出现及其与自然语言使用的不一致。这些失调被认为部分源于偏好学习阶段,例如根据人类反馈进行强化学习,通常会使模型更有用,但同时可能会引入系统性词汇偏差。就词汇行为而言,这在模型对某些格式的偏好或对单词的过度使用(此外,深入研究)中可见,即使这些模式不存在于基本模型输出中。对偏好训练期间引起的词汇错位的研究受到对手动管理的依赖的限制。我们通过引入三角偏好转变分数来解决这个问题,这是一种在人类黄金标准、基本模型之间进行三角测量的指标,并指导变体隔离由偏好学习专门引起的转变,而无需手动管理。我们提供了六个模型系列的数据,将结果锚定在文献中,并通过分析偏好学习是否将模型转向可以解释为“声望语言”的方向来说明一般方法的实用性。该指标提供了一种初始自动化方法来量化偏好调整引起的行为变化,因此可能有助于为模型调整和值得信赖的人工智能的开发提供信息。