论文
通过 KL 优化的 微调 控制多轮 LLM 生成中的分布偏差
Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning
摘要
虽然现实世界本质上是随机的,但 大语言模型 (LLM) 主要通过针对固定基本事实的单轮推理进行评估。在这项工作中,我们将镜头转向分布对齐:评估 LLM 在重复提示时是否可以生成符合所需目标分布的输出,例如反映现实世界的统计数据或均匀分布。我们使用职业环境中的性别、种族和情绪属性来制定分布对齐。我们的实证分析表明,现成的 LLM 和标准对齐技术(包括即时工程和直接偏好优化)无法可靠地控制输出分布。为了弥补这一差距,我们提出了一种新颖的 微调 框架,它将转向词元校准与语义对齐结合起来。我们引入了一种混合目标函数,结合 Kullback-Leibler 散度来锚定潜在转向标记的概率质量,并结合 Kahneman-Tversky 优化将这些标记绑定到语义一致的响应。六个不同数据集的实验表明,我们的方法显着优于基线,在属性生成任务中实现了精确的分布控制。