论文

SHALA-LLM:在对齐 LLM 时智能处理不明确的标签

SHALA-LLM: Smartly Handling Ambiguous Labels in Aligning LLMs

模型训练强化学习

摘要

许多以人为中心的任务,包括自然语言推理(NLI)和情感识别(ER),都有多种看似合理的解释,导致标签模糊性并挑战人类注释者之间的分歧。随着 LLM 越来越多地部署在现实世界中,忠实地建模这种模糊性对于识别有争议的输入、保留模糊情况下的可变性以及捕获人类判断的完整分布至关重要。然而,现有的 LLM 对齐方法主要假设单个正确标签,排除优化过程中注释者的分歧。我们没有将这种歧义视为噪音,而是展示了如何通过名为“智能处理对齐 LLM 中的歧义标签”(SHALA-LLM) 的新算法将其视为改进模型行为的信息。该强化学习框架为 LLM 提供了一种直接从注释器分布中学习的新方法,同时在优化过程中动态优先考虑高度模糊的样本。对歧义敏感的 NLI 和 ER 基准(包括 ChaosNLI、GoEmotions 和 MSP-Podcast)的实验表明,SHALA-LLM 提高了与注释器标签分布的一致性,例如在 ChaosNLI 上,它减少了 Jensen-Shannon 距离高达 62.1%。同时,SHALA-LLM 将 F1 提高了高达 16.7%,这表明建模注释器不一致也可以增强分类性能。