论文
ClaHF:一种受人类反馈启发的强化学习框架,用于改进分类任务
ClaHF: A Human Feedback-inspired Reinforcement Learning Framework for Improving Classification Tasks
摘要
文本分类模型通常通过监督 微调 (SFT) 进行训练。然而,SFT 本质上是从实例标签进行行为克隆,因此无法充分捕获样本之间的相对偏好关系,这限制了模型塑造决策边界和校准预测置信度的能力。在本文中,我们提出了 ClaHF,一种受人类反馈启发的强化学习 (RL) 文本分类框架,它将偏好建模和 RL 优化集成到分类管道中,而不需要额外的人工注释。与之前仅依赖于实例监督的工作不同,ClaHF 构建了多个候选预测及其相对排名关系,并在奖励模型 (RM) 内联合建模 Top-1 偏好和非最佳候选之间的排序。该设计将传统的标签监督转化为可直接应用于策略优化的偏好信号。我们对跨越三类场景的八个分类任务进行了系统评估。结果表明,ClaHF 持续改进了不同语言模型 (LM) 的分类性能和置信度校准。数据和代码可在 https://anonymous.4open.science/r/ClaHF 获取。