论文

CoAct:人机协同的 Co-Active LLM 偏好学习

CoAct: Co-Active LLM Preference Learning with Human-AI Synergy

模型训练偏好优化

摘要

从基于偏好的反馈中学习已成为在不同任务中协调 LLM 的有效方法。然而,高质量的人工注释偏好数据仍然昂贵且稀缺。现有方法通过自我奖励(通过使用纯粹人工智能生成的标签进行扩展,但存在不可靠性风险)或主动学习(通过预言机注释确保质量,但无法充分利用未标记的数据)来解决这一挑战。在本文中,我们提出了 CoAct,这是一种新颖的框架,它通过战略性的人机协作将自我奖励和主动学习协同结合起来。 CoAct 利用自我一致性来识别可靠的自标记数据和需要预言机验证的样本。此外,预言机反馈指导模型在其可解能力范围内生成新指令。在两个模型系列的三个推理基准上进行评估,CoAct 在 GSM8K 上平均提高了 13.25%,在 MATH 上平均提高了 8.19%,在 WebInstruct 上平均提高了 13.16%,始终优于所有基准。