论文

将语言模型与选择性预测结合起来

Aligning Language Models with Selective Prediction

模型训练强化学习

摘要

大语言模型 (LLM) 越来越多地被部署为高风险现实世界人工智能系统中的关键决策组件,这使得 LLM 的可靠性成为最重要的实际问题。在本文中,我们重点关注通过选择性预测(SP)来增强 LLM 的可靠性,该策略允许 LLM 仅预测可能正确的输入(即覆盖范围),从而降低该部分输入的错误率(即风险)——标记剩余输入以供未来人类判断。换句话说,SP 通过平衡风险覆盖权衡并实现无缝的人机协作来提高 LLM 的可靠性。为了将 SP 集成到 LLM 中,我们专注于 LLM 后训练 对齐阶段,并建议将 LLM 与 SP 性能指标对齐,这与主要关注正确性或校准指标的现有 LLM 对齐方法形成鲜明对比。具体来说,我们提出了一种新颖的对齐框架,即选择奖励强化学习(RLSR),其目标是风险覆盖曲线(AURC)下的面积(一种流行的 SP 性能指标)作为其对齐目标。与域内和域外任务的多个对齐基线相比,RLSR 实现了更好的风险覆盖权衡。