论文

REAR:通过奖励分解调整测试时间偏好

REAR: Test-time Preference Realignment through Reward Decomposition

模型推理测试时计算扩展

摘要

将 大语言模型 (LLM) 与不同的用户偏好保持一致是一项关键但具有挑战性的任务。虽然 后训练 方法可以使模型适应特定需求,但它们通常需要昂贵的数据管理和额外的训练。测试时间缩放 (TTS) 提供了一种高效的 无需训练 替代方案,但其应用在很大程度上仅限于可验证的领域,例如数学和编码,在这些领域中可以轻松判断响应的正确性。为了将 TTS 扩展到偏好对齐,我们引入了一种新颖的框架,该框架将任务建模为重新对齐问题,因为基本模型通常无法与所述偏好充分对齐。我们的主要见解是将底层奖励函数分解为两个部分:一个与问题相关,另一个与偏好信息相关。这使我们能够得出 REAlignment Reward (REAR),它有选择地重新调整这两个奖励项的比例。然后,我们证明 REAR 可以表示为 词元级 策略对数概率的线性组合,使其计算高效且易于与各种 TTS 算法集成,例如 best-of-$N$ 采样和树搜索。实验表明,与其他测试时间基线相比,REAR 不仅能够在不同用户需求下针对偏好对齐任务实现可扩展的测试时间重新对齐,而且还可以在适当的偏好设置下推广到数学和视觉任务。