论文
仅使用上下文是不够的:个性化奖励模型的测试时训练
Using Context Is Not Enough: Test-Time Training for Personalized Reward Modeling
摘要
来自人类反馈的强化学习 (RLHF) 使大语言模型 (LLM) 与人类偏好保持一致,但大多数管道学习单一奖励模型,忽略了偏好的个体差异。个性化奖励模型(PRM)通过根据用户特定的反馈调节奖励来解决这个问题,最常见的是通过上下文学习(ICL),其中用户的历史比较作为上下文偏好对提供。然而,我们发现基于 ICL 的 PRM 的一个关键限制:它们无法捕获上下文对传达的偏好关系。为了解决这个问题,我们提出了偏好对齐测试时间训练(P-TTT),它将这些关系显式编码为用户特定的快速权重,以进行个性化奖励预测。 P-TTT 引入了序列级更新和应用操作来匹配偏好反馈的响应级粒度,以及直接使用成对偏好关系来指导快速权重适应的偏好对齐目标。值得注意的是,P-TTT 实现简单且计算效率高,可以在单次前向传递中快速更新权重,而无需推理时间反向传播。大量实验表明,P-TTT 更有效地捕捉历史偏好关系,并且大大优于最先进的方法。