论文

MATO:针对 大语言模型 的多目标个性化对准和测试时间优化

MATO: Multi-objective Personalized Alignment with Test-time Optimization for Large Language Models

模型推理解码与生成控制

摘要

将 大语言模型 (LLM) 与多样化和多方面的用户偏好保持一致是个性化 AI 系统的一项基本挑战。现有的多目标对齐方法要么依赖于昂贵的训练,要么需要针对每个偏好预先训练的奖励模型,这使得它们很难适应不断变化的偏好。基于提示的个性化提供了 无需训练 的替代方案,但单独提示通常提供的可操纵性有限,因为 LLM 可能会过分强调或忽视某些偏好,并且在出现冲突时无法让用户可靠地控制不同目标的相对重要性,从而导致次优对齐。在本文中,我们介绍 MATO,一个用于多目标个性化对齐与测试时间优化的 无需训练 框架。 MATO 将个性化制定为测试时优化问题,通过解码过程中的可控权重来控制多个目标的相对重要性,而无需修改模型参数或需要外部奖励模型。具体来说,奖励发现模块直接从主干网 LLM 中恢复自然语言指定的各种目标的偏好奖励,而权重优化模块则根据用户的初始偏好和部分生成的响应动态调整目标权重,以平衡生成过程中的竞争目标。由此产生的奖励和权重共同指导词元分配的在线优化过程,从而更好地与目标保持一致。跨多个数据集和主干 LLM 的大量实验表明,MATO 始终优于强大的基线,实现了帕累托改进的多目标对齐和更强的可操纵性。这些结果凸显了测试时优化是可扩展、可控和与模型无关的个性化对齐的一个有前途的方向。