论文

哪些目标需要旋钮?可引导多元对齐中的目标冲突预测与权衡覆盖

Which Objectives Need a Dial? Predicting Objective Conflict and Covering Trade-offs in Steerable Pluralistic Alignment

模型评测模型行为与机制分析

摘要

人们持有多样且有时相互冲突的价值观,因此没有任何单一的对齐模型能让所有人满意。多元对齐因而需要可引导的模型,能够以不同方式平衡相互竞争的目标。多目标直接偏好优化(MODPO)通过一个目标权重来张成连续的权衡谱。我们研究两个问题:什么时候一个模型可以同时改进两个目标,以及如何在不为每个权衡单独训练模型的情况下覆盖多种权衡?在来自HelpSteer与UltraFeedback的七组目标对上,两个预训练测量指标能够预测各目标在人类标注数据上是一致还是冲突,但对AI标注数据不成立——在后者中,回复长度与重复度混杂了奖励模型分数。为实现更广的权衡覆盖,选择最近的已训练模型与合并模型参数都有帮助,但两者都不能持续媲美直接训练。这些发现为构建服务多元偏好的可引导模型提供了实用指导。