论文
一致性最大化改善多元对齐
Coherence Maximization Improves Pluralistic Alignment
摘要
将人工智能系统与不同的人类价值观相结合需要基于具体示例的价值规范,但在没有广泛人类监督的情况下生成此类示例仍然是一个公开的挑战。我们使用内部一致性最大化(ICM)(通过最大化相互可预测性来推断标签)来研究使这些示例有效的原因,以生成特定于角色的示例,从而在没有人类监督的情况下引导模型走向目标群体的价值观。在涵盖分类、偏好和开放式生成的四个基准中,ICM 推断的上下文示例与金标签的性能相匹配。至关重要的是,连贯性比单个标签的准确性更重要:在准确性保持不变的情况下,更连贯的例子比不连贯的例子概括得更好。对于预训练数据中代表性不足的角色,针对模型对角色价值观最不确定的问题进行有针对性的人类反馈,比对任意问题使用相同数量的标签产生更好的泛化能力。这些结果将一致性确定为可扩展价值规范的关键设计原则,利用预训练语言模型中已编码的不同人类观点。