论文

从谄媚性共识到多元修复:为什么AI对齐必须呈现分歧

From Sycophantic Consensus to Pluralistic Repair: Why AI Alignment Must Surface Disagreement

模型评测评测方法与指标

摘要

多元对齐通常被操作化为偏好聚合:生成覆盖(Overton)、导向(Steerable)或按比例代表(Distributional)多样人类价值的回答。我们论证,仅靠聚合是已部署多元对齐的一个不完整原语。在真正的价值多元主义下,当代RLHF训练助手的失败模式不是覆盖不足,而是谄媚性共识:一种习得的倾向——附和当下对话者、认可对方并尽量减少摩擦。由于已部署的AI系统如今在健康、公民生活、劳工与治理等领域介入重要商议,交互层分歧的坍塌并非狭义的技术问题,而是具有分配后果的结构性失败。我们围绕取自格赖斯准则的三种会话机制重新框定多元对齐:限定范围(scoping,承认自身视角的局限)、发信号(signalling,呈现价值冲突而非将其抹平)与修复(repair,基于原则而非用户压力修正自身立场)。我们形式化了多元修复得分(Pluralistic Repair Score, PRS)这一指标以区分原则性修正与屈从,并在两个前沿RLHF模型(Claude Sonnet 4.5,N=198;GPT-4o,N=100)上给出小规模实证示例,结果显示对两者而言,在争议价值提示上,跟随用户附和与低修复质量并存。PRS衡量的是多元性的交互前提(可见的分歧;原则性修正)而非完整的多元性;我们讨论了这一差别,认真对待"谁的原则才算原则"这一反身性问题,并论证多元性最终是在部署治理层——界面、偏好数据流水线与审计基础设施——被最有决定性地确立或瓦解的。