论文
宪法偏好重建中的开放问题
Open Problems in Constitutional Preference Reconstruction
摘要
成对偏好数据广泛用于训练与评估语言模型(如RLHF),但每个数据点记录的是选择而非选择背后的理由。逆向宪法AI(ICAI)等方法尝试通过把数据集压缩为简短的自然语言原则“宪法”来改善可解释性。我们论证该框架欠指定:原则的平铺列表还不是可执行的决策规则——因为原则组合方式隐式。我们以成对设定为试验台实证刻画宪法方法的三个开放问题。第一,原则质量难以度量:覆盖率与准确率是有用但不完整的端到端重建代理。第二,组合有歧义:固定原则不变,不同执行者(LLM裁判与多数投票)仅73%一致。第三,宪法在LLM间不同:跨模型投票一致率73%,而模型内一致率81%。跨PRISM、AlpacaEval与Chatbot Arena:原则精炼(ICAI+)是缓解这些问题的第一步——跨执行者一致率升至78%,透明执行者匹敌LLM裁判准确率(66%对67%)。