论文
民主 ICAI:辩论我们如何从偏好中引导原则
Democratic ICAI: Debating Our Way to Steering Principles from Preferences
摘要
基于偏好的一致性常常难以捕捉人类判断背后的推理。许多评估依赖于多个相互作用的标准,但成对标签仅揭示最终选择,而不是影响偏好的考虑因素。逆宪法人工智能(ICAI)通过将偏好总结为自然语言原则来提高决策的可解释性,但其单遍解释忽略了复杂决策中涉及的许多细微差别。我们引入了民主 ICAI (DICAI),这是一种新颖的方法,通过结构化的角色辩论收集多种相互竞争的理由,为影响每次比较的因素提供更广泛、更具表现力的解释。从这些更丰富的信号中,我们得出更清晰、更全面的指导原则,并使用它们通过基于 LLM 的法官和决策树法官以及通过构成诱导的偏好标签的下游 模型训练 来指导偏好决策建模。跨多个创意任务类别的创意偏好基准 MuCE-Pref 和 LiTBench 的实验表明,民主 ICAI 产生了更忠实的偏好结构。它改进了相对于深思熟虑的提示和基于原则的基线的跨任务的平均偏好预测,同时生成 LLM 注释者更喜欢的宪法。