论文
当规范冲突时:一种基于对称性的LLM偏好测量框架
When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences
摘要
大语言模型(LLM)日益被要求整合可能不一致或相互冲突的多源信息。然而,分析模型如何在相互竞争的规范之间消解冲突,仍缺乏可控且可归因的方法。我们提出一个受控实验框架,用于研究模型在规范冲突下的偏好。通过构造带有显式冲突的规范,该框架使模型在竞争规范之间的选择可以被直接观察和分析。基于对称性的设计进一步减少混淆因素,使跨表示类型的偏好可以系统比较。我们在一个包含 550 个冲突实例、覆盖 11 个函数族的可执行数学基准上评估该框架,比较四种表示类型:纯自然语言、形式语言、自然化形式语言和输入—输出示例。结果显示出系统性的偏好模式而非随机行为,且排序一致:$ \text{Formal} \approx \text{Naturalized Formal} > \text{Pure Natural Language} > \text{Input--Output Examples} $。示例效应还进一步依赖于模型能力与函数族。我们将该框架扩展到布尔代数、代码生成与临床领域的异构规范冲突,证明其适用于多样任务与规范形式。该框架为测量 LLM 如何在竞争性信息来源之间消解冲突提供了统一方法。
