论文
测量AI系统的Authority Stack:对8个AI模型366,120条强制选择响应的实证分析
Measuring the Authority Stack of AI Systems: Empirical Analysis of 366,120 Forced-Choice Responses Across 8 AI Models
摘要
AI系统在面对结构化两难时究竟表现出怎样的价值观、证据偏好与信息源信任层级?我们首次对Authority Stack框架(S. Lee, 2026a)全部三个层级的AI决策进行大规模实证测绘:价值优先级(L4)、证据类型偏好(L3)与信息源信任层级(L2)。使用PRISM基准——一个每层含14,175个独特场景的强制选择测量工具,覆盖7个专业领域、3个严重程度、3个决策时间范围与5种场景变体——我们在温度0下评估了8个主流AI模型,共获得366,120条响应。关键发现包括:(1) 在L4层,普遍主义优先与安全优先的模型呈对称的4:4分布;(2) 防御领域出现剧烈的价值重构,8个模型中有6个的安全价值胜率飙升到接近天花板(95.1%-99.8%);(3) L3层的证据层级出现分化,一些模型偏好实证科学证据,另一些偏好基于模式或经验的证据;(4) L2层对机构信息源的信任广泛趋同;(5) 配对一致性得分(PCS)介于57.4%至69.2%,显示对场景变体存在显著的框架敏感性。重测信度(TRR)介于91.7%至98.6%,表明价值不稳定性主要源于变体敏感性而非随机噪声。这些发现表明AI模型拥有可测量(尽管有时不稳定)的Authority Stack,对跨专业领域的部署具有重要影响。