论文
当平衡隐藏偏差时:强制选择中的访问条件位置锁定 LLM 评估
When Counterbalancing Hides the Bias: Access-Conditioned Position Lock in Forced-Choice LLM Evaluation
摘要
具有平衡方向的强制选择探针是测量语言模型“价值倾向”的标准工具,并且重复绘制的集中/极端指数被解读为模型承诺的敏锐程度。我们证明这个估计量在其低端是不可识别的:平衡,旨在消除位置偏差,而是将位置锁定(无论内容如何都返回相同答案字母的模型)映射到与真正中立性相同的接近 0.5 的签名上,因此“软性”和“不参与”无法与内容无关的字母偏差区分开来。在九个模型中,头寸锁定项目的比例几乎完美地跟踪了该指数(r=-0.986)——这是一个结构性结果,而不是一个发现:信息量是该界限的残差,即模型对其所参与的项目所显示的承诺。索引读取为软的三个模型是位置锁定程度最高的,并且锁定在允许推理的访问配置下解析(部署的 CLI -> 原始 API -> 启用推理),在锁定崩溃时移动索引 0.06->0.63 和 0.34->0.66->0.64(Opus:0.61->0.39->0.22);这将低读数确定为可识别性失败,而不是处置。支持推理的读数也不是“真”值;关键是该指数本身无法确定其低端的承诺。访问配置(部署客户端、推理开/关)是导致此故障的原因之一,显示在两个访问路径(Anthropic 订阅 CLI 和 DeepSeek 客户端)上,并且在冻结的基准测试中,它与提供程序混淆。我们提供了必须伴随任何浓度读数的位置锁定诊断,并表明,在推理允许的条件产生集中选择的情况下,浓度盲审计有报告中立性的风险。方向翻转组件在很大程度上对工件具有鲁棒性,仍然可以识别真正的跨模型分歧。