论文

谁的对齐?比较LLM在多样组织决策情境中的过程对齐

Whose Alignment? Comparing LLM Process Alignment Across Diverse Organizational Decision Contexts

模型评测评测方法与指标

摘要

将人工智能系统与组织决策保持一致通常被视为单一目标问题:使模型表现得像组织一样。我们认为这种框架掩盖了更深层次的多元化挑战。我们依靠决策策略捕获方法来衡量流程一致性:大语言模型是否像组织一样重视信息,而不仅仅是是否得出相同的结论。将此方法应用于 ECHR 第 6 条决策,流程对齐可以强有力地预测输出准确性(r = 0.85,p < .001),并且外化可显着改善对齐不良模型的对齐。将其应用于德国消费者信贷决策时,这种关系崩溃了(r = 0.15,p = .60):干预措施产生不一致的效果,并且基准编码了潜在的歧视性历史模式。这种对比本身就是一个多元化的一致性发现:在有争议的领域,高度的流程一致性既不能通过外部化来实现,也不是无条件可取的。输出协议本身无法区分已内化组织政策的模型与仅近似其结果的模型;过程级测量是任何多元一致性评估的必要组成部分。

谁的对齐?比较LLM在多样组织决策情境中的过程对齐
图 1:两个域的策略对齐(余弦相似性)与输出准确性。左:ECHR 第 6 条决定显示出很强的正相关关系( r = 0.85 r=0.85 , p < .001 p<.001 , n = 10 n=10 个模型 × \times 3 个条件);虚线标志着法院回归上限。右:德国信贷决策(平衡子集)显示出平坦、不显着的关系( r = 0.15 r=0.15 , p = .60 p=.60 , n = 5 n=5 个模型 × \times 2–3 个条件);虚线标志着规范上限(75.1%)。对比是核心发现:在具有有争议的规范基准的领域中,流程对齐和输出精度完全解耦。