论文

鲁棒性悖论:在高风险决策中将基于规则的逻辑与情感噪声解耦

The Paradox of Robustness: Decoupling Rule-Based Logic from Affective Noise in High-Stakes Decision-Making

模型评测鲁棒性、公平性与可信度评测

摘要

虽然大语言模型 (LLM) 被广泛记录为对微小的提示扰动敏感,并且容易与用户偏见保持一致,但它们在相应的、受规则约束的决策中的稳健性仍未得到充分探索。在这项工作中,我们发现了一个引人注目的“稳健性悖论”:尽管众所周知的词汇脆弱性,但经过教学调整的大语言模型却表现出行为上和情感框架效应上几乎完全的不变性。我们使用跨越三个高风险领域(医疗保健、法律和金融)的新型受控扰动框架,量化了稳健性差距,大语言模型对叙事操纵的抵抗力比人类受试者高出 110-300 倍。具体来说,与在人类中观察到的重大偏差(Cohen's h in [0.3, 0.8])相比,我们发现模型的效应大小接近于零(Cohen's h = 0.003)。这一结果是非常违反直觉的,并且表明驱动阿谀奉承和迅速敏感的机制并不一定会转化为逻辑约束满足的失败。我们证明这种不变性在具有不同训练范式的模型中持续存在。我们的研究结果表明,虽然大语言模型对于查询的格式可能很“脆弱”,但对于为什么决策应该有偏见,它们却非常“稳定”。我们的研究结果表明,经过指令调整的模型可以将逻辑规则遵守与有说服力的叙述脱钩,提供决策稳定性的来源,补充甚至可能消除制度环境中人类判断的偏见。我们发布了 162 个场景的基准、代码和数据,以促进在 GitHub.com 上对叙述引起的偏见和稳健性进行严格评估。

鲁棒性悖论:在高风险决策中将基于规则的逻辑与情感噪声解耦
图7:跨领域(Academic、Financial、Medical)与模型的决策漂移(Decision Drift)热力图。颜色深浅表示漂移幅度;整体浅淡的着色证实不存在领域 × 模型交互效应。所有单元格均落在 ±3% ROPE 之内。