论文
大语言模型决策中的代理变量依赖未经预测证据校准
Proxy reliance in large language model decisions is uncalibrated to predictive evidence
摘要
大语言模型(LLM)正进入分诊和放贷等决策场景,在这类场景中必须把与任务相关的推理同不可允许的代理变量使用区分开。目前的审计只问:当人口属性改变时决策是否改变。但与受保护群体相关的属性携带有预测价值,因此决策改变既可能是歧视,也可能是合理推断。我们在一个有已知真值的临床排序任务上测量四个LLM中的因果代理效应,在该任务中证据所支持的依赖程度可以被精确计算并作为参照。同一审计信号给出三种判定:过度依赖、有据依赖与依赖不足。在中立标签下,每个模型都依赖不携带任何信息的代理变量。有信息量的代理变量则引出全部三种判定。带社会含义的字段名会把依赖压低,在一个模型中甚至低于参照值。两项发现解释了这一点:依赖程度严重跟不上证据,且社会标签抑制是脆弱的——情境示例会让每个模型的依赖重新升到零以上。基于准确率的评估完全检测不到这些现象。