论文

和我们一样公平吗?审计LLM在资源分配中的对齐

Fair Like Us? Auditing LLM Alignment in Resource Allocation

模型评测鲁棒性、公平性与可信度评测

摘要

稀缺、不可分资源的公平分配是许多社会问题中的重要挑战。虽然有若干形式化的公平理论,但没有单一定义总能被满足。随着大型语言模型(LLM)日益被用于支持决策和充当智能体,它们引发了关于分配正义的新担忧:其判断不直接绑定于任何特定公平框架,可能违反关键规范性原则。在这项工作中,我们提出一种评测LLM公平推理的通用方法。我们研究跨广泛模型集合的第一人称公平判断,并在匹配场景和引导条件下与人类回应直接比较。我们发现,LLM倾向于比人类偏好更严格的公平约束,表现出更多自利行为,对信息的框架化方式敏感,并且难以通过使用当前数据集的微调与人类判断对齐。

和我们一样公平吗?审计LLM在资源分配中的对齐:论文配图
图 1:呈现一个公平划分实例的示例提示。红色、绿色和蓝色文本分别突出显示(私有的)估值信息、(个人的)分配信息,以及引出感知公平性判断的(基于阈值的)问题。