论文
和我们一样公平吗?审计LLM在资源分配中的对齐
Fair Like Us? Auditing LLM Alignment in Resource Allocation
摘要
稀缺、不可分资源的公平分配是许多社会问题中的重要挑战。虽然有若干形式化的公平理论,但没有单一定义总能被满足。随着大型语言模型(LLM)日益被用于支持决策和充当智能体,它们引发了关于分配正义的新担忧:其判断不直接绑定于任何特定公平框架,可能违反关键规范性原则。在这项工作中,我们提出一种评测LLM公平推理的通用方法。我们研究跨广泛模型集合的第一人称公平判断,并在匹配场景和引导条件下与人类回应直接比较。我们发现,LLM倾向于比人类偏好更严格的公平约束,表现出更多自利行为,对信息的框架化方式敏感,并且难以通过使用当前数据集的微调与人类判断对齐。
