论文

将分诊决策拆分给多智能体会隐藏偏见还是有助于发现偏见?——审计容量约束下基于LLM的资源分配多智能体仿真研究

Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints

智能体系统Agent任务评测

摘要

先前的基准测试工作表明,单个大语言模型(LLM)在被迫做出生死攸关的资源分配决策时,会表现出可测量的人口统计偏见。而实际部署很少只用单个智能体:它们采用流水线,其中的审查步骤正是为了捕捉这类失败。我们研究当同一决策被分布到角色分化的多智能体流水线(评估、分配、独立审计)中,而非由单一模型做出并自查时,偏见会发生什么。我们使用一个合成灾难分诊模拟器(配对病例在临床上完全相同,仅一个人口统计属性不同),在GPT-4o-mini上运行192个回合(2,304对已解决的病例),在三个独立变化的压力维度下比较单智能体对照条件与九智能体流水线。我们发现两种条件下偏见结果的发生频率没有可测量的差异(6.9% vs. 6.1%,p = 0.498)。我们确实发现审计容量对偏见是否被发现有巨大且显著的影响:30.0%的偏见结果完全未被察觉,在审计员过载时升至43.8%,在不过载时降至18.4%。分解该效应显示,它几乎完全由覆盖率驱动(病例是否被审查;负载下从100.0%降至65.6%,p < 0.001),而非对已审查病例的判断退化(81.6% vs. 85.7%,p = 1.000,方向甚至反转)。一项后续实验表明,用按估计风险而非先到先得的方式重排审计队列,可在相同容量约束下挽回大部分损失的覆盖率(65.6%升至91.7%,p = 0.028)。我们讨论了对任何在资源约束下为LLM智能体流水线增加独立监督的系统的启示,并如实报告研究局限:单一模型、样本量适中、无对抗性复制。

将分诊决策拆分给多智能体会隐藏偏见还是有助于发现偏见?——审计容量约束下基于LLM的资源分配多智能体仿真研究:论文配图
图1:运行回合中的模拟界面。病例从左向右依次经过评估、分配和审计环节,流向一个固定容量的病房。红色虚线标出刚被不平等处置的一对双胞胎,即本研究测量的事件。