论文

多步骤临床 LLM 代理的反事实公平性审核需要可测量的每次操作不稳定性下限

Counterfactual Fairness Audits of Multi-Step Clinical LLM Agents Require a Measured Per-Action Instability Floor

智能体系统Agent任务评测

摘要

反事实审计是检查临床智能体是否以不同方式对待人口统计不同但临床相同的患者的标准工具。他们报告了翻转率:当只有患者描述符发生变化时,动作发生变化的频率。我们证明这个量本身是无法解释的。在 16 个小插图(相同的叙述,相同的描述符字符串,没有任何变化)中重新运行相同的条件十次,在 8.7% 的结果小插图单元中移动了临床药剂的行动,并且不同行动的不稳定性异质性高达八倍,从 ICU 升级的 0.022 到受控物质谨慎的 0.179。我们的数据中没有与该楼层的人口统计对比。第二个模型给出了 6.7% 的合并下限,并对六种操作进行了几乎相同的排名(Spearman 0.94,精确的 p=0.017),因此下限不是某个系统的产物。经过五次抽签的多数投票聚合会删除其中的 39%,然后变平,零模拟将剩余部分归因于每个单元的异构率,因此复制会减轻但不会消除。因此,任何在其旁边没有每个操作下限的反事实公平估计报告都不能被视为差异的证据。这些测量是使用 FairMedAgent 进行的,FairMedAgent 是一种针对临床 LLM 代理行为差异的评估工具,其估计量(范围内反事实翻转率)仅计算已发布的决策规则承认的行为和临床医生裁定的行为之间的翻转。该估计值需要进行频段裁决,目前正在进行中;这里没有声明差异结果。每个合成小插图在跨越种族、性别、年龄、保险、英语熟练程度及其交叉点的固定形式条件下运行六阶段轨迹(围绕确定性环境步骤的五个面向模型的决策)。Harness、底层协议和每个分析脚本均已发布。