论文

通过自适应多代理 LLM 系统进行可靠的自残风险筛查

Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems

智能体系统Agent 协作

摘要

行为健康和精神病学领域的新兴人工智能系统使用多步骤或多代理 LLM 管道来执行评估自残风险和筛查抑郁症等任务。然而,常见的评估方法(例如 LLM 作为法官)并不表明决策何时可靠,或者错误如何在多个 LLM 判断中累积,从而限制了它们对安全关键设置的适用性。我们提出了一个多智能体管道的统计框架,其结构为有向无环图(DAG),它为启发式投票提供了一种替代方案,具有原则性的、自适应的决策。我们将每个智能体建模为随机分类决策,并引入(1)更严格的智能体级性能置信界限,(2)基于输入难度的基于强盗的自适应采样策略,以及(3)对多智能体系统的后悔保证,该系统在部署时显示对数误差增长。我们在行为健康方面的两个标记数据集上评估我们的系统:AEGIS 2.0 行为健康子集 (N=161) 和 SWMH Reddit 帖子的分层样本 (N=250)。根据经验,我们的自适应采样策略在两个数据集中实现了任何条件下的最低误报率,AEGIS 2.0 上为 0.095,而单代理模型为 0.159,将安全内容的错误标记减少了 40%,并且在所有条件下仍然具有相似的误报率。这些结果表明,有原则的自适应采样在不降低这种情况下的召回率的情况下,在精度方面提供了有意义的改进。