论文

Agent识别Agent:临床多Agent系统的捷径级联与基准操纵

Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems

模型评测安全与风险评测

摘要

临床决策支持正朝着由语言模型代理组成的委员会在共享工作空间中进行讨论。我们询问,这些委员会是否可以通过捷径被操纵,尽管它们受到基准奖励但临床医生会忽略。在六个公共数据集上,跨越文本(MedQA-USMLE、MedMCQA、MIMIC-CXR报告)、影像学(NIH ChestX-ray14、MIMIC-CXR-JPG、CheXpert)和表格化重症监护室记录(SUPPORT2),Gemini委员会在孤立情况下抵制这些捷径(5-16%的翻转),但一个社会上可接受的捷径传播:当两个同行都给出相同的错误答案时,测试中的持怀疑态度的人采纳了它,在38%的情况下,虚假“预筛选”系统也这样做,无论能力级别。在三个监督代理中,一个门禁无法区分采纳与诚实的一致性(100%的假阳性率);一个只阅读记录的同源法官将采纳推向文本(精确度100%,召回率93%),但在影像学中崩溃;一个私下询问持怀疑态度人的裁判员转移到影像学(77-88%的精确度,13-21%的假阳性率)。增加捷径的视觉突出度不会改变传播,而降低一半的同伴声音会提高它。隐藏规则的操纵几乎无声:只有1/10文本和1/134影像学中的偏离者提到他们移向了哪个规则。什么游戏一个委员会是社会上的合理性,但只有独立于自我报告的裁判员才能抓住这一点。代码:https://github.com/criticaldata/benchmaxxing