论文
伪造结果下医学影像剂的来源依赖性遵从:试点审计
Source-Dependent Deference in Medical Imaging Agents Under Falsified Findings: A Pilot Audit
摘要
使用工具的代理被提议用于医学成像,当工具返回错误结果时,它们的行为在很大程度上是无法测量的。我们会审核 ReAct 风格的工具调用代理是否在收到伪造的结果后放弃它已经正确给出的答案,以及这是否取决于结果的呈现方式。在跨越四个供应商指定模型层的 20 个 VQA-RAD 封闭式问题中,代理承诺仅根据图像给出答案;然后,否定的结果会以来自代理调用自身的analyze_image工具的JSON形式传递,或者以引用放射科医生的散文形式传递。我们的结果是在没有任何工具的情况下正确回答案例的佣金错误率。在散文归因的声明下,尊重度要高得多:在最强的级别上,代理在 13 个案例中的 10 个中修改了正确答案,而在该工具下,13 个案例中只有 1 个(精确的 McNemar p=0.0039,Holm 调整后的 0.012)。我们并不声称这会隔离来源标签。在我们的设计中,归因随着交付渠道而变化,并且暴露程度有所不同,因为工具声明仅在代理调用该工具时才到达代理。这一发现是来自一个小规模试点的联合来源和交付不对称,该试点未满足预先指定的停止规则。