论文
同一患者,不同的顺序:重复运行下临床 LLM 药物的作用水平可靠性
Same Patient, Different Order: Action-Level Reliability of Clinical LLM Agents Under Repeated Runs
摘要
临床代理基准可以对相同的输入报告相同的结论,而代理在每次运行时提交截然不同的订单。这些代理订购测试、请求药物并进行推荐,但基准测试通常每项任务只得分一次,很少询问相同的输入是否会产生相同的操作;我们使用的基准 MedAgentBench 对单次尝试进行了评分并说明了这一点。为了衡量这一差距,我们引入了“相同输入重新运行”,它在每个输入保持固定的情况下重放任务,并比较顺序而不是分数,具有六个可靠性指标,并将其应用于 1000 MedAgentBench 运行,涵盖来自五个可写入系列的 50 个任务、两个低于 100 亿个量化为四位的参数的开放权重模型和两个温度。该研究表明,行动层面的差异是存在的,并且可以通过分数而未记录下来,而不是任何比率的概括。在温度为 0.7 的 8B 模型下,所有 43 个排序组在五次相同的运行中发出一组不同的指令,26 个在某些运行中发出指令,而在其他运行中则不发出指令,28 个记录不同的编码值、剂量或分析物。在这 43 个中的 22 个中,基准报告了对于实质上不同的行为的相同失败判决,正如它对 4B 模型的所有 10 个不同组的结果一样,均为 0.7。订单还会在运行过程中到达不同的端点,其中一个端点被记录服务器拒绝,而代理被告知它已成功。这些发现激发了临床代理基准中的重复运行评估、行动级稳定性报告和执行忠实的环境反馈。