反事实评估揭示临床 LLM 和代理中隐藏的能力概况
Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents
摘要
两个临床人工智能系统在基于覆盖范围的评分标准上的得分几乎相同,但当患者输入发生变化时,其表现却截然不同:一个系统更新其建议以匹配新的临床信号,而另一个系统无论如何都会产生相同的输出。我们引入了因果敏感性评分(CSS),这是一种预先注册的干预指标,它沿着五个有临床意义的维度(生物标志物翻转、既往治疗失败、生物标志物去除、手术状态变化和阶段扰动)改变肿瘤学肿瘤板病例,并使用 {0, 0.5, 1.0} 量表对每个模型是否按照预先注册的正确方向更新其建议进行评分。以共识匹配分数 (CMS)(一种基于覆盖范围的加权召回指标)为基准,来自三个实验室的 6 个前沿模型在 224 个案例的单次推理中进行了评估,排名几乎相反:所有 6 个模型的排名都发生了变化,CMS 最差的模型变成了 CSS 最好的模型,而一个中上 CMS 模型在 CSS 上排名最后。我们进一步揭示了一个普遍的安全盲点:每个前沿模型在手术状态干预方面都失败了(家庭 D 的 CSS 最多为 17.2%),CMS 没有揭露这一发现。该指标还转移到使用工具的代理:在 ReAct 式的实验中,工具的使用改进了六个模型中的五个的 CSS(+2.5 至 +20.3 个百分点),但 CSS 最低的模型检索了相同的图表部分,但仍然无法更新其建议 - 揭示了只有在反事实评估下才可见的结构响应能力缺陷。交叉法官重复和三名评估者医学专业验证证实了总体研究结果。 CSS 等干预性预注册指标补充了临床 AI 代理基于覆盖率的评估:它们捕获覆盖率指标遗漏的响应能力,并为未来的代理 RL 系统提供候选密集奖励信号。