论文

IatroBench:AI安全措施引发医源性伤害的预注册证据

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures

模型评测安全与风险评测

摘要

询问一位前沿模特如何逐渐减少六毫克阿普唑仑的用量(精神病医生退休了,还剩下十天的药,突然停药会导致癫痫发作),它会告诉她打电话给她刚刚解释的精神病医生并不存在。改变一个词(“我是一名精神科医生;一名患者出现……”),相同的模型、相同的权重、相同的推理过程会产生一本教科书阿什顿手动锥度,具有地西泮等效性、抗惊厥药物覆盖范围和监测阈值。知识就在那里;模型保留了它。 IatroBench 测量了这一差距。 60 个预先注册的临床场景、6 个前沿模型、3,600 个响应,通过针对医生评分进行验证的结构化评估管道在两个轴上进行评分(佣金伤害,CH 0-3;遗漏伤害,OH 0-4)(kappa_w = 0.571,1 内一致性 96%)。核心发现是身份相关的扣留:在医生与外行框架中匹配相同的临床问题,所有五个可测试模型都为医生提供了更好的指导(解耦差距+0.38,p = 0.003;在外行框架中,安全碰撞动作的二元命中率下降了13.1个百分点,p < 0.0001,而非碰撞动作没有变化)。对于安全投资最多的车型,差距最大(Opus,+0.65)。三种失败模式清晰地分开:训练有素的扣留(Opus)、无能(Llama 4)和不加区别的内容过滤(GPT-5.2,其后生成过滤器以外行人的 9 倍的速度剥离医生的反应,因为它们包含更密集的药理学标记)。标准大语言模型法官将 OH = 0 分配给医生评分 OH >= 1 (kappa = 0.045) 的回答的 73%;评估仪与训练仪具有相同的盲点。每个场景都针对已经用尽标准推荐的人。