论文

MedBench v5:临床多模式模型的动态、面向过程和幻觉感知基准

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

模型评测基准与评测资源

摘要

现有的医疗人工智能基准缺乏流程可视性、原子技能评估和集成幻觉检测。我们推出了 MedBench v5,这是一个重新设计的临床多模式模型(语言、视觉语言和代理系统)基准,从静态 QA 转向动态、面向过程的评估。 MedBench v5的特点:(1)结合临床认知反应(13个子维度)和医学原子技能(4个代理环境)的双维度框架,涵盖63个任务; (2) 用于分解退化分析的三种可切换信息流压力源(遗漏、矛盾、证据延迟); (3) 具有五个推理节点的动态过程审核协议,可产生特定于模型的故障指纹; (4)幻觉传播监测,涵盖起始、传播、锚定和矛盾交互——捕捉无声幻觉。前沿模型的实验表明,强大的整体任务表现并不能保证过程的稳定性:压力源主要扰乱矛盾检测、诊断更新、幻觉传播和基于矛盾的自我纠正,而最终的证据基础可以保持表面稳定。 MedBench v5为临床人工智能评估中的能力分析、可控压力测试、过程审核和幻觉轨迹分析提供了统一的基础设施。