论文

智能体临床推理中大语言模型的信息获取失败

Information-seeking failures of large language models in agentic clinical reasoning

智能体系统Agent任务评测

摘要

大语言模型在医学知识测评上得分很高,但临床推理要求在不确定性下主动决定查什么。我们在血液肿瘤领域开发智能体评估框架:模型必须在承诺诊断与治疗方案前,跨三个顺序轮次主动请求临床数据。跨32个前沿模型:最佳者总准确率仅68%。信息利用率——实际请求的可用数据比例——是诊断准确率的最强预测因子(R=0.69,P<0.001),但利用率在最后一轮从57%崩至26%,使对治疗选择关键的分子与细胞遗传学数据未被查问。推理轨迹在临床推理量规上得分很高(91%超阈值),却与准确率去相关——揭示局部连贯的理由与全局正确的结论之间的鸿沟。错误分析识别出搜索满足、锚定与过早闭合为主导失败模式——与诊断推理双过程模型中新手临床医生的特征性认知偏误相同。结果表明:当前模型在临床肿瘤学中的主要局限不是医学知识不足,而是不确定性下信息获取的系统性失败。