论文

大语言模型 缺乏医学知识的时间意识

Large Language Models Lack Temporal Awareness of Medical Knowledge

模型评测基准与评测资源

摘要

现有大语言模型医学知识评估主要采用不带时间维度的考试式基准,但医学知识随证据与治疗批准持续变化。忽略时间可能无法完整评价模型能否推理特定时期的知识;大量医学数据又来自历史,模型不仅需知道正确内容,还需知道何时正确。研究构建 TempoMed-Bench,以演进的指南知识评估医学领域的时间意识。评估发现:对最新知识的表现随时间近似线性下降,而非在知识截止时间突然下降;模型回忆过时历史知识比最新建议更困难,历史准确率仅为最新知识的25.37%—53.89%,提示训练中可能遗忘;模型预测在相邻年份不规则波动,出现时间不一致。接入智能体搜索工具后,表现变化为−3.15%至14.14%,仍难轻易解决问题。研究指出模型需要更好地编码知识的时间适用性。