论文
MedKIT:评估大语言模型中的知识集成和泛化
MedKIT: Evaluating Knowledge Integration and Generalization in Large Language Models
摘要
不断发展的现实世界知识需要不断更新模型。尤其是在医学领域,随着临床证据随着时间的推移而变化,过时的知识可能会带来安全风险。现有的知识整合评估侧重于事实回忆,对新整合的知识是否真正可用提供的洞察有限。我们的基准 MedKIT(医学知识集成和转移)提供了对模型如何在临床更新的实际序列下集成和应用知识的精细评估。每个实例都对应于来自临床证据的事实更新,并与评估跨词汇变异、关系转换、构成推理和开放式操作化的迁移以及知识保存的局部性测试的目标探针配对。使用 MedKIT,我们对 5 个不同模型(包括通用和医学大语言模型)的 12 种知识整合策略进行了大规模实证研究。我们的结果揭示了召回和可用知识之间的一致差距:虽然大多数方法在原始更新任务和词汇变化下取得了巨大的进步,但关系泛化是有限的,并且没有一种方法对组合或操作任务产生有意义的改进。这些发现凸显了知识整合方面的根本挑战,并将 MedKIT 定位为开发方法的测试平台,使新整合的知识在任务和环境中更加一致地可用。