论文

使用 LLM 进行上下文分子特性预测:关于记忆和知识冲突的盲法研究

In-Context Molecular Property Prediction with LLMs: A Blinding Study on Memorization and Knowledge Conflicts

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 的功能已从自然语言处理扩展到科学预测任务,包括分子特性预测。然而,它们在上下文学习中的有效性仍然不明确,特别是考虑到广泛使用的基准中训练数据污染的可能性。本文研究了 LLM 是否对分子特性执行真正的上下文回归,还是依赖于逐字检索记忆的目标值。此外,我们通过一系列逐步盲法实验来分析预先训练的知识和上下文信息之间的相互作用。我们使用系统致盲方法在三个 MoleculeNet 数据集(Delaney 溶解度、亲脂性、QM7 原子化能)上评估三个家族(GPT-4.1、GPT-5、Gemini 2.5)的 9 个 LLM 变体,该方法迭代地减少可用信息,并辅以 0、60 和 1000 次上下文样本大小作为信息访问的额外控制。为了验证记忆分析和致盲实验,我们为记忆实验添加了阳性和阴性对照,为多样本实验添加了结构参考基线,并为所有结果添加了引导置信区间。我们没有发现遗留基准上逐字检索的证据,并表明盲法暴露了预先训练的知识和上下文信息之间的冲突。这项工作为评估受控信息访问下的分子特性预测提供了一个原则框架。