论文

大语言模型 应该看到什么?物理不变量作为偏微分方程发现的数据表示

What Should a Large Language Model See? Physical Invariants as a Data Representation for PDE Discovery

上下文与知识上下文工程

摘要

了解分子相互作用如何控制宏观行为是分子科学的一个核心挑战。然而,传统的理论构建无法跟上现代实验通常产生的大量数据集的步伐。 大语言模型 提供了一条有前途的自动化理论构建途径,但时空场不能直接放置在提示中。现有模型通常仅通过衡量每个提案的拟合程度的分数来了解数据。在这里,我们引入数据解释,这是一个将场测量为理论家将参考的数量并将其作为直接输入提供给模型的阶段。在模拟场的基准上,相对于显示原始数据,解释几乎使恢复方程的准确性提高了三倍,计算成本可以忽略不计,并且无需任何训练。通过允许语言模型像理论家一样读取现场数据,数据解释为自动化现场理论构建提供了一条实用的途径,可以与实验共同发展。