论文
CARAT:材料大语言模型会推理还是背诵?
CARAT: Do Materials LLMs Reason or Recite?
摘要
当材料大语言模型回答有关晶体结构的问题时,它是从结构中推理还是复制已在其输入中打印的答案?准确性无法说明:结构描述通常会打印出其评分所针对的字段。 CARAT 在八个匹配视图中固定问题和黄金答案,在 GraphSpace 中单独命名每个结构关系,并添加匹配微调、答案屏蔽、证据注入、配对推理和可以保留声明的规则。首先,在基准最难的家庭中,扎根的观点比公式输入值高 17.3 分。其次,我们将这种审视转向我们自己。 GraphSpace 比普通周期图高出 19.3 个点,但这个余量同时产生两个影响:普通渲染包含问题所需的所有内容的情况下,它是 1.96 个点,而完全忽略这些字段的情况下,是 46.7 个点。标题主要衡量基线缺乏什么,而不是如何呈现证据。第三,我们攻击自己的标杆。跳过链接并直接读取列表的规则回答了七个顽固家族中的四个,因此我们重建了它,直到十一个这样的快捷方式接近机会。冻结模型引用了该链接,但当我们重定向它时,在 95.6% 的配对情况下答案相同:它重复该关系而不使用它。经过匹配监督后,它达到了 99.8%,删除链接后,它会下降到 23.4%,低于最佳捷径达到的 27.0%:这两个步骤都是可学习的。