论文

化学与材料推理落地验证:检测是瓶颈

Grounded verification of chemical and materials reasoning: detection is the bottleneck

模型推理推理验证与自校正

摘要

语言模型正在进入化学和材料发现工作流程,其中错误的分子式、空间群或形成能可以悄悄地传播到下游决策中。这些虚构隐藏在流畅的推理痕迹中,并集中在罕见的长尾实体上,在这些实体中,模型置信度最不值得信赖。检索每个提示的参考数据可以抓住他们,但要付出沉重的覆盖率和弃权成本。我们表明,确定性的、基于数据库的验证可以选择性地捕获和修复这些错误,并且绑定约束是检测而不是修复。我们的分层验证程序提取每个可检查的声明,根据权威数据库和物理定律对其进行测试,并仅在检查失败时检索参考值。在四个模型和超过 500 个带有固定条件的提示中,门控纠正将提交公式的错误率从 22% 降低到 4%,检索次数比全面增强少 3.2 倍,并且当每个答案(无论是否纠正)都被评分时,它的性能优于对话式检索预言机。当旗帜着火时,修复几乎总是成功的;只有在验证者的范围涵盖它并且存在长尾错误的情况下,收益才能达到最终答案。可检查的声明,检查成本低廉,是化学领域值得信赖的机器推理的实用杠杆。