论文

面向持续科学发现的证据知情LLM信念

Evidence-Informed LLM Beliefs for Continual Scientific Discovery

智能体系统Agent 规划

摘要

大语言模型(LLM)的开放式科学发现日益作为假设搜索与验证的长程循环运作——奖励信号引导下一步测试哪个假设。一个显著的近期例子是AutoDiscovery——它使用“贝叶斯惊讶”——LLM在观察某假设的证据后经历的信念偏移——同时作为发现度量与搜索奖励。我们首先观察到AutoDiscovery把惊异当作静态量——而人类推理中的惊异是非平稳的——它相对随经验演化的信念定义——这是持续科学发现的前提。我们以证据知情的LLM信念解决该错配:用先前假设的证据更新先验——为新假设计算非平稳惊异。我们比较上下文信念更新机制——发现对既往发现的基于嵌入检索增强生成最能预期最终后验——识别出37.5%的静态惊异为伪。随后我们修改搜索以避免这些伪奖励——优先在非平稳信念下仍令人惊讶的假设。具体地——我们对原搜索程序引入两个互补变化:信念更新过滤与多样性最大化。跨五个发现域——我们的方法较原搜索程序平均增加30.62%的累积非平稳惊异——表明LLM的持续科学发现不仅需要更好的信念度量——还需要避免冗余、鼓励多样性的搜索程序。