LLM-IDEA:用可辨识性判断科学Agent实验停滞原因
LLM-IDEA: Identifiability-Driven Experimental Agent for Autonomous Discovery of Mechanistic World Models
摘要
大型语言模型代理越来越多地被部署为自主科学家,在最少的人类监督下设计实验并推断机械世界模型。然而,可识别性常常被忽视:当达到稳定状态时,智能体需要知道它是否能力还不够,或者模型根本无法从数据中识别,在这种情况下,再多的同类实验也无济于事。我们提出了可识别性驱动的实验代理(LLM-IDEA),用于闭环发现,其可识别性引擎返回三向高原结论:能力限制、在设计类别内可解决或经认证耗尽。在 ODEBench 上,62 个具有自由常数的系统中的 60 个在第 0 轮可识别;对于协议可以运行的每个实验,RC 电路都经过认证,并且收获模型可以通过添加一个初始条件来解析。可识别性引擎再现了 Lotka-Volterra、Van der Pol、Lorenz 和药代动力学模型的已知结论,其中推荐静脉注射臂药理学家 使用,并且它将我们自己的基准的深度评分器在四种观察设计中排名最后。在 DiscoverPhysics 基准上,它发现了两个公共世界,它们的解释标题奖励了法律实验无法做出的区分,并且每个具有准确轨迹的模型都未达到解释等级(15 个中的 15 个,而可识别世界中的 9 个中有 5 个,p = 0.012)。在外星宇宙中,我们提出了一个二体测试平台,其中力定律在可证明的不可识别协议和可识别协议之间切换,可识别协议上的 LLM-IDEA 在 8/8 种子上达到了至少 3 的发现深度,而没有种子时为 1/8。因此,自主发现代理可以计算(而不是猜测)是否需要更多搜索、更好的同类实验或不同类型的实验。