论文

生化领域不确定性下的LLM序贯决策

LLM sequential decision making under uncertainty in biochemical domains

模型评测上下文与知识记忆模型行为与机制分析Agent记忆

摘要

大语言模型 (LLM) 越来越多地用于推动科学发现。在信任LLM在紧张的实验预算下设计实验之前,了解LLM如何根据新数据和文献记忆做出决策至关重要。然而,他们的决策策略在当前用于评估研究人员的绩效分数中是不可见的。在这里,我们将贝叶斯优化设置中的五个前沿LLM与涵盖蛋白质工程、反应优化、分子设计、肽自组装和催化的七个组合数据集的已发布统计基线进行了基准测试。性能与模型信念和行为的直接测量相结合,从而实现高度解析的行为分析。逐渐剥离上下文的即时消融将记忆与化学推理和纯粹的分类优化分开。先前的化学知识有助于预期,但差异很大,有时甚至会损害绩效。没有经过测试的配置能够决定性地超越跨域的平均统计基线。信念运动和鞅诊断在这里纠正了测量噪声偏差,将理性主体错误地标记为非理性,表明模型对输入数据反应过度,而不是在此处研究的背景下巩固其先验。有趣的是,虽然LLM的行为是剥削性的,但模型真诚地打算探索并始终如一地按照这一意图采取行动。这种失败是由于情境粘性而产生的能力差距。删除上下文历史可以恢复探索,这表明先验和数据必须解耦才能实现有效的 LLM 驱动的发现。