论文

COGTRL:通过强化学习使用认知轨迹训练 LLM 以提供科学发现援助

COGTRL: Training LLMs for Scientific Discovery Assistance using Cognitive Traces via Reinforcement Learning

模型训练强化学习

摘要

经过广泛科学研究的 大语言模型 (LLM) 日益成为科学发现的助手。然而,大多数研究论文忽略了检查约束、失败的替代方案以及实现预期目标所需的迭代决策的细粒度认知过程。这种认知过程对于现实世界的科学家在限制下实现特定目标至关重要。在本文中,我们表明,LLM 在接受训练以产生此类认知痕迹时,作为科学发现助手的表现比仅接受科学文献训练时更好。我们提出了 COGTRL,一种轨迹级强化学习框架,通过联合优化认知轨迹和以交错方式产生的科学步骤,训练 LLM 来模拟认知推理。在两个 3B 参数模型和两个科学领域(人工智能和材料科学)中,COGTRL 比可比较的 3B 模型基线平均提高了 7.85 个点的方法质量,并且相对于 70B 参数模型实现了具有竞争力的性能。此外,领域专家的分析表明,与基线相比,COGTRL 生成的方法更受青睐。