论文

一项策略就足够了:单代理强化学习优于化学工具学习的树搜索

One Policy Is Enough: Single-Agent Reinforcement Learning Outperforms Tree Search for Chemistry Tool Learning

模型训练强化学习

摘要

化学问题通常需要精确的计算和数据库查找,而语言模型无法从其参数中提供这些功能,因此必须使用外部工具。这里的工具使用是一个由三部分组成的问题:从一个大池中选择正确的工具,用正确类型的参数填充它,然后进行链式调用,以便每个工具都消耗最后一个的输出。 CheMatAgent 是之前发布的一个系统,它通过分层进化 MCTS 解决了这个问题:在两个有学识的批评者下搜索工具调用树的独立策略和执行模型,其中一个部分回归到 GPT 分配的分数。我们证明单一政策就足够了。我们的模型在从左到右的一代中交错推理、工具调用和返回,通过监督预热进行训练,然后根据直接从黄金调用链读取的程序化奖励进行结果级强化学习,这样在训练循环中就不会留下有学问的批评家和法官。在 ChemToolBench 多工具综合化学上,在使用 CheMatAgent 的两个主干上,我们将 Qwen-2.5-7B 上的工具 F1 提高了 5.5%,将返回 F1 提高了 9.6%,在 Llama-3.1-8B 上提高了 3.7% 和 3.9%,与它们最强的搜索配置相比,每个问题一次模型调用,针对成本随树增长的搜索;我们还在 Qwen-2.5-7B 上领先答案通过率。