论文

虚假工具的使用:当强化学习智能体得知错误的行动理由时

Spurious Tool Use: When RL Agents Learn the Wrong Reason to Act

模型训练强化学习

摘要

大型语言模型 (LLM) 代理越来越多地将自然语言推理与网络搜索和代码执行等外部工具交织在一起。这些工具使用策略通常通过强化学习(RL)进行优化,这可以放大训练数据中的虚假相关性。在这项工作中,我们研究了经过 RL 训练的智能体何时以及为何学习快捷工具选择策略:根据表面提示线索而不是真正的任务要求调用工具。我们构建了结合事实问答和数学推理任务的受控合成环境,并在训练过程中注入与特定工具密切相关但与工具必要性因果无关的线索。在存在提示但不需要相关工具的反事实评估中,代理表现出大量的捷径行为,虚假工具调用率增加了高达 39%。然而,快捷方式的形成并不普遍:在我们测试的条件下,只有当智能体已经学会可靠地使用目标工具时,它才会出现,这表明任务能力,而不仅仅是数据集不平衡,是快捷方式学习的关键因素。交换线索分析进一步表明,线索和工具之间的语义对齐大大放大了这种效果。为了减轻这些失败,我们引入了密集的决策级奖励,其中大语言模型法官评估每个工具调用的必要性。这种工具必要性奖励有效地抑制了线索驱动的工具使用,同时保持了任务绩效,为提高 LLM 代理工具使用策略的稳健性提供了一种实用的方法。