论文
TInR:探索 大语言模型 中的工具内部推理
TInR: Exploring Tool-Internalized Reasoning in Large Language Models
摘要
通过在推理过程中使用外部工具扩展 大语言模型 (LLM) 功能,工具集成推理 (TIR) 已成为一个有前途的方向。现有的 TIR 方法在推理过程中通常依赖于外部工具文档。然而,这会导致工具掌握困难、工具尺寸限制和推理效率低下。为了缓解这些问题,我们探索工具内部化推理(TInR),旨在利用内化到 LLM 的工具知识来促进推理。实现这一目标提出了显着的要求,包括工具内化和工具推理协调。为了解决这些问题,我们提出了 TInR-U,一种用于统一推理和工具使用的工具内化推理框架。 TInR-U 通过三个阶段的流程进行训练:1)具有双向知识对齐策略的工具内化; 2) 使用高质量推理注释监督 微调 热身,以及 3) 具有 TInR 特定奖励的强化学习。我们在域内和域外设置中全面评估我们的方法。实验结果表明,TInR-U 在两种设置下均取得了优异的性能,凸显了其有效性和效率。