论文
LLM智能体的工具创建与使用联合优化
Joint Optimization of Tool Creation and Use for Large Language Model Agents
摘要
工具增强的语言模型受限于人类愿意去编写的API;现有工具创建系统通过在推理时提示冻结的LLM来修补这一问题,导致编写工具的模型与使用工具的模型相解耦,没有任何信号表明它产出的schema就是它自己能够调用的schema。我们提出SMITH(Schema-grounded Multi-task Iterative Tool Honing),一个在单一策略内联合训练工具创建与工具使用的强化学习框架。每次rollout要么是构建任务(从少量示例编写一个工具),要么是使用任务(在留出问题上调用工具池中的工具)。三条独立的奖励轴分别捕获schema、代码与结果层面的失败,使每种失败模式贡献各自的梯度。一个用SMITH在13个带精确验证器的程序化推理任务上训练的4B Qwen3,在留出任务上达到79.8的宏平均准确率,为所有被评估方法中最佳,并领先于未经训练的30B-A3B工具编写者。它还在TabMWP-Hard上达到40.4,在域外GQA上达到42.6(比最佳同骨干推理时基线高7.6),且未使用任何视觉或表格训练数据。我们4B模型编写的工具还在相同推理任务下提升了LFM-2.5-350M与Qwen3-30B-A3B的性能。