论文
当 API 使用错误的语言时:重新审视 后训练 的多语言工具使用
When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use
摘要
在多语言环境中,大语言模型 (LLM) API 调用的可靠性会降低。当模型选择正确的工具但以不一致的语言生成参数值时,会发生常见的失败,我们将其称为参数语言不匹配(ALM)。尽管在语义上是正确的,但此类输出在操作上是无效的,并且不会被标准 API 调用指标捕获。我们重新审视用于缓解 ALM 的 后训练 策略,发现在我们的基准测试中,受监督的 微调 (SFT) 提供了强大的基线,显着提高了参数语言的一致性和端到端函数调用的准确性。在一致的模型选择下,SFT 的性能可与更复杂的强化学习 (RL) 方法相媲美,有时甚至超过。我们进一步研究具有结构化、争论感知奖励的强化学习是否能提供额外的好处。虽然组相对策略优化 (GRPO) 等方法可以提高语言一致性并更好地保留一般推理能力,但这些收益是渐进的,并且在泛化和多目标权衡中最为明显。总的来说,我们的结果表明,多语言 API 基础的大部分性能可以通过仔细的监督训练来实现,而 RL 提供的是有针对性的而不是根本性的改进。