论文
Translate-R1:通过强化学习使用具有成本意识的翻译工具
Translate-R1: Cost-Aware Translation Tool Use via Reinforcement Learning
摘要
LLM 中语言之间的性能差距有据可查,并且本机地缩小它需要在语料库上进行预训练或 微调,对于大多数语言来说,这是相当有限的。翻译提供了另一种选择:将输入转换为模型的主导语言可以立即释放其全部功能。但是,对于模型已经处理的语言来说,翻译每个输入都是浪费,同时将选择权留给模型也会失败,因为 LLM 过于自信,即使在无法理解输入的情况下也会跳过该工具。先前的工作通过特定于语言的规则、启发式或外部路由器解决了这个问题,每一个都需要手动工程。相反,我们学习一个单一的策略,该策略决定何时仅根据奖励进行翻译,开发语言和领域自适应的内省,仅当它无法本地解决任务时才调用翻译。使用来自我们保留答案的翻译管道的数据,我们继续在训练后的 Qwen3-4B 上跨 3 个资源层(高、低、XLow)和 5 个域的 22 种语言进行强化学习,并引入置信门控 GSPO 以供成本敏感的工具使用。门控策略将未训练基线的奖励提高了+4.6(高)、+23.5(低)和+17.5(XLow),并将零样本扩展到 9 种保留语言。与几乎总是转换的无约束策略(奖励上限)相比,它以成本的 66% 保留了全额奖励,在低资源层上比其他成本惩罚高出高达 +24.3,同时在高资源层上以工具使用的一小部分与免费策略的奖励相匹配。在 2 种之前零接触的合成语言上,它正确地学会了始终翻译,比过度自信的基线提高了 +18.7。