论文
重写重要的内容:通过Agentic强化学习进行自适应多语言查询重写以进行推理
Rewrite What Matters: Adaptive Multilingual Query Rewriting for Reasoning via Agentic Reinforcement Learning
摘要
在多语言场景中,具有相同语义但不同语言的查询可能会引导模型进入不同的推理轨迹,从而导致性能差异。为了缩小这一差距,以前的研究通常采用一刀切的查询重写策略,例如翻译,它忽略了不同场景需要不同类型的语义转换的事实。在本文中,我们提出了 mRewriter-R1,一种具有强化学习功能的Agentic多语言查询重写框架。与单轮重写不同,mRewriter-R1将多语言查询重写制定为多轮顺序决策过程,模型通过自适应算子选择动态执行多方面优化。实验结果表明,mRewriter-R1 在不同的大推理骨干模型上优于所有强多语言重写基线。进一步分析表明,学习到的策略可以根据查询特征自适应地决定重写运算符,在不同的推理任务中表现出强大的泛化能力,并且与异构推理语言模型具有即插即用的兼容性。
