论文

LANG:具有语言自适应提示指导的多语言推理强化学习

LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance

模型训练强化学习

摘要

事实证明,强化学习对于增强 大语言模型 (LLM) 中的多步推理是有效的,但其优势尚未完全转化为多语言环境。现有的方法面临着一个基本的权衡:优先考虑输入语言的一致性会严重影响推理质量,而优先考虑推理往往会导致语言意外地偏向英语。我们使用 LANG 来应对这一挑战,这是一种新颖的框架,利用语言条件提示来指导非英语推理任务的探索。我们的方法结合了两个关键机制来防止对这些提示的依赖:逐渐撤回脚手架的渐进衰减时间表,以及根据特定语言困难调整学习视野的语言自适应开关。具有挑战性的多语言数学基准的实证结果表明,LANG 在不影响语言一致性的情况下显着提高了推理性能。此外,我们表明我们的框架超越了数学,促进了跨模型层更一致的语言对齐