论文
语言作为推理优化的潜在变量
Language as a Latent Variable for Reasoning Optimization
摘要
随着 LLM 减少以英语为中心的偏见,出现了一个令人惊讶的趋势:非英语反应有时在推理任务上优于英语。我们假设语言充当潜在变量,在结构上调节模型的内部推理路径,而不仅仅是充当输出媒介。为了测试这一点,我们进行了多语言思维实验,其中提示模型在语言受限和语言不受约束的条件下解决相同的问题。结果表明,非英语反应通常会达到更高的准确度,并且当语言不受限制时往往会出现最佳表现,这表明多语言能力拓宽了模型的潜在推理空间。基于这一见解,我们提出了polyGRPO(多语言组相对策略优化),这是一种将语言变化视为隐式探索信号的强化学习框架。它在语言受限和非受限条件下在线生成多语言偏好数据,从而优化答案准确性和推理结构方面的策略。仅在没有思想链注释的情况下对 18.1K 多语言数学问题进行训练,polyGRPO 将基础模型 (Qwen2.5-7B-Instruct) 在四个英语推理测试集上的绝对准确率提高了 6.72%,在多语言基准测试中提高了 6.89%。值得注意的是,它是唯一在英语常识推理任务上超越基本 LLM 的方法(4.9%),尽管它仅接受数学数据训练,凸显了其强大的跨任务泛化能力。进一步的分析表明,将语言视为潜在变量可以扩展模型的潜在推理空间,从而在推理性能方面产生一致且可推广的改进。