论文
混沌中的阶梯:测试时间缩放何时、如何(或许还有为什么)改进 LLM 机器翻译
Ladders in Chaos: When, How, (and Perhaps Why) Does Test-Time Scaling Improve LLM Machine Translation
摘要
大语言模型 (LLM) 的测试时间缩放的两种形式已成为有效且广泛采用的范式:顺序的,其中稍后的答案尝试依赖于早期的答案尝试,以及并行的,例如独立同分布。重新排序抽样。在这项研究中,我们研究了它们在翻译中的特性。首先,我们的研究表明,顺序抽样具有更高的性能上限,可以提供更加多样化和有效的样本池,特别是在较小的抽样预算下。其次,我们通过多维手动分析来询问测试时间缩放的本质。对 Best-of-N 翻译的人工分析表明,顺序采样极大地提高了翻译的流畅性和自然度,但当推理预算很大时,可能会降低准确性。最后,我们建议解释顺序缩放改进机器翻译的机制。我们的受控分析将连续自我改进的成功部分归因于模型对更大目标端上下文的访问。顺序采样的消融实验证明了其在不同采样温度下的鲁棒性,同时也揭示了对上下文构建的敏感性,为未来的改进提出了方向。