论文
计算对齐训练:优化测试时间推理
Compute Aligned Training: Optimizing for Test Time Inference
摘要
扩展测试时计算已成为增强 大语言模型 (LLM) 性能的强大机制。然而,标准 后训练 范式、监督 微调 (SFT) 和强化学习 (RL) 在基本策略下优化单个样本的可能性,从而与依赖聚合或过滤输出的测试时间程序产生偏差。在这项工作中,我们提出了计算对齐训练,它将训练目标与测试时策略保持一致。通过将推理策略概念化为基本策略上的运算符,我们得出了新的损失函数,可以在应用所述策略时最大化性能。我们在常见的测试时间策略中实例化 SFT 和 RL 的此类损失函数。最后,我们提供的经验证据表明,与标准训练相比,这种训练方法大大改善了测试时间缩放。