论文
使用测试时计算改进潜在泛化
Improving Latent Generalization Using Test-time Compute
摘要
语言模型 (LM) 表现出两种不同的知识获取机制:权重学习(即在模型权重内编码信息)和上下文学习 (ICL)。尽管这两种模式具有互补的优势,但权重学习经常难以促进对内化知识的演绎推理。我们将这种限制描述为潜在泛化的缺陷,逆转诅咒就是一个例子。相反,上下文学习表现出高度强大的潜在泛化能力。为了提高权重知识的潜在泛化能力,先前的方法依赖于训练时数据增强,但这些技术是特定于任务的,可扩展性较差,并且无法泛化到分布外的知识。为了克服这些缺点,这项工作研究了如何训练模型使用测试时计算或“思考”,特别是为了提高潜在泛化能力。我们使用正确性反馈中的强化学习 (RL) 来训练模型,以产生长的思维链 (CoT),以提高潜在泛化能力。我们的实验表明,这种思维方法不仅解决了分布内知识的潜在泛化失败的许多实例,而且与增强基线不同,它还可以泛化到未执行强化学习的新知识。然而,在纯粹的反转任务中,我们发现思维并不能解锁直接的知识反转,但思维模型的生成和验证能力使它们能够获得远远高于机会的表现。事实自我验证的脆弱性意味着思维模型仍然远低于该任务的情境学习的表现。总的来说,我们的结果将测试时思维确立为提高 LM 潜在泛化能力的灵活且有前途的方向。