论文
无验证者测试时间扩展的一致性
Consilience for Verifier-Free Test-Time Scaling
摘要
测试时间扩展通常使用外部验证器,例如编码中的编译器和测试用例或机器人应用程序中经过训练的值函数,以获得高质量的执行轨迹。无验证器测试时间缩放(或 VF-TTS)作为一种增强 大语言模型 (LLM) 推理的机制正在获得广泛关注,主要是因为我们在许多实际应用中无法访问如此高质量的验证器。在现有的 VF-TTS 方法中,基于置信度的 VF-TTS 方法(仅根据置信度计算和对执行轨迹排序)特别有前途。此类方法为样本评估引入了接近于零的开销,并且需要最少的内部模型状态访问,从而使这些方法在模型和任务之间具有高度灵活性。在本文中,我们证明了现有基于置信度的 VF-TTS 方法的一个关键局限性,即此类方法在处理复杂任务时会发生灾难性的崩溃。我们观察到一个非常有趣的现象:一致的高置信度经常表明探索失败,倾向于自信地给出错误的答案。为了解决这个问题,我们的核心见解是,稳健的认知搜索需要特定的置信轨迹模式:此类方法在开始时执行探索性分支,如初始置信度较低所示,并收敛到最终置信度较高的解决方案。为了实现这一见解,我们引入了一致性,这是一种新颖的选择框架,可以明确评估推理置信度的时间不对称性。我们通过组合指标来实施这一点,该指标积极惩罚高初始置信度,同时严格要求最终确定性。涵盖研究生水平数学问题和自由格式代码生成的广泛实验表明,一致性有效地优于现有基线,验证了我们对完成置信度的新颖观点。