论文
SCATR:简单校准的测试时间排名
SCATR: Simple Calibrated Test-Time Ranking
摘要
测试时间扩展 (TTS) 通过在推理时分配额外的计算来改进 大语言模型 (LLM)。在实践中,TTS 通常是通过并行扩展来实现的:生成多个候选响应并通过 Best-of-N (BoN) 策略选择最佳响应。因此,其有效性取决于评分函数。过程奖励模型 (PRM) 等学习评分器可能很强大,但训练和运行成本高昂。基于词元对数概率的轻量级置信启发法要便宜得多,但我们发现它们的性能通常要差得多。为了改进轻量级置信启发法,而又不产生更强的学习评分器的全部成本,我们引入了 SCATR,这是一种简单而高效的 BoN 排名方法,它使用基本模型的隐藏表示从小型校准集中学习轻量级评分器。在编码和数学推理基准测试中,SCATR 比之前基于置信度的基线提高了高达 9%。相对于相同校准数据上的 LoRA 微调,它实现了相当的精度,可训练参数减少了 8000 倍,计算量也低得多,训练和推理延迟分别减少了 150 倍和 1000 倍。 SCATR 还与强大的 PRM 基线相比具有竞争力,在多种设置中,数学准确率提高了 7.8%,编码准确率提高了 4.2%,同时推理速度提高了 1000 倍。总体而言,SCATR 为可扩展的测试时间选择提供了强大的准确性与效率权衡。