论文
廉价验证器,大盲区:衡量降本级联系统的可靠性代价
Cheap Verifiers, Large Blind Spots: Measuring the Reliability Cost of Cost-Saving Cascades
摘要
推理级联通过使用廉价模型回答大多数查询并将硬尾升级为充当验证器的前沿模型来降低成本。一个自然的扩展结束了循环:根据验证者的拒绝对便宜的学生进行微调,以便升级率和成本每轮都会下降。我们对真实的LLM进行了测量,并报告了四项发现。首先,验证者的盲点,即它接受的学生错误答案的比例,很大,并且呈对抗性移动:它随着学生能力的增长而增长(当学生从 0.5B 扩展到 32B 时,$β$ 从 0.12 到 0.55),并随着验证者的能力而缩小,因此它在廉价学生、廉价验证者级联机制中是最糟糕的。其次,购买它会带来节省:前沿验证器将 $β$ 驱动到大约 0.05,但随后在 46% 的硬数学查询上升级,而真实错误率为 39%,为近一半的流量支付了前沿价格。第三,对验证者拒绝的尾部进行幼稚的纠正性微调并不能改善小学生的情况,而是会降低并最终使其崩溃,对于我们尝试过的每位老师(跨家庭和同家庭)来说,因此在这种规模上,自我改进循环是弄巧成拙的。第四,通过所有这些级联自己的仪表板,通过验证器计算的每个指标,读取的误差为 3%,而真实交付的误差高达 32%:系统对其自身的构造退化视而不见。然后,我们给出了解释盲目性的理论、二群体守恒定律 $ε_\infty \lesssim q_0 β_0$(在该定律下,每个环内指标都会提高,而真实质量却不会),以及验证该机制的综合研究。实际结论:自我改进级联的可靠性无法从通过其自己的验证器计算的任何指标中读取。