论文

从 Pass@K 和 Pass@1 之间的差距中学习

Learning from the Gap Between Pass@K and Pass@1

模型训练监督微调与指令调优

摘要

对许多响应进行采样并保留通过验证器的响应,可以让大语言模型解决超出其单一响应能力的问题,但必须为每个查询再次支付此搜索费用,而许多部署仅使用单一响应进行回答。对经过验证的响应进行后训练可以将搜索的优势转移到模型中。在固定预算的情况下,仅根据正确性进行选择会将时间花费在模型已经正确回答的问题上,而留下更少的时间来纠正其错误。为了解决这种不平衡问题,我们提出了 GapFT,它根据 Pass@K 和 Pass@1 之间的差距进行训练:源模型在一个响应中失败但在 K 个样本内解决的问题。 GapFT 保持目标和训练预算固定,仅更改经过验证的响应进入训练;精确的分解将产生的 Pass@1 更改分解为纠正的故障和源模型已解决的问题的回归。在具有三个模型系列的 LogiQA 2.0 和 ReClor 上,GapFT 在每种设置下都高于预算匹配的均匀拒绝采样微调 (RFT),具有积极的汇集效应,并且在 Llama-3.1-8B 和 Mistral-7B 上,它恢复了整个已验证池的微调增益的约三分之二到五分之四,并解决了 11-34% 的问题。进一步的分析表明,收益来自于前几个搜索样本恢复的失败,而仅通过更深层次的搜索发现的失败会取代重放并且不会增加净收益,用黄金标记的失败搜索填充相同的预算无法达到较低的准确性,并且收益受到搜索暴露的可转移失败的数量的限制。