论文
LLM-as-an-Improver:将验证反馈转化为更好的候选答案
LLM-as-an-Improver: Turning Verification into Better Candidates
摘要
基于验证器的选择通过生成多个候选解并使用验证器选出最有希望的一个来提升大语言模型表现。但现有方法通常仅把验证作为排名步骤,在固定候选池评估完毕后便丢弃反馈。本文研究验证能否同时改善候选集本身。为此,我们提出LLM-as-an-Improver及Verify—Repair—Reselect(VRR)方法,利用验证反馈生成并重新选择改进后的候选解。VRR保留初始优胜者,同时按条件生成三种互补替代方案:优胜者的修复版、次优者的修复版,以及采用新方法的解答。它仅利用推理时信息过滤无效和重复候选,再按原有评估标准重新选出最终答案。在多种模型、代码生成和推理基准上,VRR在许多设置中优于固定候选池的验证器选择,即使初始池中的候选全部错误,也能恢复出正确解。这些结果表明,大语言模型可扮演更广泛的改进者角色:验证反馈不仅能从现有解中选择,还能构造超出初始池的更强候选。
