论文
我们需要前沿模型来验证数学证明吗?
Do We Need Frontier Models to Verify Mathematical Proofs?
摘要
训练、后训练 和推理时间方法的进步使前沿推理模型能够在数学竞赛中赢得金牌并解决具有挑战性的开放问题。要获得对这些模型响应的信任,需要检查自然语言证明是否有错误。 LLM 法官越来越多地被采用,以满足评估此类证明不断增长的需求。虽然验证被认为比生成更容易,但可靠的验证实际上需要什么模型功能?我们在竞争级问题的人类分级自然语言证明数据集上系统地评估了四个开源和两个前沿 LLM。我们考虑两个关键指标:验证者的准确性和自我一致性(对同一证明的重复判断的一致率)。我们观察到,较小的开源模型的准确度仅落后于前沿模型约 10%,但不一致程度高出约 25%。此外,我们发现验证者的准确性对所有模型的提示选择都很敏感。然后,我们证明较小的模型实际上确实具有在前沿模型级别验证证明的数学能力,但它们很难通过一般判断提示可靠地引出这些能力。通过 LLM 引导的提示搜索,我们合成了一组专门的提示,克服了较小模型的特定故障模式,将其性能提高了 9.1% 的准确性和 15.9% 的自我一致性。这些收益是跨模型和数据集实现的,使得 Qwen3.5-35B 等模型在证明验证方面的性能与 Gemini 3.1 Pro 等前沿模型相当。