论文

模型能力占主导地位:AIMO 3 的推理时间优化经验教训

Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3

模型推理测试时计算扩展

摘要

对多次 LLM 尝试的多数投票改进了数学推理,但相关错误限制了有效样本大小。一个自然的解决办法是为不同的选民分配不同的推理策略。该方法“Diverse Prompt Mixer”在 AIMO 3 竞赛中进行了测试:3 个模型、23 多个实验、50 个 IMO 级别问题、一个 H100 80 GB、5 小时限制。每一次即时级别的干预都会失败。高温采样已经消除了误差;较弱的策略降低准确性的程度大于降低相关性的程度。在 N=8 的情况下,跨越 8 点的能力差距,并且在每次优化测试中,模型能力都占主导地位。最佳多数票得分 (42/50) 和 pass@20 (~45.5) 之间的差距是选择损失,而不是即时损失。基于验证者的选择器可以关闭它。即时工程不能。