论文
决定推理策略的是模型的多样性,而不是方法
Your Model Diversity, Not Method, Determines Reasoning Strategy
摘要
LLM 推理的计算扩展需要在探索解决方案方法($宽度$)和完善有前途的解决方案($深度$)之间分配预算。大多数方法都会隐式地权衡一种方法,但为什么给定的权衡起作用仍不清楚,并且对单个模型的验证掩盖了模型本身的作用。我们认为,最优策略取决于模型的多样性概况、概率质量在解决方案方法中的分布,并且在采用任何探索策略之前必须对其进行表征。我们通过分解推理不确定性的理论框架将其形式化,并得出树式深度细化优于并行采样的条件。我们在 Qwen-3 4B 和 Olmo-3 7B 系列上进行了验证,结果表明,轻量级信号足以对低多样性对齐模型进行基于深度的细化,但对高多样性基础模型的效用有限,我们假设需要对较低的勘探覆盖范围进行更强的补偿。