论文

大型推理模型中推理时间的能力和效率的扩展

Scaling of Capability and Efficiency at Inference Time in Large Reasoning Models

模型评测模型能力评测

摘要

能力和效率是大型语言模型 (LLM) 推理的两个关键维度。能力是指正确解决给定问题的能力,而效率是指利用有限资源解决问题的能力。当大语言模型使用思想链 (CoT) 推理来解决受控难度的问题时,正确解决的问题数量和得出正确答案所需的标记数量都取决于问题难度和模型大小。然而,这些因素如何共同影响能力和效率仍然知之甚少。在这里,我们使用分层贝叶斯模型来评估 DeepSeek-R1-Distill 模型系列中的大语言模型在四类算术和算法推理问题上的能力和效率。在固定的模型大小下,正确解决实例的概率随着实例大小(我们对问题难度的代理)呈指数衰减。衰减规模随模型大小呈次线性增长,表明较大的模型能力更强,但能力增益会随着规模的增大而减弱。输出长度随着实例大小的幂律增长,作为难度的代理。然而,该幂律的参数不会随着模型大小而系统地变化,这表明较大的模型并不会变得更加高效。总之,这些发现揭示了单纯扩展作为开发更强大的人工智能系统的策略的潜在局限性:能力随着回报递减而提高,而效率几乎没有提高。