论文

扩展推理中提示策略的温度相关性能 大语言模型

Temperature-Dependent Performance of Prompting Strategies in Extended Reasoning Large Language Models

模型评测模型能力评测

摘要

扩展推理模型通过启用显式测试时计算来解决复杂问题,代表了 大语言模型 (LLM) 功能的变革性转变。然而,这些系统的采样温度和提示策略的最佳配置在很大程度上仍未得到充分探索。我们使用 Grok-4.1 系统地评估了四种温度设置(0.0、0.4、0.7 和 1.0)的思维链和零样本提示,并对来自 AMO-Bench(一项具有挑战性的国际数学奥林匹克级别基准)的 39 个数学问题进行扩展推理。我们发现零样本提示在中等温度下达到峰值性能,在 T=0.4 和 T=0.7 时达到 59% 的准确率,而思想链提示在极端温度下表现最好。最值得注意的是,扩展推理的好处从 T=0.0 时的 6 倍增加到 T=1.0 时的 14.3 倍。这些结果表明温度应与提示策略联合优化,挑战使用 T=0 进行推理任务的常见做法。