论文

随着LLM能力提升,软引导开始超过思维链提示

Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve

模型评测模型行为与机制分析

摘要

链式推理(CoT)提示仍然是评估模型推理能力的标准基准。最初,这种方法被引入以从大语言模型(LLMs)中引出逐步推理,这些模型通常倾向于直接输出最终答案。然而,许多现代的LLMs在处理推理任务时会“自然”地产生CoT式响应,这促使我们重新审视标准CoT提示的有效性。我们在一个数学问题解决任务上评估了几种现代的中型语言模型,并发现专门用于推理的任务模型在简单零样本设置下表现更好,而使用少量样本CoT示例则不然——显著超越官方报告的结果(例如,在GSM8K上的Mathstral从77%提升到84%)。对于测试的通用性模型,零样本CoT提示也足以超过少量样本CoT基准。我们将其归因于“指导-干扰”权衡:标准CoT提示还要求风格适应、格式合规和潜在的不想要的上下文化,这可能会分散模型专注于核心推理任务。我们的发现表明,使用标准CoT提示越来越成为一种干扰因素,随着模型变得更强。