论文

内在的自我纠正何时有帮助?任务敏感的分析

When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis

模型评测模型行为与机制分析

摘要

内在自我校正 (SC) 旨在通过提示模型在没有外部反馈的情况下重新审视自己的初始答案来改进 大语言模型 输出。最近的研究对这种方法的可靠性提出了质疑,表明模型常常难以判断其初始反应是否正确。在这项工作中,我们对 SC 采取任务敏感的观点。我们不是询问它是否普遍有效,而是检查 SC 可能通过不同机制运作的环境:验证明确的约束,重新审视复杂的推理过程,或者对文字游戏任务中的竞争策略提供第二意见。在多个基准测试和模型中,我们发现当底层任务结构促进这些修订模式时,SC 可以产生一致的性能增益。这些结果表明,SC 最好被理解为一种依赖于任务的推理时间策略,其有用性取决于修订阶段在给定任务中可以发挥的作用,而不是作为改进初始模型输出的一致可靠的方法。