论文

大语言模型何时应该相信自己的修订?内在自我修正的风险意识研究

When Should LLMs Trust Their Own Revisions? A Risk-Aware Study of Intrinsic Self-Correction

模型评测模型推理推理验证与自校正评测方法与指标

摘要

内在自我修正要求语言模型在不接收新的外部证据的情况下修改自己的答案。第二遍可以纠正错误,但也可以推翻已经正确的答案。我们通过跟踪初始答案和修订答案之间的正确性转换,研究了 BoolQ、GSM8K 和 Corr2Cause 上 29 个开放权重大语言模型的这种权衡。聚合准确率可以掩盖显着不同的修订行为:例如,Llama-3.1-8B 在 GSM8K 上提高了 25.5 个百分点,而细化将 19.1% 的最初正确答案更改为错误答案。一项受控的 BoolQ 研究进一步表明,精炼会改变恢复和伤害之间的平衡。然后,我们比较三种运行时选择:保留初始答案、始终接受修订以及使用初始响应后可用的信号有选择地调用修订。通过比较,可以确定学习门控有用的设置以及更简单的无条件策略表现更好的其他设置。这些结果表明,将内在的自我修正视为一种修正策略,而不是视为一致有益的第二遍,并通过它恢复的修正和它引入的错误来评估它。