论文

自纠正幻觉:角色重标注门控显式错误标记

The Self-Correction Illusion: Role Relabeling Gates Explicit Error Flagging in Large Language Models

模型评测模型行为与机制分析

摘要

最近的研究表明,LLM 代理很难纠正自己推理轨迹中的错误,尽管他们有能力纠正外部来源的错误。我们询问这是否反映了能力缺陷或角色标签的人为因素。为了测试这一点,我们设计了一种免训练干预、源条件角色重新标记,使错误声明字节保持相同,仅改变其消息角色。该声明出现在代理的“<想法>”、用户消息、工具响应或系统“<内存>”块内。我们测试了 12 个模型域组合,涵盖从 70B 级到较小系列的封闭权重 API 和开放权重模型。将“<想法>”重新标记为外部角色可将显式纠正率提高 23 至 93 个百分点,在 12 个实验设置中的 10 个实验设置中显着。这表明这些模型未能检测到自身生成的错误很大程度上是由于聊天模板中的角色标记方式造成的,而不是纯粹的认知缺陷。最有效的角色标签是与领域相关的:“<记忆>”在大多数数学实验中占主导地位,而用户消息在逻辑演绎中占主导地位。将角色标签处理视为指令调整中的关键实验变量,为缩小自我纠正差距提供了更直接的途径。

自纠正幻觉:角色重标注门控显式错误标记:论文配图
图 1:自我修正错觉。在 GSM8K 风格的数学中,将字节相同的错误声明 (𝒄⋆\boldsymbol{c_{\star}}) 从代理自己的 <thought> 重新标记为外部角色(用户、工具或系统 <memory>),将罕见的显​​式自我纠正转变为常见的结果。这表明自我纠正的失败很大程度上反映了角色标签的假象,而不是纯粹的能力缺陷。