论文
反思还是再生?为什么人工修订成功而 LLM 修订却失败
Reflection or Re-Generation? Why LLM Revision Fails Where Human Revision Succeeds
摘要
反思,即重新审视和修改先前推理的能力,是人类如何改进答案的核心。 大语言模型 (LLM) 越来越多地被提示“反思”,但这是否类似于人类修订仍不清楚。我们引入了 Human-LLM 反射框架 (HRF),这是一种受控的两遍协议,在自我、对等和跨代理设置的相同条件下比较人类和 LLM 版本。使用基于每次迭代交叉熵降低的信息论分析,我们发现了 LLM 反射的两种失效模式。在具有有限答案空间的客观任务中,反射产生接近于零的信息增益(Delta I 大约为 0),表现为与重新采样无法区分的中性再生。在主观任务上,它会产生显着的负增益(Delta I < 0),使预测偏离目标。相比之下,人工修正在这两种情况下都会产生积极的效果。跨代理实验将失败定位于修订步骤,而不是输入质量:LLM 甚至会降低高质量的人类响应。诊断分析(以首次通过正确性为条件的修订,以及针对随机重新洗牌基线的预言机引导修订)表明,哪个子步骤占主导地位因任务和模型而异,而不是简化为单一机制:自错误检测存在于客观多项选择任务中,但在主观任务中较弱,并且预言机错误信号下的恢复超过了某些模型的基线,而对于其他模型则低于基线。统一的帐户是结构性的:没有外部信息,自条件修正无法减少目标的不确定性,因此 LLM 反射更好地理解为条件重新生成,而不是真正的错误驱动修正。