论文
通过不确定性下的策略性信息分配理解LLM推理
Understanding Reasoning in LLMs through Strategic Information Allocation under Uncertainty
摘要
大语言模型在推理过程中经常表现出顿悟时刻,例如在“等等”等标记后明显的自我纠正,但其潜在机制仍不清楚。我们引入了一个信息论框架,它将推理分解为程序信息和认知语言化——支持下游控制行动的不确定性的明确外化。我们表明,纯粹的程序推理可能会变得信息停滞,而认知语言化可以持续获取信息,并且对于实现信息充分性至关重要。实证结果表明,强大的推理性能是由不确定性外化驱动的,而不是由特定的表面标记驱动的。我们的框架统一了之前关于顿悟时刻和训练后实验的发现,并为未来的推理模型设计提供了见解。
