论文
超越元推理:面向LLM推理自我改进的元认知巩固
Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning
摘要
大语言模型(LLM)已展现出强大的推理能力,随着现有增强LLM推理的方法不断成熟,越来越多的关注转向元推理这一有前景的进一步改进方向。然而现有大多数元推理方法仍是情景式的:它们专注于在单个实例内执行复杂的元推理例程,却忽视跨实例积累可复用的元推理技能,导致失败模式反复出现且元认知开销居高不下。本文提出元认知巩固(Metacognitive Consolidation),一个新框架,模型将过去推理情景中的元认知经验巩固为可复用知识,以改进未来的元推理。我们将该框架实例化为:把实例级问题求解结构化为推理、监控与控制等不同角色,以生成丰富且可归因的元级轨迹。随后通过分层、多时间尺度的更新机制巩固这些轨迹,逐步形成不断演化的元知识。实验结果表明,该框架在多个基准与骨干模型上均取得一致的性能提升,且性能随元认知经验随时间的积累而提高。
