论文

超越元推理:面向LLM推理自我改进的元认知巩固

Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning

上下文与知识智能体系统记忆智能体自我改进Agent记忆

摘要

大语言模型(LLM)已展现出强大的推理能力,随着现有增强LLM推理的方法不断成熟,越来越多的关注转向元推理这一有前景的进一步改进方向。然而现有大多数元推理方法仍是情景式的:它们专注于在单个实例内执行复杂的元推理例程,却忽视跨实例积累可复用的元推理技能,导致失败模式反复出现且元认知开销居高不下。本文提出元认知巩固(Metacognitive Consolidation),一个新框架,模型将过去推理情景中的元认知经验巩固为可复用知识,以改进未来的元推理。我们将该框架实例化为:把实例级问题求解结构化为推理、监控与控制等不同角色,以生成丰富且可归因的元级轨迹。随后通过分层、多时间尺度的更新机制巩固这些轨迹,逐步形成不断演化的元知识。实验结果表明,该框架在多个基准与骨干模型上均取得一致的性能提升,且性能随元认知经验随时间的积累而提高。

超越元推理:面向LLM推理自我改进的元认知巩固:论文配图
图 2:元认知巩固 (MC2) 概述。内循环 (MRO) 通过推理器 - 监视器 - 控制器分解生成结构化的操作 - 批评 - 纠正跟踪,而外循环 (MCA) 将跨实例的这些跟踪合并为不断发展的元知识,并更新特定于角色的策略以进行后续推理。