MetaCtrl:您的大语言模型可以使用元认知控制器更好、更简洁地进行推理
MetaCtrl: Your Large Language Models Can Reason Better and More Concisely with a Metacognitive Controller
摘要
大型推理模型通过在回答之前分配额外的计算来提高挑战性问题的性能,但较长的推理并不总是会带来更好的结果,并且可能会在简单问题上引入大量冗余推理。相反,过度缩短推理会降低困难推理的表现。因此,有效的推理需要根据推理器的能力和不断发展的解决方案状态动态地决定何时附加计算有用。现有的方法通常依赖于预定义的预算或干预规则,重新训练目标推理器,或需要额外的监督。我们引入了 MetaCtrl,这是一种轻量级控制器,可以自适应地调节冻结推理器,而无需预定义词元预算或推理器重新训练。我们将推理调节表述为一个顺序元认知控制问题:MetaCtrl 观察不断演变的推理轨迹,并决定是否继续、简化、跳过冗余步骤或结束推理。它直接通过强化学习进行训练,使用优先考虑正确性的奖励,同时支持正确解决方案中较短的轨迹,既不需要监督干预轨迹,也不需要针对特定问题的预算。在涵盖数学、科学和代码的七个基准测试中,MetaCtrl 不断提高 LRM 的准确性,同时缩短其推理长度。在 DeepSeek-R1-Distill-Qwen-7B 上,它将平均准确率提高了 4.7 个点,同时将生成长度缩短了 53.3%。无需进一步训练,同一控制器即可转移到看不见的推理机(例如 Qwen3-14B),将平均准确度提高 2.9 个点,并将生成长度缩短 50.3%。这些结果将 MetaCtrl 确立为即插即用控制器,可提高推理准确性,同时大幅减少推理时间的生成。该代码可在 https://github.com/binbin2xs/MetaCtrl. 获取