论文

CoT2-Meta:面向测试时推理的预算约束元认知控制

CoT2-Meta: Budgeted Metacognitive Control for Test-Time Reasoning

模型推理测试时计算扩展

摘要

近期的测试时推理方法通过生成更多候选链或在更大的推理树上搜索来提升性能,但它们通常缺乏对何时扩展、剪枝什么、如何修复以及何时放弃的显式控制。我们提出CoT2-Meta,一个免训练的元认知推理框架,将对象级的思维链生成与对部分推理轨迹的元级控制相结合。该框架整合四个组件:策略条件化的思维生成、树状搜索、用于步骤级推理评估的在线过程oracle,以及通过扩展、剪枝、修复、停止与回退决策来分配计算的元控制器。在匹配的推理预算下,CoT2-Meta持续优于强大的单路径、基于采样与基于搜索的基线,包括ReST-MCTS。在默认骨干模型上,它在MATH上取得92.8 EM,在GPQA上取得90.4的准确率,在GSM8K上取得98.65 EM,在BBEH上取得75.8的准确率,在MMMU-Pro上取得85.6的准确率,在HLE上取得48.8的准确率,相对最强非CoT2-Meta基线分别提升+3.6、+5.2、+1.15、+2.0、+4.3与+4.3分。除这些核心结果外,该框架在覆盖知识与问答、多跳推理、编程及分布外评估的更广泛的15个基准套件上依然有效。补充分析显示出更好的计算扩展性、更优的校准、更强的选择性预测、有针对性的修复行为,以及跨骨干模型家族的一致增益。这些结果表明,显式元认知控制是构建可靠且计算高效的测试时推理系统的一项实用设计原则。

CoT2-Meta:面向测试时推理的预算约束元认知控制:论文配图
图 1:CoT2-Meta 作为推理之上的推理。内层执行对象级推理,而外层对部分轨迹执行元认知控制。元控制器决定何时在有限预算下扩展、修剪、修复、停止或放弃。