论文
引导认知需求以支持LLM的自适应元推理
Cognitive Demand Steering for Adaptive Meta-Reasoning in Large Language Models
摘要
最近的元推理框架通过将链式思考生成封装在迭代的控制循环中,提高了LLM的推理能力,允许更有效的回溯、推理循环的终止以及注入有前景的推理模式,以及其他策略调整。尽管方法在很大程度上依赖于逆向奖励函数、粗略搜索动作或需要大量样本监督的额外推理控制器训练,但引入了认知需求导向(CDS)框架,该框架具备残余需求评估功能:在每个步骤中,LLM基的进展评估器评估到达解决方案所需的残余推理,而不是仅仅评估前一个步骤。这使元控制器能够选择包括通用示例和行动在内的推理干预,这些行动直接解决这一向前的需求信号。这种转变消除了任何已训练组件的需要,同时允许在没有任何适应的情况下,零样本转移跨模型和任务。与粗略的描述相比,我们使用认知尺度来设计干预以及在16个维度上设计初始问题复杂性和残余需求信号,这些维度由认知科学驱动(例如,注意和扫描、学习和抽象、空间物理推理),使控制器能够以精细的词汇进行诊断。在三个前沿的LLM和六个推理基准上,CDS在直接调用LLM和标准CoT推理的基础上,准确率提高了21.9%,在困难的数学和编程任务上,提高了9%。