论文

通过结构化元认知在通用代理中进行深度推理

Deep Reasoning in General Purpose Agents via Structured Meta-Cognition

模型推理推理策略与问题分解

摘要

人类通过灵活地转换推理模式来直观地解决复杂问题:他们计划、执行、修改中间目标,通过联想判断解决歧义,并将正式程序应用于明确的子问题。当前的 LLM 代理缺乏这种灵活性,因为它们的支架提前对此类推理决策进行了硬编码。当这些支架的规定结构与任务相匹配时,这些支架是有效的,但当解决任务需要调整推理本身的结构时,这些支架就很脆弱。我们引入深度推理——一种通过结构化元推理构建特定任务支架的推理时间方法。深度推理使用一种形式语言,将元推理表示为关联推理、形式计算和递归子问题解决的可执行分解,使分解原理能够编码为指导测试时脚手架构建的上下文示例。我们在通用代理(DOLORES)中实例化了这种方法,该代理将复杂的任务分配给更受控制的推理线程。我们根据四个硬基准的最先进的脚手架方法对其进行评估:多跳推理、长链问答、长上下文聚合和深度研究式信息搜索。 DOLORES 在三种模型尺寸和两个模型系列中的性能优于所有评估的支架,比最强的评估支架基线平均提高了 24.8%。 DOLORES 将认知分布在结构化、低负载的推理线程中,从而减少过早终止和幻觉。这一优势甚至可以缩小扩展差距,8B 版本在一半以上的设置中超越了同一系列的所有评估的 32B 基线。这些结果指向未来的代理系统,将脚手架视为自适应推理,及时构建每个任务所需的结构。