论文

自适应潜在代理推理

Adaptive Latent Agentic Reasoning

模型推理推理策略与问题分解

摘要

大型推理模型通过生成扩展的思想链 (CoT) 推理来提高性能,但当应用于 LLM 代理时,这种行为会变得低效。当前的 LLM 智能体通常在每个决策步骤中生成详细的文本推理,并在各个回合中几乎均匀地分配推理工作,导致多回合智能体轨迹的效率大幅降低。我们提出了自适应潜在代理推理(ALAR),这是一种双模式框架,它使用紧凑的潜在推理进行常规轮换,并在需要更深入思考时选择性地升级为显式思维链。 ALAR 通过使用代理的行为作为监督锚来学习潜在推理,并进一步优化以在足以完成任务成功时使用潜在推理,并为更困难的决策保留显式 CoT。代理搜索和工具使用基准的实验表明,ALAR 保持了相当或更好的任务准确性,同时在搜索中将生成的词元大幅减少了 43.6%,在工具使用中将生成的词元减少了 84.6%。这些结果表明,ALAR 通过减少不必要的文本推理,同时保留对更困难的决策步骤的明确审议,改善了 LLM 代理的准确性与效率权衡。