论文
不要过度思考,也不要思考不足:迈向Agentic AI中的自适应推理
Don't Overthink, Don't Underthink: Toward Adaptive Reasoning in Agentic AI
摘要
大语言模型(LLM)的最新进展表明,增加推理时推理量可以提升复杂任务的性能。然而,许多现有方法依赖固定或预分配的推理控制,例如固定token预算、执行前难度估计或激活空间干预,并且往往在独立的推理基准而非完整的agentic工作流上进行评估。这些假设在agentic AI系统中可能不成立,因为推理需求会随规划、工具使用、记忆检索和智能体间交互而动态演变。因此,推理可能变得过多或不足,导致不必要的计算、延迟增加、规划漂移、过度工具调用或解决方案不完整。我们认为,下一代agentic AI的一个主要挑战不仅在于语言模型应执行多少推理,而在于它应如何根据不断变化的任务需求分配推理。我们将过度推理和推理不足刻画为推理错配的两种反复出现的失败模式,并在MATH-500和GAIA公开验证基准上对它们进行评估。以工具决策延迟、token消耗、token上限耗尽和答案正确性为指标,我们的结果表明,被归类为过度推理的案例伴随更高的计算成本而没有成比例的准确率提升,而被归类为推理不足的案例则始终与不正确或不完整的解决方案相关。这些发现为agentic AI自适应推理机制的未来研究提供了动机。