论文

智能体会思考得更深吗?序列规划中逐层动力学的机制性考察

Do Agents Think Deeper? A Mechanistic Investigation of Layer-Wise Dynamics in Sequential Planning

模型评测模型行为与机制分析

摘要

近期的机制研究表明,大语言模型(LLM)在标准单轮任务中可能低效地利用其深度。这在自主智能体场景——模型必须执行多轮规划、工具使用和迭代状态更新——是否仍然成立,尚不清楚。我们通过横跨深度研究(Deep Research)、代码生成与表格处理三个领域的完整用户-智能体轨迹的系统性逐层分析来研究这一问题。借助残差流探针、因果层跳过干预和有效深度测量,我们表明智能体推理展现出与静态任务不同的深度画像。随着轨迹展开,模型逐步调用更多、更深的层,且在后期轮次中出现更强的长程层间依赖。与此同时,残差更新日益以校正为主导,表明从稳定的特征积累转向反复重新校准。有效深度分析进一步揭示了显著的构建-精炼差距:语义方向往往形成得较早,而深层对稳定最终输出仍然必要。跨模型家族来看,这一差距在Qwen和Minimax中显著,而GLM表现出更依赖领域的深度分配模式。这些结果提供了机制层面的证据:自主LLM智能体会随推理复杂度增长而自适应地分配深度。

智能体会思考得更深吗?序列规划中逐层动力学的机制性考察:论文配图
图 1:我们的研究概述。左:我们从三个种子域构建多轮智能体轨迹,包括深度研究、代码生成和表格处理。中:我们展示了一个组合的、以工具为中介的轨迹,其中后来的轮次重用早期生成的中间工件(例如,生成的代码和派生表),从而增加了交叉轮次依赖性和推理复杂性。这一进程伴随着逐渐更深层次的动员,从浅层推理到中级推理,然后是深层推理。右图:随着交互深度的增加,残差更新表现出更频繁的校正动态,而模型系列显示出明显的深度利用特征,包括 Qwen/Minimax 中的构造细化差距和 GLM 中依赖于领域的共享专家分歧。