论文
智能体会思考得更深吗?序列规划中逐层动力学的机制性考察
Do Agents Think Deeper? A Mechanistic Investigation of Layer-Wise Dynamics in Sequential Planning
摘要
近期的机制研究表明,大语言模型(LLM)在标准单轮任务中可能低效地利用其深度。这在自主智能体场景——模型必须执行多轮规划、工具使用和迭代状态更新——是否仍然成立,尚不清楚。我们通过横跨深度研究(Deep Research)、代码生成与表格处理三个领域的完整用户-智能体轨迹的系统性逐层分析来研究这一问题。借助残差流探针、因果层跳过干预和有效深度测量,我们表明智能体推理展现出与静态任务不同的深度画像。随着轨迹展开,模型逐步调用更多、更深的层,且在后期轮次中出现更强的长程层间依赖。与此同时,残差更新日益以校正为主导,表明从稳定的特征积累转向反复重新校准。有效深度分析进一步揭示了显著的构建-精炼差距:语义方向往往形成得较早,而深层对稳定最终输出仍然必要。跨模型家族来看,这一差距在Qwen和Minimax中显著,而GLM表现出更依赖领域的深度分配模式。这些结果提供了机制层面的证据:自主LLM智能体会随推理复杂度增长而自适应地分配深度。
