论文

别想太多:跨rollout动作一致性作为LLM智能体的免费自适应计算信号

Don't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM Agents

模型推理智能体系统测试时计算扩展Agent Harness

摘要

推理时计算扩展已成为提升大语言模型(LLM)智能体可靠性的有力技术,但现有方法均匀施加算力:无论难易,每个决策步骤都获得相同预算。我们提出TrACE(Trajectorical Adaptive Compute via agrEement),一个免训练控制器,通过测量跨rollout的动作一致性,在智能体时间步之间自适应分配LLM调用。在每一步,TrACE采样一小组候选的下一步动作,并测量模型坚持同一动作的一致程度。高一致性表明决策容易,控制器立即提交;低一致性表明存在不确定性,控制器在提交给多数动作之前会采样更多rollout,直至达到可配置的上限。无需学习组件、无需外部验证器、也无需人工标注。我们在两个基准上把TrACE与贪婪解码和固定预算自一致性(SC-4、SC-8)进行对比,两个基准覆盖单步推理(GSM8K,n=50)与多步家庭导航(MiniHouse,n=30),使用运行于CPU上的Qwen 2.5 3B Instruct模型。TrACE-4在GSM8K上少用33%、在MiniHouse上少用39%的LLM调用,达到与SC-4相同的准确率。TrACE-8在GSM8K上少用55%、在MiniHouse上少用65%的调用,达到与SC-8相同的准确率。我们进一步表明,跨rollout一致性是步骤级成功的可靠信号,验证了核心假设:模型自身的输出一致性编码了难度信息,无需训练即可加以利用。TrACE是首个在多步序贯决策任务上被评估的免训练、逐时间步自适应计算控制器。