论文
MAXS:基于LLM代理的元自适应探索
MAXS: Meta-Adaptive Exploration with LLM Agents
摘要
大语言模型(LLM)代理通过多工具协作展现出内在推理能力。然而在代理推理过程中,现有方法常受困于:(i)局部短视的生成,因缺乏前瞻(lookahead);(ii)轨迹不稳定,早期小错会升级为发散的推理路径。这些问题使全局有效性与计算效率难以兼顾。为解决这两个问题,我们提出meta-adaptive exploration with LLM agents(MAXS),一个基于LLM代理的元自适应推理框架,灵活整合工具执行与推理规划。MAXS采用前瞻策略将推理路径向前延伸数步,估计工具使用的优势值,并结合步间一致性方差与步间趋势斜率,共同选择稳定、一致且高价值的推理步骤。此外,我们引入轨迹收敛机制,一旦路径达成一致即停止进一步rollout,以控制计算成本,在多工具推理中实现资源效率与全局有效性的平衡。我们在三个基座模型(MiMo-VL-7B、Qwen2.5-VL-7B、Qwen2.5-VL-32B)与五个数据集上开展大量实证研究,表明MAXS在性能与推理效率上持续超越现有方法。进一步分析证实了前瞻策略与工具使用的有效性。
