论文
ATLAS:代理测试时间学习分配缩放
ATLAS: Agentic Test-time Learning-to-Allocate Scaling
摘要
测试时间扩展已成为改进 大语言模型 推理的主要方法,但其编排仍然是设计师设计的:固定样本预算、固定细化循环、固定评分规则或固定搜索策略决定计算的使用方式,让模型负责求解而不负责编排。我们介绍 ATLAS,这是一个代理测试时间扩展框架,其中 LLM 编排器拥有端到端的控制循环。通过一个单一的动作“探索”,它会针对原始问题派遣一个新的独立解决者,协调器决定是否收集更多证据,何时停止,以及如何综合最终答案;动作空间是可扩展的,每个探索调用都可以选择指定求解器、推理工作或提示策略。我们在 Claude Sonnet 4.6 主干下的四个基准上评估 ATLAS,涵盖科学问答、代码生成和多模态推理,在 HLE-Verified 上达到 56.00%,在 LiveCodeBench 上达到 82.29%,在 GPQA-Diamond 上达到 85.75%,在 BabyVision 上达到 23.71%,同时使用的 API 调用比固定工作流基准少得多。多模型扩展 ATLAS-MM 将求解器选择作为附加操作维度,进一步将 HLE-Verified 提高到 60.00%,将 LiveCodeBench 提高到 85.63%,并且在 GPQA-Diamond 和 BabyVision 上保持一致的增益。用单独的积分器取代协调器的直接合成的消融会降低或无法提高四个基准中三个基准的准确性,这与状态证据管理在产生收益中的作用一致。