论文
AdaTurn:主动视觉感知代理的预算感知测试时间缩放
AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents
摘要
主动视觉代理通过在多个回合中交叉推理与图像定位动作来解决细粒度的图像任务。然而,部署时执行轨迹预算很少是固定的:一些请求允许较长执行轨迹,而其他请求则要求代理在严格的轮次限制下采取行动。现有方法训练策略时就好像执行轨迹预算是隐藏的一样,因此当可用预算小于智能体偏好的轨迹时,交互通常会在产生任何有效答案之前被截断;我们将这种失败称为\emph{灾难性截断}。为了克服这一挑战,我们提出了 AdaTurn,这是一个预算感知框架,它以允许的转弯次数为条件调节代理,并显式地训练由预算引起的边界行为。我们的关键组件强制应答 DAPO (FA-DAPO) 将超预算事件从隐藏的或惩罚性的失败转换为可训练的最终决策步骤,教导模型在不再可能使用进一步的工具时综合部分证据。我们在训练和推理期间进一步随机化执行轨迹预算,并引入负载平衡调度程序,使此类操作变得实用。 AdaTurn 显着提高了低预算的准确性,例如,在四轮中将 VisualProbe-Medium 从 36.7% 提高到 47.6%,同时在较大预算下保持强大的扩展性,并有效地转移到多个骨干网和通用多模式基准。