论文

交互扩展:为测试时计算落地第三根轴

Interaction Scaling: Grounding the Third Axis of Test-Time Compute

模型推理智能体系统测试时计算扩展Agent Harness

摘要

测试时花更多算力有两种标准方式:让模型推理更久,或采样更多尝试保留其一。两者共有隐性上限:都是内部的。每个额外token都来自同一组冻结权重与同一提示,因此两者都无法告诉模型它尚不知道的事。我们研究第三种方式——交互:模型提出一个工件,外部仪器观察其实际行为,模型修订。每轮导入一个真实观察,因此交互突破另两者撞上的天花板。我们论证单一变量支配这第三根轴——落地——且必须在回路两侧成立:驱动修订的反馈须来自真正观察缺陷的仪器,为结果打分的度量亦然。在固定token预算的困难编码任务上:仅推理与best-of-N采样都到平台期(后者即使oracle挑最佳样本也一样),而每种交互策略持续改进;我们的提议者—评审者治控以零运行间方差达到完美的100%通过率,增益跨三个模型家族成立。在渲染的视觉工件上:惯常的裁判(读截图的VLM)把15张明显破损图中的14张评为“完美”——截图在裁判看到之前就藏住了缺陷;测量真实布局的工具则显示该回路跨四种模态去除40–74%的缺陷;而同一个VLM用作评审者时,在测量工具能修复幻灯片布局之处反而使其更糟。交互扩展是真实且独立于推理与采样的——但只有在反馈与度量都落地时才可见。

交互扩展:为测试时计算落地第三根轴:论文配图
(a) 单次(66 个测量到的缺陷):内容溢出 16:916{:}9 幻灯片框架(虚线)超过框架高度的一半:这正是屏幕截图法官永远不会看到的缺陷类别,因为捕获了框架上的作物。(b) 锚定反馈后(00 个缺陷):在提议→\tomeasure→\torevise 循环之后执行相同的任务:压缩样本网格并重新平衡面板,以便每个元素都位于框架内。图3:循环修复内容的具体示例。密集的真实纸张幻灯片任务(GAN 论文),以等宽渲染整页:单次 (3(a)) 与审阅 (3(b))。确定性几何仪器单次计数 66 个缺陷,审查后计数 00 个(相同的 6→06\to 0 减少在第二个种子中重复),屏幕截图法官看不到任何缺陷(第 6 节)。