论文
交互扩展:为测试时计算落地第三根轴
Interaction Scaling: Grounding the Third Axis of Test-Time Compute
摘要
测试时花更多算力有两种标准方式:让模型推理更久,或采样更多尝试保留其一。两者共有隐性上限:都是内部的。每个额外token都来自同一组冻结权重与同一提示,因此两者都无法告诉模型它尚不知道的事。我们研究第三种方式——交互:模型提出一个工件,外部仪器观察其实际行为,模型修订。每轮导入一个真实观察,因此交互突破另两者撞上的天花板。我们论证单一变量支配这第三根轴——落地——且必须在回路两侧成立:驱动修订的反馈须来自真正观察缺陷的仪器,为结果打分的度量亦然。在固定token预算的困难编码任务上:仅推理与best-of-N采样都到平台期(后者即使oracle挑最佳样本也一样),而每种交互策略持续改进;我们的提议者—评审者治控以零运行间方差达到完美的100%通过率,增益跨三个模型家族成立。在渲染的视觉工件上:惯常的裁判(读截图的VLM)把15张明显破损图中的14张评为“完美”——截图在裁判看到之前就藏住了缺陷;测量真实布局的工具则显示该回路跨四种模态去除40–74%的缺陷;而同一个VLM用作评审者时,在测量工具能修复幻灯片布局之处反而使其更糟。交互扩展是真实且独立于推理与采样的——但只有在反馈与度量都落地时才可见。
