论文

教它停止,而不仅仅是点击

Teach it to stop, not just to click

模型评测评测方法与指标

摘要

代理计算机使用的强化学习是在单次运行中报告的,这些数字会产生误导。在五个预言机分级环境中使用验证者引导的 35B 计算机使用代理 (CUA) 修复,我们发现修复策略的成功率主要由上游方差决定:跨三个单元(交叉数据绘制 $\times$ 种子网格、引导 CI)的方差分量分解发现评估方差可以忽略不计($σ_{\mathrm{eval}} \approx 0$),并且训练种子效应在各处都很小($\leq 10\%$);相反,它在数据绘制和运行之间的不确定性之间进行划分,数据绘制的份额在最难的单元格上上升到主导($48\%$)。运行到运行的分布是双峰的(Hartigan dial $p=0.07$,$k=10$),因此单次运行出现故障模式的可能性大约为 30%,并且mean$\pm$std 是错误的摘要。在此基础上,有两个发现成立。首先,可修复性在纠正措施的约束程度方面分为两层:单个固定词元可靠安装(完成检测 $0.97\pm0.06$),而开放式纠正只是部分 - 空间坐标点击(基础 $0.53\pm0.35$)和生成字段填充($0.14\pm0.04$)。其次,只有当纠正措施是任务唯一剩余的阻碍因素时,帧级修复才会转移到任务成功(LinkedIn 8/20 vs. base 0/15,Fisher $p=0.006$)。我们发现了自己的两个过度主张——样本效率曲线和“视觉定位能力无法靠增加预算获得”的界限——只是通过在种子之间进行复制;压力测试将风险置于外部:在类似的情况下,该领域发布的规模的单次改进大约有三分之一的时间会出现错误的迹象。我们发布了一个用于常规 k 种子报告的库 (cua_reliability)。据我们所知,该设备是第一个基于真实 35B CUA 策略的多模式分段聚合 同策略 自 蒸馏 (SA-OPSD) 更新。