论文
WhatWorkedBench:评测AI Agent的实验理解能力
WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents
摘要
AI研究Agent需要可靠的知识来判断实验如何改变结果。我们提出WhatWorkedBench来度量实验理解能力,即在预算受限的实验之后对组件变更做出预测的准确性。Agent检查代码、选择测量项,并提交一个响应面——一张为组件设置的每种配置预测得分的表格。穷举式CPU执行提供参考效应:在固定其他组件的情况下改变每个组件所产生的效应。这些效应捕捉跨36个任务(来自30个数据源和8种工作流类型)的变更组合,共1248条配置记录。核心评测结合了覆盖全部八个家族的4206条数值控制记录,以及原始六个家族的108个Agent回合。在八次新测量中,成对效应岭回归在22个数据源中的15个上选中最优配置,并在三个数据源上将所有效应误差限制在得分范围的10%以内。对同一批Agent观测拟合高斯过程(GP),将效应恢复度(相对真实效应幅度的准确率)在原始Flash队列中从0.632提升到0.698,在另一队列中从0.621提升到0.720。在六个已完成的节拍检测与图任务提交上,同观测GP将家族宏平均恢复度从0.303提升到0.455。在六个各含六个二元选项的工作流、20次新测量上,编码代码等价性(行为完全相同的配置)将GP恢复度从0.248提升到0.462。WhatWorkedBench支持关于实验型Agent、自适应实验设计、数值推断以及程序结构利用的研究。