开源项目

METR发布Time Horizon 1.1,扩充长任务并更新评测基础设施

Time Horizon 1.1

应用与实践智能体系统Agent HarnessAgent任务评测编程长程任务评测

概述

METR于1月29日发布TH1.1,采用228项任务,将预计需人类八小时以上完成的任务从14项增加到31项,修订或删除存在歧义、评分错误及奖励作弊空间的实例。执行框架由Vivaria迁移到Inspect,并对同一任务集进行比较。 公开分析分别报告任务集变化、重复运行波动和框架迁移的影响。50%时间跨度指在指定成功率下、按人类完成难度折算的任务时长,不能解读为Agent能无人监管稳定运行同样长时间。长任务的人类时长大多为估计,不全部来自实测。