论文

无需执行轨迹采样即可预测任务难度

Predicting Task Difficulty Without Rollouts

模型评测评测方法与指标

摘要

评估和训练自主代理的一个基本挑战是衡量他们尝试的任务的内在难度。估计这个数量对于环境设计者创建合成数据或基准以及构建训练课程非常有用,从而提供一种降低计算成本的方法。随着智能体(尤其是基于 LLM 的智能体)进入更长期的领域,这种估计变得越来越重要,其中经验试错法成为严重的计算瓶颈。然而,现有的工作主要局限于静态任务,并且依赖于评估指标,正如我们所展示的,这些评估指标可以给出预测性能的不完整图片。在本文中,我们研究了跨越编码、数学、机器学习、网络导航、函数调用和其他领域的 17 个代理基准的事前难度预测。我们发现 AUC 可以掩盖较差的难度估计,将 词元级 熵识别为有用的预测信号,并证明预期难度和观察到难度之间的残差如何暴露环境缺陷,例如污染和不可行性。