论文

QVal:低成本评估长视野 LLM 代理的密集监控信号

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents

模型评测评测方法与指标

摘要

LLM 智能体越来越多地在长视野中行动,其中单个轨迹可以包含数百或数千个动作。在这些设置中,仅结果奖励提供的指导过于稀疏,无法告知模型中间行动的优点。密集监督方法旨在通过对中间步骤进行评分来解决这个问题,从内在信心到自我 蒸馏 并嵌入相似性。然而,通常的做法是通过测量集成它们的训练管道的下游性能来评估它们。这是昂贵的,将监督质量与训练工程混杂因素混为一谈,并使需要不同训练设置的不同方法系列变得无法比较。因此,密集的监督方法很少以共同点为基准。我们推出 QVal,一个用于直接评估密集监督信号的 无需训练 测试平台。给定状态-动作对,QVal 衡量方法的得分 Q 对齐的程度:它是否根据强参考策略的 Q 值对动作进行排序。这使我们可以在任何训练运行之前比较信号,并将信号质量与其他工程选择分开。我们将 QVal 实例化为 QVal-v1.0,对四种不同环境和七个方法系列中的 21 种密集监督方法进行基准测试,并在六个开放权重模型主干上进行了超过 1.2K 次评估实验。我们发现,简单的提示基线始终优于文献中最近的密集监督方法,并且表现与家庭密切相关。这些发现适用于模型大小、环境和观察方式。 QVal 的设计目的是可以轻松扩展到新的环境和方法,使研究人员能够在任何训练运行之前迭代密集的监督方法。