论文
TRACE:在 Agentic 评估中诊断验证器的脆弱性
TRACE: Diagnosing Verifier Brittleness in Agentic Evaluation
摘要
验证者分数现在既充当大型语言模型(LLM)代理的基准指标和训练奖励,并且分数的变化通常被解读为能力的变化。相反,它可能反映了评估的变化。我们引入了 TRACE,这是一种将分数变化从判决转变为可测试诊断的协议:它将有针对性的更改应用于评估的一部分,比较配对运行,检查智能体的行为是否发生变化,并对未更改的轨迹重新评分以测试评分规则是否负责。在由 25 个合成任务组成的受控套件中,重命名工具会使脚本化代理的得分降低 0.250,即使它执行完全相同的操作;在评分时恢复原始名称可以缩小整个差距,而相同的突变则暴露了第二个智能体的真正行为失败。在由四名 LLM Agent参与的公共 $τ^2$ 基准任务中,一项最初的 30 项任务研究发现混合奖励变化,其一个明显的效果无法复制。在对 88 个新任务进行的更大规模的跟踪中,每个条件重复运行、重命名工具或重新格式化工具 对于八个代理更改对中的七个,输出将奖励保持在 $\pm$0.10 以内,而故意误导的工具名称将每个代理的奖励降低了 0.20-0.44,这表明该设置可以检测到真实效果。相同的重新运行会翻转 15-36% 的任务结果,因此单次运行比较无法将呈现效果与运行之间的差异区分开。当固定轨迹以不同方式呈现时,两位前沿LLM法官会给出一致的裁决,但在 57% 的相同记录上彼此意见不一致,这主要是因为他们对程序而不是结果进行评分。因此,TRACE 将分数变化所表达的关于代理的内容与它所表达的关于测量的内容分开。