论文

披露harness之前不要比较LLM智能体

Stop Comparing LLM Agents Without Disclosing the Harness

模型评测智能体系统Agent Harness评测方法与指标

摘要

本立场文件认为,对于跨具有可比前沿能力的模型进行评估的长期任务,代理执行工具(即围绕语言模型管理上下文构建、工具交互、编排和验证的基础设施层)通常比它所包装的模型更能决定代理性能。我们形式化并捍卫了约束约束论点:在这种情况下,性能差异更多地受线束配置而非模型选择的影响,因此当前的评估协议系统地将线束级别的收益错误地归因于模型改进。我们从三个方面支持这篇论文。首先,控制理论形式化将线束视为闭环动力系统的控制器,将 LLM 视为其控制的随机策略,这解释了为什么线束的微小变化可以产生比用一种模型替代另一种模型所获得的性能变化更大的性能变化。其次,已发布的基准、行业部署和受控方差分解表明,利用引起的方差可以大大超过模型引起的方差,包括模型排名逆转的情况。第三,我们提出了一个具有披露标准和方差分解协议的安全评估框架。在披露安全带规格之前,长期代理的排行榜比较应被视为不完整且可能具有误导性。

披露harness之前不要比较LLM智能体:论文配图
图 1:从推理到控制。推理框架(左)将智能体视为 while 循环中的模型,将性能归因于 πθ\pi_{\theta}。闭环框架(右)使线束成为控制器𝒞H\mathcal{C}_{H}:稳定性 V⁡(st)V(s_{t})、上下文漂移 δt\delta_{t} 和控制滞后 τ\tau 是控制器属性,模型是开环的,线束闭环。