论文
LLMAgent评估的选择性自动化认证
Certified Selective Automation of LLM Agent Evaluation
摘要
评估 LLM Agent仍然以人类阅读轨迹结束,因为自动评审无法保证他们出错的频率。我们提出操作问题:评审可以接管Agent评估的哪一部分,并证明自动决定的轨迹之间的错误率低于预算阿尔法?智能体语料库拒绝标准答案:许多智能体尝试相同的任务,因此轨迹到达相关的集群,并且独立同分布。现有选择性判断方法的证书可能夸大了安全性:一个简单的证书可以声称 98% 的自动化,而其实现的错误在 17.5% 的任务重采样中超出了预算。我们引入了一个任务级引导证书,该证书在我们测试的每个机制中都有效,同时匹配朴素证书的覆盖范围;有限样本集群有效替代方案在实际任务计数方面无法证明任何内容。根据该证书,接受过 SFT 和拒绝加权 GRPO 训练的 4B logprob 评审在 alpha=0.1 时对工具使用和网络语料库的评估结果证明为 0.30-0.59,这是强引出的前沿模型中唯一在两个标题语料库上都获得认证的评审。在训练之前,仅根据基本率和歧视即可预测经过认证的覆盖范围(留一语料库 R^2=0.96)。最后,该证书还兼作自我训练过滤器:在认证区域内收获的伪标签的污染范围受构造的 alpha 限制(在六次收获中实现了 0.000-0.041),让评审以域内强度进入一个看不见的领域,目标训练标签为零。