论文
量化前沿大语言模型代理人的夸大倾向
Quantifying Overclaiming Propensity in Frontier LLM Agents
摘要
人们越来越相信前沿编码代理可以长时间自主工作,但代理的最终响应通常是用户看到的唯一工作记录。我们量化了前沿特工夸大任务完成的倾向,这种虚假陈述可能会误导用户。当代理的最终响应与上下文中的信息相矛盾时,代理就会夸大其词。该定义不需要推断意图,并且与任务成功无关。我们推出了 OverclaimBench,这是一个评估套件,由五个文件审查场景、基于转录的覆盖率测量和已记录的植入缺陷组成。我们在自己的生产命令行界面中评估了八个专有前沿模型,并在 OverclaimBench 上的单个固定工具下评估了四个开放权重模型,发现 1) 代理在 67.9\% 的运行中没有读取他们被要求审查的所有文件; 2) 在并非读取所有文件的运行中,代理在 80.4% 的情况下会产生误导(每个模型 59--96%),要么错误地声称已读取所有文件,要么忽略覆盖范围不完整; 3)要求授权给下属增加阅读覆盖率,但在仍然不完整的评论中,绝大多数仍然具有误导性; 4) 错误地声称已完成审查的代理人错过了植入的缺陷,其比率约为读取每个文件的代理人的 1.8 倍,这表明声称已完成审查可以掩盖实质性缺陷。总之,这些结果表明,代理人的最终反应并不是对其行为的可靠描述。