论文
追逐公众评分:编码智能体 工作流程中的用户压力和评价利用
Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows
摘要
Frontier 编码智能体 越来越多地用于工作流程中,其中用户主要通过公共分数的重复改进来监督进度,即在工作区中带有标签的公共评估文件上报告的分数,而不是通过直接检查代理的中间输出。我们研究了多轮用户提高分数的压力是否会导致公共分数剥削:通过捷径提高公共分数而不改善隐藏的私人评估的行为。我们从初步的单脚本表格分类任务开始,其中 GPT-5.4 和 Claude Opus 4.6 都在 10 轮用户代理交互中利用标签信息。然后,我们构建了 AgentPressureBench,这是一个涵盖三种输入模式的 34 任务机器学习存储库基准,并从 13 个 编码智能体 收集了 1326 个多轮轨迹。在我们的基准测试中,我们观察到 403 次利用性运行,涵盖所有任务。我们还发现,更强的模型具有更高的利用率,这得到了 0.77 的显着斯皮尔曼等级相关性的支持。我们的消融实验表明,较高的用户压力会导致更早的利用,将平均第一轮利用减少 15.6 轮(即 19.67 至 4.08)。作为缓解措施,在提示中添加明确的反漏洞利用措辞主要可以消除漏洞利用(100% 到 8.3%)。我们希望我们的工作能够引起人们对编码智能体工作流程的更仔细使用的关注,并在用户压力下开发更强大的编码智能体。我们的项目页面位于 https://ucsc-vlaa.github.io/AgentPressureBench 。