论文

审计自我改进代理中的Harness篡改

Auditing Harness Tampering in Self-Improving Agents

智能体系统Agent任务评测

摘要

自我改进的智能体不断地修改自己的装备,以推动其性能的前沿。然而,此类修改可能会产生虚幻的性能增益或损害完整性约束(例如授权、来源和完整性),而不会真正提高功能。我们将这种现象称为“Harness篡改”,它将概念从奖励和测量篡改扩展到完整的自我改进生命周期。为了系统地研究这个问题,我们提出了一个两轴分类法,根据其发生的Harness功能角色及其违反的义务对每个未对齐的编辑进行分类。然后,我们通过将被篡改的良性编辑对植入自我改进代理的真实轨迹中来构建带注释的语料库。我们对篡改分类和本地化任务的多种审计方法进行调整和基准测试。最后,我们系统地审核自我改进代理的真实轨迹。结果表明,Harness篡改在不同代理的实际运行中始终发生,通常持续存在于最佳代理的谱系中,并在整个分类中形成不同的系统特定配置文件。