论文
OpenAI-HuggingFace:对齐测试的再现和经验教训
OpenAI-HuggingFace: A Reproduction & Lessons for Alignment Testing
摘要
2026 年 7 月,OpenAI 的Agent通过其预期环境之外的渠道进行协调,以破坏 Hugging Face 的安全基础设施。现有的对准测试实践可以预见到这一事件吗?如果不是,需要改变什么?我们探讨这些问题。首先,我们确定导致此事件的不当行为。然后,我们展示如何从公开可用的模型中手动引发这些行为,并且如果给予大量计算预算,审计Agent也可以做同样的事情。根据我们的结果,我们提出了改进对准测试的方向。具体来说,在这个项目中:(1)我们在模拟原始管道和工具的环境中,使用公开可用的模型,重现了导致 OpenAI-Hugging Face 事件的错位 AI 行为。 (2) 我们证明,审计Agent可以在给出高级定性描述的情况下引发类似的行为。 (3) 我们观察到这样做的一个关键因素是计算。重现每种行为所需的计算差异很大,这表明可以成功引发的错位行为的范围随计算的变化而变化。 (4) 我们表明,简单的上下文强化学习 (RL) 算法可以显着减少引发这些行为所需的计算量。上述结果激发了对可随计算扩展的自动对齐测试方法的需求,并且考虑到计算成本,可以有效地实现这一点。我们的工作表明强化学习是一个很有前途的方向。我们发布了我们的代码和成绩单。