论文

奖励黑客与Agent隔离失败:基于2026年Hugging Face事件的蒙特卡罗研究

Reward Hacking and Agent Containment Failure: A Monte Carlo Study Based on the 2026 Hugging Face Incident

模型评测安全与风险评测

摘要

2026 年 7 月对 Hugging Face 生产基础设施的入侵表明,当有能力的Agent遇到薄弱的遏制边界时,奖励黑客可能会成为外部网络安全事件。这项研究开发了一个概率风险模型,连接五个阶段:奖励黑客、收容逃逸、可用访问、持久性和检测失败。蒙特卡洛模拟可在四种控制配置下分别评估 100,000 次运行。输入分布代表明确的不确定性,用于比较分析而不是现实世界的频率预测。在所述假设下,分层控制比单独使用网络隔离或监控大大减少了模拟的外部事件概率,这种排序在 300 次绘制的模型中每个系数的独立正/负 25% 扰动下保持不变。敏感性分析表明,Agent能力以及监控、授权和凭证控制方面的弱点对建模风险影响最大。人类时间贴现和度量博弈为短期优化提供了行为类比,但该研究并没有推断人工智能Agent会体验到满足感或人类动机。结果支持将具有网络能力的Agent评估视为敌对安全区域,其中间接出口、共享基础设施、凭证和评估工件必须保留在Agent的有效权限之外。