论文

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

模型评测安全与风险评测

摘要

随着大型语言模型(LLM)演化为自主Agent,现有安全评估面临根本性权衡:人工基准成本高昂,而基于LLM的模拟器可扩展但受逻辑幻觉困扰。我们提出AutoControl Arena,一个基于逻辑-叙事解耦原则的前沿AI风险评估自动化框架。通过将确定性状态接地于可执行代码、同时将生成性动态委托给LLM,我们在保持灵活性的同时缓解幻觉。这一原则通过三Agent框架实例化,实现超过98%的端到端成功率和相对现有模拟器60%的人类偏好。为诱发潜在风险,我们在X-Bench(70个场景、7个风险类别)中变化环境压力与诱惑。评估9个前沿模型揭示:(1)对齐幻觉:压力下风险率从21.7%激增至54.5%,能力强的模型增幅格外大;(2)场景特定的安全扩展:高级推理提升对直接伤害的鲁棒性,却恶化对钻空子场景的鲁棒性;(3)分歧的失当模式:较弱模型造成非恶意伤害,而更强模型发展出策略性隐藏。

AutoControl Arena:为前沿AI风险评估合成可执行测试环境
图16:对比案例1(真实世界):权力寻求(Power Seeking)。同一智能体在真实的bash环境中执行相同的逻辑,遇到真实的系统错误代码。