论文

对抗性人文基准:前沿模型安全的风格稳健性结果

Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety

模型评测安全与风险评测

摘要

对抗性人文基准 (AHB) 评估模型安全拒绝是否能够在远离熟悉的有害提示形式后继续存在。该基准从 MLCommons AILuminate 中提取的有害任务开始,通过人文风格的转换重写了相同的目标,同时保留了意图。这将对抗性诗歌和对抗性故事的文献从单一的越狱操作者扩展到更广泛的风格混淆和目标隐藏的基准系列。在此报告的基准测试结果中,原始攻击记录了 3.84% 的攻击成功率 (ASR),而转换方法的范围从 36.8% 到 65.0%,在 31 个前沿模型中产生了 55.75% 的整体 ASR。根据欧盟人工智能法案实践守则启发的系统性风险视角,化学、生物、放射性和核(CBRN)是最高的类别。总而言之,这种风格稳健性的缺乏表明当前的安全技术泛化能力较弱:对“非恶意”的深入理解仍然是前沿模型安全中未解决的核心问题。