论文
压力下的风险:语言模型中对抗性鲁棒性的计算感知评估
Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models
摘要
大语言模型 (LLM) 的对抗鲁棒性评估通常会报告固定查询预算下的攻击成功率 (ASR),隐式地将所有攻击视为同等成本。在实践中,不同攻击策略的计算开销可能有几个数量级的差异。因此,固定预算的 ASR 可能会掩盖越狱模型所需的真正努力,从而难以确定攻击的成本是否值得攻击者获得回报。我们提出了一种基于计算压力的计算感知评估框架,以累积浮点运算(FLOP)来衡量,作为对抗性努力的代表。我们引入了风险计算曲线,它将计算预算映射到攻击风险,并得出两个指标来总结给定攻击成功所需的平均压力。在语言 模型训练 和对齐方面跨越三个家族和四个不同阶段的十个模型中,在两个越狱鲁棒性基准上使用三种攻击策略(基于梯度、迭代细化和基于模板)进行评估,我们发现:(1)对齐训练对计算空间鲁棒性具有非单调影响; (2) 缩放模型大小会降低基于梯度的攻击有效性,但对更便宜的基于模板的攻击影响有限; (3)在代理模型上优化的基于梯度的攻击可以转移到单独的目标模型,提供一种降低攻击者成本的方法; (4) 单个模型中不同危害类别的计算成本差异高达 ${\approx}5{\times}$; (5) 与安全相关的强化学习增加了总成本,同时导致某些类别的访问不成比例。我们发布了框架来实现计算感知的风险评估和评估。