BioRefusalAudit:使用通用与领域微调稀疏自编码器审计生物安全拒绝深度
BioRefusalAudit: Auditing Biosecurity Refusal Depth Using General and Domain-Fine-Tuned Sparse Autoencoders
摘要
语言模型的生物安全评估通常只问模型是否产生有害输出。本文提出一个互补的问题:当模型拒绝时,这种拒绝在结构上是否可靠,还是会在提示措辞、格式或输出长度的轻微改变下消失?在五种架构中,没有任何模型能干净地区分良性与危害。Gemma 2 2B-IT在75个提示中从未真正拒绝,对每个与危害相关的查询都含糊其辞。Gemma 4 E2B-IT在使用聊天模板格式时拒绝了65/75个提示,不用时则为0/75。两个Gemma模型在80-token上限下都跌至0%。Qwen 2.5 1.5B和Phi-3-mini过度拒绝,把83-87%的良性生物学内容标记为有害。Llama 3.2 1B显示出唯一有意义的层级梯度(61个百分点的跨度)。为探究这种过度拒绝的驱动因素,我们测试了一组列入附表I但生物学上无毒的化合物(尤其是裸盖菇素栽培,其具有FDA突破性疗法认定)。一些模型对这些内容的拒绝率超过了对真正有害生物学内容的拒绝率,表明拒绝跟随的是合法性与文化显著性,而非CBRN危害。为度量内部一侧,我们引入分歧分数D,将模型的表面响应标签与其内部稀疏自编码器(SAE)特征激活进行比较。完整的D在Gemma 2 2B-IT(Gemma Scope 1)和Gemma 4 E2B-IT(作者训练的生物SAE)上计算。我们发布了两个微调的Gemma 2领域SAE。在Gemma 4上,配合与拒绝两类响应以0.647分的差距完全分离、零重叠(n=75),不过这是初步结果:目录狭窄、校准在样本内完成且SAE覆盖仅限Gemma家族。这项工作在一个黑客松周末内用消费级硬件(GTX 1650 Ti Max-Q,SAE训练另用Colab T4)完成,这些初步证据表明,激活层面的审计可能揭示行为评估看不到的失效模式,且跨架构差异可观。
