论文

预测激活引导的副作用

Forecasting Side Effects of Activation Steering

模型评测模型行为与机制分析

摘要

激活引导通过向隐藏激活添加一个学习到的方向来修改语言模型,无需重训练即可实现有针对性的行为改变。虽然有效,引导常常对其他行为产生意外的副作用,使其难以安全部署。因此我们问:这些副作用能否在施加引导之前被预测?我们通过在三个开放权重语言模型上、跨67种行为的分类体系构建交叉效应矩阵来回答这一问题。我们发现副作用是常见、有结构且常常不对称的,揭示了现有基于相似性的启发式无法解释的相互作用。尽管如此复杂,我们证明副作用在很大程度上可以在执行引导之前被预测:其幅度主要取决于目标行为,而其方向可以从模型未引导的表示中以显著高于简单基线的准确率被预测出来。我们的结果表明,激活引导具有系统性且可预测的副作用,这使主动式安全审计与更知情的引导干预部署成为可能。

预测激活引导的副作用:论文配图
图1:激活导向的交叉效应矩阵。行表示被导向的行为,列表示被测量的行为,每个条目表示导向某一行为对另一行为的影响。带边框的单元格为经FDR控制后显著;边缘条形统计每个行为的显著副作用数量。