论文
SwordBench:评估转向图像表示的正交性
SwordBench: Evaluating Orthogonality of Steering Image Representations
摘要
在推理时引导或干预模型表示以纠正预测对于人工智能的可解释性和安全性至关重要,但现有的评估协议仅限于模糊的语言建模任务。为了解决这一差距,我们引入了 SwordBench,这是一个跨多个主干和概念删除任务引导视觉模型图像表示的基准。除了统一的基准测试套件之外,我们还提出了新的评估概念,揭示了概念激活向量之间正交化的二阶效应,以实现实用指导。具体来说,跨概念稳健性衡量了与替代概念正交的输入之间概念检测性能的稳定性,而附带损害则量化了转向是否无意中影响了缺乏偏差的输入的下游任务的模型性能。我们发现,尽管线性支持向量机表现出优异的可分离性和正交性,但它无法实现零附带损害,通常落后于稀疏自动编码器。在较简单的情况下,标准基线和基于优化的方法都无法实现完美的转向。源代码很快就会在 GitHub 上提供。