论文
OPIUM:通过双目标潜在优化减轻转向外部性和过度拒绝
OPIUM: Mitigating Steering Externalities and Over-Refusal via Dual Objective Latent Optimization
摘要
激活转向提供了一种用于在推理时控制 大语言模型 的轻量级机制,但转向向量可能会产生意想不到的外部性:效用向量可能会削弱安全行为,而拒绝向量可能会导致对良性提示的过度拒绝。我们引入 OPIUM(通过实用歧管优化受保护的注入),这是一种通过表示匹配来净化转向向量的 无需训练 方法。给定两个提示集上的参考行为,OPIUM 优化了一个新的引导向量,该向量保留了所需干预引起的下游表示,同时在原始向量失败的提示上匹配更安全的参考行为。在转向外部性和过度拒绝设置中,OPIUM 相对于普通转向和定向消融改善了安全性-效用权衡,这表明激活转向的有害副作用通常可以直接在激活空间中减轻。