论文
KANSteer:文本到图像模型的非线性激活操控
Beyond the Linear Representation Hypothesis: Non-Linear Activation Steering in Text-to-Image Models
摘要
机械可解释性通常依赖于线性表示假设(LRH),该假设假设高级概念被编码为激活空间中的线性方向。然而,自然的视觉概念并不一定需要线性的视觉过渡:在晴朗和暴风雨之间存在着中间的天气状态,例如天空中有几朵白云,而不仅仅是一场较弱的风暴;在毛毛虫和蝴蝶之间,进步并不是毛毛虫翅膀不断生长。这就提出了这样的问题:这种真实的中间状态是否也由模型非线性表示。事实上,当我们直接提示文本到图像模型的中间属性时,它们的激活很少沿着连接端点的直线方向下降。因此,我们提出了 KANSteer,它将概念遍历建模为穿过其中间状态的曲线。为了寻求一种既简单又可解释的表示,我们建议使用柯尔莫哥洛夫-阿诺德网络(KAN),它提供一个一维坐标,其学习函数定义轨迹。这允许转向方向沿着概念变化,同时保留可解释的表示。在几个概念和文本到图像的扩散变换器中,我们发现它们的激活轨迹大大偏离直线,并且 KANSteer 比线性转向提供了更紧密的拟合和更平滑的中间属性遍历。
