论文
拓扑引导
Topological Steering
摘要
随着大语言模型(LLM)的迅速崛起,控制不良模型行为变得越来越重要。现有的行为控制方法通常直接干预激活或特征空间,但此类方法可能对异常值、分布变化、噪声和其他局部扰动敏感。受拓扑数据分析(TDA)的启发,拓扑数据分析捕获全局而非纯粹的局部结构,我们提出了拓扑转向,这是一种通过激活空间的拓扑表示来控制 LLM 行为的新框架。使用持久性图,我们的方法将基于激活的转向与 TDA 连接起来,并实现更强大的行为控制。我们表明,拓扑引导在多个模型系列和模型大小中一致地修改 LLM 行为。