论文
经RFM-AGOP的快速多维拒答子空间
Fast Multi-dimensional Refusal Subspaces via RFM-AGOP
摘要
大语言模型(LLM)激活的转向与监控日益同时用于安全与可解释性。早期工作假设行为沿单一线性方向编码——但近期发现表明复杂行为——如拒答有害查询——存在于多维子空间中。但提取这些子空间的既有方法计算昂贵——在产生长推理踪迹的推理模型上变得不可承受。通过将可高效计算的递归特征机(RFM)算法与探测 informed 初始化相结合——我们能在数秒内识别多维拒答子空间——在推理(Qwen 3)与非推理(Qwen 2.5)模型上皆然。RFM不仅允许更快的子空间识别——还在消融任务上表现出优于替代方法的性能。更多工作计划用于更好理解不同方法找到的子空间之间的关系。若获确认——RFM可成为LLM既有子空间提取方法的廉价可扩展补充。