论文
基于锚点投影表示的行为轴跨模型族普适性
Cross-Family Universality of Behavioral Axes via Anchor-Projected Representations
摘要
来自不同模型族的大语言模型使用不同的隐藏维度、分词器和训练流程,使行为方向难以跨模型比较或迁移。我们提出一个锚点投影框架,将每个模型的隐藏表示映射到共享的锚点坐标空间(ACS)。从源模型提取的行为方向被投影到ACS并平均为规范方向。对于一个新模型,规范方向仅借助锚点激活即可重建到其原生隐藏空间,无需微调或针对目标模型的方向提取。我们在五个指令微调模型族和十个行为轴上进行评估。我们发现同轴方向在ACS中于Llama-Qwen-Mistral-Phi(LQMP)簇内高度对齐。这种共享结构可迁移到下游任务。对于对齐的LQMP簇,留出目标达到(0.83)的十路检测准确率和(0.95)的平均二分类AUROC,而规范引导在分布偏移下诱导最高+0.46%的拒绝率变化。敏感性分析表明,两个源模型和小型锚点池就足以逼近可迁移的方向。总体而言,ACS为跨模型族可解释性提供了新视角,揭示表示层面的迁移在模型族之间依然稳健。
