论文
状态迁移揭示受控路由中的复用
State Transfer Reveals Reuse in Controlled Routing
摘要
基于提示词的干预可以改变模型行为,但仅有训练成功并不能确定与行为相关的状态表征在哪里。我们在受控路由任务中研究这一问题,使用在支持数据上选择的接口、留出查询评估,以及匹配的必要性、充分性与错误接口对照。在 GPT-2 triop 上,一个早期接口在这些测试下支持精确迁移。在 GPT-2 add/sub 上,固定接口处的零重训练编译迁移恢复了供体路由的大部分准确率,而可训练的提示词槽位只有在额外的支持样本与优化之后才能在其他若干位置重新学会相同行为。这些结果在一个可直接检验两者的设定中区分了固定接口复用与提示词重定位。Qwen 路由为算符词元处相同的匹配接口模式提供了跨架构一致性检验,尽管局部 V 路径上的供体特异身份仍未解决。生成与推理分支被用来界定适用范围:一旦控制依赖更长的轨迹或更困难的选择,它们显示出更宽泛的迁移或更弱的控制器可辨识性。因此,在受控路由中,固定接口迁移是比单纯训练成功的提示词更强的复用证据。
