论文

将 RL 引发的工具使用本地化为单个交叉编码器功能

Localizing RL-Induced Tool Use to a Single Crosscoder Feature

模型评测模型行为与机制分析

摘要

微调 通过 RL 重塑了语言模型的内部表示,以实现工具使用等代理行为,但这些变化的机制基础仍然知之甚少。虽然强化学习极大地改进了结构化工具调用的生成,但尚不清楚哪些特征出现、哪些特征被保留,以及识别的特征是否可以用于无需再训练的行为控制。在这项工作中,我们展示了 $\textit{专用特征交叉编码器 (DFC)}$ 隔离了一组紧凑的 RL 特定特征,这些特征在 $\texttt{Qwen2.5-3B}$ 中调节工具调用能力。在 $48$ 交叉编码器超参数扫描中,编码-解码重建将 RL 模型的工具正确性提高了 $+31.1 \pm {9.7}$ pp,并通过 $+6.8 \pm 5.0$ pp 被动地将工具调用能力转移到冻结的基础模型,我们称之为 $\textit{能力溢出}$。我们的研究结果表明,DFC 分区将 RL 引入的功能集中到一个最小的、可操纵的功能集中,从而实现代理 LLM 的运行时行为控制。