论文
以标题特定激活转向控制工具使用
Controlling Tool Use with Heading-Specific Activation Steering
摘要
工具增强大语言模型经外部工具扩展参数知识之外的能力,但倾向于不必要地调用它们。我们考察工具使用决策是否有可提取与操纵的稳定内部表示——考虑到工具在推理时完全存在于上下文中、在模型权重中没有直接编码,这个问题并不平凡。我们显示:从标题锚定位置提取的转向向量对五个开源模型、三个领域的工具调用行为施加双向因果控制——在参数推理已足够的领域中最有效地抑制不必要的工具使用。但几何分析揭示这种因果有效性并不对应干净的线性结构:工具调用步骤与抑制向量呈弥散的双峰对齐,而非线性编码假说预测的一致负对齐;且不同工具类型启用大体不同的内部签名、跨工具特征重叠低。我们假设这些几何性质是工具非参数性本质的指示,并把工具使用转向向量与为参数化扎根概念提取的那些区分开。这种几何不规则性与观察到的因果有效性之间的关系仍是开放问题。
