论文

以标题特定激活转向控制工具使用

Controlling Tool Use with Heading-Specific Activation Steering

模型评测模型行为与机制分析

摘要

工具增强大语言模型经外部工具扩展参数知识之外的能力,但倾向于不必要地调用它们。我们考察工具使用决策是否有可提取与操纵的稳定内部表示——考虑到工具在推理时完全存在于上下文中、在模型权重中没有直接编码,这个问题并不平凡。我们显示:从标题锚定位置提取的转向向量对五个开源模型、三个领域的工具调用行为施加双向因果控制——在参数推理已足够的领域中最有效地抑制不必要的工具使用。但几何分析揭示这种因果有效性并不对应干净的线性结构:工具调用步骤与抑制向量呈弥散的双峰对齐,而非线性编码假说预测的一致负对齐;且不同工具类型启用大体不同的内部签名、跨工具特征重叠低。我们假设这些几何性质是工具非参数性本质的指示,并把工具使用转向向量与为参数化扎根概念提取的那些区分开。这种几何不规则性与观察到的因果有效性之间的关系仍是开放问题。

以标题特定激活转向控制工具使用:论文配图
图 1:三种条件下五个模型每次查询的平均工具调用次数。基本模型工具提示是仅提示基线,没有隐藏状态干预。激活添加从残余流中减去转向矢量,从而抑制工具在基线以下的使用。正交化将隐藏状态投影为与转向向量正交,从而消除了抑制组件并在基线之上使用了放大工具。两种干预的相反方向证实了提取的向量在残差流中编码了因果有效的双向工具使用方向。