论文
通过表示转向实现LLM智能体可调的工具调用率
Tunable Tool-Call Rates in LLM Agents via Representation Steering
摘要
决定是否调用工具是LLM智能体的一项核心能力,且做错代价高昂:不必要的调用增加延迟、累积成本,并可能触发不可逆的副作用,而漏掉调用则让模型在只有通过工具调用才能回答的问题上自信地出错。模型对这种平衡管理不佳,既过度使用也使用不足工具。现有方法如后训练和提示工程成本高昂且难以在推理时修改。我们表明,指令微调模型是否调用工具可以由残差流中的单个线性方向控制,该方向无需任何训练即可从模型自身的工具使用偏好信号中提取,并转化为无需改变提示的推理时干预。以强度α加入该方向会使调用率从接近0%单调移动到90%以上,同时保持调用格式良好。转向是双向的:调低它会抑制调用,调高它会诱导新的调用,且这些调用恰好落在模型无法凭自身知识回答的问题上。我们还表明该方向可泛化到未见过的工具,其强度与每个工具自身的方向相当,且不偏袒任何特定工具选择。在真实工具执行下,单次强度扫描即可描绘出成本/准确率帕累托前沿,并将开放域问答准确率近乎翻倍(0.29→0.56);同一配方无需任何训练即可迁移到涵盖稠密、MoE和多模态架构的多种模型上。我们的代码公开发布于https://github.com/YuqiChen4188/Steering-Tool-Use-Propensity。
