了解何时询问:LLM 工具使用的段级贡献分配
Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use
摘要
人类知道何时寻求帮助,例如$347 \times 28$ 需要计算器,而 $2+2$ 则不需要。语言模型则不然。基于提示的方法可以指示模型何时调用工具,但这种脚手架并不能教会它识别其自身知识的边界。为整个轨迹分配单一结果奖励的强化学习方法也好不到哪儿去:轨迹级别的信用不能隔离成功事件中哪个工具调用真正有帮助,也不能惩罚不必要的调用。我们提出 \textbf{CARL} (\textbf{C}ompetence-\textbf{A}ware \textbf{R}einforcement \textbf{L}earning),它训练模型自身的价值评估器,以了解参数化知识在哪里足够以及在哪里需要外部帮助。通过在自然工具使用边界(例如,代码栅栏分隔符和上下文块转换)分解每个轨迹采样,CARL 从单个二进制结果为每个段分配独立的信用,无需外部判断或步骤级注释。因此,错误的工具调用、不正确的提取和不必要的调用都会获得适当签名的优势。训练有素的价值评估器捕获了模型的领域能力:它将参数可解决的问题与工具相关的问题区分开来,AUC 为 7B,为 0.93。在涉及算术、多跳事实 QA 和金融表格数字推理的五个基准测试中,CARL 比最佳 RL 基线在 7B 处提高了 6.7 分,在 3B 处提高了 9.7 分,在 Musique 上的增益最大(7B 处+8.3 EM,3B 处+9.0 EM)。该模型对参数化可回答问题的工具调用减少了 53\%,同时在这些问题上保持 ${\sim}10$ EM 点的准确性。小规模的收益最大:3B 的改进是 7B 改进的 1.4 倍,这表明知道何时不成比例地询问参数内存较小的模型会受益。