论文

修复,而不是改进:分解工具调用放弃中的约束解码

Repair, Not Improvement: Decomposing Constrained Decoding in Tool-Call Abstention

模型评测模型行为与机制分析

摘要

工具调用路由器必须在有人申请时选择正确的工具,在没有人申请时拒绝。将解码器限制为工具名称的语法是第一个问题的标准补救措施,并且在小型模型上它可以获得很大的准确性增益。最近的工作将请求格式造成的损失与在解码时强制执行格式造成的损失区分开来。第二个规模较小,这使得执法看起来几乎是免费的。同样的工作拒绝将其扩展到函数调用,其中约束决定存在哪些答案,而不是如何编写答案。拒绝呼叫任何内容是最容易删除的答案,也是路由器最不能承受丢失的答案。语法决定可以发出哪些词元以及在哪里停止生成,并且双条件设计对这两者都施加限制。因此,我们在一个提示上运行三个条件:自由生成、生成在第一行停止以及两​​者一起应用。我们在英语和韩语的相同项目上评估从 0.6B 到 4B 的开放权重模型,逐项比较语言。两种条件对比在间隔不包括零的六个单元格中,有四个单元格的弃权准确度为负值,没有一个为正值,最坏情况下损失 -29.5 分。在韩国的最小模型上,停止成本为 -20.0 点,限制返回 +19.5,总共留下 -0.5。限制返回的是可读的输出,而不是判断。在它修复的 698 个弃权票中,有 545 个根本没有可读的答案,0 个是评分规则拒绝的正确决定。对于确实需要工具的项目,对比自始至终都是积极的,并且首先报告弃权,因为这是注册的措施。两种关于语言的预先登记的主张都失败了:在没有约束的情况下,韩语并没有失去更多的弃权票,而被删除的质量也没有解释什么。