界面诱发的轨迹删失
Interface-Induced Trajectory Censoring
摘要
Agent评测通常从服务栈读取工具调用率。即使模型输出格式正确的调用,这个数值也可能为零:接口在下游看到轨迹之前已将其过滤。在BFCL v4自身的数据、执行器和评分器上,固定权重、案例、解码方式及随机种子,仅更换服务适配器,同一模型的得分即可从0.00变为0.96 / 0.19。聊天模板与解析器的2×2实验准确定位了原因:两者的主效应均为零,影响全部来自交互作用。没有单个组件本身存在缺陷,仅修复接口契约的一侧毫无收益。 在tau-bench的115个交互式零售任务上,相同更换使服务器解析出的调用从0增至636,至少执行过一次工具的任务从0增至103。探针在规模相差21倍的Qwen2.5-Coder模型上复现了这一漏斗:所有规模的服务器解析结果均为0/100,而模型实际输出的格式正确调用在32B时达到80/100,按经裁定的金标准校准后约为72/100。在匹配的接口封装下、相当的规模范围内,静默失败数量维持在0—2;这一预测已在运行前提交至仓库。Llama-3.1-8B把任务函数本身当作工具调用的比例为23%,加入一个strict:true标志后降至0。 这种不匹配也进入训练循环,影响与模型规模有关:在verl的AgentLoop中,7B模型的115次生成有45次包含完整调用,但接受、执行和返回观察的次数均为0。1.5B模型的同一零结果有多重成因,因此论文分开报告两种规模。评测时,修复适配器恢复了调用机制,但最终效果提升不显著:解析次数由0增至84,挽救次数由0增至9,通过率由53增至62(n.s.)。作者发布了98行预检程序,可捕获本文所有静默失败。观察到的工具调用率属于测量它的模型与接口组合系统,不能仅归因于模型自身。
