论文

界面诱发的轨迹删失

Interface-Induced Trajectory Censoring

智能体系统智能体互操作协议

摘要

Agent评测通常从服务栈读取工具调用率。即使模型输出格式正确的调用,这个数值也可能为零:接口在下游看到轨迹之前已将其过滤。在BFCL v4自身的数据、执行器和评分器上,固定权重、案例、解码方式及随机种子,仅更换服务适配器,同一模型的得分即可从0.00变为0.96 / 0.19。聊天模板与解析器的2×2实验准确定位了原因:两者的主效应均为零,影响全部来自交互作用。没有单个组件本身存在缺陷,仅修复接口契约的一侧毫无收益。 在tau-bench的115个交互式零售任务上,相同更换使服务器解析出的调用从0增至636,至少执行过一次工具的任务从0增至103。探针在规模相差21倍的Qwen2.5-Coder模型上复现了这一漏斗:所有规模的服务器解析结果均为0/100,而模型实际输出的格式正确调用在32B时达到80/100,按经裁定的金标准校准后约为72/100。在匹配的接口封装下、相当的规模范围内,静默失败数量维持在0—2;这一预测已在运行前提交至仓库。Llama-3.1-8B把任务函数本身当作工具调用的比例为23%,加入一个strict:true标志后降至0。 这种不匹配也进入训练循环,影响与模型规模有关:在verl的AgentLoop中,7B模型的115次生成有45次包含完整调用,但接受、执行和返回观察的次数均为0。1.5B模型的同一零结果有多重成因,因此论文分开报告两种规模。评测时,修复适配器恢复了调用机制,但最终效果提升不显著:解析次数由0增至84,挽救次数由0增至9,通过率由53增至62(n.s.)。作者发布了98行预检程序,可捕获本文所有静默失败。观察到的工具调用率属于测量它的模型与接口组合系统,不能仅归因于模型自身。

界面诱发的轨迹删失:论文配图
图1:对制剂轨迹进行检查的地方。5层,=100毫升每臂。左侧两个面板( 有记录的默认配置) 显示一个高的第一个栏, 悬崖为零: 模型发出完善的电话, 没有下游发生任何事件 。只有在服务器不作任何分析的情况下,才能计量自动调用量——一个成功的分析方法将调用量移动到工具_调用量和空格内容中——所以这些单元格是无效的,而不是零。