论文

请求无济于事:在 BFCL 多回合中对采取行动的决定进行评分

Asking Earns Nothing: Scoring the Decision to Act in BFCL Multi-Turn

智能体系统模型训练强化学习Agent任务评测RLVRAgentic RL

摘要

缺乏所需信息的智能体应该询问而不是采取行动,智能体排行榜的任务定义也是如此。 BFCL 多回合围绕模型应该询问的回合构建其四个类别中的两个,并且其记分器从不查看该回合:那里的黄金轨迹是空的,检查器会跳过它,并且脚本用户无法回答,因此询问不会获得任何收益,猜测在该回合中不会花费任何成本,并且询问两次会丢失该项目。该基准还包含该决策的控制实验。应该询问的项目是一个基本项目,其中一条信息从一个回合中删除,因此相同的请求在同一回合索引处出现两次,一次完成,一次未完成:第一次模型应该做出改变世界的调用,第二次它应该询问。我们对每一对进行一个决策,模型是否尝试在该回合中做出改变世界的调用,在没有LLM判断的情况下读取存储的轨迹; “始终行动”和“始终要求”得分均为 50。在做出此决策的 223 对中,gpt-5.4 在 83.4% 的完整回合中尝试跟注,并在 78.0% 的不完整回合中阻止,七个模型的最佳决策准确度为 80.7%;在相同的项目上,官方得分将其排在第六位,而排名第一的车型则排在中间。一条告诉 gpt-5.4 不要询问的附加行推动它在这对的两边都采取行动,因此它的决策准确性没有显示出明显的变化,而它的官方分数在两个应该询问的类别和基本双胞胎上上升了 13.5 到 23.5 分;相反的一行,告诉 gemma-4-31B-it 首先询问,将其决策提高了 4.5 分,但没有获得官方得分。分数随着行动的推动而变化,而不是随着决定而变化。我们发布了对,一个回合级记分器,可以在任何 BFCL 输出目录上运行,无需 API 密钥,以及 31 个手动验证的不良项目。

请求无济于事:在 BFCL 多回合中对采取行动的决定进行评分的原论文方法或结果图
图 1:(a) 记分员跳过未指定的回合;改编自项目 miss_param_122。 (b) 同样的 223 个应该问的项目有两种得分方式:官方对这些项目的准确度,以及对双胞胎的行动决定,其中总是行动和总是要求都得分 50。