论文
RideWay:评估工具型语言智能体的高效任务完成
RideWay: Benchmarking Efficient Task Completion for Tool-Using Language Agents
摘要
AI智能体通常按是否完成任务评估。在交互服务中,成功的智能体仍可能因重复提问、冗余搜索或可避免修改让用户受挫。我们提出面向有状态工具调用环境中叫车智能体的效率基准RideWay,以及以成功为门槛的效率效用指标:相对任务专属参考工作量,对成功轨迹中额外工具调用和面向用户轮次进行折扣。人工成对偏好校准相对惩罚,反映服务流程总体权衡:额外对话常造成明显摩擦,额外工具使用有时却能核验约束或保留用户意图。在58项任务和24个模型上,额外轮次拟合惩罚约为额外工具调用的两倍。在任务不重叠的留出偏好上,效率效用整体准确率78.7%;轨迹轮次不同时为90.6%,仅工具调用不同时则接近随机水平,而这也是标注者最缺乏共识的维度。RideWay使交互效率能够与任务成功一同衡量,同时揭示按次数评估工具使用的边界。
