论文

通过基于环境的验证评估开放式电子商务代理

Evaluating Open-Weight E-Commerce Agents with Environment-Grounded Verification

智能体系统Agent任务评测

摘要

购物对话有许多通往同一个购物车的路线,而任务成功率会将所有路线降低为一个分数。我们构建了一个确定性且可重复的电子商务环境,预先提交每个试验的客户和轨迹参数,包括角色、难度、目标购物车和项目展示时间表。模拟消费者尝试在评估模型的帮助下从环境中购买目标购物车。环境指导模拟器的操作并记录每个辅助操作以及当时的环境状态。审判结束后,这些记录使评估人员能够根据保留的证据评估对话的各个部分。例如,仅当客户已经提及该产品时,评估人员才会对未能显示目标产品的搜索进行惩罚。我们进一步使用这些证据,根据助手的操作与预期工具调用集的比较,对工具调用应用不同的惩罚。我们的环境还与模拟器进行双向交互,当模拟器确定客户变得过于沮丧时,读取其输出以停止试用,并实时注入指令,指定何时探索、推迟购买商品或召回之前的交易。这种交互创建了一个开放式且可验证的模拟。在 20B 到 35B 参数的 8 个开放权重代理中,每个代理进行 160 次试验和 44 个指标,生成的能力概况可区分行动不足、过度购买、不受支持的产品属性和糟糕的搜索,所有这些终端的成功都掩盖了这些。