论文
ComboShoppingBench:评估LLM智能体在优惠券与预算约束下的组合式购物
ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons
摘要
现实世界的购物往往需要构建一组互补的商品,而非检索单个产品。此类组合购物任务出现在设备配置、备餐、活动策划和团体点外卖中,需要就商品兼容性、可得性、门店层面要求、配送费、优惠券和预算进行联合推理。评估颇具挑战,因为多个购物篮可能满足同一请求,使精确匹配指标不适用,而仅靠语义评估又无法检测不可行订单、无效优惠券组合或错误支付。我们提出 ComboShoppingBench,一个在模拟电商和外卖环境中进行开放但可验证的购物篮构建的 agentic 购物基准。在任务合成阶段,一个探索智能体构建可行且语义连贯的可购商品篮;该见证(witness)购物篮引导优惠券、预算约束、用户查询和对齐评估细则的生成。在评估阶段,LLM 评审员评估语义满足度、响应质量和声明忠实度,同时确定性验证检查商品 ID 有效性、预算合规性和优惠券最优性。在多样 LLM 智能体上的实验表明,即使强大的智能体在 ComboShoppingBench 上也表现挣扎,凸显可靠、约束感知的组合购物仍有巨大改进空间。
