论文
构建、评判、优化:多智能体消费级助手持续改进蓝图
Build, Judge, Optimize: A Blueprint for Continuous Improvement of Multi-Agent Consumer Assistants
摘要
对话式购物助手(CSA)是 Agentic AI 的一个引人注目的应用,但从原型走向生产暴露出两个未被充分研究的挑战:如何评估多轮交互,以及如何优化紧耦合的多智能体系统。食品杂货购物进一步放大这些困难,因为用户请求常欠明确、高度偏好敏感,且受预算和库存等因素约束。本文提出评估与优化对话式购物助手的实用蓝图,并以生产规模的 AI 食品杂货助手为例说明。我们提出多面评估量规,把端到端购物质量分解为结构化维度,并开发与人工标注对齐的经校准 LLM-as-judge 流水线。在此评估基础上,我们研究基于 SOTA 提示优化器 GEPA(Shao 等,2025)的两种互补提示优化策略:(1)Sub-agent GEPA,按局部量规优化单个智能体节点;(2)MAMuT(Multi-Agent Multi-Turn)GEPA(Herrera 等,2026),一种新颖的系统级方法,用多轮模拟与轨迹级评分联合优化跨智能体提示。我们发布量规模板与评估设计指南,支持构建生产级 CSA 的从业者。
