论文

生产购物Agent评测:用用户仿真、重复基线和断言定位改进

On Evaluating and Improving Conversational Agents in Production

智能体系统Agent HarnessAgent任务评测

摘要

我们提出评估和改进大规模生产多Agent购物助手的框架,并报告使用经验。离线评估面对三个障碍。第一,记录的对话不能直接回放到修改后的系统,因为不同回答会改变随后每个回合。第二,未修改系统也在运行间波动:LLM组件具有随机性,商品、价格和客户个性化信号也随时变化。第三,整体质量分数混合不同业务行为,只显示质量改变,不能指出哪项行为导致变化。框架逐一应对:对于报告的行为,Evaluation Harness生成目标断言和固定客户场景队列,通过有依据的用户仿真,在助手本地实例中复现。仿真器不回放日志,而是依据记录消息和上下文生成新的客户回合。未修改系统的重复运行形成保存的基线。Improvement Orchestrator把断言结果转为假设,将每个假设作为隔离修改实现,并用场景级差异的配对百分位自助法区间与基线比较。调查结束时,Harness可以提出未来评测修订,但需人类批准且不得改变过去决策。我们报告生产调查:断言分布显示商品轮播中的哪些位置受失败影响,重复运行区分真实改善与运行波动;对评测本身的审计,还发现缺乏所需证据的评审,以及虽已配置却未应用的模型设置。