技术实践
百度穿搭助手建立对话评测与全链路Trace
概述
百度穿搭助手团队因传统中台 Agent 平台业务适配差,在模型 + Harness 工程成熟后自行搭建 4 项平台能力:对话评估平台(维护测试用例集对对话满意效果做评估,列表与详情页给出实际产品效果与性能分析)、Prompt 调试与数据集管理、全链路 Trace(整体概览各阶段工具调用、tokens 使用与耗时,可按 session 查看单次会话明细)、线上效果监控 Trace(结合日志埋点采集与 Prometheus/Grafana 大屏展示)。 QA 侧把『经验驱动的人工判断』转为『规则驱动的 AI 自动校验』:用例生成由手工编写转为基于需求/技术文档、以及基于整库理解的接口用例自动生成(获取变更→变更分析→生成可执行参数→生成接口测试用例,覆盖边界值、异常值、典型值),用例生成效率由天级(人工编写)变为小时级(AI 自动生成 + 人工 review),收益为分钟级完成人工需数小时的验证覆盖。 另外建设交付 AIQA,把需求、进展、文档等项目关键信息整合到侧边栏统一展示,自动统计项目进度并发送项目日报。文中后续提出的点—线—面—网四级推进路径(标准化→工具化→平台化→智能化)中,已落地工具包括电商搜索小助手、上线 check 工具、搜索诊断工具、报警诊断修复工具。、搜索诊断工具、报警诊断修复工具。