技术实践

百度电商搜索以Harness重组全栈研发与测试

应用与实践智能体系统模型评测Agent Harness基准与评测资源评测方法与指标编程

概述

百度电商搜索团队以「Harness 工程是基础设施,全栈能力是组织形态」为框架,把质量定义为输入约束 × 生成约束 × 输出约束,在三类复杂度递进的需求上落地。品牌卡迭代(典型老人接新业务:在线、离线、运营平台共 4 代码库 + Go/Python/Vue 3 技术栈、1 人全栈)采用 Harness 三件套 + 全栈 + 平台化:技术调研、开发、联调阶段周期由 10 人/天降至 4 人/天,技术评审时已完成研发 50%+,整体周期减少 20%+,业务熟悉从天级压到小时级。 RD/QA 协同上,RD 前置输出标准化 Spec 明确功能逻辑、数据流转、接口约束、异常处理与边界场景,QA 结合 Spec 与「搜索电商后端用例生成 SKILL」分钟级生成高覆盖度测试 Case,本次原计划排期 3 天的服务端测试 1.5 天完成、测试周期压缩约 30%,QA BugFix 数字员工自动做问题归因与代码修改建议,边界 Case 测试效率提升约 60%。 榜单自动化由 1 名 RD 用 6 周打通完整数据生产与评估流程,涉及 8 代码库、3 技术栈、13 算子,含在线/离线/评估/算子多技术栈系统:技术栈为 Python 3.14 + eflow-operator + Pydantic Settings + OpenAI SDK + instructor + ruff/mypy/pytest 三重检查 + doubao-seed(主)/deepseek-r1(降级),流程由「策略→人工 Excel→多轮审核→手动脚本入库→流式同步」改为「策略提交→平台批量任务→eflow 算子生产→自动聚合→自动入库→自动同步」。 13 算子三阶段审计发现 3 个代码问题(1 高/1 中/1 低)已修复,13 项逻辑差异闭环(2 修复/3 TODO/5 无需处理/3 不纳入),Top2000 策略召回率 75%(PV 覆盖 95.5%)、上榜理由召回率 99%。QA 左移到数据契约定义阶段,测试重点由测功能转为测数据正确性与链路可靠性。 文中称该场景 80% 的代码已是 AI 生成的。