技术实践

百度阿拉丁以Harness和独立QA管理研发交付

智能体系统模型评测应用与实践Agent 协作Agent Harness评测方法与指标编程

概述

百度阿拉丁 RD&QA 团队自 2026 年 4 月在项目中全面接入 AI Coding,复盘发现 coding 环节可提效 30%,但需求总完成时间几乎不变,于是把模型外的工程环节重组为 Harness 全链路闭环。full-chain-delivery 作为调度中心接收 iCafe 需求卡片或知识库文档,先检查业务目标、输入输出、边界与验收标准,再按复杂度编排接口设计、代码生成、自动 CR、单测、真实 curl 冒烟、历史回归、环境部署和问题排查。 每个阶段都有输入、输出、成功/失败条件与回流目标,门禁失败后保存证据、做最小修复、重跑验证,最多 3 轮止损。团队还把测试拆成独立 QA SubAgent,使研发和测试共享需求/代码知识但保持判定对抗,以独立上下文和 QA 标准化验收抑制跳步、伪造 Mock 与“以 bug 验证 bug”。非 coding 事务则可经 Dodo 群聊远端触发。