技术实践

百度前端团队将代码与视觉验证接入交付流程

应用与实践智能体系统模型评测Agent HarnessAgent任务评测评测方法与指标编程

概述

百度前端团队把验证流程左移,让 Agent 在开发过程中按工程规范自检与修复。Agent Operating Rules 在项目根目录 rules 下维护索引文件,按改动类型渐进式加载工程约定,并设两道门禁:所有代码改动后必须启动独立 subagent 执行 code-validation Skill 做即时 CR(不可用 lint/build 替代),涉及 UI 的改动必须通过 CDP 连接真实浏览器执行 visual-verify Skill。 code-validation 由独立 subagent 加载 rules.md(通用检查 + 项目专属阻塞规则,每条附判断标准与正确写法示例),只审 changed lines 并按 Error/Warning/Info 输出报告,主 Agent 修复后才可继续,同一套规则在开发期与流水线共用。visual-verify 以 Contract 模式工作(JSON 描述期望页面状态→contract-lint 静态校验→dom-assert 真实浏览器断言→写入 contract.md),并提供标注截图、console 检查与跨任务 Memory。 案例中 Agent 实现快捷回复功能后经三轮「发现→修复→再验证」:先由 console-check 发现 card/index.tsx 访问 undefined 全局状态导致 Error Boundary 崩溃,再用 annotate-screenshot 定位面板被父容器 overflow:hidden 裁切,最后逐项验证分类切换、搜索、短语回填(字数计数 17/500)、最近使用、增删弹窗与 localStorage 持久化。 Figma To Verify 由 7 个 Skill 组合(figma-to-html → chrome-cdp 双 Tab → element-screenshot → vet-generator 生成 VET 并对齐颜色 → vet-investigation 识别候选问题 → visual-issue-clarification 逐问题复核量化),由独立 Subagent 用 getComputedStyle 精确到 px 复核并注入 SVG 标注。 Pipeline Code Review 按目录前 3 级分组 + bin-packing 把大 diff 拆成≤500 行 chunk,用 CLI 子进程并发 10+ 审查并以 task.log 与 result JSON 追踪进度、支持中断恢复,输出 review.json 后可驱动可视化报告、唤起 Comate IDE 修复、按文件独立 worktree 自动批量修复与闭环标记,并已基于 OpenClaw + BrowserUse 初步打通 iCode 集成。