技术实践

淘天以双侧视觉取证和Diff闭环修正页面还原

应用与实践智能体系统模型评测Agent 动作执行与治理评测方法与指标视觉感知与空间理解

概述

在塔罗 Cockpit 大循环中,前端 UI 任务要经过实现与视觉验证两个责任阶段,只要改动影响用户可见结果就进入视觉 Agent 的验证阶段,Tarot Pixel diff skill 提供完整视觉反馈链路:先通过 Mock 固定目标业务状态(视觉 Agent 用 Mock 固化场景后再与对应设计状态比较,Mask 仅处理商品图、用户头像等无法控制的运行时内容,固定文案、装饰和业务状态仍参与验收),再用 Tarot Pixel Diff 对比设计稿与实现截图,并根据差异做设计与实现双侧取证——设计侧从 Pixel API 获取节点尺寸、相对位置和样式,实现侧通过浏览器读取实际 DOM 的位置与计算样式,两侧数据共同构成修改依据以避免按截图目测参数。 此后由视觉 Agent 按根因修复,并在相同 Mock、视口和对比范围下重新执行 Diff。通过则视觉证据进入 Review。状态、结构或接口缺失使任务退回前端 Agent。多轮修复仍无法收敛则转入负责人或人工仲裁。元素位置偏差由视觉 Agent 修复、状态分支缺失退回前端 Agent、设计稿与需求冲突转交负责人或用户,每类问题都有明确出口。