技术实践

得物以VLM驱动三端统一UI测试

应用与实践智能体系统Agent 工具调用Agent 环境交互Agent Harness编程视觉感知与空间理解

概述

得物 App 客户端测试团队为解决用例迁移成本高(中等规模模块转化需数人天)、调试人工介入多、iOS/Android/HarmonyOS 三端各写一套且改版同步失效三个痛点,落地 ai_uitester。能力一为用例平台数据自动转化:把测试用例平台导出的多层树形 JSON 经六阶段 Pipeline(树结构展平提取叶节点与面包屑路径、用例解析为结构化数据、与已有 suite 去重、LLM 增强生成可执行步骤并注入 Wiki 知识、持久化写入配置、版本归档)自动转为可执行脚本,LLM 增强模块由 StepGenerator 把如「列表正常展示,可滑动查看更多」的 Checkpoint 描述转成含 App、Tap、Wait、Assertion、Swipe 等步骤类型的完整 JSON,关键约束包括条件弹窗用 Action 类型(存在则处理、不存在自动跳过)、不规范步骤由校验器降级修正而非丢弃、每个用例必须包含 App 步骤。 支持高并发处理与模块级 Wiki 预加载,每阶段写入检查点文件实现断点续传。能力三为 VLM 驱动的跨平台统一:核心执行模型是「截图 → 理解 → 执行」闭环,VLM 看像素级截图而非 DOM,同一条 JSON 脚本在 Android、iOS、HarmonyOS 三端通用无需修改,底层驱动按设备类型自动选择,BaseAIDriver 实现「截图→大模型解析→决策执行→记录日志→重新截图」的感知-决策循环(最多 20 轮,点击配套置信度校验),Prompt 有四大约束(每次只做一个动作、MatchedText 必须从截图逐字符复制且 Confidence <= 0.5 必须返回 Action: Null、弹窗与权限登录页等高优先级知识自动注入、按平台自动切换系统操作指令),并可选深度思考模式获得子目标分解、进度跟踪与前后截图对比。 Wiki 知识库被用例增强、自愈诊断、运行时执行、下游技能与反馈闭环 5 大场景消费,采用精确匹配 → 去除优先级后缀 → 去除括号 → LLM 语义匹配 → 跳过并缓存的五层降级匹配以保证注入知识准确。