技术实践
得物以VLM巡检App页面体验问题
概述
得物结合内部前端页面巡检平台,把视觉语言模型(VLM)接入 App 智能巡检:巡检平台负责检测问题、个性化规则与目标场景配置及结果汇总与告警。自动化服务完成真机设备调度、执行环境初始化、进入目标页面、现场 AI 送检、自定义操作执行与通用异常查询分析。模型服务按用户配置的 AI 校验规则与通用检测规则对现场实时截图做分析。 并与前端/客户端 SDK 打通获取 js 错误、白屏、网络错误等系统级异常。三类检测能力:页面结构布局问题检测(分「页面部分框架是否匹配」的元素级匹配与「页面完全匹配」的图文整体对比两种标准)、通用视觉体验问题检测(文字类结合 AI 理解与 OCR 判断文案与排列顺序,图片类侧重元素、图标与交互)、多页面展示一致性检测(维护多级页面商品/展示对应关系,用模型识图定位上级页面目标并过滤相似图,最终结合多级截图与规则对比)。 效果:整体问题识别准确率从 50% 提升到 80%,图片相似度匹配准确率从 50% 提升到 80% 以上。首次会场 AI 走查(纯技术)共发现 17 个配置问题,AI 问题发现率达 95%。结果的展示包含规则对比图、现场截图与模型分析过程,误报可反馈用于优化模型检测能力。