技术实践
得物以自然语言UI操作和双路校验检测无响应
概述
针对无法直达的目标入口(如需下滑多屏才展示的板块),团队引入 AI 自动化操作:用户用简短自然语言描述前置操作步骤,由大模型完成操作分析、UI 自动化框架完成操作执行——模型接收截图与任务描述后返回 bbox,换算为实际坐标再执行点击,返回内容需做 json 解析并对异常 JSON 走 json_repair 修复与 bbox 数字分隔容错。 文中称采用的是开源免费大模型,自建服务时 token 成本基本可忽略,利用其多模态的 NLP、图像识别、目标定位、分类与检测能力并持续优化 Prompt 实现智能 UI 自动化。AI 操作也可作为独立路径校验放在视觉检测之后执行,出错同样上报。操作无响应检测对比了图像像素处理与模型分析两种方案,两者均能满足场景需要,出于成本考虑大部分场景优先用基于灰度直方图相关系数、卡方距离与交集的像素对比判断操作是否生效,仅在像素判断不足时才调用模型分析。