技术实践

得物以规则和置信度门禁治理测试用例自愈

智能体系统模型评测应用与实践Agent 动作执行与治理评测方法与指标编程视觉感知与空间理解

概述

ai_uitester 内置 AI 智能调试模式实现自动诊断与自愈修复:用例执行采用 while 循环支持动态步骤变更,步骤失败先过规则引擎失败分类器,把 device / timeout / network 类非业务失败过滤掉并自动换机或重试,只有 business 类业务逻辑失败才进入 AI 诊断。 AI 诊断由 VLM 输入带 ✓✗○ 标注的步骤、错误信息、失败截图与 Wiki 知识,输出 diagnosis、confidence、complete_steps 与 resume_from_index。置信度 ≥ 阈值时自动应用修复、替换执行步骤并从 resume_from_index 重新执行,执行通过即固化用例、执行失败则回退原用例,置信度 < 阈值时改为弹出人工审核、展示步骤 diff 与超时倒计时并由人 Accept/Reject、超时自动 Reject。 置信度阈值经实测调优设为 0.5:阈值过高会大量拒绝操作拖低执行效率,过低则误点风险上升。两条铁律是 MatchedText 必须从截图逐字符复制不允许脑补、宁可不点击也不点错。文中给出三个真实自愈案例:功能按钮位置移动(Confidence 0.9,改点页面顶部功能菜单栏)、进入页面需额外操作(Confidence 0.8,插入等待后重新点击入口)、冷启动弹窗遮挡导致后续步骤失效(Confidence 0.9,诊断「前置步骤失效」并把执行指针回退到步骤 2、在启动 App 后插入条件 Action 处理弹窗)。 自愈返回完整步骤列表而非增量 Diff,以避免多次修复后索引偏移与修复引入新 Bug。