视觉AI自动化测试能做什么?
1. 视觉回归测试
基准截图(基线图) ↔ 运行时截图对比,AI 识别差异:
- 文字错位、按钮偏移、颜色异常、图标缺失、截断、白屏、黑屏
- 区分真实bug和允许的微小差异(抗锯齿、压缩噪点,传统像素对比容易误报)
2. AI 控件识别 & 操作
AI 模型从截图里直接识别:按钮、输入框、弹窗、复选框、文字、图标,返回坐标,驱动鼠标 / 点击 / 输入:
- OCR:提取界面文字,校验文案、验证码、提示信息
- 目标检测(YOLO 等):识别各类 UI 组件
- 多模态大模型:理解页面语义,比如 “找到登录按钮并点击”
3. 业务场景自动化
- 端到端操作:打开页面→AI 识别账号框→输入→点登录→截图校验结果
- 异常检测:自动识别报错弹窗、加载动画、空白页面
- 兼容性测试:批量跑不同分辨率 / 浏览器,统一视觉校验
4. 局限性
- 页面布局大变样时,基线图需要更新;
- 纯视觉无法直接读取接口、DOM 属性;
- 动态随机内容(时间、随机验证码)需要屏蔽对比区域;
- 性能比传统 DOM 自动化慢,适合 UI 验收,不适合高频接口回归。