一、按用途场景分类
基准正向数据
正常合法入参、标准业务流程数据,用于主流程回归,作为 AI 判断 “正确结果” 的基线。
边界极值数据
最大长度、最小数值、临界金额、最大分页条数、超长文本、刚好达标条件等,用于边界校验。
异常非法数据
空值、null、特殊符号、非法 ID、负数、越权账号、乱码、不符合枚举值参数,用于异常容错测试。
并发 / 重复脏数据
重复提交单号、同一账号并发请求、未支付重复回调、幂等性场景数据。
兜底兜底构造数据
流程中断数据、中途取消、退款逆向数据、过期订单、已核销单据等逆向业务数据。
二、按生命周期与可复用性分类
静态固化数据
固定账号、固定字典值、基础配置数据,长期不变,可存入文件 / 数据库长期复用。
动态临时数据
每次执行动态创建的订单、单据、临时用户,执行完成自动删除或回滚,避免数据污染。
快照回滚数据
数据库基线快照,每次测试跑完一键恢复初始状态,保证每次执行环境一致。
三、按安全等级分类
脱敏可用数据
手机号、身份证、银行卡、地址做掩码处理,可入库、可给大模型读取训练。
敏感涉密数据
真实生产核心账务、密钥、内部权限信息,禁止进入 AI 样本库,仅人工线下使用。
四、配套管理规则
打标签:每条数据标注所属接口、场景、预期结果,AI 可按标签自动调用;
版本化:需求迭代同步更新对应数据集,淘汰失效旧数据;
隔离存放:测试、预发、生产数据物理隔离;
自动清理:动态数据执行后销毁,防止脏数据导致 AI 误判缺陷。