罕见故障、极端天气和少数用户行为很难在真实数据中大量出现,敏感数据又不能随意共享。合成数据通过规则或生成模型构造新的记录,可以帮助测试系统,也能补充部分稀缺情况。
问题在于,合成过程依据的仍是已有数据和假设。原始资料没有看见的人群与事件,生成结果也可能继续忽略。
先明确它服务什么任务
用于软件压力测试的数据,只要结构和分布合理;用于训练风险模型的数据,则需要更严格地保留变量关系。不同用途对应不同质量标准。
团队应提前写下哪些特征必须接近真实情况,哪些可以简化。否则一套数据看起来完整,却无法回答具体问题。
合成数据擅长扩大已知范围,最容易漏掉的仍然是那些没有被定义的情况。
检查相似,也检查差异
平均值接近不代表数据足够真实。要观察长尾、变量关联和关键群体表现,并用一部分真实数据做对照。模型在合成数据上成绩很好,回到现实仍可能迅速失效。
过度接近原始记录也有风险。生成流程需要评估是否可能还原个体信息,不能把“合成”直接等同于匿名。
保留生成过程
合成规则、模型版本、随机参数和原始数据范围都应记录。业务条件变化后,旧的生成方式可能不再适用。
较稳妥的做法是让合成数据补充真实数据,而不是完全替代。它可以帮助团队探索边界,但最后仍要在真实任务上确认结果。
