How can data quality be

22 查阅
How can data quality be quantified in the data warehouse?如何来量化数据仓库中的数据质量?

参考答案:

正确答案:
答:在数据仓库项目中,通常通过不规则数据的检测工作(Anomaly Detection)来量化源系统的数据质量。除非成立专门的数据质量调查项目组,否则这个工作应该由ETL项目组完成。通常可以采用分组SQL来检查数据是否符合域的定义规则。
对于数据量小的表,可以直接使用类似下面的SQL完成。
select state, count(*) from order_detail group by state
对于数据量大的表,一般通过采样技术来减少数据量,然后进行不规则数据检测