Data quality

Anomaly injection for data quality testing

By default, generated data should be valid. Anomalies are opt-in so teams can test failure paths intentionally.

Great Generator creates synthetic data. It does not anonymize, mask, de-identify, or transform production records.

Generate with anomalies

Use configured anomaly rates to create test data for data quality rules and pipeline hardening.

data = generate_domain(
    "ecommerce",
    anomalies={"null_rate": 0.02, "duplicate_rate": 0.01, "outlier_rate": 0.005},
)

Useful for

Validation tests, negative testing, data quality demos, ETL error handling, monitoring demos, and QA datasets.

Related documentation

Keep exploring