← all demos Data curation & quality

Synthetic Data Factory

The generate → score → dedup → filter loop a real data-curation pipeline runs, shrunk to one request: a synthetic dataset for any topic, auto-scored against a quality rubric, near-duplicates flagged, with a live quality dashboard.

How it works

  1. Generate a small synthetic dataset for your topic.
  2. Score each item 1–5 on correctness, specificity, and clarity (LLM grader).
  3. Dedup: flag near-duplicates (Jaccard similarity on word sets).
  4. Filter: items below the bar or duplicated fail QA. Dashboard shows pass rate + per-criterion averages.
Generate
Scorerubric
Dedup
Filterquality bar