Synthetic Data Generation with Python and LLMs
Abstract
A talk presented on September 4, 2025, at PyCon Somalia 2025.
Full text
Synthetic Data Generation with Python and LLMs Ahmed Unshur Research Data Scientist Garaadsiin Consulting Limited DOI: 10.5281/zenodo.17053188 September 4, 2025
About Ahmed Unshur ●Research Data Scientist at Garaadsiin Consulting Limited ●Psychologist ●Certified Carpentries Instructor ●Open Science Advocate 2
Agenda ●Understanding Synthetic Data ●Benefits and Limitations ●Generation Methods ●Demos (1 and 2) - Tabular Synthetic Data Generation ●Ethical Considerations and Best Practices 3
Why Synthetic Data? 4 Generated with Midjourney V7
Definition of Synthetic Data “Synthetic data refers to data that is artificially generated rather than obtained by direct measurement or collection from real-world events.” (Johnson, 2024) 5
6
Benefits of Synthetic Data ●Privacy preservation ●Improved data accessibility ●Data augmentation ●Cost and time efficiency ●Support for innovation and testing 7 (Giuffrè & Shung, 2023; Gonzales et al., 2023; Mendes et al., 2025)
Limitations and Risks ●Utility–privacy trade off‑ ●Bias replication and amplification ●Lack of trust and interpretability ●Quality and validity concerns ●Risk of re-identification ●Regulatory and ethical challenges 8 (Giuffrè & Shung, 2023; Foraker et al., 2025; Resnik et al., 2025)
Generation Methods ●Statistical methods ●Generative AI algorithms ●Rule-based models 9 (Johnson, 2024)