Synthetic data: generation and validation for health sciences

Zaghi, Adriano (2026) Synthetic data: generation and validation for health sciences, [Dissertation thesis], Alma Mater Studiorum Università di Bologna. Dottorato di ricerca in Scienze e tecnologie della salute, 38 Ciclo.
Documenti full-text disponibili:
[thumbnail of Zaghi_Adriano_Tesi.pdf] Documento PDF (English) - Accesso riservato fino a 5 Settembre 2027 - Richiede un lettore di PDF come Xpdf o Adobe Acrobat Reader
Disponibile con Licenza: Salvo eventuali più ampie autorizzazioni dell'autore, la tesi può essere liberamente consultata e può essere effettuato il salvataggio e la stampa di una copia per fini strettamente personali di studio, di ricerca e di insegnamento, con espresso divieto di qualunque utilizzo direttamente o indirettamente commerciale. Ogni altro diritto sul materiale è riservato.
Download (4MB) | Contatta l'autore

Abstract

The demand for biological data is increasing as researchers seek to understand the complexity of natural phenomena, particularly in health sciences and biology. However, such data are derived from experimental measurements and are inherently limited. Access to medical data is often restricted due to privacy concerns, and biological evidence frequently comes from simplified or isolated scenarios. Synthetic data offer a promising solution to improve data sharing in healthcare and biological research. Synthetic data are generated using mathematical models, statistical processes, or generative algorithms (e.g., GANs, VAEs, diffusion models) to replicate the structure and distribution of real datasets while preserving privacy. In this work, we generated synthetic data using both machine learning and stochastic approaches. Using Variational Autoencoders, we produced a synthetic cohort based on the UK-NCRI dataset, containing information on 150 genomic mutations, cytogenetic alterations, and survival outcomes related to six disease events. The synthetic data were validated in terms of statistical similarity and privacy preservation, and successfully used to replicate analytical workflows including clustering, survival analysis, and multi-state modeling. In parallel, we developed a pipeline to generate synthetic shotgun microbiome samples. These data translated information from isolated genomes into a format suitable for modeling microbiome complexity. The synthetic samples were used to train a machine learning model capable of predicting antimicrobial resistance in real samples. Together, these case studies demonstrate the potential of synthetic data to enhance reproducible research, improve data accessibility, and address privacy constraints in both clinical and biological contexts.

Abstract
Tipologia del documento
Tesi di dottorato
Autore
Zaghi, Adriano
Supervisore
Co-supervisore
Dottorato di ricerca
Ciclo
38
Coordinatore
Settore disciplinare
Settore concorsuale
Parole chiave
Synthetic data, VAE, Machine Learning, Leukemia, Antimicrobial Resistance, Generative models, AML, AMR, Dirichlet
Data di discussione
17 Marzo 2026
URI

Altri metadati

Gestione del documento: Visualizza la tesi

^