I dati sintetici, generati artificialmente per emulare le caratteristiche dei dati reali, sono sempre più utilizzati nei settori che impiegano algoritmi di machine learning. Offrono diversi vantaggi, tra cui la possibilità di aggirare molte delle criticità legate alla tutela della privacy. Tuttavia, è necessario prestare attenzione ai profili di sicurezza e all’affidabilità dei modelli che li producono e li utilizzano.

  1. Alternativa all’uso dei dati personali
  2. Dati sintetici nella sicurezza informatica
  3. Vantaggi e criticità dei dati sintetici
dati sintetici rivoluzione privacy image

Alternativa all’uso dei dati personali

Sia in Europa sia negli Stati Uniti, governi e istituzioni stanno ricorrendo ai dati sintetici come alternativa all’impiego di dati personali in diversi ambiti industriali, in particolare nei settori della ricerca e dello sviluppo tecnologico.

Poiché imitano mitano le proprietà statistiche dei dati reali, si rivelano utili in quanto non contengono informazioni personali identificabili. Per cui, vengono utilizzati soprattutto dalle aziende che sviluppano o addestrano algoritmi di machine learning, uno dei principali sottoinsiemi dell’intelligenza artificiale. Si tratta di una tecnologia che, tuttavia, non è priva di criticità e presenta anche potenziali rischi.

Ma come vengono generati i dati sintetici? Non sono creati manualmente, bensì prodotti da algoritmi e modelli simulativi basati su tecniche di intelligenza artificiale generativa. Questi ultimi non si limitano ad analizzare dati esistenti, ma sono in grado di generarne di nuovi e coerenti dal punto di vista statistico. Il processo sta trasformando profondamente il settore tecnologico e, allo stesso tempo, introduce nuove sfide in materia di cybersecurity, etica e protezione dei dati personali.

Classificazione e generazione dei dati sintetici

Generalmente distinguiamo tre tipi di dati sintetici:

  • completamente sintetici, quando non incorporano alcuna informazione riconducibile al mondo reale;
  • parzialmente sintetici, quando derivano da dati reali opportunamente trasformati;
  • ibridi, quando combinano dataset reali e artificiali.

La loro generazione avviene attraverso diverse soluzioni tecnologiche, tra cui librerie come Synthetic Data Vault per l’ambiente Python, insieme ad altri framework, pacchetti e strumenti open source.

Dati sintetici nella sicurezza informatica

L’impiego dei dati sintetici nell’addestramento dei modelli di intelligenza artificiale, un ambito che presenta al tempo stesso opportunità e criticità in termini di cybersecurity, offre diversi vantaggi. Tra i principali vi è la possibilità di ridurre l’utilizzo di dati personali reali, limitandone l’esposizione e attenuando i rischi legati alla tutela della privacy.

I dati sintetici consentono inoltre di realizzare cyber stress test, ovvero simulazioni controllate finalizzate a valutare la resilienza di un’organizzazione e la sua capacità di prevenire, rilevare e gestire incidenti significativi di sicurezza informatica. Attraverso la creazione di scenari di attacco simulati, è possibile testare l’efficacia dei sistemi di rilevamento delle intrusioni e, più in generale, delle misure di difesa adottate, ampliando e rafforzando il perimetro di protezione.

Questo tipo di dati trovano applicazione anche nelle cosiddette sandbox regolatorie, ambienti fisici o virtuali nei quali le aziende possono sperimentare nuovi prodotti o servizi tecnologici in un contesto controllato e supervisionato, spesso con il coinvolgimento delle autorità competenti. Un modello utilizzato soprattutto nei settori ad alta regolamentazione, inclusa la cybersecurity.

In ambito di sviluppo software, i dati sintetici possono essere impiegati per creare prototipi e digital twin, ossia rappresentazioni virtuali di oggetti o sistemi reali progettate per riprodurne il comportamento in modo fedele. Questo consente di individuare e correggere eventuali criticità prima della messa in produzione o dell’immissione sul mercato.

Vantaggi e criticità dei dati sintetici

L’impiego dei dati sintetici, in alternativa all’utilizzo di informazioni reali, presenta indubbi vantaggi. In particolare:

  • Migliore efficienza operativa. L’uso di dati sintetici consente di accelerare attività di analisi, ricerca e sviluppo, evitando i tempi e i vincoli legati all’accesso e alla gestione di grandi volumi di dati reali;
  • Maggiore tutela della riservatezza. I dati sintetici, se correttamente generati, non contengono informazioni riferibili a persone fisiche. Questo semplifica il rispetto delle normative applicabili, come il GDPR, riducendo gli obblighi legati al trattamento di dati personali;
  • Riduzione del rischio di data breach. Nei contesti di testing e sviluppo, l’impiego di dati sintetici limita l’esposizione di dataset reali e, di conseguenza, abbassa l’impatto potenziale di eventuali violazioni.

Ma oltre a questi benefici esistono anche dei rischi, legati principalmente al loro utilizzo superficiale o improprio. Tra i principali si citano:

  • Qualità e affidabilità dei dati. Se i dati sintetici non riproducono in modo accurato le caratteristiche statistiche dei dati reali, i modelli addestrati su di essi possono generare risultati imprecisi o fuorvianti;
  • Deriva del modello. Nota anche come model drift, indica la progressiva perdita di efficacia di un modello quando le condizioni del mondo reale cambiano e i dati utilizzati per l’addestramento non riflettono più tali variazioni;
  • Distorsioni nei dati sintetici. I cosiddetti bias possono emergere anche nei dataset artificiali, introducendo errori sistematici o amplificando squilibri già presenti nei dati di partenza.

Una gestione efficace dei dati sintetici richiede controlli costanti sulla qualità, verifiche periodiche delle prestazioni dei modelli e una chiara tracciabilità dei processi di generazione e utilizzo dei dataset. Solo così è possibile sfruttarne i vantaggi senza compromettere affidabilità, conformità normativa e sicurezza.



    Dichiaro di aver letto e compreso l'Informativa sul trattamento dei dati