I cybercriminali usano il voice cloning per simulare voci reali e truffare con il vishing. Scopri rischi e difese contro questa minaccia AI.
Il vishing (voice phishing) è un attacco informatico che sfrutta l’ingegneria sociale attraverso chiamate telefoniche fraudolente. I cybercriminali impersonano enti legittimi, come banche, operatori telefonici o forze dell’ordine, per ingannare la vittima, adottando metodi persuasivi. L’obiettivo è indurla a fornire informazioni sensibili o a disporre bonifici verso conti controllati dagli attaccanti.
Tradizionalmente, questi attacchi si basavano su sistemi automatizzati di sintesi vocale o sull’intervento diretto di operatori umani. Tuttavia, l’evoluzione tecnologica e la recente diffusione dell’intelligenza artificiale generativa hanno rivoluzionato il metodo di esecuzione del vishing.

Oggi, i criminali informatici impiegano questi strumenti per realizzare attacchi mirati, mediante una tecnica nota come voice cloning. Questa tecnica consiste nel riprodurre alla perfezione la voce della vittima, o di un suo contatto fidato, utilizzando algoritmi di deep learning. Il risultato è un attacco che unisce inganno psicologico e precisione tecnologica, aumentando il rischio di compromissione, soprattutto in contesti aziendali e finanziari.
In questo articolo analizzeremo nel dettaglio come funziona il voice cloning, come viene applicato al vishing e quali sono i principali rischi per aziende e utenti privati. Infine, vedremo le misure di sicurezza da adottare per difendersi da questa nuova minaccia.
Come viene effettuato il voice cloning
Per realizzare un voice cloning, i cybercriminali utilizzano software di intelligenza artificiale in grado di generare voci sintetiche estremamente realistiche. Questi strumenti si basano su modelli di deep learning riescono a replicare con precisione frequenza, timbro, ritmo e persino l’accento della voce campione. Molti di questi tool sono accessibili anche a utenti privi di competenze tecniche avanzate, grazie a interfacce user-friendly e processi automatizzati.
I programmi più evoluti riescono a ricostruire una voce con un’accuratezza superiore all’85%, partendo da appena tre secondi di registrazione. Con un addestramento più esteso, il risultato può diventare praticamente indistinguibile dalla voce originale.
Per ottenere il materiale vocale, i criminali possono chiamare direttamente la vittima con uno stratagemma telefonico, inducendola a parlare e registrandone la voce. Tuttavia, in molti casi non è necessario alcun contatto diretto, in quanto la voce può essere estratta da contenuti pubblici disponibili online, come:
- Video pubblicati su YouTube;
- Reel e storie su Instagram o TikTok;
- Podcast, interviste o dirette vocali;
- Messaggi vocali inviati su WhatsApp o Telegram;
La facilità di accesso a questi contenuti rende il voice cloning una tecnica alla portata di chiunque, con costi bassi e livelli di efficacia sempre più elevati.
Voice cloning e vishing: truffe sempre più sofisticate
Una volta clonata la voce, i cybercriminali la utilizzano per effettuare chiamate vocali mirate, con l’obiettivo di manipolare psicologicamente la vittima e indurla ad agire d’impulso. L’efficacia di questa tecnica risiede nel senso di familiarità che la voce clonata genera: la vittima riconosce un tono a lei noto e si lascia facilmente ingannare, rivelando informazioni sensibili o autorizzando bonifici.
Le chiamate vengono pianificate con estrema cura. I criminali analizzano i profili social della persona imitata per raccogliere dati personali, abitudini quotidiane, relazioni familiari, eventi recenti e altri elementi utili a rendere la conversazione più realistica. A partire da questi dati, generano script personalizzati con software di text-to-speech (TTS), simulando con estrema precisione tono e contenuti.
I contesti più utilizzati per convincere la vittima includono:
- Incidenti stradali o richieste di aiuto improvvise;
- Denunce di rapina o aggressioni;
- Smarrimento del telefono o del portafoglio;
- Contatti da parenti o conoscenti in difficoltà all’estero, che hanno urgente bisogno di denaro;
A differenza del vishing tradizionale, basato su campagne massive e generiche, il voice cloning segue un modello altamente mirato, in cui la vittima viene selezionata a priori. In alcuni casi, vengono usati messaggi vocali pre-registrati o voicemail, ma le chiamate in tempo reale restano il metodo più efficace per instaurare una relazione di fiducia e manipolare l’utente nel giro di pochi secondi.
Rischi e segnali di allarme
Il vishing basato sul voice cloning può avere conseguenze economiche gravi, sia per i singoli utenti che per le aziende. Le perdite generate da un singolo attacco possono superare centinaia di migliaia di euro, soprattutto quando le vittime appartengono a contesti ad alta esposizione finanziaria.
I metodi di pagamento richiesti dai truffatori sono spesso non tracciabili e includono:
- Gift card digitali, acquistabili senza verifica d’identità;
- Bonifici internazionali verso conti esteri o intestati a soggetti fittizi;
- Carte prepagate, facilmente attivabili e anonime;
- Criptovalute, ideali per trasferimenti rapidi e irreversibili;
Secondo un recente studio di McAffee, il fenomeno è in rapida diffusione a livello globale. Almeno 1 utente su 4 ha dichiarato di aver ricevuto una chiamata sospetta con voce clonata, mentre il 70% degli intervistati ha ammesso di non essere in grado di distinguere tra una voce autentica e una riprodotta con intelligenza artificiale.
Caso reale: truffa vocale ai danni di imprenditori italiani
Nel febbraio 2025, un sofisticato attacco di vishing ha preso di mira alcune delle figure più note dell’imprenditoria italiana, tra cui Giorgio Armani, Remo Ruffini (Moncler) e Massimo Moratti. I truffatori hanno utilizzato un voice clone del Ministro della Difesa Guido Crosetto, simulando una richiesta urgente di fondi per finanziare la liberazione di giornalisti italiani rapiti all’estero.
La credibilità della voce clonata, combinata a uno scenario plausibile e a una narrazione ben costruita, ha indotto almeno una delle vittime a effettuare un bonifico da 1 milione di euro. Solo dopo aver contattato il vero Ministro, la truffa è stata svelata. Grazie alla prontezza della denuncia, le autorità italiane sono riuscite a intercettare il trasferimento nei Paesi Bassi, evitando la perdita definitiva della somma.
Questo caso evidenzia quanto gli attacchi basati su voice cloning possano colpire anche soggetti di alto profilo, sfruttando fiducia, urgenza e contesti emotivamente coinvolgenti per ottenere il massimo risultato con il minimo contatto.
Prevenzione e difesa
Con la crescente diffusione degli attacchi vishing basati su voice cloning, è fondamentale conoscere e adottare misure efficaci per prevenire la minaccia. In particolare, si raccomanda di:
- Non fidarsi della sola voce.
Una voce familiare non è più un elemento affidabile. In presenza di richieste insolite, soprattutto se accompagnate da un tono di urgenza, è essenziale verificare l’identità del chiamante tramite canali di comunicazione alternativi. - Impostare una password all’interno del proprio nucleo familiare.
Le aziende dovrebbero adottare procedure interne di verifica per tutte le richieste sensibili, come l’autorizzazione di bonifici bancari. Anche gli utenti privati dovrebbero sensibilizzare amici e familiari, in particolare le persone anziane, su come riconoscere i segnali tipici di un tentativo di truffa. - Formare dipendenti e familiari.
Aziende e imprese dovrebbero adottare procedure interne di verifica per richieste sensibili, come bonifici bancari. Anche gli utenti privati dovrebbero sensibilizzare amici e familiari, soprattutto gli anziani, su come identificare i segnali di un tentativo di truffa. - Non rispondere a telefonate sospette.
Se si riceve una chiamata da un numero sconosciuto, è bene non parlare né fornire alcuna risposta: potrebbe trattarsi di un tentativo da parte dei cybercriminali di registrare una clip vocale. In questi casi è preferibile riagganciare immediatamente e, se si ha il sospetto fondato di un’attività fraudolenta, segnalare il numero alle autorità competenti.
È importante tenere a mente che la verifca umana resta sempre la prima linea di difesa contro le minacce informatiche. Infatti, in molti casi basta un semplice controllo per evitare di subire conseguenze anche molto gravi.



