L'ANALISI TECNICA

Frode a Fideuram, persi 36 milioni: con l’AI la voce non basta più a verificare l’identità


Indirizzo copiato

WhatsApp, e-mail e una voce che avrebbe imitato quella di un professionista conosciuto: così sarebbero stati disposti trasferimenti per 95 milioni da Fideuram, di cui una buona parte già recuperati. Il caso mostra come l’AI e i deepfake rendano più credibile la CEO fraud e perché oggi riconoscere una voce non basti più ad autenticare un ordine

Pubblicato il 25 set 2026

Dario Fadda

Research Infosec, fondatore Insicurezzadigitale.com



AI Questions Icon
Chiedi all'AI
Riassumi questo articolo
Approfondisci con altre fonti
Frode Banca Fideuram




Circa 95 milioni di euro trasferiti, 36 dei quali ancora da recuperare, dopo una richiesta urgente apparentemente proveniente dai vertici del gruppo bancario, una conversazione con una voce che avrebbe imitato quella di un professionista conosciuto e una serie di e-mail costruite per rendere credibile l’operazione. È la frode che nel febbraio 2026 ha coinvolto Fideuram e il suo presidente di allora, Paolo Molesini.

La vicenda, emersa pubblicamente soltanto mesi dopo, è interessante non perché introduca una tecnica di attacco completamente nuova. WhatsApp, telefonate, e-mail, urgenza e impersonificazione appartengono da tempo al repertorio del social engineering. A cambiare è la capacità dell’intelligenza artificiale di rendere più credibile uno degli elementi che fino a poco tempo fa potevano spezzare l’inganno: la voce.

È probabilmente questa la lezione più importante del caso Fideuram. L’AI non avrebbe sostituito le tecniche tradizionali di frode, ma le avrebbe integrate in una catena costruita attraverso conoscenza dell’organizzazione, relazioni di fiducia e diversi canali apparentemente indipendenti.

Il risultato è una sorta di “autenticazione artificiale”: ogni elemento sembra confermare quello precedente, mentre tutti possono appartenere alla stessa scenografia costruita dall’attaccante.

Frode ai danni di Fideuram: la ricostruzione dei fatti

Secondo le ricostruzioni disponibili, Molesini riceve un messaggio WhatsApp apparentemente proveniente da Carlo Messina, amministratore delegato della capogruppo Intesa Sanpaolo, con una richiesta relativa a un’operazione finanziaria urgente da effettuare attraverso la tesoreria di Fideuram.

Poco dopo entra nella storia una seconda identità: qualcuno che appare essere Paolo Nastasi, managing partner italiano dello studio legale internazionale A&O Shearman, completamente estraneo alla vicenda ma conosciuto dalla vittima. Il contatto, questa volta, avviene anche attraverso la voce, che secondo quanto emerso, sarebbe stata riprodotta utilizzando uno strumento di intelligenza artificiale, noto anche come deepfake. Alla comunicazione si aggiungono poi e-mail costruite per apparire provenienti dallo studio legale e contenenti le coordinate delle società e dei conti sui quali effettuare i pagamenti.

Il risultato dà la misura dell’efficacia dell’operazione. Vengono disposti trasferimenti per circa 95 milioni di euro, prevalentemente verso Cina e Hong Kong. I successivi controlli consentono di recuperare una parte consistente delle somme: circa 40 milioni vengono restituiti da una banca cinese, mentre altri 13 milioni vengono bloccati in Portogallo nell’ambito dell’indagine coordinata dalla Procura di Milano.

Rimangono da recuperare almeno 36 milioni che, secondo le ricostruzioni investigative, sarebbero passati attraverso ulteriori movimenti e sarebbero stati infine convertiti in criptovalute.

Come è stata strutturata la frode ai danni di Fideuram

Prima viene stabilita l’autorità attraverso l’apparente messaggio del vertice della capogruppo; poi viene introdotto un contesto plausibile, quello di un’operazione finanziaria urgente e riservata; successivamente compare una seconda persona conosciuta dalla vittima, che sembra confermare quanto raccontato; infine arrivano e-mail e coordinate bancarie coerenti con l’intera storia.

Il risultato è una sorta di catena di autenticazione artificiale nella quale ogni elemento sembra fornire conferma a quello precedente.

È proprio qui che il social engineering contemporaneo compie un salto di qualità. Falsificare un’e-mail è relativamente facile, sostenere la stessa identità durante una conversazione telefonica molto meno.

Quando, però, l’attaccante può controllare contemporaneamente il messaggio, la posta elettronica, il numero utilizzato per il contatto e perfino la voce di una delle persone coinvolte, quelle che sembrano verifiche indipendenti rischiano di diventare soltanto componenti differenti della stessa scenografia.

La minaccia crescente del voice cloning

Non è noto pubblicamente quale sistema sia stato utilizzato nel caso Fideuram, né quale materiale audio sia servito agli aggressori per riprodurre la voce attribuita a Nastasi. Sarebbe quindi scorretto sostenere che la voce sia stata ricavata da una particolare intervista o da un video pubblico.

Quello che sappiamo, però, è che una simile procedura è ormai perfettamente compatibile con le capacità dei sistemi contemporanei di voice cloning.

Fino a pochi anni fa, ottenere una replica credibile di una voce richiedeva una quantità considerevole di registrazioni, competenze specialistiche e un lavoro di post-produzione non banale.

I moderni sistemi di zero-shot e few-shot voice cloning hanno drasticamente abbassato questa soglia. Progetti di ricerca come OpenVoice mostrano come sia possibile partire da un campione relativamente breve per estrarre caratteristiche riconoscibili della voce e utilizzarle nella generazione di nuove frasi, intervenendo anche su ritmo, intonazione, pause ed emozione.

Come viene sfruttata la tecnica del voice cloning

Non significa, ancora una volta, che proprio OpenVoice sia stato utilizzato in questo caso; significa che capacità un tempo riservate a laboratori specializzati sono oggi disponibili attraverso software, servizi commerciali e progetti open source accessibili a una platea enormemente più ampia.

Per dirigenti, professionisti e personaggi con una certa esposizione pubblica questo introduce un problema ulteriore. Il materiale necessario a costruire la loro voce artificiale potrebbe non dover essere rubato: potrebbe essere già pubblicamente disponibile.

Conferenze aziendali, webinar, podcast, interviste televisive, interventi durante eventi, presentazioni agli investitori, video su YouTube e contenuti pubblicati sui social costituiscono un archivio potenzialmente enorme di campioni audio.

Un’attività OSINT che in passato serviva principalmente a ricostruire organigrammi, relazioni professionali e informazioni utili a confezionare un buon phishing può quindi trasformarsi anche nella fase preparatoria di un attacco vocale.

L’attaccante può studiare attraverso LinkedIn chi occupa determinate posizioni, leggere comunicati stampa per comprendere quali studi legali o consulenti lavorino con un’organizzazione, osservare interviste e conferenze per raccogliere materiale vocale e utilizzare informazioni pubbliche per rendere plausibile la conversazione.

L’esperimento di voice cloning condotto dall’FBI

L’FBI ha mostrato in maniera piuttosto efficace quanto questa barriera tecnologica si sia abbassata.

In un esperimento divulgato dall’agenzia, partendo dal video pubblico su YouTube di un proprio esperto, un collaboratore è riuscito a realizzarne una voce sintetica utilizzando strumenti open source e commerciali, con un investimento di tempo e denaro estremamente contenuto.

Il risultato non aveva bisogno di essere indistinguibile dall’originale: era sufficiente che fosse abbastanza credibile da funzionare nel contesto di una conversazione. Ed è probabilmente questo uno degli aspetti più sottovalutati del voice cloning applicato alle frodi.

Una telefonata, infatti, è già un ambiente favorevole all’imperfezione. La compressione audio, la qualità della rete, il rumore ambientale, le pause e una conversazione relativamente breve possono nascondere alcune anomalie della sintesi.

Se poi la vittima ha appena ricevuto un messaggio apparentemente autentico, conosce la persona che pensa di avere dall’altra parte e si aspetta quella telefonata, entra in gioco anche un potente meccanismo cognitivo: il cervello possiede già una spiegazione per ciò che sta ascoltando.

Il problema tecnologico che non si risolve comprando tecnologia

Il caso apre però anche una questione meno comoda per le organizzazioni. La cyber security aziendale continua spesso a essere considerata un problema prevalentemente tecnico, da delegare all’IT, al SOC o al responsabile della sicurezza, mentre dirigenti, amministratori e figure non tecniche vengono coinvolti soprattutto attraverso corsi periodici di awareness.

Eppure, proprio le persone che occupano le posizioni più elevate possono rappresentare obiettivi particolarmente appetibili, perché dispongono dell’autorità necessaria per imprimere urgenza a una richiesta, autorizzare operazioni eccezionali o mettere in movimento altre persone all’interno dell’organizzazione.

La posizione gerarchica non coincide necessariamente con la preparazione digitale. Un dirigente può possedere decenni di esperienza finanziaria, conoscere perfettamente il proprio settore e amministrare organizzazioni estremamente complesse senza avere una conoscenza altrettanto approfondita delle possibilità offerte oggi dalla sintesi vocale, dai deepfake o dalle tecniche avanzate di impersonificazione.

Lo stesso vale, naturalmente, per avvocati, amministratori pubblici, medici, responsabili finanziari e professionisti di qualsiasi altro settore. Non si tratta di chiedere a ogni manager di diventare un esperto di machine learning, ma di riconoscere che una parte delle competenze necessarie a svolgere ruoli con grandi responsabilità economiche passa ormai anche dalla comprensione del rischio digitale.

Questo divario diventa particolarmente pericoloso perché molte delle nostre abitudini di sicurezza derivano da un mondo tecnologico che non esiste più. Per una persona che non segue quotidianamente l’evoluzione della cyber security può essere ancora perfettamente razionale pensare che riconoscere la voce di un conoscente costituisca una conferma della sua identità.

Ed è qui che emerge un paradosso frequente nella sicurezza aziendale: si possono investire milioni in EDR, SIEM, autenticazione multifattore, segmentazione delle reti e sistemi antifrode, per poi lasciare che una decisione da decine di milioni di euro venga influenzata da una conversazione su WhatsApp e da una voce riconosciuta telefonicamente.

Non perché gli strumenti tecnici siano inutili, ma perché l’attaccante può decidere di non affrontarli affatto.

Se è più semplice convincere una persona autorizzata a eseguire legittimamente l’operazione, compromettere tecnicamente l’infrastruttura diventa persino superfluo.

Il caso Fideuram dimostra che la vulnerabilità è il processo

Una voce clonata, da sola, non sposta 95 milioni di euro. A spostarli è un processo organizzativo nel quale quella voce riesce a inserirsi e ad acquisire credibilità. L’attacco attraversa messaggistica istantanea, telefono, posta elettronica, relazioni personali e infine procedure finanziarie reali.

L’aggressore non ha necessariamente bisogno di violare il sistema bancario: gli basta riuscire a entrare nella catena attraverso la quale vengono prese decisioni autentiche.

Il perimetro della cyber security, di conseguenza, non può più coincidere soltanto con endpoint, account, server e reti. Deve comprendere anche i meccanismi attraverso i quali un’organizzazione decide che un ordine sia autentico.

Europol descrive da tempo nelle CEO fraud schemi basati proprio sull’impersonificazione di un dirigente, sulla richiesta urgente e riservata e sull’eventuale intervento di una seconda persona o di comunicazioni apparentemente indipendenti per rafforzare la storia.

Cosa impariamo dalla frode a Fideuram

L’intelligenza artificiale non ha inventato questa forma di criminalità: ne ha semplicemente eliminato uno dei punti deboli storici, cioè la difficoltà di mantenere l’impersonificazione quando la vittima decide di parlare direttamente con la persona che crede di avere davanti.

Per questo anche il tradizionale consiglio di “telefonare per verificare” deve essere aggiornato. Una verifica out-of-band funziona soltanto quando il secondo canale è realmente indipendente dal primo.

Chiamare un numero ricevuto nel messaggio sospetto non significa verificare nulla; rispondere a un indirizzo fornito dallo stesso interlocutore non costituisce una conferma; persino parlare con una seconda persona indicata dal primo soggetto può diventare parte dell’inganno.

Per operazioni particolarmente sensibili occorrono invece directory aziendali conosciute in precedenza, numeri verificati indipendentemente, sistemi di approvazione autenticati e procedure che impediscano all’urgenza dichiarata da un dirigente di sostituirsi ai controlli previsti.

Potremmo quasi parlare di una forma di zero trust applicata alle relazioni umane: non nel senso di trasformare ogni rapporto professionale in una relazione di sospetto, ma nell’accettare che voce, volto, numero telefonico, fotografia e stile di scrittura non possano più essere considerati da soli prove sufficienti di identità.

L’identità percepita e quella autenticata stanno diventando due cose differenti.

Serve anche una preparazione digitale adeguata al livello di responsabilità delle persone, soprattutto quando queste dispongono dell’autorità necessaria per muovere denaro, dati o infrastrutture.

La cyber security awareness non dovrebbe essere considerata un adempimento annuale uguale per tutti, ma una competenza proporzionata al rischio associato al ruolo: chi può autorizzare un’operazione da milioni di euro dovrebbe conoscere almeno altrettanto bene le nuove forme di impersonificazione quanto conosce le procedure finanziarie che è chiamato ad approvare.

Partecipa alla community

guest

0 Commenti
Più recenti
Più votati
Inline Feedback
Vedi tutti i commenti

Articoli correlati

0
Lascia un commento, la tua opinione conta.x