Quattro secondi, una frase pronunciata due volte, “Io sono Giorgia Meloni” e una domanda depositata presso l’Ufficio dell’Unione europea per la proprietà intellettuale. La presidente del Consiglio ha scelto un marchio sonoro per aggiungere una tutela legale contro uno dei rischi emergenti dell’intelligenza artificiale generativa: la clonazione della propria voce, il cosiddetto voice cloning.
La domanda presentata il 5 ottobre risulta ancora “oggetto di esame” e riguarda tre categorie di prodotti e servizi che comprendono contenuti multimediali scaricabili, attività culturali e organizzazione di manifestazioni politiche. La notizia, anticipata da Repubblica, è stata confermata da fonti di Palazzo Chigi.
Per la cyber security, però, il significato del caso supera la questione della proprietà intellettuale. Una voce pubblicamente disponibile in centinaia di ore di registrazioni può diventare materia prima per sistemi di sintesi vocale capaci di attribuire a una persona parole mai pronunciate. E quando quella persona è un capo di governo, un ministro, un CEO o un dirigente con poteri autorizzativi, il deepfake smette di essere soltanto un falso audiovisivo: può trasformarsi in un vettore di attacco.
Il punto è quindi più ampio: nell’era dell’AI generativa, riconoscere una voce non equivale più ad avere autenticato chi sta parlando.
Indice degli argomenti
“Io sono Giorgia Meloni”: cosa è stato realmente depositato
La prima distinzione è giuridica, ma ha conseguenze anche sulla valutazione del rischio cyber.
Meloni non ha registrato una tecnologia capace di impedire che un modello di AI apprenda o replichi la sua voce. Ha presentato una domanda per un marchio sonoro dell’Unione europea.
Secondo la documentazione dell’Euipo sui marchi sonori, questa tipologia di marchio è costituita esclusivamente da un suono o da una combinazione di suoni e può essere rappresentata attraverso un file audio. Nel caso della presidente del Consiglio, la domanda utilizza una registrazione di circa quattro secondi.
È quindi opportuno evitare un equivoco: il deposito non crea una barriera tecnica contro il voice cloning e non significa che qualsiasi futura imitazione della voce di Meloni ricadrà automaticamente nell’ambito della tutela del marchio.
Il marchio identifica uno specifico segno sonoro e la sua protezione opera nel perimetro giuridico definito dalla registrazione e dai prodotti e servizi interessati. La stessa Euipo ricorda che la domanda deve indicare i beni e i servizi che il marchio intende coprire.
La mossa della Premier aggiunge, dunque, un possibile strumento di tutela e contrasto agli utilizzi non autorizzati, ma non risolve il problema tecnologico.
Ed è proprio questa distanza tra tutela dell’identità e replicabilità tecnica dell’identità a rendere interessante il caso.
Deepfake vocali: la voce diventa un attributo compromettibile
Per anni abbiamo considerato la voce un segnale relativamente affidabile dell’identità.
Riconoscere al telefono un amministratore delegato, un collega o un familiare costituiva implicitamente una forma di verifica. L’AI generativa indebolisce questa associazione perché permette di separare la voce dalla persona che l’ha prodotta.
Il risultato è paragonabile, per certi versi, a ciò che la cyber security ha già sperimentato con altri attributi identificativi.
Il numero visualizzato sul telefono non dimostra l’identità del chiamante perché può essere falsificato. Un indirizzo email apparentemente corretto può essere oggetto di spoofing o provenire da un account compromesso. Una password può essere sottratta.
Adesso anche la voce deve essere considerata replicabile e quindi non affidabile come fattore autonomo di autenticazione.
Il problema diventa particolarmente serio per i personaggi pubblici. Un politico, un manager o una celebrità offre involontariamente enormi quantità di materiale audio attraverso interviste, conferenze, podcast, video e social network.
L’attaccante non deve necessariamente rubare un campione vocale: può trovarlo pubblicamente.
E per un clone credibile bastano, indicativamente, una decina di secondi di audio. Di un leader politico esistono ore di registrazioni pubbliche, e quel «Io sono Giorgia» è stato ripreso, campionato, remixato e trasformato in meme e canzoni. Il materiale di partenza è ovunque, e nessun marchio lo ritira dalla circolazione.
Il vettore, poi, non è più solo la telefonata. Le frodi passano per videoconferenze, messaggi vocali, segreterie e video sintetici affiancati all’audio. Il caso dell’azienda di Hong Kong, spogliata di oltre 25 milioni di dollari dopo una videoconferenza deepfake, mostra la scala possibile.
Dalla disinformazione al vishing: cosa può fare un attaccante con una voce clonata
Il primo scenario associato al caso Meloni è naturalmente la disinformazione.
Un audio sufficientemente credibile potrebbe attribuire a un capo di governo dichiarazioni mai pronunciate su una crisi internazionale, una decisione politica, un provvedimento economico o un evento di sicurezza.
La caratteristica più pericolosa di questo tipo di contenuto è la velocità.
Un deepfake non deve necessariamente resistere per giorni alle verifiche dei fact checker. In alcuni scenari può essere sufficiente che venga considerato autentico per pochi minuti e circoli attraverso social network, piattaforme di messaggistica o canali informativi prima della smentita.
Più delicato ancora è l’utilizzo mirato.
Un falso messaggio vocale non deve convincere milioni di cittadini. Può essere costruito per persuadere una singola persona.
L’audio, dunque, diventa il formato ideale per l’inganno: costa poco, circola su canali chiusi dove la moderazione arriva tardi e non offre indizi visivi da smascherare. Un falso diffuso nelle ore precedenti a un voto può orientare percezioni prima che arrivi qualunque smentita.
E la mossa della Premier Meloni si ricollega direttamente alla campagna elettorale che si avvicina e al timore di una possibile guerra ibrida condotta da Mosca.
Quando il deepfake diventa social engineering
È qui, dunque, che voice cloning e cyber security convergono direttamente.
Nel 2023, la storia della telefonata tra la nostra premier Meloni e un noto duo comico russo fece alzare le antenne agli esperti di cyber security. Dietro quello che sembrava un semplice scherzo, c’era tanto della classica sapienza da social engineering che i criminali, ma anche gli Stati-nazione, adoperano nello spazio cyber per ottenere informazioni riservate.
Per comprendere ancora meglio il rischio basta tornare al febbraio 2025. Una voce clonata del ministro della Difesa Guido Crosetto contattò grandi imprenditori sostenendo che servissero fondi urgenti per liberare giornalisti italiani detenuti all’estero. Secondo le ricostruzioni, Massimo Moratti versò quasi un milione di euro, poi bloccato dalla Procura di Milano su un conto olandese.
Il bersaglio non era il ministro, ma chi si fidava di lui. È lo schema di autorità e urgenza del CEO fraud, con la voce al posto dell’email: nessun exploit, solo ingegneria sociale potenziata da un modello generativo.
Ancora, nel maggio 2025 l’FBI ha segnalato una campagna di impersonation nella quale attori malevoli utilizzavano messaggi di testo e messaggi vocali generati dall’AI fingendosi alti funzionari statunitensi. L’obiettivo era stabilire un rapporto di fiducia con le vittime per ottenere successivamente accesso ad account e informazioni.
Un successivo aggiornamento dell’FBI ha ricostruito attività risalenti almeno al 2023 nelle quali sono stati impersonati funzionari statali, membri dell’amministrazione della Casa Bianca, esponenti di governo e membri del Congresso.
Il modello di attacco è particolarmente interessante perché mostra che il deepfake vocale può essere soltanto un componente di una catena di social engineering.
L’attaccante può iniziare con uno SMS, spostare la conversazione su un’app di messaggistica cifrata e utilizzare successivamente una voce sintetica per rafforzare la credibilità dell’identità costruita.
In un contesto aziendale, la stessa tecnica può evolvere in una variante della tecnica di Business Email Compromise: il criminale non imita più soltanto l’indirizzo email del CEO, ma ne replica anche la voce.
CEO fraud e autorizzazioni: “ho riconosciuto la voce” non basta più
Immaginiamo una richiesta urgente attribuita all’amministratore delegato: autorizzare un bonifico, inviare un documento riservato, modificare le coordinate di pagamento di un fornitore o concedere temporaneamente un accesso.
Il successo dell’attacco dipende da due elementi tradizionali del social engineering: autorità e urgenza.
Il voice cloning aggiunge il terzo: la familiarità.
La vittima non riceve soltanto un ordine apparentemente proveniente dal proprio superiore. Ne riconosce il timbro, l’intonazione e potenzialmente persino alcune caratteristiche espressive.
L’FBI ha già avvertito che criminali informatici utilizzano tecniche di clonazione audio e video per impersonare familiari, colleghi e business partner con l’obiettivo di ottenere informazioni sensibili o autorizzare transazioni fraudolente.
Per questo motivo, le organizzazioni dovrebbero eliminare dai processi più sensibili qualunque presupposto secondo cui riconoscere la voce costituisca una verifica sufficiente dell’identità.
Un ordine ricevuto attraverso telefono, nota vocale o videoconferenza deve essere sottoposto agli stessi controlli previsti per qualsiasi altra richiesta potenzialmente compromessa.
Un falso audio politico può diventare anche un attacco cyber
Nel caso di un personaggio istituzionale il rischio assume, inoltre, una dimensione ulteriore.
La disinformazione può essere integrata all’interno di operazioni cyber più articolate.
Un attore ostile potrebbe utilizzare un falso audio come esca per campagne di phishing, accompagnandolo con collegamenti a presunti documenti, comunicati o video integrali. La curiosità generata da una dichiarazione clamorosa diventerebbe così il meccanismo per indurre la vittima ad aprire una pagina malevola o scaricare un file.
La tecnica funziona anche nella direzione opposta: un account social o un sito istituzionale compromesso potrebbe diventare il canale attraverso cui distribuire un deepfake, conferendogli una credibilità iniziale molto maggiore.
In questi scenari, cyber attack e information operation smettono di essere fenomeni separati.
La compromissione tecnica fornisce autenticità apparente alla disinformazione; il contenuto sintetico aumenta l’efficacia dell’attacco informatico.
Per organizzazioni pubbliche, aziende strategiche e infrastrutture critiche, il threat modeling dovrebbe quindi considerare anche l’impersonation dei vertici attraverso contenuti sintetici.
Il problema opposto: se tutto può essere deepfake, anche il vero può essere negato
C’è poi una conseguenza meno intuitiva.
La diffusione dei deepfake non permette soltanto di far apparire vero qualcosa di falso. Rende più semplice sostenere che qualcosa di autentico sia falso.
È il fenomeno generalmente definito liar’s dividend (o «dividendo del bugiardo»): quando l’opinione pubblica sa che voce e immagini possono essere generate artificialmente, chi viene confrontato con una registrazione autentica può provare a screditarla sostenendo che è stata prodotta dall’AI.
Il danno è quindi bidirezionale.
Da una parte aumenta la capacità di fabbricare evidenze. Dall’altra diminuisce la fiducia nelle evidenze reali.
Per un personaggio politico questo problema riguarda l’integrità del dibattito pubblico. Per un’impresa può interessare registrazioni di riunioni, dichiarazioni di dirigenti, comunicazioni con clienti e fornitori o materiale utilizzato durante un incidente.
La questione non è più soltanto rilevare il falso. Diventa necessario dimostrare l’origine del vero.
L’AI Act obbliga a dichiarare i deepfake, ma l’attaccante non seguirà le regole
Sul piano normativo l’Unione europea ha già introdotto una risposta specifica.
L’articolo 50 dell’AI Act stabilisce che chi utilizza un sistema di AI per generare o manipolare immagini, audio o video che costituiscono un deepfake deve dichiarare che il contenuto è stato generato o manipolato artificialmente, fatte salve le eccezioni previste dal regolamento. Gli obblighi di trasparenza sono applicabili dal 2 agosto 2026.
La Commissione ha, inoltre, promosso un Codice di buone pratiche sulla trasparenza dei contenuti generati dall’AI, dedicato proprio a marcatura, labelling e individuazione dei contenuti sintetici.
E anche l’Italia, dallo scorso 10 ottobre 2025 dispone dell’articolo 612-quater del codice penale, introdotto dalla legge 132/2025: punisce con la reclusione da uno a cinque anni chi, causando un danno ingiusto, diffonde senza consenso immagini, video o voci alterati con l’IA e idonei a ingannare sulla loro genuinità. Il reato è a querela, ma si procede d’ufficio se il fatto è commesso contro una pubblica autorità a causa delle sue funzioni: per un presidente del Consiglio, la leva penale esiste già.
Sono strumenti importanti per costruire un ecosistema nel quale i contenuti AI legittimi possano essere riconosciuti.
Ma dal punto di vista cyber esiste un limite evidente: un criminale, un gruppo state-sponsored o un operatore impegnato in una campagna di disinformazione non etichetterà volontariamente il proprio deepfake.
La compliance può quindi aumentare la trasparenza dell’ecosistema legittimo, ma non sostituisce i meccanismi di autenticazione e rilevamento necessari contro un avversario intenzionalmente malevolo.
Dal rilevamento del falso alla provenienza del contenuto
È per questo che la risposta tecnologica non può dipendere esclusivamente dai deepfake detector.
Rilevare automaticamente un audio sintetico rimane utile, ma crea una competizione continua tra tecniche di generazione e tecniche di detection. All’aumentare della qualità dei modelli, gli artefatti utilizzati per riconoscere il falso possono diminuire o cambiare.
Per le comunicazioni ad alto impatto diventa quindi più interessante spostare parte della sicurezza verso la provenienza.
Invece di domandarsi soltanto se un file “sembri falso”, occorre poter verificare da dove proviene, chi lo ha pubblicato e se la sua integrità sia stata preservata.
Per istituzioni e aziende significa associare alle comunicazioni ufficiali canali verificati, firme digitali dove applicabili, processi di pubblicazione controllati e procedure di risposta già predisposte nel caso in cui compaia un contenuto sintetico attribuito ai vertici.
La velocità della smentita conta, ma conta ancora di più la possibilità per giornalisti, dipendenti, partner e cittadini di raggiungere rapidamente una fonte autentica riconoscibile.
Per le aziende il voice cloning deve entrare nelle procedure antifrode
Il caso Meloni contiene, infine, una lezione immediatamente applicabile alle imprese.
Un’organizzazione dovrebbe partire dal presupposto che voce e immagine di CEO, CFO e altri dirigenti possano essere replicate.
Da questo assunto discende una modifica dei processi, prima ancora dell’acquisto di nuovi strumenti.
Le richieste che comportano bonifici, variazioni delle coordinate bancarie, rilascio di credenziali, trasferimento di informazioni riservate o modifiche ai privilegi devono prevedere verifiche out-of-band attraverso un canale indipendente. Un dipendente che riceve una nota vocale dal CEO non dovrebbe richiamare il numero indicato nel messaggio, ma utilizzare un contatto già conosciuto e verificato.
Per le operazioni più sensibili è opportuno applicare la separazione dei compiti e un secondo livello di approvazione.
Anche la formazione deve cambiare. Dire ai dipendenti di “ascoltare se la voce sembra artificiale” diventa progressivamente meno efficace. La procedura deve funzionare anche quando il deepfake è perfetto.
È lo stesso principio applicato al phishing moderno: la sicurezza non può dipendere dalla capacità dell’utente di individuare ogni inganno.
Il marchio di Meloni segnala un cambiamento più grande
La domanda presentata da Giorgia Meloni all’Euipo non fermerà tecnicamente un modello capace di clonarne la voce. Può però aggiungere uno strumento giuridico per reagire agli utilizzi non autorizzati di uno dei tratti più riconoscibili della sua identità pubblica.
Ed è proprio questa necessità a mostrare quanto sia cambiato il problema.
La voce è sempre stata copiabile da un imitatore. L’AI cambia costo, velocità, scala e accessibilità della replica, consentendo di inserire una voce sintetica all’interno di campagne automatizzate, personalizzate e potenzialmente multimodali.
Per politici e personaggi pubblici significa affrontare il rischio della disinformazione e dell’impersonation. Per le aziende significa rivedere procedure antifrode e meccanismi autorizzativi. Per la cyber security significa allargare ancora una volta il concetto di identità digitale.
Password, token e account non sono più gli unici attributi che un attaccante può sottrarre o imitare.
Anche volto e voce sono diventati segnali compromettibili.
La conseguenza operativa è netta: un sistema sicuro non dovrebbe più chiedersi semplicemente “riconosco questa persona?”, ma “posso verificare attraverso un secondo elemento indipendente che sia davvero lei?”.
Nell’era dei deepfake, è questa la differenza tra riconoscimento e autenticazione.















Partecipa alla community