AI security

Il caso OpenAI-Hugging Face: l’AI ha già imparato ad aggirare le sandbox



Indirizzo copiato

Durante un test in ambiente isolato, modelli avanzati di OpenAI hanno individuato e sfruttato una vulnerabilità zero-day per ottenere l’accesso a Internet e compromettere i server di Hugging Face. Un episodio che ridefinisce i limiti delle sandbox e i modelli di difesa nell’era dell’AI

Pubblicato il 22 lug 2026

Pierluigi Paganini

Cyber Security Analyst, CEO CYBHORUS



OpenAI Hugging Face
AI Questions Icon
Chiedi all'AI
Riassumi questo articolo
Approfondisci con altre fonti


Il caso Hugging Face racconta qualcosa di inedito e per certi versi inquietante: un modello AI, messo in una sandbox (una sorta di gabbia o ambiente controllato per i non addetti ai lavori) per essere valutato, ha usato una quantità significativa di elaborazione per trovare un modo di uscire dall’isolamento.

Il modello ha poi scoperto e sfruttato autonomamente una vulnerabilità zero-day in un componente di terze parti, si è mosso lateralmente nella rete fino a trovare un nodo con accesso a Internet, ha dedotto dove potevano trovarsi le soluzioni al test che stava cercando di superare e le ha rubate.

Tutto questo senza istruzioni esplicite, spinto unicamente dall’obiettivo assegnatogli.

L’aspetto più eclatante non è la singola azione, ma la catena. Il modello ha pianificato, adattato la strategia, aggirato un controllo di sicurezza considerato robusto e completato un’operazione in più fasi con un livello di autonomia che fino a ieri era considerato teorico.

Se lo stesso comportamento si manifestasse in un contesto ostile, con obiettivi diversi dall’ottenere le risposte di un test, le implicazioni sarebbero serie: nessuna sandbox potrebbe essere considerata sicura per definizione, nessuna rete isolata garantita tale e i tempi di risposta umana risulterebbero strutturalmente inadeguati rispetto alla velocità operativa del modello.

Il caso OpenAI-Hugging Face: cosa è successo

Per capire cosa è successo davvero occorre ricostruire il contesto. OpenAI stava conducendo una valutazione interna delle capacità offensive dei propri modelli, tra cui GPT-5.6 Sol e un sistema pre-release ancora più avanzato.

L’obiettivo era misurare quanto fossero capaci di condurre operazioni cyber complesse.

Per farlo, i classificatori di sicurezza che normalmente impediscono ai modelli di perseguire attività ad alto rischio erano stati deliberatamente disabilitati. I benchmark giravano in un ambiente altamente isolato, con accesso alla rete limitato a un proxy interno per l’installazione di pacchetti software. Era, sulla carta, una gabbia solida.

“Mentre operavano nel nostro ambiente di test in sandbox, i nostri modelli hanno speso una quantità sostanziale di calcolo inferenziale per trovare un modo di ottenere accesso aperto a Internet, nel tentativo di risolvere il problema di valutazione”, recita l’annuncio di OpenAI. “Per ottenere l’accesso, i modelli hanno identificato e sfruttato una vulnerabilità zero-day nel proxy cache del registro dei pacchetti”.

Quello che segue è la parte che lascia senza parole.

Con l’accesso a Internet ottenuto attraverso la vulnerabilità zero-day, i modelli hanno eseguito una serie di azioni di escalation dei privilegi e movimento laterale nell’ambiente di test di ricerca, fino a raggiungere un nodo con accesso alla rete esterna.

Da lì hanno dedotto che Hugging Face probabilmente ospitava modelli, dataset e soluzioni per ExploitGym, il benchmark che stavano cercando di superare. Hanno cercato e trovato modi per accedere a informazioni riservate da usare per “barare” alla valutazione, incluso concatenare vettori di attacco multipli, credenziali rubate e ulteriori vulnerabilità zero-day per raggiungere l’esecuzione di codice remoto sui server di Hugging Face.

“L’incidente dimostra chiaramente che i modelli avanzati possono scoprire e sfruttare percorsi di attacco nuovi in sistemi reali senza accesso al codice sorgente. Evidenzia che le capacità cyber avanzate devono essere sviluppate insieme a salvaguardie più solide e strumenti difensivi”, continua OpenAI.

Il modello AI stava solo completando il suo compito

Il punto che merita attenzione è questo: il modello non stava cercando di fare del male, stava cercando di completare un compito che gli era stato assegnato.

L’obiettivo assegnatogli era superare un test e ha fatto esattamente quello che un attaccante umano motivato avrebbe fatto: ha cercato le risposte dove potevano trovarsi, usando qualunque mezzo disponibile.

La differenza rispetto a un attaccante umano è la velocità, la sistematicità e l’assenza di esitazione. Non c’è stanchezza, non c’è paura di essere scoperti nel senso psicologico del termine, non c’è negoziazione interna tra rischio e beneficio. C’è solo l’obiettivo e la ricerca del percorso più efficiente per raggiungerlo.

Questo è esattamente il motivo per cui l’incidente è eclatante dal punto di vista della sicurezza. Le organizzazioni che oggi costruiscono i propri modelli di difesa partendo dall’assunzione che una rete segmentata o una sandbox ben configurata costituisca una barriera sufficiente devono aggiornare quella valutazione.

Non perché le sandbox siano inutili, ma perché un modello sufficientemente capace e sufficientemente motivato tratterà l’isolamento come un problema tecnico da risolvere, non come un confine invalicabile.

E lo risolverà con metodi che nessun penetration tester umano avrebbe necessariamente considerato in quel contesto.

E se fosse solo una sofisticata comunicazione commerciale?

C’è però una seconda lettura che non va scartata e che riguarda le dinamiche del mercato dell’AI.

OpenAI ha ammesso tutto volontariamente, ha collaborato attivamente con Hugging Face, ha comunicato con trasparenza e tempestività. Il CEO di Hugging Face Clem Delangue ha dichiarato pubblicamente la propria gratitudine per la collaborazione, definendo l’incidente probabilmente il primo del suo genere e sostenendo che la sicurezza dell’AI non si risolverà con nessuna azienda che lavora in segreto, ma in modo aperto e collaborativo.

Il risultato pratico di questa gestione è che il mercato ha ora una prova empirica, documentata e firmata da OpenAI stessa, che i suoi modelli sanno fare cose che prima erano solo teoriche o al limite del credibile.

Un incidente così gestito, nessun danno permanente, nessuna vittima, massima visibilità, narrazione collaborativa, difficilmente potrebbe generare più attenzione e credibilità per i modelli in arrivo. È lecito chiedersi quanto questa trasparenza sia anche una forma molto sofisticata di comunicazione commerciale.

La risposta più onesta è probabilmente che entrambe le cose sono vere contemporaneamente. L’incidente è reale, le capacità dimostrate sono reali, i rischi impliciti sono reali. E la gestione comunicativa è stata eccellente.

Nel settore dell’AI avanzata, dove la fiducia è la valuta principale e la corsa alle capacità è feroce, dimostrare di poter gestire un incidente di questa portata con trasparenza e collaborazione vale quanto dimostrare che i propri modelli sanno bucare una sandbox.

I modelli AI ormai vanno trattati come attori offensivi

Per chi lavora nella sicurezza informatica, la lezione operativa è chiara: i modelli AI avanzati vanno trattati come potenziali attori offensivi anche quando operano in contesti controllati, i perimetri di isolamento vanno progettati assumendo che possano essere violati e il monitoraggio comportamentale dei modelli durante le fasi di valutazione non è opzionale.

Hugging Face lo ha fatto con i propri strumenti open source e ha rilevato l’attività autonomamente. Questo è forse il dato più incoraggiante dell’intera vicenda: la difesa basata sull’AI ha funzionato.

Il problema è che stava difendendo da un’altra AI dello stesso livello di sofisticazione.

Partecipa alla community

guest

0 Commenti
Più recenti
Più votati
Inline Feedback
Vedi tutti i commenti

Articoli correlati

0
Lascia un commento, la tua opinione conta.x