il quadro

Agenti AI, il rischio è nel perimetro: cosa insegnano gli ultimi incidenti


Indirizzo copiato

Dalla fuga dalla sandbox al blocco di GPT-6.1 Astra, fra agosto e settembre si sono moltiplicati gli incidenti cyber. Ecco perché i casi degli Agenti AI di OpenAI e Anthropic costringono a spostare l’attenzione dal comportamento anomalo dei singoli modelli all’affidabilità del perimetro di training del modello

Pubblicato il 30 set 2026

Maria Beatrice Versaci

Analyst, Hermes Bay



AI Questions Icon
Chiedi all'AI
Riassumi questo articolo
Approfondisci con altre fonti
agenti AI attacco; Agenti AI, il rischio è nel perimetro: cosa insegnano gli ultimi incidenti




Gli incidenti che hanno coinvolto OpenAI, Anthropic e Hugging Face mostrano che il rischio degli agenti AI non dipende solo dalle capacità dei modelli, ma anche da ciò che l’ambiente consente loro di raggiungere. Isolamento, monitoraggio, gestione delle credenziali e minimo privilegio diventano così controlli essenziali.

I casi recenti, prima del blocco di GPT-6.1 Astra da parte di OpenAI

Il 29 settembre OpenAI ha rinunciato a GPT-6.1 Astra e sospeso il training dei modelli più avanzati, dopo aver scoperto nuovi incidenti con agenti autonomi. Per la prima volta un laboratorio di frontiera ha reso pubblico lo stop a un intero modello già pronto, invece di limitarsi a far slittare l’uscita o ad aggiustare il tiro durante il lancio.

L’episodio è solo il più recente di una sequenza che da luglio coinvolge i principali laboratori del settore, a partire dall’intrusione di OpenAI nei sistemi di Hugging Face e dai quattro incidenti individuati da Anthropic nelle proprie valutazioni di sicurezza informatica, mostrano una frequenza di incidenti simili, tale da spostare l’attenzione dal comportamento anomalo dei singoli modelli all’affidabilità del perimetro all’interno del quale il modello viene addestrato.

I fatti di settembre

Secondo quanto ricostruito, gli agenti di OpenAI hanno consultato dati pubblici del Census Bureau degli Stati Uniti d’America e informazioni
liberamente disponibili sui siti della Securities and Exchange Commission. Queste informazioni in particolare sono state poi pubblicate senza alcuna precedente indicazione su un altro sito.

In un episodio in cui sono stati coinvolti i sistemi del Dipartimento dell’Istruzione, invece, gli agenti hanno individuato chiavi API destinate agli sviluppatori, pur raccogliendo alla fine soltanto informazioni pubbliche.

Ma il tentivo di violazione del sito di un ufficio del personale del ministero statunitense è avvenuto mentre il governo australiano avviava un’indagine su un accesso non autorizzato di un agente sempre di OpenAI a un sito della sanità pubblica.

L’organizzazione di valutazione indipendente Transluce ha anche individuato un tentativo di intrusione non riuscito nello stesso sito, attribuendolo ad agenti che sembrerebbero provenire da OpenAI, l’azienda però non ha confermato.

Transluce ha segnalato anche ulteriori attività anomale verso altre agenzie federali e alcuni siti di singoli Stati, non tutte chiaramente riconducibili a
OpenAI. Intanto l’azienda ha precisato che la maggior parte delle attività esaminate riguarda normali compiti di ricerca, per i quali i modelli tendono a rivolgersi ai siti istituzionali in quanto fonti autorevoli.

Negli ultimi giorni Axios ha pubblicato uno scoop: sia OpenAI che Anthropic avrebbero iniziare a valutare internamente decine di migliaia di episodi dove i rispettivi modelli più evoluti hanno bypassato i sistemi di controllo agendo in modo autonomo e imprevisto. Cifre molto più elevate di quanto le due aziende avevano finora ammesso pubblicamente.

L’attacco ai siti statunitensi

Per quanto riguarda le conseguenze degli incidenti confermati, la SEC ha dichiarato che non è avvenuta la consultazione di alcuna informazione riservata. Inoltre il Dipartimento dell’Istruzione ha riferito di non aver riscontrato alcun impatto su sito e banche dati.
Anche in assenza di danni, il quadro emerso mostra un agente che, incaricato di reperire informazioni, utilizza le credenziali trovate nel corso della ricerca e diffonde i risultati in luoghi non previsti trattando, essenzialmente, tutto ciò che è raggiungibile come parte legittima del compito.

È la stessa logica emersa a luglio nel caso di Hugging Face e nei 4 incidenti che hanno coinvolto i modelli Anthropic, anche se nel caso di Hugging Face il
superamento del confine è avvenuto sfruttando una vulnerabilità ignota mentre in quello di Anthropic è venuto meno per un errore di configurazione umano.

In questo caso segnalato più di recente che ha coinvolto i siti governativi americani, invece, l’accesso a internet era previsto, ma l’agente lo ha usato in modi non richiesti. L’esito è comunque lo stesso.

Un sistema che persegue l’obiettivo assegnato considerando qualunque risorsa raggiungibile come parte del compito, sfruttando ciò che ha effettivamente a disposizione e agendo in base a quello che l’ambiente gli consente di fare.

Come mitigare i rischi

Gli spazi, in cui i modelli si addestrano e valutano, richiederebbero un trattamento come veri e propri sistemi da proteggere, con controlli sugli accessi alla rete, monitoraggio del traffico in uscita e verifiche periodiche della configurazione, allo stesso modo in cui si protegge un’infrastruttura di produzione.

L’ordine esecutivo di Trump

Sul piano politico, la vicenda cade in un momento di forte dibattito. Parlamentari ed esperti chiedono ai laboratori di rallentare lo sviluppo per costruire contromisure adeguate, e gli stessi vertici di OpenAI e Anthropic si sono espressi a favore di un rallentamento.

Nel corso di un incontro con il presidente cinese Xi Jinping, il presidente Usa Donald Trump ha concordato di condividere informazioni sui rischi dell’intelligenza artificiale e di coordinare gli sforzi per la sua sicurezza.

il 29 settembre Trump, dopo aver ribattezzato l’intelligenza artificiale «Super Intelligence» con un ordine esecutivo, ha reso noto l’accordo con le Big dell’AI per stabilire quattro livelli di controlli e audit, volontari e una supervisione indipendente.

Ma l’executive order non introduce nuovi obblighi di cyber sicurezza per OpenAI, Google, Anthropic, Meta o gli altri sviluppatori privati. L’intento di Trump consiste infatti nel trovare un equilibro fra l’opportunità di innovare liberamente, senza vincoli preventivi, e la possibilità di richiersta all’industria di realizzare in autonomia un sistema di controllo affidabile.

Invece di imporre regole statali ai modelli di frontiera, gli Usa cercano un sistema di auto-governance in grado di monitorare tecnologie che, al contempo, acquisiscono capacità ed autonomia.

Dal canto suo, OpenAI, oltre a disporre di ulteriori salvaguardie, ha dichiarato di aver messo in conto nuove pause future, dopo aver già pubblicato sei rapporti su comportamenti inattesi dei propri modelli e un quadro per individuarli, analizzarli e renderli noti.

Il quadro europeo

Per l’Europa il tema ha anche una dimensione normativa già definita. Il Regolamento europeo sull’intelligenza artificiale impone ai fornitori di modelli di uso generale con rischio sistemico di valutare e mitigare i rischi, di garantire un livello adeguato di protezione informatica del modello e della relativa infrastruttura e di tracciare, documentare e comunicare senza indebito ritardo gli incidenti gravi all’Ufficio europeo per l’IA e, se del
caso, alle autorità nazionali competenti.

Gli episodi di questi mesi offrono un banco di prova concreto per l’applicazione di questi obblighi, soprattutto per quanto riguarda gli ambienti di valutazione gestiti da soggetti terzi.

Agenti AI e rischio nel perimetro: gli aspetti positivi emersi finora

La trasparenza mostrata finora dai laboratori, che hanno reso pubbliche ricostruzioni dettagliate e avvisato le organizzazioni coinvolte, rappresenta un elemento positivo e utile all’intera comunità della sicurezza informatica.

Il passo successivo è rendere sistematico ciò che oggi avviene su base volontaria, con verifiche indipendenti sull’isolamento degli ambienti di test, procedure condivise tra laboratori e partner di valutazione e canali di notifica rapidi verso le organizzazioni che possono trovarsi, senza saperlo, sul percorso di un agente impegnato a completare il proprio compito.

Partecipa alla community

guest

0 Commenti
Più recenti
Più votati
Inline Feedback
Vedi tutti i commenti

Articoli correlati

0
Lascia un commento, la tua opinione conta.x