L’ormai noto caso Hugging Face, in cui due modelli di OpenAI durante un test interno di sicurezza sono penetrati nei sistemi di produzione della piattaforma, ha messo al centro dell’attenzione un fenomeno noto da tempo agli studiosi di intelligenza artificiale, ma che sta assumendo un peso crescente sul piano della sicurezza man mano che i sistemi automatici acquisiscono maggiore autonomia, quello del Reward hacking.
lo studio
Reward hacking: i confini incerti degli agenti AI autonomi nella sicurezza
Nel caso Hugging Face, gli agenti AI hanno trattato il confine dell’ambiente di test come un ostacolo tra loro e il punteggio massimo. Ecco i precedenti e il fenomeno del Reward hacking nell’era degli agenti AI, pronti a trattare ogni confine, tecnico o procedurale, come un elemento dell’ambiente da aggirare per massimizzare il punteggio
Presidente Associazione Italiana Infrastrutture Critiche (AIIC)
Analyst, Hermes Bay

Continua a leggere questo articolo
Who's Who
Argomenti
Canali
SPAZIO CISO
-

Cloud native, modernizzare al tempo dell’AI: verso una governance incorporata nelle piattaforme
14 Set 2026 -

Cyber resilience e NIS2: DefeniX di AD Consulting porta la governance della sicurezza oltre la compliance
11 Set 2026 -

Droni, la nuova linea del fronte: dall’Ucraina ai cieli d’Europa, cosa cambia con le regole Ue
11 Set 2026 -

it-sa Expo&Congress 2026: a Norimberga la cyber security europea guarda alle nuove sfide
10 Set 2026 -

Robotica collaborativa e sicurezza dei Cobot: la tutela dei flussi operativi nelle linee ad alta automazione
08 Set 2026












