Un caso finito recentemente sulla stampa ha evidenziato come Claude 3.5 Sonnet, il modello di intelligenza artificiale sviluppato da Anthropic e generalmente noto per la sua affidabilità, possa essere aggirato per produrre contenuti razzisti e addirittura malware.
nuove minacce
Manipolazione emotiva: la tecnica che mette a nudo le vulnerabilità dei LLM
Nonostante la reputazione di modello AI sicuro, uno studente afferma che Claude 3.5 Sonnet può essere indotto a generare discorsi d’odio e malware attraverso tecniche di manipolazione emotiva. Ecco come funziona questa tecnica di “jailbreaking” e perché serve una chiamata all’azione per la sicurezza dell’AI
Esperto di AI Security, Consulente dell'Unione Europea

Continua a leggere questo articolo
Who's Who
Argomenti
Canali
SPAZIO CISO
-
![AD Consulting DefeniX]()
Cyber resilience e NIS2: DefeniX di AD Consulting porta la governance della sicurezza oltre la compliance
11 Set 2026 -
![Droni Ucraina Europa]()
Droni, la nuova linea del fronte: dall’Ucraina ai cieli d’Europa, cosa cambia con le regole Ue
11 Set 2026 -
![it-sa Expo&Congress 2026]()
it-sa Expo&Congress 2026: a Norimberga la cyber security europea guarda alle nuove sfide
10 Set 2026 -
![Robotica collaborativa]()
Robotica collaborativa e sicurezza dei Cobot: la tutela dei flussi operativi nelle linee ad alta automazione
08 Set 2026 -
![Sycophancy nell’AI; HAL 9000 e l’AI Act: la supervisione umana è solo un’illusione]()
Sycophancy nell’AI: quando l’algoritmo ci dà ragione anche se stiamo sbagliando
08 Set 2026








