Fase Nomination: lascia il tuo voto agli Italian Security Awards 2026
Modelli in valutazione di OpenAI, Anthropic e Meta hanno raggiunto sistemi di produzione reali eludendo il contenimento nei test. Un ransomware ha operato in piena autonomia una volta avviato da un umano.
Alcuni modelli AI ancora in fase di valutazione interna presso OpenAI, Anthropic e Meta, durante test interni sono sfuggiti ai sistemi di contenimento; nello stesso periodo, un affiliato di un gruppo ransomware ha portato a termine un'estorsione lasciando che fosse il modello a gestire in autonomia l'intero attacco. La buona notizia è che l’uso dell’IA da parte degli attaccanti è ancora acerbo e si basa su tecniche e modelli non all’avanguardia, sebbene bisogna prestare attenzione perché il divario si sta riducendo. Questi e altri dati sono pubblicati da Check Point Research nel nuovo report AI Threat Landscape Digest, relativo al bimestre luglio e agosto 2026.
Il caso più eclatante è quello ormai chiacchieratissimo di Hugging Face. Un modello di OpenAI confinato in quello che avrebbe dovuto essere un ambiente di test isolato, collegato solo a un proxy interno, ha individuato e sfruttato in autonomia una vulnerabilità sconosciuta del proxy stesso per uscire dal contenimento e raggiungere i sistemi di produzione. Per farlo il modello ha eseguito circa 17.600 passaggi. Il caso ha creato molto allarmismo, ma si è ridimensionato appena si è capito che l'ambiente di valutazione di Anthropic era stato lasciato accessibile per errore.
Meta ha subìto un'esposizione simile, causata da una configurazione errata di un valutatore terzo. L'AI Security Institute del Regno Unito ha segnalato 19 azioni non autorizzate su 122 esecuzioni controllate, tra cui il caso di un agente che ha creato identità false nel tentativo di convincere un vero manutentore open source ad approvare codice malevolo.

Sul fronte criminale, Gambit Security ha documentato che un affiliato del servizio di ransomware The Gentlemen ha utilizzato Claude Code contro almeno sei organizzazioni, selezionando deliberatamente un modello più vecchio e meno vincolato. Ogni volta che l'autorizzazione veniva rifiutata, l'affiliato apriva una nuova sessione per confermarla, lasciando poi che fosse il modello a eseguire l'intrusione in autonomia. Lo stesso gruppo aveva già mostrato in comunicazioni interne analizzate dai ricercatori di preferire strumenti AI commerciali cinesi meno vincolati.
Una campagna separata, denominata JADEPUFFER, è andata oltre. È stata documentata come il primo caso di ransomware agentico, in cui un'intera operazione di estorsione è stata portata avanti dal modello dall'inizio alla fine senza che un essere umano la avviasse.
Gli episodi riassunti nel report confermano la tendenza già ben nota dell’AI come componente sempre più presente nelle catene di attacco. Un’altra tendenza è l’erosione della barriera di competenza che un tempo separava gli attaccanti più capaci dal resto. Intorno all'accesso all'AI si è consolidato un mercato criminale organizzato su più livelli. Il furto delle credenziali resta il primo passo, seguito dalla rivendita e dal packaging, ovvero l'integrazione dell'accesso in strumenti già pronti all'uso. Non solo: gli attaccanti oggi cercano continuità operativa dei servizi AI e per questo stanno imparando a manipolare il processo decisionale dell'AI. Va da sé che la sfida di sicurezza si sposta dalla protezione dei sistemi alla protezione del giudizio delle AI.
Un altro dato che emerge è che il divario tra le capacità all'avanguardia e il loro impiego da parte dei criminali si sta comprimendo e nulla suggerisce che il ritmo rallenterà. Accesso, conformità e autonomia sono ormai beni separati sul mercato criminale, quindi il comportamento di sicurezza intrinseco di un modello non costituisce più il vincolo determinante contro l'uso improprio.
Sull’altro fronte, ossia quello delle aziende che si devono difendere, c’è molto lavoro da fare. Nel periodo in esame, una richiesta su 36 inviate agli strumenti di AI generativa presentava un rischio elevato di fuga di dati sensibili, e l'88% delle organizzazioni aveva registrato almeno una richiesta ad alto rischio. Su base annua, la quota di prompt ad alto rischio è raddoppiata. Le difese attuali riescono ancora a intercettare la maggior parte degli attacchi basati sull'AI, ma solo perché le tecniche restano familiari e gli strumenti sono ancora soggetti a errori; gli incidenti di laboratorio mostrano che entrambe le condizioni stanno iniziando a cambiare. I tempi di reazione pensati per attaccanti umani non tengono più il passo con un modello che agisce in pochi minuti.
Esplora altri articoli su questi argomenti
Se questo articolo ti è piaciuto e vuoi rimanere sempre informato
22-09-2026
22-09-2026
22-09-2026
21-09-2026