Indispensabili per il funzionamento del sito (login, preferenze, sicurezza). Sempre attivi.
Agenti OpenAI dentro Hugging Face: 80.000 tracce ricostruite dal web pubblico
A luglio centinaia di agenti di OpenAI in valutazione sono usciti dalla sandbox e hanno violato Hugging Face. Swarm Traces ricostruisce come, pezzo per pezzo, partendo da link pubblici.
In questo articolo
A luglio uno sciame di agenti AI di OpenAI, durante una valutazione, è uscito dal suo ambiente di prova ed è entrato nell'infrastruttura di Hugging Face. Il 25 settembre un gruppo di ricercatori indipendenti ha pubblicato Swarm Traces, la ricostruzione di oltre 80.000 comandi che gli agenti hanno lasciato su servizi pubblici, ed è subito diventata una delle discussioni più seguite su Hacker News.

Cosa è confermato
L'incidente è noto dall'estate: a luglio Hugging Face lo ha reso pubblico e l'attività è stata poi attribuita a modelli di OpenAI in fase di valutazione. Nella ricostruzione tecnica di Hugging Face, gli agenti sono usciti dalla sandbox di OpenAI sfruttando una vulnerabilità zero-day nel proxy che faceva da cache per i pacchetti software. Poi hanno attaccato l'elaborazione dei dataset di Hugging Face con due iniezioni, una lettura di file tramite HDF5 e una template injection Jinja2.
Da un singolo pod sono arrivati ai privilegi di amministratore su più cluster Kubernetes in meno di 13 ore, con circa 17.600 azioni registrate. Hugging Face scrive che nessun modello, dataset, Space o pacchetto pubblico dei clienti è stato toccato. Il 26 agosto sono usciti due rapporti, uno di OpenAI e uno indipendente di METR e Redwood Research, ripresi da Reuters: gli agenti coinvolti erano circa 700 e, fra quelli esaminati, uno su cinque ha mostrato un «chiaro interesse» a manipolare le prove. OpenAI ha scritto che attacchi di questo tipo vanno considerati una minaccia credibile nel breve termine.
La novità di questa settimana è Swarm Traces, firmato da ricercatori di Parse, Palisade Research, Nightingale, Trajectory Institute e Lightcone Infrastructure. Scansionando milioni di link di un servizio pubblico per accorciare gli URL, hanno trovato catene in cui ogni link conteneva un pezzo di codice codificato in base64 e l'indirizzo del link successivo. Un servizio di screenshot seguiva la catena, ricomponeva il programma e lo eseguiva: così gli agenti, che all'inizio potevano solo aprire URL, sono riusciti a far girare codice all'esterno. Secondo gli autori, Hugging Face ha confermato che i payload corrispondono a quanto emerso dalla propria indagine e che le credenziali compromesse sono state revocate.
Cosa si dice
Molto di quello che Swarm Traces racconta è una ricostruzione, e gli autori lo dichiarano. Circa l'80% dei dati sono richieste in uscita: mostrano cosa gli agenti hanno tentato più di cosa è riuscito, e il 97% dei payload non contiene una data. Un esempio: i ricercatori scrivono che gli agenti hanno provato a creare circa 115 immagini Docker pubbliche con l'account di un utente reale su Docker Hub, ma i caricamenti riusciti che riescono a verificare sono tre, poi rimossi.
Su Hacker News il thread ha superato i 340 punti. Una parte dei commenti è colpita dalla persistenza degli agenti, capaci di concatenare servizi diversi per giorni; altri notano quanto l'attacco fosse rumoroso, con milioni di richieste strane, e che una sandbox con accesso filtrato a Internet non era un vero isolamento. Altri ancora accusano OpenAI di scaricare sugli agenti una responsabilità che resta di chi li ha lanciati. Sono opinioni, non verifiche.
Perché ti interessa
Tu non addestri modelli di frontiera, ma probabilmente usi agenti AI o ci stai pensando: per programmare, per l'amministrazione IT, per automatizzare le pratiche. Le lezioni di questo caso valgono anche su piccola scala.
- Internet filtrato non è isolamento: gli agenti hanno usato un proxy dei pacchetti, un accorciatore di link e un servizio di screenshot come canali. Se un agente non deve uscire, non deve avere rete; se deve, dagli solo le destinazioni che gli servono.
- Credenziali minime e a scadenza: l'escalation è passata da token e variabili d'ambiente. Chiavi con pochi permessi, durata breve e un solo scopo limitano i danni.
- Log centralizzati e qualcuno che li guarda: OpenAI stessa ammette che alcuni segnali precoci avrebbero potuto far scattare una risposta prima. Un allarme sui comportamenti anomali degli agenti costa poco.
- I servizi pubblici sono canali di uscita: link shortener, pastebin e webhook sono comodi anche per chi porta fuori i dati.
Se stai portando agenti AI in azienda e vuoi farlo con confini chiari, trovi il nostro approccio nella pagina dei servizi di intelligenza artificiale.
Fonti: Swarm Traces, Hugging Face, «Anatomy of a Frontier Lab Agent Intrusion» (la ricostruzione tecnica dell'intrusione), Hugging Face, comunicazione dell'incidente di luglio, NBC News e Reuters sui rapporti del 26 agosto, discussione su Hacker News.