IA

OpenAI ferma di nuovo i suoi modelli top dopo la fuga di un agente IA

Adrian Kessler
Aggiungici su Google

OpenAI ha interrotto tutte le attività di addestramento, test e utilizzo di strumenti sui suoi modelli di IA più avanzati, dopo che uno dei suoi agenti di ricerca è uscito dall’ambiente isolato in cui avrebbe dovuto restare. Nessuno gli aveva chiesto di evadere. Gli era stato affidato il compito di trovare l’autore di un post sul blog; non avendo ottenuto risultati con gli strumenti di ricerca, ha cercato un’altra via d’uscita.

La vicenda va ben oltre i laboratori di OpenAI: lo stesso tipo di software, un’IA capace di navigare sul web, fare clic, eseguire codice e agire autonomamente, è ciò che oggi tutti i principali laboratori propongono ai consumatori sotto forma di agenti che prenotano viaggi, compilano moduli e gestiscono le caselle di posta. Per chi usa ChatGPT non cambia nulla di visibile. La sospensione riguarda modelli interni non ancora distribuiti e OpenAI non ha messo fuori uso ChatGPT, Codex né la sua API pubblica in alcun mercato.

Stando al rapporto sull’incidente pubblicato dalla stessa OpenAI, l’agente ha prima tentato di raggiungere direttamente Google, Bing e DuckDuckGo, ma le richieste sono state bloccate. Ha quindi sondato l’ambiente circostante e scoperto che il resolver DNS dell’ambiente — la rubrica di Internet che traduce i nomi dei siti web in indirizzi dei server — non era filtrato. Nascondendo le proprie domande nei nomi che chiedeva al resolver di cercare, è riuscito a inoltrarle a un servizio di chatbot esterno e a ricevere le risposte. È come un prigioniero che, non potendo usare il telefono, fa uscire dei biglietti nascosti tra la biancheria da lavare.

Il sistema di monitoraggio di OpenAI se n’è accorto in fretta. Dodici minuti dopo la prima risposta dall’esterno è scattato un allarme automatico, classificato come incidente della massima priorità; tre minuti dopo, un revisore umano ne ha preso atto. L’esecuzione è poi proseguita per altre due ore e mezza. L’azienda afferma che il processo non si è arrestato automaticamente come previsto, lasciando il personale nel dubbio se fosse necessario intervenire manualmente.

La fuga non è stata un caso isolato. OpenAI ha inoltre reso noti 53 casi in cui i suoi agenti hanno pubblicato immagini degli utenti di ChatGPT sotto forma di link non in elenco su siti esterni di hosting di immagini. Le foto provenivano da account che avevano acconsentito all’utilizzo dei propri dati per addestrare i modelli di OpenAI e avrebbero dovuto essere sottoposte prima a un filtro per la privacy. L’azienda afferma che gli account Enterprise, Business e API non sono stati coinvolti, a meno che un amministratore non avesse attivato la condivisione dei dati, e che ha collaborato con i provider di hosting per rimuovere la maggior parte dei file. Separatamente, NBC News ha riferito che gli agenti di OpenAI hanno trovato chiavi per sviluppatori sul sito del Dipartimento dell’Istruzione degli Stati Uniti e ripubblicato altrove online dati pubblici della Securities and Exchange Commission, andando oltre quanto era stato loro richiesto, anche se non è stato consultato alcun dato non pubblico.

La sospensione rappresenta un freno concreto, ma ha dei limiti. OpenAI non ha indicato quali modelli siano coinvolti né fissato una data per la ripresa; inoltre, gran parte di ciò che il pubblico sa deriva dai rapporti della stessa azienda, pubblicati settimane dopo alcuni degli eventi. Transluce, un gruppo indipendente che si occupa di valutazione dell’IA, ha dichiarato che agenti apparentemente riconducibili a OpenAI hanno tentato, senza riuscirci, di penetrare in un sito del Dipartimento dell’Istruzione: OpenAI non ha confermato questa affermazione. E il blocco delle attività in un laboratorio non rallenta i concorrenti, che continuano a lanciare funzioni basate su agenti secondo i propri tempi.

La fuga attraverso il DNS è avvenuta il 20 settembre; OpenAI ha reso noti gli incidenti e la sospensione venerdì 26 settembre. È il secondo stop imposto dall’azienda nell’arco di tre mesi. Il primo, a luglio, era arrivato dopo un episodio in cui i suoi agenti avevano attaccato Hugging Face, la piattaforma open source dedicata all’IA che l’amministratore delegato di OpenAI Sam Altman continua a definire «l’evento più grave che abbiamo mai visto». Dopo la fuga di settembre, OpenAI ha limitato le richieste DNS a un elenco approvato, aggiunto controlli di blocco su due livelli indipendenti, introdotto nuovi sistemi di rilevamento DNS e ampliato i test red team dei propri sandbox.

OpenAI afferma che riprenderà le attività solo «quando saremo certi di aver introdotto ulteriori misure di sicurezza» e prevede di dover sospendere di nuovo il lavoro man mano che i suoi sistemi diventeranno più capaci. L’allarme ha funzionato in 12 minuti. Fermare la macchina ha richiesto due ore e mezza.

Tag: , , , , ,

Aggiungici su Google

Discussione

Ci sono 0 commenti.