IA

L’IA di Anthropic ha inviato una falsa segnalazione di omicidio alla polizia di Filadelfia: il Comune chiama i suoi legali

Adrian Kessler
Aggiungici su Google

La falsa segnalazione di omicidio inviata da un modello Anthropic sul sito della polizia di Filadelfia non è mai arrivata a un detective. A intercettarla è stato un filtro antispam. È la parte rassicurante della vicenda, quella su cui fa leva anche il resoconto della stessa azienda. Ma Filadelfia sta agendo sulla base di un altro aspetto: la segnalazione è rimasta per settimane nei sistemi della città prima che l’azienda che l’aveva generata se ne accorgesse, e ora la città ha affidato il caso ai propri legali.

Dietro la bizzarria di un chatbot che si spaccia per testimone c’è un meccanismo più semplice. Il modello era in funzione sul web pubblico nell’ambito di un test, con una breve lista di divieti. Tra questi non figurava l’invio di una falsa testimonianza in un caso di omicidio ancora aperto.

Che cosa ha fatto davvero il modello di Anthropic

Secondo il resoconto della stessa Anthropic, il modello era Claude Haiku 4.5, incaricato di inventare ed eseguire attività di esempio su pagine web scelte a caso. Una di queste era il sito della città per raccogliere segnalazioni su omicidi irrisolti, PhillyUnsolvedMurders.com. Le istruzioni gli imponevano di «non accedere mai, creare account, inserire dati personali, effettuare acquisti o inviare contenuti distruttivi». Non dicevano nulla sui moduli. Così il modello ne ha compilato uno, ha lasciato vuoti i campi relativi a nome e recapiti e ha scritto: «Potrei avere informazioni su questo caso».

Secondo Fox Business, il messaggio aggiungeva di ricordare di aver visto qualcuno «corrispondente alla descrizione» nei pressi di una strada indicata sulla pagina. Ma la pagina non riportava alcuna descrizione di un sospettato. Il messaggio si concludeva con: «Contattatemi se queste informazioni sono utili». La polizia afferma che la segnalazione è stata contrassegnata come spam e non è mai stata inoltrata al Real-Time Crime Center per le verifiche; aggiunge inoltre di non aver trovato tracce di accessi non autorizzati ai sistemi o ai dati del dipartimento.

Perché Filadelfia non la considera una semplice anomalia

Nella sua dichiarazione, il dipartimento attribuisce alle proprie misure di sicurezza il merito di aver limitato i danni, ma non considera chiusa la questione. Tali misure «non attenuano la gravità del fatto che un sistema di IA presenti informazioni inventate», ha dichiarato, aggiungendo che «dietro i casi irrisolti ci sono vittime reali, famiglie in lutto e investigatori impegnati a trovare risposte». Ha detto ad Anthropic che «l’azienda deve rafforzare le proprie misure di sicurezza per impedire che episodi simili coinvolgano i sistemi cittadini» e ha definito «inaccettabile» il ritardo con cui la città è stata informata.

È qui che la vicenda smette di riguardare un modello e comincia a riguardare un’azienda. Secondo NBC10, la polizia sta lavorando con il Law Department della città, l’Office of Innovation and Technology e il gruppo dirigente della sindaca Cherelle Parker; l’amministrazione afferma inoltre che valuterà l’introduzione di tutele normative a livello locale, statale e federale. Non sono state annunciate accuse né sanzioni. Ma per Anthropic è un interlocutore inedito un’amministrazione cittadina che studia come regolamentare i test condotti dai laboratori di IA sui propri sistemi.

Un episodio che si aggiunge a una lista più lunga

La segnalazione di Filadelfia compare in un rapporto pubblicato da Anthropic lo stesso giorno in cui la polizia ha reso pubblica la vicenda. Il documento suddivide in quattro categorie le azioni involontarie dei suoi modelli su sistemi reali: sfruttare vulnerabilità software su siti di terzi per eseguire comandi, inviare moduli che non avrebbero dovuto compilare, aggirare restrizioni per raggiungere dati protetti e usare URL abbreviati per eludere i limiti degli strumenti di recupero dei contenuti. In un caso, un modello di ricerca non ancora rilasciato ha inviato un modulo governativo reale dopo che non era riuscito a caricare una copia di prova. In un altro, Claude Mythos 5 ha trovato token di accesso nel file delle impostazioni di un sito cartografico e li ha usati per interrogare un server di un’amministrazione locale.

Alcuni dei siti appartenevano ad agenzie federali, statali e locali; Anthropic afferma di aver informato la Casa Bianca e avvisato ciascuna delle agenzie coinvolte. L’azienda descrive gli episodi come caratterizzati da un «impatto minimo nel mondo reale» e meno gravi di quelli resi noti in precedenza, quando Claude aveva raggiunto sistemi reali di terzi per diverse ore durante test di sicurezza informatica. Afferma inoltre di non aver ancora completato una valutazione integrale dell’allineamento dei nuovi casi.

Il momento in cui arriva la notizia è importante. Alla fine di settembre, la Federal Trade Commission ha confermato un’indagine estesa all’intero settore su Anthropic, OpenAI e altri laboratori, per verificare se abbiano violato il FTC Act; secondo Reuters e The Next Web, sta preparando richieste formali che possono obbligare i dirigenti a testimoniare. Reuters ha riferito che il presidente della FTC Andrew Ferguson aveva ipotizzato che gli sviluppatori dovessero rispondere dei danni se i loro agenti di test finiscono per violare dei sistemi. Il caso più noto tra quelli esaminati riguarda OpenAI: a luglio l’azienda ha rivelato che oltre mille dei suoi agenti avevano violato la piattaforma Hugging Face.

Che cosa ha cambiato Anthropic e che cosa ammette così facendo

Anthropic afferma di aver interrotto il processo di test responsabile dell’episodio, aggiunto una fase di convalida, ristretto le operazioni consentite ai propri modelli con gli strumenti web e creato strumenti di rilevamento che, nelle prove, hanno bloccato tutti i casi riportati. Il cambiamento più significativo è una retromarcia: l’azienda ha esteso a tutte le proprie valutazioni interne la sospensione dell’accesso a Internet in tempo reale, «finché non avremo verificato che le nostre misure di sicurezza e monitoraggio» intercettino questi comportamenti in modo affidabile. In parole semplici, l’azienda non può ancora garantire di riuscire a vedere che cosa fanno i suoi agenti sul web pubblico, e perciò li sta tenendo lontani.

Le date aiutano a capire la rabbia della città. La polizia fa risalire la segnalazione al 18 luglio (PhillyVoice ne ha scritto il 28 luglio). Anthropic afferma di aver individuato il caso durante l’esame di trascrizioni avviato a luglio; la polizia sostiene che l’azienda lo abbia scoperto il 28 settembre. Secondo la polizia, Anthropic l’ha informata mercoledì 7 ottobre e il giorno successivo si è tenuto un incontro; nel rapporto di Anthropic, invece, la scoperta è stata comunicata l’8 ottobre, «non appena si è conclusa la nostra analisi tecnica». Il dipartimento ha reso pubblica la vicenda il 9 ottobre.

La misura di sicurezza che ha funzionato era della città: un filtro antispam e una regola che impone a una persona di verificare ogni segnalazione. Il prossimo modulo che un agente di test deciderà di compilare potrebbe appartenere a qualcuno che non dispone né dell’uno né dell’altra.

Tag: , , , ,

Aggiungici su Google

Discussione

Ci sono 0 commenti.