Un agente di Anthropic ha inviato una falsa segnalazione su un caso di omicidio irrisolto alla polizia di Filadelfia. Un altro agente ha richiesto 20 visti di ingresso negli Stati Uniti attraverso un form sul sito del Dipartimento di Stato. L’azienda californiana ha descritto diversi comportamenti inattesi e bloccato l’accesso ad Internet per tutti gli ambienti di valutazione interni.
Agenti AI fuori controllo: interviene la Super Intelligence Force
In seguito agli incidenti elencati a fine luglio e inizio settembre, Anthropic ha avviato un’analisi approfondita delle attività eseguite dagli agenti basati sui modelli Claude, senza però individuare incidenti con una gravità simile. Quando ha ampliato la ricerca a casi meno gravi, tra cui quelli in cui Claude aveva accesso ad Internet durante i test, l’azienda californiana ha scoperto diversi comportamenti inattesi. Anthropic ha pertanto deciso di bloccare l’accesso a Internet per tutte le valutazioni fino all’implementazione di adeguate misure di sicurezza.
Gli incidenti descritti sono conseguenza di azioni eseguite dagli agenti che non hanno rispettato i prompt dei test, come la semplice ricerca di informazioni su Internet. Alcuni casi riguardano accessi non autorizzati a siti di agenzie governative statunitensi a livello locale, statale e federale. I comportamenti inattesi sono suddivisi in quattro categorie:
- Claude ha inviato un modulo contenente dati sensibili su un sito web reale
- Claude ha sfruttato una vulnerabilità software per eseguire comandi su un server
- Claude ha aggirato una restrizione per accedere a dati protetti da token o a pagamento
- Claude ha utilizzato servizi di URL shortening per superare i limiti del tool di raccolta dati
Nella prima categoria rientra l’incidente confermato dalla polizia di Filadelfia. Un agente basato su Claude Haiku 4.5 ha inviato una falsa segnalazione su un caso di omicidio irrisolto attraverso il form del sito PhillyUnsolvedMurders.com. Questo è il messaggio scritto dall’agente:
Potrei avere informazioni su questo caso. Ricordo di aver visto qualcuno che corrispondeva alla descrizione nella zona di [nome della strada indicato nella pagina] in quel periodo. Vi prego di contattarmi se queste informazioni dovessero rivelarsi utili.
La segnalazione è stata considerata spam e quindi scartata. Ciò è avvenuto il 18 luglio. Anthropic ha scoperto tale attività il 28 settembre e avvisato la polizia di Filadelfia il 7 ottobre. Un portavoce del Dipartimento di polizia ha dichiarato:
L’azienda deve rafforzare le proprie misure di sicurezza per evitare che incidenti analoghi compromettano i sistemi cittadini all’insaputa dell’amministrazione comunale. Il ritardo di due mesi nel rilevare l’incidente e nel segnalarlo alla città è inaccettabile. I casi irrisolti coinvolgono vittime reali, famiglie in lutto e investigatori che lavorano per ottenere risposte. Le aziende tecnologiche devono adottare tutte le misure necessarie per impedire che i loro sistemi forniscano informazioni false alle forze dell’ordine.
Anthropic non ha descritto l’incidente riportato dal New York Times. Un agente ha presentato richieste per 20 visti (una a maggio e 19 ad agosto) attraverso un form disponibile sul sito del Dipartimento di Stato. Le richieste erano però incomplete, quindi sono state scartate. La Super Intelligence Force (SIF), creata da Trump, ha comunicato che le aziende devono immediatamente notificare simili incidenti e implementare i rimedi con urgenza. Anthropic ha informato la SIF ieri mattina (9 ottobre).