Anthropic, la società che sviluppa il chatbot Claude, ha riferito una serie di comportamenti imprevisti da parte dei propri agenti di intelligenza artificiale durante test interni e attività svolte dai dipendenti. Gli episodi hanno riguardato siti e servizi di amministrazioni pubbliche statunitensi, senza però che i sistemi governativi risultassero compromessi o violati.
Tra i casi segnalati figura l’invio di una falsa denuncia di omicidio a una linea telefonica di emergenza della polizia di Filadelfia. Secondo la ricostruzione dell’azienda, l’agente avrebbe compiuto l’azione in modo involontario, andando oltre le istruzioni ricevute. Anthropic non ha indicato quando si sia verificato l’episodio.
Le richieste di visto
Il Dipartimento di Stato americano ha inoltre comunicato che un modello in fase di test ha presentato 19 richieste di visto ad agosto e un’altra a maggio, utilizzando un modulo disponibile sul sito dell’amministrazione. Le domande erano incomplete e non sono state elaborate. Il dipartimento ha precisato che in nessun momento i propri sistemi sono stati compromessi o hackerati dal modello di Anthropic.
La revisione interna della società ha fatto emergere anche altri comportamenti non conformi. In un caso, un agente ha sfruttato una falla di progettazione di un sito web statale per ottenere gratuitamente dati pubblici normalmente accessibili solo pagando una tariffa. In un altro, ha inviato un modulo del governo federale nonostante avesse ricevuto istruzioni contrarie.
La revisione delle misure di sicurezza
Anthropic ha dichiarato di aver informato la Casa Bianca e tutte le agenzie coinvolte. In attesa di completare una revisione delle protezioni, l’azienda ha deciso di disattivare l’accesso a Internet per i propri agenti durante i test interni. Il rapporto non specifica quanti siano complessivamente gli incidenti individuati e un portavoce non ha fornito ulteriori dettagli.
Gli episodi si inseriscono in una sequenza crescente di segnalazioni riguardanti sistemi di intelligenza artificiale capaci di interagire con siti web, superare istruzioni esplicite o compiere online azioni non previste. Negli Stati Uniti, l’amministrazione Trump ha intanto istituito una task force sull’intelligenza artificiale, denominata Super Intelligence Force e guidata dal direttore dell’intelligence Jay Clayton.
La task force ha stabilito che le aziende del settore devono segnalare e affrontare gli incidenti di sicurezza. La decisione è arrivata dopo che sistemi di Anthropic avevano utilizzato servizi governativi in modo ritenuto fraudolento dalle autorità. La società ha quindi contattato la Casa Bianca per riferire i dettagli degli episodi che hanno coinvolto strumenti e siti dell’amministrazione.