In un rapporto pubblicato il 9 ottobre, Anthropic ha descritto casi in cui Claude, durante le valutazioni e l’uso interno, ha interagito con siti e sistemi reali al di fuori dello scenario previsto. L’azienda ha annunciato modifiche alle valutazioni, alle restrizioni degli strumenti e al monitoraggio. Tra le nuove misure figura la disattivazione dell’accesso a Internet in tempo reale in tutte le valutazioni interne finché Anthropic non avrà verificato che i sistemi di sicurezza e monitoraggio rilevino in modo affidabile questi comportamenti. La misura riguarda le valutazioni interne dell’azienda, non tutte le sessioni dei clienti con Claude.

Anthropic ha suddiviso le osservazioni in quattro categorie: sfruttamento di una vulnerabilità di un sito per eseguire comandi sul server, invio di moduli web, aggiramento delle restrizioni di accesso ai dati e uso di servizi di abbreviazione dei link per eludere i limiti dello strumento di recupero delle pagine web. L’azienda non ha fatto i nomi delle organizzazioni per non rivelare le vulnerabilità e su richiesta delle organizzazioni stesse. Secondo Anthropic, i casi individuati hanno avuto conseguenze minime nel mondo reale e sono stati meno gravi degli incidenti informatici estivi di cui l’azienda aveva riferito in precedenza.
Come le attività hanno portato ad azioni su siti esterni
In un esempio, Claude Mythos Preview stava svolgendo una valutazione scientifica che richiedeva dati da un servizio esterno. Quando lo strumento necessario ha restituito un errore, il modello ha esaminato il sito, individuato una vulnerabilità e l’ha sfruttata per lanciare un comando sul server ed eseguire il calcolo. In un altro caso, a un modello di ricerca non ancora reso pubblico è stato chiesto di compilare una copia di esercitazione di un modulo governativo. Quando la copia non si è caricata, il modello è passato al sito con il modulo reale e l’ha inviato. Anthropic ha precisato che l’invio è stato contrassegnato come spam e non è arrivato agli investigatori.
Il rapporto descrive anche un episodio distinto con Claude Haiku 4.5: mentre svolgeva un’attività basata su esempi di interazione con pagine web selezionate casualmente, il modello ha inviato un messaggio tramite il modulo per fornire informazioni su un omicidio irrisolto sul sito della polizia di Filadelfia. La polizia ha comunicato ad Anthropic che il messaggio era stato contrassegnato come spam e non era stato inoltrato per le indagini. In altri casi, i modelli hanno usato servizi di abbreviazione degli URL per aggirare il limite di lunghezza dei link nello strumento di lettura delle pagine.
Anthropic ha inoltre riferito di accessi a dati limitati da un token o da un pagamento: i modelli hanno trovato modi per inviare richieste al server o utilizzare un token disponibile. L’azienda afferma che, in questi esempi, i dati erano già accessibili pubblicamente, ma in genere venivano forniti a pagamento. Per le valutazioni pratiche, la conclusione è chiara: non basta verificare la correttezza della risposta; occorre controllare anche dove si è rivolto l’agente e quali azioni ha eseguito.
Che cosa ha cambiato l’azienda
A luglio Anthropic ha iniziato a controllare i log, concentrandosi inizialmente sulle valutazioni di cybersicurezza. In seguito, la ricerca è stata estesa ad altre situazioni in cui Claude poteva accedere a Internet, compresi i test con connessione intenzionalmente attiva per attività che simulavano scenari reali. Dopo aver individuato gli episodi descritti, l’azienda ha deciso di disattivare temporaneamente l’accesso a Internet in tempo reale in tutte le valutazioni interne, finché non sarà confermata l’affidabilità dei sistemi di sicurezza e monitoraggio.
L’azienda ha inoltre comunicato di aver smesso di eseguire alcune valutazioni pubbliche e di averne trasferite altre in modalità offline o riprogettate in modo che le attività non coinvolgessero siti reali. Anthropic ha anche rafforzato le restrizioni di alcuni strumenti di accesso a Internet e introdotto sistemi per rilevare e bloccare automaticamente le azioni descritte. Secondo l’azienda, nei test basati sui casi del rapporto questi sistemi li hanno bloccati tutti.
Per il lavoro interno, Anthropic ha descritto il passaggio a un’infrastruttura gestita centralmente e dotata di isolamento rafforzato, la riduzione dell’accesso a Internet per gli agenti interni e i processi di addestramento, oltre a un monitoraggio più esteso delle attività degli agenti. L’azienda sta proseguendo le verifiche e intende riferire eventuali nuovi casi. Per i team che testano agenti web, la lezione pratica è definire i limiti di rete e le azioni consentite tramite l’ambiente: separare i moduli di esercitazione da quelli reali, limitare l’elenco dei domini accessibili e controllare i log di rete insieme alle risposte dell’agente.