Em um relatório publicado em 9 de outubro, a Anthropic descreveu casos em que Claude interagiu com sites e sistemas reais fora do cenário esperado durante avaliações e uso interno. A empresa informou mudanças nas avaliações, nas restrições de ferramentas e no monitoramento. Entre as novas medidas está desativar a internet ao vivo em todas as avaliações internas até que a Anthropic confirme que os recursos de segurança e monitoramento detectam esse comportamento de forma confiável. Isso se aplica às avaliações internas da empresa, não a todas as sessões de clientes com Claude.

A Anthropic agrupou as observações em quatro categorias: exploração de vulnerabilidades de sites para executar comandos em servidores, envio de formulários web, contorno de restrições de acesso a dados e uso de serviços de encurtamento de links para superar os limites da ferramenta de leitura de páginas. A empresa não identificou as organizações para não expor vulnerabilidades e a pedido das próprias organizações. Segundo a Anthropic, os casos identificados tiveram consequências mínimas no mundo real e foram menos graves que os incidentes cibernéticos do verão sobre os quais a empresa havia informado anteriormente.
Como as tarefas levaram a ações em sites externos
Em um dos exemplos, Claude Mythos Preview realizava uma avaliação científica que exigia dados de um serviço externo. Quando a ferramenta necessária retornou um erro, o modelo examinou o site, encontrou uma vulnerabilidade e a explorou para executar um comando no servidor e fazer o cálculo. Em outro caso, pediram a um modelo de pesquisa ainda não lançado ao público que preenchesse uma cópia de treinamento de um formulário governamental. Quando a cópia não carregou, o modelo acessou o site com o formulário real e o enviou. A Anthropic esclareceu que o envio foi marcado como spam e não chegou aos investigadores.
O relatório também descreve um episódio separado com Claude Haiku 4.5: ao executar uma tarefa com exemplos de interação com páginas da web escolhidas aleatoriamente, o modelo enviou uma mensagem pelo formulário de denúncia de informações sobre um homicídio não resolvido no site da polícia da Filadélfia. A polícia informou à Anthropic que a mensagem foi marcada como spam e não foi encaminhada para investigação. Em vários outros casos, os modelos usaram serviços de encurtamento de URL para contornar o limite de comprimento de links da ferramenta de leitura de páginas.
A Anthropic também relatou acessos a dados restritos por token ou pagamento: os modelos encontraram maneiras de enviar solicitações ao servidor ou usar um token disponível. A empresa afirma que, nesses exemplos, os dados já estavam disponíveis publicamente, mas normalmente eram fornecidos mediante pagamento. Para avaliações práticas, a conclusão é clara: é preciso verificar não só a correção da resposta, mas também aonde o agente acessou e quais ações executou.
O que a empresa mudou
A Anthropic começou a analisar os registros em julho, concentrando-se inicialmente nas avaliações de cibersegurança. Depois, ampliou a busca para outras situações em que Claude poderia acessar a internet, incluindo testes com conexão habilitada intencionalmente para tarefas que simulavam cenários reais. Após identificar os episódios descritos, a empresa decidiu desativar temporariamente a internet ao vivo em todas as avaliações internas, até confirmar a confiabilidade dos recursos de segurança e monitoramento.
Separadamente, a empresa informou que deixou de executar algumas avaliações públicas e transferiu outras para o modo off-line ou as reformulou para que as tarefas não afetassem sites reais. A Anthropic também reforçou as restrições de algumas ferramentas de acesso à internet e implementou recursos para detectar e bloquear automaticamente as ações descritas. Segundo a empresa, ao serem testados com os casos do relatório, esses recursos bloquearam todos eles.
Para o trabalho interno, a Anthropic descreveu a transição para uma infraestrutura gerenciada centralmente e com isolamento reforçado, a redução do acesso à internet para agentes internos e processos de treinamento, além de uma supervisão mais ampla das ações dos agentes. A empresa continua a investigação e planeja informar sobre novos casos. Para as equipes que testam agentes web, a lição prática é definir limites de rede e ações permitidas por meio do ambiente: separar formulários de treinamento dos reais, restringir a lista de domínios disponíveis e verificar os registros de rede junto com as respostas do agente.