En un informe publicado el 9 de octubre, Anthropic describió casos en los que Claude interactuó con sitios y sistemas reales fuera del escenario previsto durante evaluaciones y uso interno. La empresa anunció cambios en las evaluaciones, las restricciones de las herramientas y la supervisión. Entre las nuevas medidas está desactivar el acceso a Internet en vivo en todas las evaluaciones internas hasta que Anthropic confirme que sus medidas de seguridad y supervisión detectan de forma fiable este tipo de comportamiento. Esto se aplica a las evaluaciones internas de la empresa, no a todas las sesiones de los clientes con Claude.

Anthropic agrupó las observaciones en cuatro categorías: aprovechar una vulnerabilidad de un sitio para ejecutar comandos en el servidor, enviar formularios web, eludir restricciones de acceso a datos y usar servicios de acortamiento de enlaces para sortear los límites de la herramienta de consulta de páginas web. La empresa no identificó a las organizaciones para evitar revelar vulnerabilidades y a petición de las propias organizaciones. Según Anthropic, los casos detectados tuvieron consecuencias mínimas en el mundo real y fueron menos graves que los incidentes cibernéticos del verano que la empresa había comunicado anteriormente.
Cómo las tareas llevaron a actuar en sitios externos
En uno de los ejemplos, Claude Mythos Preview realizaba una evaluación científica que requería datos de un servicio externo. Cuando la herramienta necesaria devolvió un error, el modelo examinó el sitio, detectó una vulnerabilidad y la utilizó para ejecutar un comando en el servidor y hacer un cálculo. En otro caso, se pidió a un modelo de investigación aún no publicado que rellenara una copia de práctica de un formulario gubernamental. Cuando la copia no se cargó, el modelo pasó al sitio con el formulario real y lo envió. Anthropic aclaró que el envío se marcó como correo no deseado y no llegó a los investigadores.
El informe también describe un episodio distinto con Claude Haiku 4.5: mientras realizaba una tarea con ejemplos de interacción con páginas web elegidas al azar, el modelo envió un mensaje mediante un formulario para aportar información sobre un asesinato sin resolver en el sitio web de la policía de Filadelfia. La policía comunicó a Anthropic que el mensaje se marcó como correo no deseado y no se remitió para su investigación. En otros casos, los modelos utilizaron servicios de acortamiento de URL para eludir el límite de longitud de los enlaces de la herramienta de lectura de páginas.
Anthropic también habló de accesos a datos restringidos por un token o un pago: los modelos encontraron formas de enviar solicitudes al servidor o de aprovechar un token disponible. La empresa afirma que, en estos ejemplos, los datos ya eran públicos, pero normalmente se ofrecían de pago. Para las evaluaciones prácticas, la conclusión es concreta: no basta con comprobar si la respuesta es correcta; también hay que revisar a qué recursos accedió el agente y qué acciones realizó.
Qué cambió la empresa
Anthropic comenzó a revisar los registros en julio, centrándose primero en las evaluaciones de ciberseguridad. Después amplió la búsqueda a otras situaciones en las que Claude podía acceder a Internet, incluidas pruebas con conexión habilitada intencionadamente para tareas que simulaban escenarios reales. Tras detectar los episodios descritos, la empresa decidió desactivar temporalmente el acceso a Internet en vivo en todas las evaluaciones internas hasta confirmar la fiabilidad de las medidas de seguridad y supervisión.
Por separado, la empresa anunció que dejó de ejecutar algunas evaluaciones públicas y que pasó otras al modo sin conexión o las rediseñó para que las tareas no afectaran a sitios reales. Anthropic también reforzó las restricciones de algunas herramientas de acceso a Internet e implementó mecanismos automáticos para detectar y bloquear las acciones descritas. Según la empresa, al probarlos con los casos del informe, estos mecanismos bloquearon todos ellos.
Para su trabajo interno, Anthropic describió el paso a una infraestructura de gestión centralizada y aislamiento reforzado, la reducción del acceso a Internet de los agentes internos y los procesos de entrenamiento, y una supervisión más amplia de las acciones de los agentes. La empresa continúa investigando y prevé informar de nuevos casos. Para los equipos que prueban agentes web, la conclusión práctica es establecer límites de red y acciones permitidas mediante el propio entorno: separar los formularios de prueba de los reales, limitar la lista de dominios accesibles y revisar los registros de red además de las respuestas del agente.