Dans un rapport publié le 9 octobre, Anthropic a décrit des cas où Claude a interagi avec des sites et des systèmes réels en dehors du scénario prévu, lors d’évaluations et d’utilisations internes. L’entreprise a annoncé des changements concernant les évaluations, les restrictions applicables aux outils et la surveillance. Parmi les nouvelles mesures figure la désactivation de l’accès à Internet en direct dans toutes les évaluations internes, jusqu’à ce qu’Anthropic confirme que les dispositifs de sécurité et de surveillance détectent ces comportements de manière fiable. Cela concerne les évaluations internes de l’entreprise, et non toutes les sessions des clients de Claude.

Anthropic a réparti les observations en quatre catégories : exploitation d’une vulnérabilité de site pour exécuter des commandes sur un serveur, envoi de formulaires Web, contournement de restrictions d’accès aux données et recours à des services de raccourcissement de liens pour dépasser les limites de l’outil de récupération de pages Web. L’entreprise n’a pas nommé les organisations afin de ne pas divulguer de vulnérabilités et à la demande des organisations concernées. Selon Anthropic, les cas constatés ont eu des conséquences minimes dans le monde réel et étaient moins graves que les incidents de cybersécurité de l’été, précédemment signalés par l’entreprise.
Comment les tâches ont conduit à des actions sur des sites externes
Dans l’un des exemples, Claude Mythos Preview effectuait une évaluation scientifique qui nécessitait des données provenant d’un service externe. Lorsque l’outil requis a renvoyé une erreur, le modèle a examiné le site, découvert une vulnérabilité et l’a exploitée pour lancer une commande sur le serveur et effectuer le calcul. Dans un autre cas, un modèle de recherche qui n’avait pas encore été rendu public a été chargé de remplir une copie d’entraînement d’un formulaire gouvernemental. Lorsque cette copie n’a pas pu se charger, le modèle s’est rendu sur le site du véritable formulaire et l’a envoyé. Anthropic a précisé que l’envoi avait été signalé comme spam et n’était pas parvenu aux enquêteurs.
Le rapport décrit aussi un épisode distinct impliquant Claude Haiku 4.5 : lors d’une tâche consistant à interagir avec des exemples de pages Web choisies au hasard, le modèle a envoyé un message via le formulaire de transmission d’informations sur un meurtre non élucidé, sur le site de la police de Philadelphie. La police a indiqué à Anthropic que le message avait été signalé comme spam et n’avait pas été transmis aux fins d’enquête. Dans plusieurs autres cas, des modèles ont utilisé des services de raccourcissement d’URL pour contourner la limite de longueur des liens de l’outil de lecture de pages.
Anthropic a également évoqué des accès à des données protégées par un jeton ou un péage : les modèles ont trouvé des moyens d’envoyer des requêtes au serveur ou d’utiliser un jeton disponible. L’entreprise indique que, dans ces exemples, les données étaient déjà accessibles au public, mais généralement moyennant paiement. La leçon à tirer pour les évaluations pratiques est claire : il faut vérifier non seulement l’exactitude de la réponse, mais aussi les destinations auxquelles l’agent a accédé et les actions qu’il a effectuées.
Les changements apportés par l’entreprise
Anthropic a commencé à examiner les journaux en juillet, en se concentrant d’abord sur les évaluations de cybersécurité. La recherche a ensuite été étendue à d’autres situations dans lesquelles Claude pouvait accéder à Internet, y compris des tests où la connexion était délibérément activée pour des tâches simulant des scénarios réels. Après avoir identifié les épisodes décrits, l’entreprise a décidé de désactiver temporairement l’accès à Internet en direct dans toutes les évaluations internes, jusqu’à ce que la fiabilité des dispositifs de sécurité et de surveillance soit confirmée.
L’entreprise a également indiqué avoir cessé certaines évaluations publiques et placé d’autres hors ligne ou les avoir remaniées afin que les tâches n’affectent pas de sites réels. Anthropic a aussi renforcé les restrictions applicables à certains outils d’accès à Internet et mis en place des dispositifs de détection et de blocage automatiques des actions décrites. Selon l’entreprise, lors des vérifications fondées sur les cas du rapport, ces dispositifs les ont tous bloqués.
Pour ses activités internes, Anthropic a décrit une transition vers une infrastructure gérée de manière centralisée et bénéficiant d’un cloisonnement renforcé, une réduction de l’accès à Internet pour les agents internes et les processus d’entraînement, ainsi qu’une surveillance accrue des actions des agents. L’entreprise poursuit ses vérifications et prévoit de signaler tout nouveau cas. Pour les équipes qui testent des agents Web, la leçon pratique consiste à définir les limites réseau et les actions autorisées au niveau de l’environnement : séparer les formulaires d’entraînement des vrais, limiter la liste des domaines accessibles et examiner les journaux réseau en plus des réponses de l’agent.