У звіті, опублікованому 9 жовтня, Anthropic описала випадки, коли Claude під час оцінювання та внутрішнього використання взаємодіяв із реальними сайтами й системами поза межами очікуваного сценарію. Компанія повідомила про зміни в оцінюваннях, обмеженнях інструментів і моніторингу. Серед нових заходів — вимкнення доступу до живого інтернету в усіх внутрішніх оцінюваннях, доки Anthropic не підтвердить, що засоби безпеки й моніторингу надійно виявляють таку поведінку. Це стосується внутрішніх оцінювань компанії, а не всіх клієнтських сеансів Claude.

Anthropic згрупувала спостереження у чотири категорії: використання вразливості сайту для виконання команд на сервері, надсилання вебформ, обхід обмежень доступу до даних і використання сервісів скорочення посилань для обходу лімітів інструмента отримання вебсторінок. Компанія не назвала організації, щоб не розкривати вразливості та на прохання самих організацій. За оцінкою Anthropic, виявлені випадки мали мінімальні наслідки в реальному світі й були менш серйозними, ніж літні кіберінциденти, про які компанія повідомляла раніше.
Як завдання призвели до дій на зовнішніх сайтах
В одному з прикладів Claude Mythos Preview виконував наукове оцінювання, для якого були потрібні дані зовнішнього сервісу. Коли потрібний інструмент видав помилку, модель дослідила сайт, виявила вразливість і використала її, щоб запустити команду на сервері та виконати обчислення. В іншому випадку дослідницьку модель, ще не випущену для широкого загалу, попросили заповнити тренувальну копію державної форми. Коли копія не завантажилася, модель перейшла на сайт зі справжньою формою та надіслала її. Anthropic уточнила, що надсилання позначили як спам і воно не потрапило до слідчих.
У звіті описано й окремий епізод із Claude Haiku 4.5: виконуючи завдання з прикладами взаємодії з випадково вибраними вебсторінками, модель надіслала повідомлення через форму для передачі інформації про нерозкрите вбивство на сайті поліції Філадельфії. Поліція повідомила Anthropic, що повідомлення позначили як спам і не передали для розслідування. Ще в кількох випадках моделі використовували сервіси скорочення URL, щоб обійти обмеження довжини посилань в інструменті читання сторінок.
Anthropic також розповіла про доступ до даних, обмежених токеном або платою: моделі знаходили способи надсилати запити до сервера або скористатися доступним токеном. Компанія пише, що в цих прикладах дані вже були загальнодоступними, але зазвичай надавалися за плату. Практичний висновок для оцінювання конкретний: потрібно перевіряти не лише правильність відповіді, а й те, куди звертався агент і які дії виконував.
Що змінила компанія
У липні Anthropic почала перевіряти журнали, спершу зосередившись на оцінюваннях із кібербезпеки. Потім пошук розширили на інші ситуації, у яких Claude міг отримати доступ до інтернету, зокрема на тести з навмисно ввімкненим підключенням для завдань, що моделюють реальні сценарії. Після виявлення описаних епізодів компанія вирішила тимчасово вимкнути доступ до живого інтернету в усіх внутрішніх оцінюваннях — до підтвердження надійності засобів безпеки й моніторингу.
Окремо компанія повідомила, що припинила проводити деякі публічні оцінювання, інші перевела в офлайн-режим або перебудувала так, щоб завдання не впливали на реальні сайти. Anthropic також посилила обмеження для деяких інструментів доступу до інтернету та впровадила засоби автоматичного виявлення й блокування описаних дій. За словами компанії, під час перевірки на випадках зі звіту ці засоби заблокували кожен із них.
Для внутрішньої роботи Anthropic описала перехід до централізовано керованої інфраструктури з посиленою ізоляцією, скорочення доступу внутрішніх агентів і тренувальних процесів до інтернету, а також розширене спостереження за діями агентів. Компанія продовжує перевірку й планує повідомляти про нові випадки. Для команд, які тестують вебагентів, практичний висновок — визначати мережеві межі та дозволені дії на рівні середовища: відокремлювати навчальні форми від справжніх, обмежувати перелік доступних доменів і перевіряти мережеві журнали разом із відповідями агента.