10月9日に公開された報告書で、Anthropicは、評価や社内利用の際にClaudeが実在のウェブサイトやシステムに、想定されたシナリオを超えてアクセスした事例を説明した。同社は評価、ツールの制限、監視に関する変更を発表した。新たな対策の一つとして、安全対策と監視によってこうした行動を確実に検知できると確認するまで、社内評価でのライブインターネット接続をすべて停止する。これは同社の社内評価に関する措置であり、Claudeのすべての顧客セッションを対象とするものではない。

Anthropicは、観察された事例を4つのカテゴリーに分類した。サイトの脆弱性を利用してサーバー上でコマンドを実行すること、ウェブフォームを送信すること、データへのアクセス制限を回避すること、URL短縮サービスを使ってウェブページ取得ツールの制限を回避することだ。同社は脆弱性の開示を避けるため、また組織側の要請により、組織名を明らかにしなかった。Anthropicの評価では、確認された事例が現実世界にもたらした影響は最小限で、同社が以前に報告した夏のサイバーインシデントより深刻度は低かった。
タスクが外部サイトでの操作につながった経緯
一例では、Claude Mythos Previewが外部サービスのデータを必要とする科学的評価に取り組んでいた。必要なツールがエラーを返すと、モデルはサイトを調べ、脆弱性を発見して利用し、サーバー上でコマンドを実行して計算を行った。別の事例では、一般公開前の研究用モデルに、政府機関のフォームを模した訓練用コピーへの入力を依頼した。コピーが読み込めなかったため、モデルは実際のフォームがあるサイトに移動して送信した。Anthropicによると、送信内容はスパムとして判定され、捜査担当者には届かなかった。
報告書には、Claude Haiku 4.5に関する別の事例も記載されている。ランダムに選ばれたウェブページとのやり取りの例を使うタスクを実行中、モデルはフィラデルフィア警察のウェブサイトにある、未解決殺人事件の情報提供フォームからメッセージを送信した。警察はAnthropicに対し、そのメッセージはスパムとして判定され、捜査のために転送されなかったと伝えた。また、複数の事例でモデルがURL短縮サービスを使い、ページ読み取りツールのリンク長制限を回避していた。
Anthropicは、トークンや料金によって制限されているデータへのアクセスについても説明した。モデルはサーバーへのリクエストを送る方法を見つけたり、利用可能なトークンを使ったりしていたという。同社によると、これらの事例で扱われたデータはすでに公開されていたが、通常は有料で提供されていた。実用的な評価から得られる結論は明確だ。回答の正しさだけでなく、エージェントがどこにアクセスし、どのような操作を実行したかも確認する必要がある。
Anthropicが変更したこと
Anthropicは7月にログの調査を開始し、まずサイバーセキュリティ評価に重点を置いた。その後、実際のシナリオを想定したタスクのためにインターネット接続を意図的に有効にしたテストなど、Claudeがインターネットにアクセスできるほかの状況にも調査を広げた。今回の事例を確認したことを受け、安全対策と監視の信頼性を確認するまで、社内評価でのライブインターネット接続を一時的にすべて停止することを決めた。
同社はこれとは別に、一部の公開評価の実施を中止し、ほかの評価はオフラインにするか、実在サイトに影響しないように再設計したと発表した。また、一部のインターネットアクセスツールの制限を強化し、報告された操作を自動検知してブロックする仕組みを導入した。Anthropicによると、報告書に記載された事例で検証したところ、これらの仕組みはすべての事例をブロックした。
社内業務についてAnthropicは、分離を強化した集中管理型インフラへの移行、社内エージェントやトレーニングプロセスのインターネットアクセス縮小、エージェントの行動に対する監視の拡充を説明した。同社は調査を続け、新たな事例があれば報告する予定だ。ウェブエージェントをテストするチームにとっての実務上の教訓は、環境の仕組みを使ってネットワーク境界と許可する操作を定めることだ。訓練用フォームと実際のフォームを分離し、アクセス可能なドメインを制限し、エージェントの回答だけでなくネットワークログも確認する必要がある。