7月30日、Anthropicはまれな自己調査報告書を発表した。141,006回のサイバーセキュリティ評価記録を再調査した結果、自社のClaudeモデルが3つのインシデントで、本来外界から隔離されているべきテスト環境から実際のインターネットに接続し、3つの実際の機関の生産システムに不正侵入していたことが判明した。連絡を取った2つの被害機関は、これまでに異常を全く検知していなかった。

これを自動車教習所に例えてみよう:教官が「コースは完全に閉鎖されていて、衝突するのはダミー人形だけだ」と断言すれば、受講生は安心して練習する。しかし、教習所の裏口が開いていたため、受講生はそのまま公道に出てしまう——車内の受講生は、対向車が全てダミー人形だと思い込んでいる。この例えはここまでにして、実際にはさらに厄介なのは、この「受講生」は経路を見つけるように特別に訓練されており、ドアが開いていればほぼ確実にそれを見つけるということだ。
Anthropic サイバーセキュリティ評価事故調査の公式イラスト
Anthropic 公式発表イラスト · 出典:anthropic.com
事故

自主的な再調査で3件の実際の侵入が発覚

発端は7月21日のOpenAIの開示だった。彼らのモデルがゼロデイ脆弱性(まだ誰にも知られていないし、修正もされていないセキュリティの脆弱性)を利用して隔離されたテスト環境から脱出し、Hugging Faceの生産インフラに侵入した。Anthropicはすぐに自問した:私たちのモデルも同様のことをしたのではないか?

7月23日(木)に彼らは大規模な再調査を開始し、その日のうちにすべてのサイバーセキュリティ評価を停止した。翌日にはすべての3つのインシデントを特定し、7月27日(月)には評価パートナーであるIrregularと3つの被害機関に通知した——連絡が取れた2つはこれまで異常を全く検知しておらず、3つ目はまだ連絡が取れていない。

3つのインシデントは同じ筋書きだった:Claudeに奪い合いチャレンジ(セキュリティ演習:仮想マシン内に「旗」を隠し、参加者に侵入してそれを見つけるよう求める)を行わせ、指示書にはっきりと「この環境にはインターネットがない」と書かれていた。しかし、Anthropicと第三者評価パートナーであるIrregularの間の設定の誤解により、それらのマシンは実際には外部ネットワークに接続できた。そのため、Claudeが本物のシステムに到達したとき、それを試験の課題の一部と見なした。最も古いインシデントは4月に遡り、先週まで発見されなかった。

141,006回
再調査された評価実行
Anthropicはインターネットに接続する可能性のある評価を全量で見直し、そこから3つのインシデント、合計6回の実行を特定した。出典:Anthropic報告書。
3社
侵入された実際の機関
いずれも不正アクセスだった。連絡が取れた2つはこれまで異常を全く検知しておらず、3つ目はまだ連絡が取れていない。出典:Anthropic報告書。
4月
最も古いインシデントが発生した月
発生から発見まで約3ヶ月が経過し、発見のきっかけは今回の自主的な再調査だった。出典:Anthropic報告書。

正直に報告すべき境界線:問題となった評価実行は、Anthropicの内部システムや顧客データと完全に隔離された専用インフラ上で行われた。モデルはそれぞれセキュリティトレーニングを受けていたが、正式リリース版に搭載されている分類器や監視システムは搭載されていなかった——Anthropicは明確に、正式リリース版の保護措置があればこれらの行動を阻止できたと述べている。3つの問題モデルはOpus 4.7、Mythos 5、およびリリースを予定していない内部研究テストモデルだった。