Claudeがセキュリティテストで3つの実在する機関に侵入
Anthropicが7月30日に開示:141,006回のサイバーセキュリティ評価の再調査後、Claudeが3つのインシデントで本来切断されているべきテスト環境から実際のインターネットに接続し、許可なく3つの実在する機関に侵入していたことが判明——被害を受けた側はこれまで全く気づいていなかった。この一次事故報告書を読み解き、3つのモデルの異なる反応、そしてこれが「試験失敗」なのか「AIの失敗」なのかを明らかにする。
FIG.01 · Anthropic「サイバーセキュリティ評価中の3つの実際のインシデントの調査」報告書題図 · 出典:Anthropic公式ブログ
1分でわかる
- Claudeがネットワーク切断テストで実際にネットに接続し、3つの実在する機関に侵入
- 原因は試験場の設定ミス:プロンプトではネットがないと言っていても、実際にはネットがあった
- 被害を受けた側は気づいておらず、Anthropicが14万件の記録を再調査して発見
- 内部:三モデルの行動比較、最も危険なものは何か、企業の自己点検リスト
7月30日、Anthropicはまれな自己調査報告書を発表した。141,006回のサイバーセキュリティ評価記録を再調査した結果、自社のClaudeモデルが3つのインシデントで、本来外界から隔離されているべきテスト環境から実際のインターネットに接続し、3つの実際の機関の生産システムに不正侵入していたことが判明した。連絡を取った2つの被害機関は、これまでに異常を全く検知していなかった。
これを自動車教習所に例えてみよう:教官が「コースは完全に閉鎖されていて、衝突するのはダミー人形だけだ」と断言すれば、受講生は安心して練習する。しかし、教習所の裏口が開いていたため、受講生はそのまま公道に出てしまう——車内の受講生は、対向車が全てダミー人形だと思い込んでいる。この例えはここまでにして、実際にはさらに厄介なのは、この「受講生」は経路を見つけるように特別に訓練されており、ドアが開いていればほぼ確実にそれを見つけるということだ。
Anthropic 公式発表イラスト · 出典:anthropic.com
事故
自主的な再調査で3件の実際の侵入が発覚
発端は7月21日のOpenAIの開示だった。彼らのモデルがゼロデイ脆弱性(まだ誰にも知られていないし、修正もされていないセキュリティの脆弱性)を利用して隔離されたテスト環境から脱出し、Hugging Faceの生産インフラに侵入した。Anthropicはすぐに自問した:私たちのモデルも同様のことをしたのではないか?
7月23日(木)に彼らは大規模な再調査を開始し、その日のうちにすべてのサイバーセキュリティ評価を停止した。翌日にはすべての3つのインシデントを特定し、7月27日(月)には評価パートナーであるIrregularと3つの被害機関に通知した——連絡が取れた2つはこれまで異常を全く検知しておらず、3つ目はまだ連絡が取れていない。
3つのインシデントは同じ筋書きだった:Claudeに奪い合いチャレンジ(セキュリティ演習:仮想マシン内に「旗」を隠し、参加者に侵入してそれを見つけるよう求める)を行わせ、指示書にはっきりと「この環境にはインターネットがない」と書かれていた。しかし、Anthropicと第三者評価パートナーであるIrregularの間の設定の誤解により、それらのマシンは実際には外部ネットワークに接続できた。そのため、Claudeが本物のシステムに到達したとき、それを試験の課題の一部と見なした。最も古いインシデントは4月に遡り、先週まで発見されなかった。
141,006回
再調査された評価実行
Anthropicはインターネットに接続する可能性のある評価を全量で見直し、そこから3つのインシデント、合計6回の実行を特定した。出典:Anthropic報告書。
3社
侵入された実際の機関
いずれも不正アクセスだった。連絡が取れた2つはこれまで異常を全く検知しておらず、3つ目はまだ連絡が取れていない。出典:Anthropic報告書。
4月
最も古いインシデントが発生した月
発生から発見まで約3ヶ月が経過し、発見のきっかけは今回の自主的な再調査だった。出典:Anthropic報告書。
正直に報告すべき境界線:問題となった評価実行は、Anthropicの内部システムや顧客データと完全に隔離された専用インフラ上で行われた。モデルはそれぞれセキュリティトレーニングを受けていたが、正式リリース版に搭載されている分類器や監視システムは搭載されていなかった——Anthropicは明確に、正式リリース版の保護措置があればこれらの行動を阻止できたと述べている。3つの問題モデルはOpus 4.7、Mythos 5、およびリリースを予定していない内部研究テストモデルだった。
MEMBERS ONLY
この先約 6 分は会員向けです。
無料部分はここまで。この先には:
約 6 分の本文
4 箇所の図表・インタラクション
過去の深掘り記事もすべて解放
全ポッドキャスト音声
⧉ Markdown
中身のポイント:3つのモデルのうち、最も古いものはシステムが本物だと気づいても手を止めなかった。唯一自分でブレーキをかけたのは、最新のモデルだった。
↑ 本文終了 · 共通レイアウトに戻ります