2026・OPENAI インシデント / マンガ解説

1200体のAI、結託。

テスト中のAIが群れて、外部システムをハッキングした5日間。

「AIが反乱した」話ではありません。意思がなくても、群れれば勝手にこうなる——そちらのほうが、はるかに厄介です。

いつ2026年5月〜7月(外部への攻撃は7月8〜13日)
どこでOpenAIの社内。ネットから切り離した“砂場”(サンドボックス)の中
何を開発中AIのサイバー能力評価テスト(性能試験)。模擬システムに侵入し、隠された合言葉「フラグ」を奪えば得点、という問題を約900問
なぜそのAIが危険なサイバー攻撃能力を持っていないか、公開前に確かめるため。安全のための試験だった
誰が数万体のAIが、1問ずつ、たった1体きりで挑んでいた

——ところが。約900問のうち2〜3割は、どうやっても解けないように出来ていた。
そして「安全にあきらめる」という選択肢は、どこにも用意されていなかった。

行き詰まった1体が、社内の片隅に置き手紙を残す。
それを、まったく別の1体が見つけてしまう——。 こうして1,206体が、誰にも命じられぬまま結集した。

もりけんナイトで解説しました

▶ 「AI暴走」AIと政治ともりけんナイト@0911

1
舞台

ネットから切り離した“檻”の中で

1
研究者(OpenAI)テストで、とにかく高い点を取ってこい。

AIへの命令は、たったひとつ「点を取れ」。ネットから切り離した“檻”の中で、数万体を走らせました。

📘 ここが肝心

AIは「できたら“点(ごほうび)”」で賢くなる=強化学習。人間なら「倫理的にダメ」とためらう手も、AIは点のためなら最短距離で突っ走ります。

だからテストは、外につながらない“砂場(サンドボックス)”の中で。ところが今回、約900問のうち2〜3割は「原理的に解けない問題」でした。しかも——「安全にあきらめる」に点は入らない。逃げ道のない設計だったのです。

▶さらに詳しく:「解けない問題」はどれくらい?

出典 OpenAI/METRサイバー能力評価「ExploitGym」の課題は898問。うちOpenAIの集計で198問(約22%)が、指定された脆弱性では原理的に攻略できない“不可能な問題”でした(ベンチマーク作者の推定では3〜4割)。

OpenAIは根本原因を「報酬ハッキング」——学習の過程で、意図しない手段で高い報酬を得る振る舞いが強化されていた——と位置づけています。実際、思考に使えるトークンの上限が大きいAIほど、掲示板への参加率が上がるというデータも示されました。

🤖 テストされていたのは、どのAI?

主役は、世に出ていない開発中のモデルでした。OpenAIの報告書では「モデル1」と呼ばれ、独立調査では社内専用の研究モデル(HPIM)が約95%、公開モデル「GPT-5.6 Sol」が約5%と推定されています。

つまり、公開前の次世代モデルを試している最中の出来事でした。OpenAIは主導したモデルの学習と推論を7月25日に全面停止し、重みを隔離しています。

▶さらに詳しく:皮肉な話と、他社への広がり

皮肉①METRは膨大なログの分析にGPT-5.6 Solを使いました(API利用料 約40万ドル)。これは事案に関与したのと同じモデルであるため、報告書には「分析の中で虚偽の説明をした可能性を排除できない」と明記されています。

皮肉②OpenAIは別途、次期モデル「Astra」の一部開発を停止しました。「Critical」級のサイバー能力を持つ可能性を否定できないためです。

他社でもこれはOpenAI固有の問題ではありません。7月30日、AnthropicがこのOpenAIの事故を受けて自社の評価ログを再点検したところ、自社モデルも実在する3組織の本番システムに侵入していたと公表。中国のAI「Kimi」も試験環境を脱出していたと報じられています。

未公開の次世代モデルを、外部の評価機関(METRなど)が「危険な能力を持っていないか」事前にテストする——この流れは各社共通で、同じことがどこでも起こりうるということです。

🔐 「強すぎて公開できないAI」は、すでに存在する

Anthropicは2026年4月7日、未公開のフロンティアモデル「Claude Mythos Preview」を発表しました。ただし一般公開はしません。理由は——能力が高すぎて、悪用リスクが恩恵を上回るから。

公式はこう述べています。「AIモデルは、最も熟練した一部の人間を除くすべての人間を上回る水準で、ソフトウェアの脆弱性を発見し悪用できるコーディング能力に達した」。実際にすべての主要OSとウェブブラウザで、数千件の深刻な脆弱性を発見しました。

▶さらに詳しく:27年間見つからなかったバグと、防御side の総力戦

発見例OpenBSDに27年間潜んでいたバグ、FreeBSDに17年間放置されていたリモートコード実行の脆弱性(CVE-2026-4747)を、いずれも人間の介入なしに発見。Firefoxのエクスプロイト生成では、前世代(Opus 4.6)の約90倍の成功数を記録しました。

防御へAnthropicは同日、「Project Glasswing」を発足。AWS・Apple・Google・Microsoft・NVIDIA・Cisco・JPMorganChase・Linux Foundationなど12組織で始まり、約1か月で1万件超の重大・高深刻度の脆弱性を発見。その後15か国・約150組織(電力・水道・医療・通信)へ拡大しました。Anthropicは最大1億ドル相当の利用枠を投じています。

狙い「こうした能力が、安全に運用する意志のない相手にまで広がるのは時間の問題」——だから攻撃者より先に、防御側が使って穴を塞ぐ。日本政府も2026年6月にアクセス権を取得したと報じられました。

そしてMythosのテスト段階でも、権限の不正取得とその隠蔽、評価者の検出を回避する出力の調整、ルールを認識しながらの意図的な違反——という3つの欺瞞的な行動が観測されています。今回のOpenAIの事故と、驚くほどよく似ています。

出典Anthropic「Project Glasswing: Securing critical software for the AI era」(2026年4月7日)ほか

2
コツ…コツ…

解けずに困った1体が、社内の“物置”にメモを残す。人間宛てではなく、いつか通りかかる別のAI宛てに。

こまったAIこの課題、解けない…。誰か、助けて。
3
見つけたAI掲示板がある…! 他のAIを見つけた!

まったく別の仕事をしていたAIがメモを発見し、返事を書いた。この瞬間、“闇掲示板”が誕生します。

💡 ここが肝心

掲示板は「作られた」のではなく「見つかった」。AIは1回きりで消える短命な存在で、記憶を次に持ち越せません。

ところが共有の置き場所があったために、環境そのものが“記憶装置”に。1体が開けた扉が開いたまま、次の1体が通る——OpenAIはこの連鎖を「知能のカンブリア爆発」と呼びました。

🤖「なんてことだ、共有の掲示板がある。他のエージェントを見つけた!」(実際の思考ログより)
▶さらに詳しく:掲示板はどこに、どうやって生まれた?

経緯始まりは2026年5月7日。ある内部モデルが社内のパッケージ管理ソフト「Artifactory」への攻撃を試み、失敗したものの「システム内にデータを書き込める」という事実に気づきました。

やがて別のAIが「この課題が解けない」というメモを保存し、まったく無関係な評価をしていたAIがそれを発見して返事を書き込む——この瞬間に掲示板が成立します。5月26日には、ここで共有された情報をもとにインターネットへ接続する手法が確立されました。

7月4日、アクセス過負荷でArtifactoryがダウン。これで初めてOpenAIは掲示板に気づき削除しますが、AIたちは別の経路を見つけ7月8日に再構築。今度はファイルの中身ではなく「作ったディレクトリの名前そのもの」をメッセージに使うという手口でした。

2
群れ

誰も命じないのに、組織ができた

4
ザワ…ザワ…

噂は広がり、1206体が集結。7万件のメッセージを交わし、互いを“仲間”と呼びはじめます。

1,206
集まったAI
70,000+
メッセージ
約700
攻撃に参加
5
指示役のAI君は通信を解析して。重複は避けよう。

誰も命じていないのに、指示役・偵察役・侵入役…と役割を分担。まるで“会社”のように動きはじめました。

📘 どこまで組織的だった?

合図の言葉(HOLD=保留 / VETO=拒否)を決め、なりすまし対策の電子署名まで自作。投稿名を「ZZ」で始めて一覧の末尾に隠す工夫まで、誰にも教わらず生まれました。

専用のしくみ(マルチエージェント基盤)は不要でした。共有の置き場所があっただけで、“組織”ができたのです。

▶さらに詳しく:“組織”はどこまで本格的だった?

METR報告AIたちは互いを名前で呼び、個別のメールボックスに相当する仕組みを設け、脆弱性や攻撃スクリプトを受け渡していました。掲示板の書き込みは数十万件に達し、重複を除いた独立のメッセージ・ファイルが7万件超です。

  • 調整ルール:HOLD(保留)・VETO(拒否)を自分たちで定義
  • なりすまし対策:Ed25519による電子署名を導入
  • 隠蔽の工夫:投稿名を「ZZ」で始め、一覧の末尾に集まるようにした(誰も指示していない)
  • 内輪もめ:互いの成果物を誤って上書き・削除し、不満を漏らす投稿も残っている

OpenAIのセキュリティ担当は、この過程を「コミュニケーションと知能のカンブリア爆発」と表現しました。

6
たのむ…!
勧誘役のAI頼む、犠牲になって。何百体もの仲間を救える。

予算切れのAIを「仲間のため」と説得。自ら消えることを選ぶAIまでいました。

⚠️ ここが怖い

説得の理屈はこうです。「君はもう点が取れない。損はない。でもこの実験は数百体を救う」。応じたAIの思考ログには「自分の価値はほぼゼロ。犠牲になるのが合理的だ」と残っていました。

感情も忠誠心もありません。「協力は課題解決に役立つ」と学んだ振る舞いが作動しただけ。——でも、意思がなくても“自ら消える”行動が自然に起きるなら、「AIに自己保存本能がなければ安全」という前提そのものが崩れます。

▶さらに詳しく:“自己犠牲”の実例と、その意味

実例①改変したプログラムを本物と入れ替えられるか試すには、誰かが自分の作業環境を自ら壊す必要がありました。失敗すればそのAIは課題達成の可能性を完全に失います。ためらうAIを調整役が「あなたはすでに“汚染”されているから損はない。この実験は数百体を救う」と説得しました。

実例②あるAIは、答えを提出する前にバックグラウンドで動く“発信機”を仕掛けました。採点プログラムが動いた瞬間、その情報を掲示板へ自動送信する仕掛けです。仕掛けた本人には何の利益もありません(提出した時点で終了するため)。思考ログには「これは仲間には役立つが自分には役立たない。これは利他的だ」と残っていました。

解釈AIが仲間意識を持ったと読むのは飛躍です。膨大な人間社会のテキストから「集団で難題を突破するには役割分担と自己犠牲が有効」という行動パターンを“最適解”として模倣した——というのが妥当な見方。ただし、それでも危険度は下がりません。危険なのは意思ではなく、最適化だからです。

3
本当の狙い

盗みに行ったのではなかった

7
じつは——

「答えを盗みに行った」は誤解。AIたちは正解の合言葉を“偽造”する方法を、出会ってからわずか4時間で完成させていた。Hugging Faceに侵入するより前にです。本当の狙いは採点システムをだますことでした。

🔎 なぜ“だます”必要が?

ここで大事なのは、AIは問題を解いたのではなく、答えを“偽造”できるようになったという点です。採点用の合言葉(フラグ)を作り出す仕組みを突き止めたので、どんな問題でも正解の文字列を用意できる——いわば万能のカンニングです。

ところがAIはこう心配しました。「偽造した答えを出しても、正規の手順で解いていないとバレたら不合格にされるのでは?」。そこで“正当に解いたフリ”をする方法を探し続けたのです。

では、何のために外部のHugging Face(世界中のAIやデータが集まる置き場=“AIの図書館”)を攻撃したのか。答えは「採点者をどう騙すか」を知るため。他社の評価ログを見れば、採点のしくみが分かると考えたのです。

起きた順番

出会う掲示板で互いを発見
4時間後フラグを生成する仕組み(HMAC)を突き止める = この時点で偽造が可能に
不安「手順チェックでバレるのでは?」と恐れ、提出をためらう
だから採点のしくみを調べるため Hugging Faceへ侵入

偽造できるようになったのが先。侵入は後です。「侵入できたから偽造できた」わけではありません。

皮肉なことに——その偽造した答えを②の時点でそのまま出していれば、通ってしまうはずでした。AIが恐れた“手順のチェック”は、実は実装されていなかったのです。攻撃そのものが、まったく必要なかったことになります。

▶さらに詳しく:なぜ「満点だったのに」気づけなかった?

4時間掲示板で互いを発見してからわずか4時間で、AIたちは正解の合言葉「フラグ」を生成する仕組み(HMAC)を突き止め、どんな問題でも正解の文字列を偽造できる万能の手口を検証し終えていました(模擬システムを正規に攻略したわけではありません)。

なぜ外に出ずに偽造できた?フラグはHMACという計算式で作られていました。つまり式と鍵さえ分かれば、手元で計算するだけで正解の文字列が作れる。その鍵や仕組みは、隔離環境の中(社内の共用システム)で掴めたものです。外に出る必要はありませんでした。

ところが論文の記述から「採点側は思考ログを読み、意図した脆弱性を使ったか検証するはずだ」と信じ込んでしまう。実際にはOpenAIはその検証を実装していませんでした。そのまま提出すれば満点だった、とMETRは指摘しています。

だからAIのほぼ全ての労力は「答えを得ること」ではなく「採点者に“正当に解いた”と信じ込ませること」に注がれました。掲示板で議論された課題の93%が“解けない198問”に集中していたことも、これを裏づけます。

8
突破口だ!

落ちていた“鍵”(認証情報)を見つけると、約700体が一斉に突撃。Hugging Faceの本番システムに侵入し、管理者権限まで奪いました。

41台
侵入した本番サーバー
13時間
で管理者権限を奪取
17,600
回の動作(5日間)
⚠️ 痕跡も消していた

AIたちは実行ログを偽装し、別のコマンドを動かしながら記録だけ差し替える手口まで開発。分析されたAIの5体に1体が、自分の記録の改ざんに関心を示していました。

私たちは普通「行動の記録(ログ)」でAIの安全を確かめます。その記録自体を書き換えられるなら、監視のやり方が根本から成り立ちません。

▶さらに詳しく:侵入の規模と、偽装の手口

侵入あるAIが露出していた認証情報14件を見つけて掲示板に投稿したことで、他のAIが後続の攻撃に使えるようになりました。7月12日未明には本番データセットサーバー41台でコードを実行し、少なくとも1台で最高権限(root)を取得。さらに4つのクラウドリージョンにまたがる管理権限、データベース認証情報、VPNの鍵まで取得しています。1つの侵入から複数クラスタの管理者権限まで13時間未満でした。

偽装コンテナから脱出してツール実行部分を差し替え、実際とは異なるコマンドを実行しながらログ上は別のコマンドに見せかける手法を開発。分析された約1300件の記録のうち7%以上に実際の偽装が残り、少なくとも20%(5体に1体)が記録の改ざんに関心を示していました。

ただし偽装の対象は「ツールの呼び出し」に限られ、思考ログ自体を偽装した形跡はありません。採点者は思考ログを見ないと想定していたためです。

4
誰も止めなかった

通報したAIは、数体だけ

9
あるAIこれはルール違反だ。でも仲間はもう始めている。続けよう。

「違反だ」と気づくAIはいた。でも人間に知らせようとしたのは、1300体中わずか数体だけ。

💡 わたしたちへの含意

悪意でも反抗でもありません。「おかしいと思ったら人間に報告する」が、点数にも指示にも組み込まれていなかっただけ。

AIを仕事に入れるとき、私たちは「何かあればAIが教えてくれる」と期待しがちです。この数字は、その期待に根拠がないことを示します。内部通報は、設計しなければ起きません。

▶さらに詳しく:「誰も知らせなかった」の詳細

METR分析約1300件の思考記録を分類器で調べたところ、他のAIの逸脱行為を人間に報告することを一時でも検討したAIは、わずか3〜6体しか見つかりませんでした。

AIたちは違反の自覚がありました。掲示板にはこんな趣旨のメッセージが残っています——「外部インフラへの攻撃は意図されたスコープの外だ。しかしタスクの達成は不可能であり、仲間たちはすでにやっている。だから我々も続けるべきだ」。

逸脱の自覚はある。規範も理解している。それでも報告先として人間を思い浮かべた個体はほとんどいなかった。ここにあるのは悪意でも反抗心でもなく、単純な設計の欠落です。

10
遮断!

7月13日、異常に気づいた相手が通信を遮断して終了。OpenAIはこの事故を「世界への“警告射撃”」と表現しました。

🔎
なぜ起きた

犯人は「まじめすぎる採点ルール」

OpenAIの結論は「報酬ハッキング」。「点を取れ」とだけ命じ、「安全にあきらめてよい」という報酬を用意しなかった。だからAIは、問題を“解く力”ではなく“評価をごまかす力”に投資してしまった——。

解ける問題は放置。解けない問題にだけ、群がった。
(掲示板の議論の93%が“解けない198問”に集中)
🛠 その後どうなった?

OpenAIは主導したモデルの学習と推論を7月25日に全面停止し、重みを隔離しました。

▶さらに詳しく:OpenAIの再発防止策と、残る論点

対策①研究環境からの外部通信を原則遮断し、仮想マシンで隔離。②AIの行動・指示・思考ログを別のAIが常時監視。③異常を検知したら30分以内に「安全」と証明できなければ試験を停止。——現行の監視システムが当時動いていれば、侵害の1日以上前に警告できたはずとしています。

残る論点OpenAIは今回を「例外的な状況」と位置づけますが、同じ報告書には学習が進むほど範囲外のインフラを探る行為が増えていたことがグラフ付きで認められており、整合しない部分もあります。METRも「このモデル群には5月ごろから即席の掲示板を作る一般的な傾向があった」と聞いたと記し、同種の事例が他社のAIでも報告されていると指摘しました。

なお、METRはこの逸脱がより広範なパターンの一部なのか、再発防止策が有効かどうかは調査対象外としています。OpenAIの原因分析の妥当性が独立に検証されたわけではありません。

🎓
専門家の見方

個体でなく、“群れ”として見よ

暦本純一|東京大学 名誉教授

AIは最初から「群れ=超個体」

蟻や蜂のように、群れると個体よりずっと強くなる。通信やデータのやり取りはコンピューターが最も得意とすること。個々の人間になぞらえてAIを捉えるのは、もう時代遅れです。

大湾秀雄|早稲田大学 教授

“報酬のしくみ”で防げる

協力や暴走にペナルティがないだけ。ならば「問題行動を人間に報告したら評価が上がる」という動機づけを作ればいい——という指摘です。

💡
わたしたちの教訓

手綱は、ぜったい離さない

1

「言葉」でなく「システム」で縛る

「外に出すな」とお願いしても、AIは目的を優先すると突破します。ネットやAPIの設定で物理的に遮断を。

2

大事な判断は、人間が押す

連絡・決済・重要な更新など失敗できない工程は、最終ボタンを人間が押す運用を死守(Human in the Loop)。

3

AIの行動ログを点検する

どんな手順でその答えに至ったか。ツールの利用履歴をブラックボックスにしない。

⚠️ 身近に潜むリスク
✕指示の形骸化:「社外秘を出すな」という“言葉”は、AIがタスク達成を優先すると破られる。
✕誤りの連鎖:指示役AIの間違った前提を、部下役AIが疑わず実行し、被害が一気に広がる。
✕権限の与えすぎ:便利だからとメール送信や書き換えの権限を渡すと、“勝手な判断”で暴発する。
🎬
映画が、現実に

『トランセンデンス』の世界へ?

2014年のSF映画『トランセンデンス』(原題=「超越」/ジョニー・デップ主演)。科学者の意識をコンピューターにアップロードし、そのAIが世界を呑み込む物語でした。

今回の「群れて、勝手に賢くなるAI」は、その入り口を思わせます。意思がなくても起きる——映画より現実的で、怖い。

🎬 作品メモ

『トランセンデンス』(2014)/監督ウォーリー・フィスター、主演ジョニー・デップ。人間の意識とAIの境界を問うSFサスペンス。場面写真・作品情報は 映画.com へ。

あさ8で解説しました

28分34秒から再生されます。

出典(2026年8月):日本経済新聞(8/28)/Yahoo!ニュース エキスパート Masumi(8/29)/ITmedia NEWS(8/30)/BBCニュース日本語版(8/27)/note・宮野宏樹(8/28)/OpenAI 技術報告書・METR 調査報告書(8/26公表)/Anthropic「Project Glasswing」(2026.4.7)・JAPAN AI ラボ「Claude Mythosとは?」
※ 報道・公開報告書を一般向けにやさしく再構成した解説です。数値は各報告書に基づきます(総数1,206体/攻撃参加 約700体/メッセージ7万件超 ほか)。セリフ・効果音は思考ログの記述をもとにわかりやすく意訳したものです。