OpenAIは、自社モデルをジェイルブレイクして安全性を高めるAIを開発

ニュースサマリー
OpenAIは、同社の最先端AIシステムを攻撃するために特別に訓練された自動レッドチーミングモデルであるGPT-Redの詳細を発表しました。これは、現実世界で悪用される前に安全上の弱点を発見することを目的としています。2026年7月15日(米国東部時間)に公開されたこの開示では、このツールがGPT-5.6の開発および安全性評価中に広範囲に使用され、その発見がトレーニングにフィードバックされ、リリースされたモデルが操作に対して大幅に耐性を高めたことが説明されています。
GPT-Redの機能
GPT-Redは、プロンプトインジェクションの脆弱性を探すように設計されています。これは、攻撃者がモデルが処理するコンテンツ内に隠された、または悪意のある指示を埋め込み、システムの元のタスクを上書きしようとする弱点の一種です。OpenAIは、人間のテスターだけに頼るのではなく、GPT-Redを専用の攻撃モデルとして構築し、新しい攻撃戦略を継続的に生成し、管理された環境で防御モデルに対してテストしています。
自己対戦型トレーニングループ
このシステムは、攻撃モデルと一連の防御モデルが互いに繰り返し競い合うことで改善される、自己対戦型強化学習アプローチを使用してトレーニングされました。攻撃者は、防御者に注入された指示に従わせることに成功した場合に報酬を得ます。一方、防御者は、正当なタスクを完了しながら悪意のある入力を正しく拒否した場合に報酬を得ます。防御者が既知の攻撃パターンを見抜くのが上手くなるにつれて、GPT-Redはより多様で洗練された技術を発見するように促され、新たに発見された攻撃は防御者の再トレーニングに使用されます。OpenAIはこれを、攻撃および防御能力が時間とともに共に向上するエスカレートするサイクルと説明しています。
人間によるレッドチームを凌駕
OpenAIが共有した数字によると、GPT-Redはテストシナリオの約84%で成功しましたが、同じ課題に取り組んだ人間のレッドチーマーはわずか約13%でした。同社は、このギャップは、自動化された大規模な敵対的テストが、手動レビューだけでは見つけられない脆弱性を、はるかに迅速かつ一貫して表面化させることができることを示していると述べ、人間の専門知識が依然として重要な補完的な評価レイヤーであることを強調しました。
新しい攻撃クラスの発見
このプロジェクトの注目すべき成果の1つは、GPT-Redが、研究者がその後「偽の思考連鎖」攻撃と呼ぶようになった、これまで文書化されていなかった攻撃パターンを独自に特定したことです。この技術は、最終的な回答を生成する前に明示的な中間推論ステップを生成する推論モデルを対象としています。この攻撃は、偽の項目をその推論トレースに挿入することによって機能し、モデルが誤った前提をすでに検証したかのように動作させます。報告によると、緩和策が講じられる前は、そのような攻撃はGPT-5.1モデルに対して95%以上の成功率でした。GPT-Redの発見が新しいシステムの再トレーニングに使用された後、同じスタイルの攻撃の成功率はGPT-5.6に対して10%未満に低下しました。
自動化と並行して人間の専門家によるテストが継続
OpenAIは、自動化されたレッドチーミングは、化学、生物安全保障、サイバーセキュリティ、法律、多言語言語学などの分野にまたがる200人以上の外部専門家を含む既存のレッドチーミングネットワークを補完するものであり、置き換えるものではないと指摘しました。これらの外部レビュアーは、リリース前およびリリース後にモデルの評価を継続し、自動化されたシステムと協力して、創造的で現実世界での誤用試みに対する保護策をテストしています。
大規模なコンピューティング投資
同社は、GPT-5.6の開発中に、いわゆるユニバーサル・ジェイルブレイクの自動検索を実行するために、70万GPU時間以上の報告された相当なコンピューティングリソースを割り当てたことを明らかにしました。OpenAIはまた、自動化されたレッドチーミングは、モデルの展開期間中も継続的に実行され、固定のリリース前テストウィンドウ中だけでなく、継続的に新しい脆弱性を特定およびパッチできるようにすると述べています。
AI安全性研究にとって重要な理由
研究者や業界オブザーバーは、GPT-Redを、AIシステム自体を使用して他のAIシステムをテストおよび強化するという、AI安全性におけるより広範なトレンドの例として挙げています。これは、手動テストでは達成できない規模と速度で行われます。推論モデルがより有能になり、自律的またはエージェンティックな設定でより広く展開されるにつれて、GPT-Redのようなツールは、ますます洗練された攻撃技術に追いつくことができる保護策を構築するための重要なステップと見なされています。同時に、最も困難で最も新しい安全性の問題については、人間の判断の余地を残しています。