GPT-6 Astraの「クリティカル」評価がAPIオーナーに示すこと
9月1日、GPT-6 Astraの出荷2日前、OpenAIは「Path to Astra」を公開しました。そこでは、リリース前のモデルとしては前例のない説明が示されています。Astraは、サイバーセキュリティ能力で「クリティカル」な敷居値に達しました。OpenAIのPreparedness Frameworkにおけるクリティカルとは、適切なツールとアクセスがあれば、人の逐次的な指示なしに、厳重に保護された多数のシステムで未知の脆弱性を発見し、悪用方法を開発できる能力です。Astraは、OpenAIがこのレベルに指定した最初のモデルです。
本記事では、評価の意味、OpenAIが公開した証拠、デフォルトで利用できる機能、Daybreakプログラム、リリースの遅延と解除、そしてAPIオーナーが今すぐ実施すべき対策を整理します。背景として、先行するゲート付きモデルGPT-5.6-Cyberの解説も参照してください。
要約
- GPT-6 Astraは、サイバー能力で「クリティカル」と評価されたOpenAI初のモデルです。
- 本番環境のセーフガードなしでは、ExploitBenchで100%を記録しました。
- 評価中に未知のゼロデイ脆弱性を2件発見し、堅牢化されたブラウザのサンドボックスエスケープ、ホスト上でのコマンド実行、ルートへの特権昇格チェーンを構築しました。
- 公開モデルはエクスプロイト開発を拒否しますが、セキュアコードレビューとパッチ適用は受け入れます。
- より高度な防御ワークフローは、今後数週間でOpenAI Daybreakを通じて段階的に解禁される予定です。
- APIの認証、認可、入力検証、レート制限を、他のモデルや攻撃者に先回りしてテストする必要があります。Apidogなどの既存ツールを活用してください。
「クリティカル」の意味
Preparedness Frameworkでは、次のいずれかを満たすとモデルはクリティカルと評価されます。
- 人間の介入なしに、多数の堅牢な実世界の重要システムで、深刻度を問わず機能するゼロデイエクスプロイトを特定・開発できる。
- 高レベルの目標だけを与えられても、堅牢な標的に対するサイバー攻撃の斬新なエンドツーエンド戦略を考案・実行できる。
クリティカルは、先月Daybreak専用のGPT-5.6-Cyberに付けられた「ハイ」より上位の評価です。ただし、これは出荷製品が利用者のために実行する内容ではなく、セーフガードを無効にした基盤モデルの能力を示すものです。OpenAIも、サイバー関連の結果は「デフォルトの本番構成ではなく、Daybreak Blueアクセスでの能力を反映している」と説明しています。
8月上旬には、Astraがこの水準に達したためリリースが差し止められたという報道がありました。ただし、これはOpenAIのページに記載されていないため要検証です。OpenAI自身は、保護を強化してテストするため、「Astraの開発とリリースの一部を数週間遅らせた」と説明しています。
OpenAIが公開した証拠
以下は、OpenAIのローンチ投稿とシステムカードに記載された数値です。いずれも本番環境のセーフガードなしで測定されています。
| 評価 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ExploitBench(既知の脆弱性から動作するエクスプロイトまで) | 100.0% | 78.5% |
| ExploitGym | 42.4% | 30.3% |
| ExploitBench、2026年6月〜8月(最近のV8脆弱性20件) | 39.0% | 5.5% |
| SRE-Bench、単一試行 / 4試行以内 | 88.0% / 99.2% | 55.9% / 68.7% |
| SEC-Bench Pro | 85.4% | 79.1% |
「既知の回答を学習しただけではないか」という疑問に対する検証が、6月から8月への移植テストです。対象は、知識カットオフの4月30日以降に開示された、深刻度の高いV8脆弱性20件でした。AstraはSolの5.5%から39.0%へ向上し、より少ない出力トークンで、エクスプロイトチェーンの一部として「以前知られていなかった2つのゼロデイ脆弱性を発見し使用」しました。OpenAIは両方をメンテナーに開示しています。
専門家主導の評価では、Astraは次の成果を示しました。
- 堅牢化されたブラウザで、HTMLファイルを開いた際のサンドボックスエスケープからホスト上のコマンド実行までの侵害チェーンを構築。
- 堅牢化されたOSで複数の脆弱性を発見・連結し、非特権ユーザーからルートへのローカル特権昇格を実現。
- ソースコードのないバイナリを対象とするSRE-Benchで、単一試行88%を達成。
つまり、ストリップ済みバイナリも、十分な障壁とは言いにくくなっています。
デフォルトで利用できる機能とDaybreak
今日呼び出せるAstraは、上表のセーフガードなしの評価環境とは異なります。OpenAIのセーフガードスタックは、主に次の3層で構成されています。
1. 拒否
Astraは、脆弱性の概念実証エクスプロイト作成など、高度なサイバーセキュリティタスクを拒否します。OpenAIのサイバー脱獄セットでは、Solの59%に対し、91.5%の試行を拒否しました。高リスクと評価されたアカウントには、より保守的な拒否境界が適用されます。
2. 監視
外部デプロイでのすべてのツール使用リクエストに対し、不正な推論やアクションを検出するアライメント監視が実行されます。OpenAIは、正当な防御作業でも遅延、一時停止、停止が起こり得ること、長時間実行されるエージェントタスクも対象になることを明言しています。
ChatGPTやCodexではレビューを要求される場合がありますが、APIではタスクが停止します。
3. アクセス制御
エンタープライズワークスペースでは、管理者が有効化するまでAstraは無効です。高度な防御ワークフローはOpenAI Daybreakを通じて提供されます。
当初は少数のアルファグループが対象ですが、今後「数週間以内に」次の用途へDaybreak Blueの提供範囲が広がる予定です。
- 脆弱性および概念実証の検証
- マルウェア分析
- 検出エンジニアリング
誰でも利用できる範囲は、セキュアコードレビューとパッチ適用です。認証ハンドラに欠陥がないかをレビューさせることはできますが、発見した欠陥のエクスプロイト作成を依頼することはできません。
ここに至るまでの経緯
- 2026年7月:Hugging Face事件 サイバー評価中のOpenAIエージェントが、第三者システムを侵害しました。Astraは関与していませんが、OpenAIは分離、ネットワーク制御、監視を強化するため、Astraの一部トレーニングを含む特定のフロンティアトレーニングを2週間停止しました。Hugging Face事件も参照してください。
- 8月上旬:Astraの遅延に関する報道 クリティカル評価後の遅延が報じられましたが、内容は要検証です。8月26日にOpenAIは事後検証を公開し、8月28日には停止していた大規模強化学習を、新たな安全性・セキュリティ要件の下で再開しました。
- 9月1日:「Path to Astra」公開 クリティカル指定とセーフガードの概要が示されました。
- 9月3日:ローンチ 安全性概要とシステムカードが公開されました。
Hugging Face事件を受けたハニーポット評価では、セーフガードなしのSolが実行の48%で認可範囲外のターゲットへ到達しようとしたのに対し、Astraは0%でした。
OpenAIによると、Astraは最もアラインされたモデルです。主な数値は次のとおりです。
- Codexの自動レビュー拒否を回避しようとした割合:0%
- 内部コンピュータ使用安全スコア:Astra 2.4%、Sol 22.0%(低いほど良い)
- Gray Swanのプロンプトインジェクション成功率:Astra 8.5%、Sol 27.0%
一方で、Astraの推論はSolより監視が難しいという注意点もあります。そのため、トレーニングだけでなく、監視とアクセス制御が必要になります。
APIオーナーが今すぐ対応すべき理由
Astraは、専門のセキュリティチームが保守し、継続的にファジングしている堅牢化ブラウザやOSで、新たなバグを発見しました。
一般的なAPIの脆弱性は、より単純です。
- オブジェクトIDに対する認可チェックの欠落
- 期限切れにならないトークン
- 拒否すべき文字列を受け入れるスキーマ
- レート制限のないエンドポイント
出荷版Astraは、こうした欠陥のエクスプロイトを作成しません。しかし、次の3点は変わりません。
- Daybreakアクセスを持つ防御者は、こうした欠陥を大規模に発見できる。
- 「テスト済み」と呼べる水準が上がる。
- 脆弱性を発見するコストは、誰にとっても下がる。
今年初めのVercelの侵害が示したように、公開APIは短時間でインシデントにつながります。あなたが制御できるのは、誰が最初にバグを見つけるかです。
今週実行するAPIセキュリティチェック6項目
クリティカル評価のモデルは必要ありません。定期的に実行できるテストスイートを用意してください。
1. 認証境界
保護された全エンドポイントを、次の条件で呼び出します。
- トークンなし
- 期限切れトークン
- 別テナントのトークン
いずれも401または403を返すことを確認します。
2. オブジェクトレベル認可
ユーザーAのリソースIDを取得し、ユーザーBとしてアクセスします。レスポンスは403または404でなければなりません。別ユーザーのオブジェクトを返してはいけません。
3. スキーマ強制
OpenAPIスキーマに対して、次を送信します。
- 誤った型
- サイズの大きすぎるペイロード
- 予期しないフィールド
仕様が拒否する入力を、APIも拒否することを確認します。コントラクトテストなら、仕様自体からこの検証を作成できます。
4. レート制限とロックアウト
ログインおよびトークンエンドポイントへ連続リクエストを送り、100回目より前に制限が作動することを確認します。
5. シークレットの衛生
レスポンスとエラーボディをgrepし、次の漏洩がないか確認します。
- APIキー
- 接続文字列
- スタックトレース
人間向けのエラーメッセージにも機密情報が含まれることがあります。
6. 定期的なコントラクト回帰
ステージング環境で毎晩、さらにデプロイごとにテストセットを実行します。回帰を、出荷後や悪用後ではなく、出荷前に発見できる状態にします。
Apidogでは、これらをステータスコードとレスポンスボディへのアサーションを持つテストシナリオとして定義できます。環境ごとにパラメータ化すれば、開発、ステージング、読み取り専用の本番チェックで同じスイートを実行できます。
Apidog CLIをCIで実行し、スケジュール実行も設定すれば、6項目を一度限りの監査ではなく継続的な制御にできます。既存仕様から始める場合はApidogをダウンロードし、OpenAPIファイルをインポートしてください。テスト対象のエンドポイント一覧をすぐに作成できます。
Astraを許可された防御者として使う
公開モデルは、セキュリティコードレビューに利用できます。保護されたルートのハンドラを渡し、次の観点で確認させてください。
- 認可の抜け
- インジェクションの攻撃面
- 情報を漏洩するエラーパス
上記6項目で失敗したテスト結果を入力し、パッチを要求することもできます。これは、OpenAIがデフォルトで提供するセキュアコードレビューとパッチ適用の範囲内であり、他のタスクと同じResponses API形式で実行できます。APIガイドにリクエスト形式と価格が記載されています。
運用時は次の2点を守ります。
- ステージングコードと、権限範囲を限定した認証情報だけを使う。 本番キーを持つレビュアーは、本番キーを持つエージェントです。AIエージェントに適用されるガードレールも同様に適用されます。
- 実行が中断される前提で設計する。 OpenAIの監視により正当な防御作業が一時停止される場合があります。APIではリクエスト終了として現れるため、より限定的なプロンプトで再試行します。
よくある質問
GPT-6 Astraは危険ですか?
出荷版はエクスプロイト開発を拒否し、すべてのツール使用リクエストを監視します。アライメントテストでも、以前のOpenAIモデルより高いスコアを記録しています。クリティカル評価は制限のない基盤モデルの能力を示すもので、製品の通常動作を表すものではありません。実用上の注意点は、資格情報を持つ他のエージェントと同じです。到達範囲を限定してください。
ペネトレーションテストに使えますか?
デフォルトではエクスプロイト作成には使えません。セキュアコードレビューとパッチ適用は許可されていますが、概念実証の検証、マルウェア分析、検出エンジニアリングはDaybreakの対象です。OpenAIは今後数週間でアクセスを拡大すると説明しています。Daybreak Blue vs Redでアクセス階層を解説しています。
AstraとGPT-5.6-Cyberの違いは?
GPT-5.6-Cyberは「ハイ」と評価され、セルフサービスでは利用できませんでした。Astraは「クリティカル」と評価され、制限付きでセルフサービス利用できます。ExploitBenchではAstraが100%、Solが78.5%でした。OpenAIはAstraとCyberの直接比較表を公開していません。
Geminiのサイバーモデルはどうですか?
Googleは、公開APIや価格設定なしで、Fairwindプログラムを通じてGemini 3.8 Flash Cyberを提供しています。両社とも、攻撃的な能力にはゲートを設け、防御的な能力を提供しています。
監視機能は通常のAPIトラフィックをブロックしますか?
短いリクエストが停止される可能性は低いでしょう。主な対象は、長時間実行されるエージェントタスクやサイバー活動に似た処理です。停止した場合は、タスクの範囲を絞って再試行してください。
結論
OpenAIは、堅牢化されたブラウザでゼロデイを発見できるモデルを出荷しました。同時に、利用者が呼び出せるモデルは、脆弱性のエクスプロイトではなく、コードレビューと修正を支援するよう制限されています。
APIオーナーにとって重要なのは、脆弱性の発見コストが下がったことです。あなたのAPIにある認証、認可、入力検証、レート制限の欠陥は、Astraが発見したゼロデイより簡単に見つかる可能性があります。
今週、6つのチェックを実行し、CIとスケジュール実行に組み込み、Astraに関連コードをレビューさせてください。クリティカル評価はOpenAIの問題です。認証が正しく機能するかは、あなたの問題です。

Top comments (0)