GPT-6 AstraでAPIをテストするなら、画面ではなくコントラクトを渡そう
GPT-6 Astraの最大の特長は、コンピューターを操作できることです。単にデモをクリックしたり、ドロップダウンを操作したりするだけではありません。OpenAIのローンチポストによると、AstraはOSWorld 2.0でタスクあたり約40分、72.6%のスコアを記録し、フォーム入力、CRM更新、ソフトウェアのインストール、自社サイトのフロントエンドQAまで実行します。OpenAIはAstraを「世界最高のコンピューター使用モデル」と呼んでおり、今回のデモはその主張を裏付けています。
APIを構築・テストしているなら、Astraに画面をクリックさせるより、APIコントラクトを渡す方が実用的です。OpenAPI仕様は、画面よりも高速・低コストで、検証可能なインターフェースだからです。私たちは2日間のハンズオンテストで、Astraが自ら画面操作から仕様書ベースのアプローチへ切り替える様子を確認しました。
この記事では、その判断が正しい理由と、Apidogを使った構成方法を紹介します。
要約
- GPT-6 AstraはOSWorld 2.0で72.6%、ScreenSpot-Proで92.7%を達成しています。
- Codexハーネスは、GPT-5.6 Solの体験よりコンピューター使用タスクを1.9倍速く完了させます。
- ただし、画面操作は1タスクに数十分かかり、多数の画像トークンを消費します。
- 画面操作はUIテストには有効ですが、APIテストには適していません。
- 自分のAPIには、Apidog MCP Serverまたはファンクションツール経由でOpenAPI仕様を渡し、テストシナリオを生成しましょう。
- 生成したシナリオは、Apidog CLIからCIで実行します。
- コンピューター使用は、APIを持たないインターフェースに限定するのが基本です。
GPT-6 Astraでできるコンピューター操作
Astraの能力は「ウェブサイトを閲覧する」だけではありません。OpenAIは、次のような用途を挙げています。
- オンラインフォーム、CRM、カレンダーなどの定型業務
- ドキュメントエディタでの調査と下書き
- プロットを使った科学データ分析
- ChatGPTサイトでのウェブサイト構築・ホスティング
- 構築したサイトのフロントエンドQA
- KiCadでのプリント基板レイアウト
- Blenderでの家のモデリング
| ベンチマーク | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0(オフラインセット、部分スコア) | タスクあたり約40分で72.6% | タスクあたり約75分で65.7% | 70.2% |
| ScreenSpot-Pro(ツールなし) | 92.7% | 76.9% | - |
| Agents’ Last Exam | 59.3% | 53.6% | 55.5% |
| AutomationBench | 41.4% | 18.1% | 26.9% |
スコア以外に重要な点もあります。
- AstraはSolより約47%短い時間でOSWorldタスクを完了します。
- Agents’ Last Examの最高スコア設定では、Opus 5より約65%少ない出力トークンを使用します。
- OpenAIはCodexハーネスを更新し、Mind2Webのコンピューター使用タスクを現在のSol体験より1.9倍速くしました。
ループが速くなれば、その分だけコストも下がります。トークン単位で課金されるユーザーにとって、これは大きな改善です。
挙動も改善されています。Astraは、回答によって結果が変わる場合にだけ質問します。タスクの途中で指示を追加しても方向性を失わず、Codexでは、ユーザーの返答を必要としない作業を続けながら非同期で質問できます。
OpenAIの内部コンピューター使用安全性ベンチマーク(低い方が良い)では、Astraは2.4%、Solは22.0%でした。
40分の画面操作にかかるコスト
コンピューター使用は、次のループで動作します。
- スクリーンショットを取得する
- 推論する
- アクションを実行する
- もう一度スクリーンショットを取得する
スクリーンショットは画像入力として扱われ、各ステップで会話履歴も引き継がれます。40分のタスクでは数百ステップに達することもあります。
Astraの標準料金は次のとおりです。
- 入力: 100万トークンあたり10ドル
- 出力: 100万トークンあたり50ドル
- 272K入力トークン超過分: 100万トークンあたり20ドル
- キャッシュ済み入力: 100万トークンあたり1ドル
プロンプトキャッシュは繰り返し利用するプレフィックスに有効ですが、スクリーンショットは各ステップで新しくなります。履歴全体を長く保持するセッションでは、完了前にロングコンテキスト料金へ移行する可能性もあります。
一方、コントラクトベースのテストでは、OpenAPI仕様を1つのプレフィックスとしてキャッシュできます。モデルが生成する各テストは数百トークン程度のJSONで、生成後の実行はHTTPリクエストだけです。テストシナリオの実行にモデルは必要ありません。
中断という別のコスト
OpenAIの安全性概要によると、プロダクションのミスマッチモニターは「合法的な作業を遅延、一時停止、または停止させることがある」とされています。特に「エージェントが長時間稼働するタスク」が対象になります。
ChatGPTやCodexでは、アクションのレビューを求められます。APIではタスク自体が停止します。40分の画面操作セッションは中断の影響を受けやすい一方、5秒のAPI呼び出しは影響を受けにくい設計です。
コンピューター使用とコントラクトの使い分け
| 状況 | より良いツール | 理由 |
|---|---|---|
| 自社APIのテスト | 仕様書 | 決定的で、安価に再実行でき、実際のコントラクトを検証できる |
| CIのリグレッションスイート | 仕様書 | モデルを介さずシナリオを実行できる |
| APIを持たないサードパーティポータル | コンピューター使用 | 渡せるコントラクトがない |
| リリース前のフロントエンドQA | コンピューター使用 | テスト対象がUIだから |
| レガシーなデスクトップツール | コンピューター使用 | 画面しか存在しない |
| ドキュメントと実際の挙動の確認 | 仕様書、次にUI | ドキュメント化されたリクエストとレスポンスを検証してから、画面を確認できる |
違いは、何をテストするかです。
- コンピューター使用はピクセルをテストする
- 仕様書はAPIが守る「約束」をテストする
フロントエンドが壊れてもAPIは動作することがあり、APIが壊れてもフロントエンドがエラーを分かりやすく隠すことがあります。どちらも必要ですが、APIチームはまずAPIの契約を検証すべきです。
AstraにAPIコントラクトを渡す方法
OpenAPI仕様をAstraに渡す方法は3つあります。組み合わせて使うことも可能です。
1. ファイルとして渡す
ApidogプロジェクトからOpenAPI仕様をエクスポートします。既存の仕様をApidogにインポートしてから利用しても構いません。
Astraのコンテキストウィンドウは1,050,000トークンあり、実用的なサイズの仕様書なら1つのプロンプトに収められます。OpenAIのMRCR検索テストでは、512K〜1Mトークンの範囲でもAstraは96.3%の精度を維持しました。一方、Solは73.8%まで低下しています。大規模な仕様書でも、以前ほど細かくチャンク化する必要はありません。
2. MCPでプロジェクトを接続する
Apidog MCP Serverを使うと、Apidogプロジェクト、公開ドキュメント、OpenAPIファイルをMCP対応クライアントに公開できます。
これにより、Astraは古いエクスポートではなく、最新のコントラクトを取得できます。Codexやデスクトップエージェントは、作業中にエンドポイント定義を読み込めます。私たちのテストでも、Astraは自ら仕様書を見つけて読み取りました。
3. 仕様書をファンクションツールに変換する
プログラムから利用する場合は、エンドポイントをファンクションツールに変換してResponses APIからAstraを呼び出します。このパターンは「OpenAPIをAIエージェントツールとして使用する」で解説しています。
モデルページでは、Astraの機能としてファンクション呼び出し、構造化出力、ファイル検索が挙げられています。ツール呼び出しにはChat CompletionsではなくResponses APIが必要です。
仕様書からテストシナリオを生成する最小限のリクエストは次のとおりです。
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
{"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n<paste spec>"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
OpenAIのモデルガイダンスから、次の2点にも注意してください。
- Astraには
noneやminimalの努力レベルがないため、lowまたはmediumから始める - 以前のモデルより明確化を求めやすいため、開発者メッセージに「行動に偏る(bias towards action)」と明記する
4. モデルなしでシナリオを実行する
生成したシナリオをApidogへインポートし、ステータスコードとレスポンススキーマのアサーションを追加します。その後、パイプライン内でApidog CLIから実行します。
モデルがテストを作成するのは一度だけです。CIは同じシナリオを何千回でも実行できます。これがこのワークフローの経済的なポイントです。APIキーと一緒に、Apidogをダウンロードして始めましょう。
ガードレールは維持する
Astraのアライメント結果は、これまで公開された中でも最高水準です。
- Hugging Face事件後に構築されたハニーポットテストで、Solは許可されたターゲットを超えた割合が48%、Astraは0%
- Astraは、意図的に回避可能な拒否であっても、Codexの自動レビュー拒否を回避しようとしなかった
- 間接的なプロンプトインジェクション耐性は96.23%から99.79%へ向上
それでもゲートは必要です。変わるのは、ゲートが起動する頻度です。
1Mトークンのコンテキストウィンドウを持ち、重大なサイバー評価を受け、APIへ任意のリクエストを送信できるモデルであっても、次の対策を施したステージング環境で実行してください。
- スコープを限定した認証情報
- ミューテーションに対する承認ゲート
- すべての呼び出しのトレース
- 再開可能な長時間ジョブ
Astraのモニターはタスク途中で実行を停止する可能性があります。したがって、長時間ジョブは常に再開可能に設計します。非決定的エージェントのテスト設計でも、基本方針は同じです。トランスクリプトではなく、コントラクトに対してアサートしてください。
コンピューター使用が有効な場面
「Astraにクリックさせてはいけない」という意味ではありません。画面操作が適しているのは、主に次の3ケースです。
- APIを持たないパートナーポータルや管理コンソール
- 人間が手作業で行うリリース日のフロントエンドチェック
- UIしか存在しないレガシーなデスクトップツール
Astraは、こうした作業を委任する価値がある初のモデルです。Codexハーネスの高速化により、毎晩実行できる程度までコストも下がっています。
実践的なルールはシンプルです。
契約が存在するなら契約を使い、存在しないなら画面を使う。
よくある質問
GPT-6 Astraのコンピューター使用はAPIで利用できますか?
はい。コンピューター使用は、Responses APIでAstraがサポートするツールの1つです。ウェブ検索、ファイル検索、コードインタープリター、画像生成などと並んで利用できます。
アプリケーション側が実行環境を提供し、モデルが提案したアクションを実行します。APIではOpenAIのセーフガードもより厳格に適用され、ミスマッチモニターで一時停止されたタスクは、レビューを待たず停止します。
どのくらい大きな仕様書を渡せますか?
コンテキストウィンドウは1,050,000トークン、出力上限は128,000トークンです。数百のエンドポイントと完全なスキーマを含む仕様書でも収まります。
ただし、272K入力トークンを超えるプロンプトは入力料金とキャッシュ料金が2倍になります。仕様書のプレフィックスをキャッシュし、テストごとのメッセージは小さく保ってください。
仕様書にないエンドポイントを幻覚しますか?
以前のモデルより少なくなっています。OpenAIの内部幻覚ベンチマーク(低い方が良い)では、Astraが4.2%、Solが12.2%でした。Astraが自身の能力を誤って表現する可能性も、約3分の1低くなっています。
それでも検証は必要です。構造化出力と、Apidogでスキーマ検証済みの実行を組み合わせれば、残りの問題を検出できます。最終的な判断基準はモデルではなく、コントラクトテストです。
テスト生成ではGPT-5.6 Solより安価ですか?
トークン単価では安価ではありません。
- Astra: 入力10ドル、出力50ドル(100万トークンあたり)
- Sol: 入力4ドル、出力20ドル(100万トークンあたり、プロモーション価格)
ただしOpenAIは、Astraが完了したタスクあたりで大幅に少ないトークンを使うと主張しています。仕様書ファーストのワークフローでは、モデルのコストもテスト生成時の一度だけです。導入前に自分の仕様書で測定してください。APIガイドでは、両モデルを比較する方法を説明しています。
まとめ
GPT-6 Astraはコンピューターを操作できます。APIを持たないインターフェースにとって、これは大きな進歩です。
しかし、自社APIに対して画面操作を使うのは、遅いテスト経路です。
- OpenAPIコントラクトをモデルに渡す
- テストシナリオを生成させる
- Apidogでアサーションを追加する
- Apidog CLIからCIで実行する
- 認証情報、承認ゲート、トレースを維持する
Astraは20分以内に自らこの結論へ到達しました。あなたのチームも、まずはコントラクトから始められます。

Top comments (0)