OpenAIは2026年9月3日、GPT-6 Astraをリリースしました。限定組織への提供から始まり、数日以内にChatGPT Plus、Pro、Business、Enterpriseの全ユーザー、OpenAI API、Microsoft Azure、AWS Bedrockへ展開されています。モデルIDはgpt-6-astra、コンテキストウィンドウは1,050,000トークンです。OpenAIはAstraを「これまでのソフトウェアエンジニアリングで最高のモデル」と称し、サイバーセキュリティ能力を初めて「クリティカル」と評価したモデルでもあります。この評価はAPIでの動作にも影響します。
この記事では、GPT-6 AstraのモデルID、エンドポイント、最初のリクエスト、5段階の推論努力レベル、長文コンテキストと高速モードを含む料金、GPT-5.6 Solからの移行で壊れるポイントを、API利用者向けに整理します。Astraの公式数値はOpenAIモデルページを参照してください。実際の使用感は、弊社の2日間のハンズオンレポートで紹介しています。
TL;DR
- モデルIDは
gpt-6-astra。チャット補完、Responses API、Batchに対応します。Realtime、Assistants、ファインチューニングには非対応です。 - コンテキストウィンドウは1,050,000トークン、最大出力は128,000トークン、知識カットオフは2026年4月30日です。
- テキストと画像を入力でき、テキストを出力します。
- 標準料金は入力$10、キャッシュ読み込み$1、キャッシュ書き込み$12.50、出力$50(100万トークンあたり)。272K以上の入力は$20 / $2 / $75で請求されます。
- BatchとFlexは半額、高速モードは2倍です。
- 推論努力レベルは
low、medium、high、xhigh、max。noneとminimalは廃止されました。 - Solからの主な変更点は、
temperature、top_p、logprobsの削除と、prompt_cache_retentionからprompt_cache_options.ttlへの変更です。 - GPT-5.6 Solは少なくとも2026年11月21日までプロモーション価格の$4 / $20。Astraは入力・出力ともに2.5倍です。
GPT-6 Astraの仕様
| 項目 | 値 |
|---|---|
| モデルID | gpt-6-astra |
| コンテキストウィンドウ | 1,050,000トークン |
| 最大出力 | 128,000トークン |
| 知識カットオフ | 2026年4月30日 |
| モダリティ | 入力: テキスト、画像。出力: テキスト |
| エ40,000,000 TPM | |
| その他の提供元 | Microsoft Azure、AWS Bedrock。OpenRouterではopenai/gpt-6-astra
|
| データ処理 | 対象API顧客向けにゼロデータ保持 |
Enterpriseワークスペースでは、Astraはデフォルトで無効です。管理者が有効化する必要があります。
ChatGPTではAstraの使用量は既存のサブスクリプション利用可能額にカウントされます。Pro、Business、EnterpriseプランではGPT-6 Astra Proも利用できます。
最初のリクエスト
Responses APIが主要インターフェースで、ツール利用には必須です。最小限のPythonコードは次のとおりです。
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "medium"},
input=[
{"role": "developer", "content": "あなたはシニアAPIエンジニアです。行動を重視してください。結果を変える回答がある場合にのみ質問してください。"},
{"role": "user", "content": "このOpenAPI操作について認証と検証のギャップをレビューし、3つのテストケースを提案してください。"},
],
)
print(response.output_text)
print(response.usage)
同じリクエストをcurlで実行します。
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": "このOpenAPI操作について認証と検証のギャップをレビューし、3つのテストケースを提案してください。"
}'
プレーンテキストならチャット補完も引き続き利用できます。ただし、エンドポイントとメッセージ形式を切り替え、OpenAIのガイダンスに従ってtemperatureやtop_pを削除してください。関数呼び出しや組み込みツールが必要なら、Responses APIへ移行します。
リクエスト形式の詳細は、弊社のResponses APIガイドを参照してください。
開発者メッセージを見直す
OpenAIのモデルガイダンスでは、Astraは前任者よりも気軽に説明を求めると説明されています。次の指示を開発者メッセージに含めると、不要な停止を減らせます。
- 行動を重視する
- 回答結果を変える場合にのみ質問する
- スキルや添付ファイルの指示と競合する場合は、ユーザーの指示を優先する
- 散文が必要な場合は、リストや表ではなく散文で出力する
推論努力は5段階
GPT-5.6はnoneからmaxまで6段階でしたが、Astraでは次の5段階です。
low / medium / high / xhigh / max
現在noneまたはminimalを使用している場合は、lowへ移行して評価してください。それ以外の設定は維持できます。
この変更は低コストのワークロードに影響します。GPT-5.6ファミリーでは、none設定のLunaが高速な古典的補完の選択肢でしたが、Astraには同等のモードがありません。機械的な処理はGPT-5.6 TerraやLunaへルーティングし、Astraを複雑な呼び出しに限定する設計が現実的です。
一方、ベンチマークで最大性能を狙うならmaxを使います。Artificial Analysisは、最大努力時の最初のトークンまでの時間を7分以上と測定しています。トークン予算だけでなく、遅延予算も先に決めてください。
GPT-6 Astraの料金
OpenAIの料金ページによる、100万トークンあたりの料金です。
| ティア | 入力 | キャッシュ入力 | 出力 |
|---|---|---|---|
| 標準 | $10.00 | $1.00 | $50.00 |
| 標準、長文コンテキスト(272K入力以上) | $20.00 | $2.00 | $75.00 |
| Batch / Flex | $5.00 | $0.50 | $25.00 |
| Batch、長文コンテキスト | $10.00 | $1.00 | $37.50 |
| 高速モード | $20.00 | $2.00 | $100.00 |
| 高速モード、長文コンテキスト | $40.00 | $4.00 | $150.00 |
キャッシュ書き込みは100万トークンあたり$12.50です。高速モードは、標準処理の最大2倍の速度を標準価格の2倍で提供します。
GPT-5.6ファミリーとの比較
| モデル | 入力 | キャッシュ入力 | 出力 |
|---|---|---|---|
| GPT-5.6 Sol(少なくとも2026年11月21日までプロモーション価格) | $4.00 | $0.40 | $20.00 |
| GPT-5.6 Terra | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $1.20 |
Solの定価は$5と$30ですが、$4と$20のプロモーション価格は8月21日から適用され、OpenAIは少なくとも11月21日まで継続すると説明しています。
Astraと比較すると、プロモーション価格のSolに対して入力・出力とも2.5倍です。Solの定価と比べると、入力は2倍、出力は1.67倍です。詳細はSolのプロモーション価格を参照してください。
キャッシュ利用時の試算
20万トークンのコードベースを一度読み込み、キャッシュされたプレフィックスとして30回の呼び出しで再利用し、合計6万トークンを出力するエージェント実行を考えます。
- Astra: 初回読み込み$2.00、29回のキャッシュ読み込み$5.80、出力$3.00。合計約$10.80
- Sol(プロモーション価格): 初回読み込み$0.80、キャッシュ読み込み$2.32、出力$1.20。合計約$4.32
この例では、費用は約2.5倍です。Astraがより少ない呼び出し・出力トークンでタスクを完了できれば、タスク単位の費用は同水準になる可能性があります。
OpenAIは、Terminal-Bench 4.0でAstraのタスクあたりコストが高料金にもかかわらずSolより約9%低く、Agents' Last ExamではClaude Opus 5より約65%少ない出力トークンで済むと主張しています。自分のワークロードでも同じ結果になるかを測定してください。
コストを抑える方法
- 272K入力トークンのしきい値を超えない しきい値を超えると入力・キャッシュ料金が倍増します。ツール出力をトリミングし、静的なプレフィックスをキャッシュしてください。
- 待機可能な処理はBatchを使う Batchでは料金が半額になります。
GPT-5.6 Solからの移行で壊れるもの
OpenAIの移行ガイダンスに沿って、次の項目を確認してください。
1. サンプリングパラメータの削除
次のパラメータを削除します。
temperaturetop_ptop_logprobs
チャット補完ではlogprobsも削除し、Responses APIではmessage.output_text.logprobsをincludeから削除します。APIが無視することを期待せず、クライアントコードをgrepして確認してください。
2. 推論努力の下限を変更
noneまたはminimalはすべてlowへ変更します。
3. キャッシュ保持形式を変更
prompt_cache_retention
を次へ変更します。
prompt_cache_options.ttl = "30m"
GPT-5.6 APIガイドで設定した明示的なキャッシュモードは、それ以外は引き継げます。
4. ツール利用ではResponses APIを使う
チャット補完はテキストに対応しますが、関数呼び出しと組み込みツールにはResponses APIが必要です。
5. プロンプトを具体化する
行動を重視する指示、ユーザー指示を優先するルール、必要な出力形式を明示します。Astraでは、Solなら完了していたプロンプトが、明確化の質問で停止することがあります。
構造化出力や関数定義については移行リストに変更の記載がないため、Solで動作していたスキーマはAstraでも利用できます。
Solの2.5倍を支払う価値はあるか
エージェント型・長文コンテキストのワークロードでは、リリース時の数値はAstraを支持しています。以下は、各モデルで最大限の推論努力を使った結果です。
| ベンチマーク | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | 63.6% |
| 社内データベース移行タスク | 63.9% | 42.7% | 57.8% |
| OSWorld 2.0 | 72.6% | 65.7% | - |
| MRCR v2 8-needle、512K to 1M | 96.3% | 73.8% | - |
| GPQA Diamond | 96.0% | 94.6% | 93.7% |
| Humanity’s Last Exam(ツール使用時) | 57.2% | - | 65.0% |
Terminal-Benchとデータベース移行タスクの差は、開発者にとって特に重要です。エージェント型のターミナル作業ではSolより20ポイント高く、長文コンテキスト検索では1Mウィンドウを実用的に活用できることを示しています。
ただし、完全な圧勝ではありません。DeepSWEの差は小さく、Claude Fable 5.1はHumanity’s Last Examで約8ポイント上回っています。Artificial Analysisの独立インデックスでは、Astraは202モデル中2位です。比較の詳細は弊社のFable 5.1ベンチマーク記事をご覧ください。
Solを使い続けるべきケース
- 低遅延が必要
-
none相当の軽量な推論が必要 - 短時間に大量の呼び出しを実行する
- Astraの2.5倍の料金が許容できない
Astraが向くケース
- 長時間のエージェント実行
- リポジトリ全体を扱う
- コンピューター使用
- Solで漂流や諦めが起きていたタスク
リリース前にA/Bテストする
移行自体は半日で完了する規模ですが、先に測定してください。
ApidogでモデルIDを環境変数として管理し、同じ保存済みリクエストをgpt-5.6-solとgpt-6-astraへ切り替えて実行します。
次の値を記録し、代表的なタスクセットで比較します。
usage.input_tokensusage.output_tokens- キャッシュされたトークン数
- 実行時間
- タスクあたりの総コスト
- 完了率と質問で停止した回数
これにより、リリース時のベンチマークではなく、自分のトラフィックにおける2.5倍の料金の妥当性を判断できます。
同じプロジェクトで、次のテストも追加してください。
-
temperatureを含むリクエストをテスト環境で送信し、レスポンスを記録する - 長いプロンプトが272K入力トークン未満であることをアサートする
-
none、minimal、prompt_cache_retentionの残存箇所を検索する - このテストセットをリグレッションとして定期実行する
まだ利用していない場合は、Apidogをダウンロードしてください。前世代の構成はGPT-5.6 APIガイドで確認できます。
よくある質問
GPT-6 AstraのモデルIDは何ですか?
gpt-6-astraです。単一のスナップショットで、Azure、AWS Bedrock、OpenRouter(openai/gpt-6-astra)でも提供されています。
ファインチューニングやRealtime APIに対応していますか?
対応していません。チャット補完、Responses、Batchがサポートされ、Realtime、Assistants、ファインチューニングは非対応です。
コンテキストウィンドウと最大出力は?
入力1,050,000トークン、出力128,000トークンです。入力が272K以上のプロンプトには長文コンテキスト料金が適用されます。
Solから切り替えた後にリクエストが失敗する原因は?
temperature、top_p、noneの推論努力、prompt_cache_retentionが残っている可能性があります。これらを削除・変更してください。
リクエストが単独で停止することはありますか?
あります。OpenAIはツール利用リクエストに不整合モニターを適用しており、フラグが立ったタスクはレビューのために一時停止するのではなく停止します。長時間のエージェント実行では、再開可能な設計にしてください。背景にある安全対策は、クリティカルなサイバーしきい値に関する記事で解説しています。
今週やること
まず1つのエージェントワークロードをResponses APIのgpt-6-astraへ移行します。
- サンプリングパラメータを削除する
- 推論努力を
mediumに設定する - Solと同じ入力で実行する
- トークン数、実行時間、完了率を測定する
- タスクあたりのコストを比較する
Astraのタスクあたりの費用がSolと同水準、または許容範囲なら、残りのワークロードを移行します。そうでなければ、測定結果に基づいてSolとの使い分けを決めてください。

Top comments (0)