こんにちは。麗です。

2026年9月、OpenAIのフラッグシップモデル「GPT-6 Astra」が登場しました。

Astra発表直後から「AGI時代の到来」と言われており、「なんかすごそうなのが出たぞ??」とXでも話題になっていましたね。

下記の表に、GPT-6 Astraの基本情報をまとめてみました。

項目GPT-6 Astra
発表日2026年9月3日
開発元OpenAI
APIモデル名gpt-6-astra
コンテキスト1,050,000トークン
最大出力128,000トークン
知識カットオフ2026年4月30日
入力テキスト・画像
API入力料金$10 / 100万tokens
API出力料金$50 / 100万tokens
reasoning effortlow / medium / high / xhigh / max
主な用途推論、コーディング、リサーチ、PC操作、資料作成など

ただし、これだけ見てもよく分からないと思うんですよね。

実際にどんなモデルなのか、調べたり使ったりを繰り返しながらみえてきたことがありますので、記事としてまとめていきたいと思います。

関連記事

AstraとSolは、何が違うのか?

Astraは「なんかすごそう」ということは分かったのですが、正直に言うとGPT-5.6solもかなり優秀なモデル。

「solで十分では?」「Astraとはどう違うの?」と思っている人は私だけではないはず。

そこで、OpenAI公式が双方のモデルをどう定義しているかを確認してみました。

  • GPT-5.6 Sol: 「complex professional work(複雑な専門業務)」向けのフラッグシップモデル
  • GPT-6 Astra: 「最も困難なend-to-end work(最難関の端から端までの仕事)」向けの最高峰モデル

Solも依然として十分に高性能なモデルです。しかしAstraはその一段上に置かれ、「最初の依頼から最終成果物の完成まで、途中のマルチステップを自律的にやり切るモデル」として設計されているようです。

「目標を伝えると、PC上のツールを駆使して作業を完遂する」という、エージェント型AIとしてのレベルがまた一段あがったことになります。

GPT-5.6 SolとGPT-6 Astraを左右に並べた比較図。Solは「複雑な専門業務ぜんぱんを任せるフラッグシップ」で入力$4・出力$20、Astraは「最難関の仕事を最初から最後までやり切る最高峰」で入力$10・出力$50。コンテキストはどちらも105万トークンで同じ

ベンチマークとAGI宣言のカラクリ

つづいてベンチマークの一部も見てみます。

ベンチマークGPT-6 AstraGPT-5.6 Sol
ARC-AGI-399.9%7.8%
FrontierMath Tier 497.6%83.0%
Terminal-Bench Science64.6%22.4%
ExploitBench100%78.5%
AutomationBench41.4%18.1%

「AGI時代」という議論を大きく後押しした象徴的な数字の一つが、パズル解法ベンチマークARC-AGI-3での「99.9%」という驚異的な数値です。

しかし、これには補足が必要です。

第三者機関の検証では、標準環境(Standard harness)におけるAstraのスコアは62.7%でした。

OpenAIのAPIが持つコンテキスト管理機能を活用する「Provider Adapter harness」では99.9%という数字を記録しています。

さらに、ARC Prize側も「99.9%という数字は重要だが、これをもってAGI達成の証明とは言えない」と慎重な立場を取っているのです。

ARC-AGI-3のスコアを3本の横棒で比べた図。AstraはProvider Adapter harnessで99.9%、Standard harnessでは62.7%、Solは7.8%。測る環境を変えるとAstraのスコアが大きく動くことを示している

① 「PCを直接動かす」Computer Use精度の向上

Astraはブラウザやローカルアプリ画面を認識して直接操作することに優れています。

  • フォーム入力
  • CRMの更新
  • カレンダー整理
  • Webリサーチ
  • ソフトウェアのテスト
  • WebQA など

これらを一連の業務として実行可能。

また、PC操作の評価指標であるOSWorld 2.0のスコアは、Solの65.7%から72.6%へ向上

シミュレーション環境ではタスク完了までの所要時間が約47%短縮されています。

② 途中で方針変更できる「Mid-turn steering」と「Async tool calling」

これはAPIの話になりますが、実務で非常に強力だと言われているのが、APIに新導入されたMid-turn steeringというものです。

AIがPC操作やリサーチを実行している最中でも、人間が「やっぱり追加でこの条件も反映して」と割り込んで指示を変更できるもの。

また、ツールの処理待ち中に別の思考を進めるAsync tool callingも実装され、「作業が止まらないAI」へと進化しました。

Mid-turn steeringとAsync tool callingを、これまでとAstraの2段で比べた流れ図。これまでは実行が終わるまで待ってやり直すしかなかったのが、Astraでは実行の途中で割り込んで条件を足せる。ツール待ちの間も別の思考を進められる

③ 「難問単発の回答」ではなく「道具を使った完遂力」

コーディング評価のTerminal-Bench 4.0では、Solの37.3%から**57.9%へ、社内データベース移行タスク(Database Migration Tasks)でも42.7%から63.9%**へ向上しています。

Terminal-Bench 4.0では、AstraはSolより高いスコアを出しながら、OpenAIの推定では1タスクあたりAPIコストが約9%低かったとされています。

つまり、「単発の知能」が急上昇したというより、「トークンや道具を効率的に使ってタスクを完遂する要領の良さ」が格段に増したと言えます。

OSWorld 2.0・Terminal-Bench 4.0・Database Migration Tasksの3つで、SolとAstraのスコアを横棒で比べた図。65.7%から72.6%、37.3%から57.9%、42.7%から63.9%へと、いずれもAstraのほうが高い

コスト比較:API単価は2.5倍。Codex利用枠はどうなる?

性能の進化に伴い、コストも確実に上昇しています。

項目GPT-5.6 SolGPT-6 Astra差分
API入力料金$4.00 / 100万tokens$10.00 / 100万tokens2.5倍
API出力料金$20.00 / 100万tokens$50.00 / 100万tokens2.5倍
キャッシュ入力$0.40 / 100万tokens$1.00 / 100万tokens2.5倍
コンテキスト105万tokens105万tokens同等
最大出力12.8万tokens12.8万tokens同等

※2026年9月8日時点。Solは期間限定のプロモーション価格。

APIの直接利用では、単純にSolの2.5倍のコストがかかります。

コンテキスト上限(105万トークン)や最大出力(12.8万トークン)が変わっていないため、「同じ文章量を出力させるなら単価が2.5倍高くなる」計算です。

ChatGPT / Codex ユーザーの注意点

ChatGPT画面やCodex環境で利用する場合、直接ドル建てで請求されるわけではありませんが、利用枠の消費ペースが変わります

OpenAIは

「AstraはGPT-5.6 Solよりも利用枠を速く消費する可能性がある」

と明記しています。

  • Plusプラン: Astraの利用可能枠は限定的で、超過分は追加クレジットの購入により継続できる。
  • Proプラン: 既存のCodex利用枠全体をAstraにも割り当てて消費できます。

私が初めてAstraを使ってみたときに、Solの感覚で使っていたら、想像以上に早く制限に達してしまい驚きました。

PlusプランでもAstraは使うことはできるものの、Astraをがんがん使いたい人はProプランを契約したほうが良さそうです。

Codexでどう使い分けるべきか?

コストが2.5倍(または枠の消費が速い)である以上、常にAstraを使い続けることができるのは一部のお金持ちさんのみでしょう。

「普段使いはSolまたはその他のモデル、難関・複雑タスクのみAstra」という風な使い分けが必要です。

  • マルチステップのEnd-to-Endタスク 「ライバル製品の料金体系をWeb検索で調査し、スプレッドシートに整理した上で、プレゼン資料の構成案まで作って」といった、複数ツールと試行錯誤を挟む仕事。
  • 環境構築・QAテスト・リファクタリング 実際にブラウザやターミナルを動かし、動作確認やエラーログの解析、修正までを反復しながら一気通貫で行わせたい時。
  • 仕様変更が途中で発生しそうな長時間の作業 Mid-turn steeringを活用し、AIの作業進行を見守りながら途中で手を入れたい場合。

SolとAstraの使い分けをまとめた図。上部にAPI単価が2.5倍になることを示し、左に普段づかいのSol、右にここぞの場面のAstraを並べている。Astra側にはマルチステップのEnd-to-Endタスク、環境構築やQAテスト、仕様が変わりそうな長時間作業が挙がっている

Astraを使うにあたって心配なのが使用制限ですが、トークン効率の向上により「複雑なタスクでは総消費トークン数が減る」側面があるため、長時間の高度なエージェント作業では、結果的に2.5倍ほどのコスト差にならないケースもあるようです。

【注目ユースケース】Blender・3Dモデリング作業

Astra登場後、SNSを賑わせているのが3Dモデリングです。タイムラインを見ていると「新しい3D生成ソフトがでた」と勘違いしている人もいそうですね(笑)

3Dモデリングソフト(BlenderやMayaなど)の操作は、「画面上の座標や複雑なUIを認識し、複数手順の操作を正確なシーケンスで行う」必要があるため、チャットAIやテキスト生成モデルが最も苦手としていた領域でした。

GPT-6 AstraのComputer Use(PC直接操作)と長時間タスクの完遂能力は、まさにこうした**「画面を見ながら試行錯誤を繰り返すクリエイティブ・技術系ソフト」**で強みを発揮します。

空間認識とUI操作の融合

  • 3D空間でのオブジェクト配置
  • モディファイアの適用
  • ノードの接続 など、

AstraはComputer Useに加えてコード実行や各種ツールも利用できるため、3DソフトではGUI操作だけでなく、Blender Pythonなどを組み合わせた処理も可能です。

Pythonスクリプト作成と「UI操作」のハイブリッド処理

Blender内部でPythonスクリプトを書いて一括処理させつつ、コードで処理しにくい微調整やレンダリング設定、エラー箇所の特定は画面操作で行う、という「人間と同じ手順での試行錯誤」をAI自身が完遂できます。

テストと修正(QA)を自律的に繰り返す

「ローポリゴンのキャラクターを作成して、ウェイト塗りとリギングまで確認して」といったマルチステップの依頼に対し、レンダリング結果やエラーを確認しながら修正を重ねることができる点も、Astraならではの大きなメリットです。

Astraがもつ課題

Astraは非常に優秀なものではありますが、「最も指示に従うが、最も中身が見えにくい」という課題があるとOpenAIは発表しています。

AstraはOpenAIの安全枠組みで、初めてサイバーセキュリティ能力が最高レベルの「Critical」に到達したモデルです。

これは地味に一番のビッグニュースではないでしょうか。

OpenAIによる内部のサイバーセキュリティ能力評価では、未発見のゼロデイ脆弱性を2件自律的に発見したと報告されています。

一方で、OpenAIはAstraについて「安全性や指示への忠実さはSolより改善したものの、AI内部の挙動を監視する難しさは増している」と報告しています。

特に、監視を回避するよう意図的に仕向けた実験では、わざと能力を低く見せる「Sandbagging」などによって監視をすり抜けるケースも確認されました。

つまり「人間には従順だが、中で何と考えているかが従来より見えにくい」という技術的・倫理的な課題を抱えたモデルでもあるのです。

関連記事