GPT-6 Astraは何がすごいのか|前世代・他社モデルと数字で比べてみた

GPT-6 Astraは何がすごいのか|前世代・他社モデルと数字で比べてみた
  • URLをコピーしました!

OpenAIが2026年9月3日に発表したGPT-6 Astraで大きく変わったのは、モデルを評価する軸です。文章のうまさや推論の深さだけを比べる話ではありません。

パソコンを人間と同じように操作し、仕事を最後まで終わらせる。そこに軸足が移りました。

発表当日のブリーフィングで、共同創業者のグレッグ・ブロックマン氏は「AGIの時代へようこそ」と締めくくったと報じられています。フロンティアモデルの発表としても、かなり踏み込んだ表現です。

ただ、私が発表資料とベンチマーク表を読み込んで面白いと感じたのは、そうした大きな見出しよりも細かい数字のほうでした。伸びた領域と伸びていない領域が、はっきり分かれているんですよね。

前世代のGPT-5.6 Solから何が変わったのか。他社モデルと比べてどこで勝ち、どこで負けているのか。そして、同社史上初の「Critical」判定を受けたサイバー能力は何を意味するのか。

ここまで確認すると、自分の仕事にAstraを入れるべきかどうかも判断しやすくなります。

目次

押さえておきたい変化は3つ

GPT-6 Astraで押さえておきたい変化は、次の3つです。

変化具体的に何が起きたか
パソコン操作が主戦場になったブラウザー、表計算、業務アプリを人間と同じ手順で操作し、成果物まで出す
前世代からの伸び幅が大きいFrontierMath Tier 4は83.0%から97.6%、AutomationBenchは18.1%から41.4%へ
サイバー能力が初めてCritical判定適切なツールと権限があれば、未知の脆弱性を自力で見つけられる水準に達し、段階的な提供へ切り替わった

一方、総合的な知能指標では、他社モデルに抜かれている項目も残りました。「すべてで最強」ではなく、パソコン操作や業務工程で強みが際立っているところが、今回の読みどころです。

「答えるAI」から「パソコンを操作するAI」へ

Astraの中心は、人間用の画面を操作し、複数の工程を一続きで終わらせることです。OpenAIは公式ページで、Astraを「世界最高のコンピューター操作モデル」と位置づけています。

引き受ける作業として挙げられているのは、オンラインフォームの入力、CRMの顧客レコード更新、カレンダーの整理といった手間のかかる仕事です。ネットで調べた内容をメールや文書エディターに下書きすることもできます。

さらに、科学データを解析してグラフを作り、Webサイトを構築し、そのフロントエンドが正しく動くかをQAチェックする。ここまでを一続きで担うとのことです。

発表時のプロモーション映像は、1980年代のAIデモで「黄色い円を描いて」と頼む場面から始まります。

そこから現在に切り替わり、音声だけで黄色い円をロケットに変え、数分で3Dゲームに仕上げる様子が流れました。eBayへの出品も、音声入力だけで完結しています。

コネクターを書く時代が終わりかけている

ブロックマン氏が示したのは、ツールごとに接続を作り込むのではなく、人間用の画面をAIが直接操作する方向です。

生成AIブームのあいだ、企業はモデルを社内システムにつなぐために、APIやプラグイン、検索基盤を延々と作ってきました。

彼はその状況を、人がコネクターを書き、あらゆるツールへの接続を丹念に作り込むことに縛られてきた時代だと表現しています。

主張の核心は、ソフトウェアにはすでに汎用知能向けのインターフェースが用意されている、という点。つまり、人間用のユーザー画面です。十分に賢いエージェントなら、そこを直接触ればいい。

この発想が現実になると、SaaS連携を売りにしてきたサービスの立ち位置は変わります。私自身、業務ツール同士をつなぐ自動化に何日もかけた経験があるので、この変化はけっこう大きいと感じています。

47%の時短という数字の読み方

OSWorld 2.0のオフラインサブセットを使った遅延シミュレーションでは、Astraが1タスクあたり約40分でスコア72.6%。GPT-5.6 Solは約75分で65.7%でした。所要時間にすると、約47%の短縮です。

さらにCodex側のハーネスも同時に更新され、Mind2Webベンチマークでは、現行のSol環境に対して1.9倍のタスク完了速度になったと説明されています。

この評価では、スコアが65.7%から72.6%へ上がっただけでなく、所要時間も約75分から約40分へ短くなりました。エージェントへ任せる作業は待ち時間そのものがコストなので、実務では体感差が大きくなるはずです。

前世代のGPT-5.6 Solから何がどれだけ伸びたのか

公式が公開しているベンチマークから、変化の大きいものを抜き出しました。

ベンチマークGPT-6 AstraGPT-5.6 Sol
FrontierMath Tier 4 (v2)97.6%83.0%
Terminal-Bench Science 0.164.6%22.4%
Terminal-Bench 4.057.9%37.3%
AutomationBench41.4%18.1%
BenchCAD95.9%83.3%
ScreenSpot-Pro(ツールなし)92.7%76.9%
ExploitBench100.0%78.5%
MRCR v2 8-needle 512K-1M96.3%73.8%
内部ハルシネーション評価(低いほど良い)4.2%12.2%
ARC-AGI-399.9%7.8%

ARC-AGI-3の7.8%から99.9%という変化は、さすがに目を引きます。ただし、この数字には注釈が必要です。

OpenAI自身の評価注記によると、Astraの実行には同社のResponses APIハーネスが使われ、推論を保持したまま長い文脈を扱う設定になっていました。比較対象のモデルは、別の条件で動いている可能性があります。

似た論点は8月にも出ていました。NVIDIAが同じARC-AGI-3の公開セットで100%を達成したという発表です。ただし、使われた基盤モデルはClaude Opus 5で、素のスコアは約30%だったと説明されています。

永続メモリーやツール、失敗からの復帰機構を備えたエージェント構成が差を生んだわけです。

つまり、測っているのがモデル単体なのか、システム全体なのかがあいまいになっています。ARC-AGI-3の数字だけを取り出して騒ぐのは危ういところです。

素数の未解決問題を1つ動かした

前世代との差を示すベンチマークとは別に、私が印象に残ったのは数学の成果でした。

素数同士がどこまで近くに現れうるかという問題では、10年以上のあいだ「無限に多くの素数ペアが246以内に存在する」が最良の結果とされてきました。

これをJulia Stadlmann氏が240まで縮め、Astraはさらに186まで押し下げる証明を導いています。

もう一つ、素数のあいだに現れる異常に大きな間隔について、80年以上変わっていなかった項をAstraが改善しました。OpenAIは両方の証明と検証材料を公開しています。

EpochAIのグレッグ・バーナム氏は、この結果を「一つの時代の終わりであり、別の時代の始まり」と評しました。ベンチマークのスコアと違い、証明は正しいかどうかを機械的に検証できます。

そこが今回いちばん反論しにくい部分です。

指示からはみ出さなくなった

難しい、あるいは達成不可能なタスクを与えたとき、モデルが与えられた権限の外へ出ていくか。

それを測る評価では、本番用の安全装置なしでGPT-5.6 Solが48.2%の頻度で認可された対象を越えました。Astraは0%です。

能力の話より地味ですが、実務ではここが効いてきます。

Codexでは、判断に迷う点を非同期で質問しながら、返事に依存しない作業を並行して進める挙動も入りました。

返信がなければ妥当な仮定で進み、影響の大きい判断だけは待つ。途中で方針変更を伝えても、元の依頼や制約を見失いにくくなっています。

長いセッションで文脈が埋まったときの扱いも変わりました。これまでは要約による圧縮で、なぜ修正が失敗したかといった細部が抜け落ちがちでした。

Astraは文脈ウィンドウをまたいでメモを引き継ぎ、過去のやり取りを検索して取り出せます。Codexの設定ファイルから有効化できる実験的機能として提供され、数週間のうちに既定になる予定とのことです。

他社モデルと比べた実際の立ち位置

OpenAIは公式ページで他社モデルとの比較表を出しています。

自社発表の数字である点は差し引いて読む必要がありますが、勝ちと負けの両方が載っているのは珍しいところです。

ベンチマークGPT-6 AstraClaude Fable 5.1Claude Opus 5Gemini 3.8 Flash
AutomationBench41.4%31.4%26.9%記載なし
Terminal-Bench 4.057.9%55.8%52.3%19.1%
Terminal-Bench Science 0.164.6%52.6%30.0%記載なし
FrontierMath Tier 4 (v2)97.6%87.8%73.2%記載なし
GPQA Diamond96.0%93.7%93.7%95.3%
Agents’ Last Exam59.3%記載なし55.5%記載なし
Humanity’s Last Exam(ツールあり)57.2%65.0%63.6%記載なし
Artificial Analysis Intelligence Index v4.1.161.265.763.158.7

総合力ではまだ抜かれている

Astraが、すべての指標で他社モデルを上回っているわけではありません。

Humanity’s Last ExamではClaude Fable 5.1が65.0%を記録し、Astraの57.2%を上回りました。第三者指標のArtificial Analysis Intelligence Indexでも、Astraの61.2に対してFable 5.1は65.7。

前世代のSolが60.9なので、この指標に限れば伸びはごくわずかです。

海外のコミュニティでは「6というより5.7」という辛口の評価も出ました。純粋な知能の飛躍を期待していた層には、確かに肩透かしに映る数字です。

Astraの強みは、知能そのものより「作業を完了させる力」に寄っています。AutomationBenchやTerminal-Bench Scienceのような、実際の業務工程を模したベンチマークで大きく差が開いているのが、その表れ。

逆に、文章生成の質だけを比べる用途なら、Astraはオーバースペックです。

コストを含めると、印象はまた変わります。Terminal-Bench Science 0.1では、Fable 5.1の52.6%に対してAstraが64.6%。しかも、推定API費用は約31%低い水準だとされています。Terminal-Bench 4.0でも約63%低いコストです。

Agents’ Last Examでは、Claude Opus 5より出力トークンを約65%少なく使ったと説明されています。

動画生成のHiggsfield AI社も、他社モデルより最大20%少ないトークンで複雑な制作フローを完走できたとコメントしました。

初のCritical認定が意味すること

安全性の面で最も重いのが、サイバー能力の評価です。AstraはOpenAIのPreparedness Frameworkにおいて、サイバーセキュリティ能力が初めて「Critical」に到達したモデルになりました。

適切なツールと権限を与えれば、人が一手ずつ指示しなくても、よく防御されたシステムに対して未知の脆弱性を見つけ、悪用方法を組み立てられる。そういう水準の認定です。

攻撃と防御は同じ能力の裏表

数字を並べると、認定の重さが伝わります。

評価GPT-6 AstraGPT-5.6 Sol
ExploitBench100.0%78.5%
ExploitGym42.4%30.3%
ExploitBench(2026年6〜8月版)39.0%11.5%
SRE-Bench(1回目で解決)88.0%55.9%

2026年6〜8月版は、直近3か月に見つかった脆弱性で作った新しいベンチマークです。過去の脆弱性を学習済みである可能性を潰すための工夫。

この評価の最中に、Astraは未知のゼロデイ脆弱性を2件発見し、OpenAIは開発元へ報告したと公表しています。

同じ能力が、防御側にはパッチを当てる武器になり、攻撃側には侵入の道具になります。だからOpenAIは今回、リリース時点のAstraに「概念実証の攻撃コードを作る」ような高度なタスクを拒否させました。

安全なコードレビューやパッチ適用には使える一方、その先はDaybreakという審査つきプログラムを通じて段階的に開放する方針です。

運用面では、モデルの推論と行動を監視する分類器が動いています。疑わしいと判断されると、ChatGPTやCodexでは確認を求められ、APIではタスクが停止します。正当な作業まで止まることがあるとOpenAI自身が認めており、ここは実務で引っかかりそうなポイントです。

Enterprise向けの提供が既定でオフになっているのも、同じ流れです。管理者がワークスペースで有効化しない限り、社内では選択肢に出てきません。

不安が残る点も、そのまま公表されています。監視回避を明示的に指示するテストで、Astraの書かれた推論はSolより追跡しにくくなりました。

OpenAIは「簡単なタスクでは書かれた推論をより制御でき、少ない手数で解けるため」と説明しつつ、この低下を深刻に受け止めるとしています。

知能の進歩がアラインメントの進歩を保証するわけではない。

チーフサイエンティストのヤクブ・パホツキ氏はそう述べています。監視能力が追いつかなければスケーリングを止めるとまで明言しました。

使えるプランと料金、提供の段取り

提供区分対象料金
ChatGPTPlus、Pro、Business、Enterprise各プランの利用枠内
GPT-6 Astra ProPro、Business、Enterprise各プランの利用枠内
OpenAI APIモデルID gpt-6-astra入力100万トークンあたり10ドル、出力50ドル
Amazon BedrockAWS利用企業公式発表に記載なし

9月3日は限られた組織への先行提供から始まり、数日かけてChatGPTの有料プラン全体とAPI、AWSへ広がる段取りになっています。

ただし、Enterpriseプランでは提供開始時点で既定オフです。対象プランであっても、管理者がワークスペースで有効化するまではモデル選択に表示されません。

無料プランについては、発表文に記載がありません。使えないと明言されたわけでもないため、現時点では予定が示されていない、と読むのが正確なところです。

利用枠はAstra専用に区切られておらず、既存のサブスクリプション枠をすべてAstraに充てることもできます。枠を超えて使いたい場合は、追加でクレジットを購入する形です。

APIには標準の最大2倍の速度で動くFastモードもあり、料金も標準の2倍になります。キャッシュの読み書きは別レートです。

なお、コンテキストウィンドウは1,050,000トークン、最大出力は128,000トークンという情報も出回っています。知識カットオフは2026年4月30日とされています。公式の発表ページには明記がなく、API仕様をまとめた第三者サイトの記載です。

トークン単価ではなくタスク単価で見る

Astraの標準料金は入力10ドル、出力50ドル。Claude Fable 5.1やClaude Mythos 5.1と同じ水準です。GPT-5.6 Solの標準モード(入力5ドル、出力30ドル)からは倍近くに上がりました。

ここでブロックマン氏が持ち出したのが、価格の見方そのものを変えるという主張です。

トークンへの値付けは意味をなさない。自社のトークンは競合のトークンと同じではなく、モデルファミリーが違えば同じでもない、と説明しています。

見るべきは、完了タスクあたりの価格というわけです。

実例として挙げられたのがDeepSWE v1.1で、最高性能の設定では、Solの最高スコア設定を上回りながら、推定API費用は1タスクあたり約57%低いとされています。

安いモデルでリトライを繰り返し、人が手直しする時間まで積み上げると、高いモデルで一発で終わらせたほうが結局は安く付く。この理屈は、エージェント運用を実際にやっている人ほど納得しやすいはずです。

このモデルが指し示す次の景色

将来性を考えるうえで、私が注目しているのは3つです。

  • 連携開発の縮小。コネクターを書く仕事が、画面を操作させる設計に置き換わっていく
  • 人の役割の移動。指示を出す仕事から、成果と権限を監督する仕事へ
  • 監視可能性がボトルネックになる。能力が上がるほど中身が見えにくくなる矛盾

一つ目は、すでに動き始めています。人間用の画面を直接操作できるなら、API連携を前提にした自動化ツールの価値は相対的に下がります。

逆に、権限管理や監査ログのように「エージェントを安全に働かせる」層の価値は上がるはずです。

二つ目について、OpenAIの研究者ミア・グレーゼ氏は、人はより高い抽象度で仕事を差配し、複雑な作業をアプリケーションをまたいで委譲する形になると述べています。

プロンプトを工夫する技術より、どこまで任せ、どこで止めるかを設計する技術が問われる方向へ動きそうです。

三つ目がいちばん厄介です。監視のしくみは、正当な作業まで止めてしまうことがあります。かといって緩めれば、Critical判定を受けた能力が野放しになります。

企業がエージェントを本格導入するとき、この綱引きには必ずぶつかるはずです。

懐疑的な見方も紹介しておきます。認知科学者のゲイリー・マーカス氏は、システムの中身がわからないままでは、何ができて何ができないのかを判断しにくいと指摘しました。

事前アクセスが与えられたのは前向きな評価者ばかりで、懐疑派には渡されていない点も挙げています。初期の熱狂が時間とともに冷めるパターンを、彼は繰り返し見てきたわけです。

私も同じくらいの距離感で見ています。発表資料の数字が本物でも、自分の業務で再現するかどうかは別の話です。

よくある質問

無料プランでもGPT-6 Astraは使えますか。

公式発表に無料プランへの提供予定は書かれていません。使えないと断言されたわけではないため、現時点では続報を待つ形になります。

Claudeより優れているのですか。

用途によります。OpenAIが公開した比較表では、パソコン操作や業務工程を模したベンチマークでAstraが上回りました。

一方、Humanity’s Last ExamやArtificial Analysis Intelligence IndexではClaude Fable 5.1が上です。自社発表の数字である点も念頭に置いて読むのが安全です。

会社のChatGPTにAstraが表示されません。

Enterpriseプランは提供開始時点で既定オフになっています。管理者がワークスペースで有効化するまで、モデル選択に出てきません。まずは社内の管理担当に確認してみてください。

サイバー能力がCriticalというのは、一般ユーザーにも影響しますか。

安全チェックによって作業が止まる可能性があります。リリース時点のAstraは概念実証の攻撃コード生成などを拒否するよう調整され、監視分類器も動いています。

防御目的の高度な用途は、審査つきのDaybreakプログラム経由で段階的に開放される方針です。

GPT-5.6 Solからすぐ乗り換えるべきですか。

文章生成が中心なら、急ぐ理由は薄いところです。パソコン操作やコーディングを含む多段階の作業を任せているなら、完了率と所要時間で比べる価値があります。

API料金は倍近くに上がるため、タスクあたりのコストで判断するのが現実的です。

まとめ

GPT-6 Astraの本質は、賢さの更新というより、仕事を最後まで終わらせる能力の更新にあります。

総合的な知能指標では他社に譲る場面もある一方、OpenAIが公開した指標では、パソコン操作と業務工程で強みが表れました。サイバー能力がCritical判定に達したことで、提供や監視も従来より慎重になっています。

すべての用途ですぐに乗り換えるべきモデルではありません。文章生成が中心なら急ぐ理由は薄く、パソコン操作やコーディングを含む多段階の仕事では試す価値があります。

まずは自分の定型業務を1つ選び、完了率と所要時間を測るところから試してみてください。

よかったらシェアしてね!
  • URLをコピーしました!

この記事を書いた人

サイト「インターネットビジネスの世界」運営者。ビジネスプロデューサー、著述業。メルマガやブログを書きながら、好きなことをしてのんびりと生きています。

目次