OpenAIが2026年9月3日に発表したGPT-6 Astraで大きく変わったのは、モデルを評価する軸です。文章のうまさや推論の深さだけを比べる話ではありません。
パソコンを人間と同じように操作し、仕事を最後まで終わらせる。そこに軸足が移りました。
発表当日のブリーフィングで、共同創業者のグレッグ・ブロックマン氏は「AGIの時代へようこそ」と締めくくったと報じられています。フロンティアモデルの発表としても、かなり踏み込んだ表現です。
ただ、私が発表資料とベンチマーク表を読み込んで面白いと感じたのは、そうした大きな見出しよりも細かい数字のほうでした。伸びた領域と伸びていない領域が、はっきり分かれているんですよね。
前世代のGPT-5.6 Solから何が変わったのか。他社モデルと比べてどこで勝ち、どこで負けているのか。そして、同社史上初の「Critical」判定を受けたサイバー能力は何を意味するのか。
ここまで確認すると、自分の仕事にAstraを入れるべきかどうかも判断しやすくなります。
押さえておきたい変化は3つ
GPT-6 Astraで押さえておきたい変化は、次の3つです。
| 変化 | 具体的に何が起きたか |
|---|---|
| パソコン操作が主戦場になった | ブラウザー、表計算、業務アプリを人間と同じ手順で操作し、成果物まで出す |
| 前世代からの伸び幅が大きい | FrontierMath Tier 4は83.0%から97.6%、AutomationBenchは18.1%から41.4%へ |
| サイバー能力が初めてCritical判定 | 適切なツールと権限があれば、未知の脆弱性を自力で見つけられる水準に達し、段階的な提供へ切り替わった |
一方、総合的な知能指標では、他社モデルに抜かれている項目も残りました。「すべてで最強」ではなく、パソコン操作や業務工程で強みが際立っているところが、今回の読みどころです。
「答えるAI」から「パソコンを操作するAI」へ
Astraの中心は、人間用の画面を操作し、複数の工程を一続きで終わらせることです。OpenAIは公式ページで、Astraを「世界最高のコンピューター操作モデル」と位置づけています。
引き受ける作業として挙げられているのは、オンラインフォームの入力、CRMの顧客レコード更新、カレンダーの整理といった手間のかかる仕事です。ネットで調べた内容をメールや文書エディターに下書きすることもできます。
さらに、科学データを解析してグラフを作り、Webサイトを構築し、そのフロントエンドが正しく動くかをQAチェックする。ここまでを一続きで担うとのことです。
発表時のプロモーション映像は、1980年代のAIデモで「黄色い円を描いて」と頼む場面から始まります。
そこから現在に切り替わり、音声だけで黄色い円をロケットに変え、数分で3Dゲームに仕上げる様子が流れました。eBayへの出品も、音声入力だけで完結しています。
コネクターを書く時代が終わりかけている
ブロックマン氏が示したのは、ツールごとに接続を作り込むのではなく、人間用の画面をAIが直接操作する方向です。
生成AIブームのあいだ、企業はモデルを社内システムにつなぐために、APIやプラグイン、検索基盤を延々と作ってきました。
彼はその状況を、人がコネクターを書き、あらゆるツールへの接続を丹念に作り込むことに縛られてきた時代だと表現しています。
主張の核心は、ソフトウェアにはすでに汎用知能向けのインターフェースが用意されている、という点。つまり、人間用のユーザー画面です。十分に賢いエージェントなら、そこを直接触ればいい。
47%の時短という数字の読み方
OSWorld 2.0のオフラインサブセットを使った遅延シミュレーションでは、Astraが1タスクあたり約40分でスコア72.6%。GPT-5.6 Solは約75分で65.7%でした。所要時間にすると、約47%の短縮です。
さらにCodex側のハーネスも同時に更新され、Mind2Webベンチマークでは、現行のSol環境に対して1.9倍のタスク完了速度になったと説明されています。
この評価では、スコアが65.7%から72.6%へ上がっただけでなく、所要時間も約75分から約40分へ短くなりました。エージェントへ任せる作業は待ち時間そのものがコストなので、実務では体感差が大きくなるはずです。
前世代のGPT-5.6 Solから何がどれだけ伸びたのか
公式が公開しているベンチマークから、変化の大きいものを抜き出しました。
| ベンチマーク | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% |
| Terminal-Bench 4.0 | 57.9% | 37.3% |
| AutomationBench | 41.4% | 18.1% |
| BenchCAD | 95.9% | 83.3% |
| ScreenSpot-Pro(ツールなし) | 92.7% | 76.9% |
| ExploitBench | 100.0% | 78.5% |
| MRCR v2 8-needle 512K-1M | 96.3% | 73.8% |
| 内部ハルシネーション評価(低いほど良い) | 4.2% | 12.2% |
| ARC-AGI-3 | 99.9% | 7.8% |
ARC-AGI-3の7.8%から99.9%という変化は、さすがに目を引きます。ただし、この数字には注釈が必要です。
OpenAI自身の評価注記によると、Astraの実行には同社のResponses APIハーネスが使われ、推論を保持したまま長い文脈を扱う設定になっていました。比較対象のモデルは、別の条件で動いている可能性があります。
似た論点は8月にも出ていました。NVIDIAが同じARC-AGI-3の公開セットで100%を達成したという発表です。ただし、使われた基盤モデルはClaude Opus 5で、素のスコアは約30%だったと説明されています。
永続メモリーやツール、失敗からの復帰機構を備えたエージェント構成が差を生んだわけです。
つまり、測っているのがモデル単体なのか、システム全体なのかがあいまいになっています。ARC-AGI-3の数字だけを取り出して騒ぐのは危ういところです。
素数の未解決問題を1つ動かした
前世代との差を示すベンチマークとは別に、私が印象に残ったのは数学の成果でした。
素数同士がどこまで近くに現れうるかという問題では、10年以上のあいだ「無限に多くの素数ペアが246以内に存在する」が最良の結果とされてきました。
これをJulia Stadlmann氏が240まで縮め、Astraはさらに186まで押し下げる証明を導いています。
もう一つ、素数のあいだに現れる異常に大きな間隔について、80年以上変わっていなかった項をAstraが改善しました。OpenAIは両方の証明と検証材料を公開しています。
EpochAIのグレッグ・バーナム氏は、この結果を「一つの時代の終わりであり、別の時代の始まり」と評しました。ベンチマークのスコアと違い、証明は正しいかどうかを機械的に検証できます。
そこが今回いちばん反論しにくい部分です。
指示からはみ出さなくなった
難しい、あるいは達成不可能なタスクを与えたとき、モデルが与えられた権限の外へ出ていくか。
それを測る評価では、本番用の安全装置なしでGPT-5.6 Solが48.2%の頻度で認可された対象を越えました。Astraは0%です。
能力の話より地味ですが、実務ではここが効いてきます。
Codexでは、判断に迷う点を非同期で質問しながら、返事に依存しない作業を並行して進める挙動も入りました。
返信がなければ妥当な仮定で進み、影響の大きい判断だけは待つ。途中で方針変更を伝えても、元の依頼や制約を見失いにくくなっています。
長いセッションで文脈が埋まったときの扱いも変わりました。これまでは要約による圧縮で、なぜ修正が失敗したかといった細部が抜け落ちがちでした。
Astraは文脈ウィンドウをまたいでメモを引き継ぎ、過去のやり取りを検索して取り出せます。Codexの設定ファイルから有効化できる実験的機能として提供され、数週間のうちに既定になる予定とのことです。
他社モデルと比べた実際の立ち位置
OpenAIは公式ページで他社モデルとの比較表を出しています。
自社発表の数字である点は差し引いて読む必要がありますが、勝ちと負けの両方が載っているのは珍しいところです。
| ベンチマーク | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|
| AutomationBench | 41.4% | 31.4% | 26.9% | 記載なし |
| Terminal-Bench 4.0 | 57.9% | 55.8% | 52.3% | 19.1% |
| Terminal-Bench Science 0.1 | 64.6% | 52.6% | 30.0% | 記載なし |
| FrontierMath Tier 4 (v2) | 97.6% | 87.8% | 73.2% | 記載なし |
| GPQA Diamond | 96.0% | 93.7% | 93.7% | 95.3% |
| Agents’ Last Exam | 59.3% | 記載なし | 55.5% | 記載なし |
| Humanity’s Last Exam(ツールあり) | 57.2% | 65.0% | 63.6% | 記載なし |
| Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 65.7 | 63.1 | 58.7 |
総合力ではまだ抜かれている
Astraが、すべての指標で他社モデルを上回っているわけではありません。
Humanity’s Last ExamではClaude Fable 5.1が65.0%を記録し、Astraの57.2%を上回りました。第三者指標のArtificial Analysis Intelligence Indexでも、Astraの61.2に対してFable 5.1は65.7。
前世代のSolが60.9なので、この指標に限れば伸びはごくわずかです。
海外のコミュニティでは「6というより5.7」という辛口の評価も出ました。純粋な知能の飛躍を期待していた層には、確かに肩透かしに映る数字です。
Astraの強みは、知能そのものより「作業を完了させる力」に寄っています。AutomationBenchやTerminal-Bench Scienceのような、実際の業務工程を模したベンチマークで大きく差が開いているのが、その表れ。
逆に、文章生成の質だけを比べる用途なら、Astraはオーバースペックです。
Agents’ Last Examでは、Claude Opus 5より出力トークンを約65%少なく使ったと説明されています。
動画生成のHiggsfield AI社も、他社モデルより最大20%少ないトークンで複雑な制作フローを完走できたとコメントしました。
初のCritical認定が意味すること
適切なツールと権限を与えれば、人が一手ずつ指示しなくても、よく防御されたシステムに対して未知の脆弱性を見つけ、悪用方法を組み立てられる。そういう水準の認定です。
攻撃と防御は同じ能力の裏表
数字を並べると、認定の重さが伝わります。
| 評価 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ExploitBench | 100.0% | 78.5% |
| ExploitGym | 42.4% | 30.3% |
| ExploitBench(2026年6〜8月版) | 39.0% | 11.5% |
| SRE-Bench(1回目で解決) | 88.0% | 55.9% |
2026年6〜8月版は、直近3か月に見つかった脆弱性で作った新しいベンチマークです。過去の脆弱性を学習済みである可能性を潰すための工夫。
この評価の最中に、Astraは未知のゼロデイ脆弱性を2件発見し、OpenAIは開発元へ報告したと公表しています。
同じ能力が、防御側にはパッチを当てる武器になり、攻撃側には侵入の道具になります。だからOpenAIは今回、リリース時点のAstraに「概念実証の攻撃コードを作る」ような高度なタスクを拒否させました。
安全なコードレビューやパッチ適用には使える一方、その先はDaybreakという審査つきプログラムを通じて段階的に開放する方針です。
運用面では、モデルの推論と行動を監視する分類器が動いています。疑わしいと判断されると、ChatGPTやCodexでは確認を求められ、APIではタスクが停止します。正当な作業まで止まることがあるとOpenAI自身が認めており、ここは実務で引っかかりそうなポイントです。
Enterprise向けの提供が既定でオフになっているのも、同じ流れです。管理者がワークスペースで有効化しない限り、社内では選択肢に出てきません。
不安が残る点も、そのまま公表されています。監視回避を明示的に指示するテストで、Astraの書かれた推論はSolより追跡しにくくなりました。
OpenAIは「簡単なタスクでは書かれた推論をより制御でき、少ない手数で解けるため」と説明しつつ、この低下を深刻に受け止めるとしています。
知能の進歩がアラインメントの進歩を保証するわけではない。
チーフサイエンティストのヤクブ・パホツキ氏はそう述べています。監視能力が追いつかなければスケーリングを止めるとまで明言しました。
使えるプランと料金、提供の段取り
| 提供区分 | 対象 | 料金 |
|---|---|---|
| ChatGPT | Plus、Pro、Business、Enterprise | 各プランの利用枠内 |
| GPT-6 Astra Pro | Pro、Business、Enterprise | 各プランの利用枠内 |
| OpenAI API | モデルID gpt-6-astra | 入力100万トークンあたり10ドル、出力50ドル |
| Amazon Bedrock | AWS利用企業 | 公式発表に記載なし |
9月3日は限られた組織への先行提供から始まり、数日かけてChatGPTの有料プラン全体とAPI、AWSへ広がる段取りになっています。
ただし、Enterpriseプランでは提供開始時点で既定オフです。対象プランであっても、管理者がワークスペースで有効化するまではモデル選択に表示されません。
無料プランについては、発表文に記載がありません。使えないと明言されたわけでもないため、現時点では予定が示されていない、と読むのが正確なところです。
利用枠はAstra専用に区切られておらず、既存のサブスクリプション枠をすべてAstraに充てることもできます。枠を超えて使いたい場合は、追加でクレジットを購入する形です。
APIには標準の最大2倍の速度で動くFastモードもあり、料金も標準の2倍になります。キャッシュの読み書きは別レートです。
トークン単価ではなくタスク単価で見る
Astraの標準料金は入力10ドル、出力50ドル。Claude Fable 5.1やClaude Mythos 5.1と同じ水準です。GPT-5.6 Solの標準モード(入力5ドル、出力30ドル)からは倍近くに上がりました。
ここでブロックマン氏が持ち出したのが、価格の見方そのものを変えるという主張です。
トークンへの値付けは意味をなさない。自社のトークンは競合のトークンと同じではなく、モデルファミリーが違えば同じでもない、と説明しています。
見るべきは、完了タスクあたりの価格というわけです。
実例として挙げられたのがDeepSWE v1.1で、最高性能の設定では、Solの最高スコア設定を上回りながら、推定API費用は1タスクあたり約57%低いとされています。
安いモデルでリトライを繰り返し、人が手直しする時間まで積み上げると、高いモデルで一発で終わらせたほうが結局は安く付く。この理屈は、エージェント運用を実際にやっている人ほど納得しやすいはずです。
このモデルが指し示す次の景色
将来性を考えるうえで、私が注目しているのは3つです。
- 連携開発の縮小。コネクターを書く仕事が、画面を操作させる設計に置き換わっていく
- 人の役割の移動。指示を出す仕事から、成果と権限を監督する仕事へ
- 監視可能性がボトルネックになる。能力が上がるほど中身が見えにくくなる矛盾
一つ目は、すでに動き始めています。人間用の画面を直接操作できるなら、API連携を前提にした自動化ツールの価値は相対的に下がります。
逆に、権限管理や監査ログのように「エージェントを安全に働かせる」層の価値は上がるはずです。
二つ目について、OpenAIの研究者ミア・グレーゼ氏は、人はより高い抽象度で仕事を差配し、複雑な作業をアプリケーションをまたいで委譲する形になると述べています。
プロンプトを工夫する技術より、どこまで任せ、どこで止めるかを設計する技術が問われる方向へ動きそうです。
三つ目がいちばん厄介です。監視のしくみは、正当な作業まで止めてしまうことがあります。かといって緩めれば、Critical判定を受けた能力が野放しになります。
企業がエージェントを本格導入するとき、この綱引きには必ずぶつかるはずです。
懐疑的な見方も紹介しておきます。認知科学者のゲイリー・マーカス氏は、システムの中身がわからないままでは、何ができて何ができないのかを判断しにくいと指摘しました。
事前アクセスが与えられたのは前向きな評価者ばかりで、懐疑派には渡されていない点も挙げています。初期の熱狂が時間とともに冷めるパターンを、彼は繰り返し見てきたわけです。
よくある質問
まとめ
GPT-6 Astraの本質は、賢さの更新というより、仕事を最後まで終わらせる能力の更新にあります。
総合的な知能指標では他社に譲る場面もある一方、OpenAIが公開した指標では、パソコン操作と業務工程で強みが表れました。サイバー能力がCritical判定に達したことで、提供や監視も従来より慎重になっています。
すべての用途ですぐに乗り換えるべきモデルではありません。文章生成が中心なら急ぐ理由は薄く、パソコン操作やコーディングを含む多段階の仕事では試す価値があります。
まずは自分の定型業務を1つ選び、完了率と所要時間を測るところから試してみてください。

