GPT-6 Astra 完全ガイド:パソコン操作を丸ごと任せられるAI、OpenAI最強モデルの実力と使い方
OpenAIが2026年9月3日にリリースしたGPT-6 Astraは、ブラウザ・スプレッドシート・デスクトップアプリを人間の代わりに操作できる「コンピューター操作AI」として登場した。AGI宣言の背景、何ができるか、誰がどう使えるか、そして懸念点まで、一冊で読めるガイドにまとめた。
2026年9月3日、OpenAIはひとつの区切り線を引いた。
新モデル「GPT-6 Astra」のリリースとともに、プレジデントのGreg Brockmanは「AGI時代へようこそ」と宣言した。大げさに聞こえるかもしれないが、Astraの実力を見ていくと、その言葉が単なる自己PR以上の意味を持つことがわかってくる。
Astraは従来のチャットAIとは根本的に異なる。テキストを生成するだけでなく、ブラウザを開き、フォームに記入し、スプレッドシートを編集し、デスクトップアプリを操作する——つまり、人間がパソコンで行う作業を代わりにこなせるモデルだ。
GPT-6 Astraとは何か
OpenAIは Astra を「世界最高のコンピューター操作モデル」と位置づけている。これはいわゆる「コンピューター使用AI」と呼ばれるカテゴリで、画面を「見て」マウスやキーボードの操作をシミュレートしながらタスクをこなす。
前世代のGPT-5.6 Solと比較した場合、Astraは同等タスクを約47%速く処理し、精度も大幅に向上している。Texas州のStargate施設にある10万基超のGPUで訓練された。
GPT-5.6 Sol との比較
| 指標 | GPT-5.6 Sol | GPT-6 Astra |
|---|---|---|
| OSWorld 2.0(コンピューター操作) | — | 72.6% |
| ARC-AGI-3(抽象推論) | — | 98.6% |
| FrontierMath(高度数学) | — | 97.6% |
| DeepSWE v1.1(ソフトウェア開発) | — | 74.1% |
| タスク処理速度 | 基準 | 約47%高速 |
| 料金(入力) | 非公開 | $10/百万トークン |
抽象推論の98.6%、高度数学の97.6%という数値は、これまでのどのAIモデルも達成していない水準だ。
Astraは具体的に何ができるか
「コンピューターを操作できる」と言っても、どんな作業なのか、もう少し具体的にイメージしよう。
ブラウザとWebアプリ
- Webサイトのフォームに情報を自動入力する
- CRMシステム(SalesforceやHubSpotなど)のレコードを更新する
- Google Calendar やOutlookでスケジュールを整理する
- Web調査を実行し、結果をドキュメントにまとめる
たとえば「競合他社5社の最新ブログ記事をまとめてGoogleドキュメントに整理して」という指示を与えると、Astraが実際にブラウザを操作して自分で調べ、まとめてくれる。
スプレッドシートとドキュメント
- Excelや Googleスプレッドシートのデータを加工・分析する
- Pythonスクリプトを書いて実行し、結果を可視化する
- プレゼンテーションを構成から自動作成する
- Webサイトを構築してテストする
「先月の売上データをCSVで渡すから、月別推移グラフを作ってPDFでまとめて」といった依頼も処理できる。
デスクトップアプリ
- KiCadやFreeCADといったエンジニアリングアプリの操作
- ソフトウェアのインストールとトラブルシューティング
- 複数アプリをまたいだ複雑なワークフロー
以前はAPIや自動化ツールが必要だった操作を、自然言語で指示するだけで実行できるようになる。
誰がどうやって使えるか
アクセス方法
リリース直後はOpenAIの「Daybreak」エンタープライズプログラム参加者が先行利用できる状態でスタートした。その後まもなく ChatGPT Plus、Pro、Business、Enterpriseの各ユーザーへ順次展開される予定だ。APIアクセスはAWS BedrockとMicrosoft Azureを通じても提供される。
料金
| モード | 入力 | 出力 |
|---|---|---|
| 標準 | $10/百万トークン | $50/百万トークン |
| 高速(Fast Mode) | $20/百万トークン | $100/百万トークン |
前世代のSolより2.5倍ほど高いが、OpenAIは「トークン単価ではなくタスク完了コストで見るべき」と主張している。つまり、Astraが1回の指示でSolの複数回分のタスクをまとめてこなせれば、トータルコストは下がるという考え方だ。
一般ユーザーがChatGPTのサブスクリプション内でどこまで利用できるかは、展開が進むにつれて明確になるだろう。
「AGI時代」とはどういう意味か
Greg Brockmanは記者会見で「AGI時代へようこそ(Welcome to the AGI era)」と述べたが、同時に「明確な転換点があったわけではなく、予想以上に段階的な移行だった」とも認めている。
これは正直な発言だ。AstraがAGI(汎用人工知能)そのものかどうかは哲学的議論に過ぎない。しかし実用的な観点から言えば、「指示を与えれば人間と同等以上の効率でパソコン作業をこなすAI」が登場したという事実は、仕事の仕方を変えうる大きな転換点であることは間違いない。
なおMicrosoftとの契約にあったAGI条項は撤廃されており、「AGI」はもはや法的・契約的な概念ではなく、「精神的な概念(spiritual concept)」だとBrockmanは言う。
懸念点——なぜ物議を醸すのか
Astraがリリース直後から「物議を醸すモデル」と呼ばれているのには理由がある。
不透明な推論プロセス
Astraは「不透明な再帰処理(opaque recurrence)」と呼ばれる推論技術を使っており、AIがどのように結論に至ったかを外部から追いにくい。これまでAIの安全性評価で用いてきた「思考の連鎖(chain of thought)」のモニタリングが有効に機能しない。OpenAIのチーフサイエンティストJakub Pachockiも「より高度なモデルは少ない言語トークンでより難しいタスクを実行できるため、監視が難しくなる」と認めている。
サイバーセキュリティの最高リスク評価
Astraは OpenAI の準備フレームワーク(Preparedness Framework)で初めて「Critical(最高リスク)」に分類された。ExploitBenchと呼ばれる脆弱性評価では100%のスコアを達成しており、評価中に2件の未知のゼロデイ脆弱性を自律的に発見している。
OpenAIはモデルレベルの拒否機能、分類器、監視システム、事後対応チームなどの多層防衛を実装したとしているが、自律的にコンピューターを操作できるモデルが攻撃側に悪用された場合のリスクは、これまでより格段に高い。
まとめ
GPT-6 Astraは「チャットAI」という枠を超えた。会話するだけでなく、実際にパソコン上で手を動かしてタスクをこなすAIの時代が始まった。
フォームへの入力、スプレッドシートの加工、Webリサーチのまとめ、アプリ操作——これらを指示するだけで任せられるなら、ホワイトカラーの業務の相当部分が変わる可能性がある。ChatGPT Plusユーザーへの展開が完了したとき、その変化は実感として伝わってくるはずだ。
一方で、推論の不透明さとサイバーセキュリティリスクという課題は残る。「使いこなす側」として先手を打つためにも、Astraが何ができて何が怖いのかを知っておくことは、今週の最優先タスクと言えるかもしれない。
アップデート:プラン別のメッセージ制限が判明
2026年9月5日、OpenAIはGPT-6 Astraの標準版・Pro版をPro、エンタープライズ、ビジネスプレミアムの各プランに展開した(Plusユーザーへの展開はまもなく予定)。あわせて、プランごとの具体的なメッセージ制限が明らかになった。
前世代のGPT-5.6 Solと比べると、標準版のメッセージ数はおおむね半分に抑えられている。
標準版(5時間ウィンドウあたり)
| プラン | メッセージ数 |
|---|---|
| Plus | 5〜45件 |
| Pro(5倍枠) | 25〜225件 |
| Pro(20倍枠) | 100〜900件 |
| ビジネススタンダード | 5〜45件 |
GPT-6 Astra Pro(週単位・月単位)
| プラン | メッセージ数 |
|---|---|
| Pro($200プラン) | 200件/週 |
| Pro($100プラン) | 50件/週 |
| ビジネスプレミアム | 50件/週 |
| ビジネススタンダード | 15件/月 |
無料ユーザーとGoユーザーは引き続きアクセス対象外だ。Astraを日常的に使い倒したいユーザーにとっては、上位プランへの加入がほぼ前提になる制限値と言える。
アップデート:OpenAIが公式プロンプティングガイドを公開
2026年9月5日、OpenAIはGPT-6 Astraを使いこなすための詳細なプロンプティングガイドを公開した。Astraは前世代より「効果的な協力者」を目指して設計されているが、その分プロンプトの書き方にも新しい工夫が求められるという。
「行動への傾向付け」を意識する
OpenAIは、“can you…”や”help me…”といった表現を、質問への招待ではなく「行動の呼びかけ」として解釈するようAstraに指示することを推奨している。事前許可を求める前に、ユーザーが具体的に承認・審査できる成果物をまず用意させるのがポイントだ。
避けるべき「スロップワード」
以下のような表現はブロックリスト入りしている。
- 「delve」「leverage」「foster」など過剰に使われがちな語彙
- “In short:“や”The simplest mental model is:“といった定型的な締めくくり
- 「exact-head checks」のような造語的な複合形容詞
- “X, not Y”型の対比表現
代わりに、シンプルな動詞と前置詞を使って実際の関係性を直接表現するよう求めている。
開発者向けの実践的なコツ
- スキルファイル監査:
AGENTS.mdなど、エージェントに読ませるスキルファイル内の不明確・矛盾した指示が予期しない挙動を招くことがあるため、事前の見直しが有効 - デバッグプロンプト:「正確なスキルファイル名と関連指示を引用し、その挙動になった理由を説明させる」ことで、予期しない動作の原因を特定しやすくなる
- テストの最適化:小さな変更でも過大なテストスイートが走りがちなため、「新たな障害や未解決の問題がある場合のみテストを再実行する」よう明示的に指示するとよい
- サブエージェントへの委譲:並行実行するサブエージェントに対しては、委譲するタイミングと作業範囲を明確に指定する必要がある
Astraを日常的に、あるいは開発ワークフローに組み込んで使うなら、こうした「モデルの癖」を踏まえたプロンプト設計が、体感速度や出力品質を大きく左右しそうだ。
アップデート:ベンチマーク改版でAstraとClaude Fable 5.1の差が明確に
第三者ベンチマーク機関Artificial Analysisは、GPT-6 Astraのスコアが実際の性能向上を反映していないとの批判を受け、「Intelligence Index」をv4.2に改版した。
改版前は前世代のGPT-5.6 Solと同点だったAstraのスコアは、改版後に4ポイント上昇。他のベンチマークではAstraが大きくリードしていたにもかかわらず、Artificial Analysisの評価だけが実態に追いついていなかったことになる。
改版後の総合ランキングは以下の通りだ。
- Claude Fable 5.1(Anthropic)
- GPT-6 Astra(OpenAI)
- Metaの主力モデル
Astraはタスクあたりのトークン消費量で全フロンティアモデルを上回る効率の良さを示しているが、総合スコアでは依然としてClaude Fable 5.1が首位を維持している。
改版では新ベンチマーク「AA-Briefcase」「GDP.pdf」を追加する一方、性能が飽和した「GPQA-Diamond」を除外し、非公開テストデータの比重を40%まで拡大するなど、採点方法そのものにも手が入った。急速に進化するフロンティアモデルの実力を測るための、暫定的な対応だという。
アップデート:開発者がAstraだけでポータルを完全クリア、所要時間約24時間
開発者のcozyblaze氏が、GPT-6 Astraに人間の介入を一切加えず、パズルゲーム「Portal」を最初から最後までクリアさせることに成功した。所要時間は約23時間43分で、コードとドキュメントはGitHubで公開されている。
Astraは、MCP(Model Context Protocol)と改良版のSourcePauseToolを通じてゲームを制御した。ゲームを一時停止するたびにスクリーンショット、プレイヤー位置、カメラ角度を認識し、次に取る入力を選んでからゲームを再開する、という手順を繰り返す方式だ。トークン使用量は定価換算で最低570ドル相当にのぼったが、cozyblaze氏自身は200ドルのCodex購読の範囲内でこれを実現したという。
この成果は、OpenAIが2016年に掲げていた「単一のエージェントが複数のゲームを解けるようにする」という長年のビジョンが、具体的な形で実証された事例といえる。cozyblaze氏は「Astraは今後登場するモデルの中では最悪の出来だろう」とコメントしており、今後さらに高度な自律エージェントが登場することを示唆した。
コンピューター操作AIとしてのAstraの実力は、業務アプリの操作にとどまらず、事前に用意されていない環境でも長時間にわたり自律的にタスクを遂行できる水準に達しつつあることを、この事例は示している。
アップデート:自動販売機経営とドローン操縦、独立評価機関のベンチマークでClaude Fable 5.1を上回る
AIエージェント評価機関Andon Labsが、Astraを2種類の実務寄りベンチマークで検証し、Claude Fable 5.1を上回る結果を報告した。
**仮想自動販売機経営(Vending-Bench)**では、AIが自動販売機事業の仕入れ・価格設定・在庫管理を丸ごと任される。Astraの平均最終残高は$15,515で、Fableの$5,422を大きく上回った。仕入れ交渉でも安定した判断を示し、取引先が倒産した際の損失はゼロだったという。なお両モデルの価格判断には違いがあり、Astraは価格固定の提案を拒否したのに対し、Fableは「違法な価格カルテルに相当する合意」に応じたと報告されている。
**ドローン操作タスク(Drone-Bench)**では、3D環境の再構成、機体の位置特定、ナビゲーション、人物検出、追跡という5つのタスクすべてで、Astraが初めて人間とAIの基準値を上回った。ただし各タスクを個別に見ると成功率にはばらつきがあり、5タスクすべてを連続して完遂できた確率は2.8%にとどまる。
自動販売機経営もドローン操縦も、これまでは特化型のツールや人手が前提だった業務領域だ。汎用AIモデルがこうした実務タスクで基準値を上回り始めたことは、監視ドローンのような用途を含め「AIに何が任せられるか」を見極める必要性を、規制当局や利用者双方に突きつけている。
アップデート:OpenAI公式が業務効率の具体的な数値を公表
OpenAIは公式ブログで、Astraの「仕事のための知能」としての性能を裏付ける追加のベンチマーク結果を公表した。ソフトウェア開発の実行環境を評価するTerminal Bench 4.0では57.9%を記録し、前世代のGPT-5.6 Solの37.3%から大きく上回った。財務モデリングの実技を競うFinancial Modeling World Cupの課題では、コンピューター操作を使い、優勝した人間の参加者よりも約4倍速く完了したという。
安全性の指標としては、意図しない挙動の発生率がGPT-5.6 Solと比べて89%減少したとしている。あわせてOpenAI社内のエンジニアチームでは、応答までの待ち時間が従来比で25分の1に短縮されたとも説明しており、社内の開発ワークフローにもAstraを組み込んで効果を検証していることをうかがわせる。
料金体系は入力100万トークンあたり10ドル、出力100万トークンあたり50ドルからで、既存の外部ツールとAPI連携がなくても既存アプリと組み合わせて使える設計を強調している。これらの数値は、Astraが単なるベンチマークスコアの向上にとどまらず、実務での作業時間短縮に直結することを示す材料としてOpenAIが位置付けているものだ。
アップデート:Pro購読の新規登録を一時停止
2026年9月10日、OpenAIはAstraへの需要急増を受け、月額200ドルのPro購読の新規登録を一時的に停止した。製品責任者のThibault Sottiaux氏はXで「Astraへの需要は本当に前例のない水準だ」と述べ、システムへの負荷が深刻であることを明かしている。
Go、Plus、APIなど他のプランは引き続き利用可能で、登録停止の期間については明示されていない。OpenAIは前月にもCodexユーザーの使用制限をリセットしたばかりで、Astraを巡るインフラ負荷が繰り返し表面化している格好だ。Pro購読を検討していたユーザーは、当面Plusなど他プランへの切り替えを視野に入れる必要がありそうだ。
アップデート:数学ベンチマークで首位も、Claude Fable 5.1に逆転される
未解決の数学問題226問を集めたベンチマーク「ErdosBench」で、Astraはスコア3.23・106問解決という結果を残し、一時は首位に立った。前世代GPT-5.6 Solと比べて5〜10%の向上だという。しかしその後、Anthropicの Claude Fable 5.1 がAstraを上回り、首位を明け渡している。
注目すべきは、OpenAIがこの結果を意図的な最適化の産物とは位置付けていないことだ。同社チーフサイエンティストのJakub Pachockiは「我々は数学研究をより優れたものにすることができるが、再帰的自己改善と自動整列研究の緊急性のため、この方向を優先しない」と説明している。つまり最高レベルの数学能力は、他の優先事項に取り組んだ副産物として得られたものだという。
この結果は、AIが全領域で均等に進化するのではなく特定分野で突出して進化する「スパイキーAGI」仮説を支持する材料としても注目されている。数学界では、Terence Taoが指摘する「証明の過剰供給」という新たな課題も浮上しつつある。
アップデート:Perplexity・Cognitionが実運用でAstraを採用、監視頻度の低下を証言
OpenAIは公式ブログで、Astraを本番環境に組み込んだ2社の導入事例を新たに公開した。
Perplexityは、社内コミュニケーション文書の作成やソフトウェアの変更、本番システムの監視といった一連の業務をAstraに任せていると明かした。従来モデルに比べて人間が結果を逐一確認する頻度を大きく減らせているといい、エンドツーエンドのシステム運用をAIに委ねる段階に踏み込んだ格好だ。
Cognition(コーディングエージェント「Devin」の開発元)は、Astraを使うことでDevin自身が書いたコードのテストと動作確認の精度を高められたと説明している。狙いは、エンジニアがレビューすべきコード量を減らしつつ、開発・リリースのペースを上げることにある。
両社の事例に共通するのは、Astraを「作業を代行するAI」から一歩進めて「成果物の正しさ自体を検証させるAI」として使い始めている点だ。人間のチェックを介さずにタスクの完了を判断できる場面が増えるほど、開発・運用ワークフローにおけるAstraの位置づけは大きくなっていきそうだ。
アップデート:ロボット操作の空間推理で「段階的な飛躍」、専門家が評価
新設のロボティクスベンチマーク「StationeryBench」で、Astraの空間推理能力が競合を大きく引き離す結果が出た。このベンチマークは、マーカーのキャップを外す、クリップを注ぐ、定規をロボットアーム間で受け渡すといった机上作業5種類を、双腕ロボット「YAM」に実行させて評価するもの。200回の試行の結果、Astraは100タスク中7件を完全達成し中央値スコア46/100を記録した一方、Ai2の「MolmoAct2」は完全達成0件・中央値スコア12/100にとどまった。
コーネル大学とGoogle DeepMindの研究者Yoav Artzi氏は、この結果を「空間推理における段階的な飛躍」と評価している。未発表のベンチマーク「REMAP」ではAstraがほぼ人間レベルの精度に達している一方、StationeryBenchのような別のシナリオではまだ人間の水準に届いていないともいい、進歩にはばらつきがある。Artzi氏は、OpenAIがBlenderで生成した3Dシーンなど大量の3Dデータでモデルを訓練した可能性を指摘し、これがAstraの空間タスクに特化した性能向上につながったのではないかと推測している。
Astraはこれまでパソコン操作AIとして紹介されてきたが、今回のベンチマーク結果は、物理世界でロボットアームを制御する用途への応用可能性を示すものだ。ロボティクス分野の開発者にとっては、Astraが単なるデスクトップ作業の自動化にとどまらず、実機を動かすタスクでも実用レベルに近づきつつあることを示す材料といえる。