OpenAI、GPT-6のSolとLunaを発表 API価格50%値下げでOpus 5超えの実務性能
OpenAIがGPT-6ファミリーにSolとLunaを追加。GPT-5.6比でAPI価格を50%引き下げながら、業務自動化ベンチマークでClaude Opus 5を上回る性能を実現し、ChatGPTとAPIで即日提供を始めた。
OpenAIは9月22日、最上位モデル「GPT-6 Astra」に続く新モデル「GPT-6 Sol」と「GPT-6 Luna」を発表した。API価格を前世代のGPT-5.6比で50%引き下げつつ、業務自動化ベンチマークでClaude Opus 5を上回る性能を示し、コストを抑えたい開発者に選択肢を広げる。
GPT-6ファミリーの拡充
今月上旬に投入されたAstraは、専門的な業務・事実性・コーディング・コンピュータ操作で最高性能を狙う旗艦モデルという位置づけだった。Sol は複雑な作業タスク向け、Luna は文書要約や情報抽出、簡潔な回答といった定型業務向けに設計されており、Astraで培った学習手法を踏襲しつつ、コスト効率を優先したモデルという棲み分けになる。
価格とベンチマーク
API価格は、Solが入力100万トークンあたり4ドルから2ドルへ、出力が20ドルから10ドルへとそれぞれ半減した。Lunaも入力0.20ドルから0.10ドルへ、出力1.20ドルから0.50ドルへと同じく50%引き下げられている。
性能面では、業務ワークフローを検証する「AutomationBench」でSol(xhigh設定)がClaude Opus 5(max設定)を、タスクあたりコストわずか9%で上回った。「Agents’ Last Exam」でもSolはmax設定で56.4%のスコアを記録し、Opus 5の最高スコアを60%低いコストで超えている。事実性の評価では、Solは前世代モデルの約半分のエラー率まで改善し、Astra並みの信頼性に近づいた。コーディング検証の「DeepSWE v1.1」ではSolがmax設定で68.8%を記録し、Claude Fable 5.1のxhigh設定によるスコア69.9%にわずか1.1ポイント差まで迫りながら、コストは約80%低い。
キャッシュ機能の強化と提供開始
OpenAIは長い会話やエージェント処理で再利用されるコンテキストの節約策として、プロンプトキャッシュの改善も同時に発表した。キャッシュされた入力トークンの読み取りには最大90%の割引が適用され、キャッシュ利用状況を可視化するダッシュボードや、キャッシュミスの原因を診断するツールも新たに提供される。
GPT-6 SolとLunaは、ChatGPT WorkとCodexでPlus・Pro・Business・Enterprise・Eduの各プランに対し即日提供が始まった。Free・Goプランのユーザーはデスクトップアプリ経由でLunaを利用できる。APIではgpt-6-sol、gpt-6-lunaとして呼び出し可能だ。ChatGPT上ではサービス安定のため段階的に展開するとしており、表示されない場合は時間を置いて再確認するよう案内している。
競争が激化するAIモデル市場
TechCrunchによれば、この発表と同じ9月22日にAnthropicもClaude Opus 5.5を公開しており、低価格化と性能向上を両立させる開発競争が激しさを増している。OpenAIは今回、GPT-6 Astraで確立した高性能をより安価な層に展開することで、コスト重視の開発者やエージェント開発チームを囲い込む狙いがあるとみられる。
アップデート: 独立分析で性能はGPT-5.6並みとの指摘
第三者ベンチマーク機関Artificial Analysisの分析によると、SolとLunaは価格こそ半減したものの、総合的な知能スコアは前世代のGPT-5.6とほぼ同水準にとどまっているという。特に業務遂行能力を測る「GDPval-AA v2.1」ベンチマークでは、Solのスコアが約100Eloポイント、Lunaが約75Eloポイントそれぞれ低下しており、OpenAIが発表時に強調した「AutomationBench」や「Agents’ Last Exam」などとは異なる結果が出ている。
Artificial Analysisは、モデル発表のたびに都合の良いベンチマークだけが選ばれる傾向を批判しており、SolとLunaの性能差が小さいことで、開発者にとってどちらを選ぶべきかの判断がかえって難しくなっていると指摘する。価格の引き下げ自体は開発者にとって歓迎できる一方、実際の性能向上を伴わない値下げである可能性には注意が必要だ。
アップデート: プロンプトキャッシュに明示的ブレークポイントと診断ツールを追加
OpenAIは同日、プロンプトキャッシュ機能の追加改善も発表した。新たに導入された「明示的ブレークポイント」を使うと、開発者はプロンプトのどこまでをキャッシュ対象にするかを指定できるようになり、変化しにくい前提部分をキャッシュしつつ、頻繁に更新される内容だけをプロンプト末尾に置く構成が可能になる。
あわせて、リクエストごとのキャッシュ未活用の原因を特定する診断ツールと、アプリ全体のキャッシュ利用状況を時系列で確認できるダッシュボードも提供が始まった。OpenAIによれば、これらのツールを使って改善を行ったユーザーの中には、キャッシュヒット率が1週間足らずで83%から91%に向上し、キャッシュ書き込みが約3分の2減少、推論コストが36%下がった事例もあるという。