OpenAI が新音声モデル GPT-Live-1 と GPT-Live-1 mini をリリースした。最大の特徴は「フルデュプレックス」アーキテクチャで、従来の音声 AI では音声認識→テキスト生成→音声合成の流れが順序立てて実行されていたが、GPT-Live では 同時にリッスンとスピークが可能。ChatGPT ユーザーの「話している途中での割り込み」や「自然なやり取り」への期待が現実化する。

従来の音声 AI との差異

従来の OpenAI ChatGPT Voice は音声認識と合成の間で遅延が生じ、ユーザーが話終わるのを待つ設計だった。GPT-Live は GPT-5.5 と統合され、会話がレイテンシーなく進む。会話の途中で AI が応答を開始でき、ユーザーが割り込むことも可能。

利用可能性と提供層

  • GPT-Live-1 mini: ChatGPT 無料ユーザー向け、デフォルトで利用可能
  • GPT-Live-1: ChatGPT Plus / Pro ユーザー向け、7 月中に一般向けリリース予定
  • API アクセス: 開発者向け API は同時期に提供開始予定

長時間会話と文脈保持

会話時間は従来の数分制限から 30~40 分 に拡張。AI は「話されていない沈黙の時間」でも会話の文脈を保持し、より自然な応答が可能になった。例えば、ユーザーが数秒間沈黙した後に発言しても、AI はその間の会話流れを理解して継続する。

ライブ翻訳機能とまだ改善中の領域

ライブ翻訳機能も搭載されたが、テスト段階ではヒンディー語での翻訳が「不自然な響き」との評価を受けており、多言語対応はまだ開発途上。今後のアップデートで精度向上が期待される。

「自分ごと」としての新しい使い方

従来の テキストベースの ChatGPT や DALL-E との違いは、リアルタイム会話がより人間らしくなる という点。複雑な質問を音声で長時間かけてリサーチできるようになり、「考えながら会話する」という学習・相談のワークフローが ChatGPT 内で完結する。特に通勤時間や運転中といった「テキスト入力が難しい場面」での AI 活用が一気に現実的になる。

アップデート: 開発者向け API が正式公開、料金は 1 分 0.05 ドル

OpenAI は GPT-Live-1 を開発者向け API として正式公開した。料金は 1 分あたり 0.05 ドルで、前世代モデル GPT-Realtime-2.1 と比較して以下の性能向上が報告されている。

  • フルデュプレックス対応テスト: 80.1%(前世代 45.4%)
  • ターンテイク遅延: 0.8 秒(前世代 1.4 秒)
  • ツール呼び出し精度: 87%(前世代 60%)
  • 銀行向け音声サポートの成功率: 32%(前世代 12.4%)

新たに 12 種類のボイスが追加され、異なるアクセント・言語に対応する。ASR(音声認識)によるトランスクリプトやレスポンステキストの自動出力にも対応した。実利用例として、Yelp が電話予約システムに GPT-Live-1 API を採用し、通話処理の改善を報告している。

開発者にとっては、フルデュプレックス音声を自社アプリに組み込む選択肢が具体的な価格と性能指標つきで示されたことになる。コールセンターや予約システムなど、リアルタイム音声対応が求められるサービスでの導入検討が進みそうだ。