ElevenLabsが音声生成モデル「Eleven v4」公開、対応言語90超・遅延150ミリ秒に短縮
ElevenLabsが新型音声生成モデル「Eleven v4」と高速版「v4 Turbo」を公開した。対応言語を90以上に拡大し、発音精度は91.7%に向上。v4 Turboは150ミリ秒という低遅延を実現した。
続きを読むElevenLabsが新型音声生成モデル「Eleven v4」と高速版「v4 Turbo」を公開した。対応言語を90以上に拡大し、発音精度は91.7%に向上。v4 Turboは150ミリ秒という低遅延を実現した。
続きを読むGoogleが、Geminiがユーザーの代わりに店舗や企業に電話をかける新機能「Call for Me」のテストを開始した。米国のPixel 11所有者かつGemini有料購読者が対象で、通話はいつでも本人が引き継げる。
続きを読むGoogleがGemini 3.8 Liveに「Live Avatar」を追加し、AIとの対話にリアルタイムの視覚的な存在感を持たせた。企業ブランドに合わせたカスタムアバターも生成可能で、まずGemini Enterpriseから提供する。
続きを読むGoogleが表現力豊かな音声を生成する新モデル「Gemini 3.8 Flash TTS」「Flash-Lite TTS」を発表。自然言語で声を一から作れる機能や30秒サンプルでの声複製に対応し、開発者は即座にAPIで利用できる。
続きを読むOpenAIがChatGPT VoiceをGPT-6 Astra・Sol・Lunaへ刷新し、音声会話中にメール・カレンダー・Slackを操作できるプラグイン機能を追加。モバイルのWorkタブでも音声起動が可能になった。
続きを読むAlibaba の Qwen チームが音声AI「Qwen-Audio-3.1」を発表。音声認識・音声合成・リアルタイム対話の5モデルを刷新し、価格を最大95%引き下げた。企業の音声AI導入コストが大幅に下がる。
続きを読むGoogleがGemini 3.8 Liveと高度推論版のExtended Thinkingを発表。近リアルタイムの音声対話や97言語の自動切り替えに対応し、開発者はGemini APIで即座に利用できる。
続きを読むOpenAI が新音声モデル GPT-Live-1 をリリース。フルデュプレックス技術により、ユーザーは話しながら AI に割り込まれ、30~40 分の長時間会話に対応。ChatGPT 無料ユーザーは GPT-Live-1 mini、有料ユーザーは GPT-Live-1 フル版が利用可能。7 月中に API アクセスも予定。
続きを読むリアルタイム音声対話に特化したスタートアップが、Seligman Venturesなど主要VCから $13M を調達。応答遅延ほぼゼロで、人間と区別つかない音声エージェント実現へ。
続きを読む6年ぶりに Google がスマートスピーカーの新作 「Google Home Speaker」を発表。価格は $99.99。従来の「OK Google」コマンド型から脱却し、Gemini を搭載することで自然言語対話が可能に。6月25日より米国で販売開始。
続きを読む中国・香港・シンガポール拠点の研究チームが Apache 2.0 で公開した新音声モデル Audio-Interaction。Qwen2.5-Omni-3B ベースで、従来の音声AIと異なり「0.4秒ごとに応答するか沈黙するかを判定」しながらリアルタイムで翻訳・文字起こしに対応。開発者が GitHub から即座に利用可能。
続きを読むOpenAI は音声クローニングスタートアップ Weights.gg を買収。セレブの声を複製するツールを開発してきた同社のチームは、ChatGPT や開発者向け API に音声技術を統合する予定です。
続きを読むWispr などのAI音声ディクテーションツールの普及により、オフィスの音声環境が急速に変わりつつある。スタートアップからエンタープライズまで、職場での仕事スタイルと社員間コミュニケーションが『音声優先』へシフト。夫婦間の違和感から経営層の懸念まで、その影響は多方面に及んでいる。
続きを読むParloa が OpenAI のモデルを活用し、スケーラブルな音声駆動型 AI カスタマーサービスエージェントを構築。設計・シミュレーション・デプロイを可能にし、企業向けの信頼できるリアルタイムインタラクションを実現。
続きを読むOpenAIが3つの新音声モデルを発表。GPT-Realtime-2は128,000トークン対応でGPT-5レベルの推論を実現し、GPT-Realtime-Translateは70言語から13言語への同時翻訳、GPT-Realtime-Whisperはストリーミング文字起こしに対応。すべてRealtime APIを通じて利用可能。
続きを読むOpenAIが音声AIの技術的基盤を刷新しました。WebRTCスタックの再構築により、低レイテンシーでシームレスな会話ターンテイキングが実現され、グローバルスケールでの配信が可能になりました。
続きを読むKnownがサンフランシスコの試験で報告した音声AIは、紹介の約80%が実デートに至ったとされる有望な結果を示しましたが、対象人数や期間など詳細は未公開で、今後の透明なデータ公開と再現性の検証が期待されています。
続きを読む