ElevenLabsが音声生成モデル「Eleven v4」公開、対応言語90超・遅延150ミリ秒に短縮
ElevenLabsが新型音声生成モデル「Eleven v4」と高速版「v4 Turbo」を公開した。対応言語を90以上に拡大し、発音精度は91.7%に向上。v4 Turboは150ミリ秒という低遅延を実現した。
続きを読むElevenLabsが新型音声生成モデル「Eleven v4」と高速版「v4 Turbo」を公開した。対応言語を90以上に拡大し、発音精度は91.7%に向上。v4 Turboは150ミリ秒という低遅延を実現した。
続きを読むGoogleが表現力豊かな音声を生成する新モデル「Gemini 3.8 Flash TTS」「Flash-Lite TTS」を発表。自然言語で声を一から作れる機能や30秒サンプルでの声複製に対応し、開発者は即座にAPIで利用できる。
続きを読むGoogle DeepMind has unveiled Gemini 3.1 Flash TTS, an advanced text-to-speech model that delivers natural-sounding voice synthesis with fine-grained control over style, pace, and tone. The model supports over 70 languages and sets a new standard for expressive AI audio generation.
続きを読む