Metaがリアルタイム音声認識モデル公開、20人超を聞き分け価格は業界最安級
Meta Superintelligence Labsが音声認識モデル「Muse Voice Transcribe」を発表。話者分離・発話区切り検出まで1モデルに統合し、応答時間0.16秒、価格は1時間18セントと低価格を実現した。
続きを読むMeta Superintelligence Labsが音声認識モデル「Muse Voice Transcribe」を発表。話者分離・発話区切り検出まで1モデルに統合し、応答時間0.16秒、価格は1時間18セントと低価格を実現した。
続きを読む2026年ワールドカップでは、Sony のホークアイテクノロジーが最新の AI 技術で進化し、各スタジアムに配置した16台の光学追跡カメラが選手の位置をリアルタイムで 3D 追跡。完全自動化されたオフサイド判定が試合の公平性を支えています。
続きを読む中国・香港・シンガポール拠点の研究チームが Apache 2.0 で公開した新音声モデル Audio-Interaction。Qwen2.5-Omni-3B ベースで、従来の音声AIと異なり「0.4秒ごとに応答するか沈黙するかを判定」しながらリアルタイムで翻訳・文字起こしに対応。開発者が GitHub から即座に利用可能。
続きを読むD4RTは4D(空間+時間)の動的シーンを一つの仕組みで同時に再構成し、並列処理による高速化でロボットやARの即時応答を実現する次世代技術として期待できます。
続きを読む