Metaは、初のリアルタイム音声認識モデル「Muse Voice Transcribe」を公開した。Meta Superintelligence Labsが開発したこのシステムは、音声をテキストに変換し、話者を識別するとともに、発話が終了したかどうかを判定する。モデルは、1時間を超える録音や20人を超える話者が参加する会話を、追加処理なしで処理できる。70以上の言語で学習され、そのうち25言語については初回リリース前に包括的な検証が行われた。言語の切り替わりや、文脈に基づいて固有名詞を認識することもできる。会話を80ミリ秒単位で処理する「適応型レイテンシー」システムは、速度と精度のバランスを取る。発話の開始と終了を区別し、音声アプリケーションにおける応答のタイミングを判断する。Metaは、同モデルが9月1日時点でArtificial Analysisのランキング首位に立ったと発表した。この技術は、Meta AIのデスクトップ向け音声入力とMuse Codeに追加された。APIの料金は千分あたり3ドルで、1時間あたり約18セント。WhatsApp、Instagram、Messengerへの統合については明らかになっていない。
なぜ重要なのか
この進展がもたらす実用上の効果は、音声アプリが会話をテキスト化するだけでなく、誰が話しているのか、またインタラクションがいつ終了したのかも処理できるようになる点にある。特に、長時間の録音、複数の参加者による会話、複数の言語が使われる会話を扱う開発者に関わるものであり、言語の切り替わりや文脈から固有名詞を識別できることも、こうした用途において付加価値をもたらす可能性がある。リアルタイム処理と適応型レイテンシーにより、アプリはモデルの発話の流れに応じて、応答を生成するタイミングを判断できる。API料金が明らかにされたことで、技術の利用を検討する人は事前にコストを計算できるようになる一方、モデルがWhatsApp、Instagram、Messengerに追加されるかどうかは、ユーザー体験への影響という点で依然として未解決の問題となっている。
背景
Metaは、FikirPilotのアーカイブにおいて新しい名前ではない。直近90日間で、この名前に言及した記事を4本公開しており、最も新しい記事は2026年8月30日付となっている。