PANews 9月2日付の報道によると、IT之家が9to5Macを引用して伝えたところでは、Metaは初のリアルタイム音声認識モデル「Muse Voice Transcribe」を発表した。開発者はMeta Model APIを通じて利用でき、価格は音声1,000分あたり3ドル(約1時間あたり0.18ドル)。このモデルはストリーミング自動音声認識、話者分離、エンドポイント検出を単一のプロセスに統合しており、ユーザーが話している間にテキストを同時出力でき、録音終了後に全体を処理する必要がない。モデルは70以上の言語(25言語は検証済み)、1時間超の音声、多言語切り替えに対応し、20名以上の話者が含まれる録音から異なる発言者を分離できる。Metaは適応遅延メカニズムを導入し、認識しやすい音声は高速に出力し、複雑な語句にはより多くの文脈を用いることで、速度と精度を両立させている。9月1日時点で、このモデルはArtificial Analysisのストリーミング音声テキスト変換ランキングで1位となっている。
Metaがリアルタイム音声認識AIモデル「Muse Voice Transcribe」を発表、20人以上の話者を分離して文字起こし可能
共有先:
著者:PA一线
この内容は市場情報の提供のみを目的としており、投資助言を構成しません。
PANews公式アカウントをフォローして、強気・弱気相場を一緒に乗り越えましょう
おすすめ記事
PANewsアプリ
24時間ブロックチェーン業界情報を追跡し、深掘り記事を解析。




