バイトダンスが音声・動画全二重大規模モデル「SeedRealtime」を発表

PANews 8月5日ニュース、財聯社の報道によると、バイトダンスはネイティブな音声・動画全二重大規模モデル「SeedRealtime」を正式に発表した。SeedRealtimeは統一アーキテクチャで音声、動画、テキストをネイティブに融合し、連続するマルチモーダル情報ストリーム上でリアルタイムに対話でき、「見ながら、聞きながら、話す」というまったく新しい体験をもたらす。エンドツーエンドの人手評価の結果、カスケードモデルと比較して、SeedRealtimeの音声・動画対話のリズム問題は半減し、モデルが話すタイミングをより自然に捉えられ、「話し終わる前に遮られる、話し終わっても応答が遅れる、あるいは背景の雑音や雑談で誤って起動してしまう」といった引っかかり現象が大幅に減少した。同時に、1回の対話で完全かつスムーズにコミュニケーションできる確率も明らかに向上した。現在、SeedRealtimeは豆包(Doubao)アプリで全ユーザー向けに提供されている。

共有先:

著者:PA一线

この内容は市場情報の提供のみを目的としており、投資助言を構成しません。

PANews公式アカウントをフォローして、強気・弱気相場を一緒に乗り越えましょう
関連トピック
PANews APP
日本金融庁が暗号規制体制を再編、新たに「暗号資産・ステーブルコイン課」を設置
PANews 速報