Meta發佈實時音頻感知AI模型Muse Voice Transcribe,支持20餘人分軌轉寫

PANews 9月2日消息,據IT之家援引9to5Mac報導,Meta推出首個實時音頻感知模型Muse Voice Transcribe,開發者可透過Meta Model API調用,定價為每1,000分鐘音頻3美元(約合每小時0.18美元)。該模型在同一流程中整合流式自動語音識別、說話人分離與端點檢測,用戶說話時可同步輸出文字,無需等待完整錄音結束後再處理。模型支持70餘種語言(25種已驗證)、超1小時音頻及多語言切換,可在包含20餘名說話者的錄音中分離不同發言者。Meta引入自適應延遲機制,對易識別語音快速輸出,對複雜詞語調用更多上下文以兼顧速度與準確度。截至9月1日,該模型在Artificial Analysis流式語音轉文本排行榜中位列第一。

分享至:

作者:PA一线

本內容只為提供市場資訊,不構成投資建議。

關注PANews官方賬號,一起穿越牛熊
PANews APP
AI安全初創公司AIR完成5000萬美元融資,紅杉和Greenoaks領投
PANews 快訊