Meta, 실시간 오디오 인식 AI 모델 Muse Voice Transcribe 공개, 20명 이상 화자 분리 전사 지원

PANews 9월 2일 소식, IT之家가 9to5Mac을 인용해 보도한 바에 따르면, Meta가 첫 실시간 오디오 인식 모델 Muse Voice Transcribe를 출시했다. 개발자는 Meta Model API를 통해 호출할 수 있으며, 가격은 오디오 1,000분당 3달러(시간당 약 0.18달러)이다. 이 모델은 동일한 프로세스에서 스트리밍 자동 음성 인식, 화자 분리 및 끝점 탐지를 통합해 사용자가 말하는 동안 텍스트를 동시에 출력할 수 있어 전체 녹음이 끝난 후 처리할 필요가 없다. 이 모델은 70개 이상의 언어(25개 검증 완료), 1시간 이상의 오디오 및 다국어 전환을 지원하며, 20명 이상의 화자가 포함된 녹음에서 서로 다른 발화자를 분리할 수 있다. Meta는 적응형 지연 메커니즘을 도입해 인식하기 쉬운 음성은 빠르게 출력하고, 복잡한 단어는 더 많은 문맥을 활용해 속도와 정확도를 모두 고려한다. 9월 1일 기준, 이 모델은 Artificial Analysis 스트리밍 음성-텍스트 변환 순위에서 1위를 차지했다.

공유하기:

작성자: PA一线

이 내용은 시장 정보 제공만을 목적으로 하며, 투자 조언을 구성하지 않습니다.

PANews 공식 계정을 팔로우하고 함께 상승장과 하락장을 헤쳐나가세요
PANews APP
AI 보안 스타트업 AIR, 5,000만 달러 투자 유치... 세쿼이아와 그린옥스 주도
PANews 속보