PANews 9월 2일 소식, IT之家가 9to5Mac을 인용해 보도한 바에 따르면, Meta가 첫 실시간 오디오 인식 모델 Muse Voice Transcribe를 출시했다. 개발자는 Meta Model API를 통해 호출할 수 있으며, 가격은 오디오 1,000분당 3달러(시간당 약 0.18달러)이다. 이 모델은 동일한 프로세스에서 스트리밍 자동 음성 인식, 화자 분리 및 끝점 탐지를 통합해 사용자가 말하는 동안 텍스트를 동시에 출력할 수 있어 전체 녹음이 끝난 후 처리할 필요가 없다. 이 모델은 70개 이상의 언어(25개 검증 완료), 1시간 이상의 오디오 및 다국어 전환을 지원하며, 20명 이상의 화자가 포함된 녹음에서 서로 다른 발화자를 분리할 수 있다. Meta는 적응형 지연 메커니즘을 도입해 인식하기 쉬운 음성은 빠르게 출력하고, 복잡한 단어는 더 많은 문맥을 활용해 속도와 정확도를 모두 고려한다. 9월 1일 기준, 이 모델은 Artificial Analysis 스트리밍 음성-텍스트 변환 순위에서 1위를 차지했다.
Meta, 실시간 오디오 인식 AI 모델 Muse Voice Transcribe 공개, 20명 이상 화자 분리 전사 지원
공유하기:
작성자: PA一线
이 내용은 시장 정보 제공만을 목적으로 하며, 투자 조언을 구성하지 않습니다.
PANews 공식 계정을 팔로우하고 함께 상승장과 하락장을 헤쳐나가세요
추천 읽기
관련 특집
PANews 앱
24시간 블록체인 업계 소식을 추적하고 심층 기사를 분석합니다.




