Google의 100개 이상 언어를 지원하는 Universal Speech Model이 OpenAI의 Whisper Model을 능가합니다
Google의 Universal Speech Model은 조용히 놀라운 성과를 달성했습니다: 레이블이 지정된 훈련 데이터의 약 1/7을 사용하면서 100개 이상의 언어에서 OpenAI의 Whisper와 동등하거나 능가하는 ASR 성능을 달성했습니다.
Google의 Universal Speech Model은 조용히 놀라운 성과를 달성했습니다: 레이블이 지정된 훈련 데이터의 약 1/7을 사용하면서 100개 이상의 언어에서 OpenAI의 Whisper와 동등하거나 능가하는 ASR 성능을 달성했습니다. 이 리뷰는 이들이 그것을 어떻게 성취했는지 파고듭니다 — 답변은 단순히 더 많은 컴퓨팅은 아닙니다. USM은 300개 이상의 언어를 지원하는 방대한 1,200만 시간의 레이블이 없는 다국어 데이터셋에 의존하고, 그런 다음 자체 지도 학습 목표를 위한 임의 투영 양자화를 사용하고 감독 미세 조정으로 깔끔하게 연결하기 위해 음성-텍스트 양식 매칭을 사용합니다.
이 설명은 전체 사전 훈련 레시피, RPQ가 학습된 코드북을 필요로 하지 않고 SSL 목표를 위한 경량 양자화기로 작동하는 이유, 그리고 웹 규모에서 쌍을 이루는 데이터를 요구하지 않고 음성 및 텍스트 표현을 정렬하는 방법을 다룹니다. 그 결과는 도메인 내 및 도메인 외 모두 낮은 리소스 언어의 긴 꼬리에 걸쳐 다운스트림 다국어 ASR 및 음성-텍스트 번역으로 일반화되는 단일 인코더입니다. 이는 완전히 감독된 접근 방식이 시작되는 위치입니다. 당신의 제품이 상위 20개 언어를 넘어 사용자들을 서비스해야 한다면, 다국어 음성 스택에 커밋하기 전에 이해할 가치가 있는 모델 아키텍처입니다.
