Speech Generative AI: VoiceBox by Meta AI (also Flow Matching and Neural ODE)

Tutorials

음성 생성 AI: Meta AI의 VoiceBox(Flow Matching과 Neural ODE도)

수년 동안 음성 생성은 규모와 일반성 측면에서 텍스트 및 이미지 생성에 뒤떨어졌습니다 — 모든 작업은 자체 맞춤형 모델을 사용했습니다.

수년 동안 음성 생성은 규모와 일반성 측면에서 텍스트 및 이미지 생성에 뒤떨어졌습니다 — 모든 작업은 자체 맞춤형 모델을 사용했습니다. Meta AI의 VoiceBox는 이 패턴을 깨뜨렸습니다. 50,000시간 이상의 필터링되지 않은 음성으로 훈련된 비자동회귀 flow matching 모델로, 한 가지를 잘하도록 설계되었습니다: 주변 컨텍스트와 텍스트가 주어졌을 때 오디오를 채우기. 이 단일 목표는 영점 샷 TTS, 교차언어 합성, 노이즈 제거, 콘텐츠 편집, 스타일 전환을 모두 동일한 체크포인트에서 활용할 수 있게 합니다.

이 리뷰는 flow matching(그리고 그 아래의 Neural ODE 메커니즘)이 음성에 왜 그렇게 잘 맞는지 설명합니다 — 연속적이고 비자동회귀이며 유사한 품질에서 확산보다 극도로 빠릅니다. 또한 헤드라인 숫자들을 문맥에 넣습니다: VoiceBox는 명료성(1.9% vs 5.9% WER)과 화자 유사성 모두에서 VALL-E를 이기면서 최대 20배 빠르게 실행됩니다. VALL-E와 Whisper 이후 음성 기초 모델이 어디로 향하는지 추적하고 있거나, flow matching이 그냥 유행어를 읽는 대신 실제로 무엇을 하는지 이해하고 싶다면, 이 심화 분석은 들을 가치가 있습니다.