[롱 리뷰] Speaker Verification에서 Multispeaker Text-To-Speech Synthesis로의 Transfer Learning
이 논문은 제로샷 음성 클로닝을 실용적으로 만든 연구입니다: 수천 개의 노이즈가 많고 전사본이 없는 음성으로 판별적 검증 작업에서 speaker encoder를 학습한 후, 그 임베딩을 Tacotron 2로
이 논문은 제로샷 음성 클로닝을 실용적으로 만든 연구입니다: 수천 개의 노이즈가 많고 전사본이 없는 음성으로 판별적 검증 작업에서 speaker encoder를 학습한 후, 그 임베딩을 Tacotron 2 synthesizer와 WaveNet vocoder로 입력합니다. 결과는 몇 초의 참조 오디오에서 새로운 speaker를 모방할 수 있는 TTS 시스템이며, 학습 중에 본 적이 없는 speaker도 모방할 수 있습니다.
Google의 Jia et al. 작업에 대한 이 롱 리뷰는 세 가지 모듈을 자세히 살펴봅니다: verification 목표로 학습된 speaker encoder, 임베딩에 조건화된 sequence-to-sequence mel-spectrogram synthesizer, 그리고 autoregressive WaveNet vocoder. 또한 encoder를 일반화하기 위해 필요한 speaker 다양성의 크기를 정량화하는 ablation을 설명하고, 무작위로 샘플링된 임베딩도 일관성 있는 새로운 음성을 생성한다는 놀라운 결과도 다룹니다. 음성 클로닝, 개인화된 TTS, 또는 speaker 임베딩 분야에서 무언가를 구축하고 있다면, 이 논문은 필수 읽을거리이며 이 깊이 있는 리뷰는 모든 부분을 다룹니다.
