UniSpeech-SAT: 화자 인식 사전 학습을 통한 범용 음성 표현 학습
자기 지도 음성 모델은 음성 내용을 아름답게 학습하는 경향이 있지만 화자 신원은 나중에 생각하는 경향이 있습니다. 이는 ASR에는 좋지만 화자 검증, 화자 분할 또는 음성 복제에는 형편없습니다.
자기 지도 음성 모델은 음성 내용을 아름답게 학습하는 경향이 있지만 화자 신원은 나중에 생각하는 경향이 있습니다. 이는 ASR에는 좋지만 화자 검증, 화자 분할 또는 음성 복제에는 형편없습니다. Microsoft의 UniSpeech-SAT는 HuBERT 스타일의 사전 학습에 명시적인 화자 인식 목표를 주입하여 이 간격을 메웁니다: 발화 단위의 대조 손실과 발화 혼합은 인코더가 무엇이 말하고 있는지뿐만 아니라 누가 말하고 있는지를 나타내도록 강제합니다.
이러한 결과는 SUPERB 벤치마크에 걸쳐 나타나며, UniSpeech-SAT는 화자 식별, 검증 및 화자 분할에서 특히 강한 수치를 기록하면서 ASR 및 음소 인식에서도 자신의 역할을 수행합니다. 이 세션은 발화 혼합이 어떻게 구성되는지, 추가 대조 항이 콘텐츠 학습을 해치지 않는 이유, 그리고 이 설계가 곧 WavLM의 길을 열어준 방법을 설명합니다. 음성을 구분해야 하는 무언가를 구축하는 경우 - 회의 전사부터 생체 인증까지 - 10분 정도의 시간을 할애할 가치가 있습니다.
