[롱 리뷰] Wav2Seq: Pseudo Languages를 사용한 Speech-to-Text Encoder-Decoder Models의 Pre-training
대부분의 speech pretraining은 encoder 측면에 집중했습니다: wav2vec, HuBERT, WavLM, 하지만 sequence-to-sequence ASR은 pretrained decoder도 필요합니다.
대부분의 speech pretraining은 encoder 측면에 집중했습니다: wav2vec, HuBERT, WavLM, 하지만 sequence-to-sequence ASR은 pretrained decoder도 필요합니다. Wav2Seq는 영리한 트릭으로 그 간격을 메웁니다: speech 표현을 이산 pseudo-token으로 클러스터링한 후, 그 토큰을 합성 "pseudo language"로 취급하고 전체 encoder-decoder Transformer를 speech를 그것으로 번역하는 pretraining을 합니다.
이 롱폼 리뷰는 Wav2Seq 파이프라인을 자세히 살펴봅니다: pseudo-language가 어떻게 구성되는지, 그것을 실제 번역 대상으로 취급하는 것이 decoder에 유용한 무언가를 어떻게 가르치는지, 그리고 pretrained 모델이 downstream ASR 및 spoken language understanding 작업으로 어떻게 전이되는지. seq2seq 모듈의 attention에 대한 수정사항이 포함됩니다. 저리소스 ASR, cascaded speech-to-text, 또는 encoder 이상으로 self-supervised pretraining에서 더 많은 것을 짜내려고 하는 경우, 이 깊이 있는 리뷰는 이해할 가치가 있는 모든 설계 선택을 다룹니다.
