[Olewave's Review] AudioLM: a Language Modeling Approach to Audio Generation

Tutorials

[Olewave의 리뷰] AudioLM: 오디오 생성을 위한 언어 모델링 접근

AudioLM은 많은 사람들에게 오디오 생성이 신호 처리보다는 언어 모델링처럼 보여야 한다고 확신시킨 논문입니다.

AudioLM은 많은 사람들에게 오디오 생성이 신호 처리보다는 언어 모델링처럼 보여야 한다고 확신시킨 논문입니다. Google의 프레임워크는 원시 파형을 이산 토큰으로 매핑한 다음, 그 위에 언어 모델을 훈련하여 오디오 연속을 다음-토큰 예측으로 캐스팅합니다. 영리한 부분은 하이브리드 토큰화입니다: 마스크된 오디오 언어 모델의 의미론적 토큰이 장기 구조를 처리하고, 신경망 코덱의 음향 토큰이 높은 충실도 합성을 제공합니다. 함께 그들은 이전 접근 방식을 막았던 트레이드오프를 해결합니다.

기록이나 레이블이 없는 원시 파형에 대해 훈련된 AudioLM은 보이지 않는 음성에 대해 화자 정체성과 운율을 보존하면서 구문론적으로나 의미론적으로 일관성 있는 음성 연속을 생성합니다. 또한 음성을 넘어 일반화하여 기호적 음악 표현 없이 그럴듯한 피아노 연속을 생성합니다. 이것은 VALL-E, MusicLM, 그리고 토큰 기반 TTS 시스템의 물결의 직접적인 지적 선조입니다. 따라서 2단계 토큰화 설계를 이해하면 그 이후에 나온 모든 것을 읽을 때 배당금을 지불합니다. 토큰 기반 생성 오디오를 구축하거나 평가하고 있다면, 이 리뷰는 필드를 재구성한 아이디어에 대한 가치 있는 입문서입니다.