iOS 16์ ์๋ก์ด ๋ฐ์์ฐ๊ธฐ ๊ธฐ๋ฅ์ ์ด๋ป๊ฒ ์๋ํ ๊น์? Apple์ ๋น๊ฒฐ์ ์์ฑ ์ฐ๊ตฌ์์ด ๋ฐํ์ค๋๋ค!
Apple์ iOS 16 ๋ฐ์์ฐ๊ธฐ๋ ์์ ํ ๊ธฐ๊ธฐ์์ ์คํ๋๋ฉฐ, ์ด ๋จ์ผ ์ค๊ณ ์ ํ์ ์ง์ฐ ์๊ฐ, ๊ฐ์ธ์ ๋ณด ๋ณดํธ, ๊ทธ๋ฆฌ๊ณ ํด๋ํฐ์์ ์คํ ๊ฐ๋ฅํ ASR ์ํคํ ์ฒ์ ์ข ๋ฅ์ ๋ํ ์ฐ์์ ์ํฅ์ ๋ฏธ์นฉ๋๋ค.
[์ฅ๋ฌธ ๋ฆฌ๋ทฐ] Conformer: ์์ฑ ์ธ์์ ์ํ Convolution-augmented Transformer
Conformer๋ end-to-end ASR์ ์กฐ์ฉํ ์ฅ์ ํ ๋ชจ๋ธ์ด๋ฉฐ, ๋ชจ๋ Transformer ๋ธ๋ก์ convolution ๋ชจ๋์ ์ถ๊ฐํ๋ ๊ทธ ๋ฐฉ์์ ๋จ์ํ์ง๋ง ๋๋๊ฒ๋ ์ ์๋ํ๋ ์์ด๋์ด ์ค ํ๋์ ๋๋ค.
[๋จ๋ฌธ ๋ฆฌ๋ทฐ] Conformer: ์์ฑ ์ธ์์ ์ํ Convolution-augmented Transformer
Conformer๋ ๊ฑฐ์ ๋จ์ํ ์์ ์ ํตํด ASR ์ธ๊ณ๋ฅผ ํฉ์ธ์์ต๋๋ค: ๊ฐ Transformer ๋ธ๋ก์ convolution ๋ชจ๋์ ๋ถ์ฌ ๋ชจ๋ธ์ด ์ ์ญ ์ปจํ ์คํธ์ ๋ก์ปฌ ์ํฅ ์ธ๋ถ ์ ๋ณด๋ฅผ ํ ๋ฒ์ ํฌ์ฐฉํ ์ ์๋๋ก ํ์ต๋๋ค.
๋ฐ์ฌ ์์ ์จ๊ฐ ์ปดํจํฐ๋ก 2022 ๋์ ์ํ ์ํ์ ์ต์ข ๋ฌธ์ ๋ฅผ ํ๋ค
์ฐ๊ตฌ์ฉ ์ปดํจํฐ ๋์ํ ๋๊ตฌ๋ฅผ 2022 ์ค๊ตญ ๊ฐ์ค์นด์ค ์ํ ์ํ์ ๊ฐ์ฅ ์ด๋ ค์ด ๋ฌธ์ ์ ์ฌ์ฉํ๋ฉด ์ด๋ค ์ผ์ด ์ผ์ด๋ ๊น์?
[์ฅ๋ฌธ ๋ฆฌ๋ทฐ] Cascaded Diffusion Models for High Fidelity Image Generation
Imagen๊ณผ DALL-E 2๊ฐ ์์ฑ ์ด๋ฏธ์ง๋ฅผ ์ํ ํ์ฐ์ ๊ธฐ๋ณธ๊ฐ์ผ๋ก ๋ง๋ค๊ธฐ ์ ์, ์ด Google Brain ๋ ผ๋ฌธ์ ์ดํ ๋ง์ ํ ์คํธ-์ด๋ฏธ์ง ์์คํ ์ด ์กฐ์ฉํ ์ฐจ์ฉํ cascaded diffusion ๋ ์ํผ๋ฅผ ์ ์ํ์ต๋๋ค: ์์
[๋จ๋ฌธ ๋ฆฌ๋ทฐ] Cascaded Diffusion Models for High Fidelity Image Generation
Cascaded diffusion์ ๋ง์ ์ต์ ์์ฑ ์์ ์ ๊ธฐ์ ๋ฅผ ์ด๋ฃจ๋ ๋ค๋จ๊ณ ๋ ์ํผ์ ๋๋ค: ํ ๊ฐ์ diffusion ๋ชจ๋ธ๋ก ์์ ์ด๋ฏธ์ง๋ฅผ ์์ฑํ ํ, ๊ณ ์ฃผํ ์ธ๋ถ
[์ฅ๋ฌธ ๋ฆฌ๋ทฐ] Axial Attention in Multidimensional Transformers
์ด๋ฏธ์ง ๋๋ ๋น๋์ค์ ๋ํ ์์ ํ self-attention์ ๋น์ฉ์ด ๊ณผ๋ํฉ๋๋ค. ์ด์ฐจ ์ฆ๊ฐ ์์ด Transformer์ ํํ๋ ฅ์ ์ ์งํ๋ ค๋ฉด?
[๋จ๋ฌธ ๋ฆฌ๋ทฐ] Axial Attention in Multidimensional Transformers
Axial attention์ Transformer๋ฅผ ๊ณ ์ฐจ์ ๋ฐ์ดํฐ์ ๋ํด ๋ค๋ฃจ๊ธฐ ์ฝ๊ฒ ์ ์งํ๋ ์ฐ์ํ ์์ด๋์ด ์ค ํ๋์ ๋๋ค: ํ ๋ฒ์ ๋ชจ๋ ํฝ์ ์ด๋ ๋ชจ๋ ์๊ฐ-์ฃผํ์ ๋น์ ์ฃผ๋ชฉํ๋ ๋์ , ํ ๋ฒ์ ํ ์ถ์ ๋ฐ๋ผ ์ฃผ๋ชฉํฉ๋๋ค.
[๋กฑ ๋ฆฌ๋ทฐ] Speaker Verification์์ Multispeaker Text-To-Speech Synthesis๋ก์ Transfer Learning
์ด ๋ ผ๋ฌธ์ ์ ๋ก์ท ์์ฑ ํด๋ก๋์ ์ค์ฉ์ ์ผ๋ก ๋ง๋ ์ฐ๊ตฌ์ ๋๋ค: ์์ฒ ๊ฐ์ ๋ ธ์ด์ฆ๊ฐ ๋ง๊ณ ์ ์ฌ๋ณธ์ด ์๋ ์์ฑ์ผ๋ก ํ๋ณ์ ๊ฒ์ฆ ์์ ์์ speaker encoder๋ฅผ ํ์ตํ ํ, ๊ทธ ์๋ฒ ๋ฉ์ Tacotron 2๋ก
[์ ๋ฆฌ๋ทฐ] Speaker Verification์์ Multispeaker Text-To-Speech Synthesis๋ก์ Transfer Learning
ํ๋ ์ ๋ก์ท ์์ฑ ํด๋ก๋ ๋ฌผ๊ฒฐ์ ์์ํ Google ๋ ผ๋ฌธ์ ์๋ฆ๋ต๊ฒ ๊น๋ํ ์ํคํ ์ฒ๋ฅผ ๊ฐ์ง๊ณ ์์ต๋๋ค: verification์ ํ์ต๋ speaker encoder, ํ ์คํธ์ speaker ์๋ฒ ๋ฉ์
[๋กฑ ๋ฆฌ๋ทฐ] Wav2Seq: Pseudo Languages๋ฅผ ์ฌ์ฉํ Speech-to-Text Encoder-Decoder Models์ Pre-training
๋๋ถ๋ถ์ speech pretraining์ encoder ์ธก๋ฉด์ ์ง์คํ์ต๋๋ค: wav2vec, HuBERT, WavLM, ํ์ง๋ง sequence-to-sequence ASR์ pretrained decoder๋ ํ์ํฉ๋๋ค.
[์ ๋ฆฌ๋ทฐ] Wav2Seq: Pseudo Languages๋ฅผ ์ฌ์ฉํ Speech-to-Text Encoder-Decoder Models์ Pre-training
wav2vec 2.0 ๊ฐ์ Self-supervised pretraining์ ํ๋ฅญํ speech encoder๋ฅผ ์ ๊ณตํ์ต๋๋ค, ํ์ง๋ง ์ ์ฒด encoder-decoder ASR ์์คํ ์ ์ํ๋ฉด, decoder๋ ์ฌ์ ํ ์ฒ์๋ถํฐ ์์ํ์ต๋๋ค.
[๊ธด ๋ฆฌ๋ทฐ] Towards Zero-Label Language Learning
์ธ๊ฐ์ด ๋ ์ด๋ธ์ ์ง์ ํ ๋จ ํ๋์ ์์ ์์ด ์์ ๋ณ NLP ๋ชจ๋ธ์ ํ์ต์ํฌ ์ ์๋ค๋ฉด ์ด๋จ๊น์? "Towards Zero-Label Language Learning"์ ์ด ์ง๋ฌธ์ ๊ฐํ๊ฒ ์ ๊ธฐํฉ๋๋ค.
[์งง์ ๋ฆฌ๋ทฐ] Towards Zero-Label Language Learning
์๊ฐ์์ ๋ค์ฌ ์ฃผ์์ ์ง์ ํ ๋ ์ด๋ธ๋ ๋ฐ์ดํฐ๊ฐ ์ ๋ง๋ก ํ์ํ์ง ์๋ค๋ฉด ์ด๋จ๊น์?
[๊ธด ๋ฆฌ๋ทฐ] Fully Sharded Data Parallel: ๋ ์ ์ GPU๋ก ๋ ๋น ๋ฅธ AI ํ์ต
์ ๋นํ GPU ์์ฐ์ผ๋ก ์์ญ์ต ๋งค๊ฐ๋ณ์ ์์ฑ ๋๋ ์ธ์ด ๋ชจ๋ธ์ ํ์ตํ๋ ๊ฒ์ ํ์ดํ๋ผ์ธ ๋ณ๋ ฌํ, ํ ์ ๋ณ๋ ฌํ, ๋๋ ZeRO ์คํ์ผ์ ์ตํฐ๋ง์ด์ ์ค๋ฉ ์ค์์ ์ ํํด์ผ ํ๋ ๊ฒ์ ์๋ฏธํ์ต๋๋ค.
[์งง์ ๋ฆฌ๋ทฐ] Fully Sharded Data Parallel: ๋ ์ ์ GPU๋ก ๋ ๋น ๋ฅธ AI ํ์ต
Fully Sharded Data Parallel์ ๋ชจ๋ ์์ฑ ๋ฐ ์ธ์ด ํ์ด ๊ฒฐ๊ตญ ๋ฌป๋ ์ง๋ฌธ์ ๋ํ Meta์ ๋ต๋ณ์ ๋๋ค: ๋ ํฐ ๊ท๋ชจ์ GPU๋ฅผ ํ๋ก๋น์ ๋ํ์ง ์๊ณ ํ ์๋ฆฟ์ ๋ ํฐ ๋ชจ๋ธ์ ํ์ตํ๋ ๋ฐฉ๋ฒ์ ๋ฌด์์ผ๊น์?
[Long Review] ํ๋ จ ๋ฐ์ดํฐ ์ค๋ณต ์ ๊ฑฐ๊ฐ ์ธ์ด ๋ชจ๋ธ์ ๋ ์ข๊ฒ ๋ง๋ ๋ค
์ค๋ณต ์ ๊ฑฐ๋ ์ง๋ฃจํด ๋ณด์ด์ง๋ง, C4 ๋ด์ 61๊ฐ ๋จ์ด๋ก ๋ ๋ฌธ์ฅ์ด 60,000๋ฒ ์ด์ ๋ํ๋๊ณ , ์ด๋ฐ ๋ง๋ญ์น๋ก ํ๋ จ๋ ์ธ์ด ๋ชจ๋ธ์ด ํ๋ จ ์ธํธ ํ ์คํธ๋ฅผ ๋ถ์ํ๊ฒ re
[Short Review] ํ๋ จ ๋ฐ์ดํฐ ์ค๋ณต ์ ๊ฑฐ๊ฐ ์ธ์ด ๋ชจ๋ธ์ ๋ ์ข๊ฒ ๋ง๋ ๋ค
๋น์ ์ ์ธ์ด ๋ชจ๋ธ์ "์ผ๋ฐํ" ์ค ์ผ๋ง๋ ๋ง์ ๋ถ๋ถ์ด ์ค์ ๋ก๋ ๋จ์ํ ๋ฐ๋ณต์ผ๊น์?
[Long Review] CLAS: ๊น์ ๋ฌธ๋งฅ: ์ข ๋จ๊ฐ ๋ฌธ๋งฅ์ ์์ฑ ์ธ์
ASR ์ ํ์ ์ถ์ํ ์ฌ๋์ด๋ผ๋ฉด ๋๊ตฌ๋ ๊ณ ์ ๋ช ์ฌ์ ๊ณ ํต์ ์๊ณ ์์ต๋๋ค: ์ฐ๋ฝ์ฒ ์ด๋ฆ, ๋ ธ๋ ์ ๋ชฉ, ์ฝ๋ฌผ ์ด๋ฆ, ๋ชจํธํ ์ฅ์ ์ด๋ฆ.
[Long Review] ์ฅ๋ฌธ ์ง์์๋ต ์ง์ ์ ์ฅ์ ๋ฌผ
์ฅ๋ฌธ ์ง์์๋ต์ ๋ฆฌ๋๋ณด๋์์๋ ์ธ์์ ์ผ๋ก ๋ณด์ด์ง๋ง ์์ธํ ์ดํด๋ณด๋ฉด ๋ถ์ํ ๋ฒค์น๋งํฌ ์ค ํ๋์ ๋๋ค.
[๊ธด ๋ฆฌ๋ทฐ] ๋ฏธ์ธ์กฐ์ ๋ ์ธ์ด ๋ชจ๋ธ์ ์ ๋ก์ท ํ์ต์
InstructGPT๊ฐ ์ง์์ด ํ๋์ ์ผ์์ ์ธ ํํ์ผ๋ก ๋ง๋ค๊ธฐ ์ ์, Google์ FLAN ๋ ผ๋ฌธ์ ์์ฐ์ด ์ง์์ด์ ๋ํ ์ ๋นํ ์์ ๋ค์ค ์์ ๋ฏธ์ธ์กฐ์ ์ด ํ๋ฒํ LM์ ๋๋๋๋ก c
[๊ธด ๋ฆฌ๋ทฐ] 'GShard': ์กฐ๊ฑด๋ถ ์ฐ์ฐ ๋ฐ ์๋ ์ค๋ฉ์ผ๋ก ๊ฑฐ๋ ๋ชจ๋ธ ํ์ฅ
Transformer๋ฅผ 100์ต ๊ฐ ์ด์์ ๋งค๊ฐ๋ณ์๋ก ํ์ฅํ๋ ๊ฒ์ ๋น ๋ฅด๊ฒ ์ฒ ํ์ ์ด ๋ฉ๋๋ค: ๋ชจ๋ ํ ํฐ์ ๋ํด ์ ์ฒด ๋คํธ์ํฌ๋ฅผ ํ์ฑํํ๊ฑฐ๋ ๊ฐ ํ ํฐ์ ์ค์ ๋ก ๋ด์ผ ํ๋ ์ ๋ฌธ๊ฐ์๊ฒ ๋ผ์ฐํ ํฉ๋๊น?
์ธ์๋ฅ์ด์ฒ๋ผ ๋ฎ์ ๋ฌ์์ ํผ๊ฒจ ์ค์ผ์ดํฐ๋ค: Kullback-Leibler ๋ฐ์ฐ์ด ๊ทธ๋ค์ ์ฐจ์ด๋ฅผ ๊ตฌ๋ณํ ์ ์์ต๋๊น?
์คํผ์ปค ์ ์์ ์ํ์ค-ํฌ-์ํ์ค ๋ชจ๋ธ์ ์ธ์ฝ๋์ ์ด๋ ต๊ฒ ํ๋ํ ์ํฅ ํํ์ ์์์ํค์ง ์๊ณ ์ ์์ํค๋ ค๊ณ ์ค์ ๋ก ์๋ํ ๋๊น์ง ํด๊ฒฐ๋ ๊ฒ์ฒ๋ผ ๋ค๋ฆฌ๋ ASR ๋ฌธ์ ์ค ํ๋์ ๋๋ค.
Nathan Chen์ 4ํ์ ํ๋ฆฝ์ด Mixture-of-Experts๋ก ์ฑ์ ๋ฉ๋๊น? Part 1: Switch Transformers: ํฌ์ MoE ๋ชจ๋ธ
Nathan Chen์ 4ํ์ ์ ์์ ๋ํ ์ฐ์ค๊ฐฏ์๋ฆฌ๋ก ํํ๋๋ ์ด ํ ๋ก ์ Switch Transformer๋ฅผ ์ดํด๋ด ๋๋ค. Google์ Mixture-of-Experts ํ์ฅ์ ๋ํ ๊น๋ํ๊ณ ๊ณผ๊ฐํ๊ฒ ๋จ์ํ๋ ํด์์ ๋๋ค.
Nathan Chen์ 4 Flip์ด Mixture-of-Experts๋ก ์ฑ์ ๋๋์? Part 2: GLaM:Efficient Scaling of LMs with MoE
MoE ๋ฏธ๋ ์๋ฆฌ์ฆ์ Part 2๋ GLaM์ผ๋ก ์ด์ ์ ๋ง์ถฅ๋๋ค. Google์ 1.2์กฐ-ํ๋ผ๋ฏธํฐ Mixture-of-Experts ์ธ์ด ๋ชจ๋ธ๋ก, ์ ๋ก-์ท, ์-์ท, ๊ทธ๋ฆฌ๊ณ ํจ-์ท ๋ฒค์น๋งํฌ์์ GPT-3๊ณผ ๋๋ฑํ๊ฑฐ๋ ๋ฅ๊ฐํ๋ฉฐ ํ ํฐ๋น ์ฝ 8%์ ํ๋ผ๋ฏธํฐ๋ง ํ์ฑํํฉ๋๋ค
์์ฑ ๊ด์ ์์ ๊ฒํ ๋ BERT ๋ ผ๋ฌธ
BERT๋ NLP์์ ๊ฑฐ์ ์๊ฐ๊ฐ ํ์ ์์ง๋ง, ์์ฑ ์์ง๋์ด์ ๊ด์ ์์ ์ฝ์ผ๋ฉด ํ์ค "๋ง์คํฌ๋ ์ธ์ด ๋ชจ๋ธ๋ง์ด ๋ชจ๋ ๊ฒ์ ๋ฐ๊ฟจ๋ค"๋ ์์ฝ๊ณผ๋ ๋ค๋ฅธ ๊ตํ๋ค์ ๋ฐ๊ฒฌํฉ๋๋ค.
Transformer: Attention is All You Need์ Listen, Attend and Spell -- ์์ฑ ๊ด์ ์์
๋ ํธ์ ๋ ผ๋ฌธ, ํ๋์ ์ด์ผ๊ธฐ. "Attention Is All You Need"๋ ์ธ๊ณ์ Transformer๋ฅผ ์ ๊ณตํ๊ณ ์์ด ๋ชจ๋ธ๋ง์ด ์ด๋ป๊ฒ ์ํ๋๋์ง๋ฅผ ์ฌ์ค์ ํ๊ณ , "Listen, Attend and Spell" (LAS)์ ์๋-ํฌ-์๋ ์์ฑ์ ๋ํด 1๋ ๋จผ์ ๋์ผํ ์ผ์ ํ์ตโฆ
Breaking Bad์์ Wav2vec 2.0์ผ๋ก: ์์ฑ ํํ์ ์๊ธฐ ์ง๋ ํ์ต์ ์ํ ํ๋ ์์ํฌ
Walter White, Jesse Pinkman, ๊ทธ๋ฆฌ๊ณ ๋ ์ด๋ธ์ด ์๋ ์ค๋์ค ๋ฐฐ์น๊ฐ ๊ณตํต์ ์ด ๋ญ๊น์?
HuBERT: ์จ๊ฒจ์ง ๋จ์์ ๋ง์คํน ์์ธก์ ํตํ ์์ฒด ์ง๋ ์์ฑ ํํ ํ์ต
wav2vec 2.0์ด ๋์กฐ์ ์์ฒด ์ง๋๋ก ๊ฒ์์ ๋ฐ๊ฟจ์ง๋ง, HuBERT๋ ๋ ๋ ์นด๋ก์ด ์ง๋ฌธ์ ์ ์ํ์ต๋๋ค: ๋์กฐ์ ํธ๋ฆญ์ ์์ ํ ๊ฑด๋๋ฐ๊ณ ์์ฑ์์ BERT ์คํ์ผ์ ๋ง์คํน ์์ธก์ ์ํํ๋ฉด ์ด๋จ๊น์?
W2v-BERT: ๋์กฐ ํ์ต๊ณผ ๋ง์คํน๋ ์ธ์ด ๋ชจ๋ธ๋ง์ ๊ฒฐํฉํ ์์ฒด ์ง๋
์์ฑ ์ฌ์ ํ์ต์ ์ํด ๋์กฐ ํ์ต๊ณผ ๋ง์คํน๋ ์ธ์ด ๋ชจ๋ธ๋ง ์ค์ ์ ํํด์ผ ํ ๋ ๋์ ๊ฐ์ ๋คํธ์ํฌ์ ์ฐ๊ฒฐํ ์ ์๋ค๋ฉด ์ ์ ํํด์ผ ํ ๊น์?
