Tag: ml

News
[Olewave's Review] CLIP (3/3): Learning Transferable Visual Models From Natural Language Supervision
Tutorials

[Olewave's Review] CLIP (3/3): ์ž์—ฐ์–ด ๊ฐ๋…์œผ๋กœ๋ถ€ํ„ฐ์˜ ์ „์ด ๊ฐ€๋Šฅํ•œ ์‹œ๊ฐ ๋ชจ๋ธ ํ•™์Šต

์ด CLIP ๊ฒ€ํ† ์˜ ๋งˆ์ง€๋ง‰ ๋ถ€๋ถ„์€ ๊ฒฐ๊ณผ ์„น์…˜์— ๋„๋‹ฌํ•˜๋ฉฐ, ์—ฌ๊ธฐ์„œ OpenAI์˜ ๋Œ€์กฐ์  ์ด๋ฏธ์ง€-ํ…์ŠคํŠธ ๋ชจ๋ธ์ด ํฅ๋ฏธ๋กœ์šด ์•„์ด๋””์–ด์—์„œ ์ „์ฒด ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์Šคํƒ์˜ ๊ธฐ์ดˆ ๊ณ„์ธต ๊ธฐ๋ณธ ์š”์†Œ๋กœ ์ „ํ™˜๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

1์›” 14, 2023ยท 1 min read
[Olewave's Review] CLIP (2/3): Learning Transferable Visual Models From Natural Language Supervision
Tutorials

[Olewave's Review] CLIP (2/3): ์ž์—ฐ์–ด ๊ฐ๋…์œผ๋กœ๋ถ€ํ„ฐ์˜ ์ „์ด ๊ฐ€๋Šฅํ•œ ์‹œ๊ฐ ๋ชจ๋ธ ํ•™์Šต

OpenAI์˜ CLIP์€ ๊ณ ์ • ๋ ˆ์ด๋ธ” ์„ธํŠธ๋ฅผ ๋ฒ„๋ฆฌ๊ณ  ๋Œ€์‹  ์ธํ„ฐ๋„ท์—์„œ ์ˆ˜์ง‘ํ•œ 4์–ต ๊ฐœ์˜ (์ด๋ฏธ์ง€, ํ…์ŠคํŠธ) ์Œ์œผ๋กœ ํ›ˆ๋ จํ•จ์œผ๋กœ์จ ์ปดํ“จํ„ฐ ๋น„์ „์˜ ์Šคํฌ๋ฆฝํŠธ๋ฅผ ๋’ค์ง‘์—ˆ์Šต๋‹ˆ๋‹ค.

1์›” 1, 2023ยท 1 min read
[Olewave's Review] CLIP (1/3): Learning Transferable Visual Models From Natural Language Supervision
Tutorials

[Olewave's Review] CLIP (1/3): ์ž์—ฐ์–ด ๊ฐ๋…์œผ๋กœ๋ถ€ํ„ฐ์˜ ์ „์ด ๊ฐ€๋Šฅํ•œ ์‹œ๊ฐ ๋ชจ๋ธ ํ•™์Šต

BLIP, LLaVA, ๋˜๋Š” ๊ฐ€์น˜ ์žˆ๋Š” ์Œ์„ฑ-LLM์ด ์žˆ๊ธฐ ์ „์— CLIP์ด ์žˆ์—ˆ์œผ๋ฉฐ, ์ด๊ฒƒ์ด ์ด์•ผ๊ธฐ๊ฐ€ ์‹œ์ž‘๋˜๋Š” ๊ณณ์ž…๋‹ˆ๋‹ค.

12์›” 17, 2022ยท 1 min read
Boris Johnsonโ€™s Rise and Fall - an analysis of the mics
Tutorials

Boris Johnson์˜ ํฅ๋ง - ๋งˆ์ดํฌ์˜ ๋ถ„์„

์ •์น˜ ๋‰ด์Šค๋Š” ๋ณดํ†ต ์Œ์„ฑ AI ์—”์ง€๋‹ˆ์–ด๊ฐ€ ๊ธˆ์š”์ผ ์˜คํ›„์— ํ์— ์˜ฌ๋ ค๋†“๋Š” ๊ฒƒ์ด ์•„๋‹ˆ์ง€๋งŒ, Boris Johnson์˜ ์‚ฌ์ž„ ๋ฐœํ‘œ๋Š” ์ผ๋ จ์˜ ์Šค์บ”๋“ค์— ๋Œ€ํ•œ ์ •๋‹น์˜ ๋ฐ˜๋ž€์œผ๋กœ ๋งˆ์ดํฌ ๋ฑ…ํฌ ์•ž์—์„œ ์ „๋‹ฌ๋˜์—ˆ์Šต๋‹ˆ๋‹ค

7์›” 9, 2022ยท 1 min read
[Olewave's Long Review] Xception: Deep Learning with Depthwise Separable Convolutions
Tutorials

[Olewave์˜ ์žฅํŽธ ๋ฆฌ๋ทฐ] Xception: ๊นŠ์ด๋ณ„ ๋ถ„๋ฆฌํ˜• ์ปจ๋ณผ๋ฃจ์…˜์„ ์ด์šฉํ•œ ๋”ฅ๋Ÿฌ๋‹

Xception์€ Inception ๊ฐ€์„ค์„ ๋…ผ๋ฆฌ์  ๊ทน๋‹จ๊นŒ์ง€ ๋ฐ€์–ด๋ถ™์ด๊ณ  ์ฑ„๋„ ๊ฐ„ ๋ฐ ๊ณต๊ฐ„์  ์ƒ๊ด€๊ด€๊ณ„๋ฅผ ์™„์ „ํžˆ ๋ถ„๋ฆฌ๋œ ์—ฐ์‚ฐ์œผ๋กœ ๋ฐ€์–ด๋ถ™์˜€์œผ๋ฉฐ, ์ด๋กœ ์ธํ•ด ์ธ๊ธฐ๋ฅผ ์–ป์€ ๊นŠ์ด๋ณ„ ๋ถ„๋ฆฌํ˜• ์ปจ๋ณผ๋ฃจ์…˜์€ ์ด์ œ ๋ชจ๋“  ๊ณณ์— ๋‚˜ํƒ€๋‚œ๋‹ค

7์›” 9, 2022ยท 1 min read
Phased Array Radar on China's Aircraft Carrier Fujian 003 and Its Connection with Speech Beamforming
Tutorials

์ค‘๊ตญ์˜ ํ•ญ๊ณต๋ชจํ•จ Fujian 003์˜ ์œ„์ƒ๋ฐฐ์—ด ๋ ˆ์ด๋”์™€ ์Œ์„ฑ ๋น”ํฌ๋ฐ์˜ ์—ฐ๊ฒฐ

์ค‘๊ตญ์˜ ์ตœ์‹  ํ•ญ๊ณต๋ชจํ•จ Fujian 003์— ํƒ‘์žฌ๋œ ์œ„์ƒ๋ฐฐ์—ด ๋ ˆ์ด๋”์™€ ์Šค๋งˆํŠธ ์Šคํ”ผ์ปค๊ฐ€ ์‹œ๋„๋Ÿฌ์šด ๋ฐฉ์—์„œ ๋‹น์‹ ์˜ ๋ง์„ ๋“ค์„ ์ˆ˜ ์žˆ๊ฒŒ ํ•˜๋Š” ๋งˆ์ดํฌ ์–ด๋ ˆ์ด๋Š” ์‹ค์ œ๋กœ ๊ฐ™์€ ๊ธฐ๋ณธ ์ˆ˜ํ•™์„ ๊ณต์œ ํ•ฉ๋‹ˆ๋‹ค.

6์›” 25, 2022ยท 1 min read
How Does the All-New Dictation in iOS 16 Work? Reveal Apple's Secret Sauce by a Speech Researcher!
Tutorials

iOS 16์˜ ์ƒˆ๋กœ์šด ๋ฐ›์•„์“ฐ๊ธฐ ๊ธฐ๋Šฅ์€ ์–ด๋–ป๊ฒŒ ์ž‘๋™ํ• ๊นŒ์š”? Apple์˜ ๋น„๊ฒฐ์„ ์Œ์„ฑ ์—ฐ๊ตฌ์›์ด ๋ฐํ˜€์ค๋‹ˆ๋‹ค!

Apple์˜ iOS 16 ๋ฐ›์•„์“ฐ๊ธฐ๋Š” ์™„์ „ํžˆ ๊ธฐ๊ธฐ์—์„œ ์‹คํ–‰๋˜๋ฉฐ, ์ด ๋‹จ์ผ ์„ค๊ณ„ ์„ ํƒ์€ ์ง€์—ฐ ์‹œ๊ฐ„, ๊ฐœ์ธ์ •๋ณด ๋ณดํ˜ธ, ๊ทธ๋ฆฌ๊ณ  ํœด๋Œ€ํฐ์—์„œ ์‹คํ–‰ ๊ฐ€๋Šฅํ•œ ASR ์•„ํ‚คํ…์ฒ˜์˜ ์ข…๋ฅ˜์— ๋Œ€ํ•œ ์—ฐ์‡„์  ์˜ํ–ฅ์„ ๋ฏธ์นฉ๋‹ˆ๋‹ค.

6์›” 18, 2022ยท 1 min read
[Long Review] Conformer: Convolution-augmented Transformer for Speech Recognition
Tutorials

[์žฅ๋ฌธ ๋ฆฌ๋ทฐ] Conformer: ์Œ์„ฑ ์ธ์‹์„ ์œ„ํ•œ Convolution-augmented Transformer

Conformer๋Š” end-to-end ASR์„ ์กฐ์šฉํžˆ ์žฅ์•…ํ•œ ๋ชจ๋ธ์ด๋ฉฐ, ๋ชจ๋“  Transformer ๋ธ”๋ก์— convolution ๋ชจ๋“ˆ์„ ์ถ”๊ฐ€ํ•˜๋Š” ๊ทธ ๋ฐฉ์‹์€ ๋‹จ์ˆœํ•˜์ง€๋งŒ ๋†€๋ž๊ฒŒ๋„ ์ž˜ ์ž‘๋™ํ•˜๋Š” ์•„์ด๋””์–ด ์ค‘ ํ•˜๋‚˜์ž…๋‹ˆ๋‹ค.

6์›” 11, 2022ยท 1 min read
[Long Review] Cascaded Diffusion Models for High Fidelity Image Generation
Tutorials

[์žฅ๋ฌธ ๋ฆฌ๋ทฐ] Cascaded Diffusion Models for High Fidelity Image Generation

Imagen๊ณผ DALL-E 2๊ฐ€ ์ƒ์„ฑ ์ด๋ฏธ์ง€๋ฅผ ์œ„ํ•œ ํ™•์‚ฐ์„ ๊ธฐ๋ณธ๊ฐ’์œผ๋กœ ๋งŒ๋“ค๊ธฐ ์ „์—, ์ด Google Brain ๋…ผ๋ฌธ์€ ์ดํ›„ ๋งŽ์€ ํ…์ŠคํŠธ-์ด๋ฏธ์ง€ ์‹œ์Šคํ…œ์ด ์กฐ์šฉํžˆ ์ฐจ์šฉํ•œ cascaded diffusion ๋ ˆ์‹œํ”ผ๋ฅผ ์ œ์‹œํ–ˆ์Šต๋‹ˆ๋‹ค: ์ž‘์€

6์›” 4, 2022ยท 1 min read
[Short Review] Cascaded Diffusion Models for High Fidelity Image Generation
Tutorials

[๋‹จ๋ฌธ ๋ฆฌ๋ทฐ] Cascaded Diffusion Models for High Fidelity Image Generation

Cascaded diffusion์€ ๋งŽ์€ ์ตœ์‹  ์ƒ์„ฑ ์ž‘์—…์˜ ๊ธฐ์ €๋ฅผ ์ด๋ฃจ๋Š” ๋‹ค๋‹จ๊ณ„ ๋ ˆ์‹œํ”ผ์ž…๋‹ˆ๋‹ค: ํ•œ ๊ฐœ์˜ diffusion ๋ชจ๋ธ๋กœ ์ž‘์€ ์ด๋ฏธ์ง€๋ฅผ ์ƒ์„ฑํ•œ ํ›„, ๊ณ ์ฃผํŒŒ ์„ธ๋ถ€

6์›” 4, 2022ยท 1 min read
[Long Review] Axial Attention in Multidimensional Transformers
Tutorials

[์žฅ๋ฌธ ๋ฆฌ๋ทฐ] Axial Attention in Multidimensional Transformers

์ด๋ฏธ์ง€ ๋˜๋Š” ๋น„๋””์˜ค์— ๋Œ€ํ•œ ์™„์ „ํ•œ self-attention์€ ๋น„์šฉ์ด ๊ณผ๋„ํ•ฉ๋‹ˆ๋‹ค. ์ด์ฐจ ์ฆ๊ฐ€ ์—†์ด Transformer์˜ ํ‘œํ˜„๋ ฅ์„ ์œ ์ง€ํ•˜๋ ค๋ฉด?

5์›” 28, 2022ยท 1 min read
[Short Review] Axial Attention in Multidimensional Transformers
Tutorials

[๋‹จ๋ฌธ ๋ฆฌ๋ทฐ] Axial Attention in Multidimensional Transformers

Axial attention์€ Transformer๋ฅผ ๊ณ ์ฐจ์› ๋ฐ์ดํ„ฐ์— ๋Œ€ํ•ด ๋‹ค๋ฃจ๊ธฐ ์‰ฝ๊ฒŒ ์œ ์ง€ํ•˜๋Š” ์šฐ์•„ํ•œ ์•„์ด๋””์–ด ์ค‘ ํ•˜๋‚˜์ž…๋‹ˆ๋‹ค: ํ•œ ๋ฒˆ์— ๋ชจ๋“  ํ”ฝ์…€์ด๋‚˜ ๋ชจ๋“  ์‹œ๊ฐ„-์ฃผํŒŒ์ˆ˜ ๋นˆ์— ์ฃผ๋ชฉํ•˜๋Š” ๋Œ€์‹ , ํ•œ ๋ฒˆ์— ํ•œ ์ถ•์„ ๋”ฐ๋ผ ์ฃผ๋ชฉํ•ฉ๋‹ˆ๋‹ค.

5์›” 28, 2022ยท 1 min read
[Long Review] Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis
Tutorials

[๋กฑ ๋ฆฌ๋ทฐ] Speaker Verification์—์„œ Multispeaker Text-To-Speech Synthesis๋กœ์˜ Transfer Learning

์ด ๋…ผ๋ฌธ์€ ์ œ๋กœ์ƒท ์Œ์„ฑ ํด๋กœ๋‹์„ ์‹ค์šฉ์ ์œผ๋กœ ๋งŒ๋“  ์—ฐ๊ตฌ์ž…๋‹ˆ๋‹ค: ์ˆ˜์ฒœ ๊ฐœ์˜ ๋…ธ์ด์ฆˆ๊ฐ€ ๋งŽ๊ณ  ์ „์‚ฌ๋ณธ์ด ์—†๋Š” ์Œ์„ฑ์œผ๋กœ ํŒ๋ณ„์  ๊ฒ€์ฆ ์ž‘์—…์—์„œ speaker encoder๋ฅผ ํ•™์Šตํ•œ ํ›„, ๊ทธ ์ž„๋ฒ ๋”ฉ์„ Tacotron 2๋กœ

5์›” 21, 2022ยท 1 min read
[Short Review] Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis
Tutorials

[์ˆ ๋ฆฌ๋ทฐ] Speaker Verification์—์„œ Multispeaker Text-To-Speech Synthesis๋กœ์˜ Transfer Learning

ํ˜„๋Œ€ ์ œ๋กœ์ƒท ์Œ์„ฑ ํด๋กœ๋‹ ๋ฌผ๊ฒฐ์„ ์‹œ์ž‘ํ•œ Google ๋…ผ๋ฌธ์€ ์•„๋ฆ„๋‹ต๊ฒŒ ๊น”๋”ํ•œ ์•„ํ‚คํ…์ฒ˜๋ฅผ ๊ฐ€์ง€๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค: verification์— ํ•™์Šต๋œ speaker encoder, ํ…์ŠคํŠธ์™€ speaker ์ž„๋ฒ ๋”ฉ์„

5์›” 21, 2022ยท 1 min read
[Short Review] Wav2Seq: Pre-training Speech-to-Text Encoder-Decoder Models Using Pseudo Languages
Tutorials

[์ˆ ๋ฆฌ๋ทฐ] Wav2Seq: Pseudo Languages๋ฅผ ์‚ฌ์šฉํ•œ Speech-to-Text Encoder-Decoder Models์˜ Pre-training

wav2vec 2.0 ๊ฐ™์€ Self-supervised pretraining์€ ํ›Œ๋ฅญํ•œ speech encoder๋ฅผ ์ œ๊ณตํ–ˆ์Šต๋‹ˆ๋‹ค, ํ•˜์ง€๋งŒ ์ „์ฒด encoder-decoder ASR ์‹œ์Šคํ…œ์„ ์›ํ•˜๋ฉด, decoder๋Š” ์—ฌ์ „ํžˆ ์ฒ˜์Œ๋ถ€ํ„ฐ ์‹œ์ž‘ํ–ˆ์Šต๋‹ˆ๋‹ค.

5์›” 14, 2022ยท 1 min read
[Long Review] Towards Zero-Label Language Learning
Tutorials

[๊ธด ๋ฆฌ๋ทฐ] Towards Zero-Label Language Learning

์ธ๊ฐ„์ด ๋ ˆ์ด๋ธ”์„ ์ง€์ •ํ•œ ๋‹จ ํ•˜๋‚˜์˜ ์˜ˆ์ œ ์—†์ด ์ž‘์—…๋ณ„ NLP ๋ชจ๋ธ์„ ํ•™์Šต์‹œํ‚ฌ ์ˆ˜ ์žˆ๋‹ค๋ฉด ์–ด๋–จ๊นŒ์š”? "Towards Zero-Label Language Learning"์€ ์ด ์งˆ๋ฌธ์„ ๊ฐ•ํ•˜๊ฒŒ ์ œ๊ธฐํ•ฉ๋‹ˆ๋‹ค.

5์›” 7, 2022ยท 1 min read
[Long Review] Fully Sharded Data Parallel: faster AI training with fewer GPUs
Tutorials

[๊ธด ๋ฆฌ๋ทฐ] Fully Sharded Data Parallel: ๋” ์ ์€ GPU๋กœ ๋” ๋น ๋ฅธ AI ํ•™์Šต

์ ๋‹นํ•œ GPU ์˜ˆ์‚ฐ์œผ๋กœ ์ˆ˜์‹ญ์–ต ๋งค๊ฐœ๋ณ€์ˆ˜ ์Œ์„ฑ ๋˜๋Š” ์–ธ์–ด ๋ชจ๋ธ์„ ํ•™์Šตํ•˜๋Š” ๊ฒƒ์€ ํŒŒ์ดํ”„๋ผ์ธ ๋ณ‘๋ ฌํ™”, ํ…์„œ ๋ณ‘๋ ฌํ™”, ๋˜๋Š” ZeRO ์Šคํƒ€์ผ์˜ ์˜ตํ‹ฐ๋งˆ์ด์ € ์ƒค๋”ฉ ์ค‘์—์„œ ์„ ํƒํ•ด์•ผ ํ•˜๋Š” ๊ฒƒ์„ ์˜๋ฏธํ–ˆ์Šต๋‹ˆ๋‹ค.

4์›” 23, 2022ยท 1 min read
[Short Review] Fully Sharded Data Parallel: faster AI training with fewer GPUs
Tutorials

[์งง์€ ๋ฆฌ๋ทฐ] Fully Sharded Data Parallel: ๋” ์ ์€ GPU๋กœ ๋” ๋น ๋ฅธ AI ํ•™์Šต

Fully Sharded Data Parallel์€ ๋ชจ๋“  ์Œ์„ฑ ๋ฐ ์–ธ์–ด ํŒ€์ด ๊ฒฐ๊ตญ ๋ฌป๋Š” ์งˆ๋ฌธ์— ๋Œ€ํ•œ Meta์˜ ๋‹ต๋ณ€์ž…๋‹ˆ๋‹ค: ๋” ํฐ ๊ทœ๋ชจ์˜ GPU๋ฅผ ํ”„๋กœ๋น„์ €๋‹ํ•˜์ง€ ์•Š๊ณ  ํ•œ ์ž๋ฆฟ์ˆ˜ ๋” ํฐ ๋ชจ๋ธ์„ ํ•™์Šตํ•˜๋Š” ๋ฐฉ๋ฒ•์€ ๋ฌด์—‡์ผ๊นŒ์š”?

4์›” 23, 2022ยท 1 min read