Archive: 2024 February

News
Variational Autoencoder (VAE) and Reparameterization Trick - Revisiting the Classic Generative Model
Tutorials

๋ณ€๋ถ„ ์ž๋™์ธ์ฝ”๋”(VAE) ๋ฐ ์žฌ๋งค๊ฐœ๋ณ€์ˆ˜ํ™” ํŠธ๋ฆญ - ๊ณ ์ „ ์ƒ์„ฑ ๋ชจ๋ธ ์žฌ๊ฒ€ํ† 

ํ™•์‚ฐ ๋ชจ๋ธ์ด ๋‚˜์˜ค๊ธฐ ์ „์—, ์ •๊ทœํ™” ํ๋ฆ„์ด ๋‚˜์˜ค๊ธฐ ์ „์—, ์ž ์žฌ ํ™•์‚ฐ ๋ชจ๋ธ์ด ์กฐ์šฉํžˆ VAE ์ธ์ฝ”๋”๋ฅผ ๋ชจ๋“  ์ง„์ง€ํ•œ ์ƒ์„ฑ ์Šคํƒ์— ๊ตฌ์ถ•ํ•˜๊ธฐ ์ „์— โ€” Kingma์™€ Welling์˜ 2013๋…„ ๋…ผ๋ฌธ์ด ๋ณ€๋ถ„ ์ž๋™์ธ์ฝ”๋”๋ฅผ ์†Œ๊ฐœ

2์›” 24, 2024ยท 1 min read
A Review of Microsoft+OpenAI, Google, Meta, and Nvidia's Open Source Large Speech Models for ASR
Tutorials

Microsoft+OpenAI, Google, Meta, ๋ฐ Nvidia์˜ ์˜คํ”ˆ ์†Œ์Šค ๋Œ€๊ทœ๋ชจ ์Œ์„ฑ ๋ชจ๋ธ ๊ฒ€ํ† (ASR์šฉ)

๋ชจ๋“  ์ฃผ์š” AI ์—ฐ๊ตฌ์†Œ๋Š” ์ด์ œ ASR์šฉ ์˜คํ”ˆ ์†Œ์Šค ๋Œ€๊ทœ๋ชจ ์Œ์„ฑ ๋ชจ๋ธ์„ ์ถœ์‹œํ–ˆ์œผ๋ฉฐ, ํ”„๋กœ๋•์…˜์šฉ์œผ๋กœ ์˜ฌ๋ฐ”๋ฅธ ๋ชจ๋ธ์„ ์„ ํƒํ•˜๋Š” ๊ฒƒ์ด ์‹ค์ œ ๊ฒฐ์ •์ด ๋˜์—ˆ์Šต๋‹ˆ๋‹ค.

2์›” 9, 2024ยท 1 min read
[Detailed Paper Reading] Zipformer: A faster and better encoder for automatic speech recognition
Tutorials

[์ƒ์„ธ ๋…ผ๋ฌธ ์ฝ๊ธฐ] Zipformer: ์ž๋™ ์Œ์„ฑ ์ธ์‹์„ ์œ„ํ•œ ๋” ๋น ๋ฅด๊ณ  ๋‚˜์€ ์ธ์ฝ”๋”

Conformer์€ ์ˆ˜๋…„ ๋™์•ˆ ๊ธฐ๋ณธ ASR ์ธ์ฝ”๋”์˜€์ง€๋งŒ, k2/icefall ํŒ€์˜ Zipformer์€ ๋” ๋น ๋ฅด๊ณ  ๊ฐ€๋ฒผ์šฐ๋ฉด์„œ๋„ LibriSpeech, Aishell-1, WenetSpeech์—์„œ ์กฐ์šฉํžˆ WER ์™•๊ด€์„ ์ฐจ์ง€ํ–ˆ์Šต๋‹ˆ๋‹ค.

2์›” 6, 2024ยท 1 min read