[Olewave 的長評] 語音辨識神經轉導器的有效訓練
神經轉導器是串流 ASR 的主力,但有效地訓練它們有名地困難:RNN-T 損失在序列長度上具有立方記憶、對齐格點在長話語上爆炸,而單一
Boris Johnson 的興衰 - 麥克風分析
政治新聞通常不是聲音 AI 工程師在週五下午準備的東西,但 Boris Johnson 的辭職聲明是在一排麥克風前發表的,當時他的政黨因一系列醜聞而背叛
iOS 16 全新聽寫功能如何運作?一位語音研究者揭露蘋果的祕密武器!
蘋果的 iOS 16 聽寫功能完全在設備上運行,這個單一的設計選擇對延遲、隱私和手機上哪些 ASR 架構甚至可行都有連鎖影響。
[長篇評論] Conformer:用於語音識別的卷積增強型 Transformer
Conformer 是悄然佔據端到端 ASR 的模型,其方法是在每個 Transformer 區塊加入卷積模組,這個看似簡單卻非常有效的想法被證實就是有效的。
[長篇評論] Axial Attention in Multidimensional Transformers
對影像或影片進行完整自注意力在計算上極其昂貴,那麼如何在不引入二次方複雜度的情況下保持Transformer的表現力?
[短篇評論] Axial Attention in Multidimensional Transformers
Axial Attention是一個優雅的想法,它使Transformers對高維數據保持可控:無需一次性對所有像素或所有時頻箱進行注意,而是每次只沿著一個軸進行注意。
[長評論] 從說話人驗證到多說話人TTS合成的遷移學習
這是使零樣本語音克隆成為實用的論文:在具有數千個嘈雜、無文本記錄的語音上訓練說話人編碼器進行判別性驗證任務,然後將這些嵌入輸入到Tacotron 2 s
[短評論] 從說話人驗證到多說話人TTS合成的遷移學習
Google的論文啟動了現代零樣本語音克隆浪潮,具有簡潔優美的架構:一個在驗證上訓練的說話人編碼器、一個Tacotron 2合成器可將文本加說話人嵌入轉換
[短評論] Wav2Seq:使用偽語言預訓練語音轉文本編碼器-解碼器模型
像wav2vec 2.0這樣的自監督預訓練給了我們很好的語音編碼器,但如果你想要一個完整的編碼器-解碼器ASR系統,解碼器仍然從零開始。
[長篇評論] Towards Zero-Label Language Learning
如果您可以在沒有任何人工標註範例的情況下訓練任務特定的 NLP 模型呢?"Towards Zero-Label Language Learning" 著力強調了這個問題。
[長篇評論] Fully Sharded Data Parallel:用更少 GPU 進行更快的 AI 訓練
在有限的 GPU 預算上訓練十億參數的語音或語言模型曾經意味著要在管道並行、張量並行或 ZeRO 風格的優化器分片之間做出選擇。
[短篇評論] Fully Sharded Data Parallel:用更少 GPU 進行更快的 AI 訓練
Fully Sharded Data Parallel 是 Meta 對每個語音和語言團隊最終都會提出的問題的答案:我們如何在不提供數量級更多 GPU 的情況下訓練數量級更大的模型?
[長評] 微調語言模型是零次學習器
在 InstructGPT 使指令調優成為家喻戶曉的術語之前,Google 的 FLAN 論文表明,對自然語言指令進行適度的多任務微調可以將一個普通的 LM 轉變為令人驚訝的強大
[長評] 'GShard':使用條件計算和自動分片擴展巨型模型
將 Transformer 擴展到超過一千億個參數很快會變成哲學問題:你是為每個令牌激活整個網絡,還是將每個令牌路由到真正需要查看它的專家?
像三胞胎一樣的俄羅斯花滑運動員:Kullback-Leibler 散度能用來區別他們嗎?
說話者自適應是那種 ASR 問題之一,聽起來已經解決,直到你實際嘗試在不破壞編碼器苦心獲得的聲學表示的情況下自適應序列到序列模型。
Nathan Chen 的 4 周跳是由 Mixture-of-Experts 評分的嗎?第一部分:Switch Transformers:稀疏 MoE 模型
以 Nathan Chen 的四周跳評分為框架,這個演講詳細介紹了 Switch Transformer,Google 對 Mixture-of-Experts 擴展的簡潔而激進的簡化版本。
Nathan Chen 的 4 Flip 是由 Mixture-of-Experts 評分嗎?第 2 部分:GLaM:使用 MoE 高效擴展 LM
MoE 小型系列的第 2 部分轉向 GLaM,Google 的 1.2 兆參數 Mixture-of-Experts 語言模型,在 zero-shot、one-shot 和 few-shot 基準測試中匹配或超越 GPT-3,同時每個 token 只激活約 8% 的參
Transformer:注意力就是一切,以及 Listen, Attend and Spell - 從語音視角
兩篇論文,一個故事。《Attention Is All You Need》給世界帶來了 Transformer 並重新定義了序列建模的方式,而《Listen, Attend and Spell》(LAS) 一年前為端到端語音識別做了同樣的事情
