【詳細論文読み解き】Zipformer: 自動音声認識のための高速でより優れたエンコーダ
Conformerはここ数年、デフォルトのASRエンコーダでしたが、k2/icefallチームのZipformerは静かにLibriSpeech、Aishell-1、WenetSpeechでWERの冠を奪い取りました。より高速でより軽量です。
I-JEPA:Yann LeCunによるコンピュータビジョン用の最初の「ワールドモデル」
Yann LeCunは何年も、生成的事前訓練が世界を理解する機械を構築するための間違った賭けであると主張してきました。
LoRA:高校生がゲーミング用グラフィックスカードでLarge Language Model(GPT-3)を訓練できるようにする
175Bパラメータ数のGPT-3の完全な微調整は、ほぼ誰もが開始できない — ストレージだけでそれを除外し、GPUはおろか。
【短編レビュー】Conformer:音声認識のための畳み込み拡張Transformer
Conformerはほぼ地味なアプローチでASR界を席巻しました:各Transformerブロックに畳み込みモジュールを統合することで、モデルはグローバルコンテキストとローカル音響特性の両方を一度にキャプチャします。
ネイサン・チェンの4フリップはMixture-of-Expertsでスコアリングされていますか?パート1:Switch Transformers:スパースMoEモデル
ネイサン・チェンのクワッドフリップスコアリングへのウインクを交わしてフレーミングされたこのトークは、Switch Transformerを詳細に説明します。これはGoogleによるMixture-of-Expertsスケーリングの明確で積極的に単純化された取り組みです。
ネイサン・チェンの4フリップはMixture-of-Expertsでスコア付けされているのか?パート2:GLaM:MoEによるLMsの効率的スケーリング
MoEミニシリーズのパート2はGLaMに向かい、Googleの1.2兆パラメータMixture-of-Expertsモデルは、ゼロショット、ワンショット、フューショットベンチマークでGPT-3に匹敵するか上回っており、パラメータの約8%のみを活性化しています
BERTペーパーをスピーチの視点からレビュー
BERTはNLPではほぼ紹介の必要がありませんが、スピーチエンジニアの目を通して読むと、標準的な「マスク言語モデリングがすべてを変えた」という要約とは異なるレッスンが明らかになります。
Transformer:Attention is All You NeedとListen, Attend and Spell -- スピーチの視点から
2つの論文、1つのストーリー。「Attention Is All You Need」はTransformerを世界に与え、シーケンスモデリングの方法をリセットした一方で、「Listen, Attend and Spell」(LAS)はエンドツーエンドスピーチについて1年前に同じことを行いました
