Archive: 2022 February

News
[Long Review] 'GShard': Scaling Giant Models with Conditional Computation and Automatic Sharding
Tutorials

[ロングレビュー] 「GShard」:条件付き計算と自動シャーディングを使用した巨大モデルのスケーリング

Transformerを1000億パラメータを超えてスケーリングすることは急速に哲学的になります:すべてのトークンに対してネットワーク全体をアクティブにしますか、それとも各トークンを実際に見る必要があるスペシャリストにルーティングしますか?

2月 26, 2022· 1 min read
Is Nathan Chen's 4 Flip scored by Mixture-of-Experts? Part 1: Switch Transformers: sparse MoE models
Tutorials

ネイサン・チェンの4フリップはMixture-of-Expertsでスコアリングされていますか?パート1:Switch Transformers:スパースMoEモデル

ネイサン・チェンのクワッドフリップスコアリングへのウインクを交わしてフレーミングされたこのトークは、Switch Transformerを詳細に説明します。これはGoogleによるMixture-of-Expertsスケーリングの明確で積極的に単純化された取り組みです。

2月 12, 2022· 1 min read
Is Nathan Chen's 4 Flip scored by Mixture-of-Experts? Part 2: GLaM:Efficient Scaling of LMs with MoE
Tutorials

ネイサン・チェンの4フリップはMixture-of-Expertsでスコア付けされているのか?パート2:GLaM:MoEによるLMsの効率的スケーリング

MoEミニシリーズのパート2はGLaMに向かい、Googleの1.2兆パラメータMixture-of-Expertsモデルは、ゼロショット、ワンショット、フューショットベンチマークでGPT-3に匹敵するか上回っており、パラメータの約8%のみを活性化しています

2月 12, 2022· 1 min read
BERT Paper Reviewed from a Speech Perspective
Tutorials

BERTペーパーをスピーチの視点からレビュー

BERTはNLPではほぼ紹介の必要がありませんが、スピーチエンジニアの目を通して読むと、標準的な「マスク言語モデリングがすべてを変えた」という要約とは異なるレッスンが明らかになります。

2月 6, 2022· 1 min read