Boris Johnsonの台頭と衰退 - マイクの分析
政治ニュースは通常、音声AIエンジニアが金曜日の午後にキューに入れるものではありませんが、Boris Johnsonの辞任発表は、マイクの銀行の前で行われ、彼の党がスキャンダルの連鎖で反乱を起こしたため
[Olewnaveのロングレビュー] Xception: 深層学習による深さ方向分離可能畳み込み
XceptionはInceptionの仮説を論理的極限まで推し進め、チャネル間および空間相関を完全に分離された操作に分離し、それが普及させた深さ方向分離可能畳み込みはあらゆる場所に登場しています
中国の航空母艦フジアン003のフェーズドアレイレーダーと音声ビームフォーミングとのつながり
中国の最新の航空母艦フジアン003に搭載されたフェーズドアレイレーダーと、スマートスピーカーが騒々しい部屋全体であなたの声を聞くことができるマイク配列は、実際には同じ基本的な数学を共有しています。
iOS 16の新しい音声入力はどのように機能するのか?音声研究者がAppleの秘策を明かす!
AppleのiOS 16音声入力はデバイス上で完全に実行され、この単一の設計選択は遅延、プライバシー、およびスマートフォンで実行可能なASRアーキテクチャの種類に連鎖的な影響を与えます。
【長編レビュー】Conformer:音声認識のための畳み込み拡張Transformer
Conformerはエンドツーエンド音声認識をひっそりと支配したモデルであり、Transformerブロック各々に畳み込みモジュールを追加するそのレシピは、その単純さの割に機能するという素晴らしいアイデアの一つになりました。
博士がコンピュータを使ってズルして、2022年の大学入学試験の数学圧軸大問を解く
研究レベルのコンピュータ代数ツールキットを2022年の中国ガオカオ数学の最難問に活用するとどうなるでしょう?
[ロングレビュー] 多次元Transformerの軸方向注意
画像またはビデオ全体にわたる完全な自己注意は禁止的に高価であるため、二次的なブローアップなしでTransformerの表現力をどのように保ちますか?
[ショートレビュー] 多次元Transformerの軸方向注意
軸方向注意はTransformersを高次元データで扱いやすくする優雅なアイデアの1つです:すべてのピクセルまたはすべての時間周波数ビンを一度に注意する代わりに、一度に1つの軸に沿って注意します。
[ロング レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
この論文は、ゼロショット音声クローニングを実用的にした論文です。数千の雑音を含む、トランスクリプト不要の音声でスピーカーエンコーダーを判別検証タスクで訓練し、これらの埋め込みをTacotron 2 s
[ショート レビュー] スピーカー検証からマルチスピーカー音声合成への転移学習
Googleのこの論文は、現代のゼロショット音声クローニングの波を起こしました。美しくシンプルなアーキテクチャを持っており、検証で訓練されたスピーカーエンコーダー、テキストとスピーカー埋め込みを受け取るTacotron 2合成器があります
[ショート レビュー] Wav2Seq: 疑似言語を使用した音声テキスト変換エンコーダーデコーダーモデルの事前訓練
wav2vec 2.0のような自己教師あり事前訓練により、素晴らしい音声エンコーダーが得られました。しかし、完全なエンコーダーデコーダーASRシステムが欲しい場合、デコーダーはまだゼロから開始していました。
[ロングレビュー] ゼロラベル言語学習へ向けて
人間によるラベル付きの例がない状態でも、タスク固有のNLPモデルを訓練できたら?「ゼロラベル言語学習へ向けて」はこの問いに真正面から向き合っています。
[ロングレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
限られたGPU予算で10億パラメータの音声モデルまたは言語モデルを訓練することは、パイプライン並列、テンソル並列、またはZeRO型オプティマイザシャーディング間での苦渋の選択を意味していました。
[ショートレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
完全シャード化データ並列(Fully Sharded Data Parallel)は、あらゆる音声チームと言語チームが最終的に問う質問へのMetaからの答えです:1桁大きいモデルを、1桁多いGPUをプロビジョニングせずに訓練するにはどうするか?
