Googleの研究者によるエンドツーエンド音声認識の深層分析、第1部:概要&モデリング
深層学習の10年間でASRワード誤り率を相対的に50%以上削減し、その過程でクラシックなHMMパイプラインを遺物のように見えるようにしました。
OpenAIのGPT-4oのニューラルネットワークアーキテクチャを推測する
OpenAIはGPT-4oに関する論文を公開していないため、このビデオは次善の対策を講じています。OpenAIが実際に実演した機能に基づいて、ニューラルネットワークアーキテクチャがほぼ確実にどのようなものであるかをリバースエンジニアリングしています。
GoogleのUniversal Speech Modelが100以上の言語でOpenAIのWhisper Modelを上回る
GoogleのUniversal Speech Modelは、標識付きトレーニングデータをほぼ7分の1しか使用しない状態で、100以上の言語においてASRでOpenAIのWhisper と同等かそれを上回る、という驚くべき成果を静かに達成しました。
【詳細論文読み解き】Zipformer: 自動音声認識のための高速でより優れたエンコーダ
Conformerはここ数年、デフォルトのASRエンコーダでしたが、k2/icefallチームのZipformerは静かにLibriSpeech、Aishell-1、WenetSpeechでWERの冠を奪い取りました。より高速でより軽量です。
GoogleのSoundStreamの詳細レビュー: エンドツーエンドニューラルオーディオコデック
ニューラルコデックは静かに最新の生成的オーディオの基盤層となり、SoundStreamはそのプロセスを開始した論文の1つです。
[Olewaveのレビュー] AudioLM: オーディオ生成への言語モデリングアプローチ
AudioLMは、オーディオ生成が信号処理よりも言語モデリングのように見えるべきだと多くの人々を確信させた論文です。
Olewaveの最も詳細なRNN-T説明:リカレントニューラルネットワークによるシーケンス変換
Alex Graves'のRNN-Tペーパーは、今日出荷されているほぼすべてのストリーミングASRシステムの静かな祖先です。Googleのオンデバイスレコグナイザーから、NeMo、ESPnet、およびそれ以上の無数のオープンソーストランスデューサースタックまで。
GoogleがBlake Lemoineを「AIボットが自覚を持つ」と言ったことで解雇した?LaMDAまたはChatGPTは人間のように思考していますか?
GoogleがLaMDAが自覚を持つようになったという主張でBlake Lemoineを解雇したとき、その物語は急速に広まりましたが、根底にある質問は残りました:LaMDAやChatGPTのような大規模言語モデルは実際に思考しているのか、
[Olewnaveのロングレビュー] Xception: 深層学習による深さ方向分離可能畳み込み
XceptionはInceptionの仮説を論理的極限まで推し進め、チャネル間および空間相関を完全に分離された操作に分離し、それが普及させた深さ方向分離可能畳み込みはあらゆる場所に登場しています
[Olewnaveのショートレビュー] Xception: 深層学習による深さ方向分離可能畳み込み
ロングフォームの深掘りなしでコアのXceptionアイデアだけが必要でしたら、このショートレビューはエクスプレスバージョンです。
[ロングレビュー] CLAS: ディープコンテキスト: エンドツーエンド文脈的音声認識
ASR製品をリリースした人なら誰でも固有名詞の苦労を知っています: 連絡先の名前、曲のタイトル、医薬品の名前、不明瞭な地名。
[ロングレビュー] ファインチューニングされた言語モデルはゼロショット学習器
InstructGPTが指示チューニングを一般的な用語にする前に、GoogleのFLAN論文は、自然言語指示に対する適度な量のマルチタスク微調整が、普通のLMを驚くほど
[ロングレビュー] 「GShard」:条件付き計算と自動シャーディングを使用した巨大モデルのスケーリング
Transformerを1000億パラメータを超えてスケーリングすることは急速に哲学的になります:すべてのトークンに対してネットワーク全体をアクティブにしますか、それとも各トークンを実際に見る必要があるスペシャリストにルーティングしますか?
