マイクロソフトのVALL-E 2レビュー(ゼロショットTTSで人間レベルの性能を達成)
ゼロショットTTSは多くの人がまだ数年先だと考えていたレベルを越えました。マイクロソフトのVALL-E 2は、LibriSpeechとVCTKの両方で、ロバスト性、自然性、スピーカー
3分でマイクロソフトのVALL-E 2を理解する(ゼロショットTTSで人間レベルの性能を達成)
時間がないが、なぜVALL-E 2が突然ゼロショットTTSのリファレンスになったのかを知りたい?
OpenAI WhisperからあなたのASRサービス自社へ:名前エンティティ&ドメイン固有用語の認識
Whisperはそのままで印象的ですが、実際に本番環境にデプロイした人なら誰もが知っているとおり、固有名詞、製品名、医療用語、法的専門用語、およびドメイン語彙の長い尾部全体で失敗します
Googleの研究者によるエンドツーエンド音声認識の深層分析、第1部:概要&モデリング
深層学習の10年間でASRワード誤り率を相対的に50%以上削減し、その過程でクラシックなHMMパイプラインを遺物のように見えるようにしました。
OpenAIのGPT-4oのニューラルネットワークアーキテクチャを推測する
OpenAIはGPT-4oに関する論文を公開していないため、このビデオは次善の対策を講じています。OpenAIが実際に実演した機能に基づいて、ニューラルネットワークアーキテクチャがほぼ確実にどのようなものであるかをリバースエンジニアリングしています。
GoogleのUniversal Speech Modelが100以上の言語でOpenAIのWhisper Modelを上回る
GoogleのUniversal Speech Modelは、標識付きトレーニングデータをほぼ7分の1しか使用しない状態で、100以上の言語においてASRでOpenAIのWhisper と同等かそれを上回る、という驚くべき成果を静かに達成しました。
ロングレビュー: AppleのMM1: マルチモーダルLLM事前学習の方法、分析、インサイト
Appleはあまり論文を発表しないため、MM1の論文がマルチモーダルLLM事前学習の完全なアブレーション研究とともに発表されたとき、MLLMsを構築している人にとって年間最も有用なデータリリースの一つでした。
AppleのSOTAマルチモーダルLLMのクイックレビュー: MM1
MM1の完全な説明に時間がない場合は、このクイックレビューで数分で本質を学べます。Appleが構築したもの、アーキテクチャとデータのアブレーションから学んだもの、どの設計決定が
Claude 3がGPT-4を上回った秘密
Claude 3 OpusがMMU、GPQA、GSM8K、およびほぼすべてのフロンティア評価ベンチマークでGPT-4を上回ったとき、興味深い質問はAnthropicが単にスケールを大きくしたかどうかではなく、何がトレーニング時間のシークレットソース
Microsoft+OpenAI、Google、Meta、NvidiaのオープンソースLargeスピーチモデルのASRレビュー
あらゆる主要なAIラボは現在、ASR向けのオープンソースLargeスピーチモデルをリリースしており、本番環境向けに適切なものを選択することが実際の課題となりました。
OpenAIのWhisperモデルから自社ASRサービスまで:後処理と言語モデリング
生のWhisper出力は素晴らしいものですが、実際のユーザーにデプロイした経験がある人なら、デモトランスクリプトと下流システムが実際に利用できるもの間のギャップを知っています。
OpenAIのWhisperモデルから自社ASRサービスまで:長いオーディオとストリーミング(パート3)
Whisperは30秒のチャンクで訓練されており、2時間のポッドキャストをフィードするか、ライブキャプショニングパイプラインにワイアリングしようとする瞬間に見せています。
OpenAIのWhisperモデルから自社ASRサービスまで:ROI(投資対効果)(パート2)
ASRのビルド対バイの質問は、通常、精度と利便性としてフレーミングされていますが、実際の決定要因は製品のライフタイム全体にわたるROIです。
OpenAIのWhisperモデルから自社ASRサービスまで:概要(パート1)
OpenAIがWhisperをオープンソース化したとき、それは静かに自社ASRサービスが何のようなものであるかのベースラインをリセットしました。
OpenAI Whisperが生成した単語タイムスタンプが正確でない理由は?再度正確にする方法は?
Whisperに単語タイムスタンプを要求すると数字が返ってくる — しかし、実際の音声にカラオケ、キャプション、またはダビング用にそれを並べてみようとしたことがあれば、ドリフト、間違った境界へのスナップ、そして時々
音声生成AI:Meta AIによるVoiceBox(フローマッチングとニューラルODEも含む)
何年間も、音声生成はスケールと汎用性の両面でテキストと画像生成に遅れていた — すべてのタスクは独自の専用モデルを取得しました。
SpeechT5のレビュー: GoogleのT5をSpeech(ASR, TTS, SID, ...)タスクに導入
T5は単一のエンコーダ-デコーダ事前学習レシピのもとでテキスト間のタスクを統一し、NLPの主要なツールとなりました。
[Olewaveのレビュー] AudioLM: オーディオ生成への言語モデリングアプローチ
AudioLMは、オーディオ生成が信号処理よりも言語モデリングのように見えるべきだと多くの人々を確信させた論文です。
[10分] OpenAIのWhisper APIがChatGPTほど優れていない理由を説明する
Whisperは大きな話題となりましたが、GPT-3がNLPを変革したようにASRを変えることはできず、この10分間のレビューでは、その理由が論文そのものに組み込まれていると主張しています。
OpenAIのGPT-3の詳細レビュー:言語モデルはフューショット学習者(パート1/3:イントロ&アプローチ)
このGPT-3の3部構成レビューの最初のパートは、スケーリングを研究上の試みから業界標準へと変えた論文を紹介しています。
VALL-Eの詳細なレビュー:ニューラルコーデック言語モデルがゼロショットテキスト音声合成器である
3秒間のリファレンスクリップからのゼロショットTTSは実現不可能に思えましたが、VALL-Eがリリースされるまで、この詳細なレビューはMicrosoftがどのようにそれを実現したかを正確に解説しています。
3分でMicrosoftのVALL-Eを理解する(最先端ゼロショットTTS)
VALL-Eは、TTSが信号回帰ではなく言語モデリングのように見え始めた瞬間です。このクイック説明は、あなたを素早く最新の状態にします。
[Olewave's Review] OpenAI's Whisper ASR: 大規模弱教師あり学習による堅牢な音声認識
OpenAIがWhisperをリリースしたとき、ASRコミュニティは680,000時間の多言語、マルチタスク、ウェブスクレイピングされたオーディオでトレーニングされたシステムと対峙する必要があり、このシステムはアクセント、背景ノイズ、および技術
Olewaveの最も詳細なRNN-T説明:リカレントニューラルネットワークによるシーケンス変換
Alex Graves'のRNN-Tペーパーは、今日出荷されているほぼすべてのストリーミングASRシステムの静かな祖先です。Googleのオンデバイスレコグナイザーから、NeMo、ESPnet、およびそれ以上の無数のオープンソーストランスデューサースタックまで。
[Olewaveの長いレビュー]音声認識のためのニューラルトランスデューサーの効率的なトレーニング
ニューラルトランスデューサーはストリーミングASRの主力製品ですが、効率的にトレーニングすることは悪名高く困難です:RNN-T損失はシーケンス長において立方体メモリを持つ、配置格子は長い発話で爆発的になる、単一の
【長編レビュー】Conformer:音声認識のための畳み込み拡張Transformer
Conformerはエンドツーエンド音声認識をひっそりと支配したモデルであり、Transformerブロック各々に畳み込みモジュールを追加するそのレシピは、その単純さの割に機能するという素晴らしいアイデアの一つになりました。
[ロングレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
限られたGPU予算で10億パラメータの音声モデルまたは言語モデルを訓練することは、パイプライン並列、テンソル並列、またはZeRO型オプティマイザシャーディング間での苦渋の選択を意味していました。
[ショートレビュー] 完全シャード化データ並列:より少ないGPUでより高速なAI訓練
完全シャード化データ並列(Fully Sharded Data Parallel)は、あらゆる音声チームと言語チームが最終的に問う質問へのMetaからの答えです:1桁大きいモデルを、1桁多いGPUをプロビジョニングせずに訓練するにはどうするか?
Breaking BadからWav2vec 2.0へ:スピーチ表現の自己教師あり学習フレームワーク
ウォルター・ホワイト、ジェシー・ピンクマン、そしてラベルなしオーディオのバッチに共通することは何か?
