Tutorials
[Olewaveのレビュー] CLIP (1/3): 自然言語監督から転移可能な視覚モデルを学習する
BLIPやLLaVA、またはまともな音声LLMが登場する前に、CLIPがありました。これがストーリーの始まりです。
Tutorials
[Olewaveのレビュー] SLUのためのトークンレベルシーケンスラベリング(合成型E2Eモデルを使用)
エンドツーエンドSLUは注目を集めていますが、シーケンスラベリングをシーケンス予測として扱うことは、何十年にもわたるよく理解されたトークンレベルタグ付けメカニズムを静かに廃止します。
