[Olewaveのレビュー] CLIP (1/3): 自然言語監督から転移可能な視覚モデルを学習する
BLIPやLLaVA、またはまともな音声LLMが登場する前に、CLIPがありました。これがストーリーの始まりです。
BLIP、LLaVA、またはその価値のある音声 LLM が存在する前に、CLIP がありました。そして、ここから物語が始まります。 3 部構成のレビューの第 1 部では、OpenAI の対照的な画像とテキストの事前トレーニング レシピを設定します。オープン ウェブから取得した 4 億の (画像、テキスト) ペア、デュアル エンコーダ アーキテクチャ、および「どのキャプションがどの画像に対応するか?」というシンプルなトレーニング目標です。その結果、転送可能な視覚表現が段階的に変化し、現在音声 AI チームが借用している多くのマルチモーダル基盤モデル作業の青写真が作成されました。
このレビューでは、固定カテゴリの監視を廃止する動機、400M ペアのデータセットの背後にあるデータキュレーション戦略、および 1 つの事前トレーニング パスを OCR、アクション認識、地理位置特定、および詳細な分類にわたって一般化できるトレーニング時のトリックについて説明します。 128 万の ImageNet トレーニング画像に一切触れずに、CLIP が ResNet-50 と対戦したゼロショット ImageNet の試合が見出しの結果ですが、より深い意味は構造的なものです。つまり、監視信号としての自然言語は、ラベル付けされたデータでは不可能な方法で拡張されます。パート 2 とパート 3 に進む前に基礎を築きたい場合、特に現在音声 AI スタックを消費している音声テキストと音声 LLM の事前トレーニング レシピに対して同じ直感を構築しようとしている場合は、再生ボタンを押してください。
