[Olewave's Review] CLIP (1/3): Learning Transferable Visual Models From Natural Language Supervision

Tutorials

[Olewave 評測] CLIP (1/3): 從自然語言監督學習可轉移的視覺模型

在有 BLIP、LLaVA 或任何值得一提的 speech-LLM 之前,有 CLIP,這正是故事開始的地方。

在有 BLIP、LLaVA 或任何值得一提的 speech-LLM 之前,有 CLIP,這正是故事開始的地方。三部分評測的第 1 部分設置了 OpenAI 的對比式影像-文字預訓練配方:從開放網路拉取的 4 億個(影像、文字)配對、雙編碼器架構以及簡單到「哪個標題對應哪個影像?」的訓練目標。結果是可轉移視覺表示的質的飛躍,以及語音 AI 團隊現在正在借鑒的許多多模態基礎模型工作的藍圖。

評測闡述了拋棄固定類別監督的動機、4 億配對資料集背後的資料整理策略,以及使單次預訓練能夠跨 OCR、動作識別、地理定位和細粒度分類進行泛化的訓練時技巧。CLIP 的零樣本 ImageNet 與 ResNet-50 的匹配,在不接觸任何 128 萬 ImageNet 訓練影像的情況下,是頭版結果,但更深層的收穫是架構上的:自然語言作為監督信號以標籤資料無法做到的方式進行擴展。如果你想在開始第 2 和 3 部分之前先建立基礎,請點擊播放,特別是如果你正在嘗試為現在主導語音 AI 堆疊的音頻-文字和 speech-LLM 預訓練配方建立相同的直覺。