[Olewave 評測] CLIP (2/3): 從自然語言監督學習可轉移的視覺模型
OpenAI 的 CLIP 通過拋棄固定標籤集並改為在從網際網路上抓取的 4 億個(影像、文字)配對上進行訓練,翻轉了計算機視覺的劇本。
OpenAI 的 CLIP 通過拋棄固定標籤集並改為在從網際網路上抓取的 4 億個(影像、文字)配對上進行訓練,翻轉了計算機視覺的劇本。這份三部分評測的第 2 部分更深入地探討使對比式影像-文字預訓練成為現實的機制,以及為什麼將標題與影像相匹配實際上是達到最先進視覺表示的令人驚訝的高效途徑。對於任何人構建多模態系統(其中語音、文字和視覺現在共享嵌入空間),這裡的設計課程直接延伸到音頻世界(想想用於音頻-文字檢索的 CLAP、Whisper 風格的弱監督,以及現在在 ICASSP 和 Interspeech 上發表的語音-LLM 對齊工作)。
這一期介紹了 CLIP 如何零樣本轉移到 30 多個下游基準測試(OCR、動作識別、地理定位、細粒度分類),並在不接觸 128 萬個訓練影像的情況下達到 ResNet-50-on-ImageNet 準確性。討論說明了為什麼自然語言監督在精選標籤停滯不前的地方能夠擴展,以及相同的原則現在如何重塑我們如何跨模態預訓練基礎模型。如果你正在考慮 ASR 或 TTS 的弱監督預訓練,這中間一章是回報著陸的地方,所以當你有 20 分鐘專注時間時,將其排隊。
