[Olewave 評測] CLIP (3/3): 從自然語言監督學習可轉移的視覺模型
這份 CLIP 評測的最後部分著重於結果部分,這正是 OpenAI 的對比式影像-文字模型從一個有趣的想法轉變為整個多模態堆疊基礎層原始構件的地方。
這份 CLIP 評測的最後部分著重於結果部分,這正是 OpenAI 的對比式影像-文字模型從一個有趣的想法轉變為整個多模態堆疊基礎層原始構件的地方。在從網路上抓取的 4 億個影像-文字配對上進行訓練,CLIP 學會將標題與影像相匹配,而這個簡單的目標原來能夠實現超過 30 個下游計算機視覺基準上的零樣本轉移,包括 OCR、動作識別、地理定位和細粒度分類。
詳細解說深入到主要基準測試,包括在沒有任何標記 ImageNet 示例的情況下在 ImageNet 上與完全監督的 ResNet-50 相匹配,以及 CLIP 泛化和不泛化的許多地方。對於語音 AI 領域的人而言,可轉移的課程是 CLIP 風格的對比式預訓練配方,它現在支撐著用於音頻-文字檢索的 CLAP、Whisper 風格的多任務訓練以及為多模態助手提供動力的聯合嵌入空間。用說服該領域自然語言監督是前進之路的數字來總結這個三部分系列。如果你涉及檢索、標籤或任何跨模態系統,值得你花時間。
