[Olewave's Review] CLIP (2/3): Learning Transferable Visual Models From Natural Language Supervision

Tutorials

[Olewave评论] CLIP (2/3): 从自然语言监督学习可转移的视觉模型

OpenAI的CLIP通过抛弃固定标签集,转而在从互联网上抓取的4亿个(图像、文本)对上进行训练,改变了计算机视觉的游戏规则。

OpenAI 的 CLIP 翻转了计算机视觉的脚本,抛弃了固定的标签集,而是对从互联网上抓取的 4 亿对(图像、文本)进行训练。这篇由三部分组成的评论的第二部分深入探讨了对比图像文本预训练的机制,以及为什么将标题与图像匹配是实现 SOTA 视觉表示的极其有效的途径。对于任何构建语音、文本和视觉共享嵌入空间的多模态系统的人来说,这里的设计课程直接回响到音频世界(想想用于音频文本检索的 CLAP、Whisper 式的弱监督,以及现在在 ICASSP 和 Interspeech 进行的语音-LLM 对齐工作)。

本期文章将介绍 CLIP 如何将零样本传输到 30 多个下游基准(OCR、动作识别、地理定位、细粒度分类),并在不接触 128 万张训练图像的情况下达到 ResNet-50-on-ImageNet 的准确性。讨论框架了为什么自然语言监督会在策划标签停滞的地方进行扩展,以及同样的原则现在如何重塑我们跨模式预训练基础模型的方式。如果您正在考虑对 ASR 或 TTS 进行弱监督预训练,那么中间的章节就是回报所在,所以当您有 20 分钟的专注时间时,请排队阅读。