Tutorials
[Olewave 評測] CLIP (3/3): 從自然語言監督學習可轉移的視覺模型
這份 CLIP 評測的最後部分著重於結果部分,這正是 OpenAI 的對比式影像-文字模型從一個有趣的想法轉變為整個多模態堆疊基礎層原始構件的地方。
Tutorials
[Olewave 評測] CLIP (2/3): 從自然語言監督學習可轉移的視覺模型
OpenAI 的 CLIP 通過拋棄固定標籤集並改為在從網際網路上抓取的 4 億個(影像、文字)配對上進行訓練,翻轉了計算機視覺的劇本。
Tutorials
[Olewave 評測] CLIP (1/3): 從自然語言監督學習可轉移的視覺模型
在有 BLIP、LLaVA 或任何值得一提的 speech-LLM 之前,有 CLIP,這正是故事開始的地方。
Tutorials
[長篇評論] Cascaded Diffusion Models for High Fidelity Image Generation
在Imagen和DALL-E 2將擴散設定為生成式影像的預設之前,這篇Google Brain論文奠定了Cascaded Diffusion的方案,許多後來的文字轉圖像系統都悄悄地採用:從一個小
Tutorials
[短篇評論] Cascaded Diffusion Models for High Fidelity Image Generation
Cascaded Diffusion是許多現代生成工作背後的二階以上方案:用一個擴散模型生成小影像,然後交給超解析度擴散模型來添加高頻細
