Tutorials
[Olewaveのレビュー] CLIP (3/3): 自然言語監督から転移可能な視覚モデルを学習する
このCLIPレビューの最後の部分は結果セクションに着地します。ここはOpenAIの対比的画像テキストモデルが興味深いアイデアから、マルチモーダルスタック全体の基盤レイヤープリミティブへとシフトした場所です。
Tutorials
[Olewaveのレビュー] CLIP (2/3): 自然言語監督から転移可能な視覚モデルを学習する
OpenAIのCLIPは、固定されたラベルセットを廃止し、代わりにインターネットからスクレイピングされた400百万の(画像、テキスト)ペアで訓練することで、コンピュータビジョンのスクリプトを逆転させました。
Tutorials
[Olewaveのレビュー] CLIP (1/3): 自然言語監督から転移可能な視覚モデルを学習する
BLIPやLLaVA、またはまともな音声LLMが登場する前に、CLIPがありました。これがストーリーの始まりです。
Tutorials
[ロングレビュー] 高忠実度画像生成のためのカスケード型拡散モデル
ImagenとDALL-E 2が拡散を生成画像の標準にする前に、このGoogle Brainの論文は、その後の多くのテキスト・ツー・イメージシステムが静かに借用したカスケード型拡散のレシピを示しました:小さなもので始める
Tutorials
[ショートレビュー] 高忠実度画像生成のためのカスケード型拡散モデル
カスケード型拡散は多くの最新の生成的作業の基礎となる2段階以上のレシピです:1つの拡散モデルで小さな画像を生成し、その後、高周波詳細を追加する超解像拡散モデルに渡します
