I-JEPA:Yann LeCunによるコンピュータビジョン用の最初の「ワールドモデル」
Yann LeCunは何年も、生成的事前訓練が世界を理解する機械を構築するための間違った賭けであると主張してきました。
Yann LeCunは何年も、生成的事前訓練が世界を理解する機械を構築するための間違った賭けであると主張してきました。I-JEPAは、その論文をコンピュータビジョン用のコードに入れるための最初の具体的なMeta AIリリースです。ピクセルの再構成または拡張の配置の代わりに、単一のコンテキストブロックからマスク作成されたターゲットブロックの抽象的な表現を予測します — 画像を生成することなく意味論を学習します。
ウォークスルーは、マスキング戦略が重要である理由(ターゲットブロックは意味的予測を強制するのに十分な大きさである必要があり、コンテキストブロックは空間的に有益である必要があります)と、共同埋め込み予測アーキテクチャがコントラスト手法を苦しめる表現崩壊を回避する理由を掘り下げます。効率の数字は見出しです:ImageNetで訓練されたViT-Huge/14は16 A100で72時間未満で、クラスごとにわずか12のラベル付き例での強い低ショット分類に到達します。MAEとDINOを超えた自己監督学習を追跡している、またはLeCunスタイルのワールドモデルが出荷される場合に実際にどのように見えるかについて好奇心のある人のために、これは表現学習が次にどこへ向かっているかについての有用な入門書です。
