I-JEPA: Yannn LeCun's First 'World Model' for Computer Vision

Tutorials

I-JEPA: Yann LeCun의 첫 번째 '세계 모델' 컴퓨터 비전용

Yann LeCun은 수년 동안 생성형 사전 훈련이 세계를 이해하는 기계를 만들기 위한 잘못된 베팅이라고 주장해왔습니다.

Yann LeCun은 수년 동안 생성형 사전 훈련이 세계를 이해하는 기계를 만들기 위한 잘못된 베팅이라고 주장해왔습니다. I-JEPA는 컴퓨터 비전을 위해 이 논제를 코드로 옮긴 첫 번째 Meta AI 출시입니다. 픽셀을 재구성하거나 증강을 정렬하는 대신, 단일 컨텍스트 블록에서 마스킹된 대상 블록의 추상적 표현을 예측하여 이미지를 생성하지 않고도 의미론을 배웁니다.

이 안내는 마스킹 전략이 중요한 이유(대상 블록은 의미론적 예측을 강제할 수 있을 정도로 충분히 커야 하고, 컨텍스트 블록은 공간적으로 정보가 풍부해야 함)와 결합 임베딩 예측 아키텍처가 대조 방법을 괴롭히는 표현 붕괴를 회피하는 이유를 자세히 설명합니다. 효율성 숫자들이 헤드라인입니다: 16개의 A100에서 ImageNet에서 72시간 이내에 훈련된 ViT-Huge/14로 클래스당 단 12개의 레이블이 지정된 예제로 강력한 저가 샷 분류를 달성합니다. MAE와 DINO를 넘어 자기 감독 학습을 추적하고 있거나, LeCun 스타일의 세계 모델이 배포될 때 실제로 어떤 모습인지 궁금하다면, 이는 표현 학습이 다음에 향할 수 있는 위치에 대한 유용한 입문입니다.