Masked Autoencoders Are Scalable Vision Learners

마스크 패치 비율이 높은 상황에서 이미지 정보를 최대화하는 representation을 구성하는 것이 목표
Encoder에서는 입력 데이터 중 이미지 정보가 포함된 패치만 사용되었으며, decoder의 입력 값으로는 모든 패치 정보가 입력됨
Encoder에서는 ViT 구조를 사용하였으며 flatten 형태로 입력 데이터가 사용되며 decoder에서는 positional encoding과 함께 사용
(Decoder에서는 pixel prediction을 위해 간단한 구조 사용)

본 논문에서는 mask 영역의 비율을 다르게 설정하며 실험 진행
NLP 분야에서 사용하는 BERT와 다르게 이미지는 token하나가 연속적인 정보를 포함하기 때문에 이를 방지하기 위해서 random한 mask augmentation을 적용하고 일반적인 비율보다 높은 비율의 mask augmentation을 적용함
Encoder 영역에서 모델 역할이 중요하고, encoder과 decoder가 분리가 가능하다는 점에서 encoder 구조에 의한 latent representation이 얼마나 잘 구축되었는가가 성능에 핵심적인 영향을 끼칠 것으로 보임
논문: He, Kaiming, et al. "Masked autoencoders are scalable vision learners." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2022.
마스크 패치 비율이 높은 상황에서 이미지 정보를 최대화하는 representation을 구성하는 것이 목표
Encoder에서는 입력 데이터 중 이미지 정보가 포함된 패치만 사용되었으며, decoder의 입력 값으로는 모든 패치 정보가 입력됨
Encoder에서는 ViT 구조를 사용하였으며 flatten 형태로 입력 데이터가 사용되며 decoder에서는 positional encoding과 함께 사용
(Decoder에서는 pixel prediction을 위해 간단한 구조 사용)
본 논문에서는 mask 영역의 비율을 다르게 설정하며 실험 진행
NLP 분야에서 사용하는 BERT와 다르게 이미지는 token하나가 연속적인 정보를 포함하기 때문에 이를 방지하기 위해서 random한 mask augmentation을 적용하고 일반적인 비율보다 높은 비율의 mask augmentation을 적용함
Encoder 영역에서 모델 역할이 중요하고, encoder과 decoder가 분리가 가능하다는 점에서 encoder 구조에 의한 latent representation이 얼마나 잘 구축되었는가가 성능에 핵심적인 영향을 끼칠 것으로 보임
논문: He, Kaiming, et al. "Masked autoencoders are scalable vision learners." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2022.