AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE

- Attention is All You Need 논문에서 제안한 transformer 구조를 vision task에 적용한 논문
- 이전 vision task에서 self-attention을 적용하는 것의 한계를 극복하여 NLP 분야에서 사용되는 self attention을 활용한 transformer 구조 (ViT) 모델 제안
- 이미지를 patch로 분할하고 sequence로 입력 (입력 데이터 생성 시 patch, position embedding을 통해 patch가 input으로 사용됨)
- 핵심 구조로는 BERT와 유사하게 토큰 정보를 제공하는 CLS token, classification head, position embedding (embedding의 position 정보를 유지), transformer (multi-head로 구성된 self-attention 메커니즘 적용)

- ViT의 경우 일반적인 CNN 계열의 모델과 달리 공간에 대한 inductive bias가 존재하지 않음
- 이에 많은 데이터를 사용해 데이터의 관계를 robust하게 학습해야하며 MLP layer에서만 local 및 translation equivariance한 특징을 가짐 (self-attention에서는 global한 특성을 지님)

- 제안 모델의 구조를 다르게 설정 (Base, Large, Huge)하여 pre-train을 진행하고 이후 1-linear layer을 이용해 classification 수행
- JFT로 사전 학습을 실시한 후에 transfer learning 진행 (성능 결과 확인 시 사전학습에서 사용된 데이터가 클수록 성능이 좋았으며 작은 크기의 데이터 셋 최적화를 위해 regularization 설정 - weight decay, dropout, label smoothing)