Skip to content

[3] AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE #3

Description

@techzzt

AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE

image

  • Attention is All You Need 논문에서 제안한 transformer 구조를 vision task에 적용한 논문
  • 이전 vision task에서 self-attention을 적용하는 것의 한계를 극복하여 NLP 분야에서 사용되는 self attention을 활용한 transformer 구조 (ViT) 모델 제안
  • 이미지를 patch로 분할하고 sequence로 입력 (입력 데이터 생성 시 patch, position embedding을 통해 patch가 input으로 사용됨)
  • 핵심 구조로는 BERT와 유사하게 토큰 정보를 제공하는 CLS token, classification head, position embedding (embedding의 position 정보를 유지), transformer (multi-head로 구성된 self-attention 메커니즘 적용)

image

  • ViT의 경우 일반적인 CNN 계열의 모델과 달리 공간에 대한 inductive bias가 존재하지 않음
  • 이에 많은 데이터를 사용해 데이터의 관계를 robust하게 학습해야하며 MLP layer에서만 local 및 translation equivariance한 특징을 가짐 (self-attention에서는 global한 특성을 지님)

image

  • 제안 모델의 구조를 다르게 설정 (Base, Large, Huge)하여 pre-train을 진행하고 이후 1-linear layer을 이용해 classification 수행
  • JFT로 사전 학습을 실시한 후에 transfer learning 진행 (성능 결과 확인 시 사전학습에서 사용된 데이터가 클수록 성능이 좋았으며 작은 크기의 데이터 셋 최적화를 위해 regularization 설정 - weight decay, dropout, label smoothing)

Metadata

Metadata

Assignees

No one assigned

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions