Skip to content

[10] Do Vision Transformers See Like Convolutional Neural Networks? #10

Description

@techzzt

Do Vision Transformers See Like Convolutional Neural Networks?

image

  • CNN과 ViT의 feature map representation 비교를 통해 ViT 모델이 representation 측면에서 가지는 장점에 대해 작성한 논문
  • Locality한 특성을 반영하는 cnn 모델과 달리 ViT는 global, local한 정보를 모두 포함하며 각 layer에서 block이 깊어질수록 global한 특성을 보존하고 있음을 확인

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions