> **How do vision transformers work?** - ViT가 높은 성능을 보이는 이유에 대해 설명 및 증명한 논문 - 구조 중 가장 주요한 역할을 하는 MSA (Multi-head self-attentions)가 효과적인 이유에 대해 설명 - ViT의 representation을 보강하는 요인에 대해 설명