[태그:] ViT

  • [논문 정리] Vision Transformer(ViT): 이미지를 패치 시퀀스로 읽는 Transformer

    An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov 외 · Google Research, Brain Team · ICLR 2021 논문 · 원문 · 공식 구현·사전학습 모델 핵심 요약 이 논문이 처음 공개된 2020년에는 자연어 처리에서 Transformer의 대규모 사전학습이 확산된 반면, 이미지 인식에서는 CNN이 중심이었다. 비전에 attention을 적용하는…