Vision Transformer (ViT)
Vision Transformer (ViT) adalah penerapan arsitektur Transformer (yang awalnya untuk teks) pada tugas visi komputer (gambar). ViT memecah gambar menjadi patch (potongan kecil) dan memperlakukannya sebagai urutan token, menggantikan dominasi CNN.
Konteks Penggunaan
State-of-the-art dalam klasifikasi gambar saat ini.
Contoh
Alih-alih memindai per pixel (CNN), ViT melihat hubungan global antar bagian gambar sekaligus.
Catatan
Membutuhkan dataset latih yang sangat masif (Google JFT-300M) untuk mengalahkan CNN.
