Vision Transformer (ViT)

Vision Transformer (ViT) adalah penerapan arsitektur Transformer (yang awalnya untuk teks) pada tugas visi komputer (gambar). ViT memecah gambar menjadi patch (potongan kecil) dan memperlakukannya sebagai urutan token, menggantikan dominasi CNN.

Konteks Penggunaan

State-of-the-art dalam klasifikasi gambar saat ini.

Contoh

Alih-alih memindai per pixel (CNN), ViT melihat hubungan global antar bagian gambar sekaligus.

Catatan

Membutuhkan dataset latih yang sangat masif (Google JFT-300M) untuk mengalahkan CNN.

Bangun Karier Sebagai AI Engineer dalam 8 Minggu!

Info Detail
Apa Itu Vision Transformer (ViT)? Definisi & Penjelasan | Kamus REA Ruangguru