Tokenization

Tokenisasi adalah proses memecah teks menjadi unit-unit kecil yang disebut token (bisa berupa kata, sub-kata, atau karakter) agar bisa diproses oleh model machine learning. Ini adalah langkah pertama dalam pipeline NLP.

Konteks Penggunaan

GPT-4 menghitung biaya berdasarkan jumlah token, bukan jumlah kata.

Contoh

Kata "Makan" mungkin jadi 1 token. Kata "Mempertanggungjawabkan" mungkin dipecah jadi "Mem", "per", "tanggung", "jawab", "kan" (Sub-word tokenization).

Catatan

1000 token kira-kira setara dengan 750 kata bahasa Inggris.

Bangun Karier Sebagai AI Engineer dalam 8 Minggu!

Info Detail