Quantization

Quantization (Kuantisasi) adalah teknik optimasi model machine learning yang mengurangi presisi angka (bobot dan aktivasi) dari floating-point 32-bit (FP32) menjadi format yang lebih kecil seperti integer 8-bit (INT8). Ini mengurangi ukuran memori model dan mempercepat inferensi dengan sedikit penurunan akurasi.

Konteks Penggunaan

Kunci untuk menjalankan LLM di laptop biasa.

Contoh

Model LLaMA asli ukurannya 130GB (FP16). Setelah di-quantization ke 4-bit, ukurannya jadi 8GB dan bisa jalan di GPU murah.

Catatan

Metode: Post-Training Quantization (PTQ) dan Quantization-Aware Training (QAT).

Bangun Karier Sebagai AI Engineer dalam 8 Minggu!

Info Detail