Quantization
Quantization (Kuantisasi) adalah teknik optimasi model machine learning yang mengurangi presisi angka (bobot dan aktivasi) dari floating-point 32-bit (FP32) menjadi format yang lebih kecil seperti integer 8-bit (INT8). Ini mengurangi ukuran memori model dan mempercepat inferensi dengan sedikit penurunan akurasi.
Konteks Penggunaan
Kunci untuk menjalankan LLM di laptop biasa.
Contoh
Model LLaMA asli ukurannya 130GB (FP16). Setelah di-quantization ke 4-bit, ukurannya jadi 8GB dan bisa jalan di GPU murah.
Catatan
Metode: Post-Training Quantization (PTQ) dan Quantization-Aware Training (QAT).
