QLoRA (Quantized LoRA)

QLoRA adalah teknik fine-tuning yang efisien memori yang menggabungkan Quantization (biasanya 4-bit) dengan LoRA (Low-Rank Adaptation). Ini memungkinkan fine-tuning model bahasa besar (65B+ parameter) pada satu GPU consumer (misalnya RTX 3090/4090).

Konteks Penggunaan

Demokratisasi fine-tuning LLM.

Contoh

Tanpa QLoRA, fine-tuning Llama-2 70B butuh 8 GPU A100 (Sewa 1M/bulan). Dengan QLoRA, bisa pakai 2 GPU A100 atau bahkan gaming GPU.

Catatan

Metode yang sangat populer di komunitas open-source AI saat ini.

Bangun Karier Sebagai AI Engineer dalam 8 Minggu!

Info Detail
Apa Itu QLoRA (Quantized LoRA)? Definisi & Penjelasan | Kamus REA Ruangguru