QLoRA (Quantized LoRA)
QLoRA adalah teknik fine-tuning yang efisien memori yang menggabungkan Quantization (biasanya 4-bit) dengan LoRA (Low-Rank Adaptation). Ini memungkinkan fine-tuning model bahasa besar (65B+ parameter) pada satu GPU consumer (misalnya RTX 3090/4090).
Konteks Penggunaan
Demokratisasi fine-tuning LLM.
Contoh
Tanpa QLoRA, fine-tuning Llama-2 70B butuh 8 GPU A100 (Sewa 1M/bulan). Dengan QLoRA, bisa pakai 2 GPU A100 atau bahkan gaming GPU.
Catatan
Metode yang sangat populer di komunitas open-source AI saat ini.
