Knowledge Distillation
Knowledge Distillation adalah teknik kompresi model di mana model kecil "murid" (Student) dilatih untuk meniru perilaku model besar "guru" (Teacher). Tujuannya adalah membuat model yang ringan dan cepat untuk perangkat mobile, namun tetap pintar mendekati akurasi model raksasa.
Konteks Penggunaan
Memindahkan kecerdasan BERT (110 juta parameter) ke DistilBERT (66 juta parameter) agar bisa jalan di HP.
Contoh
Model Guru memprediksi "Ini Gambar Kucing 90%, Anjing 10%". Model Murid dipaksa belajar output probabilitas itu (Soft Labels), bukan sekadar label "Kucing" (Hard Label).
Catatan
Sangat relevan di era LLM untuk efisiensi.
