Knowledge Distillation

Knowledge Distillation adalah teknik kompresi model di mana model kecil "murid" (Student) dilatih untuk meniru perilaku model besar "guru" (Teacher). Tujuannya adalah membuat model yang ringan dan cepat untuk perangkat mobile, namun tetap pintar mendekati akurasi model raksasa.

Konteks Penggunaan

Memindahkan kecerdasan BERT (110 juta parameter) ke DistilBERT (66 juta parameter) agar bisa jalan di HP.

Contoh

Model Guru memprediksi "Ini Gambar Kucing 90%, Anjing 10%". Model Murid dipaksa belajar output probabilitas itu (Soft Labels), bukan sekadar label "Kucing" (Hard Label).

Catatan

Sangat relevan di era LLM untuk efisiensi.

Bangun Karier Sebagai AI Engineer dalam 8 Minggu!

Info Detail