Q-Learning
Q-Learning adalah algoritma Reinforcement Learning "model-free" yang bertujuan untuk mempelajari kebijakan optimal (tindakan apa yang harus diambil) dengan memperkirakan nilai "Q" (Quality) untuk setiap pasangan keadaan-tindakan. Agen belajar melalui trial and error.
Konteks Penggunaan
Mengajarkan robot berjalan atau main game Pacman.
Contoh
Agen mengeksplorasi labirin. Jika belok kiri dapat keju (+10 poin), nilai Q(Kiri) naik. Jika belok kanan kena setrum (-10 poin), nilai Q(Kanan) turun. Lama-lama agen tahu belok kiri lebih baik.
Catatan
Basis dari Deep Q-Network (DQN) yang dibuat DeepMind.
