Off-Policy vs On-Policy
Konsep dalam Reinforcement Learning. On-Policy: Agen belajar nilai dari tindakan yang diambil berdasarkan kebijakan saat ini. Off-Policy: Agen bisa belajar dari data historis atau data yang dihasilkan oleh kebijakan lain (eksplorasi).
Konteks Penggunaan
Q-Learning (Off-Policy) vs SARSA (On-Policy).
Contoh
On-Policy ibarat belajar naik sepeda sambil nyetir sendiri. Off-Policy ibarat belajar naik sepeda dengan menonton video orang lain naik sepeda.
Catatan
Off-policy biasanya lebih efisien sampel data.
