Off-Policy vs On-Policy

Konsep dalam Reinforcement Learning. On-Policy: Agen belajar nilai dari tindakan yang diambil berdasarkan kebijakan saat ini. Off-Policy: Agen bisa belajar dari data historis atau data yang dihasilkan oleh kebijakan lain (eksplorasi).

Konteks Penggunaan

Q-Learning (Off-Policy) vs SARSA (On-Policy).

Contoh

On-Policy ibarat belajar naik sepeda sambil nyetir sendiri. Off-Policy ibarat belajar naik sepeda dengan menonton video orang lain naik sepeda.

Catatan

Off-policy biasanya lebih efisien sampel data.

Bangun Karier Sebagai AI Engineer dalam 8 Minggu!

Info Detail