Multimodal AI
Multimodal AI adalah jenis kecerdasan buatan yang mampu memproses dan memahami informasi dari berbagai jenis input (modalitas) secara bersamaan, seperti teks, gambar, audio, dan video.
Konteks Penggunaan
GPT-4o (Omni) dan Gemini 1.5 Pro.
Contoh
Anda bisa memotret isi kulkas (Gambar) dan bertanya ke AI "Masakan apa yang bisa saya buat?" (Teks). AI memproses kedua input itu sekaligus.
Catatan
Lebih mendekati cara manusia memandang dunia (melihat + mendengar + membaca).
