Multimodal AI

Multimodal AI adalah jenis kecerdasan buatan yang mampu memproses dan memahami informasi dari berbagai jenis input (modalitas) secara bersamaan, seperti teks, gambar, audio, dan video.

Konteks Penggunaan

GPT-4o (Omni) dan Gemini 1.5 Pro.

Contoh

Anda bisa memotret isi kulkas (Gambar) dan bertanya ke AI "Masakan apa yang bisa saya buat?" (Teks). AI memproses kedua input itu sekaligus.

Catatan

Lebih mendekati cara manusia memandang dunia (melihat + mendengar + membaca).

Bangun Karier Sebagai AI Engineer dalam 8 Minggu!

Info Detail
Apa Itu Multimodal AI? Definisi & Penjelasan | Kamus REA Ruangguru