Memahami Model Bahasa Multimodal Besar: Masa Depan AI

Memahami Model Bahasa Multimodal Besar: Masa Depan AI

Pendahuluan

Selama ini, sistem AI adalah spesialis yang hanya terbatas pada satu indera. Misalnya, model visi komputer dapat mengidentifikasi objek dalam foto, tetapi tidak bisa mendeskripsikan apa yang mereka lihat. Sistem pemrosesan bahasa alami dapat menulis prosa yang fasih, tetapi tetap buta terhadap gambar. Model pemrosesan audio dapat mentranskripsi pidato, tetapi tidak memiliki konteks visual. Fragmentasi ini merepresentasikan perpisahan fundamental dari cara manusia mengalami dunia. Kognisi manusia secara inheren multimodal. Kami tidak hanya membaca teks atau hanya melihat gambar. Kami mengamati ekspresi wajah sambil mendengarkan nada suara. Kami menghubungkan bentuk visual anjing dengan suara gonggongan dan kata tertulis ‘anjing’. Untuk menciptakan AI yang benar-benar beroperasi di dunia nyata, saluran sensorik terpisah ini perlu bertemu. Model Bahasa Besar Multimodal mewakili pertemuan ini.