Metin, resim, ses ve video nadiren tek başına görünür. Çok modlu öğrenme, modelleri aynı anda birden fazla veri türü üzerinde eğiterek, bir alt yazıyı bir fotoğrafa veya sözlü bir komutu görsel bir sahneye bağlamalarına olanak tanır.
Hizalama en zor kısım. Model, bir köpek resminin ve "köpek" kelimesinin birbirine yakın yerleştiği ortak bir temsili öğrenmelidir. CLIP gibi karşılaştırmalı hedefler, eşleşen çiftleri bir araya getirir ve eşleşmeyenleri birbirinden uzaklaştırır.
Ortak çok modlu görevler
- Resim alt yazısı
- Görsel soru cevaplama
- Metinden görüntü oluşturma
- Görsel bağlamlı konuşmadan metne dönüştürme
- Video anlama
Veri toplama maliyetlidir. Çift veri kümeleri, tek veri kümelerine göre daha azdır. Web'den elde edilen görüntü-metin çiftleri yardımcı olur, ancak gürültü ve önyargı içerirler. Sağlam bir çok modlu sistem oluşturmak genellikle önemli ölçüde düzenleme gerektirir.
Comments
No comments yet. Be the first to share a thought.
Leave a comment