Το κείμενο, οι εικόνες, ο ήχος και το βίντεο σπάνια εμφανίζονται μόνα τους. Η πολυτροπική μάθηση εκπαιδεύει μοντέλα σε περισσότερους από έναν τύπους δεδομένων ταυτόχρονα, επιτρέποντάς τους να συνδέσουν μια λεζάντα με μια φωτογραφία ή μια φωνητική εντολή με μια οπτική σκηνή.
Η ευθυγράμμιση είναι το δύσκολο κομμάτι. Το μοντέλο πρέπει να μάθει μια κοινή αναπαράσταση όπου μια εικόνα ενός σκύλου και η λέξη σκύλος βρίσκονται κοντά η μία στην άλλη. Αντιπαραθετικοί στόχοι όπως το CLIP ενώνουν τα ζεύγη που ταιριάζουν και απομακρύνουν τα αταίριαστα.
Κοινές πολυτροπικές εργασίες
- Λεζάντες εικόνας
- Οπτική απάντηση ερωτήσεων
- Δημιουργία κειμένου σε εικόνα
- Μετατροπή ομιλίας σε κείμενο με οπτικό περιεχόμενο
- Κατανόηση βίντεο
Η συλλογή δεδομένων είναι δαπανηρή. Τα ζευγαρωμένα σύνολα δεδομένων είναι πιο σπάνια από τα μονοτροπικά. Τα ζεύγη εικόνας-κειμένου που συλλέγονται από τον ιστό βοηθούν, αλλά φέρουν θόρυβο και μεροληψία. Η οικοδόμηση ενός ισχυρού πολυτροπικού συστήματος συχνά απαιτεί σημαντική επιμέλεια.
Comments
No comments yet. Be the first to share a thought.
Leave a comment