Text, Bilder, Audio und Video treten selten isoliert auf. Multimodales Lernen trainiert Modelle mit mehr als einem Datentyp gleichzeitig und ermöglicht es ihnen so, eine Bildunterschrift mit einem Foto oder einen gesprochenen Befehl mit einer visuellen Szene zu verknüpfen.
Die Ausrichtung ist der schwierigste Teil. Das Modell muss eine gemeinsame Repräsentation lernen, bei der ein Bild eines Hundes und das Wort „Hund“ nahe beieinander liegen. Kontrastive Lernziele wie CLIP bringen übereinstimmende Paare zusammen und trennen nicht übereinstimmende.
Gemeinsame multimodale Aufgaben
- Bildunterschrift
- Visuelle Fragebeantwortung
- Text-zu-Bild-Generierung
- Sprach-zu-Text-Umwandlung mit visuellem Kontext
- Videoverständnis
Die Datenerhebung ist kostspielig. Datensätze mit Bild-Text-Paaren sind seltener als solche mit nur einer Modalität. Aus dem Internet extrahierte Bild-Text-Paare sind zwar hilfreich, aber oft fehlerhaft und verzerrt. Der Aufbau eines robusten multimodalen Systems erfordert daher häufig eine sorgfältige Datenaufbereitung.
Comments
No comments yet. Be the first to share a thought.
Leave a comment