Tekst, obrazy, dźwięk i wideo rzadko występują osobno. Uczenie multimodalne trenuje modele na więcej niż jednym typie danych jednocześnie, umożliwiając im powiązanie podpisu ze zdjęciem lub polecenia głosowego ze sceną wizualną.
Najtrudniej jest dopasować. Model musi nauczyć się wspólnej reprezentacji, w której obrazek psa i słowo „pies” znajdują się obok siebie. Kontrastowe cele, takie jak CLIP, łączą ze sobą pasujące pary i rozsuwają te niepasujące.
Typowe zadania multimodalne
- Podpisy do obrazów
- Wizualne odpowiadanie na pytania
- Generowanie tekstu na obraz
- Mowa na tekst z kontekstem wizualnym
- Zrozumienie wideo
Gromadzenie danych jest kosztowne. Zestawy danych sparowanych są rzadsze niż te jednomodalne. Pary obraz-tekst pozyskane z internetu są pomocne, ale niosą ze sobą szum i stronniczość. Zbudowanie solidnego systemu multimodalnego często wymaga znacznej selekcji.
Comments
No comments yet. Be the first to share a thought.
Leave a comment