Tekst, bilder, lyd og video vises sjelden alene. Multimodal læring trener modeller på mer enn én type data samtidig, slik at de kan koble en bildetekst til et bilde eller en muntlig kommando til en visuell scene.
Justering er den vanskelige delen. Modellen må lære en delt representasjon der et bilde av en hund og ordet hund lander nær hverandre. Kontrasterende mål som CLIP trekker matchende par sammen og skyver uoverensstemmende par fra hverandre.
Vanlige multimodale oppgaver
- Bildeteksting
- Visuell spørsmålssvar
- Tekst-til-bilde-generering
- Tale-til-tekst med visuell kontekst
- Videoforståelse
Datainnsamling er dyrt. Parede datasett er sjeldnere enn datasett med én modalitet. Nettskrapede bilde-tekst-par hjelper, men de bærer med seg støy og skjevheter. Å bygge et robust multimodalt system krever ofte betydelig kuratering.
Comments
No comments yet. Be the first to share a thought.
Leave a comment