Tekst, billeder, lyd og video optræder sjældent alene. Multimodal læring træner modeller på mere end én type data ad gangen, hvilket giver dem mulighed for at forbinde en billedtekst til et foto eller en talt kommando til en visuel scene.
Justering er den svære del. Modellen skal lære en fælles repræsentation, hvor et billede af en hund og ordet hund lander tæt på hinanden. Kontrasterende mål som CLIP trækker matchende par sammen og skubber uoverensstemmelser fra hinanden.
Almindelige multimodale opgaver
- Billedtekster
- Besvarelse af visuelt spørgsmål
- Tekst-til-billede-generering
- Tale-til-tekst med visuel kontekst
- Videoforståelse
Dataindsamling er dyrt. Parrede datasæt er sjældnere end datasæt med én modalitet. Web-scraped billed-tekst-par hjælper, men de er støjfyldte og biasfulde. Opbygning af et robust multimodalt system kræver ofte betydelig kuratering.
Comments
No comments yet. Be the first to share a thought.
Leave a comment