EN - FR - DE - ES - IT - PT -

LexiconDream

🎭 Multimodal læring

Lære fra og integrere flere typer data som tekst og bilder.

Multimodal læring

Tekst, bilder, lyd og video vises sjelden alene. Multimodal læring trener modeller på mer enn én type data samtidig, slik at de kan koble en bildetekst til et bilde eller en muntlig kommando til en visuell scene.

Justering er den vanskelige delen. Modellen må lære en delt representasjon der et bilde av en hund og ordet hund lander nær hverandre. Kontrasterende mål som CLIP trekker matchende par sammen og skyver uoverensstemmende par fra hverandre.

Vanlige multimodale oppgaver

Datainnsamling er dyrt. Parede datasett er sjeldnere enn datasett med én modalitet. Nettskrapede bilde-tekst-par hjelper, men de bærer med seg støy og skjevheter. Å bygge et robust multimodalt system krever ofte betydelig kuratering.

Comments

No comments yet. Be the first to share a thought.

Leave a comment