EN - FR - DE - ES - IT - PT -

LexiconDream

🎭 Uczenie multimodalne

Uczenie się i integrowanie różnych typów danych, takich jak tekst i obrazy.

Uczenie multimodalne

Tekst, obrazy, dźwięk i wideo rzadko występują osobno. Uczenie multimodalne trenuje modele na więcej niż jednym typie danych jednocześnie, umożliwiając im powiązanie podpisu ze zdjęciem lub polecenia głosowego ze sceną wizualną.

Najtrudniej jest dopasować. Model musi nauczyć się wspólnej reprezentacji, w której obrazek psa i słowo „pies” znajdują się obok siebie. Kontrastowe cele, takie jak CLIP, łączą ze sobą pasujące pary i rozsuwają te niepasujące.

Typowe zadania multimodalne

Gromadzenie danych jest kosztowne. Zestawy danych sparowanych są rzadsze niż te jednomodalne. Pary obraz-tekst pozyskane z internetu są pomocne, ale niosą ze sobą szum i stronniczość. Zbudowanie solidnego systemu multimodalnego często wymaga znacznej selekcji.

Comments

No comments yet. Be the first to share a thought.

Leave a comment