EN - FR - DE - ES - IT - PT -

LexiconDream

🎭 Aprendizagem multimodal

Aprender a partir de vários tipos de dados, como texto e imagens, e integrá-los.

Aprendizagem multimodal

O texto, as imagens, o áudio e o vídeo raramente aparecem isoladamente. A aprendizagem multimodal treina modelos com mais do que um tipo de dados em simultâneo, permitindo-lhes ligar uma legenda a uma fotografia ou um comando de voz a uma cena visual.

O alinhamento é a parte difícil. O modelo precisa de aprender uma representação partilhada onde a imagem de um cão e a palavra "cão" estão próximas uma da outra. Os objetivos contrastivos como o CLIP aproximam os pares correspondentes e afastam os pares incompatíveis.

Tarefas multimodais comuns

A recolha de dados é cara. Os conjuntos de dados emparelhados são mais raros do que os conjuntos de dados de modalidade única. Os pares de imagem e texto extraídos da web ajudam, mas transportam ruído e viés. Construir um sistema multimodal robusto requer frequentemente uma curadoria substancial.

Comments

No comments yet. Be the first to share a thought.

Leave a comment