O texto, as imagens, o áudio e o vídeo raramente aparecem isoladamente. A aprendizagem multimodal treina modelos com mais do que um tipo de dados em simultâneo, permitindo-lhes ligar uma legenda a uma fotografia ou um comando de voz a uma cena visual.
O alinhamento é a parte difícil. O modelo precisa de aprender uma representação partilhada onde a imagem de um cão e a palavra "cão" estão próximas uma da outra. Os objetivos contrastivos como o CLIP aproximam os pares correspondentes e afastam os pares incompatíveis.
Tarefas multimodais comuns
- Legendas de imagens
- Respostas visuais a perguntas
- Geração de texto para imagem
- Conversão de fala em texto com contexto visual
- Compreensão em vídeo
A recolha de dados é cara. Os conjuntos de dados emparelhados são mais raros do que os conjuntos de dados de modalidade única. Os pares de imagem e texto extraídos da web ajudam, mas transportam ruído e viés. Construir um sistema multimodal robusto requer frequentemente uma curadoria substancial.
Comments
No comments yet. Be the first to share a thought.
Leave a comment