EN - FR - DE - ES - IT - PT -

LexiconDream

🎭 Aprendizaje multimodal

Aprender a partir de varios tipos de datos, como texto e imágenes, e integrarlos.

Aprendizaje multimodal

El texto, las imágenes, el audio y el vídeo rara vez aparecen solos. El aprendizaje multimodal entrena los modelos con más de un tipo de datos a la vez, lo que les permite conectar un pie de foto con una fotografía o un comando de voz con una escena visual.

La alineación es la parte difícil. El modelo debe aprender una representación compartida donde la imagen de un perro y la palabra "perro" se sitúen cerca una de la otra. Los objetivos contrastivos como CLIP agrupan los pares coincidentes y separan los que no coinciden.

Tareas multimodales comunes

La recopilación de datos es costosa. Los conjuntos de datos emparejados son más escasos que los de una sola modalidad. Los pares de imágenes y texto obtenidos mediante web scraping son útiles, pero conllevan ruido y sesgos. La creación de un sistema multimodal robusto suele requerir una curación sustancial.

Comments

No comments yet. Be the first to share a thought.

Leave a comment