El texto, las imágenes, el audio y el vídeo rara vez aparecen solos. El aprendizaje multimodal entrena los modelos con más de un tipo de datos a la vez, lo que les permite conectar un pie de foto con una fotografía o un comando de voz con una escena visual.
La alineación es la parte difícil. El modelo debe aprender una representación compartida donde la imagen de un perro y la palabra "perro" se sitúen cerca una de la otra. Los objetivos contrastivos como CLIP agrupan los pares coincidentes y separan los que no coinciden.
Tareas multimodales comunes
- Subtítulos de imágenes
- Respuesta a preguntas visuales
- Generación de texto a imagen
- Conversión de voz a texto con contexto visual
- Comprensión de vídeo
La recopilación de datos es costosa. Los conjuntos de datos emparejados son más escasos que los de una sola modalidad. Los pares de imágenes y texto obtenidos mediante web scraping son útiles, pero conllevan ruido y sesgos. La creación de un sistema multimodal robusto suele requerir una curación sustancial.
Comments
No comments yet. Be the first to share a thought.
Leave a comment