Textul, imaginile, fișierele audio și video apar rareori singure. Învățarea multimodală antrenează modelele pe mai multe tipuri de date simultan, permițându-le să conecteze o legendă la o fotografie sau o comandă rostită la o scenă vizuală.
Alinierea este partea dificilă. Modelul trebuie să învețe o reprezentare comună în care o imagine a unui câine și cuvântul câine aterizează una lângă alta. Obiectivele contrastive, cum ar fi CLIP, apropie perechile potrivite și le îndepărtează pe cele nepotrivite.
Sarcini multimodale comune
- Legendă de imagine
- Răspunsuri vizuale la întrebări
- Generarea textului în imagine
- Vorbire în text cu context vizual
- Înțelegerea videoclipurilor
Colectarea datelor este costisitoare. Seturile de date pereche sunt mai rare decât cele cu o singură modalitate. Perechile imagine-text extrase de pe web ajută, dar conțin zgomot și erori. Construirea unui sistem multimodal robust necesită adesea o curățare substanțială.
Comments
No comments yet. Be the first to share a thought.
Leave a comment