Text, obrázky, zvuk a video se zřídka objevují samostatně. Multimodální učení trénuje modely na více než jednom typu dat najednou, což jim umožňuje propojit popisek s fotografií nebo mluvený příkaz s vizuální scénou.
Zarovnání je nejtěžší část. Model se musí naučit sdílenou reprezentaci, kde se obrázek psa a slovo pes nacházejí blízko sebe. Kontrastní cíle, jako je CLIP, shodná dvojice spojují a neshodná od sebe oddělují.
Běžné multimodální úkoly
- Popisky obrázků
- Vizuální odpovědi na otázky
- Generování textu do obrázku
- Převod řeči na text s vizuálním kontextem
- Porozumění videu
Sběr dat je drahý. Párové datové sady jsou vzácnější než datové sady s jednou modalitou. Páry obrázků a textů získané z webu jsou užitečné, ale nesou šum a zkreslení. Vytvoření robustního multimodálního systému často vyžaduje důkladnou kuracii.
Comments
No comments yet. Be the first to share a thought.
Leave a comment