EN - FR - DE - ES - IT - PT -

LexiconDream

🎭 マルチモーダル学習

テキストや画像など、複数の種類のデータから学習し、統合します。

マルチモーダル学習

テキスト、画像、音声、動画は、単独で表示されることはほとんどありません。マルチモーダル学習では、複数の種類のデータを同時にモデル化することで、キャプションを写真に、音声コマンドを視覚的なシーンに関連付けることができます。

位置合わせが難しい部分です。モデルは、犬の画像と「犬」という単語が互いに近い位置にあるような共通の表現を学習する必要があります。CLIPのような対照的な目的関数は、一致するペアを近づけ、一致しないペアを遠ざけます。

一般的なマルチモーダルタスク

データ収集は費用がかかる。ペアデータセットは、単一モダリティのデータセットよりも希少である。ウェブスクレイピングによる画像とテキストのペアは役立つが、ノイズやバイアスが含まれる。堅牢なマルチモーダルシステムを構築するには、多くの場合、相当なキュレーションが必要となる。

Comments

No comments yet. Be the first to share a thought.

Leave a comment