テキスト、画像、音声、動画は、単独で表示されることはほとんどありません。マルチモーダル学習では、複数の種類のデータを同時にモデル化することで、キャプションを写真に、音声コマンドを視覚的なシーンに関連付けることができます。
位置合わせが難しい部分です。モデルは、犬の画像と「犬」という単語が互いに近い位置にあるような共通の表現を学習する必要があります。CLIPのような対照的な目的関数は、一致するペアを近づけ、一致しないペアを遠ざけます。
一般的なマルチモーダルタスク
- 画像キャプション
- 視覚的な質問応答
- テキストから画像への変換
- 視覚的な文脈を考慮した音声認識
- 動画の理解
データ収集は費用がかかる。ペアデータセットは、単一モダリティのデータセットよりも希少である。ウェブスクレイピングによる画像とテキストのペアは役立つが、ノイズやバイアスが含まれる。堅牢なマルチモーダルシステムを構築するには、多くの場合、相当なキュレーションが必要となる。
Comments
No comments yet. Be the first to share a thought.
Leave a comment