変分オートエンコーダーに数千枚の顔写真を入力すると、顔の特徴を圧縮したマップを学習し、これまで存在しなかった新しい顔写真を生成します。このモデルは生成型モデルに属し、その特徴は通常のオートエンコーダーに確率的な要素を加えたものです。
標準的なオートエンコーダーは、入力を固定ベクトルに圧縮して再構築します。一方、VAEは各入力を分布(通常は平均と分散)としてエンコードし、その分布からサンプリングしてからデコードします。この強制的なランダム性によって潜在空間が平滑化され、近接する点が類似した出力にデコードされるため、補間とサンプリングが意味のあるものになります。
主な成分
- 潜在分布のパラメータを出力するエンコーダーネットワーク
- 勾配の流れを維持するために再パラメータ化トリックを使用したサンプリングステップ
- サンプリングされた潜在ベクトルから入力を再構築するデコーダーネットワーク
- 潜在空間を正則化するKLダイバージェンス項と再構成誤差を組み合わせた損失
VAEはGANよりもぼやけた画像を生成しますが、その潜在空間はより構造化されており、ナビゲートが容易です。このトレードオフにより、VAEは創薬、異常検知、そしてピクセル単位の鮮明さよりも滑らかで解釈しやすい表現が重要なあらゆるタスクにおいて人気を博しています。
Comments
No comments yet. Be the first to share a thought.
Leave a comment