Если подать на вход вариационного автокодировщика тысячи фотографий лиц, он научится создавать сжатую карту того, как выглядят лица, а затем сгенерирует новые, которых никогда не существовало. Эта модель относится к семейству генеративных моделей, и её отличительной особенностью является вероятностный подход к обычному автокодировщику.
Стандартный автокодировщик сжимает входные данные в фиксированный вектор и восстанавливает их. В отличие от него, VAE кодирует каждый входной сигнал как распределение, обычно среднее значение и дисперсию, а затем производит выборку из этого распределения перед декодированием. Эта принудительная случайность сглаживает латентное пространство, так что близлежащие точки декодируются в похожие выходные данные, что делает интерполяцию и выборку осмысленными.
Основные ингредиенты
- Сеть кодировщика, которая выдает параметры скрытого распределения.
- Этап выборки с использованием приема репараметризации для обеспечения непрерывности градиентов.
- Сеть декодера, которая восстанавливает входные данные из дискретизированного скрытого вектора.
- Функция потерь, объединяющая ошибку реконструкции с членом дивергенции Кульбака-Лейблера, которая регуляризует скрытое пространство.
VAE-сети создают более размытые изображения, чем GAN-сети, но их латентные пространства более структурированы и в них проще ориентироваться. Этот компромисс делает их популярными в разработке лекарств, обнаружении аномалий и любых задачах, где плавное, интерпретируемое представление важнее, чем идеальная резкость пикселей.
Comments
No comments yet. Be the first to share a thought.
Leave a comment