Wystarczy wprowadzić do autokodera wariacyjnego tysiące zdjęć twarzy, a nauczy się on skompresowanej mapy wyglądu twarzy, a następnie wygeneruje nowe, które nigdy nie istniały. Model ten należy do rodziny modeli generatywnych, a jego cechą wyróżniającą jest probabilistyczne odchylenie od standardowego autokodera.
Standardowy autokoder kompresuje dane wejściowe do stałego wektora i rekonstruuje go. Zamiast tego VAE koduje każde dane wejściowe jako rozkład, zazwyczaj średnią i wariancję, a następnie pobiera próbki z tego rozkładu przed dekodowaniem. Ta wymuszona losowość wygładza przestrzeń utajoną, dzięki czemu pobliskie punkty dekodują się do podobnych wyników, co sprawia, że interpolacja i próbkowanie mają sens.
Kluczowe składniki
- Sieć koderów, która generuje parametry rozkładu ukrytego
- Krok próbkowania wykorzystujący sztuczkę ponownej parametryzacji w celu utrzymania płynności gradientów
- Sieć dekoderów rekonstruująca dane wejściowe z próbkowanego wektora utajonego
- Błąd rekonstrukcji łączący straty z terminem dywergencji KL, który normalizuje przestrzeń utajoną
Sieci VAE generują bardziej rozmyte obrazy niż sieci GAN, ale ich przestrzenie ukryte są bardziej ustrukturyzowane i łatwiejsze w nawigacji. Ten kompromis sprawia, że są one popularne w odkrywaniu leków, wykrywaniu anomalii i wszędzie tam, gdzie płynna, interpretowalna reprezentacja jest ważniejsza niż idealna ostrość pikseli.
Comments
No comments yet. Be the first to share a thought.
Leave a comment