Mat en variasjonsautokoder med tusenvis av ansiktsfotografier, og den vil lære et komprimert kart over hvordan ansikter ser ut, og deretter generere nye som aldri har eksistert. Modellen tilhører den generative familien, og dens særegne trekk er en probabilistisk vri på den vanlige autokoderen.
En standard autoencoder klemmer inndata inn i en fast vektor og rekonstruerer den. En VAE koder i stedet hver inngang som en fordeling, vanligvis et gjennomsnitt og en varians, og sampler deretter fra den fordelingen før dekoding. Denne tvungne tilfeldigheten glatter ut det latente rommet slik at nærliggende punkter dekoder til lignende utganger, noe som gjør interpolasjon og sampling meningsfull.
Viktige ingredienser
- Et kodernettverk som sender ut parametere for en latent fordeling
- Et samplingstrinn som bruker reparametriseringstrikset for å holde gradientene flytende
- Et dekodernettverk som rekonstruerer inngangen fra en samplet latent vektor
- En tapskombinasjonsrekonstruksjonsfeil med et KL-divergensterm som regulariserer det latente rommet
VAE-er produserer uskarpere bilder enn GAN-er, men deres latente rom er mer strukturerte og enklere å navigere i. Denne ulempen gjør dem populære for legemiddelutvikling, anomalideteksjon og enhver oppgave der en jevn, tolkbar representasjon er viktigere enn pikselperfekt skarphet.
Comments
No comments yet. Be the first to share a thought.
Leave a comment