Ødelæg et billede med støj, og lær derefter at vende processen om. Diffusionsmodeller trænes ved gradvist at tilføje støj til data og derefter lære at fjerne støj trin for trin. Når de er trænet, kan de starte fra ren støj og generere nye prøver, der ligner træningsfordelingen.
Denne metode driver mange af nutidens billedgeneratorer. Kvaliteten er høj, og træningsmålet er stabilt sammenlignet med generative, modstridende netværk, som kan lide af modekollaps og ustabil dynamik.
Nøglefaser
- Fremadrettet proces, tilføjer støj over mange trin
- Omvendt proces, læring af støjreduktion
- Sampling, generering fra tilfældig støj
- Konditionering, vejledning af output med tekst eller andet input
Prisen er hastigheden. Generering af et enkelt billede kan kræve snesevis eller hundredvis af netværksgennemgange. Destillation og hurtigere samplere reducerer antallet af trin, men diffusion er fortsat mere beregningsintensiv end nogle alternativer.
Comments
No comments yet. Be the first to share a thought.
Leave a comment