Zniszcz obraz z szumem, a następnie naucz się odwracać ten proces. Modele dyfuzyjne trenują poprzez stopniowe dodawanie szumu do danych, a następnie uczą się krok po kroku odszumiać. Po wytrenowaniu mogą zacząć od czystego szumu i generować nowe próbki, które wyglądają jak rozkład treningowy.
To podejście napędza wiele współczesnych generatorów obrazów. Jakość jest wysoka, a cel treningu stabilny w porównaniu z generatywnymi sieciami adwersarnymi, które mogą być podatne na załamanie modów i niestabilną dynamikę.
Etapy kluczowe
- Proces do przodu, dodawanie szumu w wielu krokach
- Proces odwrotny, nauka usuwania szumów
- Próbkowanie, generowanie z losowego szumu
- Kondycjonowanie, kierowanie wyjściem za pomocą tekstu lub innego wejścia
Kosztem jest szybkość. Wygenerowanie pojedynczego obrazu może wymagać dziesiątek, a nawet setek przejść sieciowych. Destylacja i szybsze samplery zmniejszają liczbę kroków, ale dyfuzja nadal wymaga większych mocy obliczeniowych niż niektóre alternatywy.
Comments
No comments yet. Be the first to share a thought.
Leave a comment