Détruisez une image avec du bruit, puis apprenez à inverser le processus. Les modèles de diffusion s'entraînent en ajoutant progressivement du bruit aux données, puis en apprenant à les débruiter étape par étape. Une fois entraînés, ils peuvent partir d'un bruit pur et générer de nouveaux échantillons similaires à la distribution d'entraînement.
Cette approche est à la base de nombreux générateurs d'images actuels. La qualité est élevée et l'objectif d'apprentissage est stable, contrairement aux réseaux antagonistes génératifs qui peuvent souffrir d'effondrement de mode et d'une dynamique instable.
Étapes clés
- Processus direct, ajoutant du bruit en plusieurs étapes
- Processus inverse, apprentissage du débruitage
- Échantillonnage, génération à partir de bruit aléatoire
- Conditionnement, guidage de la sortie avec du texte ou d'autres entrées
Le coût est la vitesse. La génération d'une seule image peut nécessiter des dizaines, voire des centaines, de passages réseau. La distillation et des échantillonneurs plus rapides réduisent le nombre d'étapes, mais la diffusion reste plus gourmande en ressources de calcul que certaines alternatives.
Comments
No comments yet. Be the first to share a thought.
Leave a comment