Générer une image, c'est débruiter le principe des modèles de diffusion (DALL·E, Midjourney, Stable Diffusion, Imagen)

À l'entraînement, on prend des millions d'images, on leur ajoute du bruit par étapes, et on apprend à un réseau à retirer un peu de bruit à chaque étape, guidé par la légende de l'image. À la génération, on part d'un bruit pur et on applique le réseau quelques dizaines de fois : une image « plausible selon la légende » émerge.

Ici la démonstration triche : l'image finale existe déjà (générée par un modèle d'image sur un prompt que vous verrez à la diapositive suivante) ; nous mélangeons simplement bruit et image selon le curseur. Le vrai modèle, lui, n'a jamais vu l'image finale : il la fabrique, ce qui explique les doigts en trop et les textes illisibles, et le fait qu'aucune de ces images n'est une mesure.