Tipo de modelo generativo que aprende a crear datos (típicamente imágenes) partiendo de ruido aleatorio y refinándolo progresivamente en pasos sucesivos hasta obtener una salida coherente con el prompt de entrada.
En GENAI-L y AIF-C01 (Dominio 1) se menciona como arquitectura detrás de los modelos de generación de imágenes (como Imagen de Google o Stable Diffusion), en contraste con la arquitectura Transformer usada por los LLMs de texto.