Modelos de difusión y GANs: ¿cómo se crea una imagen de la nada?
Entender cómo funcionan las herramientas de inteligencia artificial generativa es clave para dominarlas. Si no comprendemos la lógica detrás de la "magia" que convierte un texto en una imagen, estaremos limitados a probar suerte, sin saber por qué obtenemos ciertos resultados o cómo corregirlos. Esta lección te dará las bases conceptuales para que puedas interactuar con estas plataformas de manera estratégica, anticipando sus comportamientos y aprovechando sus fortalezas.
Modelos de difusión: del ruido a la imagen coherente
Imagina que tienes una foto perfecta y, poco a poco, le empiezas a añadir ruido, como la estática de una televisión vieja. Primero, solo unas motitas, luego más, hasta que la imagen original es irreconocible, convertida en puro ruido aleatorio. Los modelos de difusión hacen justo lo contrario: aprenden a revertir ese proceso.
Aquí te explico el proceso simplificado:
- Entrenamiento (la fase de aprendizaje): A la IA se le muestran millones de imágenes. A cada imagen original se le añade ruido de forma gradual, creando una secuencia de versiones cada vez más ruidosas. La IA aprende a predecir y eliminar ese ruido para volver a la imagen original. Es como si le dijeran: "Si ves esto (ruido + imagen), el ruido que debes quitar es este otro".
- Inferencia (la fase de generación): Cuando tú le das un prompt (una instrucción de texto), la IA no empieza con una imagen. Empieza con un "lienzo" de ruido completamente aleatorio. Luego, usando lo que aprendió en el entrenamiento, comienza a quitar ese ruido de forma iterativa, paso a paso, guiada por tu prompt.
- Refinamiento iterativo: En cada paso, la IA "adivina" qué parte del ruido debe eliminar para acercarse a la imagen descrita en tu prompt. Es un proceso de ensayo y error continuo, donde el ruido se va transformando en formas, colores y texturas, hasta que emerge una imagen reconocible y coherente.
Piensa en un escultor que empieza con un bloque de mármol sin forma. En lugar de añadir material, el escultor quita material, cincelando y puliendo hasta revelar la figura que tiene en mente. Los modelos de difusión "cincelan" el ruido hasta revelar la imagen deseada.
GANs (Generative Adversarial Networks): la batalla por la autenticidad
Antes de que los modelos de difusión dominaran el panorama, las GANs eran las reinas de la generación de imágenes. Aunque hoy son menos comunes para la generación de imágenes desde texto que los modelos de difusión, entender su funcionamiento te da una perspectiva histórica y técnica valiosa.
Una GAN se compone de dos redes neuronales que compiten entre sí:
- El Generador: Su trabajo es crear imágenes a partir de ruido aleatorio. Su objetivo es producir imágenes tan realistas que engañen a la otra red.
- El Discriminador: Su trabajo es distinguir entre imágenes reales (de un dataset de entrenamiento) e imágenes falsas (creadas por el Generador). Es el "detective" que intenta pillar al "falsificador".
Ambas redes se entrenan simultáneamente en un "juego" de suma cero:
1. El Generador crea una imagen.
2. El Discriminador intenta adivinar si esa imagen es real o falsa.
3. Si el Discriminador acierta, el Generador aprende de su error para mejorar su falsificación.
4. Si el Generador engaña al Discriminador, este último aprende a ser más exigente.
Este ciclo de competencia hace que ambas redes mejoren constantemente. El Generador se vuelve experto en crear imágenes indistinguibles de las reales, y el Discriminador se vuelve experto en detectarlas. El resultado final es un Generador capaz de producir imágenes de alta calidad.
Las GANs fueron revolucionarias, pero a menudo eran difíciles de entrenar y podían tener problemas para generar diversidad de imágenes o para mantener la estabilidad del entrenamiento. Los modelos de difusión han superado muchas de estas limitaciones, ofreciendo mayor control y estabilidad en la generación.
Arquitecturas en la práctica: los tres arquetipos de herramienta
Aunque todos los generadores de imagen actuales suelen basarse en la idea de los modelos de difusión (o variantes), cada plataforma tiene su propia "personalidad" y enfoque. Esto se debe a diferencias en su entrenamiento, la arquitectura específica del modelo y cómo interpretan los
prompts.
Aquí te presento una comparación de las herramientas más populares:
| Herramienta |
Tipo de Modelo (base) |
Foco Estilístico |
Fortalezas |
Debilidades Inherentes / Artefactos Comunes |
Control / Accesibilidad |
| Midjourney |
Modelo de Difusión (propietario) |
Altamente artístico, estético, cinematográfico, fantasioso. |
Impresionante calidad artística, composiciones dramáticas, excelente para conceptos abstractos y estilos visuales únicos. |
Menos control sobre detalles finos y fotorrealismo puro. A veces genera manos o anatomías extrañas. Dificultad con texto coherente. |
Interfaz basada en Discord. Control por parámetros de prompt específicos. |
| Stable Diffusion |
Modelo de Difusión (código abierto) |
Versátil, desde fotorrealismo hasta estilos artísticos. |
Gran flexibilidad y personalización (modelos, LoRAs, ControlNet). Control granular sobre la imagen. Puede generar fotorrealismo convincente. |
Requiere más conocimiento técnico para explotar su potencial. Puede ser inconsistente sin control adicional. A menudo necesita prompts más detallados. |
Disponible en línea (sitios web) o para instalar localmente. Alto nivel de control técnico. |
| El generador nativo de un asistente generalista (hoy, Gemini con sus modelos de imagen) |
Modelo multimodal nativo (propietario) |
De propósito general: el estilo lo pone tu prompt, no una estética de la casa. |
Vive dentro del mismo asistente con el que ya conversas, así que el trabajo suele continuar en la misma ventana: pides la imagen y luego pides el ajuste sobre ella. |
Menos control de bajo nivel que en Stable Diffusion y menos "firma" visual reconocible que en Midjourney. Las políticas de contenido del asistente también aplican a las imágenes. |
Chat y API. Los nombres concretos rotan: mira el bloque de estado al final de la lección. |
¿Por qué ocurren ciertos artefactos?
Los "artefactos" son esas imperfecciones o detalles inesperados que a veces aparecen en las imágenes generadas por IA (manos con seis dedos, texto ilegible, objetos extraños). Se deben a la naturaleza de cómo estos modelos aprenden y generan:
*
Aprendizaje estadístico, no conceptual: La IA no "entiende" lo que es una mano o cómo funciona un texto. Simplemente ha visto millones de ejemplos y ha aprendido patrones estadísticos de píxeles. Si en su entrenamiento no hubo suficientes ejemplos de manos perfectas desde todos los ángulos, o si el texto es muy variable, puede "adivinar" mal.
*
Proceso de denoise: Como los modelos de difusión construyen la imagen a partir del ruido, a veces el proceso de "denoise" puede introducir incoherencias, especialmente en detalles pequeños o repetitivos.
*
Sesgos en los datos de entrenamiento: Si los datos con los que se entrenó el modelo tenían sesgos (por ejemplo, más imágenes de personas caucásicas, o ciertos estilos artísticos predominantes), estos sesgos se reflejarán en las imágenes generadas.
Entender esto te ayudará a ajustar tus expectativas y a diseñar
prompts que guíen mejor a la IA, o a saber cuándo una herramienta es más adecuada para un tipo de resultado que para otro.
Ejemplo: Un astronauta en un caballo
Vamos a ver cómo un
prompt simple como "un astronauta en un caballo" es interpretado por un modelo de difusión y qué diferencias podemos esperar en distintas plataformas.
El Prompt: `un astronauta en un caballo`
1. El Proceso de Difusión (simplificado):
*
Paso 1: Ruido puro. La IA comienza con una imagen completamente aleatoria, como la estática de una televisión. No hay formas reconocibles, solo píxeles al azar.
*
Paso 2: Primeras aproximaciones. Guiada por el
prompt, la IA empieza a "denoise" el ruido. En esta etapa, solo veríamos manchas o grandes bloques de color que sugieren la presencia de un objeto grande (el caballo) y una forma más pequeña sobre él (el astronauta). Podrías distinguir una silueta borrosa.
*
Paso 3: Formas y volúmenes. La IA continúa refinando. Las manchas se convierten en formas más definidas. Podemos empezar a ver las patas del caballo, el casco del astronauta, la forma del cuerpo. Los colores empiezan a tener sentido (blanco del traje, marrón del caballo, etc.).
*
Paso 4: Detalles y texturas. El modelo añade capas de detalle: el brillo del casco, las arrugas del traje espacial, la textura del pelaje del caballo, la rienda. La imagen se vuelve nítida y coherente.
*
Paso 5: Resultado final. Una imagen completa de un astronauta montado en un caballo, con un fondo generado que complementa la escena (quizás un paisaje lunar o un campo terrestre, dependiendo de los sesgos del modelo y del entrenamiento).
2. Comparación de Resultados en Plataformas:
*
Midjourney: Probablemente verías una imagen con una composición dramática. El astronauta y el caballo podrían estar en un entorno épico, quizás con una iluminación cinematográfica y un estilo de pintura digital o fantasía. El caballo podría tener una apariencia majestuosa o incluso surrealista. El fotorrealismo no sería el objetivo principal, sino la estética y el impacto visual. Podría haber una ligera distorsión en las proporciones o detalles por el énfasis en el estilo.
*
Stable Diffusion: Aquí, la imagen podría variar enormemente dependiendo del modelo específico que estés usando (hay miles de modelos entrenados por la comunidad). Si usas un modelo fotorrealista, podrías obtener una imagen muy creíble de un astronauta en un caballo, con detalles realistas en el traje y el animal, y un fondo natural. Si usas un modelo artístico, el resultado se inclinará más hacia ese estilo. La clave es la versatilidad y la posibilidad de "guiar" el estilo con tu
prompt o con modelos adicionales.
*
El generador nativo de un asistente generalista: como no arrastra una estética de la casa, tiende a devolver una lectura literal y limpia del
prompt. El astronauta y el caballo saldrían perfectamente identificables; el estilo (foto, cómic, ilustración) será el que pidas explícitamente, y si no pides ninguno, el más neutro que el modelo considere razonable. Su ventaja aparece en el paso siguiente: puedes decirle "quítale el casco" y seguir sobre la misma imagen, en la misma conversación.
Como ves, el mismo
prompt puede dar resultados muy diferentes, no porque la IA sea "aleatoria", sino porque cada modelo tiene un entrenamiento, una arquitectura y unos sesgos estilísticos que lo hacen único.
Errores comunes
Entender la base de estas tecnologías te ayuda a evitar frustraciones y a mejorar tus resultados. Aquí te dejo algunos errores comunes:
- Esperar perfección a la primera: Los generadores de IA son herramientas estadísticas. Rara vez obtendrás la imagen perfecta con tu primer prompt. La generación de imágenes es un proceso iterativo de refinamiento.
- Tratar a la IA como si "entendiera" conceptos: La IA no comprende el mundo como un humano. No sabe lo que es una "mano" o "felicidad" en un sentido conceptual. Solo ha aprendido patrones de píxeles. Por eso, a veces las manos salen mal o las emociones son genéricas. No le pidas a la IA que "piense", sino que "genere patrones".
- Usar prompts demasiado vagos o demasiado complejos: Un prompt muy vago (`un paisaje`) dará resultados genéricos. Uno excesivamente complejo con muchas ideas contradictorias (`un coche volador antiguo futurista con ruedas de madera y motor de plasma`) puede confundir al modelo. Busca el equilibrio y la claridad.
- Ignorar los artefactos: Pensar que los artefactos (dedos extra, texto ilegible, objetos fusionados) son errores del usuario. Son inherentes al funcionamiento de los modelos. Saber que van a aparecer te prepara para iterar, corregir o aceptar esas imperfecciones.
- No experimentar con los estilos de cada plataforma: Cada herramienta tiene su punto fuerte. Usar Midjourney para un fotorrealismo técnico extremo o Stable Diffusion para una fantasía épica sin ajustar el modelo puede llevar a resultados subóptimos. Aprovecha las fortalezas de cada una.
Tu tarea
Ahora que tienes una idea de cómo se crean las imágenes de la nada, es momento de que lo experimentes por ti mismo.
- Elige una herramienta: Selecciona una de las plataformas mencionadas (Midjourney, Stable Diffusion, el generador de imágenes de Gemini o cualquier otra que tengas a mano).
- Define tu prompt: Piensa en una imagen simple que quieras generar. Tu prompt debe tener 5 palabras o menos. Por ejemplo: "perro volando en el espacio", "gato con sombrero elegante", "ciudad futurista de noche".
- Genera tu imagen: Introduce tu prompt en la herramienta elegida y genera la imagen.
- Observa y anota: Mira atentamente la imagen generada. ¿Hay detalles inesperados? ¿Algún artefacto? ¿La composición es la que esperabas? ¿Qué estilo le dio la IA? Anota al menos 3 observaciones sobre las imperfecciones o los detalles sorprendentes que encuentres. Esto te ayudará a entrenar tu ojo y a entender cómo la IA interpreta tus instrucciones.
Estado a agosto de 2026 (actualiza solo este bloque)
Las tres categorías de arriba duran años; los nombres comerciales, meses. A la fecha de esta revisión:
- Imagen: Google concentra su generación de imagen en modelos Gemini nativos, conocidos como "Nano Banana": Nano Banana 2 (
gemini-3.1-flash-image), su variante Lite (gemini-3.1-flash-lite-image) y Nano Banana Pro (gemini-3-pro-image). La marca Imagen quedó deprecada y se apagó el 17 de agosto de 2026: cualquier tutorial que te mande a "Imagen 3" o "Imagen 4" ya no se puede seguir.
- Video: Veo 3.1 y Veo 3.1 Lite siguen vigentes — no existe un "Veo 4" — y desde mayo de 2026 se les suma Gemini Omni Flash, que va de texto o imagen a video. Fuera de Google están Seedance 2.0, Kling 3.0, Runway Gen-4.5 y Luma Ray3. Sora, de OpenAI, cerró su app y su web el 26 de abril de 2026 y apaga su API el 24 de septiembre de 2026.
- Whisk dejó de existir como producto aparte: se fusionó dentro de Flow el 30 de abril de 2026.
Detente en ese último punto. Sora fue durante meses la referencia del video por IA y hoy es una API con fecha de defunción. La destreza que conserva su valor no es la herramienta: es saber describir, iterar y juzgar una imagen. Esa se muda contigo.