Empieza por la tarea y luego elige el modelo
Las comparativas de modelos de imagen suelen ordenarlos en una única escala imaginaria de calidad. Los profesionales del marketing no trabajan con esa escala. Una tienda de cosmética necesita una foto de producto limpia el lunes, un banner de rebajas con un titular legible el martes y una imagen de ambiente para un lanzamiento el viernes. Cada uno de esos días gana un modelo distinto.
Esta guía está organizada según el trabajo que necesitas hacer. Cubre Midjourney v7, FLUX.2, Ideogram 4, Imagen 4, Adobe Firefly y GPT Image, y señala dónde los datos de base son menos seguros. Los nombres de los modelos, las versiones y los precios cambian con frecuencia, así que toma los detalles como una foto de mediados de 2026 y consulta a cada proveedor antes de comprometer un presupuesto.
Fotos de producto fotorrealistas
Las imágenes de producto son las que menos margen de error admiten. Una etiqueta que se dobla, un tapón con las proporciones equivocadas o una sombra que apunta hacia donde no debe hacen que una tienda parezca descuidada. Hay dos modelos que suelen ser el punto de partida.
FLUX.2 para un realismo controlado
FLUX.2 [pro], de Black Forest Labs, presentado en noviembre de 2025, es la opción más completa para trabajo de producto. Genera resultados fotorrealistas de hasta 4 megapíxeles, admite hasta 10 imágenes de referencia para que le muestres tu envase real desde varios ángulos y reproduce texto legible con bastante fiabilidad. La versión pro costaba aproximadamente 0,07 euros por imagen en el momento de escribir esto, así que un lote de 50 fotogramas de prueba es una partida pequeña. Existen variantes de pesos abiertos ([dev] y [klein]) para los equipos que quieran alojarlo por su cuenta.
Imagen 4 para un aspecto fotográfico natural
Imagen 4, de Google, suele describirse como el modelo con el aspecto fotográfico más natural, con piel, tejidos y luz diurna que parecen de cámara y no de un render. La confianza en este dato es media: la afirmación sale de comparativas y no de una prueba de rendimiento publicada, así que haz tu propia comparación lado a lado con tu producto antes de fiarte.
Con cualquiera de los dos, la imagen de referencia hace la mayor parte del trabajo. Un prompt por sí solo se inventará un frasco. Un prompt junto con tres fotos de tu frasco real se acercará mucho más. Haz esas referencias sobre una superficie lisa con luz uniforme, con la etiqueta de cara a la cámara en al menos una de ellas, para que el modelo tenga una descripción limpia de lo que no debe cambiar.
Anuncios que necesitan palabras dentro de la imagen
Si el titular, el precio o la llamada a la acción tienen que ir dentro de la imagen, la representación del texto decide la lista corta. Ideogram 4 es el modelo al que se refiere la mayoría cuando dice que un modelo de imagen sabe escribir. Lidera en textos de anuncios, titulares, llamadas a la acción y gráficos para redes. Su liderazgo en texto está bien asentado, aunque conviene confirmar en la web del proveedor cómo se nombra exactamente la versión.
FLUX.2 es la segunda opción y la mejor cuando la imagen necesita además realismo fotográfico. GPT Image, de OpenAI, es fuerte a la hora de seguir instrucciones largas y complicadas, como una composición con cuatro elementos de texto distintos en posiciones indicadas. La nomenclatura de versiones de GPT Image ha cambiado, así que comprueba qué se ofrece ahora.
Midjourney v7 es el que conviene evitar para esta tarea. Es débil con el texto dentro de la imagen, e incluso un titular corto suele necesitar corrección manual.
Un hábito práctico: mantén el texto de la imagen por debajo de unas seis palabras, escríbelo entre comillas en el prompt y revisa igualmente cada carácter antes de publicar. Hasta los mejores modelos cambian una letra de vez en cuando. Para textos más largos, genera la imagen sin texto y añade las palabras después como una capa editable. Así además la traducción es trivial, porque la imagen no cambia nunca.
Ambiente editorial y estilo de campaña
Midjourney v7 es la elección cuando el objetivo es la atmósfera y no la exactitud. Lanzado en abril de 2025 y modelo por defecto desde junio de ese año, tiene la estética artística y editorial más potente del grupo actual. El Draft Mode genera aproximadamente diez veces más rápido, lo que viene bien para explorar un moodboard. Omni Reference ayuda a mantener la coherencia de un personaje u objeto entre imágenes, y el modelo ha incorporado la conversión de imagen a vídeo para clips de 5 a 21 segundos.
Úsalo para conceptos de campaña, imágenes principales, escenas de estilo de vida y todo aquello en que el espectador deba sentir algo antes de leer nada. No lo uses para la exactitud de un envase ni para composiciones con mucho texto.
Seguridad comercial y licencias
Algunas marcas, sobre todo las que pasan por revisión jurídica o tienen clientes corporativos, se preocupan más por el origen de los datos de entrenamiento de un modelo que por los últimos puntos de realismo. Adobe Firefly es el que tiene mejor reputación en este terreno: está entrenado con material con licencia y de dominio público y forma parte de Creative Cloud. FLUX.2 también declara datos de entrenamiento con licencia.
La seguridad de los datos de entrenamiento es solo una capa. Tus propios derechos siguen importando: las marcas registradas que aparecen en tu prompt, las personas cuyo parecido tomas como referencia y las condiciones del plan que pagas. Lee las condiciones de uso comercial del nivel que uses y anota qué modelo produjo cada recurso. Nuestro artículo sobre content credentials y marketing con IA trata este registro con más detalle.
Empareja cada tarea con su modelo
Úsalo como primera criba y deja que una pequeña prueba tenga la última palabra.
- Producto sobre fondo limpio o ambientado: FLUX.2 con tu envase como referencia. Segunda opción: Imagen 4.
- Titular, precio o llamada a la acción dentro de la imagen: Ideogram 4. Segunda opción: FLUX.2 o GPT Image.
- Imagen principal de ambiente o concepto de campaña: Midjourney v7.
- Composición compleja de varias partes descrita con palabras: GPT Image.
- Trabajo para clientes que exige tranquilidad en cuanto a licencias: Adobe Firefly.
- Alojamiento propio o volumen sensible al coste: Stable Diffusion 3.x, que ha perdido protagonismo frente a FLUX.2 pero sigue en uso.
Nano Banana Pro, de Google, conviene conocerlo para otra tarea: la edición iterativa de una imagen existente manteniendo la identidad. Su marca y su disponibilidad siguen cambiando, así que verifícalo antes de planificar en torno a él.
Un prompt de ejemplo para una foto de producto
Esta es la estructura que funciona en la mayoría de los modelos fotorrealistas. Nombra el sujeto, la superficie, la luz, la cámara y las exclusiones, en ese orden.
Fotografía de estudio del frasco de sérum de cristal esmerilado con dosificador plateado adjunto, centrado sobre un bloque de travertino claro. Luz suave de ventana desde la izquierda, sombra tenue hacia la derecha, una sola ramita de eucalipto abajo a la derecha. Objetivo de 85 mm, poca profundidad de campo, fondo neutro color crema. Mantén el texto de la etiqueta y las proporciones idénticos a la referencia. Sin manos, sin frascos adicionales, sin texto añadido.
Fíjate en lo que falta: adjetivos como impresionante o ultrarrealista. Las palabras concretas de cámara y de luz sirven más que las palabras de elogio. Si el primer resultado se aleja de tu envase, añade una cuarta foto de referencia en lugar de alargar el prompt.
Una prueba que lleva una tarde
Imagina una pequeña tienda de velas, Ember and Oak, que quiere renovar sus fotos de producto y tiene unos 28 euros de presupuesto para probar. La dueña elige tres finalistas de la lista anterior, usa los mismos cinco prompts y las mismas tres fotos de referencia en cada uno y genera cuatro variaciones por prompt. Son 60 imágenes.
Después puntúa cada imagen con cuatro preguntas: ¿la etiqueta es correcta?, ¿la llama y el cristal resultan creíbles?, ¿la iluminación encaja con su feed actual? y ¿la publicaría sin editarla? El modelo con más síes se convierte en su opción por defecto para el trabajo de producto. Otro modelo puede seguir ocupándose de los banners y las piezas de ambiente. Nada de esto exige que haya un único ganador.
Si prefieres probar dentro de un espacio de trabajo pensado para ello, el generador de imágenes con IA de SEENALYZE AI reúne en un solo sitio la generación, las capas y los ajustes de marca, y la guía de edición de imágenes fiel a la marca explica cómo arreglar los resultados que llegan casi bien.
Preguntas frecuentes
¿Qué generador de imágenes con IA es mejor para fotos de producto?
FLUX.2 es una buena opción por defecto por su fotorrealismo y por admitir hasta 10 imágenes de referencia. Imagen 4 es una alternativa creíble para un aspecto natural. Prueba los dos con tu propio producto.
¿Qué modelo maneja mejor el texto dentro de las imágenes?
Ideogram 4 lidera en titulares, llamadas a la acción y gráficos para redes. FLUX.2 y GPT Image son segundas opciones aceptables. Revisa siempre el resultado.
¿Puedo usar imágenes de IA con fines comerciales?
Normalmente sí, pero las condiciones dependen del modelo y del plan. Adobe Firefly y FLUX.2 destacan el uso de datos de entrenamiento con licencia. Lee las condiciones vigentes y guarda un registro de cómo se hizo cada recurso.
¿Necesito más de un modelo?
La mayoría de los equipos acaban con dos: uno para el trabajo realista de producto y otro para las piezas con mucho texto o de ambiente. Elegir según la tarea evita obligar a un solo modelo a hacerlo todo.
Prueba los modelos de imagen con tu propio producto
Genera fotos de producto e imágenes de anuncios fieles a tu marca y refínalas con capas y ediciones por zonas en un mismo espacio de trabajo.




