¿Cómo redactar los prompts para GPT Image 2.5? Guía de generación estructurada de imágenes y edición precisa con PixPix

El prompt de GPT Image 2.5 no necesita acumular palabras clave misteriosas. Lo que realmente influye en el resultado es si logras plasmar el propósito, el sujeto, la composición, la iluminación, los materiales y las restricciones en una tarea visual clara, y durante la edición especificar con precisión “qué modificar y qué mantener obligatoriamente”.
Este artículo toma como punto de partida el flujo de trabajo actualmente publicado de PixPix para GPT Image 2.5 y utiliza un caso original de proyector portátil para demostrar el método completo, desde requisitos vagos hasta prompts estructurados, texto preciso, múltiples imágenes de referencia y ediciones con un solo parámetro. Los ejemplos y prompts presentados en este texto son contenidos didácticos originales; no se reutilizan los casos de tazas de café ni de figuras tomados de artículos de referencia.
Conclusión rápida: primero redacta la escena, luego añade las restricciones.
Un prompt de GPT Image 2.5 fácil de mantener puede organizarse según el siguiente orden:
Propósito → Sujeto → Escena → Composición → Iluminación y materiales → Texto preciso → Elementos a conservar → Elementos a excluir

Nota: los ocho bloques dividen el prompt en decisiones que pueden revisarse por separado; al realizar la edición, primero se debe indicar el único elemento a cambiar y luego repetir lo que debe permanecer inalterado.
No es necesario completar siempre los ocho apartados. Para generar imágenes únicamente a partir de texto, basta comenzar con el propósito, el sujeto, la composición y el estilo visual; en cambio, al editar a partir de imágenes de referencia, conviene colocar primero los elementos a modificar y los que deben conservarse.
Si solo deseas recordar cinco principios, puedes tener en cuenta los siguientes:
Primero indica al modelo dónde se utilizará la imagen y luego describe la escena;
Reemplaza términos como “sofisticado, cálido, con aspecto cinematográfico” por elementos visibles como la luz, los materiales y el espacio;
Las palabras dentro de la imagen deben encerrarse entre comillas y especificar su posición, el tipo de fuente y cualquier otro texto que esté prohibido;
Cuando se utilizan varias imágenes de referencia, asigna a cada una un papel específico; no basta con decir simplemente “referencia a estas imágenes”;
Al editar, modifica solo un parámetro principal a la vez y repite aquello que debe permanecer inalterado.
Cómo elegir entre los dos modelos de GPT Image 2.5
Actualmente, OpenAI divide GPT Image 2.5 en Flare y Sunburst. Ambos permiten la generación y edición de imágenes con fondo transparente, pero tienen enfoques distintos.
Modelo | Posicionamiento oficial | Tareas más adecuadas para probar primero |
|---|---|---|
GPT Image 2.5 Flare | Modelo compacto y orientado a la velocidad | Exploración de direcciones, materiales cotidianos, borradores en serie y iteraciones rápidas |
GPT Image 2.5 Sunburst | Modelo básico, enfocado en calidad y control detallado | Composiciones complejas, ediciones precisas, piezas finales importantes y escenas que requieren inspección minuciosa |
Esto no constituye una clasificación fija. Las propias recomendaciones oficiales de OpenAI sugieren comparar la calidad y el tiempo de respuesta en tus propias tareas reales, ya que los resultados dependen del prompt, de las imágenes de referencia, del tamaño de salida y de la configuración de calidad.
En PixPix, se puede desde la página del modelo GPT Image 2.5acceder al área de trabajo: subir una imagen de referencia o describir directamente una nueva escena, redactar los requisitos de creación y, tras generar la obra, realizar una ronda adicional de ajustes focalizados. El formato, la calidad y demás configuraciones opcionales se regirán por la interfaz actual del área de trabajo; no asuma que, al incluir únicamente “4K” en el prompt, la salida cumplirá necesariamente con los requisitos de entrega.
Qué contiene un buen prompt
Uso: primero indica al modelo qué tarea debe realizar la imagen
El mismo producto, cuando se utiliza como banner de portada, en la página de detalles del producto, en la portada de redes sociales o como concepto de embalaje, requiere composiciones distintas.
Por ejemplo, en lugar de simplemente escribir:
Una imagen sofisticada de un proyector portátil.
sería mejor especificar primero:
Visual principal horizontal 16:9 para la pantalla inicial de la página de lanzamiento del nuevo proyector portátil, con un área reservada para el título en la parte superior izquierda de la composición.
El propósito influye en el tamaño del sujeto, el espacio en blanco, la dirección de la mirada y la jerarquía informativa. No se trata de una descripción decorativa, sino de condiciones compositivas.
Sujeto: explica claramente las características identificativas
Si el sujeto debe mantenerse constante en varias imágenes, no basta con decir “el mismo producto”. Debes enumerar específicamente los elementos que definen su identidad.
En este artículo utilizamos el producto original “LumaCube, proyector portátil”:
Cuerpo rectangular con esquinas redondeadas, de color blanco marfil y proporciones casi cuadradas;
En la parte frontal, en la esquina superior izquierda, destaca una lente circular negra;
Alrededor de la parte inferior del cuerpo se extiende una banda de tela azul cobalto;
En la parte superior, en la esquina posterior derecha, hay únicamente un botón naranja coral;
Sin logotipo real de marca ni etiquetas escritas.

Nota: el modelo base del producto mantiene fijos el cuerpo blanco marfil, la lente negra en la esquina superior izquierda, la banda de tela azul cobalto y el botón naranja en la parte posterior derecha; en escenas posteriores solo se modifican la composición, el texto o la iluminación ambiental.
Estas características constituyen los puntos clave de identidad del producto. El fondo puede variar, pero la posición de la lente, la banda de tela y el botón no deben desplazarse libremente.
Composición: indica dónde colocar el sujeto y qué tamaño ocupará
La descripción de la composición debe responder al menos tres preguntas:
¿Desde dónde observa la cámara?
¿Dónde se sitúa el sujeto en la imagen y qué tamaño ocupa?
¿Qué áreas deben quedar en blanco o destinarse a contener texto?
Por ejemplo:
Perspectiva de tres cuartos, ligeramente a la altura del producto; el proyector se ubica en el tercio derecho de la composición, ocupando aproximadamente la mitad de la altura total; en la parte superior izquierda se deja una pared oscura y limpia como zona para el título, mientras que el primer plano de la mesa no tiene un peso excesivo.
“Tercio derecho”, “aproximadamente la mitad de la altura” y “espacio en blanco en la parte superior izquierda” son aspectos fácilmente verificables, mucho más concretos que “composición sofisticada”.
Iluminación, materiales y colores: traduce las emociones en detalles visibles
“Cálido”, “futurista” o “sofisticado” son términos demasiado amplios. Una forma más precisa es señalar la fuente de luz, las texturas de los materiales y las relaciones cromáticas.
Por ejemplo:
La luz natural del atardecer que entra por la gran ventana del lado izquierdo ilumina el cuerpo de color marfil, mientras que en la parte posterior derecha se aprecia una discreta luz de contorno anaranjada; la lente de cristal negro mantiene un reflejo nítido, y la cinta de tela azul cobalto deja ver su fina trama tejida; el fondo está dominado por tonos gris azulado oscuro y madera de nogal cálida, sin presencia de colores fluorescentes.
Cada elemento aquí corresponde a un resultado visual verificable.
Caso original: De una necesidad difusa al diseño visual principal de la página de aterrizaje
Primera versión: Solo sensación, sin condiciones de ejecución
Supongamos que el primer término de búsqueda es:
Crea una imagen publicitaria sofisticada y con estilo cinematográfico para un proyector portátil, colocándola en el salón.
El problema de este término no es que sea demasiado breve, sino que los conceptos “sofisticado” y “estilo cinematográfico” no se han traducido en una representación visual; tampoco se especifican la identidad del producto, la posición de la cámara, el escenario de uso, la composición y los espacios en blanco, ni las restricciones a eliminar.
El modelo podría generar una imagen atractiva, pero resultaría difícil determinar si es adecuada para la página de aterrizaje, y aún más complicado lograr que la segunda imagen mantenga la misma identidad de producto.

Nota: La imagen en sí no es tosca, pero el producto aparece demasiado pequeño, el primer plano y los elementos decorativos llaman más la atención, y además falta espacio para un título claro; esto indica que los términos “sofisticado” y “estilo cinematográfico” aún no constituyen una tarea completa.
Segunda versión: Redactar la tarea visual siguiendo un orden fijo
Se podría reescribir así:
**Uso:** Página principal de aterrizaje del nuevo proyector portátil, formato horizontal 16:9, con espacio reservado para el título en la parte superior izquierda.
**Sujeto:** Proyector portátil LumaCube de diseño original, con cuerpo rectangular de color marfil y bordes redondeados; en la parte frontal, en la esquina superior izquierda, destaca una lente circular negra; rodeando la base, una cinta de tela azul cobalto; en la parte superior trasera derecha, solo una perilla de color naranja coral.
**Escenario:** Un salón moderno y tranquilo, con el producto sobre un mueble bajo de madera de nogal cálida; el fondo está compuesto únicamente por una pared de microcemento y un sofá de respaldo bajo, levemente borroso.
**Composición:** Perspectiva de tres cuartos, mirando directamente al producto; el objeto ocupa aproximadamente la mitad de la altura de la imagen, situándose en el tercio derecho, mientras que en la parte superior izquierda se mantiene un espacio limpio en la pared.
**Iluminación y materiales:** Luz natural vespertina con tonos azulados proveniente de la ventana izquierda; en la parte posterior derecha, una suave luz de contorno anaranjada; el cuerpo presenta una textura mate fina, la lente es de vidrio negro auténtico y la trama de la tela se aprecia claramente.
**Restricciones:** No deben incluirse personas, texto, logos, controles remotos, cables, lentes adicionales, perillas extra ni un segundo proyector; tampoco se modificará la estructura del producto.

Nota: La versión estructurada especifica claramente el propósito, la identidad del producto, la proporción del sujeto, los espacios en blanco, la dirección de la luz y los materiales, lo que facilita la revisión y la edición continua de la imagen.
El valor de este término no radica en su extensión, sino en que cada línea puede modificarse de manera independiente. Si el producto resulta demasiado pequeño, basta con ajustar la línea correspondiente a la composición; si la imagen parece demasiado fría, solo hay que cambiar la línea de iluminación, sin necesidad de reescribir todo el contenido.
Cómo redactar el texto dentro de la imagen
GPT Image 2.5 puede procesar el texto presente en las imágenes, pero “más preciso” no significa que no sea necesario verificarlo. Títulos, precios, fechas, nombres de marcas e información legal deben revisarse palabra por palabra.
Al redactar el texto, es fundamental proporcionar al menos cuatro tipos de información:
Redacción precisa, entre comillas;
Ubicación del texto en la imagen;
Estilo general, grosor y jerarquía tipográfica;
Prohibición expresa de cualquier otro texto.
Por ejemplo, al transformar la imagen principal de la página de aterrizaje en un cartel promocional, se podría añadir:
**Texto:** En la parte superior izquierda solo aparecen dos líneas en chino. El título principal dice: “Esta noche, ve el mundo desde casa”, en letra gruesa sin serifas; el subtítulo reza: “Proyecta tu próximo viaje”, con un tamaño aproximadamente un tercio del del título principal. Ambas líneas están alineadas a la izquierda y presentan un tono blanco cálido. No debe incluirse ningún otro texto, letra, número, logo ni marca de agua.

Nota del pie de foto: El cartel solo conserva el título principal y el subtítulo especificados, estableciendo una jerarquía mediante la posición, el tamaño de la fuente y el color; antes de publicar, aún se debe revisar el texto palabra por palabra.
Si el nombre es poco común, puede explicarse letra por letra o incluso carácter por carácter. Tras generarlo, amplíe la imagen para comprobar la ortografía, la puntuación, los saltos de línea y la repetición de caracteres; para materiales comerciales importantes, se recomienda realizar la maquetación final en herramientas de diseño.
Las varias imágenes de referencia deben asignarse a roles específicos
Cuando se suben simultáneamente imágenes del producto, referencias interiores y referencias cromáticas, es fácil que se produzca confusión si no se indica claramente su propósito: el modelo podría copiar el material del fondo sobre el producto, o incluir en la escena objetos de la referencia cromática.
Una forma más clara de redactar sería:
**Imagen de referencia 1: Identidad del producto.** Se mantienen las proporciones del cuerpo del proyector, la posición del objetivo, la banda de tela azul cobalto y el botón naranja.
**Imagen de referencia 2: Composición espacial.** Solo se toma como referencia la relación espacial entre el aparador, la pared y el sofá; no se reproducen lámparas ni elementos decorativos presentes en la imagen.
**Imagen de referencia 3: Referencia cromática.** Solo se utiliza la combinación de colores azul gris oscuro, madera de nogal cálida y un tono naranja contenido; no se copian los productos mostrados en la imagen.
Se coloca el producto de la imagen de referencia 1 dentro del espacio de la imagen de referencia 2, asegurando que la dirección de la luz natural desde la ventana izquierda coincida con la referencia espacial.

Nota del pie de foto: La primera imagen aporta únicamente la identidad del producto, la segunda se encarga exclusivamente de la composición espacial y la tercera solo aborda la paleta de colores; en la versión final, a la derecha se combinan estas tres funciones, pero sin copiar el material del fondo sobre el producto.
Cada imagen de referencia tiene un único rol principal, lo que facilita la detección posterior de posibles errores.
Edición precisa: primero se indican los cambios, luego se repiten los elementos que se mantienen
Los términos de edición difieren en énfasis de los utilizados en las instrucciones para generación de imágenes. No se debe describir nuevamente toda la imagen completa, sino señalar primero el único elemento que se modificará y luego mantener intactos los aspectos ya correctos.
Plantilla de edición monovariable
Solo cambia:[Un objeto, área o condición que requiere modificación].
Mantén sin cambios:[Identidad del sujeto, composición, cámara, iluminación, sombras, texto, otros objetos].
No añadas:[Elementos que pueden generarse por error].
Por ejemplo, cambiar la sala de estar de la tarde a la mañana:
Solo se cambia la hora exterior y la luz ambiental por una mañana temprano: el cielo exterior pasa a ser de un azul claro, mientras que la luz natural del lado izquierdo resulta más brillante y suave. Se mantienen inalterados el tamaño y la posición del proyector, la estructura del cuerpo, el reflejo del objetivo, la banda de tela azul cobalto, el botón naranja, el ángulo de la cámara, el aparador, el sofá, la posición del título y la sombra de contacto sobre la mesa. No se añaden plantas, lámparas, personas, cables ni un segundo proyector.

Nota del pie de foto: La versión corregida solo transforma la atmósfera azulada vespertina en una luz natural matutina; el producto, el aparador, el sofá, la composición y la posición de la cámara permanecen continuos.
En la siguiente ronda, si se desea eliminar texto, hágalo únicamente eliminando el texto; no reemplace muebles, ajuste la posición del producto ni cambie el clima al mismo tiempo. Abordando una variable principal a la vez, será más fácil determinar si la modificación ha sido exitosa.
Cómo comparar de manera justa Flare y Sunburst
Si debe decidir qué modelo utilizar en PixPix, no envíe una instrucción sencilla para Flare y otra compleja para Sunburst para luego comparar los resultados.
Al menos fije las siguientes condiciones:
La misma instrucción;
El mismo conjunto de imágenes de referencia y el orden de carga;
El mismo formato, configuración de calidad y cantidad de salidas;
El mismo contenido textual;
En la primera ronda no se añaden palabras de reparación específicas para un modelo.
Los resultados pueden registrarse desde cinco dimensiones: coherencia del sujeto, ejecución de la composición, precisión del texto, grado de edición local y número de iteraciones necesarias para obtener un resultado utilizable.
Si Flare ya cumple con los estándares de entrega, es más adecuado para seguir encargándose de exploraciones rápidas y materiales cotidianos; si la tarea requiere inspeccionar de cerca los materiales, una maquetación compleja o mantener estrictamente el contenido original antes de la edición, entonces conviene probar también Sunburst. La conclusión debe basarse en la tarea real que tienes, y no solo en el nombre del modelo.
Errores comunes y sus soluciones
Considerar “avanzado” como un prompt completo
Solución: añadir información sobre la fuente de luz, las superficies de los materiales, la paleta de colores y los espacios en blanco, para que la emoción tenga una base visual clara.
Introducir varios objetivos contradictorios a la vez
Solución: primero definir el propósito único de esta imagen. Si se busca tanto una imagen de producto con fondo blanco como una escena de estilo de vida y una composición tipo póster, generalmente conviene dividirlo en tareas distintas.
Varias imágenes de referencia sin especificar los roles
Solución: describir paso a paso, por cada imagen, la “identidad del producto, la composición espacial, los colores o los materiales”, y señalar qué elementos no deben ser copiados.
Escribir únicamente “mantener lo demás igual” durante la edición
Solución: enumerar claramente la estructura del producto, la identidad de los personajes, la cámara, las sombras, el texto y los objetos circundantes. Las frases genéricas pueden conservarse, pero no deben sustituir a una lista específica.
Creer que aumentar la calidad resolverá requisitos poco claros
Solución: la configuración de calidad no puede reemplazar un prompt claro, una composición bien definida ni restricciones precisas. Primero ajusta el prompt y luego compara las opciones de salida.
Publicar directamente una imagen que contiene texto
Solución: revisar cuidadosamente cada palabra, incluyendo ortografía, números, signos de puntuación, precios y fechas. Cuando se trate de información relacionada con marcas o normativas, utilizar herramientas de maquetación editables para elaborar el diseño final.
Plantillas de prompts reutilizables para GPT Image 2.5
Uso: [ubicación de la imagen, formato y espacio en blanco requerido]
Sujeto: [personaje o producto y sus características identificatorias inalterables]
Escena: [espacio, tiempo, objetos de fondo y relaciones previas y posteriores]
Composición: [ángulo de la cámara, posición del sujeto, proporción del sujeto, profundidad de campo]
Estilo: [fotografía, ilustración, 3D u otro medio específico]
Iluminación y color: [dirección de la fuente de luz, momento del día, color principal y colores excluidos]
Material: [características superficiales como metal, vidrio, tejido, papel, etc.]
Texto preciso: “[contenido que debe aparecer literalmente]”, [ubicación, jerarquía y estilo tipográfico]
Responsabilidades de las imágenes de referencia: [qué corresponde a la Imagen 1, qué a la Imagen 2 y qué a la Imagen 3]
Elementos que deben permanecer inalterados: [partes que deben quedar bloqueadas durante la edición]
Exclusiones: [textos, objetos, estructuras o efectos visuales que no deben aparecer]
Para tareas breves, no es necesario llenar mecánicamente cada apartado. El propósito de la plantilla es ayudarte a identificar decisiones pendientes, no hacer que el prompt sea cada vez más largo.
Preguntas frecuentes
¿GPT Image 2.5 requiere una sintaxis especial o pesos específicos?
No. Tanto OpenAI como los artículos de referencia enfatizan el uso de un lenguaje natural claro, coherente y fácil de mantener. El sujeto, la composición, el estilo y las restricciones son más importantes que apilar símbolos.
¿Las plantillas de Flare y Sunburst son diferentes?
La lógica central es la misma. Primero se comparan con el mismo prompt y las imágenes de referencia, y luego se decide cuál modelo utilizar según la velocidad, la calidad y la precisión de la edición; no conviene ajustar de antemano el nivel de dificultad de la tarea para ninguno de los dos modelos.
¿Se pueden subir varias imágenes de referencia a la vez?
Sí, pero cada imagen debe tener una función clara: especificar cuál corresponde a la identidad del sujeto principal, cuál al escenario y cuál únicamente a la paleta de colores, además de indicar los elementos que no deben mezclarse.
¿“Mantener sin cambios” garantiza que los píxeles sean completamente idénticos?
No. Se trata de una restricción editorial, no de una garantía a nivel de píxel. Tras cada ronda de modificación, es necesario comparar con la versión anterior para verificar si el sujeto principal, el texto, la composición y las sombras han sufrido desplazamientos.
¿Cuál modelo debería utilizarse primero en PixPix?
Para exploraciones cotidianas y variantes rápidas, puede probarse primero Flare; cuando se requieran resultados complejos o un control editorial más estricto, se recomienda Sunburst. La elección final debe basarse en los resultados reales obtenidos con la misma entrada.
Resumen
El núcleo del prompt de GPT Image 2.5 no radica en redactarlo de manera elaborada, sino en desglosar la tarea visual en decisiones verificables: qué debe hacer la imagen, quién es el sujeto principal, cómo se compone la escena, cómo se representan la iluminación y los materiales, qué textos deben ser exactos y qué contenidos no deben modificarse bajo ninguna circunstancia.
En PixPix, se comienza con un prompt básico bien estructurado, se asigna un rol a cada imagen de referencia y luego se corrige gradualmente mediante ediciones univariantes. Cuando sea necesario elegir entre Flare y Sunburst, mantenga consistentes el prompt, las imágenes de referencia y la configuración, y evalúe los resultados según sus propios estándares de entrega.

Herramienta de IA para equipos de e-commerce
Para lanzamientos de productos, publicidad y campañas promocionales, usa IA para generar imágenes de producto, visuales de escena, creatividades publicitarias y videos cortos, haciendo la producción de contenido más eficiente.