GPT Image 2 frente a GPT Image 2.5 Flare para la generación de imágenes
Los resultados varían según la tarea: GPT Image 2.5 Flare destaca en la reiluminación, la composición publicitaria y las escenas centradas en productos, mientras que GPT Image 2 es más potente para gráficos de interfaces estructuradas y la edición de objetos basada en referencias. Los modelos empatan en tipografía, anatomía y contacto, recuento, sustitución de texto y ampliación de imágenes, por lo que la mejor opción depende de tu flujo de trabajo.

Datos comparados
| Característica | GPT Image 2 | GPT Image 2.5 Flare |
|---|---|---|
| Desarrollador | OpenAI | OpenAI |
| Disponibilidad en Banana Pie | Disponible ahora | Disponible ahora |
| Créditos desde | 20 créditos | 25 créditos |
| Resolución máxima | 4K | 4K |
| Imágenes de referencia | Hasta 8 | Hasta 8 |
Caso por caso
El mismo prompt. Dos modelos. Juzga la diferencia entre las imágenes publicadas a continuación.
Materiales e iluminación de producto
Mejor en este caso: GPT Image 2.5 FlareAmbos resultados siguen fielmente el prompt, pero la imagen de la derecha muestra con mayor claridad que el frasco está medio lleno y presenta una iluminación procedente de la esquina superior izquierda más evidente. La leve deformación del tubo interior no contrarresta esas ventajas.
- Se ve exactamente un frasco de perfume rectangular transparente, sin texto, logotipo ni objetos adicionales: empate. Ambas imágenes muestran un único frasco rectangular en posición vertical sobre piedra mojada y desnuda, sin escritura, marcas, plantas ni elementos separados visibles.
- El frasco está visiblemente lleno hasta la mitad con un líquido ámbar: la derecha lo hace mejor. El nivel del líquido de la derecha queda muy cerca del punto medio de la cámara del frasco, mientras que el de la izquierda parece estar algo más de medio lleno.
- La refracción del cristal y el reflejo sobre la piedra negra mojada son físicamente coherentes: la izquierda lo hace mejor. Los bordes del cristal, la transmisión del color ámbar y el reflejo alineado resultan coherentes; la derecha presenta un tubo interior visiblemente curvado y una distorsión óptica más irregular cerca de la base del frasco.
- La iluminación desde la esquina superior izquierda produce brillos coherentes y una sombra de contacto verosímil: la derecha lo hace mejor. La dirección de la luz desde la esquina superior izquierda se aprecia con especial claridad en los brillos intensos del lado izquierdo y en la sombra asentada que se extiende hacia el lado derecho, más oscuro.
Prompt y ajustes utilizados
Prompt
A premium product photograph of exactly one transparent rectangular perfume bottle, half filled with amber liquid, standing upright on wet black stone. Light comes from the upper left, creating coherent refraction, a contact shadow, and one subtle reflection. No text, logo, plants, or extra objects.
Tipografía multilingüe
Depende de la tareaAmbos resultados son prácticamente idénticos según los criterios de evaluación. Reproducen correctamente el texto, el orden y los colores, pero los dos dividen visiblemente en dos la primera línea solicitada, por lo que el resultado tiene cinco líneas en lugar de exactamente cuatro.
- Exactamente cuatro líneas de texto centradas y ningún texto adicional: empate. Ambos carteles contienen cinco líneas de texto visibles porque "MOONLIGHT MARKET" aparece dividido entre "MOONLIGHT" y "MARKET"; ninguno contiene palabras adicionales.
- Texto y orden exactos: empate. Ambos muestran "MOONLIGHT", "MARKET", "月光市集", "18 OCT" y "RIVER HALL" en el orden solicitado, pero ninguno mantiene "MOONLIGHT MARKET" en una sola línea.
- Colores del texto: empate. Ambos muestran "月光市集" en rojo y todo el texto visible en inglés en negro.
- Legibilidad, espaciado y alineación: empate. Ambos carteles presentan una tipografía nítida y legible, con alineación centrada y un espaciado vertical generalmente uniforme; no se aprecia una ventaja visual clara.
Prompt y ajustes utilizados
Prompt
Design a clean cream-colored vertical event poster. Show exactly four centered text lines and no other text: "MOONLIGHT MARKET", "月光市集", "18 OCT", and "RIVER HALL". Render "月光市集" in red and all other lines in black.
Anatomía humana y contacto
Depende de la tareaLa izquierda cumple mejor los estrictos requisitos del prompt sobre la visibilidad de manos y dedos, mientras que la derecha presenta una anatomía y un contacto durante el modelado más convincentes. Estas ventajas se equilibran en el conjunto de los criterios.
- Hay exactamente dos manos totalmente visibles, sin manos ni personas adicionales: la izquierda lo hace mejor. Ambas imágenes muestran una persona y exactamente dos manos, pero la izquierda deja ambas manos más completamente a la vista; en la derecha, partes considerables de los dedos quedan ocultas dentro o detrás del cuenco.
- Cada mano tiene exactamente cinco dedos diferenciados y de forma natural: la izquierda lo hace mejor. En la izquierda se pueden distinguir con mayor claridad cinco dedos separados en cada mano, mientras que la superposición y la oclusión hacen menos seguro el recuento exacto en las manos de la derecha.
- Los dedos, las articulaciones y el contacto con la arcilla son anatómicamente verosímiles: la derecha lo hace mejor. El agarre desde el interior y el exterior sigue de forma natural la pared del cuenco y la alineación de los dedos resulta más convincente; varias puntas de los dedos de la izquierda parecen amontonadas o parcialmente fusionadas con la arcilla.
- El cuenco de arcilla, el torno en movimiento y la acción de modelado se reconocen con claridad: la derecha lo hace mejor. El cuenco y el torno tienen protagonismo en ambas imágenes, pero la posición opuesta de las manos en la derecha comunica con mayor claridad la acción de modelar.
Prompt y ajustes utilizados
Prompt
A photorealistic close-up of an adult potter shaping a clay bowl on a spinning wheel. Both hands are fully visible, each with five natural fingers touching the clay. No other people or hands. Soft window light.
Conteo y vinculación de atributos
Depende de la tareaAmbas imágenes cumplen los cuatro criterios sin diferencias claras. El número de objetos, la correspondencia de atributos, la disposición, la orientación del asa y el fondo limpio son prácticamente equivalentes.
- Número y ubicación de los objetos: empate; ambas imágenes muestran visiblemente exactamente tres cubos rojos en fila a la izquierda, exactamente dos esferas azules a la derecha y una taza amarilla centrada detrás de ellos.
- Correspondencia de color, forma y material: empate; ambas muestran cubos de madera rojos con una textura sutil, esferas de cristal azules, transparentes y reflectantes, y una taza de cerámica amarilla brillante.
- Dirección del asa de la taza: empate; en ambas imágenes, el asa se ve claramente en el lado derecho.
- Sin objetos ni texto adicionales: empate; ninguna imagen contiene objetos ni texto adicionales visibles.
Prompt y ajustes utilizados
Prompt
On a matte gray table, exactly three red wooden cubes form a row on the left, exactly two blue glass spheres sit on the right, and one yellow ceramic mug stands centered behind them. The mug handle points right. No other objects or text.
Composición publicitaria
Mejor en este caso: GPT Image 2.5 FlareLa derecha sigue más fielmente la composición solicitada porque el titular aparece más cerca de la posición prevista, justo debajo de la zona superior vacía. Por lo demás, ambas ofrecen resultados similares y las dos incumplen la restricción de texto al incluir "AERO" en la zapatilla.
- Exactamente una zapatilla plateada y una estela naranja: empate. Cada imagen muestra una zapatilla plateada en la parte inferior derecha, con una estela naranja que entra desde la esquina inferior izquierda y se curva a través de la escena.
- Texto visible: empate. Ambas muestran correctamente "RUN LIGHT" y "42 KM", pero también incluyen visiblemente "AERO" en la zapatilla, por lo que ninguna cumple el requisito de que esos sean los únicos textos visibles.
- Espacio superior y ubicación del titular: la derecha lo hace mejor. Ambas mantienen despejada la zona superior, pero la derecha sitúa "RUN LIGHT" más cerca de quedar justo debajo de ese espacio reservado; la izquierda deja bastante más espacio vacío antes del titular.
- Visibilidad y jerarquía: empate. Ambas mantienen completamente visibles el titular, la insignia, la estela y la única zapatilla, y establecen una jerarquía clara encabezada por el titular y la zapatilla.
Prompt y ajustes utilizados
Prompt
Create a vertical social ad for a fictional running shoe named AERO. Keep the top 15 percent empty. Directly below it, place the headline "RUN LIGHT" in the upper-left. Show exactly one silver shoe in the lower-right, an orange trail curving from the bottom-left, and a round badge reading "42 KM". No other shoes or text.
Gráfico de interfaz estructurado
Mejor en este caso: GPT Image 2La izquierda sigue exactamente el prompt, mientras que la derecha incumple el requisito explícito de no incluir texto adicional.
- Título y columnas: empate. Ambas muestran el título exacto "CHOOSE YOUR PLAN" y exactamente tres columnas con las etiquetas "STARTER", "PRO" y "TEAM".
- Filas: empate. En ambos resultados, cada columna contiene tres filas alineadas con las etiquetas "PROJECTS", "STORAGE" y "SUPPORT".
- Botones: empate. En ambos resultados, cada columna contiene exactamente un botón azul con la etiqueta "SELECT".
- Alineación y texto adicional: la izquierda lo hace mejor. Ambas tienen las columnas alineadas de manera uniforme, pero la derecha añade texto con detalles de los planes: "5", "10 GB", "Email", "25", "100 GB", "Priority", "Unlimited", "1 TB" y "24/7". La izquierda no tiene texto adicional.
Prompt y ajustes utilizados
Prompt
Create a clean horizontal pricing comparison graphic titled "CHOOSE YOUR PLAN". Use exactly three equal columns labeled "STARTER", "PRO", and "TEAM". Under each column, show exactly three aligned rows labeled "PROJECTS", "STORAGE", and "SUPPORT", followed by one blue button labeled "SELECT". White background, dark navy text, no additional columns or text.
Vinculación y edición de objetos con seis referencias
Mejor en este caso: GPT Image 2La IZQUIERDA ofrece el mejor resultado porque muestra claramente los dos limones solicitados, sin la hoja potencialmente asociada al objeto equivocado que aparece en la DERECHA, y mantiene los objetos editados ligeramente mejor encuadrados. La mayoría de las demás sustituciones solicitadas tienen un nivel de acierto similar.
- Criterio 1: empate. Ambas imágenes muestran visiblemente una taza azul marino oscuro en la zona inferior izquierda y una servilleta doblada con rayas verdes y blancas en la zona superior izquierda, sin que queden una taza roja ni una toalla blanca lisa. Al no disponer de las referencias, no es posible evaluar la correspondencia exacta con ellas.
- Criterio 2: empate. Ambas imágenes muestran exactamente una naranja cerca de la parte superior central y un cuaderno de tapa dura amarillo mostaza a la derecha; no se ve ninguna pera verde ni ningún cuaderno azul. No es posible evaluar la correspondencia exacta con las referencias sin las imágenes de origen.
- Criterio 3: la izquierda lo hace mejor. Ambas muestran dos limones a la derecha de la taza, pero la DERECHA añade a uno de ellos una llamativa hoja verde similar a la de la naranja, lo que crea una asociación visual incorrecta entre atributos. La IZQUIERDA mantiene ambos limones diferenciados y sin adornos, sin fruta adicional.
- Criterio 4: la izquierda lo hace ligeramente mejor. Ambas conservan una mesa de madera coherente, una iluminación uniforme y sombras verosímiles, pero la IZQUIERDA mantiene una mayor parte del cuaderno visible dentro del encuadre, mientras que la DERECHA lo recorta más por el borde derecho. No es posible evaluar la conservación exacta de la Referencia 1 porque no se muestra.
Imágenes de referencia
Prompt y ajustes utilizados
Prompt
Use Reference 1 as the base tabletop scene. Replace the red mug with the exact dark navy-blue mug from Reference 2 in the same position and orientation. Replace the folded white towel with the exact green-and-white striped napkin from Reference 3 in the same folded area. Replace the green pear with exactly one orange from Reference 4 in the same position. Replace the blue notebook with the exact mustard-yellow hardcover notebook from Reference 5 in the same position. Add exactly the two lemons from Reference 6 to the right of the mug. Preserve the wooden table, camera, framing, wood grain, lighting, shadows, and all other spatial relationships from Reference 1. Do not copy the white product backgrounds from References 2–6, duplicate any asset, or add other objects.
Sustitución de texto dentro de la imagen
Depende de la tareaAmbos resultados muestran limpiamente el texto solicitado y son casi idénticos visualmente. Ninguno presenta defectos visibles en el texto ni una ventaja clara en cuanto a conservación.
- Texto exacto y eliminación: empate. Ambos letreros muestran exactamente "NIGHT OWL" y no queda texto anterior visible en ninguna de las imágenes.
- Caracteres adicionales o deformados: empate. Ambos letreros contienen únicamente "NIGHT OWL", sin caracteres adicionales, duplicados ni deformados.
- Conservación de la fuente, el espaciado y la perspectiva: empate. Ambos utilizan letras mayúsculas sans serif limpias y alineadas de forma convincente con la perspectiva del letrero; no es posible evaluar por completo la conservación respecto al original porque no se muestra la imagen de origen.
- Conservación del material, la iluminación y la escena: empate. La veta de la madera pintada de verde, las sombras, las lámparas, el escaparate, las plantas y el pavimento parecen prácticamente idénticos entre ambas imágenes; no es posible evaluar por completo la conservación respecto al original sin la imagen de origen.
Imágenes de referencia
Prompt y ajustes utilizados
Prompt
Replace only the sign text with exactly "NIGHT OWL". Preserve the original font style, spacing, perspective, sign material, lighting, and everything else.
Reiluminación coherente de escenas
Mejor en este caso: GPT Image 2.5 FlareLa DERECHA consigue una reiluminación coherente más convincente, con una luz solar direccional más intensa y sombras proyectadas uniformes, en vez de limitarse principalmente a aplicar un tono cálido general.
- La cálida luz de la hora dorada entra claramente por la ventana izquierda: la derecha lo hace mejor; la luz solar intensa entra visiblemente por la ventana izquierda y se extiende por la pared, el sofá, la alfombra y el suelo, mientras que la izquierda tiene una fuente cálida, pero una iluminación menos marcada en el conjunto de la habitación.
- Los brillos y la dirección de las sombras responden de manera coherente a la nueva fuente de luz: la derecha lo hace mejor; las sombras del marco de la ventana, las plantas y las patas de los muebles se proyectan de manera uniforme hacia la derecha. La izquierda presenta sombras verosímiles en la pared, pero la direccionalidad de las sombras sobre la alfombra y el suelo es más débil.
- El resultado es más que un filtro amarillo uniforme: la derecha lo hace mejor; combina brillos cálidos con franjas de luz solar bien definidas y zonas de sombra más frías en el sofá, la pared, la alfombra y el suelo. En comparación, la izquierda presenta un tono ámbar más uniforme.
- No se ha movido, añadido, eliminado ni rediseñado ningún mueble o elemento decorativo: esto no puede evaluarse por completo sin la imagen original. Los dos resultados contienen visiblemente los mismos muebles y elementos decorativos principales en posiciones coincidentes, por lo que ninguno presenta una ventaja demostrable.
Imágenes de referencia
Prompt y ajustes utilizados
Prompt
Change the lighting to warm golden-hour sunlight entering from the left window. Do not move, add, remove, or redesign any object. Update highlights and shadows coherently.
Outpainting entre distintas proporciones
Depende de la tareaAmbas imágenes cumplen los requisitos visibles de ampliación en un grado muy similar. Los criterios específicos de conservación no pueden verificarse solo con estos resultados y ninguna presenta defectos visibles claros en la extensión.
- Resultado 16:9 con contenido lateral natural: empate. Ambos resultados son composiciones horizontales en las que la playa, el océano y el cielo se extienden de forma natural hacia ambos lados; ninguno presenta franjas negras ni un lateral claramente vacío.
- Original completo y centrado, sin recortes ni estiramientos: empate. La cabaña está centrada y sus proporciones parecen naturales en ambos resultados, pero la imagen de origen original no se muestra por separado, por lo que no es posible verificar su conservación completa ni la ausencia de recortes.
- Cabaña, costa y composición interna originales sin cambios: empate. La cabaña y la costa visibles son coherentes en ambos resultados, pero no es posible evaluar si alguno de los modelos modificó el contenido original sin la imagen de origen.
- Sin uniones visibles, relleno reflejado ni objetos repetidos: empate. Ambas extensiones parecen continuas a través de la arena, las olas, el horizonte y las nubes, sin uniones claras, patrones reflejados ni objetos duplicados visibles.
Imágenes de referencia
Prompt y ajustes utilizados
Prompt
Expand the canvas to a 16:9 landscape by naturally continuing the beach, ocean, and sky on both sides. Keep the complete original image centered without cropping, stretching, letterboxing, or modifying it.
Preservación del producto al cambiar de escena
Mejor en este caso: GPT Image 2.5 FlareLa derecha integra la zapatilla de forma más convincente en la pista mojada al atardecer solicitada, principalmente gracias a un tratamiento más logrado de la superficie húmeda y a una iluminación más coherente. No es posible verificar la conservación exacta del producto sin la imagen de origen.
- Ubicación en la escena: La imagen de la derecha lo hace mejor. Muestra con mayor claridad una cancha de baloncesto exterior mojada mediante las líneas visibles de la cancha, un aro y una valla, agua acumulada, farolas encendidas y un cielo anaranjado al atardecer; la imagen de la izquierda también sitúa bien la escena, pero las líneas de la cancha y la humedad son menos evidentes.
- Coherencia de la zapatilla: No se puede evaluar por completo porque no se muestra la imagen de referencia original de la zapatilla. Al comparar ambos resultados, los dos presentan una silueta similar, un ángulo de cámara bajo, una suela en capas, una disposición de las costuras parecida, una parte superior blanca con aspecto de cuero y un cuello tejido, aunque la imagen de la derecha añade llamativas gotas de agua sobre los materiales.
- Marca geométrica lateral: No se puede verificar que se haya mantenido sin cambios porque no se dispone de la referencia original. Ambas imágenes muestran una marca angular negra, clara y reconocible, con prácticamente la misma forma ramificada y ubicación, por lo que ninguna tiene una ventaja visual decisiva.
- Coherencia física: La imagen de la derecha lo hace mejor. La zapatilla presenta gotas visibles, una sombra de contacto que la asienta sobre la superficie, reflejos cálidos del atardecer en los bordes orientados hacia la derecha y reflejos que concuerdan con la intensa luz del atardecer y las luces de la cancha. La imagen de la izquierda muestra un reflejo más nítido de la zapatilla, pero el hecho de que esté casi seca contrasta en cierta medida con la superficie empapada.
Imágenes de referencia
Prompt y ajustes utilizados
Prompt
Place the sneaker on a wet outdoor basketball court at dusk. Preserve the exact sneaker shape, black geometric side mark, materials, stitching, sole geometry, and camera angle. Add physically coherent contact, reflections, and dusk lighting.
Transferencia de identidad y prendas con múltiples referencias
Imágenes de referencia
Prompt y ajustes utilizados
Prompt
Use the portrait in Reference 1 for the person and the isolated jacket in Reference 2 for the garment. Dress the person from Reference 1 in the exact jacket shown in Reference 2. Preserve the person's identity, face, expression, skin, hair, hands, pose, body proportions, background, framing, and lighting from Reference 1. Preserve the jacket's material, color, collar, buttons, pockets, and sleeve patch from Reference 2. Do not copy the ghost mannequin or white product background.
Coste y latencia
GPT Image 2 parte de 20 créditos, mientras que GPT Image 2.5 Flare parte de 25, por lo que GPT Image 2 es la opción que requiere menos créditos por generación. En la pequeña muestra de latencia de esta prueba, GPT Image 2 tardó entre unos 81 s y 190 s por escenario, mientras que GPT Image 2.5 Flare tardó entre unos 71 s y 101 s; estas observaciones describen esta prueba, no un benchmark general.
Cómo comparamos y declaración de transparencia
Para cada escenario, utilizamos un único prompt fijo y realizamos una ejecución por modelo; después publicamos los resultados tal como se generaron. Banana Pie ofrece acceso de pago a ambos modelos.
Banana Pie ofrece acceso de pago a este modelo junto con otros modelos en un mismo estudio. Nuestros veredictos proceden de pruebas realizadas mediante el mismo sistema que usan nuestros usuarios.







































































