GuíasTosea Team14 MIN DE LECTURA

Guía completa de GPT Image 2.5: Sunburst y Flare medidos en producción

OpenAI lanzó GPT Image 2.5 el 8 de septiembre de 2026. Medimos gpt-image-2.5-sunburst y flare frente a gpt-image-2: latencia, tokens, coste y la escalera de calidad que se desplazó.

Guía completa de GPT Image 2.5: Sunburst y Flare medidos en producción

El 8 de septiembre de 2026, OpenAI anunció ChatGPT Images 2.5 y, junto con él, dos modelos nuevos en la Images API: gpt-image-2.5-flare y gpt-image-2.5-sunburst. La comunidad llevaba tres semanas discutiendo si el próximo modelo de imagen se llamaría GPT Image 2.5 o GPT Image 3 — publicamos un rastreador de evidencias precisamente sobre esa pregunta. La respuesta resultó ser ninguna de las dos, exactamente: el producto es ChatGPT Images 2.5 y la API expone dos identificadores con sufijo en lugar de un único modelo insignia. Si llamas a gpt-image-2.5 sin sufijo, la API devuelve The model 'gpt-image-2.5' does not exist. Lo mismo ocurre con gpt-image-3.

Todavía teníamos montado el banco de pruebas del lanzamiento de GPT Image 2 en abril, así que a las pocas horas del anuncio lo apuntamos a los dos identificadores nuevos y ejecutamos 41 generaciones de imagen contra la API oficial. Esta guía es lo que volvió: qué lanzó OpenAI realmente, cuánto cuestan y cuánto tardan de verdad los dos modelos, y un detalle de migración que cambiará en silencio tu factura y la calidad de tu salida si cambias la cadena del modelo y nada más.

Diapositiva de portada 16:9 de una empresa ficticia generada por gpt-image-2.5-sunburst: una marquesina de recarga eléctrica al atardecer, un titular con serifa y cuatro bloques de metadatos etiquetados en la barra inferior

Qué lanzó OpenAI realmente el 8 de septiembre

La mitad de consumo es la más grande del anuncio. Images 2.5 llegó ese mismo día a todos los planes de ChatGPT, ChatGPT Work y Codex en escritorio, móvil y web, con cuatro funciones de producto asociadas:

  • Sketch — dibujas directamente en ChatGPT y ese dibujo se convierte en la referencia compositiva de la imagen final. Se invoca escribiendo @Sketch.
  • Plantillas — puntos de partida predefinidos para formatos habituales como pósteres o merchandising, de modo que rellenas detalles en lugar de enfrentarte a un cuadro de texto vacío.
  • Comentarios sobre la imagen — colocas un comentario en una zona concreta de la imagen generada para acotar la edición a ese punto.
  • Compartir el prompt — al compartir una imagen puedes adjuntar el prompt que la produjo, para que otra persona reproduzca la idea con su propio material.

Sobre la calidad del modelo, el propio texto de OpenAI es más medido que espectacular: Images 2.5 «produce una iluminación más natural y texturas más ricas, conserva mejor los sujetos de tus fotos de referencia y sigue las instrucciones de edición de forma más fiable a lo largo de varios turnos». La única cifra dura del anuncio es la latencia: «hemos reducido la latencia de generación de imágenes hasta un 50 % frente a Images 2.0». OpenAI también reveló que ya se crean más de 3 000 millones de imágenes por semana entre ChatGPT Images y los modelos GPT-Image de la API, y citó a Adobe, Runway, Manus y Higgsfield AI como primeros clientes de la API.

El tratamiento de seguridad no cambia de naturaleza: comprobaciones sobre prompts e imágenes, más metadatos C2PA y marca de agua invisible en las salidas. Si tu pipeline elimina o reescribe metadatos de imagen, ese comportamiento viene heredado de gpt-image-2 y conviene volver a verificarlo en lugar de darlo por hecho.

Los dos modelos de la API: Sunburst y Flare

El posicionamiento de OpenAI es explícito sobre cuál elegir primero.

gpt-image-2.5-flare se describe como «la opción por defecto para la mayoría de aplicaciones, que ofrece imágenes de mayor calidad que GPT-Image-2 con un 50 % menos de latencia». Está orientado a contenido de creadores y redes, experiencias de producto, búsqueda visual, prototipado rápido y generación de alto volumen.

gpt-image-2.5-sunburst «ofrece un nivel adicional de precisión para trabajo creativo detallado, con tiempos de generación más largos», y se plantea para creatividades de campaña listas para producción e imágenes de producto pulidas.

Dos cosas de esa pareja importan a quien esté planificando una integración. Primero, esto no es una división modelo grande/modelo pequeño como la de gpt-image-1 y gpt-image-1-mini: ambos modelos se facturan a las mismas tarifas y, en nuestras pruebas, ambos devolvieron exactamente el mismo número de tokens de salida en cada ajuste de calidad. Lo que pagas de más es tiempo, no dinero. Segundo, los nombres no dan ninguna pista del orden: «flare» es el rápido y «sunburst» es el lento, justo lo contrario de lo que sugieren las palabras a la mayoría. Anótalo en algún sitio donde tu yo futuro lo encuentre.

Ambos modelos están restringidos a dos endpoints — POST /v1/images/generations y POST /v1/images/edits — y ambos declaran soporte de inpainting. Ninguno está disponible a través de la herramienta de imagen de la Responses API en el momento de escribir esto.

Cómo lo probamos

Los benchmarks basados en un prompt ingenioso dicen muy poco sobre el comportamiento en producción, así que usamos la forma de trabajo que nuestro propio pipeline hace todos los días: convertir un guion estructurado en una diapositiva 16:9 terminada, con imágenes de plantilla de marca adjuntas.

  • Carga de trabajo. Un deck de cinco páginas para un operador ficticio de recarga eléctrica: portada, agenda y tres páginas de contenido densas en cifras (98,4 %, 96,1 %, 4,2 → 5,6, £1,9 M, 18:00) que el modelo debe renderizar sin inventar ni emborronar. El deck está inventado para este artículo; no se usó contenido de clientes.
  • Forma de la llamada. POST /v1/images/edits con el guion como prompt y de una a tres imágenes de plantilla adjuntas como referencia — la misma llamada que hace nuestro modo imagen en producción.
  • Resolución. 2048x1152 (2K, 16:9) para la matriz principal y 3840x2160 para la comparación 4K.
  • Proveedor. La API oficial de OpenAI con una clave de primera parte. Sin pasarelas agregadoras, porque la contabilidad de tokens es justo lo que queríamos medir.
  • Reintentos. Ninguno. Todas las cifras de abajo son resultados de un solo disparo y reportamos tiempo de reloj desde la petición hasta tener los bytes.
  • Volumen. 41 llamadas correctas, cero fallos, entre gpt-image-2, gpt-image-2.5-sunburst y gpt-image-2.5-flare.

El coste se calcula a partir del bloque usage que devuelve cada respuesta, con las tarifas publicadas por OpenAI, en lugar de una estimación por imagen. Esa distinción resulta importar muchísimo.

Hallazgo 1: la escalera de calidad bajó dos peldaños

Es lo más importante de este artículo y no está en el anuncio.

gpt-image-2 acepta tres ajustes explícitos de calidad — low, medium, high — más auto. GPT Image 2.5 acepta cinco: low, medium, high, xhigh, max, más auto. Pasar xhigh o max a gpt-image-2 devuelve un rechazo limpio: The model 'gpt-image-2' does not support quality 'xhigh'.

La lectura obvia es que OpenAI añadió dos peldaños por encima del techo anterior. No es lo que ocurrió. Medimos los tokens de imagen de salida que devuelve cada ajuste para la misma diapositiva de 2048 × 1152, y los dos peldaños nuevos se insertaron por debajo de los anteriores — lo que empujó hacia abajo todos los nombres conocidos.

Diagrama que compara los ajustes de calidad de gpt-image-2 y gpt-image-2.5 por tokens de imagen de salida, mostrando que el high de 2.5 equivale al medium de gpt-image-2 y el max de 2.5 al high de gpt-image-2

qualitygpt-image-2gpt-image-2.5 (ambos modelos)
low157 tokens157 tokens
medium1 413 tokens367 tokens
high5 650 tokens1 413 tokens
xhighrechazado2 511 tokens
maxrechazado5 650 tokens

Lee dos veces las filas en negrita. El high de GPT Image 2.5 gasta lo que gastaba el medium de gpt-image-2. Su max gasta lo que gastaba el high de gpt-image-2. El peldaño low es el único que conservó su significado.

La consecuencia práctica: si cambias la cadena del modelo de gpt-image-2 a gpt-image-2.5-flare y dejas quality: "medium" intacto, has pasado en silencio de un render de 1 413 tokens a uno de 367 — un recorte de 3,8× en presupuesto de salida. Tu factura cae más o menos a la mitad, lo que en el panel parece una victoria, y tus composiciones se simplifican, lo que no aparece en ningún sitio salvo en las imágenes. El cambio equivalente en fidelidad es mediumhigh.

Lo mismo aplica en 4K. A 3840x2160, gpt-image-2 en high devolvió 13 342 tokens de salida; GPT Image 2.5 en high devolvió 3 336, y solo en max devolvió los mismos 13 342. auto tampoco es una salida segura: en nuestras ejecuciones, sunburst y flare cayeron en el peldaño de 1 413 tokens cuatro de cada cinco veces, pero una llamada de flare volvió con 628 tokens de salida — un valor que nunca vimos con ningún ajuste explícito. Si te importa la previsibilidad del coste, fija quality de forma explícita.

Hallazgo 2: los mismos tokens, el mismo precio, menos espera

Una vez corregida la escalera, la comparación queda limpia. Abajo, los tres modelos producen un render de 1 413 tokens de salida de la misma diapositiva 2048 × 1152, con el mismo prompt y las mismas imágenes de referencia, al mismo coste facturado de unos $0,059 por diapositiva. La única variable es el tiempo. Cada cifra es la media de cinco páginas.

Gráfico de barras de segundos de reloj por diapositiva en dos presupuestos de tokens equiparados: gpt-image-2 en 37,3 y 82,9 segundos frente a gpt-image-2.5-flare en 19,7 y 33,7 segundos

ModeloqualityTokens de salidaLatencia mediaCoste por diapositiva
gpt-image-2medium1 41337,3 s$0,059
gpt-image-2.5-sunbursthigh1 41327,7 s$0,059
gpt-image-2.5-flarehigh1 41319,7 s$0,059

Flare es un 47 % más rápido que gpt-image-2 con una factura de tokens idéntica; sunburst, un 26 %. Eso cae casi exactamente sobre la afirmación de «50 % menos de latencia» que OpenAI hace de flare, un desenlace más raro de lo que debería para una cifra de marketing del día del lanzamiento.

La brecha se ensancha en lo alto de la escalera. En un único render de 5 650 tokens de la misma página, gpt-image-2 en high tardó 82,9 segundos; sunburst en max, 59,8 segundos; y flare en max, 33,7 segundos — un 59 % más rápido. Y en 4K, gpt-image-2 en high tardó 92,4 segundos y costó $0,42 por imagen, mientras que ambos modelos 2.5 en high terminaron en 27,8–33,8 segundos por $0,12, aunque en la escalera corregida eso es un peldaño más barato y no una comparación equivalente.

La varianza de latencia también se estrechó. En cinco páginas, flare osciló entre 17,7 y 22,3 s y sunburst entre 27,1 y 28,9 s, mientras que gpt-image-2 fue de 35,2 a 39,2 s. Para un pipeline que abre en paralelo un deck de 20 diapositivas, la cola importa más que la media, y la cola se acortó.

Hallazgo 3: qué compra realmente cada peldaño

Los peldaños baratos solo sirven si la salida es utilizable. Renderizamos la misma página de contenido en cuatro de los cinco ajustes de sunburst y las pusimos una al lado de la otra.

Cuatro versiones de la misma diapositiva generadas por gpt-image-2.5-sunburst en calidad low, medium, high y max, etiquetadas con tokens de salida, latencia y coste

Las cuatro son legibles, están bien compuestas tipográficamente y no tienen texto deformado — incluida low con 157 tokens y $0,026. Lo que compra el presupuesto extra no es corrección sino composición: en low y medium obtienes fotografía más plana, separadores más simples y bloques a dos columnas más convencionales; en high y max aparecen tarjetas por capas, mayor profundidad de campo en la imagen de fondo, tratamientos de numeración a medida y una jerarquía tipográfica más pensada.

Para un deck que se proyectará en una sala y se tirará la semana que viene, medium a $0,032 por diapositiva es defendible. Para cualquier cosa que vea un cliente, high es el peldaño que se lee como diseñado en lugar de ensamblado. Los nuevos medium y xhigh son adiciones genuinamente útiles: rellenan huecos en una escalera que antes saltaba 4× entre peldaños.

Hallazgo 4: el texto y las cifras aguantaron

La razón por la que la generación de diapositivas en modo imagen llegó a ser viable fue el renderizado de texto de gpt-image-2. Cualquier regresión ahí sería descalificatoria, así que contrastamos cada diapositiva generada con su guion de origen.

Tres versiones de la misma diapositiva de contenido generadas por gpt-image-2 en medium y por gpt-image-2.5-sunburst y flare en high, cada una etiquetada con tokens de salida, latencia y coste

En las quince diapositivas de la matriz comparativa, los tres modelos renderizaron correctamente cada titular, cada viñeta y cada cifra: 98,4 %, 96,1 %, «4.2 to 5.6», «18:00», «2024-vintage». Sin decimales perdidos, sin estadísticas inventadas, sin eslóganes alucinados en la zona vacía del logotipo. Ejecutamos los mismos prompts en chino en una pasada anterior y vimos el mismo resultado, incluido el par de caracteres visualmente similares que hace tropezar a modelos más débiles.

La diferencia visible está en la inteligencia de maquetación. gpt-image-2 lee el guion y produce una retícula competente. Los dos modelos 2.5 producen con más frecuencia algo que un diseñador reconocería como una decisión: una banda fotográfica asimétrica cruzando el tercio superior, medallones de icono que coinciden con el papel semántico de cada viñeta, un número de página en la esquina que la plantilla insinuaba pero nunca declaraba. Es un juicio subjetivo y no vamos a disfrazarlo de benchmark, pero fue consistente en las cinco páginas, en ambas direcciones, en una observación a ciegas antes de comprobar qué archivo era cuál.

Hallazgo 5: la edición multiturno deriva menos, pero deriva

Las afirmaciones de OpenAI sobre edición de precisión y consistencia multiturno son las más relevantes para quien construya un editor sobre la API, así que las probamos directamente. Partiendo de una diapositiva terminada, lanzamos tres instrucciones consecutivas de un solo cambio, realimentando cada vez la salida anterior: reescribir un titular, cambiar una cifra de 98,4 % a 99,2 %, sustituir una frase del lado opuesto de la diapositiva.

Cuatro paneles que muestran una diapositiva original y tres ediciones sucesivas de una sola instrucción, cada una aplicada correctamente mientras el resto de la diapositiva se mantiene

Los tres modelos aplicaron las tres ediciones en las tres cadenas: nueve de nueve. Es un resultado mejor de lo que esperábamos para gpt-image-2 y conviene decirlo claramente en lugar de enterrarlo: no es una capacidad que le falte al modelo anterior.

Donde difieren es en cuánto se mueve el resto de la diapositiva. Midiendo la proporción de píxeles que cambiaron por encima de un umbral perceptible, respecto al original:

Después degpt-image-22.5-sunburst2.5-flare
Turno 15,6 %4,1 %3,8 %
Turno 28,1 %6,8 %6,7 %
Turno 311,4 %9,9 %9,2 %

GPT Image 2.5 acumula alrededor de un 15–20 % menos de deriva en tres turnos, y su deriva por turno se reduce a medida que avanza la cadena (4,1 % → 3,1 % → 2,8 % en sunburst) mientras que gpt-image-2 se mantiene plano (5,6 % → 4,9 % → 4,9 %). Es una mejora real en la dirección que declara OpenAI. También es, con esta evidencia, incremental y no un salto de categoría — y conviene notar que ninguna de estas es una edición local de verdad. Sin máscara, todo el lienzo se regenera en cada turno; la fotografía de fondo se vuelve a renderizar sutilmente y, tras suficientes rondas, se desviará de forma visible. Si necesitas una región garantizada sin tocar, sigues necesitando el parámetro de máscara, no un prompt cortésmente redactado.

Precios de GPT Image 2.5, en la práctica

Ambos modelos publican tarifas idénticas, y esas tarifas son idénticas a las de gpt-image-2:

Tipo de tokenPrecio por 1 M de tokens
Entrada de texto$5,00
Entrada de texto en caché$1,25
Entrada de imagen$8,00
Entrada de imagen en caché$2,00
Salida de imagen$30,00

Como los precios unitarios no se movieron, todo el ahorro viene de la escalera, no de la lista de precios. Convertido a un deck de 20 diapositivas a 2048 × 1152 con tres imágenes de referencia adjuntas por página, usando nuestros recuentos de tokens medidos:

ConfiguraciónPor diapositivaDeck de 20
gpt-image-2, medium$0,064$1,27
2.5, high (fidelidad equiparada)$0,064$1,27
2.5, medium (un peldaño abajo)$0,032$0,64
2.5, low$0,026$0,51
gpt-image-2, high$0,190$3,81
2.5, max (fidelidad equiparada)$0,191$3,81

Una nota más sobre las entradas: las imágenes de referencia se facturan a $8 por millón y se tarifan por área en píxeles, así que tres plantillas adjuntas cuestan unos 1 728 tokens de entrada por llamada con independencia del tamaño del archivo. Reducir la resolución de las imágenes de referencia antes de subirlas sigue siendo una de las optimizaciones más baratas disponibles, y 2.5 no cambia esa aritmética.

Lo que no encontramos

Aquí importa más el equilibrio que el entusiasmo, así que: varias cosas que buscamos no aparecieron.

Ningún salto en renderizado de texto. gpt-image-2 ya estaba en el punto en que los errores son raros en contenido de documento de empresa. No encontramos ningún caso en el que 2.5 acertara y 2 fallara. Si la precisión del texto dentro de la imagen es tu único requisito, este lanzamiento no desbloquea nada.

Sigue sin haber edición local sin máscara. La mejora en edición de precisión es real pero acotada, como muestra la tabla de deriva. Quien espere que «edita solo el titular» signifique ahora «no toques literalmente nada más» se llevará una decepción.

No hay bajada de precio. La economía titular solo mejora si bajas deliberadamente por la escalera renombrada, y bajar te cuesta calidad de composición. Presentar este lanzamiento como «la mitad de coste» sin esa salvedad es engañoso.

Territorio no medido. Probamos un único género visual — diapositivas de negocio densas con referencias de marca — a dos resoluciones. No probamos retrato fotorrealista, preservación de sujeto a partir de fotos personales de referencia, fondos transparentes ni la ruta de inpainting con máscara explícita, todo ello destacado por OpenAI y todo ello susceptible de comportarse de otra forma. Nuestra muestra es de cinco páginas por configuración, a un solo disparo; toma las medias de latencia como indicativas, no como un acuerdo de nivel de servicio.

Lista de migración desde la API de gpt-image-2

Si ya tienes una integración, estos son los cambios que realmente exigen tocar código:

  1. Reasigna quality, no cambies solo el ID del modelo. mediumhigh y highmax conservan tu presupuesto de salida actual. Dejar la cadena como está te degrada en silencio.
  2. Elige flare salvo que tengas un motivo para no hacerlo. Es la opción por defecto declarada por OpenAI, fue más rápida que sunburst en todas las configuraciones que probamos y cuesta lo mismo. Recurre a sunburst en piezas destacadas donde esos 8 segundos extra compren un control más ajustado.
  3. Deja de depender de auto. Resolvió a presupuestos de tokens distintos en llamadas por lo demás idénticas. Fija quality de forma explícita si facturas a tus clientes por generación.
  4. Reajusta los tiempos de espera a la baja. Si tu cliente espera 180 segundos porque gpt-image-2 en 4K los necesitaba, flare terminará en un tercio de eso. Tiempos de espera más cortos significan detectar fallos antes.
  5. Mantén gpt-image-2 accesible como respaldo. Sigue en servicio, y un pipeline de imagen de proveedor único sin respaldo es una mala apuesta sea cual sea el modelo más nuevo.
  6. Vuelve a verificar tu tratamiento de C2PA. La marca de agua y los metadatos de procedencia se mantienen; si postprocesas las salidas, confirma que nada cambió en el contenedor.

Qué significa GPT Image 2.5 para la generación de diapositivas con IA

Un modelo de imagen más rápido no produce, por sí solo, un mejor deck — y esta es la distinción que se salta la mayoría de la cobertura de lanzamiento. Un modelo de imagen renderiza un lienzo cada vez. Una presentación es una secuencia de argumentos con una gramática visual compartida, construida a partir de un documento de origen que el modelo nunca ve entero.

Donde GPT Image 2.5 ayuda de verdad es en la economía del paso de renderizado. En un pipeline de modo imagen, cada diapositiva es una llamada aparte a la API, así que la latencia por diapositiva se multiplica directamente por el tiempo que el usuario pasa mirando una barra de progreso. Pasar de 37 a 20 segundos en un deck de 30 páginas elimina unos ocho minutos y medio de espera real con el mismo coste — lo que cambia qué resulta aceptable volver a generar. Cuando renderizar es barato en tiempo, la gente itera; cuando es lento, se conforma con el primer borrador. Los nuevos peldaños medium y xhigh también hacen realista una salida escalonada: esboza el deck entero a 367 tokens por diapositiva para revisar la narrativa y vuelve a renderizar en high solo las páginas que sobrevivan.

Lo que el modelo sigue sin poder hacer es decidir qué va en la diapositiva 7. Ese trabajo — analizar un PDF de 40 páginas, decidir qué hallazgos merecen página, mantener las cifras fieles a la fuente y sostener el lenguaje visual de una plantilla a lo largo de todo el deck — vive por encima del modelo de imagen, en la capa de orquestación. Es la misma división del trabajo que describimos en nuestra comparación entre generación de diapositivas HTML e imagen, y la razón por la que una clave suelta de la Images API no es una herramienta document-to-PPT. También es por lo que la cuestión de la exportación sigue abierta: una diapositiva generada es una imagen hasta que algo la devuelve a formas editables de PPTX.

Tosea.ai se sitúa en esa capa de orquestación: lee el documento de origen, construye la estructura de diapositivas, elige la plantilla y despacha cada página al modelo de imagen que en ese momento ofrezca el mejor equilibrio entre velocidad y fidelidad. Lanzamientos como este cambian a qué motor enrutamos y cómo fijamos el parámetro de calidad; no cambian la mitad difícil del problema. Si estás evaluando una herramienta de presentaciones con IA solo por la potencia de su modelo de imagen subyacente, nuestra guía de flujo de trabajo de PDF a PowerPoint es un mejor sitio para ver dónde está la dificultad real.

Preguntas frecuentes

¿Existe un modelo llamado gpt-image-2.5? No. La API expone gpt-image-2.5-sunburst y gpt-image-2.5-flare. Un gpt-image-2.5 sin sufijo devuelve un error de modelo inexistente, igual que gpt-image-3.

¿Cuál debería usar por defecto? Flare. OpenAI lo designa como opción por defecto y fue más rápido que sunburst en todos los ajustes de calidad que probamos, al mismo precio y con el mismo recuento de tokens de salida. Usa sunburst cuando una pieza justifique los segundos extra.

¿GPT Image 2.5 cuesta menos que GPT Image 2? Por token, no: las tarifas son idénticas. Por imagen, solo si bajas un peldaño en la escalera renombrada. Con presupuestos de salida equiparados el coste es el mismo salvo una décima de céntimo.

¿Funcionará mi código actual de gpt-image-2 si solo cambio la cadena del modelo? Se ejecutará, pero quality: "medium" ahora compra 3,8× menos tokens de salida que antes. Reasigna mediumhigh y highmax para conservar tu fidelidad actual.

¿Está obsoleto gpt-image-2? OpenAI no ha anunciado fecha de retirada y el modelo sigue en servicio. Sigue siendo un respaldo sensato en una configuración multiproveedor.

¿Soporta 4K? Sí. Ambos modelos aceptaron 3840x2160 en nuestras pruebas, con 3 336 tokens de salida en high y 13 342 en max.

¿Cómo se compara con Nano Banana 2? Todavía no hemos repetido ese enfrentamiento contra 2.5; nuestra comparación de Nano Banana 2 cubre la generación anterior y la actualizaremos cuando tengamos cifras con la misma carga de trabajo.

Fuentes