OpenAI ha lanzado dos nuevos modelos de imagen bajo la denominación ChatGPT Images 2.5, prometiendo detalles más nítidos, una edición más precisa y una generación significativamente más rápida. Nuevas funciones, como una herramienta de dibujo y prompts compartibles, buscan expandir el proceso creativo de los usuarios. OpenAI señala que actualmente se generan más de tres mil millones de imágenes cada semana a través de ChatGPT Images y los modelos GPT-Image en la API. Con ChatGPT Images 2.5, la compañía implementa una generación renovada que promete una iluminación más natural y texturas más finas.
Los modelos están diseñados para preservar mejor los sujetos de las fotos de referencia y seguir las instrucciones de edición de manera más confiable a través de múltiples iteraciones. Según OpenAI, la variante más rápida reduce la latencia de generación de imágenes hasta en un 50 por ciento en comparación con Images 2.0.
¿Qué diferencia a los nuevos modelos GPT-Image-2.5?
Para los desarrolladores, OpenAI incorpora ambos modelos a la API. GPT-Image-2.5 Flare es la opción predeterminada para la mayoría de los usos, ofreciendo una calidad de imagen superior a GPT-Image-2 con un 50 por ciento menos de latencia. El modelo más robusto, GPT-Image-2.5 Sunburst, apunta a trabajos visuales más exigentes con un control más estricto sobre las ediciones, requiriendo tiempos de generación más largos para ofrecer resultados.
Ambos modelos utilizan las mismas tasas de tokens. Esto equivale a 8 dólares por cada millón de tokens de entrada de imagen y 30 dólares por cada millón de tokens de salida. Sin embargo, debido a que el uso de tokens varía según el modelo y el nivel de calidad, las mismas tarifas no implican el mismo costo por imagen. Como novedad en Images 2.5, se introducen los niveles de calidad "xhigh" y "max", que superan el límite anterior de "high".
Una imagen de 1024x1024 en el nivel "low" cuesta alrededor de 0,006 dólares, igual que su predecesor, mientras que el nivel "high" cuesta aproximadamente 0,053 dólares, y el nuevo nivel "max" se sitúa en unos 0,21 dólares con cerca de 7.024 tokens de salida. Esto coloca al nivel "max" de Images 2.5 al mismo precio que el nivel "high" de GPT-Image-2. A diferencia de su predecesor, Images 2.5 no cuenta con una tarifa por lotes más económica hasta el momento. En pruebas iniciales, Sunburst suele costar más por imagen que Flare a pesar de tener precios de tokens idénticos, probablemente debido a procesos de razonamiento más extensos. OpenAI no ha proporcionado una cifra promedio de precio por imagen.
También resulta poco claro cómo OpenAI distribuye a los usuarios de ChatGPT entre ambos modelos. Ni el anuncio ni la documentación especifican cuándo ChatGPT recurre al modelo Flare, más rápido, o al Sunburst, más preciso. En la API es posible seleccionar el modelo explícitamente, pero la interfaz de ChatGPT aún no ofrece dicho control.
En nuestras pruebas, la distinción parece ejecutarse principalmente entre los modos Chat y Work. En Work, nuestros prompts realmente modifican solo lo solicitado, independientemente de los ajustes de razonamiento. Estas ediciones dirigidas son el foco de las mejoras del modelo. En Chat, sin embargo, más detalles siguen cambiando en las imágenes de seguimiento, incluso con el razonamiento configurado en alto. Solo en el ajuste "6 Pro" parece activarse el modelo más potente.
¿Cómo funciona la edición que mantiene la consistencia?
Como se mencionó, el enfoque del nuevo modelo es la edición. Está diseñado para cambiar únicamente los elementos solicitados y dejar el resto de la imagen intacto, incluso con sujetos y fondos complejos. En conversaciones más largas, los cambios anteriores deberían permanecer consistentes sin que la calidad de la imagen disminuya tras múltiples pasos de edición. OpenAI demuestra esto con el rediseño de una habitación. Mientras que el modelo anterior alteraba otros detalles con cada edición, el nuevo modelo se mantiene estable incluso a través de varias iteraciones.
Una prueba rápida a través de ChatGPT Work con GPT-6 Astra (Max) demuestra su eficacia. Utilizamos el siguiente prompt y luego ajustamos iterativamente un detalle pequeño (el color del plátano) y uno grande (el tigre).
Una foto DSLR hiperrealista. Un mono sosteniendo un plátano rosa está sentado sobre un tigre en primer plano. Al fondo, un CABALLO CABALGA A UN ASTRONAUTA. El astronauta está debajo, como una silla de montar humana, y el CABALLO está claramente arriba, en control, como jinete. Hazlo 100% inequívoco: el CABALLO es el jinete y el ASTRONAUTA está siendo montado, NO al revés. Alta resolución, enfoque nítido, iluminación realista.
Como nota al margen, esta es probablemente la mejor versión de un caballo montando a un astronauta que un modelo de imagen de OpenAI ha producido en nuestras pruebas. Así es como se veía con Image 2.0 (versión Thinking).
Las pruebas en el modo Chat de ChatGPT, por el contrario, siempre cambiaban el resto de la imagen al ajustar el color del plátano. Solo en el modo "6 Pro" la imagen se mantuvo consistente en una ejecución, pero no en otra. Esto podría cambiar a medida que continúe el despliegue durante la semana.
Images 2.5 también está diseñado para manejar mejor instrucciones visuales complejas, entregar contenido más preciso basado en información del mundo real y trabajar con fondos transparentes y diseños más exigentes. En nuestro último artículo, por ejemplo, le pedimos a ChatGPT que convirtiera la pieza en una revista de los años 80. El resultado fue el siguiente.
GPT-Images-2.5 a través de Astra (Max) también produjo una revista detallada con una imagen de muestra basada en nuestro prompt del mono-astronauta, en una variante más débil y una más fuerte, sin perder de vista la instrucción original por una menor calidad.
El modelo corrigió un error que introdujimos (GPT-Images-2.5 en lugar de 2.0 justo encima de las imágenes en la primera página) al recibir la orden, demostrando lo bien que preserva el resto del contenido, e hizo lo mismo para una traducción con la simple solicitud "Crea una versión en inglés de EE. UU.".
Para comparar, los resultados a través del chat estándar de ChatGPT también merecen atención, pero muestran que el modelo más débil cambia otros detalles durante la traducción. En un caso, sin embargo, captó mejor al actual CEO de Microsoft.
Dibujo, plantillas y prompts compartibles
En ChatGPT, OpenAI añade varias funciones nuevas junto a los nuevos modelos. La más importante se llama "Sketch". Permite a los usuarios dibujar directamente en ChatGPT y usar el boceto como plantilla visual para la imagen terminada. Se activa con el comando "@Sketch", y OpenAI afirma que funciona bien para diagramas, diseños de habitaciones o pósteres.
Las plantillas son prompts preconfigurados destinados a facilitar el inicio con formatos como pósteres, logotipos, infografías, miniaturas, ilustraciones o anuncios. Ofrecen una estructura en lugar de un lienzo en blanco y definen los requisitos mediante preguntas de seguimiento dirigidas. Los usuarios también pueden colocar comentarios directamente en las imágenes y compartir los prompts que utilizaron, de modo que otros puedan probar la misma idea con sus propias fotos y detalles. Como ejemplo, OpenAI destaca un prompt viral que genera retratos al estilo de los años 80.
¿Cómo se posicionan los modelos en el ranking de la Arena?
En la tabla de clasificación de texto a imagen de Arena, los nuevos modelos ocupan actualmente los dos primeros puestos. GPT-Image-2.5 Sunburst lidera con una puntuación de 1421, seguido por GPT-Image-2.5 Flare con 1399. Ambas puntuaciones llevan la etiqueta "Preliminar" y se basan en un conteo de votos aún bajo, de alrededor de 3.100 y 2.900 respectivamente. En tercer lugar se encuentra el predecesor GPT-Image-2 con 1381 puntos obtenidos de aproximadamente 78.700 votos.
Detrás se ubican mai-image-2.6 de Microsoft (1331), grok-imagine-image-2.0 de SpaceXAI (1315), y varios modelos de Reve, Meta, Google y Bytedance. Dado que las calificaciones para los dos nuevos modelos de OpenAI son preliminares, su posición podría cambiar a medida que se reciban más votos.
Marcado de agua en asociación con Google DeepMind
Para el etiquetado de procedencia, OpenAI sigue confiando en el estándar industrial C2PA, que integra metadatos para el seguimiento. Para hacer la procedencia más resistente, OpenAI también añade un marcado de agua invisible mediante SynthID de Google DeepMind en ChatGPT, Codex y la API. OpenAI sostiene que no existe una solución única para el etiquetado de procedencia, razón por la cual adopta un enfoque por capas. Images 2.5 ya está disponible a nivel mundial para todos los usuarios de ChatGPT, ChatGPT Work y Codex en escritorio, móvil y web.
Vía The Decoder.




