ChatGPT Imágenes 2.5 ya está aquí: esta vez, otros modelos de imágenes sin procesar deben estar realmente preocupados
Autor: Xiao Jing, redactor de tecnología de Tencent
Editor: Xu Qingyang, redactor de tecnología de Tencent
El 8 de septiembre, hora local en Estados Unidos, OpenAI lanzó su último modelo de generación de imágenes: ChatGPT Imágenes 2.5.
Esta nueva versión mejora la edición de imágenes, la fidelidad respecto a imágenes de referencia y la coherencia en modificaciones sucesivas. Al modificar continuamente una imagen, se conserva mejor el contenido ajustado previamente. Al editar personajes, productos o fondos, también es más fácil cambiar únicamente las partes especificadas. Su velocidad de generación es hasta un 50 % mayor que la de Imágenes 2.0.
Al mismo tiempo, ChatGPT incorpora funciones de boceto (Sketch), plantillas (Templates) y comentarios en imágenes. Los usuarios pueden dibujar directamente bocetos como referencia o marcar las zonas que requieren modificación. Los desarrolladores pueden usar las APIs GPT-Image-2.5 Flare y GPT-Image-2.5 Sunburst.
OpenAI afirma que actualmente los usuarios generan más de 3000 millones de imágenes semanales mediante ChatGPT Imágenes y el modelo GPT-Image en la API. Imágenes 2.5 ya está disponible para usuarios de ChatGPT, ChatGPT Work y Codex, en plataformas web, de escritorio y móviles.

01 Modificar una parte, no toda la imagen
El verdadero problema con las imágenes generadas por IA suele surgir tras generar la primera imagen. Por ejemplo, si el personaje es satisfactorio pero solo hay que cambiar su ropa; si se ha validado un producto pero solo se debe sustituir el fondo; o si se ha terminado un cartel pero solo hay que modificar una línea de texto. Antes, seguir editando podía alterar también otras partes de la imagen.
Imágenes 2.5 prioriza la edición precisa. OpenAI presenta ejemplos como «Edición completa del cuerpo» y «Billete de viaje multi-ciudad», usando secuencias de imágenes para mostrar el proceso de modificación, centrándose en si el modelo puede ajustar el contenido indicado manteniendo el sujeto original, la composición y otros detalles.

El ejemplo del «Billete de viaje multi-ciudad» es más fácil de entender: si solo hay que cambiar un dato en la imagen, el modelo debe identificar con precisión el objeto a modificar, conservando al mismo tiempo la estructura general del billete. Esta capacidad resulta más útil para imágenes de productos, materiales publicitarios y carteles de marca que simplemente generar una imagen bonita.
Otro foco es la edición en varias rondas. OpenAI muestra tres casos: «Rotación de cubo», «Infografía de viaje» y «Velitas de cumpleaños». No se trata de generaciones únicas, sino de múltiples modificaciones sucesivas. OpenAI busca demostrar que las modificaciones previas se conservan y que las posteriores no alteran continuamente lo ya completado.

Este es también el aspecto más destacado de la actualización de Imágenes 2.5.
La usuaria @thesoragirls realizó una prueba sencilla: dibujó una vela en la imagen y especificó que un pétalo debía permanecer inalterado, observando luego si el modelo afectaba dicho pétalo al modificar otras zonas. Sus resultados mostraron que el pétalo fijo se conservó mientras el resto cambiaba según lo requerido.

Sin embargo, la edición continua no ha resuelto del todo los problemas de detalle. El animador japonés @genel_ai descubrió en pruebas prácticas que, aunque la empresa destacó que la calidad de la imagen se mantiene tras múltiples ediciones, aún pueden aparecer artefactos y cambios de textura al superponer ediciones repetidamente.

Es decir, aunque la versión 2.5 mejora la estabilidad, aún puede producirse pérdida de calidad en escenas complejas.
02 Imágenes de referencia, más estable
El segundo cambio en Imágenes 2.5 es el manejo de imágenes de referencia.
Los usuarios pueden proporcionar fotos de personajes, mascotas u otros sujetos y luego solicitar que ingresen a una nueva escena, cambien de estilo visual o modifiquen su composición. OpenAI afirma que la nueva versión retiene mejor las características reconocibles de los personajes y mejora el rendimiento de iluminación y textura.
Los ejemplos oficiales incluyen cinco casos: «Retrato infantil rediseñado», «Perro con disfraz», «Retrato en cabina fotográfica», «Fotografía compuesta de fiesta grupal» y «Haciendo la cama».

Estos casos cubren distintas situaciones: los retratos infantil y en cabina enfatizan si se mantienen las características del personaje; el caso del perro evalúa si el sujeto conserva su imagen original al cambiar de atuendo; la fotografía compuesta de fiesta grupal implica varios personajes en una sola imagen; «Haciendo la cama» se acerca más a la edición cotidiana de imágenes, requiriendo ajustes específicos de la escena original.

Esta capacidad es especialmente importante para trabajos que requieren usar continuamente el mismo personaje, producto o material de marca. Los usuarios de la API pueden generar distintas versiones a partir de la misma imagen de referencia, reduciendo la probabilidad de cambios significativos en cada nueva generación.
Las imágenes complejas también son un foco de los ejemplos oficiales esta vez. OpenAI mostró una ilustración familiar estilo años 50: una familia frente a un enorme hábitat espacial cilíndrico con paisajes verdes, lagos y edificios futuristas.

La página oficial de introducción de OpenAI mostró una página turística de Yichang: combinando destinos, información de atracciones, imágenes y texto en una sola página, creando una guía turística completa. Requiere gestionar múltiples imágenes, distintos niveles de texto y diseños de página simultáneamente, no solo centrarse en elementos individuales.

También hay un conjunto de nueve carteles modernistas medievales, cada uno con distintas formas geométricas y textos como «Crear», «Crecer juntos» y «Elegir la bondad».
Otra imagen es una representación impresionista de calles de San Francisco, donde la calle se extiende entre casas coloridas, revelando la bahía y el Puente Golden Gate.

Además, hay invitaciones nupciales para el lago Como en tonos crema y dorado, ciudades futuristas invertidas, ocho sellos retro de parques nacionales estadounidenses, diapositivas científicas de llamaradas solares, mosaicos terrestres azul-dorados, pósteres con pegatinas de ChatGPT y ciudades futuristas bajo la lluvia.

Estos ejemplos abarcan distintos tipos: ilustraciones, carteles, invitaciones, infografías, ilustraciones científicas e imágenes promocionales de productos. El enfoque de OpenAI también es muy claro: cuando el prompt especifica simultáneamente la estructura de la imagen, el texto, el estilo visual y elementos concretos, Imágenes 2.5 cumple mejor estos requisitos.
La emprendedora de moda Yana Welinder considera que Imágenes 2.5 muestra una mejora notable en diseño de moda. Antes, con el modelo anterior, se conservaban los diseños de referencia, pero el resultado final a veces era relativamente plano; según ella, la versión 2.5 permite presentar el diseño original con un efecto visual más completo.

No obstante, algunos han obtenido resultados contrastantes. El ingeniero de IA y software Mark Kretschmann realizó pruebas específicas de ruido y artefactos en escenas forestales.

Él considera que, aunque 2.5 incorpora muchas mejoras, sus resultados no son estables. Al comparar Imágenes 2.5 con Imágenes 2.0, halló que, en varios casos probados, la versión 2.0 superaba a la 2.5 en realismo.
Por tanto, una evaluación más precisa actualmente es que Imágenes 2.5 ha mejorado principalmente el control de edición y la gestión de instrucciones complejas, aunque los resultados reales varían según el tipo de imagen.
03 Dibuja unas pocas líneas y lo entiende
Además del modelo en sí, OpenAI ha incorporado varios nuevos métodos de operación a ChatGPT.
El más directo es «Boceto». Los usuarios pueden dibujar bocetos directamente en ChatGPT y luego dejar que el modelo genere la imagen final basándose en ese boceto. Por ejemplo, para diseñar una habitación, primero se puede trazar su distribución general; para crear una prenda, el contorno; o incluso un esquema rápido de composición, que luego se le entrega a ChatGPT para completarlo. Después se pueden añadir estilos visuales y otros requisitos.
Para usarlo, basta con ingresar «@Boceto.». Esto reduce eficazmente la dependencia de los prompts textuales. Algunas composiciones son difíciles de describir con palabras, especialmente las posiciones, proporciones y contornos aproximados de los objetos. Ahora los usuarios pueden dibujar primero y luego dejar que el modelo complete los detalles.
El usuario @fquolodasha lo probó y calificó muy positivamente la capacidad de dibujo manual de GPT-Imagen 2.5, afirmando que esta vez el resultado es «realmente impresionante» y expresando admiración por las recientes actualizaciones rápidas y mejoras de capacidades de OpenAI.

Las plantillas resuelven otro problema. ChatGPT ha incorporado formatos comunes de creación, como «Cartel» y «Mercancía». Los usuarios seleccionan primero una plantilla, luego completan la información a expresar, los elementos de diseño y el estilo visual, sin tener que empezar desde un lienzo en blanco cada vez.
El intercambio de imágenes también incluye ahora una opción «Prompt». Los usuarios pueden compartir el prompt usado para generar la imagen al compartirla. Otros pueden sustituirlo por sus propias fotos y detalles para seguir generando.
Un ejemplo de OpenAI es un retrato al estilo de los años ochenta: cabello rizado, chaqueta colorida, cadena dorada, luces neón y un reproductor musical. Otros usuarios pueden seguir esta idea y sustituir la foto por la suya propia.

04 Dos versiones de API
Imágenes 2.5 también se ha integrado en la API. OpenAI ha lanzado GPT-Imagen-2.5 Flare y GPT-Imagen-2.5 Sunburst.
Flare es la versión predeterminada, centrada en velocidad, calidad y capacidades de edición. OpenAI afirma que genera imágenes de mayor calidad que GPT-Image-2 y reduce la latencia un 50 %, lo que la hace adecuada para contenido social, experiencias de producto, búsquedas visuales, prototipado rápido y generación masiva de imágenes.
Sunburst, por su parte, está más orientado a trabajos que requieren un control preciso, como materiales publicitarios formales e imágenes de producto de alta calidad. Permite tiempos de generación más largos a cambio de una mayor precisión en la edición.
Los primeros comentarios de usuarios publicados por OpenAI también destacan el control de edición.
Axultan Alimkulov, responsable de productos de IA en Higgsfield, señaló específicamente que Flare entiende mejor qué elementos deben mantenerse inalterados. Para equipos de cine, contenidos generados por usuarios (UGC) y publicidad, esto significa que, al modificar un elemento, se preservan lo máximo posible el personaje original, la composición y el reconocimiento visual.
El emprendedor serial @gkxspace ha observado esta actualización dentro de flujos de trabajo comerciales con imágenes. Considera que una de las mayores limitaciones de las imágenes generadas por IA en el pasado era que, aunque la primera imagen fuera buena, era difícil producir de forma consistente una segunda o tercera imagen estable basada en ella. Las mejoras de Images 2.5 en edición continua, velocidad y fidelidad de imágenes de referencia amplían su utilidad práctica en escenarios como cambios de vestuario en comercio electrónico, extensión de materiales de marca e ilustraciones continuas.

Actualmente, Images 2.5 está disponible para usuarios de ChatGPT, ChatGPT Work y Codex, y también se han abierto Flare y Sunburst en la API. OpenAI mantiene mecanismos como verificaciones de seguridad de prompts e imágenes, metadatos C2PA y marcas de agua invisibles para identificar imágenes generadas con sus herramientas.
Según casos oficiales y pruebas actuales de usuarios, el enfoque de esta actualización es muy claro: facilitar el control de modificaciones posteriores a la generación, garantizar mayor estabilidad de las imágenes de referencia durante su uso continuo e integrar operaciones como bocetos, plantillas y anotaciones de imágenes en el flujo de trabajo.
En cuanto al realismo, los detalles y la calidad de imagen tras varias rondas de edición, las pruebas existentes muestran resultados variables. En qué medida estos aspectos mejoran en Images 2.5 aún requiere más validación práctica.


