ChatGPT Images 2.5 è arrivato: questa volta gli altri modelli di generazione di immagini devono davvero preoccuparsi
Autore: Xiao Jing, redattore di Tencent Technology
Editor: Xu Qingyang, redattore di Tencent Technology
L’8 settembre, ora locale negli Stati Uniti, OpenAI ha rilasciato il nuovo modello di generazione di immagini ChatGPT Images 2.5.
Questa versione migliora l’editing delle immagini, la fedeltà rispetto alle immagini di riferimento e la coerenza nelle modifiche ripetute. Quando si modifica più volte un’immagine, i contenuti precedentemente regolati vengono conservati con maggiore probabilità. Risulta inoltre più facile modificare solo le parti specificate (personaggi, prodotti o sfondi). La velocità di generazione è fino al 50% superiore rispetto a Images 2.0.
Inoltre, ChatGPT ha introdotto le funzioni Sketch, Modelli e commenti alle immagini: gli utenti possono disegnare schizzi come riferimento oppure evidenziare direttamente le aree da modificare. Gli sviluppatori possono utilizzare tramite API i modelli GPT-Image-2.5 Flare e GPT-Image-2.5 Sunburst.
OpenAI afferma che attualmente gli utenti generano oltre 3 miliardi di immagini settimanalmente tramite ChatGPT Images e il modello GPT-Image nell’API. Images 2.5 è già disponibile per gli utenti di ChatGPT, ChatGPT Work e Codex, su piattaforme web, desktop e mobile.

01 Modifica una parte, non l’intera immagine
Il vero problema delle immagini generate dall’IA sorge spesso dopo la prima generazione. Ad esempio, se un personaggio è soddisfacente ma va cambiato solo l’abbigliamento; se un prodotto è confermato ma va sostituito solo lo sfondo; se un manifesto è completato ma va modificata una sola riga di testo. In passato, proseguire con le modifiche poteva alterare anche altre parti dell’immagine.
Images 2.5 mette l’editing preciso al centro dell’attenzione. OpenAI fornisce esempi come «Modifica corpo intero» e «Biglietto viaggio multi-città», mostrando il processo di modifica attraverso immagini consecutive, con particolare attenzione alla capacità del modello di adattare il contenuto richiesto mantenendo soggetto, composizione e altri dettagli originali.

L’esempio del «Biglietto viaggio multi-città» è relativamente intuitivo: se va modificata una sola informazione nell’immagine, il modello deve identificare l’oggetto specifico da modificare, preservando però la struttura complessiva del biglietto. Questa capacità è più utile per immagini di prodotto, materiali pubblicitari e manifesti di marca che non semplicemente generare un’immagine esteticamente gradevole.
Un altro focus è l’editing multi-turno. OpenAI presenta tre casi: «Rotazione cubo», «Infografica viaggio» e «Candele compleanno». Non si tratta di generazioni singole, bensì di modifiche continue. L’obiettivo è dimostrare che le modifiche precedenti vengono conservate e che operazioni successive non alterano ripetutamente i contenuti già completati.

Questo è infatti l’aspetto più significativo dell’aggiornamento di Images 2.5.
L’utente @thesoragirls ha condotto un test semplice: disegnare una candela nell’immagine specificando che un petalo dovesse rimanere invariato, poi verificare se il modello avrebbe alterato il contenuto originale modificando altre zone. I risultati hanno mostrato che il petalo fissato è stato conservato, mentre le altre parti sono cambiate come richiesto.

Tuttavia, la modifica continua non ha risolto del tutto i problemi di dettaglio. L’animatore giapponese @genel_ai ha rilevato, in test pratici, che, sebbene l’ufficio abbia sottolineato come la qualità dell’immagine possa essere mantenuta dopo più modifiche, possono comunque verificarsi artefatti e variazioni di texture sovrapponendo ripetutamente le modifiche.

In altre parole, sebbene la versione 2.5 migliori la stabilità, si può ancora verificare una perdita di qualità in scene complesse.
02 Immagini di riferimento, più stabili
Il secondo cambiamento in Images 2.5 riguarda la gestione delle immagini di riferimento.
Gli utenti possono fornire foto di personaggi, animali domestici o altri soggetti, quindi chiedere di inserirli in una nuova scena, cambiarne lo stile visivo o la composizione. OpenAI afferma che la nuova versione mantiene meglio le caratteristiche riconoscibili dei personaggi, migliorando al contempo resa di luci e texture.
Gli esempi ufficiali includono cinque casi: «Ritratto di neonato rivisitato», «Cane in costume», «Ritratto da fotobox», «Foto composita di gruppo per festa» e «Fare il letto».

Questi casi coprono situazioni diverse: il ritratto di neonato e quello da fotobox verificano soprattutto il mantenimento delle caratteristiche del personaggio; il caso del cane valuta se il soggetto conserva l’aspetto originale dopo aver cambiato abbigliamento; la foto composita di gruppo coinvolge più personaggi nello stesso quadro; «Fare il letto» si avvicina invece all’editing quotidiano di immagini, richiedendo aggiustamenti specifici della scena originale.

Questa funzionalità è particolarmente importante per lavori che richiedono l’uso continuativo dello stesso personaggio, prodotto o materiale di marca. Gli utenti API possono generare versioni diverse partendo dalla stessa immagine di riferimento, riducendo la probabilità di variazioni significative ad ogni nuova generazione.
Anche le immagini complesse sono un focus degli esempi ufficiali di questa edizione. OpenAI ha presentato un’illustrazione familiare in stile anni ’50: una famiglia in posa davanti a un enorme habitat spaziale cilindrico contenente paesaggi verdi, laghi e edifici futuristici.

La pagina introduttiva ufficiale di OpenAI mostra una pagina di viaggio per Yichang: destinazioni turistiche, informazioni sulle attrazioni, immagini e testi sono riuniti nella stessa pagina, creando una guida completa. Ciò richiede la gestione simultanea di più immagini, testi su diversi livelli e layout di pagina, non limitandosi a singoli elementi.

È presente anche una serie di nove manifesti modernisti ispirati al Medioevo, ciascuno con forme geometriche e testi diversi, tra cui «Crea», «Cresciamo insieme» e «Scegli la gentilezza».
Un’altra immagine è una rappresentazione impressionista delle strade di San Francisco, con la via che si snoda tra case colorate, rivelando la baia e il Golden Gate Bridge.

Tra gli altri esempi figurano inviti nuziali per il Lago di Como in tonalità crema-dorate, città futuristiche capovolte, otto francobolli retrò dei parchi nazionali statunitensi, slide scientifiche sulle protuberanze solari, mosaici terrestri blu-dorati, poster con sticker ChatGPT e città futuristiche sotto la pioggia.

Questi esempi coprono diversi tipi: illustrazioni, manifesti, inviti, infografiche, illustrazioni scientifiche e immagini promozionali di prodotti. L’obiettivo di OpenAI è chiaro: quando il prompt specifica struttura dell’immagine, testo, stile visivo ed elementi specifici contemporaneamente, Images 2.5 soddisfa tali richieste in modo più completo.
L’imprenditrice della moda Yana Welinder ritiene che Images 2.5 mostri un netto miglioramento nelle prestazioni di design moda. Con il vecchio modello era possibile mantenere i disegni di riferimento, ma l’effetto finale risultava talvolta piatto; secondo lei, la versione 2.5 rende l’originale con un effetto visivo più completo.

Tuttavia, alcuni hanno ottenuto risultati contrastanti. L’ingegnere AI e software Mark Kretschmann ha condotto test specifici su rumore e artefatti in scene boschive.

Secondo lui, sebbene la versione 2.5 presenti molti miglioramenti, i risultati dei test non sono stabili. Confrontando Images 2.5 con Images 2.0, ha riscontrato che, in diversi casi testati, la 2.0 offre maggiore realismo.
Pertanto, una valutazione più accurata al momento è che Images 2.5 ha migliorato soprattutto il controllo nell’editing e la gestione di istruzioni complesse, ma i risultati effettivi variano a seconda del tipo di immagine.
03 Disegna poche linee, e viene capito
Oltre al modello stesso, OpenAI ha aggiunto a ChatGPT diversi nuovi metodi operativi.
Il più immediato è Sketch: gli utenti possono disegnare direttamente uno schizzo in ChatGPT e far generare l’immagine finale in base a esso. Ad esempio, per progettare una stanza si può tracciare prima la pianta generale; per un capo d’abbigliamento, l’outline; o anche solo uno schizzo rapido della composizione, da affidare poi a ChatGPT per completarlo. In seguito si possono aggiungere stili visivi e altri dettagli.
Per usarlo basta digitare “@Sketch.” Ciò riduce efficacemente la dipendenza dai prompt testuali. Alcune composizioni sono difficili da descrivere a parole, specialmente posizioni, proporzioni e contorni approssimativi degli oggetti. Ora si può disegnare prima e lasciare che il modello completi i dettagli.
L’utente @fquolodasha ha testato e valutato molto positivamente la capacità di disegno manuale di GPT-Image2.5, definendola questa volta «davvero impressionante», esprimendo ammirazione per gli aggiornamenti rapidi e i progressi delle capacità di OpenAI.

I template risolvono un altro problema: ChatGPT ha introdotto formati comuni di creazione, come Poster e Merch. Gli utenti selezionano innanzitutto un template, quindi inseriscono le informazioni da esprimere, gli elementi grafici e lo stile visivo, senza dover partire ogni volta da zero.
La condivisione di immagini include ora anche l’opzione Prompt: gli utenti possono condividere insieme all’immagine anche il prompt utilizzato per generarla. Altri possono quindi sostituire foto e dettagli personali per continuare la generazione.
Un esempio fornito da OpenAI è un ritratto nello stile anni ’80: capelli ricci, giacca colorata, catena d’oro, luci al neon e lettore musicale. Altri utenti possono ispirarsi a questa idea e inserire le proprie foto.

04 Due versioni API
Images 2.5 è stato integrato anche nell’API. OpenAI ha lanciato GPT-Image-2.5 Flare e GPT-Image-2.5 Sunburst.
Flare è la versione predefinita, incentrata su velocità, qualità e capacità di modifica. OpenAI afferma che genera immagini di qualità superiore rispetto a GPT-Image-2, riducendo la latenza del 50%, risultando così adatto per contenuti social, esperienze prodotto, ricerche visive, prototipazione rapida e generazione su larga scala di immagini.
Sunburst, invece, è più orientato a lavori che richiedono un controllo preciso, come materiali pubblicitari formali e immagini prodotto di alta qualità. Consente tempi di generazione più lunghi in cambio di una maggiore precisione nelle modifiche.
I primi feedback utente diffusi da OpenAI hanno anch’essi evidenziato il controllo delle modifiche.
Axultan Alimkulov, responsabile AI prodotto di Higgsfield, ha specificato che Flare comprende meglio quali elementi debbano rimanere invariati. Per team cinematografici, UGC e pubblicitari, ciò significa che, modificando un singolo elemento, si preservano al massimo possibile il personaggio originale, la composizione e il riconoscimento visivo.
L’imprenditore seriale @gkxspace ha osservato questo aggiornamento nei flussi commerciali di immagini. Ritiene che uno dei principali limiti delle immagini generate in passato fosse che, sebbene la prima immagine potesse essere buona, era difficile produrne in modo coerente una seconda o terza stabile a partire da essa. Le novità di Images 2.5 riguardo modifiche continue, velocità e fedeltà delle immagini di riferimento ampliano l’uso pratico in scenari come cambi outfit nell’e-commerce, estensione materiali brand e illustrazioni continue.

Attualmente Images 2.5 è disponibile per ChatGPT, ChatGPT Work e utenti Codex; Flare e Sunburst sono inoltre accessibili tramite API. OpenAI ha mantenuto meccanismi come controlli di sicurezza su prompt e immagini, metadati C2PA e watermark invisibili per identificare le immagini generate dai suoi strumenti.
Dai casi ufficiali e dai test attuali degli utenti, l’obiettivo di questo aggiornamento è molto chiaro: rendere più controllabili le modifiche successive alla generazione, garantire maggiore stabilità delle immagini di riferimento durante utilizzi ripetuti e integrare operazioni come Sketch, template e annotazioni direttamente nel flusso di lavoro.
Per quanto riguarda realismo, dettaglio e qualità dell’immagine dopo più round di editing, i test attuali mostrano risultati variabili. Quanto questi aspetti possano migliorare in Images 2.5 richiederà ulteriori verifiche pratiche.


