ChatGPT 圖像生成 2.5 版登場:此次其他原生圖像模型真該緊張了

Tapbit Wire - Tapbit NewsTapbit Wire·來源:ChainCatcher·
分享

作者:肖靜,騰訊科技

編輯:徐慶陽,騰訊科技

美國當地時間 9 月 8 日,OpenAI 推出最新圖像生成模型 ChatGPT Images 2.5。

新版強化圖像編輯、參考圖保真度及多輪修改的一致性。用戶持續修改圖像時,先前調整內容更易保留;修改人物、商品或背景時,也更易僅變更指定部分。生成速度較 Images 2.0 最快提升 50%。

同時,ChatGPT 新增草圖(Sketch)、範本(Templates)與圖像註解功能,用戶可直接繪製草圖作為參考,或於圖像上標示需修改區域;開發者則可透過 API 使用 GPT-Image-2.5 Flare 與 GPT-Image-2.5 Sunburst 模型。

OpenAI 表示,目前用戶每週透過 ChatGPT Images 及 API 中的 GPT-Image 模型產出逾 30 億張圖像。Images 2.5 已向 ChatGPT、ChatGPT Work 及 Codex 用戶開放,支援網頁、桌面與行動平台。

ChatGPT 圖像生成 2.5 版登場:此次其他原生圖像模型真該緊張了

01 僅改一處,不動全圖

AI 生成圖像真正的困擾常發生在首張圖產出後:例如人物滿意,僅需更換服飾;商品確認無誤,只須替換背景;海報完成,卻僅需修改一行文字。過去持續修改,往往導致圖像其他部分同步異動。

Images 2.5 將精準編輯列為重點。OpenAI 提供「全身編輯」與「多城旅遊票券」等範例,以連續圖像展示修改流程,聚焦模型能否依指令調整指定內容,同時保留原始主體、構圖等細節。

ChatGPT 圖像生成 2.5 版登場:此次其他原生圖像模型真該緊張了

「多城旅遊票券」範例較易理解:若圖中僅需更動單一資訊,模型須辨識待修改的特定物件,同時維持票券整體設計結構。此能力對商品圖、廣告素材與品牌海報,實用性遠高於單純產出美觀圖像。

另一重點為多輪編輯。OpenAI 展示「立方體旋轉」、「旅遊資訊圖」與「生日蠟燭」三案例,並非一次性產出,而是多次連續修改。目標在證明先前修改可被保留,後續操作不會持續破壞已完成內容。

ChatGPT 圖像生成 2.5 版登場:此次其他原生圖像模型真該緊張了

這也是 Images 2.5 升級中最值得關注之處。

用戶 @thesoragirls 進行簡明測試:於圖中繪製一支蠟燭,並指定一朵花瓣須保持不變,再觀察模型修改其他區域時是否影響原始內容。結果顯示,固定花瓣確實保留,其餘部分則依需求變更。

ChatGPT 圖像 2.5 登場:此次其他原生圖像模型真的該緊張了

然而,持續編輯仍未完全解決細節問題。日本動畫師 @genel_ai 在實測中發現,儘管官方強調多次編輯後圖像品質仍可維持,但當編輯層層疊加時,仍可能出現偽影與紋理變化。

ChatGPT 圖像 2.5 登場:此次其他原生圖像模型真的該緊張了

換言之,2.5 雖提升了穩定性,但在複雜場景中仍可能產生品質損失。

02 參考圖像,更穩定

Images 2.5 的第二項變更,在於參考圖像的處理方式。

使用者可提供人物、寵物或其他主體的照片,再要求將其置入新場景、變更視覺風格或調整構圖。OpenAI 表示,新版更能保留人物的可辨識特徵,同時提升光影與紋理表現。

官方範例包含五種情境:「重新設計的嬰兒肖像」、「穿戲服的狗」、「照相亭肖像」、「群體派對合成照」與「整理床鋪」。

ChatGPT 圖像 2.5 登場:此次其他原生圖像模型真的該緊張了

這些範例涵蓋不同情境:嬰兒與照相亭肖像著重人物特徵能否保留;狗的案例檢驗更換服裝後主體是否維持原貌;群體派對合成照涉及多角色共存於單一畫面;「整理床鋪」則貼近日常圖像編輯,需針對原始場景進行特定調整。

ChatGPT 圖像 2.5 登場:此次其他原生圖像模型真的該緊張了

此功能對需反覆使用相同人物、產品或品牌素材的工作尤為重要。API 使用者可基於同一張參考圖像生成多種版本,降低每次重新生成時發生顯著變化的機率。

複雜圖像亦是本次官方範例的重點之一。OpenAI 展示了一幅 1950 年代風格的家庭插畫:一家人在巨型圓柱形太空棲息地前合影,內部有綠意景觀、湖泊與未來感建築。

ChatGPT 圖像 2.5 登場:此次其他原生圖像模型真的該緊張了

OpenAI 官方介紹頁面展示了一則宜昌旅遊專頁:將旅遊目的地、景點資訊、圖片與文字內容整合於同一頁面,打造完整旅遊指南。此類應用需同步處理多張圖片、不同層級的文字及整體版面配置,而不僅聚焦於單一元素。

ChatGPT 圖像 2.5 登場:此次其他原生圖像模型真的該緊張了

另有一組九宮格中世紀現代主義海報,各含不同幾何圖形與文字,如「創造」、「共同成長」與「選擇善意」。

另一幅為印象派風格的舊金山街景,街道夾在色彩繽紛的房屋之間延伸而下,遠處可見海灣與金門大橋。

ChatGPT 圖像 2.5 登場:此次其他原生圖像模型真的該緊張了

此外還有奶油金色科莫湖婚禮邀請函、倒置的未來城市、八款美國國家公園復古郵票、太陽耀斑科學簡報圖、藍金色地球馬賽克、ChatGPT 貼紙海報,以及雨中的未來城市。

ChatGPT 圖像 2.5 登場:這次,其他原生圖像模型真的該緊張了

這些範例涵蓋插畫、海報、邀請函、資訊圖表、科學插圖與產品宣傳圖等多種類型。OpenAI 的聚焦點也很明確:當提示同時指定圖像結構、文字、視覺風格與具體元素時,Images 2.5 能更完整地達成要求。

時尚創業家 Yana Welinder 認為,Images 2.5 在時尚設計表現上有顯著提升。過去使用舊模型時雖能保留參考設計,但最終效果有時較為平面;她相信 2.5 能讓原始設計呈現更完整的視覺效果。

ChatGPT 圖像 2.5 登場:這次,其他原生圖像模型真的該緊張了

然而,也有相反的測試結果。AI 與軟體工程師 Mark Kretschmann 特別針對森林場景進行雜訊與偽影測試。

ChatGPT 圖像 2.5 登場:這次,其他原生圖像模型真的該緊張了

他認為,儘管 2.5 多有改進,測試結果卻不穩定;他進一步將 Images 2.5 與 Images 2.0 對比,發現其測試的多個案例中,2.0 在寫實度上反而更勝一籌。

因此,目前較準確的判斷是:Images 2.5 主要強化了編輯控制力與複雜指令處理能力,但實際效果仍因圖像類型而異。

03 幾筆勾勒,它就懂了

除了模型本身,OpenAI 亦為 ChatGPT 新增多項操作方式。

最直接的是「草圖(Sketch)」功能:用戶可直接於 ChatGPT 中繪製草圖,再由模型依此生成最終圖像。例如設計房間時先勾勒大致格局;設計服裝時先畫出輪廓;甚至僅快速描繪粗略構圖,也能交由 ChatGPT 完善細節,之後再補充視覺風格等需求。

啟用方式很簡單,只要輸入「@Sketch.」即可,大幅降低對文字提示的依賴。有些構圖難以用文字描述,尤其是物體的位置、比例與粗略輪廓;如今用戶可先手繪,再交由模型填補細節。

用戶 @fquolodasha 測試後給予 GPT-Image2.5 的手繪能力極高評價,稱本次效果「相當驚豔」,並盛讚 OpenAI 近期快速更新與能力提升。

ChatGPT 圖像 2.5 登場:這次,其他原生圖像模型真的該緊張了

範本功能則解決另一問題:ChatGPT 新增了海報、周邊商品等常見創作格式。用戶可先選取範本,再填入欲表達的內容、設計元素與視覺風格,無須每次都從空白畫布開始。

圖像分享功能也新增「提示詞(Prompt)」選項:用戶分享圖像時,可一併分享生成該圖像所用的提示詞,他人便能替換為自己的照片與細節,繼續生成。

OpenAI 提供的範例為「1980 年代風格人像」:捲髮、彩色夾克、金鍊、霓虹燈光與隨身聽;其他用戶可沿用此概念,換上自己的照片。

ChatGPT 圖像 2.5 登場:這次,其他原生圖像模型真的該緊張了

04 兩種 API 版本

Images 2.5 已整合至 API,OpenAI 推出 GPT-Image-2.5 Flare 與 GPT-Image-2.5 Sunburst 兩種版本。

Flare 是預設版本,專注於速度、品質與編輯能力。OpenAI 表示其生成品質高於 GPT-Image-2,且延遲降低 50%,適用於社交內容、產品體驗、視覺搜尋、快速原型設計與大規模圖像生成。

Sunburst 則更適合需精細控制的工作,例如正式廣告素材與高品質產品圖像,以較長生成時間換取更高編輯精準度。

OpenAI 公布的早期用戶回饋亦聚焦於編輯控制力。

Higgsfield 的 AI 產品負責人 Axultan Alimkulov 特別指出,Flare 更能辨識哪些元素應保持不變;對影視、用戶生成內容(UGC)與廣告團隊而言,修改單一元素時,原始角色、構圖與視覺辨識皆可盡可能保留。

連續創業家 @gkxspace 觀察到此更新已融入商業圖像工作流程。他認為過去 AI 產出圖像的最大限制在於:首張圖雖佳,但難以基於它穩定產出一致的第二、三張圖;Images 2.5 在連續編輯、速度與參考圖保真度上的改進,為電商服飾更換、品牌素材延伸與連續插畫等場景拓展了實用空間。

ChatGPT Images 2.5 登場:其他原生圖像模型真的該緊張了

目前 Images 2.5 已涵蓋 ChatGPT、ChatGPT Work 與 Codex 使用者,API 中的 Flare 與 Sunburst 亦已開放。OpenAI 仍保留提示詞與圖像安全審查、C2PA 元資料及隱形浮水印等機制,以標示其工具所生成之圖像。

從官方案例與現有用戶測試可知,本次更新重點極為集中:提升產圖後修改的可控性、確保連續使用時參考圖更穩定,並把草圖、範本與圖像註解等操作整合至工作流程。

至於多次編輯後的真實感、細節與圖像品質,現有測試結果不一;Images 2.5 能改善多少,仍有待更多實際應用驗證。