تصاویر ChatGPT نسخه ۲.۵ اینجا است: این بار مدلهای تصویری خام دیگر واقعاً باید نگران باشند
نویسنده: شیائو جینگ، سردبیر فناوری تنسنت
ویراستار: شو قینگیانگ، سردبیر فناوری تنسنت
در ۸ سپتامبر، به وقت محلی ایالات متحده، اوپنایآی آخرین مدل تولید تصویر خود را با نام «تصاویر ChatGPT نسخه ۲.۵» منتشر کرد.
نسخه جدید بر بهبود ویرایش تصویر، وفاداری به تصویر مرجع و ثبات در اصلاحات چندمرحلهای تمرکز دارد. هنگامی که کاربران تصویر را بهصورت مداوم اصلاح میکنند، محتوای قبلاً تنظیمشده احتمال بیشتری دارد که حفظ شود. ویرایش فقط بخشهای مشخصی مانند شخصیتها، محصولات یا پسزمینهها نیز آسانتر شده است. سرعت تولید تا ۵۰٪ نسبت به نسخه ۲.۰ افزایش یافته است.
همزمان، ChatGPT ویژگیهای اسکیس، قالبها و نظردهی روی تصاویر را اضافه کرده است. کاربران میتوانند مستقیماً اسکیس رسم کنند یا نواحی مورد نیاز برای اصلاح را روی تصاویر علامتگذاری کنند. توسعهدهندگان میتوانند از طریق API از مدلهای GPT-Image-2.5 Flare و GPT-Image-2.5 Sunburst استفاده کنند.
اوپنایآی اعلام کرده که در حال حاضر کاربران هفتگی بیش از ۳ میلیارد تصویر را از طریق تصاویر ChatGPT و مدل GPT-Image در API تولید میکنند. نسخه ۲.۵ برای کاربران ChatGPT، ChatGPT Work و Codex در دسترس قرار گرفته و پوشش وب، دسکتاپ و موبایل را شامل میشود.

تغییر یک بخش، نه کل تصویر
مشکل واقعی تصاویر تولیدشده توسط هوش مصنوعی اغلب پس از تولید اولیه تصویر ظاهر میشود؛ مثلاً زمانی که شخصیت مطلوب است ولی فقط لباس آن باید تغییر کند، یا محصول تأیید شده است اما پسزمینه باید عوض شود، یا پوستر تمام شده اما تنها یک خط متن باید اصلاح گردد. در گذشته، ادامه ویرایش ممکن بود باعث تغییر سایر بخشهای تصویر نیز شود.
تصاویر ۲.۵ ویرایش دقیق را در جایگاه برجستهای قرار داده است. اوپنایآی نمونههایی مانند «ویرایش کامل بدن» و «بلیط سفر چندشهری» ارائه کرده است. این نمایشها از تصاویر متوالی برای نشان دادن فرآیند اصلاح استفاده میکنند و بر اینکه آیا مدل محتوای مشخصشده را طبق دستورالعملها تغییر میدهد در حالی که موضوع اصلی، ترکیب و سایر جزئیات حفظ میشوند، تمرکز دارند.

نمونه «بلیط سفر چندشهری» نسبتاً سادهتر قابل درک است. اگر تنها یک قطعه اطلاعات در تصویر باید تغییر کند، مدل باید شیء خاص مورد نیاز را شناسایی کند و در عین حال ساختار کلی طراحی بلیط را حفظ کند. این قابلیت برای تصاویر محصولات، مواد تبلیغاتی و پوسترهای برندها کاربردیتر از صرفاً تولید یک تصویر زیبا است.
تمرکز دیگر بر ویرایش چندمرحلهای است. اوپنایآی سه مورد را نمایش داده است: «چرخش مکعب»، «انفوگرافیک سفر» و «شمعهای تولد». اینها تولیدهای تکباره نیستند، بلکه شامل چندین اصلاح مداوم هستند. اوپنایآی قصد دارد نشان دهد که تغییرات قبلی حفظ میشوند و عملیات بعدی محتوای انجامشده را مختل نمیکنند.

این هم مهمترین جنبه بهروزرسانی تصاویر ۲.۵ است.
کاربر @thesoragirls تستی ساده انجام داد: رسم یک شمع در تصویر و مشخص کردن اینکه یک گلبرگ بدون تغییر باقی بماند، سپس بررسی اینکه آیا مدل هنگام اصلاح سایر نواحی بر محتوای اصلی تأثیر میگذارد یا خیر. نتایج تست او نشان داد که گلبرگ ثابت حفظ شده و سایر بخشها مطابق نیاز تغییر کردهاند.

با این حال، ویرایش پیوسته هنوز بهطور کامل مشکلات جزئیات را حل نکرده است. انیماتور ژاپنی @genel_ai در آزمونهای عملی کشف کرد که اگرچه شرکت رسمی تأکید کرده بود کیفیت تصویر پس از ویرایشهای مکرر حفظ میشود، اما با لایهبندی مداوم ویرایشها همچنان باگها و تغییرات بافتی رخ میدهد.

به عبارت دیگر، اگرچه نسخهٔ ۲.۵ پایداری را بهبود بخشیده است، اما در صحنههای پیچیده همچنان افت کیفیت امکانپذیر است.
۰۲ تصویر مرجع، پایدارتر
دومین تغییر در تصاویر نسخهٔ ۲.۵ نحوهٔ برخورد با تصاویر مرجع است.
کاربران میتوانند عکسهایی از شخصیتها، حیوانات خانگی یا سایر موضوعات ارائه داده و سپس درخواست کنند که این عناصر وارد صحنهای جدید شوند، سبک بصریشان تغییر کند یا ترکیب تصویر اصلاح گردد. اوپنایآی اعلام کرده که نسخهٔ جدید در حفظ ویژگیهای تشخیصپذیر شخصیتها عملکرد بهتری دارد و همچنین عملکرد روشنایی و بافت را بهبود بخشیده است.
نمونههای رسمی شامل پنج مورد است: «پرترهٔ بازطراحیشدهٔ نوزاد»، «سگ با لباس»، «پرترهٔ عکاسی در غرفهٔ عکاسی»، «عکس ترکیبی مهمانی گروهی» و «درست کردن تخت».

این موارد موقعیتهای مختلفی را پوشش میدهند. پرترهٔ نوزاد و پرترهٔ غرفهٔ عکاسی عمدتاً بر حفظ ویژگیهای شخصیت تمرکز دارند؛ مورد سگ بررسی میکند که آیا موضوع پس از تغییر لباس همچنان تصویر اصلی خود را حفظ میکند؛ عکس ترکیبی مهمانی گروهی شامل ظاهر شدن چندین شخصیت در یک تصویر است؛ و «درست کردن تخت» نزدیکتر به ویرایش روزمرهٔ تصاویر است و نیازمند تنظیمات خاصی در صحنهٔ اصلی است.

این قابلیت بهویژه برای کارهایی که نیازمند استفادهٔ پیوسته از یک شخصیت، محصول یا محتوای برند هستند، حائز اهمیت است. کاربران API میتوانند نسخههای مختلفی را بر اساس یک تصویر مرجع ایجاد کنند و احتمال تغییرات چشمگیر در هر تولید جدید را کاهش دهند.
تصاویر پیچیده نیز این بار در نمونههای رسمی مورد توجه قرار گرفتهاند. اوپنایآی یک تصویر خانوادگی سبک دههٔ ۱۹۵۰ را نمایش داده است: خانوادهای که در مقابل یک زیستبوم فضایی استوانهای عظیم ایستادهاند که مناظر سبز، دریاچهها و ساختمانهای آیندهنگر را در خود جای داده است.

صفحهٔ رسمی معرفی اوپنایآی یک صفحهٔ سفر برای «یچانگ» را نمایش داده است: قرار دادن مقاصد سفر، اطلاعات ج attractions، تصاویر و محتوای متنی روی یک صفحه، تا یک راهنمای سفر کامل ایجاد شود. این کار نیازمند مدیریت همزمان چندین تصویر، سطوح مختلف متن و طرحبندی صفحه است، نه صرفاً تمرکز بر عناصر جداگانه.

همچنین مجموعهای از نُه پوستر مدرنیستی از دوران قرون وسطی وجود دارد که هر کدام حاوی اشکال هندسی و متنهای متفاوتی هستند، از جمله «ایجاد کنید»، «با هم رشد کنید» و «مهربانی را انتخاب کنید».
تصویر دیگری توصیف امپرسیونیستی از خیابانهای سانفرانسیسکو است که خیابان میان خانههای رنگارنگ ادامه یافته و خلیج و پل گلدن گیت را آشکار میسازد.

علاوه بر این، دعوتنامههای ازدواج دریاچهٔ کومو با رنگهای کرمی-طلایی، شهرهای آیندهنگر وارونه، هشت تمبر رترو از پارکهای ملی ایالات متحده، اسلایدهای علمی لکههای خورشیدی، ترکیبیهای آبی-طلایی از زمین، پوسترهای استیکر ChatGPT و شهرهای آیندهنگر در باران نیز وجود دارند.

این نمونهها انواع مختلفی مانند تصاویر توضیحی، پوسترها، دعوتنامهها، اینفوگرافیکها، تصاویر علمی توضیحی و تصاویر تبلیغاتی محصول را پوشش میدهند. تمرکز OpenAI نیز بسیار روشن است: وقتی پُرامپت ساختار تصویر، متن، سبک بصری و عناصر خاص را همزمان مشخص میکند، تصاویر نسخهٔ ۲٫۵ میتوانند این نیازها را کاملتر اجرا کنند.
یانا وِلیندر، کارآفرین حوزهٔ مد، معتقد است تصاویر نسخهٔ ۲٫۵ بهبود قابلتوجهی در عملکرد طراحی مد داشته است. قبلاً با استفاده از مدل قدیمی، طرحهای مرجع قابل حفظ بودند، اما گاهی اثر نهایی نسبتاً تخت و بیعمق بود؛ او معتقد است نسخهٔ ۲٫۵ امکان ارائهٔ اثر بصری کاملتری از طرح اصلی را فراهم میکند.

با این حال، برخی نتایج آزمایشی مخالف ارائه دادهاند. مارک کرشمن، مهندس هوش مصنوعی و نرمافزار، بهطور خاص آزمایشهای نویز و اشکالات بصری را در صحنههای جنگلی انجام داده است.

او معتقد است که اگرچه نسخهٔ ۲٫۵ بهبودهای زیادی دارد، اما نتایج آزمایشها پایدار نیستند. سپس تصاویر نسخهٔ ۲٫۵ را با تصاویر نسخهٔ ۲٫۰ مقایسه کرد و در چند مورد آزمایششده، نسخهٔ ۲٫۰ از نظر واقعگرایی عملکرد بهتری داشت.
بنابراین، قضاوت دقیقتر فعلی این است که تصاویر نسخهٔ ۲٫۵ عمدتاً در کنترل ویرایش و پردازش دستورات پیچیده بهبود یافتهاند، اما اثرات واقعی هنوز در انواع مختلف تصاویر متفاوت است.
۰۳ چند خط کشیدن کافی است، آن را متوجه میشود
علاوه بر خود مدل، OpenAI روشهای عملیاتی جدیدی را به ChatGPT اضافه کرده است.
مستقیمترین این روشها، «طرح اولیه» (Sketch) است. کاربران میتوانند مستقیماً در ChatGPT طرح اولیه رسم کنند و سپس اجازه دهند مدل بر اساس آن طرح، تصویر نهایی را تولید کند. برای مثال، اگر میخواهید اتاقی طراحی کنید، ابتدا میتوانید چیدمان کلی را رسم کنید؛ اگر قصد ساخت لباسی را دارید، میتوانید ابتدا خطوط اصلی را بکشید؛ یا حتی اگر فقط یک ترکیببندی تقریبی را سریع رسم کنید، میتوانید آن را به ChatGPT بسپارید تا تکمیل شود. سپس میتوانید سبکهای بصری و سایر نیازمندیها را اضافه کنید.
برای استفاده، کافی است «@طرح اولیه.» را وارد کنید. این کار بهطور مؤثری وابستگی به پُرامپتهای متنی را کاهش میدهد. برخی ترکیببندیها را بهسختی میتوان با کلمات توصیف کرد، بهویژه موقعیتها، تناسبها و خطوط تقریبی اشیا. اکنون کاربران میتوانند ابتدا رسم کنند و سپس اجازه دهند مدل جزئیات را تکمیل کند.
کاربر @fquolodasha آزمایش کرد و توانایی رسم دستی GPT-Image2.5 را بسیار بالا ارزیابی کرد و این بار اثر را «واقعاً عالی» خواند و از بهروزرسانیهای سریع اخیر و بهبودهای قابلتوجه تواناییهای OpenAI تقدیر کرد.

قالبها نیز مشکل دیگری را حل میکنند. ChatGPT قالبهای رایج ایجاد محتوا مانند «پوستر» و «محصولات» را اضافه کرده است. کاربران ابتدا یک قالب را انتخاب میکنند، سپس اطلاعات مورد نظر، عناصر طراحی و سبک بصری را وارد میکنند و نیازی نیست هر بار از صفحهای خالی شروع کنند.
همچنین در اشتراکگذاری تصاویر، گزینهٔ «پُرامپت» اضافه شده است. کاربران اکنون میتوانند همراه با اشتراکگذاری تصویر، پُرامپت مورد استفاده برای تولید آن را نیز به اشتراک بگذارند. دیگران سپس میتوانند عکسها و جزئیات خود را جایگزین کنند و تولید را ادامه دهند.
مثالی که OpenAI ارائه کرده، پرترهای در سبک دههٔ ۱۹۸۰ است: موی مجعد، جکت رنگارنگ، زنجیر طلا و نورهای نئون و پخشکنندهٔ موسیقی. سایر کاربران میتوانند از این ایده پیروی کرده و عکسهای خود را جایگزین کنند.

۰۴ دو نسخهٔ API
تصاویر نسخهٔ ۲٫۵ همچنین در API ادغام شده است. OpenAI دو نسخهٔ GPT-Image-2.5 Flare و GPT-Image-2.5 Sunburst را رونمایی کرده است.
فلیر نسخهٔ پیشفرض است و بر سرعت، کیفیت و قابلیتهای ویرایش تمرکز دارد. اوپنآیآی ادعا میکند که کیفیت تولیدی آن بالاتر از GPT-Image-2 است و همچنین تأخیر را ۵۰٪ کاهش میدهد؛ بنابراین برای محتوای اجتماعی، تجربه محصولات، جستجوی تصویری، پروتوتایپسازی سریع و تولید انبوه تصاویر مناسب است.
در مقابل، سنبرست بیشتر برای کارهایی طراحی شده که کنترل دقیقتری نیاز دارند، مانند مواد تبلیغاتی رسمی و تصاویر باکیفیت محصولات. این مدل زمان تولید طولانیتری را در ازای دقت بالاتر در ویرایش میپذیرد.
بازخوردهای اولیه کاربران منتشرشده توسط اوپنآیآی نیز بر کنترل ویرایش تمرکز داشته است.
آکسولتان علیمکولوف، رهبر محصول هوش مصنوعی در هیگسفیلد، بهطور خاص اشاره کرد که فلیر درک بهتری از عناصری دارد که باید بدون تغییر باقی بمانند. برای تیمهای فیلم، محتوای کاربر-ساختهشده (UGC) و تبلیغات، این بدان معناست که هنگام ویرایش یک عنصر، شخصیت اصلی، ترکیب و تشخیص بصری تا حد امکان حفظ میشوند.
کارآفرین سریالی @gkxspace این بهروزرسانی را در گردشکارهای تجاری تصاویر مشاهده کرده است. او معتقد است که یکی از بزرگترین محدودیتهای تصاویر تولیدشده توسط هوش مصنوعی در گذشته این بود که اگرچه تصویر اول ممکن بود خوب باشد، اما تولید تصویر دوم یا سوم پایدار و سازگون با آن دشوار بود. تغییرات ایمیجز ۲.۵ در زمینه ویرایش پیوسته، سرعت و وفاداری تصاویر مرجع، فضای کاربردی عملیتری برای سناریوهایی مانند تغییر لباس در تجارت الکترونیک، گسترش مواد برند و تصاویر متوالی فراهم کرده است.

در حال حاضر، ایمیجز ۲.۵ برای کاربران چتجیپیتی، چتجیپیتی وُرک و کُدِکس در دسترس است و نسخههای فلیر و سنبرست آن در API نیز باز شدهاند. اوپنآیآی مکانیزمهایی مانند بررسی امنیت پرامپت و تصویر، متادیتای C2PA و واترمارکهای نامرئی برای شناسایی تصاویر تولیدشده توسط ابزارهایش حفظ کرده است.
با توجه به نمونههای رسمی و آزمایشهای فعلی کاربران، تمرکز این بهروزرسانی بسیار متمرکز است: تسهیل کنترل ویرایش پس از تولید تصویر، اطمینان از پایداری بیشتر تصاویر مرجع در استفاده پیوسته و ادغام عملیاتی مانند اسکیس، قالبها و پاداشدهی به تصاویر در گردشکار.
در مورد واقعگرایی، جزئیات و کیفیت تصویر پس از چندین دور ویرایش، آزمایشهای موجود نتایج متفاوتی نشان دادهاند. اینکه این مسائل در ایمیجز ۲.۵ تا چه حد بهبود یابند، هنوز نیازمند استفاده عملی بیشتر برای ارزیابی است.


