تصاویر ChatGPT نسخه ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

Tapbit Wire - Tapbit NewsTapbit Wire·منبع:ChainCatcher·
اشتراک‌گذاری

نویسنده: شیائو جینگ، سردبیر فناوری تنسنت

ویراستار: شو قینگ‌یانگ، سردبیر فناوری تنسنت

در ۸ سپتامبر، به وقت محلی ایالات متحده، اوپن‌ای‌آی آخرین مدل تولید تصویر خود را با نام «تصاویر ChatGPT نسخه ۲.۵» منتشر کرد.

نسخه جدید بر بهبود ویرایش تصویر، وفاداری به تصویر مرجع و ثبات در اصلاحات چندمرحله‌ای تمرکز دارد. هنگامی که کاربران تصویر را به‌صورت مداوم اصلاح می‌کنند، محتوای قبلاً تنظیم‌شده احتمال بیشتری دارد که حفظ شود. ویرایش فقط بخش‌های مشخصی مانند شخصیت‌ها، محصولات یا پس‌زمینه‌ها نیز آسان‌تر شده است. سرعت تولید تا ۵۰٪ نسبت به نسخه ۲.۰ افزایش یافته است.

همزمان، ChatGPT ویژگی‌های اسکیس، قالب‌ها و نظردهی روی تصاویر را اضافه کرده است. کاربران می‌توانند مستقیماً اسکیس رسم کنند یا نواحی مورد نیاز برای اصلاح را روی تصاویر علامت‌گذاری کنند. توسعه‌دهندگان می‌توانند از طریق API از مدل‌های GPT-Image-2.5 Flare و GPT-Image-2.5 Sunburst استفاده کنند.

اوپن‌ای‌آی اعلام کرده که در حال حاضر کاربران هفتگی بیش از ۳ میلیارد تصویر را از طریق تصاویر ChatGPT و مدل GPT-Image در API تولید می‌کنند. نسخه ۲.۵ برای کاربران ChatGPT، ChatGPT Work و Codex در دسترس قرار گرفته و پوشش وب، دسکتاپ و موبایل را شامل می‌شود.

تصاویر ChatGPT نسخه ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

تغییر یک بخش، نه کل تصویر

مشکل واقعی تصاویر تولیدشده توسط هوش مصنوعی اغلب پس از تولید اولیه تصویر ظاهر می‌شود؛ مثلاً زمانی که شخصیت مطلوب است ولی فقط لباس آن باید تغییر کند، یا محصول تأیید شده است اما پس‌زمینه باید عوض شود، یا پوستر تمام شده اما تنها یک خط متن باید اصلاح گردد. در گذشته، ادامه ویرایش ممکن بود باعث تغییر سایر بخش‌های تصویر نیز شود.

تصاویر ۲.۵ ویرایش دقیق را در جایگاه برجسته‌ای قرار داده است. اوپن‌ای‌آی نمونه‌هایی مانند «ویرایش کامل بدن» و «بلیط سفر چندشهری» ارائه کرده است. این نمایش‌ها از تصاویر متوالی برای نشان دادن فرآیند اصلاح استفاده می‌کنند و بر اینکه آیا مدل محتوای مشخص‌شده را طبق دستورالعمل‌ها تغییر می‌دهد در حالی که موضوع اصلی، ترکیب و سایر جزئیات حفظ می‌شوند، تمرکز دارند.

تصاویر ChatGPT نسخه ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

نمونه «بلیط سفر چندشهری» نسبتاً ساده‌تر قابل درک است. اگر تنها یک قطعه اطلاعات در تصویر باید تغییر کند، مدل باید شیء خاص مورد نیاز را شناسایی کند و در عین حال ساختار کلی طراحی بلیط را حفظ کند. این قابلیت برای تصاویر محصولات، مواد تبلیغاتی و پوسترهای برندها کاربردی‌تر از صرفاً تولید یک تصویر زیبا است.

تمرکز دیگر بر ویرایش چندمرحله‌ای است. اوپن‌ای‌آی سه مورد را نمایش داده است: «چرخش مکعب»، «انفوگرافیک سفر» و «شمع‌های تولد». این‌ها تولیدهای تک‌باره نیستند، بلکه شامل چندین اصلاح مداوم هستند. اوپن‌ای‌آی قصد دارد نشان دهد که تغییرات قبلی حفظ می‌شوند و عملیات بعدی محتوای انجام‌شده را مختل نمی‌کنند.

تصاویر ChatGPT نسخه ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

این هم مهم‌ترین جنبه به‌روزرسانی تصاویر ۲.۵ است.

کاربر @thesoragirls تستی ساده انجام داد: رسم یک شمع در تصویر و مشخص کردن اینکه یک گلبرگ بدون تغییر باقی بماند، سپس بررسی اینکه آیا مدل هنگام اصلاح سایر نواحی بر محتوای اصلی تأثیر می‌گذارد یا خیر. نتایج تست او نشان داد که گلبرگ ثابت حفظ شده و سایر بخش‌ها مطابق نیاز تغییر کرده‌اند.

تصاویر ChatGPT نسخهٔ ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

با این حال، ویرایش پیوسته هنوز به‌طور کامل مشکلات جزئیات را حل نکرده است. انیماتور ژاپنی @genel_ai در آزمون‌های عملی کشف کرد که اگرچه شرکت رسمی تأکید کرده بود کیفیت تصویر پس از ویرایش‌های مکرر حفظ می‌شود، اما با لایه‌بندی مداوم ویرایش‌ها همچنان باگ‌ها و تغییرات بافتی رخ می‌دهد.

تصاویر ChatGPT نسخهٔ ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

به عبارت دیگر، اگرچه نسخهٔ ۲.۵ پایداری را بهبود بخشیده است، اما در صحنه‌های پیچیده همچنان افت کیفیت امکان‌پذیر است.

۰۲ تصویر مرجع، پایدارتر

دومین تغییر در تصاویر نسخهٔ ۲.۵ نحوهٔ برخورد با تصاویر مرجع است.

کاربران می‌توانند عکس‌هایی از شخصیت‌ها، حیوانات خانگی یا سایر موضوعات ارائه داده و سپس درخواست کنند که این عناصر وارد صحنه‌ای جدید شوند، سبک بصری‌شان تغییر کند یا ترکیب تصویر اصلاح گردد. اوپن‌ای‌آی اعلام کرده که نسخهٔ جدید در حفظ ویژگی‌های تشخیص‌پذیر شخصیت‌ها عملکرد بهتری دارد و همچنین عملکرد روشنایی و بافت را بهبود بخشیده است.

نمونه‌های رسمی شامل پنج مورد است: «پرترهٔ بازطراحی‌شدهٔ نوزاد»، «سگ با لباس»، «پرترهٔ عکاسی در غرفهٔ عکاسی»، «عکس ترکیبی مهمانی گروهی» و «درست کردن تخت».

تصاویر ChatGPT نسخهٔ ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

این موارد موقعیت‌های مختلفی را پوشش می‌دهند. پرترهٔ نوزاد و پرترهٔ غرفهٔ عکاسی عمدتاً بر حفظ ویژگی‌های شخصیت تمرکز دارند؛ مورد سگ بررسی می‌کند که آیا موضوع پس از تغییر لباس همچنان تصویر اصلی خود را حفظ می‌کند؛ عکس ترکیبی مهمانی گروهی شامل ظاهر شدن چندین شخصیت در یک تصویر است؛ و «درست کردن تخت» نزدیک‌تر به ویرایش روزمرهٔ تصاویر است و نیازمند تنظیمات خاصی در صحنهٔ اصلی است.

تصاویر ChatGPT نسخهٔ ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

این قابلیت به‌ویژه برای کارهایی که نیازمند استفادهٔ پیوسته از یک شخصیت، محصول یا محتوای برند هستند، حائز اهمیت است. کاربران API می‌توانند نسخه‌های مختلفی را بر اساس یک تصویر مرجع ایجاد کنند و احتمال تغییرات چشمگیر در هر تولید جدید را کاهش دهند.

تصاویر پیچیده نیز این بار در نمونه‌های رسمی مورد توجه قرار گرفته‌اند. اوپن‌ای‌آی یک تصویر خانوادگی سبک دههٔ ۱۹۵۰ را نمایش داده است: خانواده‌ای که در مقابل یک زیست‌بوم فضایی استوانه‌ای عظیم ایستاده‌اند که مناظر سبز، دریاچه‌ها و ساختمان‌های آینده‌نگر را در خود جای داده است.

تصاویر ChatGPT نسخهٔ ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

صفحهٔ رسمی معرفی اوپن‌ای‌آی یک صفحهٔ سفر برای «یچانگ» را نمایش داده است: قرار دادن مقاصد سفر، اطلاعات ج attractions، تصاویر و محتوای متنی روی یک صفحه، تا یک راهنمای سفر کامل ایجاد شود. این کار نیازمند مدیریت همزمان چندین تصویر، سطوح مختلف متن و طرح‌بندی صفحه است، نه صرفاً تمرکز بر عناصر جداگانه.

تصاویر ChatGPT نسخهٔ ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

همچنین مجموعه‌ای از نُه پوستر مدرنیستی از دوران قرون وسطی وجود دارد که هر کدام حاوی اشکال هندسی و متن‌های متفاوتی هستند، از جمله «ایجاد کنید»، «با هم رشد کنید» و «مهربانی را انتخاب کنید».

تصویر دیگری توصیف امپرسیونیستی از خیابان‌های سانفرانسیسکو است که خیابان میان خانه‌های رنگارنگ ادامه یافته و خلیج و پل گلدن گیت را آشکار می‌سازد.

تصاویر ChatGPT نسخهٔ ۲.۵ اینجا است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

علاوه بر این، دعوتنامه‌های ازدواج دریاچهٔ کومو با رنگ‌های کرمی-طلایی، شهرهای آینده‌نگر وارونه، هشت تمبر رترو از پارک‌های ملی ایالات متحده، اسلایدهای علمی لکه‌های خورشیدی، ترکیبی‌های آبی-طلایی از زمین، پوسترهای استیکر ChatGPT و شهرهای آینده‌نگر در باران نیز وجود دارند.

تصاویر ChatGPT نسخهٔ ۲٫۵ اکنون در دسترس است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

این نمونه‌ها انواع مختلفی مانند تصاویر توضیحی، پوسترها، دعوتنامه‌ها، اینفوگرافیک‌ها، تصاویر علمی توضیحی و تصاویر تبلیغاتی محصول را پوشش می‌دهند. تمرکز OpenAI نیز بسیار روشن است: وقتی پُرامپت ساختار تصویر، متن، سبک بصری و عناصر خاص را همزمان مشخص می‌کند، تصاویر نسخهٔ ۲٫۵ می‌توانند این نیازها را کامل‌تر اجرا کنند.

یانا وِلیندر، کارآفرین حوزهٔ مد، معتقد است تصاویر نسخهٔ ۲٫۵ بهبود قابل‌توجهی در عملکرد طراحی مد داشته است. قبلاً با استفاده از مدل قدیمی، طرح‌های مرجع قابل حفظ بودند، اما گاهی اثر نهایی نسبتاً تخت و بی‌عمق بود؛ او معتقد است نسخهٔ ۲٫۵ امکان ارائهٔ اثر بصری کامل‌تری از طرح اصلی را فراهم می‌کند.

تصاویر ChatGPT نسخهٔ ۲٫۵ اکنون در دسترس است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

با این حال، برخی نتایج آزمایشی مخالف ارائه داده‌اند. مارک کرشمن، مهندس هوش مصنوعی و نرم‌افزار، به‌طور خاص آزمایش‌های نویز و اشکالات بصری را در صحنه‌های جنگلی انجام داده است.

تصاویر ChatGPT نسخهٔ ۲٫۵ اکنون در دسترس است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

او معتقد است که اگرچه نسخهٔ ۲٫۵ بهبودهای زیادی دارد، اما نتایج آزمایش‌ها پایدار نیستند. سپس تصاویر نسخهٔ ۲٫۵ را با تصاویر نسخهٔ ۲٫۰ مقایسه کرد و در چند مورد آزمایش‌شده، نسخهٔ ۲٫۰ از نظر واقع‌گرایی عملکرد بهتری داشت.

بنابراین، قضاوت دقیق‌تر فعلی این است که تصاویر نسخهٔ ۲٫۵ عمدتاً در کنترل ویرایش و پردازش دستورات پیچیده بهبود یافته‌اند، اما اثرات واقعی هنوز در انواع مختلف تصاویر متفاوت است.

۰۳ چند خط کشیدن کافی است، آن را متوجه می‌شود

علاوه بر خود مدل، OpenAI روش‌های عملیاتی جدیدی را به ChatGPT اضافه کرده است.

مستقیم‌ترین این روش‌ها، «طرح اولیه» (Sketch) است. کاربران می‌توانند مستقیماً در ChatGPT طرح اولیه رسم کنند و سپس اجازه دهند مدل بر اساس آن طرح، تصویر نهایی را تولید کند. برای مثال، اگر می‌خواهید اتاقی طراحی کنید، ابتدا می‌توانید چیدمان کلی را رسم کنید؛ اگر قصد ساخت لباسی را دارید، می‌توانید ابتدا خطوط اصلی را بکشید؛ یا حتی اگر فقط یک ترکیب‌بندی تقریبی را سریع رسم کنید، می‌توانید آن را به ChatGPT بسپارید تا تکمیل شود. سپس می‌توانید سبک‌های بصری و سایر نیازمندی‌ها را اضافه کنید.

برای استفاده، کافی است «@طرح اولیه.» را وارد کنید. این کار به‌طور مؤثری وابستگی به پُرامپت‌های متنی را کاهش می‌دهد. برخی ترکیب‌بندی‌ها را به‌سختی می‌توان با کلمات توصیف کرد، به‌ویژه موقعیت‌ها، تناسب‌ها و خطوط تقریبی اشیا. اکنون کاربران می‌توانند ابتدا رسم کنند و سپس اجازه دهند مدل جزئیات را تکمیل کند.

کاربر @fquolodasha آزمایش کرد و توانایی رسم دستی GPT-Image2.5 را بسیار بالا ارزیابی کرد و این بار اثر را «واقعاً عالی» خواند و از به‌روزرسانی‌های سریع اخیر و بهبودهای قابل‌توجه توانایی‌های OpenAI تقدیر کرد.

تصاویر ChatGPT نسخهٔ ۲٫۵ اکنون در دسترس است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

قالب‌ها نیز مشکل دیگری را حل می‌کنند. ChatGPT قالب‌های رایج ایجاد محتوا مانند «پوستر» و «محصولات» را اضافه کرده است. کاربران ابتدا یک قالب را انتخاب می‌کنند، سپس اطلاعات مورد نظر، عناصر طراحی و سبک بصری را وارد می‌کنند و نیازی نیست هر بار از صفحه‌ای خالی شروع کنند.

همچنین در اشتراک‌گذاری تصاویر، گزینهٔ «پُرامپت» اضافه شده است. کاربران اکنون می‌توانند همراه با اشتراک‌گذاری تصویر، پُرامپت مورد استفاده برای تولید آن را نیز به اشتراک بگذارند. دیگران سپس می‌توانند عکس‌ها و جزئیات خود را جایگزین کنند و تولید را ادامه دهند.

مثالی که OpenAI ارائه کرده، پرتره‌ای در سبک دههٔ ۱۹۸۰ است: موی مجعد، جکت رنگارنگ، زنجیر طلا و نورهای نئون و پخش‌کنندهٔ موسیقی. سایر کاربران می‌توانند از این ایده پیروی کرده و عکس‌های خود را جایگزین کنند.

تصاویر ChatGPT نسخهٔ ۲٫۵ اکنون در دسترس است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

۰۴ دو نسخهٔ API

تصاویر نسخهٔ ۲٫۵ همچنین در API ادغام شده است. OpenAI دو نسخهٔ GPT-Image-2.5 Flare و GPT-Image-2.5 Sunburst را رونمایی کرده است.

فلیر نسخهٔ پیش‌فرض است و بر سرعت، کیفیت و قابلیت‌های ویرایش تمرکز دارد. اوپن‌آی‌آی ادعا می‌کند که کیفیت تولیدی آن بالاتر از GPT-Image-2 است و همچنین تأخیر را ۵۰٪ کاهش می‌دهد؛ بنابراین برای محتوای اجتماعی، تجربه محصولات، جستجوی تصویری، پروتوتایپ‌سازی سریع و تولید انبوه تصاویر مناسب است.

در مقابل، سن‌برست بیشتر برای کارهایی طراحی شده که کنترل دقیق‌تری نیاز دارند، مانند مواد تبلیغاتی رسمی و تصاویر باکیفیت محصولات. این مدل زمان تولید طولانی‌تری را در ازای دقت بالاتر در ویرایش می‌پذیرد.

بازخوردهای اولیه کاربران منتشرشده توسط اوپن‌آی‌آی نیز بر کنترل ویرایش تمرکز داشته است.

آکسولتان علیم‌کولوف، رهبر محصول هوش مصنوعی در هیگسفیلد، به‌طور خاص اشاره کرد که فلیر درک بهتری از عناصری دارد که باید بدون تغییر باقی بمانند. برای تیم‌های فیلم، محتوای کاربر-ساخته‌شده (UGC) و تبلیغات، این بدان معناست که هنگام ویرایش یک عنصر، شخصیت اصلی، ترکیب و تشخیص بصری تا حد امکان حفظ می‌شوند.

کارآفرین سریالی @gkxspace این به‌روزرسانی را در گردش‌کارهای تجاری تصاویر مشاهده کرده است. او معتقد است که یکی از بزرگ‌ترین محدودیت‌های تصاویر تولیدشده توسط هوش مصنوعی در گذشته این بود که اگرچه تصویر اول ممکن بود خوب باشد، اما تولید تصویر دوم یا سوم پایدار و سازگون با آن دشوار بود. تغییرات ایمیجز ۲.۵ در زمینه ویرایش پیوسته، سرعت و وفاداری تصاویر مرجع، فضای کاربردی عملی‌تری برای سناریوهایی مانند تغییر لباس در تجارت الکترونیک، گسترش مواد برند و تصاویر متوالی فراهم کرده است.

تصاویر چت‌جی‌پی‌تی نسخه ۲.۵ اکنون در دسترس است: این بار مدل‌های تصویری خام دیگر واقعاً باید نگران باشند

در حال حاضر، ایمیجز ۲.۵ برای کاربران چت‌جی‌پی‌تی، چت‌جی‌پی‌تی وُرک و کُدِکس در دسترس است و نسخه‌های فلیر و سن‌برست آن در API نیز باز شده‌اند. اوپن‌آی‌آی مکانیزم‌هایی مانند بررسی امنیت پرامپت و تصویر، متادیتای C2PA و واترمارک‌های نامرئی برای شناسایی تصاویر تولیدشده توسط ابزارهایش حفظ کرده است.

با توجه به نمونه‌های رسمی و آزمایش‌های فعلی کاربران، تمرکز این به‌روزرسانی بسیار متمرکز است: تسهیل کنترل ویرایش پس از تولید تصویر، اطمینان از پایداری بیشتر تصاویر مرجع در استفاده پیوسته و ادغام عملیاتی مانند اسکیس، قالب‌ها و پاداش‌دهی به تصاویر در گردش‌کار.

در مورد واقع‌گرایی، جزئیات و کیفیت تصویر پس از چندین دور ویرایش، آزمایش‌های موجود نتایج متفاوتی نشان داده‌اند. اینکه این مسائل در ایمیجز ۲.۵ تا چه حد بهبود یابند، هنوز نیازمند استفاده عملی بیشتر برای ارزیابی است.