ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

Tapbit Wire - Tapbit NewsTapbit Wire·Kaynak:ChainCatcher·
Paylaş

Yazar: Xiao Jing, Tencent Teknoloji

Editör: Xu Qingyang, Tencent Teknoloji

ABD yerel saatiyle 8 Eylül’de OpenAI, en yeni görüntü üretimi modeli ChatGPT Görüntüleri 2.5’i yayınladı.

Yeni sürüm, görüntü düzenleme, referans görüntüsü doğruluğu ve çok aşamalı düzenlemelerde tutarlılığı güçlendirmeye odaklanıyor. Kullanıcılar bir görüntüyü sürekli düzenledikçe daha önce ayarlanan içerikler daha iyi korunuyor. Karakterler, ürünler veya arka planlar düzenlenirken yalnızca belirtilen bölümler değiştirilebiliyor. Üretim hızı, Görüntüleri 2.0’a kıyasla %50’ye varan oranda arttı.

Aynı zamanda ChatGPT, Taslak, Şablon ve görüntü yorumlama özelliklerini ekledi. Kullanıcılar doğrudan taslak çizerek referans verebilir ya da görüntülerde değiştirilmesi gereken alanları işaretleyebilir. Geliştiriciler API üzerinden GPT-Image-2.5 Flare ve GPT-Image-2.5 Sunburst’u kullanabilir.

OpenAI, şu anda kullanıcıların ChatGPT Görüntüleri ve API’daki GPT-Image modeli aracılığıyla haftada 3 milyardan fazla görüntü ürettiğini belirtiyor. Görüntüleri 2.5, ChatGPT, ChatGPT Work ve Codex kullanıcılarına web, masaüstü ve mobil platformlarda sunuldu.

ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

01 Sadece Bir Bölümü Değiştirin, Tüm Görüntüyü Değil

Yapay zekâ ile üretilen görüntülerle ilgili gerçek sorunlar genellikle ilk görüntü oluşturulduktan sonra ortaya çıkar. Örneğin karakter beğenildiyse ama yalnızca kıyafeti değiştirilmeliyse; ürün onaylandıysa ama sadece arka plan değiştirilmeliyse; afiş tamamlandıysa ama yalnızca bir satır metin değiştirilmeliyse. Geçmişte devam eden düzenlemeler, görüntünün diğer kısımlarını da etkileyebiliyordu.

Görüntüleri 2.5, hassas düzenlemeyi öne çıkarıyor. OpenAI, örnek olarak «Tam Vücut Düzenlemesi» ve «Çok Şehirli Seyahat Biletleri»ni veriyor. Bu gösterimler, ardışık görüntülerle düzenleme sürecini anlatıyor ve modelin talimatlara göre belirtilen içeriği değiştirebilmesiyle birlikte özgün konu, kompozisyon ve diğer detayları koruyup korumadığını vurguluyor.

ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

«Çok Şehirli Seyahat Biletleri» örneği nispeten anlaşılır. Görüntüde yalnızca bir bilgi parçası değiştirilmek istendiğinde model, belirli nesneyi tanımlayıp biletin genel tasarım yapısını korumalıdır. Bu yetenek, güzel bir görüntü üretmekten çok, ürün görselleri, reklam materyalleri ve marka afişleri gibi uygulamalarda daha pratiktir.

Diğer bir odak noktası çok aşamalı düzenleme. OpenAI, «Küp Dönüşü», «Seyahat Bilgi Grafiği» ve «Doğum Günü Mumları» örneklerini sergiledi. Bunlar tek seferlik üretim değil; birden fazla ardışık düzenleme içeriyor. OpenAI, önceki düzenlemelerin korunmasını ve sonraki işlemlerin zaten tamamlanan içerikleri bozmamasını göstermeyi amaçlıyor.

ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

Bu aynı zamanda Görüntüleri 2.5 yükseltmesinin en dikkat çekici yönüdür.

Kullanıcı @thesoragirls basit bir test yaptı: Görüntüye bir mum çizdi ve bir taç yaprağının değişmeden kalmasını belirtti; ardından modelin diğer bölgeleri düzenlerken orijinal içeriği etkileyip etkilemediğini gözlemledi. Test sonuçları, sabit tutulan taç yaprağının korunduğunu, diğer bölümlerin ise gerekli şekilde değiştiğini gösterdi.

ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

Ancak sürekli düzenleme, detay sorunlarını tamamen çözmedi. Japon animatör @genel_ai, pratik testlerde resmi açıklamada vurgulananın aksine, çoklu düzenlemeler sonrası görüntü kalitesinin korunmasının mümkün olabileceğini belirtse de, düzenlemeler üst üste eklendikçe bozulmalar ve doku değişiklikleri yaşanabildiğini tespit etti.

ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

Yani 2.5 sürümü kararlılığı artırmış olsa da karmaşık sahnelerde kalite kaybı hâlâ meydana gelebilir.

02 Referans Görüntüleri, Daha Kararlı

Görüntüleri 2.5’teki ikinci değişiklik, referans görüntülerin işlenmesidir.

Kullanıcılar karakterlerin, evcil hayvanların veya diğer konuların fotoğraflarını sağlayabilir ve ardından bunları yeni bir sahneye yerleştirmelerini, görsel stillerini değiştirmelerini ya da kompozisyonlarını ayarlamalarını isteyebilir. OpenAI, yeni sürümün karakterlerin tanınabilir özelliklerini daha iyi koruduğunu, aynı zamanda aydınlatma ve doku performansında iyileşme sağladığını belirtiyor.

Resmi örnekler beş durumu içeriyor: «Yeniden Tasarımlı Bebek Portresi», «Kostümlü Köpek», «Fotoğraf Kabin Portresi», «Grup Partisi Kompozit Fotoğrafı» ve «Yatak Yapmak».

ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

Bu durumlar farklı senaryoları kapsar. Bebek portresi ve fotoğraf kabin portresi öncelikle karakter özelliklerinin korunup korunmadığına odaklanır; köpek örneği konunun kostüm değiştirildikten sonra orijinal görüntüsünü koruyup korumadığını inceler; grup partisi kompozit fotoğrafı tek bir görüntüde birden fazla karakterin yer almasını gerektirir; «Yatak Yapmak» ise günlük görüntü düzenleme işlemlerine daha yakındır ve orijinal sahneye özel ayarlamalar yapmayı gerektirir.

ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

Bu yetenek, aynı karakter, ürün ya da marka malzemesinin sürekli kullanıldığı işler için özellikle önemlidir. API kullanıcıları aynı referans görüntüsünden yola çıkarak farklı sürümler oluşturabilir ve böylece her yeni üretimde önemli değişikliklerin yaşanma ihtimalini azaltabilir.

Karmaşık görüntüler bu kez resmi örneklerin de odak noktası. OpenAI, yeşil manzaraları, gölleri ve gelecekçi binaları barındıran devasa silindirik uzay yaşam alanı önünde duran bir aileyi gösteren 1950’ler tarzı bir aile ilüstrasyonu sergiledi.

ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

OpenAI’nin resmi tanıtımlı sayfasında Yichang için bir seyahat sayfası yer alıyor: Seyahat destinasyonları, yer çekicilik bilgileri, görüntüler ve metin içerikleri aynı sayfada bir araya getirilerek eksiksiz bir seyahat rehberi oluşturulmuş. Bu, yalnızca bireysel öğelere değil, aynı anda birden fazla görüntüye, farklı metin düzeylerine ve sayfa düzenlerine de uyum sağlamayı gerektirir.

ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

Ayrıca ortaçağ döneminden esinlenen dokuzluk modernist afişler de yer alıyor; her birinde farklı geometrik şekiller ve «Oluştur», «Birlikte Büyü» ve «Merhamet Seç» gibi metinler bulunuyor.

Başka bir görüntü, renkli evler arasında uzanan ve körfezi ile Altın Kapı Köprüsü’nü gösteren San Francisco sokaklarının izlenimci bir betimlemesi.

ChatGPT Görüntüleri 2.5 geldi: Bu kez diğer ham görüntü modelleri gerçekten tedirgin olmalı

Buna ek olarak kremsi-altın renkli Como Gölü düğün davetiyeleri, ters çevrilmiş geleceği şehirler, ABD ulusal parklarından sekiz retro pul, güneş patlaması bilim slaytları, mavi-altın renkli Dünya mozaikleri, ChatGPT çıkartma afişleri ve yağmurlu geleceği şehirler de yer alıyor.

ChatGPT Görüntüleri 2.5 burada: Bu kez diğer ham görüntü modelleri gerçekten endişelenmeli

Bu örnekler, illüstrasyonlar, posterler, davetiyeler, bilgi grafikleri, bilimsel illüstrasyonlar ve ürün tanıtım görüntülerini kapsar. OpenAI'ın odak noktası da oldukça net: İstemi görüntü yapısı, metin, görsel tarz ve belirli öğeleri aynı anda belirttiğinde Images 2.5 bu gereksinimleri daha eksiksiz yerine getirebilir.

Moda girişimcisi Yana Welinder, Images 2.5’in moda tasarımı performansında önemli bir iyileşme gösterdiğini düşünüyor. Daha önce eski model kullanıldığında referans tasarımlar korunabiliyordu ancak nihai etki bazen oldukça düz kalıyordu; buna karşın 2.5 sürümünün orijinal tasarımı daha tam bir görsel etkiyle ortaya koyduğunu belirtiyor.

ChatGPT Görüntüleri 2.5 burada: Bu kez diğer ham görüntü modelleri gerçekten endişelenmeli

Ancak bazıları karşıt test sonuçları sunmuştur. Yapay zekâ ve yazılım mühendisi Mark Kretschmann, özellikle orman sahnelerinde gürültü ve artefakt testleri gerçekleştirmiştir.

ChatGPT Görüntüleri 2.5 burada: Bu kez diğer ham görüntü modelleri gerçekten endişelenmeli

2.5 sürümünün birçok iyileşme içerdiğini kabul ederken test sonuçlarının istikrarlı olmadığını düşünüyor. Ardından Images 2.5’i Images 2.0 ile karşılaştırarak test ettiği birkaç durumda 2.0’ın gerçekçilik açısından daha iyi performans gösterdiğini tespit ediyor.

Dolayısıyla şu an için daha doğru bir değerlendirme şudur: Images 2.5 öncelikle düzenleme kontrolünü ve karmaşık talimat işleme yeteneğini geliştirmiştir; ancak gerçekçi etkiler görüntü türlerine göre hâlâ değişkenlik göstermektedir.

03 Birkaç Çizgi Çizin, Anlar

Modelin kendisine ek olarak OpenAI, ChatGPT’ye birkaç yeni işlem yöntemi de eklemiştir.

En doğrudanı Sketch (Çizim) özelliğidir. Kullanıcılar ChatGPT içinde doğrudan çizim yapabilir ve ardından modelin bu çizime dayalı olarak nihai görüntüyü oluşturmasını sağlayabilir. Örneğin bir oda tasarlamak isterseniz önce genel yerleşimi çizebilirsiniz; bir giysi tasarlamak isterseniz önce dış hatlarını çizebilirsiniz; hatta sadece hızlıca bir kompozisyon taslağı çizip ChatGPT’ye detayları tamamlamasını bırakabilirsiniz. Sonrasında görsel tarz ve diğer gereksinimleri ekleyebilirsiniz.

Kullanmak için yeterince '@Sketch.' yazmanız yeterlidir. Bu, metin tabanlı istemlere olan bağımlılığı etkili şekilde azaltır. Bazı kompozisyonlar, özellikle nesnelerin konumu, oranları ve genel hatları sözle tanımlamakta zorlanılır. Artık kullanıcılar önce çizer, sonra modelin detayları doldurmasını bekler.

Kullanıcı @fquolodasha, GPT-Image2.5’in el çizimi yeteneğini çok yüksek puanlamış ve bu kezki etkinin 'oldukça harika' olduğunu belirterek OpenAI’ın son dönemdeki hızlı güncellemelerine ve yetenek gelişimine hayran kaldığını ifade etmiştir.

ChatGPT Görüntüleri 2.5 burada: Bu kez diğer ham görüntü modelleri gerçekten endişelenmeli

Şablonlar ise başka bir sorunu ele alır. ChatGPT, Poster ve Ürün gibi yaygın yaratım biçimlerini içeren bazı şablonlar eklemiştir. Kullanıcılar önce bir şablon seçer, ardından ifade etmek istedikleri bilgileri, tasarım öğelerini ve görsel tarzı doldurur; her seferinde boş bir tuvalden başlamak zorunda kalmazlar.

Görüntü paylaşımı ayrıca bir Prompt (İstem) seçeneği de kazandırmıştır. Kullanıcılar artık görüntüyü paylaştıklarında kullanılan istemi de birlikte paylaşabilirler. Başkaları bu istemi kendi fotoğrafları ve ayrıntılarıyla değiştirerek üretim sürecini devam ettirebilirler.

OpenAI’nin sunduğu bir örnek, 1980’ler tarzı bir portredir: kıvırcık saç, renkli ceket, altın zincir, neon ışıklar ve bir müzik çalar. Diğer kullanıcılar bu fikri takip edip kendi fotoğraflarını yerine koyabilirler.

ChatGPT Görüntüleri 2.5 burada: Bu kez diğer ham görüntü modelleri gerçekten endişelenmeli

04 İki API Sürümü

Images 2.5 aynı zamanda API’ye entegre edilmiştir. OpenAI, GPT-Image-2.5 Flare ve GPT-Image-2.5 Sunburst adlı iki sürümü yayınlamıştır.

Flare, hız, kalite ve düzenleme yeteneklerine odaklanan varsayılan sürümüdür. OpenAI, bunun GPT-Image-2'den daha yüksek kaliteli görüntü ürettiğini ve gecikmeyi %50 azalttığını iddia ediyor; bu da sosyal içerik, ürün deneyimleri, görsel aramalar, hızlı prototipleme ve büyük ölçekli görüntü üretimi için uygundur.

Buna karşılık Sunburst, resmi reklam materyalleri ve yüksek kaliteli ürün görüntülerine benzer ince kontrol gerektiren işler için daha uygundur. Daha yüksek düzenleme doğruluğu karşılığında daha uzun üretim sürelerine izin verir.

OpenAI tarafından yayımlanan erken kullanıcı geri bildirimleri de özellikle düzenleme kontrolüne odaklanmıştır.

Higgsfield’ın yapay zeka ürün lideri Axultan Alimkulov, Flare’ın hangi öğelerin değişmeden kalması gerektiğini daha iyi anladığını özellikle belirtmiştir. Sinema, kullanıcı üretimi içerik (UGC) ve reklam ekipleri için bu, bir öğe değiştirilirken orijinal karakterin, kompozisyonun ve görsel tanımamanın mümkün olduğunca korunmasını sağlar.

Seri girişimci @gkxspace, bu güncellemeyi ticari görüntü iş akışları içinde gözlemlemiştir. Geçmişteki yapay zeka ile üretilen görüntülerin en büyük sınırlılıklarından birinin ilk görüntünün iyi olmasına rağmen, bundan türetilen ikinci veya üçüncü görüntüleri tutarlı biçimde üretmenin zor olması olduğunu düşünüyor. Images 2.5’in sürekli düzenleme, hız ve referans görüntüleri sadakati konusundaki iyileştirmeleri, e-ticaret kıyafet değişimleri, marka materyali genişletmeleri ve ardışık illüstrasyonlar gibi senaryolarda daha pratik kullanım imkânı sunuyor.

ChatGPT Images 2.5 burada: Bu kez diğer ham görüntü modelleri gerçekten endişelenmeli

Şu anda Images 2.5, ChatGPT, ChatGPT Work ve Codex kullanıcılarını kapsıyor; API’deki Flare ve Sunburst da açıktır. OpenAI, istemleri ve görüntülerin güvenliğini kontrol etme mekanizmalarını, C2PA meta verilerini ve oluşturulan görüntülerin tespit edilmesini sağlayan görünmez filigranları korumuştur.

Resmi örneklerden ve mevcut kullanıcı testlerinden çıkan sonuçlara göre, bu güncelleme çok odaklıdır: görüntü üretildikten sonraki düzenlemeleri daha kolay kontrol edebilmek, referans görüntülerin ardışık kullanımda daha kararlı olmasını sağlamak ve eskiz, şablon ve görüntü notlandırması gibi işlemlerle iş akışını entegre etmek.

Gerçekçilik, ayrıntı ve birden fazla düzenleme turundan sonra görüntü kalitesi açısından var olan testler farklı sonuçlar göstermiştir. Bu sorunların Images 2.5 ile ne kadar iyileştirilebileceği henüz daha fazla pratik kullanım ile doğrulanmalıdır.