ChatGPT Images 2.5 уже здесь: теперь другим базовым моделям генерации изображений действительно стоит беспокоиться
Автор: Сяо Цзин, Tencent Technology
Редактор: Сюй Цинъян, Tencent Technology
8 сентября по местному времени в США OpenAI представила новейшую модель генерации изображений — ChatGPT Images 2.5.
Новая версия делает акцент на улучшении редактирования изображений, точности воспроизведения опорных изображений и согласованности при многократных правках. При последовательном редактировании изображения ранее изменённые элементы сохраняются надёжнее. При корректировке персонажей, товаров или фона проще изменять только указанные части. Скорость генерации выросла до 50 % по сравнению с Images 2.0.
Кроме того, ChatGPT получил функции эскизов, шаблонов и комментирования изображений. Пользователи могут рисовать эскизы в качестве ориентиров или отмечать области, требующие правки. Разработчики могут использовать через API модели GPT-Image-2.5 Flare и GPT-Image-2.5 Sunburst.
OpenAI сообщает, что пользователи сейчас создают через ChatGPT Images и API-модель GPT-Image более 3 млрд изображений еженедельно. Images 2.5 уже доступна пользователям ChatGPT, ChatGPT Work и Codex на веб-, десктоп- и мобильных платформах.

01 Изменить одну часть, а не всё изображение
Сложности с ИИ-изображениями чаще всего возникают после генерации первого варианта. Например, если персонаж удачный, но нужно изменить только одежду; если товар подтверждён, но требуется заменить фон; если плакат готов, но нужно исправить лишь одну строку текста. Ранее повторное редактирование могло затронуть и другие части изображения.
Images 2.5 ставит точное редактирование во главу угла. OpenAI приводит примеры «Полного редактирования фигуры» и «Мультигородского проездного билета». В демонстрациях используются последовательные изображения, показывающие процесс правки, с акцентом на способность модели изменять только заданные элементы, сохраняя исходного персонажа, композицию и прочие детали.

Пример «Мультигородского проездного билета» понятен интуитивно: если нужно изменить лишь один элемент изображения, модель должна распознать конкретный объект для правки, сохранив общую структуру дизайна билета. Такая функция практичнее для товарных фото, рекламных материалов и брендированных плакатов, чем простая генерация красивого изображения.
Ещё одно внимание уделено многократному редактированию. OpenAI продемонстрировала три случая: «Вращение куба», «Инфографика путешествий» и «День рождения — свечи». Это не разовые генерации, а цепочки непрерывных правок. OpenAI стремится показать, что предыдущие изменения сохраняются, а последующие операции не нарушают уже завершённые элементы.

Это также наиболее значимый аспект обновления Images 2.5.
Пользователь @thesoragirls провела простой тест: нарисовала свечу на изображении, указав, что лепесток должен остаться неизменным, и проверила, затронет ли модель исходное содержимое при правке других областей. Результаты показали, что фиксированный лепесток сохранился, а остальные части изменились строго по запросу.

Однако последовательное редактирование полностью не устранило проблемы с детализацией. Японский аниматор @genel_ai в практических тестах обнаружил, что, несмотря на заявления официальных лиц о сохранении качества изображений после многократного редактирования, при наложении правок слой за слоем всё равно возникают артефакты и изменения текстур.

Другими словами, хотя стабильность в версии 2.5 улучшилась, в сложных сценах всё ещё возможна деградация качества.
02. Опорные изображения — выше стабильность
Второе изменение в Images 2.5 касается работы с опорными изображениями.
Пользователи могут загружать фотографии персонажей, домашних животных или других объектов, а затем просить поместить их в новую сцену, изменить визуальный стиль или композицию. OpenAI сообщает, что новая версия лучше сохраняет узнаваемые черты персонажей и одновременно улучшает качество освещения и текстур.
В официальных примерах приведено пять случаев: «Переработанный портрет младенца», «Собака в костюме», «Портрет в фотокабинке», «Групповое праздничное коллажное фото» и «Заправка постели».

Эти примеры охватывают разные задачи: портрет младенца и фотокабинка проверяют сохранение черт персонажа; случай со собакой — способность сохранить исходный образ при смене костюма; групповой коллаж предполагает одновременное присутствие нескольких персонажей; «Заправка постели» ближе к повседневному редактированию изображений и требует точной коррекции исходной сцены.

Эта функция особенно важна для задач, требующих постоянного использования одного и того же персонажа, продукта или бренда. Пользователи API могут создавать разные версии на основе одного опорного изображения, снижая риск значительных различий при каждой новой генерации.
Сложные изображения также выделены в официальных примерах. OpenAI продемонстрировала иллюстрацию семьи в стиле 1950-х годов: семья стоит перед огромным цилиндрическим космическим жилищем с зелёными ландшафтами, озёрами и футуристическими зданиями.

На официальной странице представления OpenAI показана туристическая страница для Ичаня: на одной странице размещены туристические направления, информация об достопримечательностях, изображения и текст — получается полноценный путеводитель. Для этого требуется одновременная обработка нескольких изображений, текста разного уровня и верстки страницы, а не просто работа с отдельными элементами.

Также представлен набор из девяти модернистских постеров средневековой тематики: каждый содержит разные геометрические формы и текст — «Создайте», «Растите вместе», «Выберите доброту».
Ещё одно изображение — импрессионистское изображение улиц Сан-Франциско: улица тянется между красочными домами и открывает вид на залив и Золотые Ворота.

Кроме того, представлены свадебные приглашения на озеро Комо в кремово-золотых тонах, перевёрнутые футуристические города, восемь ретро-марок национальных парков США, научные слайды о солнечных вспышках, мозаика Земли в сине-золотых тонах, постеры со стикерами ChatGPT и футуристические города под дождём.

Эти примеры охватывают разные типы: иллюстрации, плакаты, приглашения, инфографику, научные иллюстрации и рекламные изображения товаров. Фокус OpenAI также очевиден: когда в промпте одновременно указаны структура изображения, текст, визуальный стиль и конкретные элементы, Images 2.5 выполняет эти требования более полно.
Предприниматель в сфере моды Яна Велиндер считает, что Images 2.5 демонстрирует заметное улучшение в проектировании одежды. Ранее при использовании старой модели исходные дизайны сохранялись, но итоговый результат иногда выглядел довольно плоским; по её мнению, версия 2.5 позволяет передать оригинальный дизайн с более полным визуальным эффектом.

Однако некоторые пользователи получили противоположные результаты тестов. ИИ- и программный инженер Марк Кречманн специально провёл тесты на шум и артефакты в лесных сценах.

Он считает, что, несмотря на многочисленные улучшения в версии 2.5, результаты тестов нестабильны. Затем он сравнил Images 2.5 с Images 2.0 и обнаружил, что в нескольких протестированных случаях 2.0 показала лучшую реалистичность.
Поэтому на данный момент наиболее точная оценка такова: Images 2.5 значительно улучшила управление редактированием и обработку сложных инструкций, однако конечные результаты всё ещё различаются в зависимости от типа изображения.
03 Несколько штрихов — и модель поняла
Помимо самой модели, OpenAI добавила в ChatGPT несколько новых способов взаимодействия.
Самый прямой — это функция Sketch («Эскиз»). Пользователи могут рисовать эскизы непосредственно в ChatGPT, после чего модель создаёт финальное изображение на их основе. Например, при проектировании интерьера можно сначала набросать общую планировку, при создании одежды — контур изделия, или даже просто быстро набросать композицию, а затем поручить завершение ChatGPT. После этого можно дополнительно задать визуальный стиль и другие параметры.
Для запуска достаточно ввести «@Sketch». Это существенно снижает зависимость от текстовых промптов. Некоторые композиции трудно описать словами — особенно позиции, пропорции и контуры объектов. Теперь пользователи могут сначала нарисовать, а затем предоставить модели возможность детализировать изображение.
Пользователь @fquolodasha протестировал способность GPT-Image 2.5 к обработке рукописных эскизов и высоко её оценил, назвав результат «по-настоящему потрясающим», и выразил восхищение темпами обновлений и ростом возможностей OpenAI.

Шаблоны решают ещё одну задачу. В ChatGPT добавлены распространённые форматы создания — например, «Плакат» и «Мерч». Пользователь выбирает шаблон, затем заполняет нужную информацию, элементы дизайна и визуальный стиль — без необходимости каждый раз начинать с чистого холста.
В функцию совместного использования изображений также добавлена опция Prompt («Промпт»). Теперь при публикации изображения можно делиться и используемым для его генерации промптом. Другие пользователи смогут заменить в нём фото и детали, чтобы продолжить генерацию.
OpenAI приводит пример: портрет в стиле 1980-х — вьющиеся волосы, яркая куртка, золотая цепочка, неоновое освещение и музыкальный проигрыватель. Другие пользователи могут использовать эту идею, подставив свои собственные фото.

04 Две версии API
Images 2.5 также интегрирована в API. OpenAI выпустила GPT-Image-2.5 Flare и GPT-Image-2.5 Sunburst.
Flare — это версия по умолчанию, ориентированная на скорость, качество и возможности редактирования. OpenAI утверждает, что она генерирует изображения более высокого качества, чем GPT-Image-2, при этом сокращая задержку на 50 %; подходит для соцконтента, продуктовых опытов, визуальных поисков, быстрого прототипирования и масштабной генерации изображений.
Sunburst, напротив, ориентирована на задачи, требующие тонкого контроля, например, создание рекламных материалов и высококачественных изображений товаров. Она допускает более длительное время генерации ради повышения точности редактирования.
Ранние отзывы пользователей от OpenAI также сосредоточены на контроле редактирования.
Аксултан Алимкулов, руководитель AI-продуктов в Higgsfield, отметил, что Flare лучше понимает, какие элементы следует оставить без изменений. Для команд кинопроизводства, UGC и рекламы это означает, что при изменении одного элемента исходный персонаж, композиция и визуальное распознавание сохраняются максимально полно.
Последовательный предприниматель @gkxspace заметил это обновление в коммерческих рабочих процессах генерации изображений. Он считает, что одно из главных ограничений прежних ИИ-изображений заключалось в том, что, хотя первое изображение могло быть хорошим, было сложно стабильно получить качественное второе или третье изображение на его основе. Изменения в Images 2.5 в части непрерывного редактирования, скорости и точности опорных изображений расширяют практическое применение: смена образов в e-commerce, расширение бренд-материалов и последовательная иллюстрация.

На данный момент Images 2.5 доступна в ChatGPT, ChatGPT Work и Codex; API также поддерживает Flare и Sunburst. OpenAI сохранила механизмы проверки промптов и изображений на безопасность, метаданные C2PA и невидимые водяные знаки для идентификации генерируемых её инструментами изображений.
Согласно официальным кейсам и текущему тестированию пользователями, фокус этого обновления чётко смещён: упрощение и повышение контроля над изменениями после генерации, обеспечение большей стабильности опорных изображений при многократном использовании, а также интеграция эскизов, шаблонов и аннотаций изображений в рабочий процесс.
Что касается реализма, детализации и качества изображений после нескольких циклов редактирования, существующие тесты показывают неоднозначные результаты. Насколько эти проблемы решены в Images 2.5, покажет дальнейшее практическое применение.


