Imagens do ChatGPT 2.5 estão aqui: dessa vez, outros modelos brutos de imagens realmente precisam ficar nervosos

Tapbit Wire - Tapbit NewsTapbit Wire·Fonte:ChainCatcher·
Compartilhar

Autora: Xiao Jing, editora da Tencent Technology

Editor: Xu Qingyang, editor da Tencent Technology

Em 8 de setembro, horário local nos EUA, a OpenAI lançou o mais recente modelo de geração de imagens, Imagens do ChatGPT 2.5.

A nova versão prioriza aprimoramentos na edição de imagens, fidelidade em relação a imagens de referência e consistência em modificações multirodadas. Ao modificar continuamente uma imagem, o conteúdo previamente ajustado é mais provável de ser mantido. Ao editar personagens, produtos ou fundos, também é mais fácil alterar apenas as partes especificadas. A velocidade de geração é até 50% mais rápida que a do Images 2.0.

Ao mesmo tempo, o ChatGPT adicionou recursos de esboço (Sketch), modelos (Templates) e comentários em imagens. Os usuários podem desenhar esboços diretamente como referência ou marcar as áreas que precisam ser modificadas nas imagens. Desenvolvedores podem usar as APIs GPT-Image-2.5 Flare e GPT-Image-2.5 Sunburst.

A OpenAI afirma que, atualmente, os usuários geram mais de 3 bilhões de imagens semanalmente por meio das Imagens do ChatGPT e do modelo GPT-Image na API. O Images 2.5 já está disponível para usuários do ChatGPT, ChatGPT Work e Codex, abrangendo plataformas web, desktop e móvel.

Imagens do ChatGPT 2.5 estão aqui: dessa vez, outros modelos brutos de imagens realmente precisam ficar nervosos

01 Altere apenas uma parte, não a imagem inteira

O verdadeiro problema com imagens geradas por IA costuma surgir após a primeira imagem ser gerada. Por exemplo, se um personagem for satisfatório, mas apenas a roupa precisar ser alterada; se um produto for confirmado, mas só o fundo precisar ser trocado; se um pôster estiver concluído, mas apenas uma linha de texto precisar ser modificada. No passado, continuar editando podia causar alterações em outras partes da imagem.

O Images 2.5 coloca a edição precisa em destaque. A OpenAI apresenta exemplos como 'Edição de Corpo Inteiro' e 'Bilhete de Viagem Multicidades'. Essas demonstrações usam sequências de imagens para mostrar o processo de modificação, enfatizando se o modelo consegue ajustar o conteúdo especificado conforme instruções, mantendo sujeito original, composição e outros detalhes.

Imagens do ChatGPT 2.5 estão aqui: dessa vez, outros modelos brutos de imagens realmente precisam ficar nervosos

O exemplo 'Bilhete de Viagem Multicidades' é relativamente fácil de entender. Se apenas uma informação da imagem precisar ser alterada, o modelo deve identificar o objeto específico a modificar, preservando ao mesmo tempo a estrutura geral do design do bilhete. Essa capacidade é mais útil para imagens de produtos, materiais publicitários e pôsteres de marcas do que simplesmente gerar uma imagem bonita.

Outro foco está na edição multirodada. A OpenAI apresentou três casos: 'Rotação de Cubo', 'Infográfico de Viagem' e 'Velas de Aniversário'. Trata-se de gerações não pontuais, mas envolvendo múltiplas modificações contínuas. A OpenAI busca demonstrar que alterações anteriores são mantidas e operações subsequentes não perturbam continuamente o conteúdo já concluído.

Imagens do ChatGPT 2.5 estão aqui: dessa vez, outros modelos brutos de imagens realmente precisam ficar nervosos

Esse é também o aspecto mais notável da atualização do Images 2.5.

A usuária @thesoragirls realizou um teste direto: desenhou uma vela na imagem, especificando que uma pétala deveria permanecer inalterada, e observou se o modelo afetaria o conteúdo original ao modificar outras áreas. Seus resultados mostraram que a pétala fixa foi mantida, enquanto as demais partes foram alteradas conforme solicitado.

As imagens do ChatGPT 2.5 estão aqui: Desta vez, outros modelos de imagens brutas realmente precisam ficar preocupados

No entanto, edições contínuas ainda não resolveram totalmente os problemas de detalhes. O animador japonês @genel_ai descobriu, em testes práticos, que, embora a OpenAI tenha enfatizado que a qualidade da imagem poderia ser mantida após múltiplas edições, artefatos e alterações de textura ainda podem ocorrer ao sobrepor edições.

As imagens do ChatGPT 2.5 estão aqui: Desta vez, outros modelos de imagens brutas realmente precisam ficar preocupados

Ou seja, embora a versão 2.5 tenha melhorado a estabilidade, perda de qualidade ainda pode ocorrer em cenas complexas.

02 Imagens de referência, mais estáveis

A segunda mudança nas Imagens 2.5 é o tratamento de imagens de referência.

Os usuários podem fornecer fotos de personagens, animais de estimação ou outros sujeitos e, em seguida, solicitar que eles entrem em uma nova cena, mudem de estilo visual ou alterem sua composição. A OpenAI afirma que a nova versão é melhor em reter características reconhecíveis dos personagens, além de melhorar o desempenho de iluminação e textura.

Os exemplos oficiais incluem cinco casos: «Retrato infantil redesenhado», «Cachorro com fantasia», «Retrato em cabine fotográfica», «Fotomontagem de grupo em festa» e «Arrumando a cama».

As imagens do ChatGPT 2.5 estão aqui: Desta vez, outros modelos de imagens brutas realmente precisam ficar preocupados

Esses casos cobrem situações distintas. Os retratos infantil e em cabine focam principalmente na manutenção das características do personagem; o caso do cachorro avalia se o sujeito conserva sua aparência original após trocar de roupa; a fotomontagem de grupo envolve múltiplos personagens numa única imagem; «Arrumando a cama» aproxima-se mais da edição cotidiana de imagens, exigindo ajustes específicos à cena original.

As imagens do ChatGPT 2.5 estão aqui: Desta vez, outros modelos de imagens brutas realmente precisam ficar preocupados

Essa capacidade é especialmente importante para trabalhos que exigem uso contínuo do mesmo personagem, produto ou material de marca. Usuários da API podem gerar versões diferentes com base na mesma imagem de referência, reduzindo a probabilidade de alterações significativas a cada nova geração.

Imagens complexas também são destaque nos exemplos oficiais desta vez. A OpenAI apresentou uma ilustração familiar no estilo dos anos 1950: uma família diante de um enorme habitat espacial cilíndrico com paisagens verdes, lagos e edifícios futuristas.

As imagens do ChatGPT 2.5 estão aqui: Desta vez, outros modelos de imagens brutas realmente precisam ficar preocupados

A página oficial de introdução da OpenAI exibiu uma página de viagem para Yichang: com destinos turísticos, informações sobre atrações, imagens e conteúdo textual na mesma página, criando um guia completo. Isso exige lidar simultaneamente com múltiplas imagens, níveis distintos de texto e layouts de página, não apenas focando em elementos isolados.

As imagens do ChatGPT 2.5 estão aqui: Desta vez, outros modelos de imagens brutas realmente precisam ficar preocupados

Há também um conjunto de nove pôsteres modernistas medievais, cada um com formas geométricas e textos diferentes, incluindo «Criar», «Crescer juntos» e «Escolher a gentileza».

Outra imagem é uma representação impressionista das ruas de São Francisco, com a via se estendendo entre casas coloridas, revelando a baía e a Ponte Golden Gate.

As imagens do ChatGPT 2.5 estão aqui: Desta vez, outros modelos de imagens brutas realmente precisam ficar preocupados

Além disso, há convites de casamento para o Lago Como em tons cremosos e dourados, cidades futuristas invertidas, oito selos retrô de parques nacionais norte-americanos, slides científicos sobre explosões solares, mosaicos da Terra em tons azuis e dourados, pôsteres com adesivos do ChatGPT e cidades futuristas sob chuva.

As imagens do ChatGPT 2.5 chegaram: desta vez, outros modelos de imagens brutas precisam mesmo se preocupar

Esses exemplos abrangem diversos tipos, como ilustrações, pôsteres, convites, infográficos, ilustrações científicas e imagens promocionais de produtos. O foco da OpenAI também é bastante claro: quando o prompt especifica estrutura da imagem, texto, estilo visual e elementos específicos simultaneamente, o Images 2.5 cumpre esses requisitos com maior fidelidade.

A empreendedora da moda Yana Welinder acredita que o Images 2.5 mostra melhoria significativa no desempenho de design de moda. Anteriormente, com o modelo antigo, os designs de referência podiam ser mantidos, mas o resultado final às vezes era relativamente plano; ela considera que a versão 2.5 permite apresentar o design original com efeito visual mais completo.

As imagens do ChatGPT 2.5 chegaram: desta vez, outros modelos de imagens brutas precisam mesmo se preocupar

No entanto, alguns relataram resultados de testes contrários. O engenheiro de IA e software Mark Kretschmann realizou testes específicos de ruído e artefatos em cenas florestais.

As imagens do ChatGPT 2.5 chegaram: desta vez, outros modelos de imagens brutas precisam mesmo se preocupar

Ele acredita que, embora o 2.5 tenha muitas melhorias, os resultados dos testes não são estáveis. Ao comparar o Images 2.5 com o Images 2.0, constatou que, em vários casos testados, o 2.0 obteve melhor desempenho quanto ao realismo.

Portanto, uma avaliação mais precisa no momento é que o Images 2.5 aprimorou principalmente o controle de edição e o tratamento de instruções complexas, mas os resultados reais ainda variam conforme o tipo de imagem.

03 Desenhe algumas linhas — ele entende

Além do próprio modelo, a OpenAI adicionou diversos novos métodos de operação ao ChatGPT.

O mais direto é o recurso Sketch. Os usuários podem desenhar esboços diretamente no ChatGPT e, em seguida, pedir ao modelo que gere a imagem final com base nesse esboço. Por exemplo, para projetar um cômodo, basta desenhar o layout geral; para criar uma peça de roupa, esboçar o contorno; ou até mesmo rabiscar rapidamente uma composição básica e deixar o ChatGPT completá-la. Depois, é possível adicionar estilos visuais e outros requisitos.

Para usá-lo, basta digitar “@Sketch.” Isso reduz efetivamente a dependência de prompts textuais. Algumas composições são difíceis de descrever com palavras, especialmente posições, proporções e contornos aproximados de objetos. Agora, os usuários podem desenhar primeiro e depois deixar o modelo preencher os detalhes.

O usuário @fquolodasha testou e avaliou muito positivamente a capacidade de desenho manual do GPT-Image 2.5, afirmando que o resultado desta vez é “realmente impressionante”, e expressou admiração pelas atualizações rápidas e melhorias de capacidade da OpenAI.

As imagens do ChatGPT 2.5 chegaram: desta vez, outros modelos de imagens brutas precisam mesmo se preocupar

Os modelos resolvem outra questão. O ChatGPT incorporou alguns formatos comuns de criação, como Pôster e Merch. Os usuários selecionam primeiro um modelo, inserem as informações a serem transmitidas, elementos de design e estilo visual, sem precisar começar sempre do zero.

O compartilhamento de imagens também ganhou a opção Prompt. Agora, ao compartilhar uma imagem, os usuários podem incluir também o Prompt usado para gerá-la. Outros usuários podem então substituir por suas próprias fotos e detalhes para continuar gerando.

Um exemplo fornecido pela OpenAI é um retrato no estilo dos anos 1980: cabelos cacheados, jaqueta colorida, corrente dourada, luzes neon e um leitor de música. Outros usuários podem seguir essa ideia e trocar pela própria foto.

As imagens do ChatGPT 2.5 chegaram: desta vez, outros modelos de imagens brutas precisam mesmo se preocupar

04 Duas versões da API

O Images 2.5 também foi integrado à API. A OpenAI lançou o GPT-Image-2.5 Flare e o GPT-Image-2.5 Sunburst.

Flare é a versão padrão, focada em velocidade, qualidade e capacidades de edição. A OpenAI afirma que ela gera imagens de melhor qualidade que a GPT-Image-2, reduzindo a latência em 50%, tornando-a adequada para conteúdo social, experiências de produto, buscas visuais, prototipagem rápida e geração em larga escala de imagens.

Sunburst, por outro lado, é mais voltada para trabalhos que exigem controle refinado, como materiais publicitários formais e imagens de produto de alta qualidade. Permite tempos de geração mais longos em troca de maior precisão na edição.

Os primeiros comentários de usuários divulgados pela OpenAI também destacaram o controle de edição.

Axultan Alimkulov, líder de produtos de IA na Higgsfield, mencionou especificamente que o Flare entende melhor quais elementos devem permanecer inalterados. Para equipes de cinema, conteúdo gerado por usuários (UGC) e publicidade, isso significa que, ao modificar um elemento, o personagem original, a composição e o reconhecimento visual podem ser preservados ao máximo.

O empreendedor serial @gkxspace observou essa atualização nos fluxos comerciais de imagens. Ele acredita que uma das maiores limitações das imagens geradas por IA anteriormente era que, embora a primeira imagem pudesse ser boa, era difícil produzir de forma consistente uma segunda ou terceira imagem estável com base nela. As mudanças nas Imagens 2.5 quanto à edição contínua, velocidade e fidelidade das imagens de referência ampliam seu uso prático em cenários como troca de roupas em e-commerce, expansão de materiais de marca e ilustrações contínuas.

Imagens do ChatGPT 2.5 estão disponíveis: desta vez, outros modelos brutos de imagens realmente precisam se preocupar

Atualmente, as Imagens 2.5 estão disponíveis para usuários do ChatGPT, ChatGPT Work e Codex, e os modelos Flare e Sunburst da API também estão abertos. A OpenAI manteve mecanismos como verificações de segurança de prompts e imagens, metadados C2PA e marcas d’água invisíveis para identificar imagens geradas por suas ferramentas.

A partir de casos oficiais e testes atuais com usuários, o foco dessa atualização é muito concentrado: facilitar o controle das modificações após a geração de imagens, garantir maior estabilidade das imagens de referência no uso contínuo e integrar operações como esboço, modelos e anotações de imagens ao fluxo de trabalho.

Quanto ao realismo, detalhamento e qualidade de imagem após múltiplas rodadas de edição, os testes existentes mostraram resultados variáveis. O quanto esses problemas podem ser aprimorados nas Imagens 2.5 ainda depende de validação prática adicional.