OpenAI anunciou hoje o ChatGPT Images 2.0, a próxima geração de seu modelo de imagens, com foco em precisão, usabilidade e tarefas visuais complexas. A empresa redefine imagens como uma linguagem visual, ampliando a integração entre texto e gráficos.
Segundo a OpenAI, a novidade permite combinar texto e imagens para criar páginas complexas e atraentes. A ideia é que uma imagem possa explicar mecanismos, ambientar um cenário, testar uma ideia ou fundamentar um argumento.
Além das melhorias de mistura de texto e gráfico, o modelo traz capacidades de raciocínio que permitem gerar várias imagens por prompt com continuidade entre saídas. O objetivo é incorporar o pensamento ao output visual.
Capacidade de pensamento e fluxo de trabalho
A partir de prompts mais vagos, como solicitar uma infografia sobre atividades com base na previsão do tempo, o sistema coleta dados relevantes, determina ações adequadas ao tempo e produz imagens proporcionais ao resultado.
O sistema passa a criar imagens que mantêm coerência entre diferentes saídas, o que facilita fluxos de trabalho complexos de design e comunicação visual. A abordagem transforma a forma de construção de conteúdos visuais.
Disponibilidade e custos
O modelo está disponível hoje para usuários do ChatGPT e Codex. Saídas avançadas e capacidades de raciocínio aparecem para assinantes ChatGPT Plus, Pro, Business e Enterprise. A Access de telas e recursos varia conforme o plano.
No momento da divulgação, a versão 2.0 funciona no desktop, com promessa de disponibilidade em dispositivos móveis posteriormente. A API também oferece o modelo gpt-image-2, com preços variáveis conforme qualidade, capacidade de raciocínio e resolução.
Entre na conversa da comunidade