01. Geração de imagem (Text-to-Image)

Table of contents

O que este capítulo aborda

Text-to-Image (T2I) é a forma mais básica de geração de imagens com IA, usando apenas texto. Quando você descreve por escrito a cena desejada, como “A cat sitting on a rainbow”, o modelo de IA interpreta a descrição e cria uma imagem.

Neste capítulo, você aprenderá:

  • A estrutura de um workflow básico de Text-to-Image
  • As características dos principais modelos de imagem, como Flux, SDXL e Qwen-Image
  • Como escolher um modelo adequado à finalidade e ao ambiente

Entenda o pipeline básico

Todos os workflows de Text-to-Image compartilham as cinco etapas abaixo. Os nomes dos nodes e as configurações detalhadas variam conforme o modelo, mas o fluxo geral é o mesmo.

Explicação de cada etapa

EtapaO que fazNodes relacionados (exemplos)
1. Carregar o modeloSeleciona e carrega o modelo necessário para gerar a imagemCheckpointLoaderSimple, UNETLoader, CLIPLoader, VAELoader
2. Codificar o textoConverte a descrição da imagem desejada em um formato que o modelo possa compreenderCLIPTextEncode, CLIPTextEncodeFlux
3. Criar uma imagem latente vaziaDefine a largura e a altura da imagem que será geradaEmptyLatentImage, EmptySD3LatentImage
4. AmostragemGera a imagemKSampler
5. Decodificar/salvarSalva a imagem geradaVAEDecode, SaveImage

Formas de carregar modelos de imagem: integrada vs. separada

Há duas formas principais de carregar um modelo.

Carregamento integrado (CheckpointLoaderSimple) Um único arquivo (.safetensors) contém UNET + CLIP + VAE, permitindo carregar todos os componentes de uma vez com um único node. Modelos como Flux Schnell fp8, SDXL e SD3.5 usam esse método.

Carregamento separado (UNETLoader/Load diffusion model + CLIPLoader + VAELoader) Cada componente é carregado separadamente a partir de seu próprio arquivo. Isso permite alterar livremente a combinação de modelos e escolher a precisão necessária, como fp16 ou fp8. Modelos recentes, como Flux, Qwen e ZIT, usam esse método.

Método de amostragem: KSampler

MétodoCaracterísticas
KSamplerConfigura steps, cfg, sampler e scheduler em um único node. Simples e intuitivo

Formatos de prompt

Uma cena de alguém trabalhando em um laptop em um café de Seul durante a primavera serve como exemplo:

Formato de frase: A candid, photo-realistic scene inside a cozy Seoul café in spring: a person working on a laptop by a window with soft morning sunlight, cherry blossoms faintly visible outside, shallow depth of field, warm natural tones, 35mm lens look, high detail, no text, no logos

Formato de tags: photorealistic, candid, Seoul cafe, spring, laptop, window seat, soft morning light, cherry blossoms outside, shallow depth of field, warm tones, 35mm, high detail, cozy atmosphere, no text, no logos


Apresentação dos modelos

Família Flux

Recomenda-se usar prompts em formato de frase com estes modelos. Também é possível usar prompts em formato de tags, mas o desempenho será menor.

ModeloVelocidadeQualidade
Flux.1 SchnellMuito rápidoRegular
Flux.1 DevRegularBoa
Flux.2 DevRegular a rápidoExcelente
Flux.2 Klein 4BMuito rápidoBoa
Flux.2 Klein 9BRápidoExcelente
Flux.1 Krea DevRegularBoa

Família SDXL

Estes modelos oferecem suporte apenas a prompts em formato de tags.

ModeloVelocidadeQualidade
SDXLRegularExcelente
SDXL TurboMuito rápidoRegular

Família Qwen Image

Qwen-Image é uma família de modelos com excelente suporte a prompts multilíngues. Ele usa um codificador de texto baseado no Qwen 2.5 VL, permitindo escrever prompts em vários idiomas, incluindo coreano, chinês e inglês.

ModeloVelocidadeQualidade
Qwen-Image 20BRápidoAlta
Qwen-Image 2512FlexívelMáxima
Qwen-Image 2512 TurboMuito rápidoMáxima
Qwen-Image-Edit-2509FlexívelAlta
Qwen-Image-Edit-2512FlexívelMáxima

Outros modelos

Z-Image-Turbo

  • Usa o codificador de texto Qwen 3 4B
  • Geração rápida em 8 steps
  • Modelo otimizado para imagens fotorrealistas

Z-Image-Base

  • Usa o codificador de texto Qwen 3 4B
  • Modelo otimizado para imagens fotorrealistas

Qual modelo escolher?

Recomendações por finalidade

Se tiver dificuldade para escolher um modelo, consulte a tabela abaixo.

FinalidadeModelo recomendadoMotivo
Para começarZ-Image-Turbo8 steps, alta velocidade e modelo padrão do Getting Started
Geração rápida/poucos recursos/modelo leveFlux.1 Schnell4 steps, alta velocidade e licença Apache 2.0
Alta qualidade para uso geralFlux.1 Dev, Z-Image-TurboBom equilíbrio entre qualidade e velocidade
Fotografia fotorrealistaFlux.1 Krea DevAjustado especificamente para fotografias realistas
Renderização de textoQwen-Image 2512, Flux.2 DevGera texto com precisão dentro da imagem
Anime/ilustraçãoSDXL (Illustrious-XL, NoobAI-XL)Especializado em estilos de anime
Prompts em coreanoFamília Qwen-ImageSuporte multilíngue a coreano, chinês e inglês

Percurso de aprendizado recomendado para iniciantes

Se você está começando a usar o Text-to-Image no ComfyUI, recomendamos esta ordem:

  1. Entenda o pipeline básico com o Z-Image-Turbo
  2. Gere imagens de alta qualidade com o Flux.1 Dev ou o Flux.2 Dev
    • Use prompts mais elaborados para gerar resultados de alta qualidade
  3. Avance para modelos especializados adequados à sua finalidade
    • Se precisar de um estilo de anime, use o SDXL
    • Se quiser experimentar prompts em coreano, use o Qwen-Image

Resumo dos pontos principais

O que você deve lembrar

  • Todos os workflows de Text to Image seguem o mesmo fluxo: carregar o modelo → codificar o texto → fazer a amostragem → decodificar → salvar.
  • Os valores ideais de steps, CFG, sampler e scheduler variam conforme o modelo. Comece usando os valores padrão do template e ajuste-os aos poucos.