O que este capítulo aborda
Text-to-Image (T2I) é a forma mais básica de geração de imagens com IA, usando apenas texto. Quando você descreve por escrito a cena desejada, como “A cat sitting on a rainbow”, o modelo de IA interpreta a descrição e cria uma imagem.
Neste capítulo, você aprenderá:
- A estrutura de um workflow básico de Text-to-Image
- As características dos principais modelos de imagem, como Flux, SDXL e Qwen-Image
- Como escolher um modelo adequado à finalidade e ao ambiente
Entenda o pipeline básico
Todos os workflows de Text-to-Image compartilham as cinco etapas abaixo. Os nomes dos nodes e as configurações detalhadas variam conforme o modelo, mas o fluxo geral é o mesmo.
Explicação de cada etapa
| Etapa | O que faz | Nodes relacionados (exemplos) |
|---|---|---|
| 1. Carregar o modelo | Seleciona e carrega o modelo necessário para gerar a imagem | CheckpointLoaderSimple, UNETLoader, CLIPLoader, VAELoader |
| 2. Codificar o texto | Converte a descrição da imagem desejada em um formato que o modelo possa compreender | CLIPTextEncode, CLIPTextEncodeFlux |
| 3. Criar uma imagem latente vazia | Define a largura e a altura da imagem que será gerada | EmptyLatentImage, EmptySD3LatentImage |
| 4. Amostragem | Gera a imagem | KSampler |
| 5. Decodificar/salvar | Salva a imagem gerada | VAEDecode, SaveImage |
Formas de carregar modelos de imagem: integrada vs. separada
Há duas formas principais de carregar um modelo.
Carregamento integrado (CheckpointLoaderSimple)
Um único arquivo (.safetensors) contém UNET + CLIP + VAE, permitindo carregar todos os componentes de uma vez com um único node. Modelos como Flux Schnell fp8, SDXL e SD3.5 usam esse método.
Carregamento separado (UNETLoader/Load diffusion model + CLIPLoader + VAELoader) Cada componente é carregado separadamente a partir de seu próprio arquivo. Isso permite alterar livremente a combinação de modelos e escolher a precisão necessária, como fp16 ou fp8. Modelos recentes, como Flux, Qwen e ZIT, usam esse método.
Método de amostragem: KSampler
| Método | Características |
|---|---|
| KSampler | Configura steps, cfg, sampler e scheduler em um único node. Simples e intuitivo |
Formatos de prompt
Uma cena de alguém trabalhando em um laptop em um café de Seul durante a primavera serve como exemplo:
Formato de frase: A candid, photo-realistic scene inside a cozy Seoul café in spring: a person working on a laptop by a window with soft morning sunlight, cherry blossoms faintly visible outside, shallow depth of field, warm natural tones, 35mm lens look, high detail, no text, no logos
Formato de tags: photorealistic, candid, Seoul cafe, spring, laptop, window seat, soft morning light, cherry blossoms outside, shallow depth of field, warm tones, 35mm, high detail, cozy atmosphere, no text, no logos
Apresentação dos modelos
Família Flux
Recomenda-se usar prompts em formato de frase com estes modelos. Também é possível usar prompts em formato de tags, mas o desempenho será menor.
| Modelo | Velocidade | Qualidade |
|---|---|---|
| Flux.1 Schnell | Muito rápido | Regular |
| Flux.1 Dev | Regular | Boa |
| Flux.2 Dev | Regular a rápido | Excelente |
| Flux.2 Klein 4B | Muito rápido | Boa |
| Flux.2 Klein 9B | Rápido | Excelente |
| Flux.1 Krea Dev | Regular | Boa |
Família SDXL
Estes modelos oferecem suporte apenas a prompts em formato de tags.
| Modelo | Velocidade | Qualidade |
|---|---|---|
| SDXL | Regular | Excelente |
| SDXL Turbo | Muito rápido | Regular |
Família Qwen Image
Qwen-Image é uma família de modelos com excelente suporte a prompts multilíngues. Ele usa um codificador de texto baseado no Qwen 2.5 VL, permitindo escrever prompts em vários idiomas, incluindo coreano, chinês e inglês.
| Modelo | Velocidade | Qualidade |
|---|---|---|
| Qwen-Image 20B | Rápido | Alta |
| Qwen-Image 2512 | Flexível | Máxima |
| Qwen-Image 2512 Turbo | Muito rápido | Máxima |
| Qwen-Image-Edit-2509 | Flexível | Alta |
| Qwen-Image-Edit-2512 | Flexível | Máxima |
Outros modelos
Z-Image-Turbo
- Usa o codificador de texto Qwen 3 4B
- Geração rápida em 8 steps
- Modelo otimizado para imagens fotorrealistas
Z-Image-Base
- Usa o codificador de texto Qwen 3 4B
- Modelo otimizado para imagens fotorrealistas
Qual modelo escolher?
Recomendações por finalidade
Se tiver dificuldade para escolher um modelo, consulte a tabela abaixo.
| Finalidade | Modelo recomendado | Motivo |
|---|---|---|
| Para começar | Z-Image-Turbo | 8 steps, alta velocidade e modelo padrão do Getting Started |
| Geração rápida/poucos recursos/modelo leve | Flux.1 Schnell | 4 steps, alta velocidade e licença Apache 2.0 |
| Alta qualidade para uso geral | Flux.1 Dev, Z-Image-Turbo | Bom equilíbrio entre qualidade e velocidade |
| Fotografia fotorrealista | Flux.1 Krea Dev | Ajustado especificamente para fotografias realistas |
| Renderização de texto | Qwen-Image 2512, Flux.2 Dev | Gera texto com precisão dentro da imagem |
| Anime/ilustração | SDXL (Illustrious-XL, NoobAI-XL) | Especializado em estilos de anime |
| Prompts em coreano | Família Qwen-Image | Suporte multilíngue a coreano, chinês e inglês |
Percurso de aprendizado recomendado para iniciantes
Se você está começando a usar o Text-to-Image no ComfyUI, recomendamos esta ordem:
- Entenda o pipeline básico com o Z-Image-Turbo
- Gere imagens de alta qualidade com o Flux.1 Dev ou o Flux.2 Dev
- Use prompts mais elaborados para gerar resultados de alta qualidade
- Avance para modelos especializados adequados à sua finalidade
- Se precisar de um estilo de anime, use o SDXL
- Se quiser experimentar prompts em coreano, use o Qwen-Image
Resumo dos pontos principais
O que você deve lembrar
- Todos os workflows de Text to Image seguem o mesmo fluxo:
carregar o modelo → codificar o texto → fazer a amostragem → decodificar → salvar. - Os valores ideais de steps, CFG, sampler e scheduler variam conforme o modelo. Comece usando os valores padrão do template e ajuste-os aos poucos.