01. Tạo hình ảnh (Text-to-Image)

Table of contents

Nội dung của chương này

Text-to-Image (T2I) là phương thức tạo hình ảnh AI cơ bản nhất, chỉ sử dụng văn bản. Khi bạn mô tả cảnh mong muốn bằng lời, chẳng hạn như “A cat sitting on a rainbow”, model AI sẽ diễn giải và tạo thành hình ảnh.

Trong chương này, bạn sẽ tìm hiểu:

  • Cấu trúc workflow cơ bản của Text-to-Image
  • Đặc điểm của các model hình ảnh chính như Flux, SDXL và Qwen-Image
  • Hướng dẫn chọn model phù hợp với mục đích và môi trường

Tìm hiểu pipeline cơ bản

Mọi workflow Text-to-Image đều có chung năm bước dưới đây. Tên node và cài đặt chi tiết có thể khác nhau tùy model, nhưng luồng tổng thể vẫn giống nhau.

Giải thích theo từng bước

BướcThực hiệnNode liên quan (ví dụ)
1. Tải modelChọn và tải model cần thiết để tạo hình ảnhCheckpointLoaderSimple, UNETLoader, CLIPLoader, VAELoader
2. Mã hóa văn bảnChuyển phần mô tả hình ảnh muốn tạo sang định dạng model có thể hiểuCLIPTextEncode, CLIPTextEncodeFlux
3. Hình ảnh tiềm ẩn trốngThiết lập chiều rộng và chiều cao để tạo hình ảnhEmptyLatentImage, EmptySD3LatentImage
4. SamplingTạo hình ảnhKSampler
5. Giải mã/lưuLưu hình ảnh đã tạoVAEDecode, SaveImage

Cách tải model hình ảnh: tích hợp và tách rời

Có hai cách chính để tải model.

Tải tích hợp (CheckpointLoaderSimple) Một tệp (.safetensors) chứa tất cả UNET + CLIP + VAE, vì vậy bạn có thể tải đồng thời mọi thành phần chỉ bằng một node. Flux Schnell fp8, SDXL, SD3.5 và các model khác sử dụng phương thức này.

Tải tách rời (UNETLoader/Load diffusion model + CLIPLoader + VAELoader) Mỗi thành phần được tải riêng từ một tệp khác nhau. Bạn có thể tự do thay đổi tổ hợp model và chọn độ chính xác cần thiết (fp16, fp8, v.v.). Các model mới nhất như Flux, QwenZIT sử dụng phương thức này.

Phương thức sampler: KSampler

Phương thứcĐặc điểm
KSamplerThiết lập steps, cfg, sampler, scheduler trong một node. Đơn giản và trực quan

Định dạng prompt

Lấy ví dụ về cảnh làm việc bằng laptop tại một quán cà phê ở Seoul vào mùa xuân:

Dạng câu: A candid, photo-realistic scene inside a cozy Seoul café in spring: a person working on a laptop by a window with soft morning sunlight, cherry blossoms faintly visible outside, shallow depth of field, warm natural tones, 35mm lens look, high detail, no text, no logos

Dạng tag: photorealistic, candid, Seoul cafe, spring, laptop, window seat, soft morning light, cherry blossoms outside, shallow depth of field, warm tones, 35mm, high detail, cozy atmosphere, no text, no logos


Giới thiệu model

Dòng Flux

Nên sử dụng prompt dạng câu với model này (vẫn có thể sử dụng prompt dạng tag nhưng hiệu suất sẽ giảm).

ModelTốc độChất lượng
Flux.1 SchnellRất nhanhTrung bình
Flux.1 DevTrung bìnhTốt
Flux.2 DevTrung bình~nhanhXuất sắc
Flux.2 Klein 4BRất nhanhTốt
Flux.2 Klein 9BNhanhXuất sắc
Flux.1 Krea DevTrung bìnhTốt

Dòng SDXL

Model này chỉ hỗ trợ prompt dạng tag.

ModelTốc độChất lượng
SDXLTrung bìnhXuất sắc
SDXL TurboRất nhanhTrung bình

Dòng Qwen Image

Qwen-Image là dòng model hỗ trợ prompt đa ngôn ngữ rất tốt. Model sử dụng bộ mã hóa văn bản dựa trên Qwen 2.5 VL, cho phép bạn viết prompt bằng nhiều ngôn ngữ như tiếng Hàn, tiếng Trung và tiếng Anh.

ModelTốc độChất lượng
Qwen-Image 20BNhanhCao
Qwen-Image 2512Linh hoạtCao nhất
Qwen-Image 2512 TurboRất nhanhCao nhất
Qwen-Image-Edit-2509Linh hoạtCao
Qwen-Image-Edit-2512Linh hoạtCao nhất

Các model khác

Z-Image-Turbo

  • Sử dụng bộ mã hóa văn bản Qwen 3 4B
  • Tạo nhanh với 8 steps
  • Model được tối ưu hóa cho hình ảnh chân thực

Z-Image-Base

  • Sử dụng bộ mã hóa văn bản Qwen 3 4B
  • Model được tối ưu hóa cho hình ảnh chân thực

Nên chọn model nào?

Đề xuất theo mục đích

Nếu bạn chưa biết chọn model nào, hãy tham khảo bảng dưới đây.

Mục đíchModel đề xuấtLý do
Khi mới bắt đầuZ-Image-Turbo8 steps, tốc độ nhanh, model mặc định của Getting Started
Tạo nhanh/cấu hình thấp/nhẹFlux.1 Schnell4 steps, tốc độ nhanh, Apache 2.0
Chất lượng cao, đa dụngFlux.1 Dev, Z-Image-TurboChất lượng và tốc độ cân bằng
Ảnh chân thựcFlux.1 Krea DevĐược tinh chỉnh cho ảnh chân thực
Hiển thị văn bảnQwen-Image 2512, Flux.2 DevTạo chữ chính xác trong hình ảnh
Anime/minh họaSDXL (Illustrious-XL, NoobAI-XL)Chuyên biệt cho phong cách anime
Prompt tiếng HànDòng Qwen-ImageHỗ trợ đa ngôn ngữ gồm tiếng Hàn, tiếng Trung và tiếng Anh

Lộ trình học đề xuất cho người mới

Nếu bạn mới bắt đầu sử dụng Text-to-Image với ComfyUI, chúng tôi đề xuất thứ tự sau:

  1. Tìm hiểu pipeline cơ bản với Z-Image-Turbo
  2. Tạo hình ảnh chất lượng cao với Flux.1 Dev hoặc Flux.2 Dev
    • Tạo kết quả chất lượng cao bằng prompt tinh tế hơn
  3. Mở rộng sang model chuyên biệt phù hợp với mục đích
    • Nếu cần phong cách anime, hãy dùng SDXL
    • Nếu muốn thử prompt tiếng Hàn, hãy dùng Qwen-Image

Tóm tắt nội dung chính

Những điều cần ghi nhớ

  • Mọi workflow Text to Image đều tuân theo cùng một luồng: tải model → mã hóa văn bản → sampling → giải mã → lưu.
  • Mỗi model có giá trị steps, CFG, samplerscheduler tối ưu khác nhau. Hãy sử dụng giá trị mặc định của template trước rồi điều chỉnh từ từ.