Nội dung của chương này
Text-to-Image (T2I) là phương thức tạo hình ảnh AI cơ bản nhất, chỉ sử dụng văn bản. Khi bạn mô tả cảnh mong muốn bằng lời, chẳng hạn như “A cat sitting on a rainbow”, model AI sẽ diễn giải và tạo thành hình ảnh.
Trong chương này, bạn sẽ tìm hiểu:
- Cấu trúc workflow cơ bản của Text-to-Image
- Đặc điểm của các model hình ảnh chính như Flux, SDXL và Qwen-Image
- Hướng dẫn chọn model phù hợp với mục đích và môi trường
Tìm hiểu pipeline cơ bản
Mọi workflow Text-to-Image đều có chung năm bước dưới đây. Tên node và cài đặt chi tiết có thể khác nhau tùy model, nhưng luồng tổng thể vẫn giống nhau.
Giải thích theo từng bước
| Bước | Thực hiện | Node liên quan (ví dụ) |
|---|---|---|
| 1. Tải model | Chọn và tải model cần thiết để tạo hình ảnh | CheckpointLoaderSimple, UNETLoader, CLIPLoader, VAELoader |
| 2. Mã hóa văn bản | Chuyển phần mô tả hình ảnh muốn tạo sang định dạng model có thể hiểu | CLIPTextEncode, CLIPTextEncodeFlux |
| 3. Hình ảnh tiềm ẩn trống | Thiết lập chiều rộng và chiều cao để tạo hình ảnh | EmptyLatentImage, EmptySD3LatentImage |
| 4. Sampling | Tạo hình ảnh | KSampler |
| 5. Giải mã/lưu | Lưu hình ảnh đã tạo | VAEDecode, SaveImage |
Cách tải model hình ảnh: tích hợp và tách rời
Có hai cách chính để tải model.
Tải tích hợp (CheckpointLoaderSimple)
Một tệp (.safetensors) chứa tất cả UNET + CLIP + VAE, vì vậy bạn có thể tải đồng thời mọi thành phần chỉ bằng một node. Flux Schnell fp8, SDXL, SD3.5 và các model khác sử dụng phương thức này.
Tải tách rời (UNETLoader/Load diffusion model + CLIPLoader + VAELoader) Mỗi thành phần được tải riêng từ một tệp khác nhau. Bạn có thể tự do thay đổi tổ hợp model và chọn độ chính xác cần thiết (fp16, fp8, v.v.). Các model mới nhất như Flux, Qwen và ZIT sử dụng phương thức này.
Phương thức sampler: KSampler
| Phương thức | Đặc điểm |
|---|---|
| KSampler | Thiết lập steps, cfg, sampler, scheduler trong một node. Đơn giản và trực quan |
Định dạng prompt
Lấy ví dụ về cảnh làm việc bằng laptop tại một quán cà phê ở Seoul vào mùa xuân:
Dạng câu: A candid, photo-realistic scene inside a cozy Seoul café in spring: a person working on a laptop by a window with soft morning sunlight, cherry blossoms faintly visible outside, shallow depth of field, warm natural tones, 35mm lens look, high detail, no text, no logos
Dạng tag: photorealistic, candid, Seoul cafe, spring, laptop, window seat, soft morning light, cherry blossoms outside, shallow depth of field, warm tones, 35mm, high detail, cozy atmosphere, no text, no logos
Giới thiệu model
Dòng Flux
Nên sử dụng prompt dạng câu với model này (vẫn có thể sử dụng prompt dạng tag nhưng hiệu suất sẽ giảm).
| Model | Tốc độ | Chất lượng |
|---|---|---|
| Flux.1 Schnell | Rất nhanh | Trung bình |
| Flux.1 Dev | Trung bình | Tốt |
| Flux.2 Dev | Trung bình~nhanh | Xuất sắc |
| Flux.2 Klein 4B | Rất nhanh | Tốt |
| Flux.2 Klein 9B | Nhanh | Xuất sắc |
| Flux.1 Krea Dev | Trung bình | Tốt |
Dòng SDXL
Model này chỉ hỗ trợ prompt dạng tag.
| Model | Tốc độ | Chất lượng |
|---|---|---|
| SDXL | Trung bình | Xuất sắc |
| SDXL Turbo | Rất nhanh | Trung bình |
Dòng Qwen Image
Qwen-Image là dòng model hỗ trợ prompt đa ngôn ngữ rất tốt. Model sử dụng bộ mã hóa văn bản dựa trên Qwen 2.5 VL, cho phép bạn viết prompt bằng nhiều ngôn ngữ như tiếng Hàn, tiếng Trung và tiếng Anh.
| Model | Tốc độ | Chất lượng |
|---|---|---|
| Qwen-Image 20B | Nhanh | Cao |
| Qwen-Image 2512 | Linh hoạt | Cao nhất |
| Qwen-Image 2512 Turbo | Rất nhanh | Cao nhất |
| Qwen-Image-Edit-2509 | Linh hoạt | Cao |
| Qwen-Image-Edit-2512 | Linh hoạt | Cao nhất |
Các model khác
Z-Image-Turbo
- Sử dụng bộ mã hóa văn bản Qwen 3 4B
- Tạo nhanh với 8 steps
- Model được tối ưu hóa cho hình ảnh chân thực
Z-Image-Base
- Sử dụng bộ mã hóa văn bản Qwen 3 4B
- Model được tối ưu hóa cho hình ảnh chân thực
Nên chọn model nào?
Đề xuất theo mục đích
Nếu bạn chưa biết chọn model nào, hãy tham khảo bảng dưới đây.
| Mục đích | Model đề xuất | Lý do |
|---|---|---|
| Khi mới bắt đầu | Z-Image-Turbo | 8 steps, tốc độ nhanh, model mặc định của Getting Started |
| Tạo nhanh/cấu hình thấp/nhẹ | Flux.1 Schnell | 4 steps, tốc độ nhanh, Apache 2.0 |
| Chất lượng cao, đa dụng | Flux.1 Dev, Z-Image-Turbo | Chất lượng và tốc độ cân bằng |
| Ảnh chân thực | Flux.1 Krea Dev | Được tinh chỉnh cho ảnh chân thực |
| Hiển thị văn bản | Qwen-Image 2512, Flux.2 Dev | Tạo chữ chính xác trong hình ảnh |
| Anime/minh họa | SDXL (Illustrious-XL, NoobAI-XL) | Chuyên biệt cho phong cách anime |
| Prompt tiếng Hàn | Dòng Qwen-Image | Hỗ trợ đa ngôn ngữ gồm tiếng Hàn, tiếng Trung và tiếng Anh |
Lộ trình học đề xuất cho người mới
Nếu bạn mới bắt đầu sử dụng Text-to-Image với ComfyUI, chúng tôi đề xuất thứ tự sau:
- Tìm hiểu pipeline cơ bản với Z-Image-Turbo
- Tạo hình ảnh chất lượng cao với Flux.1 Dev hoặc Flux.2 Dev
- Tạo kết quả chất lượng cao bằng prompt tinh tế hơn
- Mở rộng sang model chuyên biệt phù hợp với mục đích
- Nếu cần phong cách anime, hãy dùng SDXL
- Nếu muốn thử prompt tiếng Hàn, hãy dùng Qwen-Image
Tóm tắt nội dung chính
Những điều cần ghi nhớ
- Mọi workflow Text to Image đều tuân theo cùng một luồng:
tải model → mã hóa văn bản → sampling → giải mã → lưu. - Mỗi model có giá trị steps, CFG, sampler và scheduler tối ưu khác nhau. Hãy sử dụng giá trị mặc định của template trước rồi điều chỉnh từ từ.