Tạo có hướng dẫn là gì?
Phương thức tạo từ văn bản thành hình ảnh (Text-to-Image) cơ bản tạo hình ảnh chỉ bằng prompt. Tuy nhiên, prompt có những giới hạn khi cần kiểm soát cấu trúc như “theo tư thế này”, “theo bố cục này” hoặc “theo phong cách này”.
Tạo có hướng dẫn (Guided Generation) là kỹ thuật kiểm soát kết quả bằng cách đưa các điều kiện (Condition) bổ sung vào model, chẳng hạn như hình ảnh tham chiếu, thông tin cấu trúc và trọng số phong cách. Trong ComfyUI, có ba phương thức chính:
| Phương thức | Đối tượng kiểm soát | Node tiêu biểu |
|---|---|---|
| ControlNet | Cấu trúc không gian, bố cục | ControlNetApplyAdvanced |
| LoRA | Phong cách, nhân vật, khái niệm | LoraLoader |
| Reference/Redux | Phong cách tổng thể, bầu không khí | Node chuyên dụng theo từng model |
Giải thích chi tiết các loại hướng dẫn
ControlNet
ControlNet kiểm soát cấu trúc của hình ảnh được tạo bằng cách đưa thông tin cấu trúc (Structural Condition) trích xuất từ hình ảnh đầu vào vào model. Bạn có thể tạo một hình ảnh hoàn toàn khác trong khi vẫn giữ đường viền, chiều sâu và tư thế cơ thể của ảnh gốc.
Các loại ControlNet
| Loại | Thông tin trích xuất | Mục đích | Node tiền xử lý |
|---|---|---|---|
| Canny | Đường viền | Giữ hình dạng/silhouette | Canny |
| Depth | Depth map | Giữ phối cảnh/bố trí không gian | DepthAnything V2 |
| OpenPose | Vị trí khớp cơ thể | Giữ tư thế | DWPosePreprocessor |
Parameter cốt lõi của ControlNet
| Parameter | Mô tả | Phạm vi đề xuất |
|---|---|---|
| strength | Cường độ kiểm soát. Giá trị càng cao thì càng bám sát cấu trúc | 0.5 ~ 1.0 |
LoRA - Tùy chỉnh phong cách/nhân vật
Đây là model đã được huấn luyện theo một phong cách hoặc nhân vật cụ thể.
Parameter cốt lõi của LoRA
| Parameter | Mô tả | Phạm vi đề xuất |
|---|---|---|
| strength_model | Mức độ ảnh hưởng của LoRA lên model | 0.6 ~ 1.0 |
| strength_clip | Mức độ ảnh hưởng của LoRA lên bộ mã hóa văn bản | 0.6 ~ 1.0 |
Reference/Redux - Chuyển phong cách dựa trên hình ảnh tham chiếu
Phương thức Reference đưa chính hình ảnh tham chiếu vào model để chuyển phong cách, màu sắc và bầu không khí. Nếu ControlNet là lệnh “hãy làm theo hình dạng này”, thì Reference là lệnh “hãy tạo theo cảm giác này”.
Các model chuyên dụng như Flux.1 Redux trích xuất đặc điểm thị giác của hình ảnh tham chiếu và áp dụng chúng vào quá trình tạo hình ảnh mới.
Workflow ControlNet
Workflow Canny
Canny ControlNet là loại ControlNet cơ bản và trực quan nhất. Nó trích xuất đường viền của hình ảnh đầu vào để kiểm soát hình dạng của hình ảnh được tạo.
Flux.1 Canny
Model sử dụng: flux1-dev-fp8 + flux-canny-controlnet-v3.safetensors
Workflow Depth
Depth ControlNet trích xuất depth map (Depth Map) của hình ảnh đầu vào để kiểm soát phối cảnh và bố trí không gian. Phương thức này đặc biệt hiệu quả khi cần giữ lại “vật nào ở phía trước và vật nào ở phía sau” hơn là hình dạng của nhân vật.
Flux.1 Depth
Model sử dụng: flux1-dev-fp8 + flux-depth-controlnet-v3.safetensors
Workflow OpenPose
OpenPose ControlNet trích xuất tư thế của nhân vật trong hình ảnh đầu vào và hiệu quả khi tạo một nhân vật khác có cùng tư thế.
Flux.1 OpenPose
Model sử dụng: flux1-dev-fp8 + FLUX-1-dev-Controlnet-union-Pro.safetensors
Cấu trúc cơ bản của workflow LoRA
Cấu trúc cơ bản của workflow sử dụng LoRA như sau:
Áp dụng nhiều LoRA
Để áp dụng nhiều LoRA cùng lúc, hãy kết nối liên tiếp các node LoraLoader:
Workflow Reference
Flux.1 Dev USO Reference - Tạo dựa trên hình ảnh tham chiếu
Tạo hình ảnh mới trong khi vẫn duy trì tính nhất quán về phong cách và chủ thể của hình ảnh tham chiếu.
Ví dụ ứng dụng:
- Tạo cùng một nhân vật với nhiều tư thế/bối cảnh khác nhau
- Tạo chuỗi hình ảnh sản phẩm nhất quán
- Tạo nhiều biến thể của cùng một chủ thể
Nên chọn phương thức nào?
Đề xuất theo mục đích
- Cần giữ chính xác đường viền → Canny ControlNet
- Muốn giữ phối cảnh/bố trí không gian → Depth ControlNet
- Muốn tạo theo một phong cách/nhân vật cụ thể → LoRA
- Muốn chuyển bầu không khí của hình ảnh tham chiếu → Reference
- Cần giữ một tư thế cụ thể → OpenPose ControlNet
Tóm tắt
| Nội dung đã học | Điểm cốt lõi |
|---|---|
| ControlNet | Kiểm soát cấu trúc không gian bằng structural map (cạnh/độ sâu/tư thế). Có ba kiến trúc: model chuyên dụng, module ControlNet và model patch |
| LoRA | Tùy chỉnh phong cách/nhân vật/khái niệm bằng tệp trọng số nhẹ. Có thể kết nối thành chuỗi bằng LoraLoader |
| Reference | Chuyển phong cách/bầu không khí của hình ảnh tham chiếu. Phù hợp với chuyển bầu không khí hơn là kiểm soát cấu trúc |