ComfyUI로 AI 그림을 생성할 때 PC에 설치되는 것과 이미지 생성 과정
AI 이미지 생성에 관심이 있다면 한 번쯤 ComfyUI라는 프로그램을 들어보셨을 것입니다. ComfyUI는 일반적인 WebUI 방식과 달리 노드(Node)를 직접 연결해서 AI 이미지 생성 과정을 구성하는 프로그램입니다. 처음 보면 복잡해 보이지만, 각각의 노드가 어떤 역할을 하는지 이해하면 오히려 이미지가 만들어지는 과정을 눈으로 확인하면서 세밀하게 설정할 수 있다는 장점이 있습니다.
이번 글에서는 ComfyUI를 사용하기 위해 PC에 무엇이 설치되는지, 그리고 프롬프트를 입력했을 때 실제로 어떤 과정을 거쳐 한 장의 이미지가 만들어지는지를 쉽게 정리해 보겠습니다.
1. ComfyUI를 사용하면 PC에 무엇이 설치될까?
ComfyUI의 실행 환경을 구성하면 크게 다음과 같은 프로그램과 AI 모델 파일이 필요합니다.
① 기본 실행 환경 - Python과 PyTorch
먼저 ComfyUI가 실행되기 위한 기본적인 소프트웨어 환경이 필요합니다.
Python - ComfyUI 프로그램과 여러 관련 기능을 실행하기 위한 기본 프로그래밍 환경입니다.
PyTorch - AI 연산을 수행하기 위한 핵심 딥러닝 라이브러리입니다. 특히 그래픽카드(GPU)를 이용해 AI 연산을 빠르게 처리할 수 있도록 해줍니다.
다만 ComfyUI를 처음 설치하는 경우에는 Python이나 PyTorch를 하나씩 직접 설치할 필요가 없는 경우도 있습니다. 포터블(Portable) 방식의 통합 패키지를 이용하면 필요한 실행 환경이 함께 들어 있는 형태로 설치할 수 있습니다.
② ComfyUI 본체와 Custom Nodes
ComfyUI 본체
실제로 노드를 배치하고 연결하면서 이미지 생성 작업을 구성하는 프로그램입니다.
ComfyUI에서는 각각의 기능이 하나의 노드 형태로 표시됩니다.
예를 들어 모델을 불러오는 노드, 프롬프트를 입력하는 노드, 이미지를 저장하는 노드 등을 서로 연결하여 하나의 작업 과정(Workflow)을 만들 수 있습니다.
Custom Nodes
ComfyUI의 기본 기능만으로 부족한 경우 추가 기능을 설치할 수 있습니다.
이를 Custom Nodes(커스텀 노드)라고 합니다.
ControlNet, AnimateDiff 등 다양한 기능이나 편의 기능을 추가할 때 사용됩니다.
즉, 스마트폰에 앱을 추가하는 것처럼 ComfyUI에도 필요한 기능을 추가할 수 있다고 생각하면 이해하기 쉽습니다.
③ 가장 중요한 AI 모델 - Checkpoint
실제로 AI가 그림을 생성하는 데 가장 중요한 파일이 Checkpoint(체크포인트) 모델입니다.
일반적으로 .safetensors 등의 확장자를 가진 대용량 파일이며, 모델에 따라 수 GB 이상의 용량을 차지하기도 합니다.
대표적으로 다음과 같은 이미지 생성 모델들이 있습니다.
- Stable Diffusion 1.5
- Stable Diffusion XL(SDXL)
- FLUX
- 기타 다양한 이미지 생성 모델
Checkpoint에는 AI가 학습한 이미지 생성에 필요한 정보가 들어 있습니다.
따라서 어떤 모델을 선택하느냐에 따라 생성되는 이미지의 스타일과 품질, 필요한 VRAM 용량 등이 달라질 수 있습니다.
④ 보조 모델과 추가 파일
Checkpoint 외에도 이미지 생성 과정에서 다양한 보조 모델을 사용할 수 있습니다.
VAE
VAE(Variational Autoencoder)는 AI가 처리한 Latent 데이터를 사람이 볼 수 있는 실제 이미지로 변환하는 데 사용됩니다.
VAE에 따라 색감이나 이미지 표현에 차이가 발생할 수 있습니다.
LoRA
LoRA는 특정 캐릭터, 의상, 화풍, 특징 등을 추가로 적용할 때 사용하는 비교적 작은 모델 파일입니다.
기본 모델에 LoRA를 추가하면 원하는 특징을 좀 더 쉽게 적용할 수 있습니다.
ControlNet
ControlNet은 이미지의 포즈, 윤곽, 깊이(Depth), 구도 등을 보다 정밀하게 제어할 때 사용하는 보조 모델입니다.
예를 들어 사람이 원하는 자세를 유지하면서 새로운 이미지를 생성하는 등의 작업에 활용할 수 있습니다.
2. ComfyUI에서는 이미지가 어떻게 만들어질까?
ComfyUI에서 Queue Prompt를 누르면 우리가 보는 한 장의 이미지가 바로 만들어지는 것처럼 보이지만, 실제로는 여러 단계의 AI 연산을 거칩니다.
전체적인 흐름을 간단하게 정리하면 다음과 같습니다.
모델 로드 → 프롬프트 해석 → 잠재 공간 생성 → 노이즈 제거 → VAE 변환 → 이미지 저장
이제 각각의 과정을 살펴보겠습니다.
1단계. AI 모델 불러오기
먼저 선택한 Checkpoint 모델을 불러옵니다.
모델에 포함된 주요 데이터가 AI 이미지 생성에 사용될 수 있도록 준비됩니다.
일반적인 Stable Diffusion 계열 모델에서는 크게 다음과 같은 요소를 생각할 수 있습니다.
- MODEL : 실제 이미지 생성에 사용되는 핵심 모델
- CLIP : 텍스트 프롬프트를 해석하는 데 사용
- VAE : Latent 데이터를 실제 이미지로 변환
GPU를 사용하는 경우 이러한 AI 연산을 처리하기 위해 필요한 데이터가 GPU의 VRAM을 사용하게 됩니다.
따라서 그래픽카드의 VRAM 용량은 ComfyUI에서 어떤 모델과 해상도를 사용할 수 있는지를 결정하는 중요한 요소입니다.
2단계. 프롬프트 해석
다음은 우리가 입력한 프롬프트를 AI가 이해할 수 있는 형태로 변환하는 과정입니다.
예를 들어 다음과 같은 프롬프트를 입력했다고 가정해 보겠습니다.
"beautiful woman, long hair, realistic portrait"
사람에게는 단순한 문장이지만 AI 모델은 이 문장을 그대로 이해하는 것이 아닙니다.
CLIP과 같은 텍스트 인코더가 프롬프트를 숫자 형태의 정보로 변환합니다.
ComfyUI에서는 일반적으로 다음과 같은 형태로 구성됩니다.
Positive Prompt → CLIP Text Encode
그리고 원하는 경우 Negative Prompt를 사용하여 원하지 않는 요소를 지정할 수도 있습니다.
이렇게 변환된 정보가 이후 이미지 생성 과정에 전달됩니다.
3단계. 초기 잠재 공간 생성
다음은 Empty Latent Image 단계입니다.
여기서 지정한 이미지의 해상도에 맞춰 빈 Latent 공간이 만들어집니다.
예를 들어 1024×1024 이미지를 생성하도록 설정했다면 그에 맞는 잠재 공간이 준비됩니다.
중요한 점은 이 단계에서 만들어지는 것이 우리가 보는 실제 이미지가 아니라는 것입니다.
처음에는 일정한 이미지가 존재하는 것이 아니라 랜덤한 노이즈(Noise)를 기반으로 한 잠재 데이터에서 이미지 생성이 시작됩니다.
4단계. KSampler에서 이미지가 만들어지기 시작한다
ComfyUI에서 가장 핵심적인 이미지 생성 과정 중 하나가 바로 KSampler입니다.
처음에는 이미지가 알아보기 어려운 노이즈 상태에 가깝습니다.
KSampler는 AI 모델의 학습 내용과 우리가 입력한 프롬프트를 참고하면서 이 노이즈를 단계적으로 제거해 나갑니다.
이 과정을 반복하면서 처음에는 아무것도 없는 것처럼 보이던 노이즈에서 점차 사람, 사물, 배경 등의 형태가 만들어집니다.
여기에서 중요한 설정이 여러 가지 있습니다.
Steps
노이즈를 제거하는 과정을 몇 단계에 걸쳐 수행할지를 결정합니다.
일반적으로 Steps가 너무 낮으면 이미지의 표현이 충분하지 않을 수 있고, 무조건 높인다고 해서 항상 결과가 좋아지는 것은 아닙니다.
CFG Scale
프롬프트를 이미지에 얼마나 강하게 반영할지를 조절하는 대표적인 설정입니다.
Sampler / Scheduler
노이즈를 제거하는 방법과 과정을 결정하는 설정입니다.
따라서 같은 프롬프트와 같은 모델을 사용하더라도 KSampler 설정에 따라 결과 이미지가 달라질 수 있습니다.
5단계. VAE Decode를 통해 실제 이미지로 변환
KSampler의 작업이 끝났다고 해서 바로 우리가 보는 PNG 이미지가 만들어지는 것은 아닙니다.
KSampler에서 나온 결과는 여전히 Latent 데이터 형태입니다.
이 데이터를 VAE Decode에 전달하면 비로소 사람이 볼 수 있는 실제 이미지 데이터로 변환됩니다.
즉, 간단하게 표현하면 다음과 같습니다.
Latent 데이터 → VAE Decode → 실제 RGB 이미지
이 과정을 거쳐 우리가 화면에서 볼 수 있는 이미지가 만들어집니다.
6단계. 이미지 저장
마지막으로 완성된 이미지가 Save Image 노드를 통해 저장됩니다.
일반적으로 ComfyUI의 Output 폴더에 생성된 이미지가 저장됩니다.
여기서 ComfyUI의 상당히 편리한 특징이 하나 있습니다.
ComfyUI에서 생성한 PNG 이미지에는 설정에 따라 당시 사용했던 Workflow 정보가 메타데이터로 함께 저장될 수 있습니다.
따라서 해당 이미지를 다시 ComfyUI에 불러오면 당시 사용했던 노드 구성과 설정을 확인하거나 작업을 다시 이어갈 수 있습니다.
즉, 단순한 이미지 파일뿐만 아니라 이미지를 어떻게 만들었는지에 대한 작업 정보까지 함께 보관할 수 있다는 것입니다.
3. ComfyUI의 이미지 생성 과정을 한눈에 정리하면
전체 과정을 아주 간단하게 표현하면 다음과 같습니다.
① AI 모델 로드
↓
② 프롬프트를 AI가 이해할 수 있는 데이터로 변환
↓
③ 랜덤 노이즈를 가진 Latent 공간 생성
↓
④ KSampler가 프롬프트와 모델을 참고해 노이즈를 단계적으로 제거
↓
⑤ VAE Decode가 Latent 데이터를 실제 이미지로 변환
↓
⑥ 완성된 이미지를 화면에 표시하고 저장
결국 우리가 프롬프트에 문장을 입력하고 버튼 하나를 누르는 것처럼 보이지만, 실제로는 이러한 여러 단계가 연결되어 한 장의 이미지가 만들어지는 것입니다.
4. 정리
ComfyUI를 PC에 설치하면 단순히 ComfyUI 프로그램 하나만 설치되는 것이 아닙니다.
기본적인 실행 환경과 함께 AI 모델, VAE, LoRA, ControlNet 등의 다양한 파일이 사용될 수 있습니다.
정리하면 다음과 같습니다.
기본 실행 환경
Python + PyTorch 등
이미지 생성 프로그램
ComfyUI + Custom Nodes
핵심 AI 모델
Checkpoint
보조 모델
VAE + LoRA + ControlNet 등
그리고 실제 이미지 생성 과정은 다음과 같이 이해하면 쉽습니다.
텍스트 입력
→ AI가 이해할 수 있는 데이터로 변환
→ 랜덤 노이즈에서 시작
→ KSampler가 노이즈를 단계적으로 제거
→ VAE Decode
→ 최종 이미지 완성
처음에는 ComfyUI의 노드 구조가 복잡하게 느껴질 수 있습니다.
하지만 각각의 노드가 어떤 데이터를 받아서 어떤 데이터를 다음 노드로 전달하는지 이해하기 시작하면 ComfyUI의 구조가 훨씬 쉽게 보이기 시작합니다.
특히 단순히 AI 그림을 생성하는 것뿐만 아니라 이미지 생성 과정을 직접 설계하고 원하는 기능을 자유롭게 조합할 수 있다는 점이 ComfyUI의 가장 큰 특징이라고 할 수 있습니다.
ComfyUI를 처음 시작하시는 분이라면 먼저 Checkpoint → CLIP → KSampler → VAE → Save Image의 기본적인 흐름부터 이해해 보시는 것을 추천합니다.
이 기본 구조를 이해하면 이후 LoRA, ControlNet, Img2Img 등의 기능을 배울 때도 훨씬 수월하게 이해할 수 있습니다.
'글 > 간단 컴팁' 카테고리의 다른 글
| TM5(TestMem5)를 활용한 램 안정화 테스트 및 불량 점검 (0) | 2026.09.29 |
|---|---|
| 윈도우 11에서 특정 장치의 드라이버 업데이트만 콕 집어서 막는 방법 (0) | 2026.04.01 |
| 3핀 4핀 CPU 쿨러 연결 (0) | 2026.03.09 |
| 인텔 CPU 쿨러, 기본 쿨러(초코파이) 제대로 장착하는 법 및 주의사항 (0) | 2026.03.08 |
댓글