SSD Nodes Learn RAM 8GB — $66/ปี
คู่มือ Matt Connorโดย Matt Connor · อัปเดตเมื่อ 2026-08-01

เครื่องสร้างภาพ AI แบบโฮสต์เองต้องใช้สเปกเท่าไร

ดูสเปกตามจริงสำหรับรัน Stable Diffusion เอง: CPU VPS ใช้ SD 1.5 ได้ใน 1 ถึง 2 นาทีต่อภาพ แต่ SDXL ใช้ 10 ถึง 20 นาที พร้อมคำสั่งติดตั้ง ComfyUI และพื้นที่ 6.94 GB

สิ่งที่เครื่องสร้างภาพ AI แบบโฮสต์เองต้องการจริง ๆ

เครื่องสร้างภาพ AI แบบโฮสต์เองประกอบด้วยเว็บแอป 1 ตัวและไฟล์โมเดล 1 ไฟล์ แอปคือ ComfyUI และทำงานได้บนเครื่อง Linux ใดก็ได้ โมเดลเป็นตัวกำหนดฮาร์ดแวร์ที่คุณต้องใช้ checkpoint ระดับ SDXL เป็นไฟล์เดี่ยวขนาด 6.94 GB และต้องใช้งานในหน่วยความจำ GPU ข้อเท็จจริงข้อนี้เป็นตัวกำหนดงบประมาณทั้งหมด ดังนั้นโปรดอ่านลำดับตัวเลือกฮาร์ดแวร์ด้านล่างก่อนเช่าเซิร์ฟเวอร์

สรุปตามจริงคือ VPS ที่ใช้เฉพาะ CPU สามารถติดตั้งและให้บริการซอฟต์แวร์ได้ และสามารถสร้างภาพขนาด 512x512 ด้วยโมเดล Stable Diffusion 1.5 รุ่นเก่าได้ โดยใช้เวลาประมาณ 1 ถึง 2 นาทีต่อภาพ เครื่องเดียวกันที่รัน SDXL ขนาด 1024x1024 จะใช้เวลา 10 ถึง 20 นาทีต่อภาพ นั่นไม่ได้หมายความว่าการตั้งค่าผิดปกติ แต่เป็นผลจากการคำนวณ และคู่มือนี้จะอธิบายรายละเอียดดังกล่าว

เหตุใดขนาดของโมเดลจึงเป็นตัวกำหนดเครื่อง

การสร้างภาพทำงานด้วยลูปลดสัญญาณรบกวน การเรนเดอร์ 30 ขั้นจะประมวลผลโมเดลทั้งหมดกับภาพ 30 ครั้ง และแต่ละขั้นจะอ่าน weight ทุกค่า SDXL ที่ใช้ความแม่นยำครึ่งหนึ่งมี weight ประมาณ 6.9 GB ดังนั้นการเรนเดอร์ 30 ขั้นจะย้ายข้อมูลผ่านหน่วยความจำประมาณ 200 GB ก่อนที่คุณจะเห็นภาพ

GPU ที่มีหน่วยความจำวิดีโอ 24 GB (VRAM ซึ่งเป็นหน่วยความจำที่ติดตั้งอยู่ถัดจากชิปกราฟิก) อ่านข้อมูลด้วยความเร็วหลายร้อย GB ต่อวินาที และเก็บข้อมูล 6.9 GB ทั้งหมดไว้ได้พร้อมกัน VPS ที่ใช้ CPU อ่าน system RAM ด้วยความเร็วระดับหลายสิบ GB ต่อวินาที และไม่มีฮาร์ดแวร์เมทริกซ์สำหรับการคอนโวลูชัน ดังนั้นลูปเดียวกันจึงทำงานช้าลง 1 ถึง 2 ลำดับขนาด นี่คือเหตุผลด้านแบนด์วิดท์ของหน่วยความจำแบบเดียวกับที่กำหนดประสิทธิภาพของโมเดลข้อความ และควรอ่านควบคู่กับ กรณีที่ VPS พร้อม GPU คุ้มค่ากับค่าใช้จ่ายจริง

การสร้างภาพแตกต่างจากการสร้างข้อความในประเด็นสำคัญหนึ่งประการ โมเดลแชตจะสตรีม token ดังนั้นเครื่องที่ช้ายังใช้งานได้ เพราะคำจะปรากฏขึ้นระหว่างที่คุณอ่าน แต่ภาพจะแสดงเมื่อขั้นตอนสุดท้ายเสร็จสิ้นเท่านั้น หากช้า คุณจะต้องจ้องแถบความคืบหน้า zolang

ระดับฮาร์ดแวร์พร้อมตัวเลขจริง

บล็อกด้านล่างแสดงค่าทั่วไปสำหรับภาพ SDXL 1 ภาพที่ความละเอียด 1024x1024, 30 ขั้นตอน และใช้ตัวสุ่มตัวอย่าง Euler ณ เดือน July 2026 ให้ใช้ค่าเหล่านี้เป็นค่าประมาณตามลำดับขนาด เวลาอาจเปลี่ยนแปลงตามตัวสุ่มตัวอย่าง จำนวนขั้นตอน และความละเอียดของคุณ

ChartOne SDXL image, 1024x1024, 30 steps (typical, July 2026)
The data behind this chart
[
  {
    "label": "8 vCPU VPS, no GPU",
    "seconds_per_image": 780
  },
  {
    "label": "8GB VRAM GPU",
    "seconds_per_image": 32
  },
  {
    "label": "12GB VRAM GPU",
    "seconds_per_image": 18
  },
  {
    "label": "24GB VRAM GPU",
    "seconds_per_image": 9
  }
]

แถว CPU ใช้เวลา 780 วินาที หรือประมาณ 13 นาที การ์ด 24 GB ใช้เวลา 9 วินาที นี่คือส่วนต่างของประสิทธิภาพที่คุณกำลังจ่ายเงินเพื่อซื้อ

ให้อ่านระดับฮาร์ดแวร์ตามแนวทางนี้ หากมี VRAM ต่ำกว่า 8 GB ก็ยังสามารถเรียกใช้ SDXL ได้ เพราะ ComfyUI จะ offload เลเยอร์ไปยัง RAM ของระบบโดยอัตโนมัติ และสามารถทำงานกับการ์ดที่มี VRAM เพียง 1 GB ได้ การ offload จะเพิ่มเวลาในทุกขั้นตอน ดังนั้นการ์ด 6 GB จึงใช้เวลาสร้างภาพใกล้ 1 นาทีต่อภาพมากกว่า 30 วินาที เมื่อมี 8 GB โมเดลฐานจะอยู่ในหน่วยความจำได้ทั้งหมด และการเรนเดอร์จะทำงานได้สะดวก เมื่อมี 12 GB คุณสามารถเก็บ ControlNet 1 หรือ 2 ตัวไว้พร้อมกับ checkpoint ได้โดยไม่ต้อง offload เมื่อมี 24 GB คุณสามารถเรียกใช้ SDXL พร้อม refiner และการเพิ่มสเกลใน workflow เดียว และเริ่มฝึก adapter ของ LoRA ได้ ซึ่งต้องใช้หน่วยความจำมากกว่าการสร้างภาพอย่างมาก

VPS ที่ใช้ CPU ทำอะไรได้และทำอะไรไม่ได้

VPS ที่ใช้ CPU ทำได้มากกว่าที่หลายคนคาดไว้ และทำได้น้อยกว่าที่การตลาดกล่าวอ้าง ควรกำหนดขอบเขตให้ชัดเจน

VPS ที่ใช้ CPU สามารถติดตั้ง ComfyUI ให้บริการเว็บอินเทอร์เฟซ จัดเก็บคลังโมเดล เรียกใช้คิว และสร้างภาพได้โดยไม่ต้องมี GPU เลย สำหรับ Stable Diffusion 1.5 ที่ความละเอียด 512x512 และ 20 ขั้นตอน ให้คาดการณ์เวลาประมาณ 60 ถึง 150 วินาทีต่อภาพบน vCPU รุ่นใหม่ 8 คอร์ พร้อม RAM 16 GB สำหรับงานแบบแบตช์ที่ทำงานข้ามคืน หรือปลายทางสร้างภาพที่มีปริมาณคำขอต่ำและมีคิวรองรับ ประสิทธิภาพระดับนี้ถือว่าเพียงพอ

VPS ที่ใช้ CPU ไม่เหมาะกับงานแบบโต้ตอบทันที การปรับ prompt หมายถึงการเรนเดอร์ 20 ครั้งใน 1 ชั่วโมง แต่หากใช้เวลา 13 นาทีต่อครั้ง คุณจะได้เพียง 4 ครั้ง นอกจากนี้ยังไม่เหมาะกับการฝึกโมเดล การ fine-tune LoRA บน CPU ใช้เวลาเป็นวัน ไม่ใช่เป็นชั่วโมง ดังนั้นให้ถือว่าไม่พร้อมใช้งาน

กฎด้านหน่วยความจำสำหรับการใช้ CPU เท่านั้นแตกต่างจากกฎสำหรับ GPU น้ำหนักโมเดลจะถูกโหลดเข้า system RAM ดังนั้นต้องมีพื้นที่สำหรับขนาดโมเดลและพื้นที่ทำงานด้วย โดยต้องใช้ RAM ประมาณ 16 GB สำหรับ SDXL และประมาณ 8 GB สำหรับ SD 1.5 เครื่องที่มี RAM 4 GB จะเริ่ม ComfyUI ได้ แต่จากนั้นจะถูก out-of-memory killer ยุติการทำงานระหว่างการเรนเดอร์ครั้งแรก ซึ่งจะแสดงเป็น process ที่หายไปพร้อมกับ Killed ใน dmesg และไม่มี Python traceback

ติดตั้ง ComfyUI บนเครื่องที่มี GPU

คำสั่งเหล่านี้มาจากโครงการต้นทาง ให้เริ่มจากการติดตั้ง Ubuntu 24.04 ใหม่ทั้งหมด โดยมี NVIDIA driver ติดตั้งไว้แล้ว ตรวจสอบ driver ก่อน เนื่องจากหากไม่ตรวจสอบ ปัญหาที่เกิดขึ้นในขั้นตอนถัดไปจะดูเหมือนกันทั้งหมด

nvidia-smi

คำสั่งนี้ต้องแสดงตารางที่มีการ์ดของคุณและ CUDA version หากแสดง command not found หรือ NVIDIA-SMI has failed because it couldn't communicate with the NVIDIA driver แสดงว่า driver ไม่ได้ติดตั้ง หรือ kernel module ไม่ได้โหลดหลังจากการอัปเกรด แก้ไขปัญหานี้ก่อนดำเนินการต่อ เพราะ ComfyUI จะสลับไปใช้ CPU โดยไม่แสดงข้อผิดพลาด และคุณอาจเข้าใจผิดว่าเป็นปัญหาของซอฟต์แวร์

sudo apt update
sudo apt install -y git python3-venv python3-pip wget
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv venv
. venv/bin/activate
pip install torch torchvision torchaudio --extra-index-url https://download.pytorch.org/whl/cu130
pip install -r requirements.txt

virtual environment ไม่ใช่คำแนะนำที่เลือกทำหรือไม่ทำก็ได้ PyTorch ติดตั้ง dependency จำนวนมาก และการติดตั้งลงในระบบโดยตรงบนเครื่องที่ใช้งานอย่างอื่นอยู่ จะทำให้ซอฟต์แวร์อื่นเสียหาย ตรวจสอบว่า PyTorch มองเห็นการ์ดก่อนดำเนินการต่อ

python -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0))"

True พร้อมชื่อการ์ดของคุณหมายความว่า stack ทำงานได้ หากแสดง False หมายความว่า wheel ที่ติดตั้งไม่ตรงกับ driver โดยมักเกิดจากมี CPU-only torch wheel อยู่ใน cache แล้ว ติดตั้งใหม่โดยใช้ index URL ด้านบน

ดาวน์โหลดโมเดลและวางแผนพื้นที่ดิสก์

ComfyUI ไม่มี weights มาให้ ต้องวาง checkpoint ไว้ใน models/checkpoints, ไฟล์ VAE ไว้ใน models/vae และอะแดปเตอร์ LoRA ไว้ใน models/loras

cd ~/ComfyUI/models/checkpoints
wget https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0/resolve/main/sd_xl_base_1.0.safetensors

ให้เลือกใช้ .safetensors แทน .ckpt เสมอ ไฟล์ .ckpt เป็นออบเจ็กต์ Python ที่ผ่านการ serialize ด้วย pickle และเมื่อโหลดไฟล์ดังกล่าว ระบบจะเรียกใช้โค้ดจากผู้สร้างไฟล์นั้น รูปแบบ safetensors เก็บเฉพาะ tensor ดังนั้นไฟล์ที่เป็นอันตรายจึงไม่สามารถเรียกใช้โค้ดได้

พื้นที่จัดเก็บเป็นค่าใช้จ่ายที่มักถูกมองข้าม checkpoint พื้นฐาน SDXL 1 รายการใช้พื้นที่ 6.94 GB ส่วน refiner ใช้พื้นที่เพิ่มอีก 6 GB โมเดล ControlNet 1 รายการใช้พื้นที่ 1.4 ถึง 2.5 GB, upscaler ใช้พื้นที่ 60 ถึง 350 MB และ LoRA ใช้พื้นที่ 20 ถึง 400 MB ผู้ที่ใช้งานอย่างจริงจังมักดาวน์โหลดโมเดลพื้นฐานรายการที่ 2 และ 3 ภายใน 1 สัปดาห์ ควรจัดสรรพื้นที่ดิสก์ 100 GB สำหรับการติดตั้งที่พร้อมใช้งาน และควรตรวจสอบไดเรกทอรี outputs ด้วย เพราะไฟล์ PNG ขนาด 1024x1024 ใช้พื้นที่ไฟล์ละ 1 ถึง 2 MB และงานแบบแบตช์ที่ปล่อยทำงานโดยไม่มีผู้ดูแลสามารถใช้พื้นที่ดิสก์ขนาดเล็กจนเต็มได้โดยไม่รู้ตัว ควรวาง models/ และ output/ ไว้บน volume ที่สามารถขยายได้ และสำรองไฟล์ workflow JSON ด้วยวิธี เช่น การสำรองข้อมูลแบบเพิ่มทีละส่วนที่เข้ารหัสไปยัง object storage weights สามารถดาวน์โหลดใหม่ได้ แต่ workflow ที่ปรับแต่งไว้ไม่สามารถสร้างกลับมาได้ง่าย ๆ

เรียกใช้และเข้าถึงอย่างปลอดภัย

cd ~/ComfyUI
. venv/bin/activate
python main.py --listen 127.0.0.1 --port 8188

ComfyUI ให้บริการบนพอร์ต 8188 บนเครื่องที่ใช้ CPU เท่านั้น ให้เพิ่ม --cpu ซึ่งจะบังคับให้ใช้เส้นทางการประมวลผลด้วย CPU แทนการล้มเหลวเมื่อไม่พบอุปกรณ์ CUDA

ให้ bind กับ 127.0.0.1 ไม่ใช่ 0.0.0.0 ComfyUI ไม่มีหน้าจอเข้าสู่ระบบและไม่มีบัญชีผู้ใช้ ใครก็ตามที่เข้าถึงพอร์ตนี้สามารถจัดคิวงาน อ่านรูปภาพทั้งหมดที่คุณสร้าง และติดตั้ง custom nodes ได้ ซึ่งเท่ากับการเรียกใช้โค้ดใดๆ บนเซิร์ฟเวอร์ของคุณ ให้เข้าถึงผ่าน SSH tunnel จากแล็ปท็อปของคุณแทน

ssh -N -L 8188:127.0.0.1:8188 you@your-server

จากนั้นเปิด http://127.0.0.1:8188 ในเครื่อง หากต้องการให้ผู้ใช้หลายคนเข้าถึงได้จริง ให้วาง reverse proxy ที่มีการตรวจสอบสิทธิ์ไว้ด้านหน้า และให้แอป bind กับ localhost เช่นเดิม หลักการเดียวกันนี้ใช้กับบริการ self-hosted ที่ไม่มีการตรวจสอบสิทธิ์ทุกประเภท และเป็นรูปแบบมาตรฐานใน การติดตั้ง Docker Compose บน VPS

ให้ทำงานต่อภายใต้ systemd

คิวเรนเดอร์ที่หยุดทำงานเมื่อเซสชัน SSH ของคุณปิดลง ไม่ใช่บริการ ให้เขียน /etc/systemd/system/comfyui.service

[Unit]
Description=ComfyUI
After=network-online.target

[Service]
User=comfy
WorkingDirectory=/home/comfy/ComfyUI
ExecStart=/home/comfy/ComfyUI/venv/bin/python main.py --listen 127.0.0.1 --port 8188
Restart=on-failure
RestartSec=5

[Install]
WantedBy=multi-user.target
sudo systemctl daemon-reload
sudo systemctl enable --now comfyui
systemctl status comfyui

active (running) และบรรทัดบันทึกที่มีข้อความ To see the GUI go to: http://127.0.0.1:8188 หมายความว่าบริการทำงานอยู่ โปรดทราบว่า ExecStart ระบุตัวแปลภาษาภายในสภาพแวดล้อมเสมือนโดยตรง เนื่องจาก systemd ไม่เรียกใช้ shell profile ของคุณ และ activate จะไม่เกิดขึ้นเลย

คำแนะนำที่เหมาะสมตามงบประมาณ

หากต้องการทดลองสร้างภาพและให้ความสำคัญกับค่าใช้จ่ายมากกว่าความเร็ว ให้เลือก CPU VPS ที่มี RAM 16 GB ใช้ SD 1.5 ที่ความละเอียด 512x512 และยอมรับว่าการสร้างภาพแต่ละภาพอาจใช้เวลา 1 หรือ 2 นาที นี่เป็นจุดเริ่มต้นที่เหมาะสมและตรงไปตรงมา โดยมีค่าใช้จ่ายเพียงเศษส่วนของระบบที่ติดตั้ง GPU นอกจากนี้ยังเหมาะสำหรับโฮสต์คลังโมเดลและเวิร์กโฟลว์ระหว่างที่คุณประเมินตัวเลือกต่างๆ

หากคุณปรับ prompt ทุกวัน ให้เช่า GPU ที่มี VRAM อย่างน้อย 12 GB แบบคิดค่าบริการรายชั่วโมงจาก GPU cloud และหยุดการทำงานเมื่อเลิกใช้งาน การสร้างภาพเป็นงานที่มีปริมาณการใช้งานขึ้นลงเป็นช่วงๆ และ GPU ที่ไม่ได้ใช้งานแต่ยังถูกเรียกเก็บค่าบริการรายเดือนเป็นสาเหตุที่พบบ่อยที่สุดของการใช้จ่ายเกินความจำเป็นในกรณีนี้ ให้จัดเก็บ checkpoint ไว้บน block storage ราคาประหยัดและ mount ไว้ใช้งาน

หากให้บริการผู้ใช้อื่น หรือฝึก LoRA adapter คุณต้องมี VRAM 24 GB และเครื่องที่เปิดใช้งานไว้ตลอด เมื่อถึงจุดนั้น เครื่องเดียวกันมักคุ้มค่ามากขึ้นหากใช้รัน language model ภายในเครื่องด้วย ซึ่งเป็นการตั้งค่าที่อธิบายไว้ใน การโฮสต์ LLM ด้วยตนเองโดยใช้ Ollama

ไม่ว่าจะเลือกตัวเลือกใด ให้ตรวจวัดประสิทธิภาพเครื่องของคุณเองก่อนเชื่อตัวเลขที่เผยแพร่ไว้ Queue prompt เดียวกัน 5 ครั้ง แล้วอ่านค่าจำนวนวินาทีต่อการทำซ้ำที่ ComfyUI แสดงในคอนโซล ตัวเลขนี้คือตำแหน่งจริงของเครื่องคุณบนลำดับประสิทธิภาพดังกล่าว

FAQ

สามารถเรียกใช้ Stable Diffusion โดยไม่มี GPU ได้หรือไม่

ได้ ComfyUI ทำงานด้วย python main.py --cpu และสร้างภาพจริงได้โดยไม่ต้องมีการ์ดจอ สำหรับ Stable Diffusion 1.5 ที่ความละเอียด 512x512 ควรใช้เวลาประมาณ 60 ถึง 150 วินาทีต่อภาพ และ SDXL ที่ความละเอียด 1024x1024 ใช้เวลาประมาณ 10 ถึง 20 นาที บน 8 vCPUs รุ่นใหม่ การกำหนดค่านี้เหมาะกับการประมวลผลเป็นชุดข้ามคืนและ endpoint ที่มีปริมาณงานต่ำ แต่ไม่เหมาะกับการปรับ prompt ซ้ำหลายครั้ง และไม่สามารถใช้ฝึกโมเดลได้ในทางปฏิบัติ

ต้องใช้ VRAM เท่าใดสำหรับ SDXL

VRAM 8 GB สามารถเรียกใช้ SDXL ที่ความละเอียด 1024x1024 ได้อย่างราบรื่น หากมี VRAM ต่ำกว่านี้ ComfyUI จะถ่ายโอนเลเยอร์ไปยัง system RAM โดยอัตโนมัติ และยังทำงานได้จนถึงประมาณ 1 GB ของ VRAM แต่ทุกขั้นตอนที่ถ่ายโอนจะเพิ่มเวลาในการประมวลผล VRAM 12 GB ช่วยให้เก็บ ControlNet พร้อมกับ checkpoint ได้ และ VRAM 24 GB รองรับ base, refiner และการเพิ่มความละเอียดใน workflow เดียวกัน อีกทั้งเป็นระดับขั้นต่ำที่เหมาะสมสำหรับการฝึก LoRA adapters

โมเดลต้องใช้พื้นที่ดิสก์เท่าใด

SDXL base checkpoint เพียงอย่างเดียวมีขนาด 6.94 GB และ refiner เพิ่มอีกประมาณ 6 GB โมเดล ControlNet มีขนาดไฟล์ละ 1.4 ถึง 2.5 GB, LoRA adapters มีขนาด 20 ถึง 400 MB และ upscalers มีขนาดสูงสุด 350 MB ควรจัดสรรพื้นที่ 100 GB สำหรับการติดตั้งที่ใช้งานได้จริงและมี base models หลายรายการ และควรตรวจสอบ output directory แยกต่างหาก เนื่องจากไฟล์ PNG ขนาด 1024x1024 มีขนาดไฟล์ละ 1 ถึง 2 MB

การเปิด ComfyUI บนอินเทอร์เน็ตสาธารณะปลอดภัยหรือไม่

ไม่ปลอดภัย ComfyUI ไม่มีระบบ authentication ใด ๆ และระบบ custom-node สามารถติดตั้งและเรียกใช้โค้ด Python จากอินเทอร์เฟซได้ ดังนั้นการเปิด port จึงทำให้เซิร์ฟเวอร์ของคุณเสี่ยงต่อการเรียกใช้โค้ดจากระยะไกล ให้ bind กับ 127.0.0.1, เชื่อมต่อผ่าน SSH tunnel ด้วย ssh -N -L 8188:127.0.0.1:8188 you@your-server และวาง reverse proxy ที่มี authentication ไว้ด้านหน้า หากมีผู้ใช้มากกว่า 1 คนต้องเข้าถึงระบบ

เหตุใด render จึงถูกยุติโดยไม่มีข้อความแสดงข้อผิดพลาด

หาก process หายไปพร้อมกับ Killed ใน dmesg และไม่มี Python traceback สาเหตุคือ Linux out-of-memory killer ไม่ใช่ข้อบกพร่องของ ComfyUI บนเครื่องที่ใช้ CPU เท่านั้น weights จะอยู่ใน system RAM ดังนั้น SDXL ต้องใช้หน่วยความจำประมาณ 16 GB และ SD 1.5 ต้องใช้ประมาณ 8 GB รวมถึงพื้นที่สำหรับการประมวลผล เพิ่ม RAM, เพิ่ม swap หรือลดไปใช้โมเดลที่มีขนาดเล็กลงและความละเอียดต่ำลง

#stable-diffusion#comfyui#ai#images#self-hosting#gpu