Görsel ve video modelleri için kart seçimi.
Bir görsel modelin hatırlayacağı bir konuşma yoktur, bu yüzden bir dil modelinden tamamen farklı bir kurala göre boyutlandırılır — ve onu barındıran en ucuz kart, neredeyse hiçbir zaman kiralamak isteyeceğiniz kart değildir.
Kısa cevap
- Tam hassasiyette
- SDXL 1.0 8.0 GB · Stable Diffusion 3.5 Large 18.4 GB · FLUX.1 dev 27.6 GB · Wan 2.1 video 14B 32.2 GB — çalışma zamanı payı dahil
- Sorunlu satır
- Katalogdaki her 24 GB kart, BF16'da FLUX.1 dev eşiğinin biraz altında kalır. FP8 bunu yarıya indirir ve hepsinde bu çıtayı aşar
- Onu barındıran en ucuz olan
- NVIDIA L4, aylık $125; FP8'te FLUX.1 dev
- İkinci bir kartın satın aldığı
- Saatte iki kat görsel, ama tek bir görselden tek saniye bile eksilmez
Her modelin ihtiyaç duyduğu
Her şeyin geri kalanını belirleyen farktan başlayın. Bir dil modeli, bağlamın her tokeniyle büyüyen bir key/value önbelleği taşır; aynı 70B modelin ne kadar konuşma tuttuğunuza bağlı olarak 40 GB veya 140 GB istemesinin nedeni de budur. Bir diffusion modelinin hiç önbelleği yoktur. Bir prompt okur, sabit sayıda adımda bir latenti gürültüden arındırır ve unutur. Ağırlıklar bu yüzden bellek sorusunun neredeyse tamamıdır ve promptlarınız uzadıkça cevap değişmez.
| Model | Parametreler | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) |
|---|---|---|---|---|
| SDXL 1.0 | 3.5 B | 8.0 GB | 4.0 GB | 2.0 GB |
| Stable Diffusion 3.5 Large | 8 B | 18.4 GB | 9.2 GB | 4.6 GB |
| FLUX.1 dev | 12 B | 27.6 GB | 13.8 GB | 6.9 GB |
| Wan 2.1 video 14B | 14 B | 32.2 GB | 16.1 GB | 8.0 GB |
Ağırlıklar artı aktivasyonlar, CUDA bağlamı ve ayırıcı parçalanması için %15'lik bir çalışma zamanı payı — yapılandırıcının uyguladığı payla aynı, böylece bunları ona göre kontrol edebilirsiniz. Bağlam sütunu yoktur, çünkü içine koyacak bir şey yoktur.
O tabloda durup üzerinde düşünmeye değer iki satır var, çünkü bir satın almanın tam olarak yanlış gittiği yer orasıdır.
FLUX.1 dev, BF16'da 27.6 GB istiyor. Bu, kiraladığımız her 24 GB'lik kartın ötesinde ve adil hissettirecek kadar da değil. Görsel işlerindeki en yaygın sürpriz tam olarak bu: internette “her yerde 4090'da çalışıyor” denen model aslında nicemlenmiş çalışıyor ve kimse bunu söylemiyor.
Wan 2.1 video 14B, BF16'da 32.2 GB istiyor. 32 GB'lik bir kartı bir gigabaytın küçük bir kısmıyla kaçırıyor. Marjımız kasıtlı olarak temkinlidir ve metin kodlayıcısını karttan çıkararak bunu genellikle telafi edebilirsiniz — ama bir satın almayı bir yuvarlama hatasına göre planlamak zorunda kalmamalısınız, bu yüzden dürüst cevap şudur: video 40 GB veya daha fazlasını ister.
Her kartın barındırdığı
Kiraladığımız her tek kartlı makine ve her birinin bu iki zorlu model için barındırdığı en iyi hassasiyet. Bant genişliği sütunu bir sonraki bölüm için var; onu bu bölümü okuduktan sonra okuyun.
| Düğüm | Kart belleği | Bant Genişliği | FLUX.1 dev | Wan 2.1 video 14B | Aylık |
|---|---|---|---|---|---|
| NVIDIA L4 | 24 GB | 300 GB/s | FP8 | FP8 | $125/ay |
| NVIDIA RTX 4090 | 24 GB | 1,008 GB/s | FP8 | FP8 | $193/ay |
| NVIDIA RTX A6000 | 48 GB | 768 GB/s | BF16 / FP16 | BF16 / FP16 | $286/ay |
| NVIDIA RTX 5090 | 32 GB | 1,792 GB/s | BF16 / FP16 | FP8 | $335/ay |
| NVIDIA A100 PCIe | 40 GB | 1,555 GB/s | BF16 / FP16 | BF16 / FP16 | $392/ay |
| NVIDIA L40S | 48 GB | 864 GB/s | BF16 / FP16 | BF16 / FP16 | $714/ay |
| NVIDIA A100 PCIe | 80 GB | 1,935 GB/s | BF16 / FP16 | BF16 / FP16 | $1,091/ay |
| NVIDIA H100 PCIe | 80 GB | 2,000 GB/s | BF16 / FP16 | BF16 / FP16 | $1,469/ay |
Yeşil referans ağırlıklardır, kehribar nicemlenmiştir. Bir diffusion modelini nicemlemek, bir dil modelinde olduğu gibi bedava bir kazanım değildir: aynı prompt ve seed, görünür şekilde farklı bir görsel verir, genellikle biraz daha yumuşak bir görsel. FP8'te iyi bir takastır, 4 bitte ise bir değerlendirme meselesidir.
Fiyat sütununun altından okuyun, tablo nettir. NVIDIA L4, aylık $125 ile, FLUX.1 dev modelini hiç olmazsa barındıran en ucuz kiraladığımız makinedir — FP8'te. Onu tam BF16'da barındıran en ucuz olan ise NVIDIA RTX A6000, $286 ile. Tam hassasiyette video aynı kartta başlar.
Herkesin yanlış okuduğu sütun
İşte görsel işleri bu sitedeki her şeyden ayıran kısım burada, ve o tablodaki en ucuz kartın neden bir tuzak olduğunun nedeni de bu.
Bir dil modeli bir token ürettiğinde, her aktif ağırlığı bellekten bir kez okur, her biriyle küçük bir aritmetik işlem yapar ve tek bir token yazar. Bunu bir sonraki token için, sonra bir sonraki için tekrar yapar. Kart hayatını bellek yolunu bekleyerek geçirir; dil modelleri için işlem hacmi tahminlerimizin esasen bant genişliğinin okunan ağırlığa bölünmesi olmasının ve bir sunum rehberinde önemli olan sütunun bant genişliği olmasının nedeni budur.
Bir diffusion adımı böyle görünmez. Aynı ağırlıklar bir latent tensöre yirmi ila elli kez uygulanır ve her geçiş, getirilen her bayt başına çok fazla aritmetik işlem yapar. Ağırlıklar bellekte sabit kalır; iş, küçük bir tensör üzerindeki konvolüsyon ve attention işlemleridir. Bu, kısıtı tersine çevirir: bir görsel model bellek yoluna değil, tensör işlem hacmine bağlıdır. Bundan üç şey çıkar ve üçünü de yanlış anlarsanız paraya mal olur.
“Sığar” demek “hızlıdır” demek değildir
Yukarıdaki tablodaki giriş seviyesi kart, FLUX.1 dev modelini FP8'te aylık $125 karşılığında barındırır ve bu, piksel işlemek için değil, küçük modelleri yoğun biçimde sunmak için tasarlanmış düşük güçlü bir parçadır. Bellek ilk filtredir, asla son filtre değil.
İkinci bir kart bekleme süresini yarıya indirmez
ComfyUI ve diffusers işlem hatları, vLLM'in bir transformer modelini böldüğü gibi tek bir gürültü giderme döngüsünü GPU'lar arasında bölmez. İki kart iki işçi çalıştırır: saatte iki kat görsel, görsel başına aynı saniye. Burada NVLink hiçbir şey kazandırmaz.
Veri merkezi kartı otomatik olarak cevap değildir
Dil sunumu için işi belirleyen sayıda bir HBM kartı kazanır. Görsel işler için tensör işlem hacmi ve bellek satın alıyorsunuz demektir ve grafik için tasarlanmış kartlar, fiyat listemizdeki konumlarının ima ettiğinden daha fazlasını dolar başına ikisinde de sunar.
Dolar başına bant genişliği, baktığınız kart sınıfı için bir gösterge — kaba bir gösterge — niteliğindedir ve kataloğumuzda NVIDIA RTX 5090 ve NVIDIA RTX 4090 kartlarını büyük bir farkla birinci ve ikinci sıraya koyar. Bu bir tesadüf değildir ve sizi ikna etmeye çalıştığımız bir pazarlık da değildir: bunlar tam olarak bu tür bir aritmetik için tasarlanmış parçalardır ve fiyat listemizin alt sıralarında yer alırlar, çünkü piyasa onları eğitim kümelerine karşı değil, oyun kartlarına karşı fiyatlandırır.
Çözünürlük, batch ve video
Ağırlıklar sabittir. Değişen şey çalışma kümesidir ve bu, parametrelerle değil pikselle değişir. Latentin kendisi ihmal edilebilir düzeydedir — kartı dolduran, o çözünürlükte ağdan geçen aktivasyonlardır.
latent_elements = (H / 8) * (W / 8) * C * batch
# C = 4 latent channels on SDXL, 16 on SD 3.5 and FLUX.
# 1024x1024, batch 1, SDXL:
128 * 128 * 4 * 1 = 65,536 elements = 128 KB in FP16
# 2048x2048, batch 4, SDXL:
256 * 256 * 4 * 4 = 1,048,576 = 2 MB in FP16
# The latent is never the problem. The activations that pass through the
# network at that resolution are, and they scale by the SAME factor:
# doubling the edge quadruples the pixel count, and roughly quadruples
# the working set. Batch multiplies it linearly on top.
Karşılaşacağınız sırayla üç pratik sonuç:
- Zirve noktası genellikle örnekleme döngüsü değil, VAE kod çözmedir. Kod çözme, latenti tek geçişte tam çözünürlüğe geri genişletir ve bir dakikadır sorunsuz çalışan bir işin tam sonunda bellek yetersizliği hatasını tetikleyen an tam da budur. Karo halinde kod çözme bunu giderir ve biraz zaman kaybettirir.
- Büyük bir kartı kullanmanın yolu batching yapmaktır. Model size 20 GB boşluk bırakıyorsa, aynı anda dört görsel üretmek, tek görseli boşlukla üretmekten çok daha iyi bir kullanımdır — ağırlıklar tüm batch için bir kez okunur, ki bir diffusion hattının bant genişliğine bağlı bir iş gibi davrandığı tek nokta budur.
- Video bir yüzde değil, bir boyut ekler. Wan 2.1 video 14B, bir kare bloğunu birlikte üretir; bu yüzden kareler, yükseklik ve genişliğin zaten çarptığı çalışma kümesini bir kez daha çarpar. 14 milyar parametreli bir video modelinin 12 milyar parametreli bir görsel modelinden çok daha büyük bir kart istemesinin nedeni budur, ve yukarıdaki ağırlık tablosunun bunu diğer her satırdan daha fazla eksik göstermesinin de nedeni budur.
ComfyUI'yi ayağa kaldırma
ComfyUI, makine teslim edilmeden önce üzerine yazabileceğimiz imajlardan biridir; bu da bu bölümü isteğe bağlı kılar. Bunu kendiniz kurmayı tercih ederseniz, bir konteyner ve bir tünelden ibarettir.
$ ssh root@203.0.113.42
$ nvidia-smi --query-gpu=name,memory.total --format=csv
# Checkpoints, LoRAs, ControlNets and VAEs on the fast local NVMe.
# This directory is the reason you are renting by the month.
$ mkdir -p /scratch/comfy/models
$ df -h /scratch
$ docker run -d --name comfy --restart unless-stopped \
--gpus all --ipc=host \
-v /scratch/comfy:/data \
-p 127.0.0.1:8188:8188 \
your-comfyui-image --listen 0.0.0.0 --port 8188
# From YOUR machine, not the server: a tunnel, then a local browser tab.
$ ssh -N -L 8188:127.0.0.1:8188 root@203.0.113.42
# http://127.0.0.1:8188
127.0.0.1: ifadesine dikkat edin.
ComfyUI'de giriş, parola veya kullanıcı kavramı yoktur. Herkese açık bir adreste yayımlandığında, GPU'nuza, model kitaplığınıza ve altındaki dosya sistemine grafik bir arayüzdür; portu tarayan herkese açıktır — ve dakikalar içinde taranır. Onu loopback arayüzüne bağlayın ve SSH üzerinden erişin. Dokümantasyon, güvenlik duvarını ve ilk saati daha ayrıntılı olarak ele alır.
Bir ayın satın aldığı
Görsel işlerin aylık bir makineye uymasının nedeni GPU'nun fiyatı değildir. Nedeni kitaplıktır. Ciddi bir ComfyUI kurulumu; özenle seçtiğiniz ve yeniden indirmek istemediğiniz checkpoint, LoRA, ControlNet, upscaler ve VAE dosyalarından oluşan birkaç yüz gigabayttır.
Karşılaştırılması gereken sütun budur ve saatlik platformların başlıkta atladığı sütun da budur. Orada disk ayrı bir kalemdir, gigabayt başına aylık fiyatlandırılır ve makine durdurulduğunda bile faturalandırmaya devam eder — ya da onu silersiniz ve bir dahaki oturuşunuzda yüzlerce gigabaytı yeniden indirirsiniz.
Bu, saatlik başabaş noktasının anlattığı tuzağın aynısıdır, görsel işler için aldığı biçimdir. Saniye başına faturalandırma güvenli görünür, çünkü makineyi durdurabilirsiniz; ama kimse durdurmaz, çünkü durdurmak kitaplığı kaybetmek anlamına gelir. Dürüst soru “kaç saat üretim yapacağım” değil, “bu makinenin var olması kaç saat gerekecek” sorusudur — ve özenle seçilmiş bir model dizini olan herkes için cevap hepsidir. Ödeme kripto para ile tek bir transferdir, kurulum ücreti yoktur ve kim olduğunuzu sormadık: promptlar, eğittiğiniz LoRA'lar ve henüz teslim etmediğiniz müşteri işi, yalnızca sizin roota sahip olduğunuz bir makinede kalır.
Bir kart ne zaman kiralanmamalı
Bunlardan birini kiralayıp pişman olmanızı istemeyiz, bu yüzden cevabın hayır olduğu durumlar aşağıda.
Haftada birkaç düzine görsel üretiyorsunuz. Barındırılan bir uç nokta size ayda birkaç dolara mal olur ve hiçbir öğleden sonranızı almaz. Kuyruk, çözünürlük sınırları veya içerik kuralları işinize karar vermeye başladığında geri dönün.
En yeni kapalı modeli istiyorsunuz. En bilinen görsel hizmetleri ağırlıkları yayımlamaz. Bu sayfadaki hiçbir makine bunları çalıştırmaz ve hiçbir bellek miktarı bunu değiştirmez.
Tek bir görseli daha hızlı istiyorsunuz ve çoklu GPU'lu düğümlere bakıyorsunuz. Bunun yerine daha hızlı tek bir kart alın. Ekstra kartlar size paralel işçiler kazandırır ve paralel işçiler çok değerlidir — ama tek bir ilerleme çubuğunu izleyen biri için değil.
Henüz bir model üzerinde karar kılmadınız. SDXL 1.0 modelini 1024 px'te mi, yoksa Wan 2.1 video 14B modelini klip başına beş saniyede mi çalıştıracağınızı bilene kadar bir yerde saatlik kiralayın. Bu iki cevap arasında aylık $161 fark var, tahmin etmeye gerek yok.
Her yerde başka — oluşturduğunuz bir kitaplık, sürekli değiştirdiğiniz bir işlem hattı, gece boyunca çalışan toplu işler veya kendi diskinizden hiç çıkmaması gereken bir çalışma — aylık adanmış bir kart daha ucuz ve daha sakin bir düzenlemedir. Yapılandırıcı, katalogdaki her düğüm için, aklınızdaki modelin ödeme yapmadan önce tek karta sığıp sığmadığını size söyler.
Ödeme yapmadan önce modelinizin sığdığını kontrol edin.
Yapılandırıcı, katalogdaki her makine için bir modelin ihtiyaç duyduğu belleği ve tek karta sığıp sığmadığını bildirir.
Diğer rehberler
- Boyutlandırma · 10 dk
Nicemleme biçimi seçimi
AWQ, GPTQ, GGUF ve FP8'in bellek, hız ve kalitede birer birer maliyeti — ve en küçük ağırlıklara sahip formatın neden nadiren en küçük modeli verdiği.
Rehberi okuyun - Boyutlandırma · 10 dk
Bir uzman karışımı modelini çalıştırmak
Toplam parametreler makineyi, etkin parametreler hızı belirler. DeepSeek V3 ve Qwen 3 235B için gereken VRAM ve hangi düğümün kiralanacağı.
Rehberi okuyun - Maliyet · 6 dk
Aylık kiralama ne zaman saatlikten üstün olur
Gerçek rakamlar üzerinden hesaplanan başabaş noktası, saatlik fiyatın makbuza kadar gizlediği üç maliyet ve bir tahmini üçe katlayan boşta kalma tuzağı.
Rehberi okuyun