Tüm 6 veri merkezi çalışıyor

Kripto ile ödenir · Kimlik kontrolü yok · 5 dakikanın altında içinde root erişimi

Boyutlandırma rehberi · 9 dakikalık okuma

Görsel ve video modelleri için kart seçimi.

Bir görsel modelin hatırlayacağı bir konuşma yoktur, bu yüzden bir dil modelinden tamamen farklı bir kurala göre boyutlandırılır — ve onu barındıran en ucuz kart, neredeyse hiçbir zaman kiralamak isteyeceğiniz kart değildir.

Kısa cevap

Tam hassasiyette
SDXL 1.0 8.0 GB · Stable Diffusion 3.5 Large 18.4 GB · FLUX.1 dev 27.6 GB · Wan 2.1 video 14B 32.2 GB — çalışma zamanı payı dahil
Sorunlu satır
Katalogdaki her 24 GB kart, BF16'da FLUX.1 dev eşiğinin biraz altında kalır. FP8 bunu yarıya indirir ve hepsinde bu çıtayı aşar
Onu barındıran en ucuz olan
NVIDIA L4, aylık $125; FP8'te FLUX.1 dev
İkinci bir kartın satın aldığı
Saatte iki kat görsel, ama tek bir görselden tek saniye bile eksilmez

Her modelin ihtiyaç duyduğu

Her şeyin geri kalanını belirleyen farktan başlayın. Bir dil modeli, bağlamın her tokeniyle büyüyen bir key/value önbelleği taşır; aynı 70B modelin ne kadar konuşma tuttuğunuza bağlı olarak 40 GB veya 140 GB istemesinin nedeni de budur. Bir diffusion modelinin hiç önbelleği yoktur. Bir prompt okur, sabit sayıda adımda bir latenti gürültüden arındırır ve unutur. Ağırlıklar bu yüzden bellek sorusunun neredeyse tamamıdır ve promptlarınız uzadıkça cevap değişmez.

Her görsel ve video modelinin hassasiyete göre ihtiyaç duyduğu bellek
Model Parametreler BF16 / FP16 FP8 4-bit (AWQ, GPTQ)
SDXL 1.0Sabit görseller 3.5 B 8.0 GB 4.0 GB 2.0 GB
Stable Diffusion 3.5 LargeSabit görseller 8 B 18.4 GB 9.2 GB 4.6 GB
FLUX.1 devSabit görseller 12 B 27.6 GB 13.8 GB 6.9 GB
Wan 2.1 video 14BBir kare bloğu olarak üretilen video 14 B 32.2 GB 16.1 GB 8.0 GB

Ağırlıklar artı aktivasyonlar, CUDA bağlamı ve ayırıcı parçalanması için %15'lik bir çalışma zamanı payı — yapılandırıcının uyguladığı payla aynı, böylece bunları ona göre kontrol edebilirsiniz. Bağlam sütunu yoktur, çünkü içine koyacak bir şey yoktur.

O tabloda durup üzerinde düşünmeye değer iki satır var, çünkü bir satın almanın tam olarak yanlış gittiği yer orasıdır.

FLUX.1 dev, BF16'da 27.6 GB istiyor. Bu, kiraladığımız her 24 GB'lik kartın ötesinde ve adil hissettirecek kadar da değil. Görsel işlerindeki en yaygın sürpriz tam olarak bu: internette “her yerde 4090'da çalışıyor” denen model aslında nicemlenmiş çalışıyor ve kimse bunu söylemiyor.

Wan 2.1 video 14B, BF16'da 32.2 GB istiyor. 32 GB'lik bir kartı bir gigabaytın küçük bir kısmıyla kaçırıyor. Marjımız kasıtlı olarak temkinlidir ve metin kodlayıcısını karttan çıkararak bunu genellikle telafi edebilirsiniz — ama bir satın almayı bir yuvarlama hatasına göre planlamak zorunda kalmamalısınız, bu yüzden dürüst cevap şudur: video 40 GB veya daha fazlasını ister.

Her kartın barındırdığı

Kiraladığımız her tek kartlı makine ve her birinin bu iki zorlu model için barındırdığı en iyi hassasiyet. Bant genişliği sütunu bir sonraki bölüm için var; onu bu bölümü okuduktan sonra okuyun.

Tek kartlı düğümler ve her birinin barındırdığı hassasiyet
Düğüm Kart belleği Bant Genişliği FLUX.1 dev Wan 2.1 video 14B Aylık
NVIDIA L4Ada Lovelace · PCIe 5.0 24 GB 300 GB/s$ başına 2.4 GB/s FP8 FP8 $125/ay
NVIDIA RTX 4090Ada Lovelace · PCIe 5.0 24 GB 1,008 GB/s$ başına 5.2 GB/s FP8 FP8 $193/ay
NVIDIA RTX A6000Ampere · PCIe 5.0 48 GB 768 GB/s$ başına 2.7 GB/s BF16 / FP16 BF16 / FP16 $286/ay
NVIDIA RTX 5090Blackwell · PCIe 5.0 32 GB 1,792 GB/s$ başına 5.3 GB/s BF16 / FP16 FP8 $335/ay
NVIDIA A100 PCIeAmpere · PCIe 5.0 40 GB 1,555 GB/s$ başına 4.0 GB/s BF16 / FP16 BF16 / FP16 $392/ay
NVIDIA L40SAda Lovelace · PCIe 5.0 48 GB 864 GB/s$ başına 1.2 GB/s BF16 / FP16 BF16 / FP16 $714/ay
NVIDIA A100 PCIeAmpere · PCIe 5.0 80 GB 1,935 GB/s$ başına 1.8 GB/s BF16 / FP16 BF16 / FP16 $1,091/ay
NVIDIA H100 PCIeHopper · PCIe 5.0 80 GB 2,000 GB/s$ başına 1.4 GB/s BF16 / FP16 BF16 / FP16 $1,469/ay

Yeşil referans ağırlıklardır, kehribar nicemlenmiştir. Bir diffusion modelini nicemlemek, bir dil modelinde olduğu gibi bedava bir kazanım değildir: aynı prompt ve seed, görünür şekilde farklı bir görsel verir, genellikle biraz daha yumuşak bir görsel. FP8'te iyi bir takastır, 4 bitte ise bir değerlendirme meselesidir.

Fiyat sütununun altından okuyun, tablo nettir. NVIDIA L4, aylık $125 ile, FLUX.1 dev modelini hiç olmazsa barındıran en ucuz kiraladığımız makinedir — FP8'te. Onu tam BF16'da barındıran en ucuz olan ise NVIDIA RTX A6000, $286 ile. Tam hassasiyette video aynı kartta başlar.

Herkesin yanlış okuduğu sütun

İşte görsel işleri bu sitedeki her şeyden ayıran kısım burada, ve o tablodaki en ucuz kartın neden bir tuzak olduğunun nedeni de bu.

Bir dil modeli bir token ürettiğinde, her aktif ağırlığı bellekten bir kez okur, her biriyle küçük bir aritmetik işlem yapar ve tek bir token yazar. Bunu bir sonraki token için, sonra bir sonraki için tekrar yapar. Kart hayatını bellek yolunu bekleyerek geçirir; dil modelleri için işlem hacmi tahminlerimizin esasen bant genişliğinin okunan ağırlığa bölünmesi olmasının ve bir sunum rehberinde önemli olan sütunun bant genişliği olmasının nedeni budur.

Bir diffusion adımı böyle görünmez. Aynı ağırlıklar bir latent tensöre yirmi ila elli kez uygulanır ve her geçiş, getirilen her bayt başına çok fazla aritmetik işlem yapar. Ağırlıklar bellekte sabit kalır; iş, küçük bir tensör üzerindeki konvolüsyon ve attention işlemleridir. Bu, kısıtı tersine çevirir: bir görsel model bellek yoluna değil, tensör işlem hacmine bağlıdır. Bundan üç şey çıkar ve üçünü de yanlış anlarsanız paraya mal olur.

“Sığar” demek “hızlıdır” demek değildir

Yukarıdaki tablodaki giriş seviyesi kart, FLUX.1 dev modelini FP8'te aylık $125 karşılığında barındırır ve bu, piksel işlemek için değil, küçük modelleri yoğun biçimde sunmak için tasarlanmış düşük güçlü bir parçadır. Bellek ilk filtredir, asla son filtre değil.

İkinci bir kart bekleme süresini yarıya indirmez

ComfyUI ve diffusers işlem hatları, vLLM'in bir transformer modelini böldüğü gibi tek bir gürültü giderme döngüsünü GPU'lar arasında bölmez. İki kart iki işçi çalıştırır: saatte iki kat görsel, görsel başına aynı saniye. Burada NVLink hiçbir şey kazandırmaz.

Veri merkezi kartı otomatik olarak cevap değildir

Dil sunumu için işi belirleyen sayıda bir HBM kartı kazanır. Görsel işler için tensör işlem hacmi ve bellek satın alıyorsunuz demektir ve grafik için tasarlanmış kartlar, fiyat listemizdeki konumlarının ima ettiğinden daha fazlasını dolar başına ikisinde de sunar.

Dolar başına bant genişliği, baktığınız kart sınıfı için bir gösterge — kaba bir gösterge — niteliğindedir ve kataloğumuzda NVIDIA RTX 5090 ve NVIDIA RTX 4090 kartlarını büyük bir farkla birinci ve ikinci sıraya koyar. Bu bir tesadüf değildir ve sizi ikna etmeye çalıştığımız bir pazarlık da değildir: bunlar tam olarak bu tür bir aritmetik için tasarlanmış parçalardır ve fiyat listemizin alt sıralarında yer alırlar, çünkü piyasa onları eğitim kümelerine karşı değil, oyun kartlarına karşı fiyatlandırır.

Neden dakika başına görsel sütunu yok. Dil modelleri için saniyede token tahmini yayımlıyoruz, çünkü arkasındaki formül savunulabilir ve onu size gösteriyoruz. Diffusion için arkasında durabileceğimiz bir eşdeğeri yoktur: görsel başına saniye, kart devreye bile girmeden, örnekleyiciye, adım sayısına, çözünürlüğe ve modeli derleyip derlemediğinize göre beş kat değişir. Bu tablo için uyduracağımız bir sayı, sayfadaki en çok alıntılanacak ama en az doğru şey olurdu. Bir ay kiralayın, kendi işlem hattınızı ölçün; cevap herhangi bir kıyaslamadan daha değerlidir.

Çözünürlük, batch ve video

Ağırlıklar sabittir. Değişen şey çalışma kümesidir ve bu, parametrelerle değil pikselle değişir. Latentin kendisi ihmal edilebilir düzeydedir — kartı dolduran, o çözünürlükte ağdan geçen aktivasyonlardır.

Bellek gerçekte nereye gidiyor
latent_elements = (H / 8) * (W / 8) * C * batch
# C = 4 latent channels on SDXL, 16 on SD 3.5 and FLUX.

# 1024x1024, batch 1, SDXL:
128 * 128 * 4 * 1     = 65,536 elements   = 128 KB in FP16

# 2048x2048, batch 4, SDXL:
256 * 256 * 4 * 4     = 1,048,576         = 2 MB in FP16

# The latent is never the problem. The activations that pass through the
# network at that resolution are, and they scale by the SAME factor:
# doubling the edge quadruples the pixel count, and roughly quadruples
# the working set. Batch multiplies it linearly on top.

Karşılaşacağınız sırayla üç pratik sonuç:

  1. Zirve noktası genellikle örnekleme döngüsü değil, VAE kod çözmedir. Kod çözme, latenti tek geçişte tam çözünürlüğe geri genişletir ve bir dakikadır sorunsuz çalışan bir işin tam sonunda bellek yetersizliği hatasını tetikleyen an tam da budur. Karo halinde kod çözme bunu giderir ve biraz zaman kaybettirir.
  2. Büyük bir kartı kullanmanın yolu batching yapmaktır. Model size 20 GB boşluk bırakıyorsa, aynı anda dört görsel üretmek, tek görseli boşlukla üretmekten çok daha iyi bir kullanımdır — ağırlıklar tüm batch için bir kez okunur, ki bir diffusion hattının bant genişliğine bağlı bir iş gibi davrandığı tek nokta budur.
  3. Video bir yüzde değil, bir boyut ekler. Wan 2.1 video 14B, bir kare bloğunu birlikte üretir; bu yüzden kareler, yükseklik ve genişliğin zaten çarptığı çalışma kümesini bir kez daha çarpar. 14 milyar parametreli bir video modelinin 12 milyar parametreli bir görsel modelinden çok daha büyük bir kart istemesinin nedeni budur, ve yukarıdaki ağırlık tablosunun bunu diğer her satırdan daha fazla eksik göstermesinin de nedeni budur.
İşe yarayan bir kural. Sayıyı ilk tablodan alın, ardından bir seferde bir megapikselik bir görsel için kartın kabaca üçte birini boşta bırakın. Batch yapmayı düşünüyorsanız, batchi küçültmek yerine bir bellek katmanına yükselin — aylık bir dönemde katman size sabit bir dolar tutarına mal olur, oysa tek görsellik bir batch size her günün her saatinde işlem hacmi kaybettirir.

ComfyUI'yi ayağa kaldırma

ComfyUI, makine teslim edilmeden önce üzerine yazabileceğimiz imajlardan biridir; bu da bu bölümü isteğe bağlı kılar. Bunu kendiniz kurmayı tercih ederseniz, bir konteyner ve bir tünelden ibarettir.

Yeni teslim edilmiş bir makinede
$ ssh root@203.0.113.42
$ nvidia-smi --query-gpu=name,memory.total --format=csv

# Checkpoints, LoRAs, ControlNets and VAEs on the fast local NVMe.
# This directory is the reason you are renting by the month.
$ mkdir -p /scratch/comfy/models
$ df -h /scratch
Loopback arayüzüne bağlı sunucu
$ docker run -d --name comfy --restart unless-stopped \
    --gpus all --ipc=host \
    -v /scratch/comfy:/data \
    -p 127.0.0.1:8188:8188 \
    your-comfyui-image --listen 0.0.0.0 --port 8188

# From YOUR machine, not the server: a tunnel, then a local browser tab.
$ ssh -N -L 8188:127.0.0.1:8188 root@203.0.113.42
# http://127.0.0.1:8188
Portun önündeki 127.0.0.1: ifadesine dikkat edin. ComfyUI'de giriş, parola veya kullanıcı kavramı yoktur. Herkese açık bir adreste yayımlandığında, GPU'nuza, model kitaplığınıza ve altındaki dosya sistemine grafik bir arayüzdür; portu tarayan herkese açıktır — ve dakikalar içinde taranır. Onu loopback arayüzüne bağlayın ve SSH üzerinden erişin. Dokümantasyon, güvenlik duvarını ve ilk saati daha ayrıntılı olarak ele alır.

Bir ayın satın aldığı

Görsel işlerin aylık bir makineye uymasının nedeni GPU'nun fiyatı değildir. Nedeni kitaplıktır. Ciddi bir ComfyUI kurulumu; özenle seçtiğiniz ve yeniden indirmek istemediğiniz checkpoint, LoRA, ControlNet, upscaler ve VAE dosyalarından oluşan birkaç yüz gigabayttır.

Disk, her tek kartlı makinede fiyata dahildir. 2 × 2 TB NVMe ve 1 Gbit/s, her iki yönde de sayaçsız — $125 düğümünde de $1,469 düğümünde olduğu kadar aynı. Orada hiçbir şey gigabayt başına faturalandırılmaz, kart boştayken hiçbir şey faturalandırılmaya devam etmez ve bir yeniden kurulumdan sonra kitaplığı tekrar indirdiğiniz gün hiçbir şey tekrar ücretlendirilmez.

Karşılaştırılması gereken sütun budur ve saatlik platformların başlıkta atladığı sütun da budur. Orada disk ayrı bir kalemdir, gigabayt başına aylık fiyatlandırılır ve makine durdurulduğunda bile faturalandırmaya devam eder — ya da onu silersiniz ve bir dahaki oturuşunuzda yüzlerce gigabaytı yeniden indirirsiniz.

Bu, saatlik başabaş noktasının anlattığı tuzağın aynısıdır, görsel işler için aldığı biçimdir. Saniye başına faturalandırma güvenli görünür, çünkü makineyi durdurabilirsiniz; ama kimse durdurmaz, çünkü durdurmak kitaplığı kaybetmek anlamına gelir. Dürüst soru “kaç saat üretim yapacağım” değil, “bu makinenin var olması kaç saat gerekecek” sorusudur — ve özenle seçilmiş bir model dizini olan herkes için cevap hepsidir. Ödeme kripto para ile tek bir transferdir, kurulum ücreti yoktur ve kim olduğunuzu sormadık: promptlar, eğittiğiniz LoRA'lar ve henüz teslim etmediğiniz müşteri işi, yalnızca sizin roota sahip olduğunuz bir makinede kalır.

Bir kart ne zaman kiralanmamalı

Bunlardan birini kiralayıp pişman olmanızı istemeyiz, bu yüzden cevabın hayır olduğu durumlar aşağıda.

Haftada birkaç düzine görsel üretiyorsunuz. Barındırılan bir uç nokta size ayda birkaç dolara mal olur ve hiçbir öğleden sonranızı almaz. Kuyruk, çözünürlük sınırları veya içerik kuralları işinize karar vermeye başladığında geri dönün.

En yeni kapalı modeli istiyorsunuz. En bilinen görsel hizmetleri ağırlıkları yayımlamaz. Bu sayfadaki hiçbir makine bunları çalıştırmaz ve hiçbir bellek miktarı bunu değiştirmez.

Tek bir görseli daha hızlı istiyorsunuz ve çoklu GPU'lu düğümlere bakıyorsunuz. Bunun yerine daha hızlı tek bir kart alın. Ekstra kartlar size paralel işçiler kazandırır ve paralel işçiler çok değerlidir — ama tek bir ilerleme çubuğunu izleyen biri için değil.

Henüz bir model üzerinde karar kılmadınız. SDXL 1.0 modelini 1024 px'te mi, yoksa Wan 2.1 video 14B modelini klip başına beş saniyede mi çalıştıracağınızı bilene kadar bir yerde saatlik kiralayın. Bu iki cevap arasında aylık $161 fark var, tahmin etmeye gerek yok.

Her yerde başka — oluşturduğunuz bir kitaplık, sürekli değiştirdiğiniz bir işlem hattı, gece boyunca çalışan toplu işler veya kendi diskinizden hiç çıkmaması gereken bir çalışma — aylık adanmış bir kart daha ucuz ve daha sakin bir düzenlemedir. Yapılandırıcı, katalogdaki her düğüm için, aklınızdaki modelin ödeme yapmadan önce tek karta sığıp sığmadığını size söyler.

Ödeme yapmadan önce modelinizin sığdığını kontrol edin.

Yapılandırıcı, katalogdaki her makine için bir modelin ihtiyaç duyduğu belleği ve tek karta sığıp sığmadığını bildirir.

Giriş Yapın

Konsol, makbuzlar ve bant dışı erişim.

Henüz hesabınız yok mu?

Ayrı bir kayıt işlemi yoktur. Hesabınız, ilk siparişinizi verirken oluşturulur — e-postayı ve şifreyi ödeme adımında seçersiniz, ve makine hazır olduğunda konsol da açık olur.

Bir sunucu yapılandırın

Language