Tüm 6 veri merkezi çalışıyor

Kripto ile ödenir · Kimlik kontrolü yok · 5 dakikanın altında içinde root erişimi

Boyutlandırma rehberi · 9 dakikalık okuma

Bir modelin gerçekte ne kadar VRAM'a ihtiyaç duyduğu.

Bunu iki sayı belirler: sabit olan ağırlıklar ve sunduğunuz bağlam miktarıyla büyüyen KV önbelleği. Yanlış cevapların neredeyse tamamı, ikincisinin birincisinden tahmin edilmesinden kaynaklanır.

Kısa cevap

Weights
Milyar cinsinden parametre × parametre başına bayt. 4-bit'te 70B, 35 GB demektir.
KV önbelleği
2 × katman sayısı × KV head sayısı × head dim × bayt, token başına. Parametre sayısıyla hiçbir ilgisi yoktur.
Overhead
Aktivasyonlar, CUDA bağlamı ve ayırıcı parçalanması için yaklaşık %15 ekleyin.
Tuzak
Ağırlıkları 4-bit'e nicemlemek, önbelleği nicemlemez. Her yaygın yığında FP16 olarak kalır.

Formül

Burada, ikinci bir modelle karşılaşınca geçerliliğini koruyan bir kestirme kural yoktur. Hesabın tamamı üç satırdır ve bir çarpana güvenmek yerine bu üç satırı hesaplamaya değer.

Toplam VRAM (GB)
# 1. Weights
weights_gb   = parameters_in_billions × bytes_per_parameter

# 2. KV cache, per token — then multiplied by the context you serve
bytes_per_tok = 2 × layers × kv_heads × head_dim × cache_bytes
cache_gb      = bytes_per_tok × context_tokens × batch / 1024³

# 3. Everything else
total_gb      = (weights_gb + cache_gb) × 1.15

2 sayısı, token başına iki tensör olmasından gelir: K ve V. bytes_per_parameter, BF16 için 2, FP8 için 1, 4-bit için 0.5'tir. cache_bytes ise ayrı bir sayıdır ve bu ayrım, yanlış bir cevabın en yaygın tek kaynağıdır — bkz. aşağıda.

Ağırlıklar

Kolay yarı. Parametre sayısıyla tam olarak doğrusaldır ve tek karar hassasiyettir.

Hassasiyete göre ağırlık belleği, seçili model boyutları için
Model BF16 / FP16FP84-bit (AWQ, GPTQ)
Llama 3.1 8B8B parametre 16.0 GB 8.0 GB 4.0 GB
Qwen 3 32B32B parametre 64.0 GB 32.0 GB 16.0 GB
Llama 3.3 70B70B parametre 140.0 GB 70.0 GB 35.0 GB
Llama 3.1 405B405B parametre 810.0 GB 405.0 GB 202.5 GB

Dört bit nicemleme kaliteden ödün verdirir; ne kadar ödün verdireceği ise yöntemden çok modele bağlıdır. Tek kart ile dört kart arasındaki farkı belirliyorsa doğru bir tercihtir; zaten rahatsanız kötü bir tercihtir.

KV önbelleği

Zor yarı — bir makinenin 4k'de yeterli, 128k'de ise yetersiz olup olmadığını belirleyen kısım budur. Katmanlara ve KV head sayısına bağlıdır, modelin ne kadar büyük olduğuna değil.

Çok farklı boyutlarda iki model, yan yana. Llama 3.3 70B, 80 katmana ve 8 KV heade sahiptir, dolayısıyla token başına 320 KB. Parametrelerin üçte biri olan Gemma 3 27B ise 62 katmana ve 16 KV heade sahiptir, dolayısıyla token başına 496 KB, yani 1.6× daha fazla. Parametre sayısından ölçeklendirilen her tahmin bunu tam tersine çevirir.
Model ve bağlam uzunluğuna göre KV önbelleği boyutu, FP16 önbellek hassasiyetinde, tek istek
Model Token başına 4k bağlam8k bağlam32k bağlam128k bağlam
Llama 3.1 8B 32 katman · 8 KV head 128 KB 0.5 GB 1.0 GB 4.0 GB 16.0 GB
Gemma 3 27B 62 katman · 16 KV head 496 KB 1.9 GB 3.9 GB 15.5 GB 62.0 GB
Llama 3.3 70B 80 katman · 8 KV head 320 KB 1.3 GB 2.5 GB 10.0 GB 40.0 GB
DeepSeek V3 671B-A37B (MoE) Latent attention 70 KB 0.3 GB 0.5 GB 2.2 GB 8.8 GB
Llama 3.1 405B 126 katman · 8 KV head 504 KB 2.0 GB 3.9 GB 15.8 GB 63.0 GB

Son sütunu ilkinden önce okuyun. 4k bağlamda önbellek, buradaki her modelde yuvarlama hatası düzeyindedir; 128k'de ise 4-bit'teki bir 70B modelin ağırlıklarından daha büyüktür. DeepSeek V3 istisnadır, çünkü latent attention mekanizması önbelleği tasarım gereği sıkıştırır — listedeki en büyük model olmasına rağmen uzun bağlamda kullanılabilir olmasının nedeni budur.

Tahminlerin nerede yanlış gittiği

Önbelleği parametre sayısından ölçeklendirmek. En yaygın hata, ve yukarıda gösterilen de budur. 27B bir model, 70B bir modelden daha fazla önbelleğe ihtiyaç duyabilir.

4-bit ağırlıkların 4-bit önbellek anlamına geldiğini varsaymak. Öyle değildir. AWQ ve GPTQ yalnızca ağırlıkları nicemler; FP8 KV'yi açıkça etkinleştirmediğiniz sürece önbellek FP16 olarak kalır. 4-bit ve 128k bağlamda 70B bir model, 35 GB ağırlık ve 40 GB önbellek demektir.

Tek bir istek için boyutlandırmak. Önbellek, eşzamanlı dizi başınadır. Sekiz kullanıcıya aynı anda hizmet vermek, önbelleğin sekiz katını gerektirir — bkz. aşağıda.

Ek yükü unutmak. Aktivasyonlar, CUDA bağlamı ve ayırıcı parçalanması gerçektir. %15, kasıtlı olarak temkinli bir paydır; bunu tamamen görmezden gelmek, “sığan” bir modelin yüklenmemesine yol açan şeydir.

Kartlar arasındaki toplam VRAM'ı toplamak. Dört adet 24 GB'lık kart, tek bir 96 GB'lık kart değildir. Tensor parallelism bir modeli bunlar arasında bölebilir, ama bu durumda her katman bağlantı üzerinden senkronize olur — bkz. NVLink rehberi.

Bir MoE'yi aktif parametrelerine göre boyutlandırmak. DeepSeek V3, token başına 37B'yi etkinleştirir, ama belleğe 671B'nin tamamını yüklemeniz gerekir. Aktif parametreler hızı öngörür; toplam parametreler ise modelin hiç yüklenip yüklenemeyeceğini belirler.

Çözümlü örnekler

Gereken toplam bellek — ağırlıklar artı önbellek artı ek yük — 8k bağlamda ve tek istekte. Bu, yapılandırıcının katalogdaki her yapılandırma için yaptığı hesabın aynısıdır.

8k bağlamda gereken toplam VRAM, model ve hassasiyete göre
Model BF16 / FP16FP84-bit (AWQ, GPTQ) Sığan en küçük düğüm
Llama 3.1 8B 8B parametre 20 GB 10 GB 6 GB NVIDIA L4 $125/ay · tek kartta · ~34 tok/s
Mistral Small 24B 24B parametre 57 GB 28 GB 15 GB NVIDIA L4 $125/ay · tek kartta · ~11 tok/s
Gemma 3 27B 27B parametre 67 GB 33 GB 20 GB NVIDIA L4 $125/ay · tek kartta · ~10 tok/s
Qwen 3 32B 32B parametre 76 GB 38 GB 21 GB NVIDIA L4 $125/ay · tek kartta · ~8 tok/s
Llama 3.3 70B 70B parametre 164 GB 82 GB 43 GB 2 × NVIDIA L4 $285/ay · düğüm genelinde bölüştürülmüş · ~7 tok/s
Mixtral 8×22B (MoE) 141B'nin 39B'si etkin 326 GB 163 GB 83 GB 4 × NVIDIA L4 $564/ay · düğüm genelinde bölüştürülmüş · ~4 tok/s
Qwen 3 235B-A22B (MoE) 235B'nin 22B'si etkin 542 GB 271 GB 137 GB 8 × NVIDIA L4 $1,106/ay · düğüm genelinde bölüştürülmüş · ~10 tok/s
DeepSeek V3 671B-A37B (MoE) 671B'nin 37B'si etkin 1,544 GB 772 GB 386 GB 8 × NVIDIA A100 PCIe $7,906/ay · düğüm genelinde bölüştürülmüş · ~37 tok/s
Llama 3.1 405B 405B parametre 936 GB 468 GB 237 GB 10 × NVIDIA L4 $1,371/ay · düğüm genelinde bölüştürülmüş · ~3 tok/s

Son sütun, modeli 4-bit ve 8k bağlamda barındıran, katalogumuzdaki en ucuz düğümdür; bellek bant genişliğinin izin verdiği tek akışlı üretim hızıyla birlikte gösterilir. İşlem hacmi rakamları kasıtlı olarak muhafazakârdır ve yayımlanmış ölçümlere göre kalibre edilmiştir — bunları bir söz değil, bir taban olarak değerlendirin.

Birden fazla isteğe hizmet vermek

Bir demo için boyutlandırılmış bir makinenin bir ürüne hizmet veremeyen bir makineye dönüştüğü nokta burasıdır. Ağırlıklar bir kez ödenir; önbellek ise eşzamanlı dizi başına ödenir.

Llama 3.3 70B için 4-bit'te toplam VRAM, eşzamanlı istek ve bağlama göre
Eşzamanlı istekler 4k bağlam8k bağlam32k bağlam
1 istek 42 GB 80 GB'lik bir kart 43 GB 80 GB'lik bir kart 52 GB 80 GB'lik bir kart
4 istek 46 GB 80 GB'lik bir kart 52 GB 80 GB'lik bir kart 86 GB bir H200
16 istek 63 GB 80 GB'lik bir kart 86 GB bir H200 224 GB çoklu GPU düğümü
64 istek 132 GB bir H200 224 GB çoklu GPU düğümü 776 GB çoklu GPU düğümü

Ne yaparsanız yapın, Llama 3.3 70B 4-bit'te 35 GB ağırlık demektir. O tabloda 35 GB'ın üzerindeki her şey önbellektir. “Dizüstümde sorunsuz çalıştı” ile “üretimde çöktü” ifadelerinin aynı kartta aynı model olmasının nedeni budur.

Önbellek belleğini geri kazanmanın iki yolu. Yığınınız destekliyorsa FP8 KV önbelleğini etkinleştirin — bu, yukarıdaki sayıları genellikle fark edilmeyen bir kalite maliyetiyle yarıya indirir. Ve --max-model-len değerini gerçekte sunduğunuz bağlamla sınırlayın: vLLM, önbelleği beyan edilen maksimum için ayırır, bu yüzden siz 8k sunarken 128k beyan etmek, ihtiyacınız olan belleğin on altı katını çöpe atmak demektir.

Bunun anlamı hangi makine

Yukarıdakilerin tamamından çıkan, önem sırasına göre üç pratik kural.

  1. Mümkün olduğunda tek kart, birden fazla karttan iyidir. Sharding yok, katmanlar arasında senkronizasyon yok, düşünülecek bir ara bağlantı yok. Modeliniz, kullandığınız bağlamda tek bir karta sığıyorsa, o kartı alın.
  2. Gerçek bağlamınıza ve gerçek eşzamanlılığınıza göre boyutlandırın, modelin ilan edilen maksimumuna göre değil. İlan edilen maksimum bir yetenektir, bir zorunluluk değil.
  3. Sharding yapmanız gerektiğinde NVLink'i tercih edin. Dört PCIe kart arasında bölmek işe yarar; dört NVLink kart arasında bölmek de işe yarar ve belirgin şekilde daha hızlıdır. Bir sonraki rehber, tam olarak bu farkın ne zaman parasına değdiğini anlatır.

Yapılandırıcı, bu hesaplamayı 41 yapılandırmanın tamamına karşı canlı olarak çalıştırır: bir model, bir hassasiyet ve bir bağlam uzunluğu seçin; size hangi düğümlerin bunu barındırdığını, hangilerinin tek bir kartta barındırdığını ve her birinin aylık maliyetinin ne olduğunu söyler. Bu sayfadaki formülü kullanır, yani hesabımıza katılmıyorsanız artık tam olarak nerede olduğunu söyleyebilirsiniz.

Kendi modelinizi kiraladığımız her makineye karşı kontrol edin.

Yapılandırıcı, siz bir şey ödemeden önce yukarıdaki hesabı 41 yapılandırmanın tamamı için yapar.

Giriş Yapın

Konsol, makbuzlar ve bant dışı erişim.

Henüz hesabınız yok mu?

Ayrı bir kayıt işlemi yoktur. Hesabınız, ilk siparişinizi verirken oluşturulur — e-postayı ve şifreyi ödeme adımında seçersiniz, ve makine hazır olduğunda konsol da açık olur.

Bir sunucu yapılandırın

Language