Tüm 6 veri merkezi çalışıyor

Kripto ile ödenir · Kimlik kontrolü yok · 5 dakikanın altında içinde root erişimi

Boyutlandırma rehberi · 10 dakikalık okuma

Bir uzman karışımının gerçek maliyeti.

“235B-A22B” gibi bir isim iki sayı içerir ve neredeyse herkes yanlış olanını okur. Bunlardan biri ne kiralayacağınızı belirler; diğeri ne kadar hızlı yanıt vereceğini belirler. Aralarında on kata varan bir fark olabilir.

Kısa cevap

Toplam parametreler makineyi belirler
4 bit'te DeepSeek V3 671B-A37B (MoE), 8k bağlamla 386 GB gerektirir. Etkin parametreleri büyüklüğünde yoğun bir model 22 GB gerektirirdi — yani 17.6× daha az.
Etkin parametreler hızı belirler
Token başına ağırlıkların yalnızca bir kısmı okunur, bu yüzden aynı kütledeki yoğun bir modelden daha hızlı üretim yapar — ama yönlendirme, bu avantajın büyük bir kısmını doğrudan geri alır.
Onu barındıran en ucuz düğüm
Ayda $7,906 karşılığında 8 × NVIDIA A100 PCIe. Neredeyse hiçbir zaman kiralanacak olan o değildir.
Kiralamaya değer olan
$11,790 fiyatındaki 4 × NVIDIA B200 SXM6 — 1.5× kat para karşılığında 2.8× kat işlem hacmi.

Kısa özet

Bir uzman karışımı, her katmanın ileri beslemeli kısmını birçok küçük ağa böler ve her tokeni bunlardan yalnızca birkaçı üzerinden gönderir. Yayımlanan isim her iki gerçeği de kaydeder: toplam parametre sayısını ve herhangi bir token için etkin olan sayıyı. Birincisinin tamamını bellekte tutmanız gerekir, ikincisini ise yalnızca token başına okursunuz. Bu tek cümle rehberin tamamıdır ve bunu tersten anlamak, bir sipariş öncesinde insanların yaptığını gördüğümüz en pahalı hatadır.

Sonuç, garip bir maliyet biçimine sahip bir modeldir: bir dev gibi kiralanır ve orta boy bir model gibi çalışır. Bunun bir fırsat mı yoksa bir tuzak mı olduğu, tamamen darboğazınızın bu iki sayıdan hangisi olduğuna bağlıdır.

Makineyi mi boyutlandırıyorsunuz? Toplamı kullanın. Her uzmanın bellekte hazır bulunması gerekir, çünkü bir sonraki tokenin hangilerine ihtiyaç duyacağını önceden bilemezsiniz. Yönlendirme, çalışma zamanında, token başına karar verilir.

Hızı mı tahmin ediyorsunuz? Etkin sayıdan başlayın, ardından büyük bir indirim uygulayın. Üretim yalnızca etkin ağırlıkları okur, zaten bütün mesele de budur — ama yönlendirici, uzman dağıtımı ve kartlar arasındaki trafik bedavaya gelmez ve bunlar bir düğüm genelinde kötü ölçeklenir.

Uzun bağlam mı sunuyorsunuz, yoksa çok sayıda kullanıcıya mı hizmet veriyorsunuz? Parametre sayılarına değil, dikkat tasarımına bakın. Bu sayfadaki en büyük modeller, token başına en küçük anahtar/değer önbelleğine sahiptir ve belirli bir uzunluğun ötesinde bu, sıralamayı tamamen tersine çevirir.

Sadece kaliteyi mi istiyorsunuz? Tek bir karta sığan yoğun bir model, sekiz kart arasında paylaştırılmış bir uzman karışımından işletmesi daha kolay, daha ucuz ve daha hızlıdır. Hiçbir yoğun model ihtiyacınız olan yanıtı vermediğinde bir MoE'ye yönelin, ismi etkileyici göründüğü için değil.

Aşağıdaki aritmetik, yapılandırıcının aynı katalog üzerinde çalıştırdığı aritmetiğin aynısıdır. Bir modelin ne kadar belleğe ihtiyaç duyduğunu genel olarak henüz hesaplamadıysanız, önce o formül gelir — model bir uzman karışımı olduğunda değişen şey ise bu sayfadır.

Adın okunması

Dolaşımda üç adlandırma kuralı var ve hepsi aynı sayı çiftini kodluyor; kafa karışıklığının sürmesinin nedeni de bu. Onları okuyabildiğinizde, boyutlandırma sorusu kendiliğinden cevaplanır.

235B-A22BToplam, sonra etkinÜçünün en açık olanı. 235 milyar parametre bellekte durur; bunlardan 22 milyarı herhangi bir token için okunur. A harfi active (etkin) anlamına gelir ve bu, size ne kiralayacağınızı söyleyen sayı değildir.
671B-A37BAynı kural, daha büyük ölçekteBu boyutta, fark kasıtlı olarak saçma hâle gelir: etkin pay yüzde altının altındadır. İhtiyacınız olan makineyle ilgili hiçbir şey o 37'den çıkmaz.
8×22BUzmanlar, sonra uzman boyutuDaha eski kural ve en çok yanıltan da bu. 176 milyar parametre anlamına gelmez, çünkü dikkat ve embedding katmanları çoğaltılmak yerine paylaşılır; 22 milyar anlamına da gelmez, çünkü token başına bir değil, iki uzman etkindir.
A22B, A37BBir ortalama, bir garanti değilEtkin sayı, tipik bir metinde yönlendirmenin maliyetidir. Bu bir tavan değildir: tokenleri birçok uzmana yayılan bir batch, modelin daha büyük bir kısmına dokunur; ölçülen işlem hacminin aritmetiğin altında kalmasının nedenlerinden biri de budur.
Boyutlandırma kataloğumuzdaki uzman karışımı modelleri, toplam parametrelere karşı etkin parametreler
Model Toplam parametreler Token başına etkin Etkin pay
Mixtral 8×22B (MoE)56 katman 141 B 39 B 28 %
Qwen 3 235B-A22B (MoE)94 katman 235 B 22 B 9 %
DeepSeek V3 671B-A37B (MoE)61 katman 671 B 37 B 6 %
Llama 3.3 70BYoğun, karşılaştırma için 70 B 70 B 100 %

Hatırlanması gereken sütun, sonuncusudur. Yoğun bir model, sakladığı her şeyi okur; bir uzman karışımı ise bir dilimini okur. Bu modellerle ilgili tuhaf olan her şey — iyisi de kötüsü de — o tek satırdan çıkar.

Gerçekte kiraladığınız bellek

İşte bütün tuzak tek bir tabloda. Orta sütun, modelin makinede ihtiyaç duyduğu şeydir; ondan sonraki sütun, etkin sayıyı olduğu gibi kabul eden bir okuyucunun bütçeleyeceği şeydir. Son sütun ise bu yanlış okumanın bedelidir.

4 bit'te, 8k bağlamla gereken VRAM, etkin parametre sayısının ima ettiğine karşı
Model 4 bit'te ağırlıklar Gereken toplam Etkin boyutunda olsaydı Aşım
Mixtral 8×22B (MoE) 71 GB 83 GB8k bağlamında 24 GB 3.4×
Qwen 3 235B-A22B (MoE) 118 GB 137 GB8k bağlamında 14 GB 9.5×
DeepSeek V3 671B-A37B (MoE) 336 GB 386 GB8k bağlamında 22 GB 17.6×

Son sütunu bir alışveriş hatası olarak okuyun. Yalnızca etkin sayıya göre boyutlandıran biri, tek bir kart aramaya çıkar ve sonunda koca bir düğüme ihtiyaç duyar — biraz daha büyük bir makineye değil, farklı bir fiyatta, tamamen farklı bir makine kategorisine.

Hayır, kullanılmayan uzmanları diskte tutamazsınız. Bu, herkesin aklına gelen ilk fikirdir ve sunum yığınları bunu gerçekten sunar. Sorun şu ki yönlendirme token başına karar verilir: ihtiyaç duyduğunuz uzman kümesi, üretilen her kelimede birkaç kez değişir, bu yüzden bir alt kümeyi barındıran bir kart, zamanının çoğunu hesaplama yapmak yerine ağırlıkları PCIe üzerinden getirip götürmekle geçirir. Sonuç, biraz daha yavaş bir model değil, hızının ancak küçük bir kısmında çalışan bir modeldir. Offloading, bir modeli tutamayan bir makinede çalıştırmanın bir yoludur, onu sunmanın değil.

Etkin parametrelerin sağladığı

Üretim, bellek bant genişliğiyle sınırlıdır: her yeni token, kendisine katılan ağırlıkların yeniden okunmasını gerektirir. Bir uzman karışımı yalnızca kendi etkin dilimini okur, bu yüzden hızının tavanı, boyutunun ima ettiğinden çok daha küçük bir sayıyla belirlenir. Vaadin bu kısmı gerçektir ve bu modellerin var olma sebebi de zaten budur.

Aşağıdaki tablo, her modeli aynı makineye koyar — ayda $7,906 karşılığında 8 × NVIDIA A100 PCIe, kataloğumuzda hepsini aynı anda barındıran en ucuz düğüm. Farklı makinelerde alınmış işlem hacmi rakamlarını karşılaştırmak, hiçbir şeyi karşılaştırmamaktır.

Tek düğümde tek akışlı üretim: uzman karışımlarına karşı yoğun modeller
Model Toplam Token başına okunan Tahmini token/sn
DeepSeek V3 671B-A37B (MoE)Uzman karışımı · 8 kart arasında paylaştırılmış 671 B 18.5 GB 37tek akış
Llama 3.1 405BYoğun · 8 kart arasında paylaştırılmış 405 B 202.5 GB 19tek akış
Qwen 3 235B-A22B (MoE)Uzman karışımı · 8 kart arasında paylaştırılmış 235 B 11.0 GB 62tek akış
Mixtral 8×22B (MoE)Uzman karışımı · 8 kart arasında paylaştırılmış 141 B 19.5 GB 35tek akış
Llama 3.3 70BYoğun · tek kartta 70 B 35.0 GB 25tek akış

Karşılaştırmaya değer iki satır, en büyük uzman karışımı ile en büyük yoğun modeldir, çünkü ikisi de düğümün tamamına paylaştırılmıştır. Karışım, çok daha büyük bir model olmasına rağmen hâlâ daha hızlı üretim yapar, çünkü token başına kendisinin yalnızca bir dilimini okur — mimarinin var oluş amacı olan takas budur. Tek kartta işaretli satırları farklı okuyun: bu modeller düğümün tek bir kartını kaplar ve diğer yediyi boş bırakır; bu, seçilmeyi bekleyen daha ucuz bir makinedir, daha yavaş bir makine değil.

Bu rakamlar zaten büyük bir ceza payı taşıyor ve taşımaları da gerekiyor. Salt etkin parametre aritmetiği, bir uzman karışımını ciddi ölçüde fazla tahmin eder. Bu tahmincinin ilk sürümü tam olarak bunu yapıyordu ve bu sayfadaki en büyük model için yayımlanmış ölçümlere karşı yaklaşık beş kat yanılıyordu. Yönlendirme kendi başına bir geçiş gerektirir, uzmanlar her katmanda kartlar arasında aktivasyon alışverişi yapmak zorundadır ve batch, ortalamanın ima ettiğinden daha fazla uzmana yayılır. Tahminci artık, seçilmek yerine ölçülmüş rakamlara göre kalibre edilmiş, kasıtlı olarak muhafazakâr bir düzeltme uygular — düşük okumasının nedeni de budur, yüksek değil. Buradaki her sayıyı, karşı planlama yapılacak bir hedef değil, makinede aşılması gereken bir taban değer olarak görün.

Aritmetiğin gizlediği ikinci şey, bir uzman karışımını iyi paylaştırmanın daha zor olduğudur. Kartlar arasında paylaştırılmış yoğun bir model, katman başına bir kez senkronize olur; bir karışım ise ayrıca tokenleri seçilen uzmanı barındıran herhangi bir karta yönlendirmek zorundadır, ki bu farklı ve daha az öngörülebilir bir trafik örüntüsüdür. Bu, ara bağlantının yalnızca makbuzda görünmekle kalmayıp parasını gerçekten hak ettiği az sayıdaki iş yükünden biridir.

Ucuzlayan yarı

Şimdiye kadarki her şey büyük modeller için kötü haberdi. İşte telafisi, üstelik neredeyse hiçbir karşılaştırmanın değinmediği kadar büyük bir telafi: bu sayfadaki en fazla parametreye sahip modeller, token başına en az anahtar/değer önbelleğine sahiptir. Önbellek, dikkat tasarımı tarafından belirlenir — katmanlar, anahtar/değer başlıkları, başlık boyutu — ve dikkatin arkasında kaç uzman olduğuyla hiçbir ilgisi yoktur.

Token başına anahtar/değer önbelleği ve bunun her bağlam uzunluğunda tek bir akışa maliyeti
Model Token başına önbellek 4k 8k 32k 128k
Mixtral 8×22B (MoE)8 KV başlığı 224 KiB 0.9 GB 1.8 GB 7.0 GB 28.0 GB
Qwen 3 235B-A22B (MoE)4 KV başlığı 188 KiB 0.7 GB 1.5 GB 5.9 GB 23.5 GB
DeepSeek V3 671B-A37B (MoE)Latent attention 70 KiB 0.3 GB 0.5 GB 2.2 GB 8.8 GB
Llama 3.3 70B8 KV başlığı 320 KiB 1.3 GB 2.5 GB 10.0 GB 40.0 GB
Llama 3.1 405B8 KV başlığı 504 KiB 2.0 GB 3.9 GB 15.8 GB 63.0 GB

O sütunlar, eşzamanlı istek başınadır. Uç noktayı aynı anda kullanan kişi sayısıyla çarpın; son sütundaki sıralama, makinenizi ağırlıklardan çok daha fazla belirler.

DeepSeek V3 671B-A37B (MoE), listedeki en küçük önbelleğe sahiptir: token başına 70 KiB. 320 KiB'lik Llama 3.3 70B karşısında bu, daha büyük model yönünde 4.6× kat bir farktır. Anahtarları ve değerleri her başlık için ayrı ayrı saklamak yerine küçük, paylaşılan bir gizil vektöre izdüşürerek önbelleği sıkıştırır. Yani yüklemesi en pahalıya mal olan model, meşgul tutması en ucuza mal olan modeldir — uzun bağlamda kullanılabilir kalmasının nedeni budur ve bir avuçtan fazla kişiye hizmet verir vermez aritmetiğin tersine dönmesinin de nedeni budur.

Pratikteki karşılığı şudur: ağırlıklar sabit bir giriş ücretidir, önbellek ise işletme maliyetidir. Bir uzman karışımı, muazzam bir giriş ücreti alır ve ardından kullanıcı başına küçük bir işletme maliyeti uygular. Benzer yetenekteki yoğun bir model ise bunun tam tersidir. İkisinden hangisinin sizin için daha ucuz olduğuna, model kartındaki parametre sayısı değil, eşzamanlılık ve bağlam uzunluğu karar verir.

Bunları hangi makineler barındırır

4 bit'te, referans bağlamla ve her modeli barındıran kataloğumuzdaki en ucuz düğüm alınarak — ister tek bir kartta olsun, ister düğüm genelinde paylaştırılmış olsun. Bunlar giriş biletleridir, öneri değildir; bir sonraki bölüm nedenini açıklar.

Her uzman karışımı modelini barındıran, kiraladığımız en ucuz yapılandırma
Model Gereken Onu barındıran en ucuz düğüm Aylık Tokens/s
Mixtral 8×22B (MoE) 83 GB 4 × NVIDIA L4Toplam 96 GB · kart başına 24 GB $564 4
Qwen 3 235B-A22B (MoE) 137 GB 8 × NVIDIA L4Toplam 192 GB · kart başına 24 GB $1,106 10
DeepSeek V3 671B-A37B (MoE) 386 GB 8 × NVIDIA A100 PCIeToplam 640 GB · kart başına 80 GB $7,906 37

Bunların her biri çoklu kartlı bir düğümdür ve bu sayfanın dürüst özeti de budur: etkin sayı onları ne kadar küçük gösterirse göstersin, kataloğumuzda hiçbiri tek bir kartta barındırılamaz. Kalan yapılandırmalar tam katalogda yer alır ve yapılandırıcı aynı kontrolü kendi modeliniz ve bağlamınız için de çalıştırır.

En ucuz düğüm, yanlış olandır

Sığmak bir eşiktir, bir hedef değil. Bir model düğüm genelinde paylaştırıldığında, işlem hacmi, paylaştırıldığı kartların bellek bant genişliğine bağlıdır — ve dolar başına bant genişliği, hepsi aynı bellek eşiğini geçen yapılandırmalar arasında bile iki kattan fazla değişir. İşte DeepSeek V3 671B-A37B (MoE), onu barındıran her düğümde, fiyata göre sıralanmış ve önemli olan tek sütun sağda.

DeepSeek V3 671B-A37B (MoE) modelini barındıran her düğüm, saniyede bir tokenin aylık fiyatıyla birlikte
Yapılandırma VRAM Aylık Tokens/s token/s başına $
8 × NVIDIA A100 PCIeGN-A10080×8 640 GB $7,906 37 $213.68
8 × NVIDIA A100 SXM4GN-A100SXM×8 640 GB $8,355 39 $214.23
4 × NVIDIA H200 SXM5GN-H200×4 564 GB $8,405 62 $135.56
8 × NVIDIA H100 PCIeGN-H100PCIE×8 640 GB $10,568 38 $278.11
8 × NVIDIA H100 SXM5GN-H100SXM×8 640 GB $11,509 64 $179.83
4 × NVIDIA B200 SXM6GN-B200×4 720 GB $11,790 103 $114.47
8 × NVIDIA H200 SXM5GN-H200×8 1128 GB $15,945 91 $175.22
8 × NVIDIA B200 SXM6GN-B200×8 1440 GB $22,351 152 $147.05

$7,906 yapılandırmasından $11,790 yapılandırmasına geçmek, makbuzu 1.5× katına, işlem hacmini ise 2.8× katına çıkarır — daha fazla ödersiniz ve her token size daha az mal olur. Bir kataloğu fiyata göre sıralayıp sığan ilk makineyi almak, bir sunum bütçesinin iki kez harcanmasının yoludur.

O sütunla ilgili bir uyarı var; bu, okuyacağınız her fiyat-işlem hacmi tablosu için geçerlidir: bu sütun tek akışlı üretimi esas alır. Sürekli batching altında toplam, her satırda birkaç kat daha yükseğe çıkar ve her satırda aynı kat kadar yükselmez — ağırlıklardan sonra daha fazla boş belleği olan bir düğüm, daha fazla eşzamanlı diziyi barındırır. Sıralama sabittir; mutlak rakamlar ise muhafazakârdır. Bu toplamın ekonomisi ayrıca ele alınır.

Bir uzman karışımının doğru cevap olduğu an

Sırayla. Sizi tanımlayan ilk satırda durun.

  1. Tek bir karta sığan yoğun bir model işi görür. O zaman onu seçin ve arkanıza bakmayın. Tek kart; paylaştırma yok, ara bağlantı sorunu yok, uzman yönlendirme trafiği yok ve bir düğümün ancak bir kısmına mal olan bir makine anlamına gelir. En gelişmiş açık bir modele ihtiyacı olduğunu düşünen ürünlerin çoğu, aslında iyi bir 32B modele ihtiyaç duyar.
  2. Kaliteye ihtiyacınız var ve bağlamınız uzun. Bir uzman karışımının gerçekten mevcut en iyi araç olduğu yer burasıdır: ağırlıklar için yalnızca bir kez ödersiniz ve küçük önbellek, makinenin uzun konuşmalara çökmeden hizmet vermeye devam etmesini sağlar. Düğümü ağırlıklara göre boyutlandırın, ardından gerçek bağlamınız için önbellek tablosunu kontrol edin.
  3. Kaliteye ihtiyacınız var ve aynı anda çok sayıda kişiye hizmet veriyorsunuz. Aynı cevap, aynı sebep; ve bu avantaj eşzamanlılıkla birlikte büyür. Sabit maliyet her akışa yayılırken akış başına maliyet düşük kalır.
  4. Kaliteye ihtiyacınız var ama yalnızca ara sıra. Bu durumda haftada birkaç saat sıcak tutmak için büyük bir düğüm kiralıyorsunuz demektir; bu da aylık bir sürenin mümkün olan en kötü kullanımıdır. Ya işi tek bir oturuşta çalışacak şekilde toplulaştırın, ya da bunun için barındırılan bir uç nokta kullanın ve kendi makinenizi düzenli yük için saklayın.
  5. Birini fine-tune etmek istiyorsunuz. Farklı bir sorun, daha büyük bir makine: eğitim her uzmana dokunur ve hepsi için optimizer durumuna ihtiyaç duyar, bu yüzden çıkarımı zaten zorlaştıran bellek ihtiyacı burada karşılanamaz hâle gelir. Yoğun bir model üzerinde adaptör fine-tuning, neredeyse herkes için gerçekçi olan yoldur.

Hangi satırda durduysanız durun, önce kontrol edilecek sayı, sunmayı düşündüğünüz hassasiyette toplam parametre sayısıdır. Bu sayfadaki her şey — hız, önbellek, saniyedeki token başına fiyat — ancak model bellekte hazır bulunduğunda önem kazanır. Yapılandırıcı, kiraladığımız her düğüme karşı bu kontrolün tamamını çalıştırır ve yukarıdaki tablolarla aynı yönlendirme düzeltmesini işlem hacmi tahminine uygular. Bellek aritmetiğini önce baştan sona görmek isterseniz, bunun kendi başına bir rehberi var; henüz bir sayı biçimine karar vermediyseniz, bu seçim, bundan öncedir.

Kendi uzman karışımı modelinizi gerçek makinelere karşı kontrol edin.

Yapılandırıcı, kiraladığımız her düğümü içerir, bu sayfayla aynı aritmetiği uygular ve herhangi bir ödeme yapmadan önce hangilerinin modelinizi barındırdığını size söyler.

Giriş Yapın

Konsol, makbuzlar ve bant dışı erişim.

Henüz hesabınız yok mu?

Ayrı bir kayıt işlemi yoktur. Hesabınız, ilk siparişinizi verirken oluşturulur — e-postayı ve şifreyi ödeme adımında seçersiniz, ve makine hazır olduğunda konsol da açık olur.

Bir sunucu yapılandırın

Language