Bir uzman karışımının gerçek maliyeti.
“235B-A22B” gibi bir isim iki sayı içerir ve neredeyse herkes yanlış olanını okur. Bunlardan biri ne kiralayacağınızı belirler; diğeri ne kadar hızlı yanıt vereceğini belirler. Aralarında on kata varan bir fark olabilir.
Kısa cevap
- Toplam parametreler makineyi belirler
- 4 bit'te DeepSeek V3 671B-A37B (MoE), 8k bağlamla 386 GB gerektirir. Etkin parametreleri büyüklüğünde yoğun bir model 22 GB gerektirirdi — yani 17.6× daha az.
- Etkin parametreler hızı belirler
- Token başına ağırlıkların yalnızca bir kısmı okunur, bu yüzden aynı kütledeki yoğun bir modelden daha hızlı üretim yapar — ama yönlendirme, bu avantajın büyük bir kısmını doğrudan geri alır.
- Onu barındıran en ucuz düğüm
- Ayda $7,906 karşılığında 8 × NVIDIA A100 PCIe. Neredeyse hiçbir zaman kiralanacak olan o değildir.
- Kiralamaya değer olan
- $11,790 fiyatındaki 4 × NVIDIA B200 SXM6 — 1.5× kat para karşılığında 2.8× kat işlem hacmi.
Kısa özet
Bir uzman karışımı, her katmanın ileri beslemeli kısmını birçok küçük ağa böler ve her tokeni bunlardan yalnızca birkaçı üzerinden gönderir. Yayımlanan isim her iki gerçeği de kaydeder: toplam parametre sayısını ve herhangi bir token için etkin olan sayıyı. Birincisinin tamamını bellekte tutmanız gerekir, ikincisini ise yalnızca token başına okursunuz. Bu tek cümle rehberin tamamıdır ve bunu tersten anlamak, bir sipariş öncesinde insanların yaptığını gördüğümüz en pahalı hatadır.
Sonuç, garip bir maliyet biçimine sahip bir modeldir: bir dev gibi kiralanır ve orta boy bir model gibi çalışır. Bunun bir fırsat mı yoksa bir tuzak mı olduğu, tamamen darboğazınızın bu iki sayıdan hangisi olduğuna bağlıdır.
Makineyi mi boyutlandırıyorsunuz? Toplamı kullanın. Her uzmanın bellekte hazır bulunması gerekir, çünkü bir sonraki tokenin hangilerine ihtiyaç duyacağını önceden bilemezsiniz. Yönlendirme, çalışma zamanında, token başına karar verilir.
Hızı mı tahmin ediyorsunuz? Etkin sayıdan başlayın, ardından büyük bir indirim uygulayın. Üretim yalnızca etkin ağırlıkları okur, zaten bütün mesele de budur — ama yönlendirici, uzman dağıtımı ve kartlar arasındaki trafik bedavaya gelmez ve bunlar bir düğüm genelinde kötü ölçeklenir.
Uzun bağlam mı sunuyorsunuz, yoksa çok sayıda kullanıcıya mı hizmet veriyorsunuz? Parametre sayılarına değil, dikkat tasarımına bakın. Bu sayfadaki en büyük modeller, token başına en küçük anahtar/değer önbelleğine sahiptir ve belirli bir uzunluğun ötesinde bu, sıralamayı tamamen tersine çevirir.
Sadece kaliteyi mi istiyorsunuz? Tek bir karta sığan yoğun bir model, sekiz kart arasında paylaştırılmış bir uzman karışımından işletmesi daha kolay, daha ucuz ve daha hızlıdır. Hiçbir yoğun model ihtiyacınız olan yanıtı vermediğinde bir MoE'ye yönelin, ismi etkileyici göründüğü için değil.
Aşağıdaki aritmetik, yapılandırıcının aynı katalog üzerinde çalıştırdığı aritmetiğin aynısıdır. Bir modelin ne kadar belleğe ihtiyaç duyduğunu genel olarak henüz hesaplamadıysanız, önce o formül gelir — model bir uzman karışımı olduğunda değişen şey ise bu sayfadır.
Adın okunması
Dolaşımda üç adlandırma kuralı var ve hepsi aynı sayı çiftini kodluyor; kafa karışıklığının sürmesinin nedeni de bu. Onları okuyabildiğinizde, boyutlandırma sorusu kendiliğinden cevaplanır.
| Model | Toplam parametreler | Token başına etkin | Etkin pay |
|---|---|---|---|
| Mixtral 8×22B (MoE) | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) | 671 B | 37 B | 6 % |
| Llama 3.3 70B | 70 B | 70 B | 100 % |
Hatırlanması gereken sütun, sonuncusudur. Yoğun bir model, sakladığı her şeyi okur; bir uzman karışımı ise bir dilimini okur. Bu modellerle ilgili tuhaf olan her şey — iyisi de kötüsü de — o tek satırdan çıkar.
Gerçekte kiraladığınız bellek
İşte bütün tuzak tek bir tabloda. Orta sütun, modelin makinede ihtiyaç duyduğu şeydir; ondan sonraki sütun, etkin sayıyı olduğu gibi kabul eden bir okuyucunun bütçeleyeceği şeydir. Son sütun ise bu yanlış okumanın bedelidir.
| Model | 4 bit'te ağırlıklar | Gereken toplam | Etkin boyutunda olsaydı | Aşım |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB | 22 GB | 17.6× |
Son sütunu bir alışveriş hatası olarak okuyun. Yalnızca etkin sayıya göre boyutlandıran biri, tek bir kart aramaya çıkar ve sonunda koca bir düğüme ihtiyaç duyar — biraz daha büyük bir makineye değil, farklı bir fiyatta, tamamen farklı bir makine kategorisine.
Etkin parametrelerin sağladığı
Üretim, bellek bant genişliğiyle sınırlıdır: her yeni token, kendisine katılan ağırlıkların yeniden okunmasını gerektirir. Bir uzman karışımı yalnızca kendi etkin dilimini okur, bu yüzden hızının tavanı, boyutunun ima ettiğinden çok daha küçük bir sayıyla belirlenir. Vaadin bu kısmı gerçektir ve bu modellerin var olma sebebi de zaten budur.
Aşağıdaki tablo, her modeli aynı makineye koyar — ayda $7,906 karşılığında 8 × NVIDIA A100 PCIe, kataloğumuzda hepsini aynı anda barındıran en ucuz düğüm. Farklı makinelerde alınmış işlem hacmi rakamlarını karşılaştırmak, hiçbir şeyi karşılaştırmamaktır.
| Model | Toplam | Token başına okunan | Tahmini token/sn |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) | 671 B | 18.5 GB | 37 |
| Llama 3.1 405B | 405 B | 202.5 GB | 19 |
| Qwen 3 235B-A22B (MoE) | 235 B | 11.0 GB | 62 |
| Mixtral 8×22B (MoE) | 141 B | 19.5 GB | 35 |
| Llama 3.3 70B | 70 B | 35.0 GB | 25 |
Karşılaştırmaya değer iki satır, en büyük uzman karışımı ile en büyük yoğun modeldir, çünkü ikisi de düğümün tamamına paylaştırılmıştır. Karışım, çok daha büyük bir model olmasına rağmen hâlâ daha hızlı üretim yapar, çünkü token başına kendisinin yalnızca bir dilimini okur — mimarinin var oluş amacı olan takas budur. Tek kartta işaretli satırları farklı okuyun: bu modeller düğümün tek bir kartını kaplar ve diğer yediyi boş bırakır; bu, seçilmeyi bekleyen daha ucuz bir makinedir, daha yavaş bir makine değil.
Aritmetiğin gizlediği ikinci şey, bir uzman karışımını iyi paylaştırmanın daha zor olduğudur. Kartlar arasında paylaştırılmış yoğun bir model, katman başına bir kez senkronize olur; bir karışım ise ayrıca tokenleri seçilen uzmanı barındıran herhangi bir karta yönlendirmek zorundadır, ki bu farklı ve daha az öngörülebilir bir trafik örüntüsüdür. Bu, ara bağlantının yalnızca makbuzda görünmekle kalmayıp parasını gerçekten hak ettiği az sayıdaki iş yükünden biridir.
Ucuzlayan yarı
Şimdiye kadarki her şey büyük modeller için kötü haberdi. İşte telafisi, üstelik neredeyse hiçbir karşılaştırmanın değinmediği kadar büyük bir telafi: bu sayfadaki en fazla parametreye sahip modeller, token başına en az anahtar/değer önbelleğine sahiptir. Önbellek, dikkat tasarımı tarafından belirlenir — katmanlar, anahtar/değer başlıkları, başlık boyutu — ve dikkatin arkasında kaç uzman olduğuyla hiçbir ilgisi yoktur.
| Model | Token başına önbellek | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |
O sütunlar, eşzamanlı istek başınadır. Uç noktayı aynı anda kullanan kişi sayısıyla çarpın; son sütundaki sıralama, makinenizi ağırlıklardan çok daha fazla belirler.
Pratikteki karşılığı şudur: ağırlıklar sabit bir giriş ücretidir, önbellek ise işletme maliyetidir. Bir uzman karışımı, muazzam bir giriş ücreti alır ve ardından kullanıcı başına küçük bir işletme maliyeti uygular. Benzer yetenekteki yoğun bir model ise bunun tam tersidir. İkisinden hangisinin sizin için daha ucuz olduğuna, model kartındaki parametre sayısı değil, eşzamanlılık ve bağlam uzunluğu karar verir.
Bunları hangi makineler barındırır
4 bit'te, referans bağlamla ve her modeli barındıran kataloğumuzdaki en ucuz düğüm alınarak — ister tek bir kartta olsun, ister düğüm genelinde paylaştırılmış olsun. Bunlar giriş biletleridir, öneri değildir; bir sonraki bölüm nedenini açıklar.
| Model | Gereken | Onu barındıran en ucuz düğüm | Aylık | Tokens/s |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | 4 × NVIDIA L4 | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | 8 × NVIDIA L4 | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | 8 × NVIDIA A100 PCIe | $7,906 | 37 |
Bunların her biri çoklu kartlı bir düğümdür ve bu sayfanın dürüst özeti de budur: etkin sayı onları ne kadar küçük gösterirse göstersin, kataloğumuzda hiçbiri tek bir kartta barındırılamaz. Kalan yapılandırmalar tam katalogda yer alır ve yapılandırıcı aynı kontrolü kendi modeliniz ve bağlamınız için de çalıştırır.
En ucuz düğüm, yanlış olandır
Sığmak bir eşiktir, bir hedef değil. Bir model düğüm genelinde paylaştırıldığında, işlem hacmi, paylaştırıldığı kartların bellek bant genişliğine bağlıdır — ve dolar başına bant genişliği, hepsi aynı bellek eşiğini geçen yapılandırmalar arasında bile iki kattan fazla değişir. İşte DeepSeek V3 671B-A37B (MoE), onu barındıran her düğümde, fiyata göre sıralanmış ve önemli olan tek sütun sağda.
| Yapılandırma | VRAM | Aylık | Tokens/s | token/s başına $ |
|---|---|---|---|---|
| 8 × NVIDIA A100 PCIe | 640 GB | $7,906 | 37 | $213.68 |
| 8 × NVIDIA A100 SXM4 | 640 GB | $8,355 | 39 | $214.23 |
| 4 × NVIDIA H200 SXM5 | 564 GB | $8,405 | 62 | $135.56 |
| 8 × NVIDIA H100 PCIe | 640 GB | $10,568 | 38 | $278.11 |
| 8 × NVIDIA H100 SXM5 | 640 GB | $11,509 | 64 | $179.83 |
| 4 × NVIDIA B200 SXM6 | 720 GB | $11,790 | 103 | $114.47 |
| 8 × NVIDIA H200 SXM5 | 1128 GB | $15,945 | 91 | $175.22 |
| 8 × NVIDIA B200 SXM6 | 1440 GB | $22,351 | 152 | $147.05 |
$7,906 yapılandırmasından $11,790 yapılandırmasına geçmek, makbuzu 1.5× katına, işlem hacmini ise 2.8× katına çıkarır — daha fazla ödersiniz ve her token size daha az mal olur. Bir kataloğu fiyata göre sıralayıp sığan ilk makineyi almak, bir sunum bütçesinin iki kez harcanmasının yoludur.
O sütunla ilgili bir uyarı var; bu, okuyacağınız her fiyat-işlem hacmi tablosu için geçerlidir: bu sütun tek akışlı üretimi esas alır. Sürekli batching altında toplam, her satırda birkaç kat daha yükseğe çıkar ve her satırda aynı kat kadar yükselmez — ağırlıklardan sonra daha fazla boş belleği olan bir düğüm, daha fazla eşzamanlı diziyi barındırır. Sıralama sabittir; mutlak rakamlar ise muhafazakârdır. Bu toplamın ekonomisi ayrıca ele alınır.
Bir uzman karışımının doğru cevap olduğu an
Sırayla. Sizi tanımlayan ilk satırda durun.
- Tek bir karta sığan yoğun bir model işi görür. O zaman onu seçin ve arkanıza bakmayın. Tek kart; paylaştırma yok, ara bağlantı sorunu yok, uzman yönlendirme trafiği yok ve bir düğümün ancak bir kısmına mal olan bir makine anlamına gelir. En gelişmiş açık bir modele ihtiyacı olduğunu düşünen ürünlerin çoğu, aslında iyi bir 32B modele ihtiyaç duyar.
- Kaliteye ihtiyacınız var ve bağlamınız uzun. Bir uzman karışımının gerçekten mevcut en iyi araç olduğu yer burasıdır: ağırlıklar için yalnızca bir kez ödersiniz ve küçük önbellek, makinenin uzun konuşmalara çökmeden hizmet vermeye devam etmesini sağlar. Düğümü ağırlıklara göre boyutlandırın, ardından gerçek bağlamınız için önbellek tablosunu kontrol edin.
- Kaliteye ihtiyacınız var ve aynı anda çok sayıda kişiye hizmet veriyorsunuz. Aynı cevap, aynı sebep; ve bu avantaj eşzamanlılıkla birlikte büyür. Sabit maliyet her akışa yayılırken akış başına maliyet düşük kalır.
- Kaliteye ihtiyacınız var ama yalnızca ara sıra. Bu durumda haftada birkaç saat sıcak tutmak için büyük bir düğüm kiralıyorsunuz demektir; bu da aylık bir sürenin mümkün olan en kötü kullanımıdır. Ya işi tek bir oturuşta çalışacak şekilde toplulaştırın, ya da bunun için barındırılan bir uç nokta kullanın ve kendi makinenizi düzenli yük için saklayın.
- Birini fine-tune etmek istiyorsunuz. Farklı bir sorun, daha büyük bir makine: eğitim her uzmana dokunur ve hepsi için optimizer durumuna ihtiyaç duyar, bu yüzden çıkarımı zaten zorlaştıran bellek ihtiyacı burada karşılanamaz hâle gelir. Yoğun bir model üzerinde adaptör fine-tuning, neredeyse herkes için gerçekçi olan yoldur.
Hangi satırda durduysanız durun, önce kontrol edilecek sayı, sunmayı düşündüğünüz hassasiyette toplam parametre sayısıdır. Bu sayfadaki her şey — hız, önbellek, saniyedeki token başına fiyat — ancak model bellekte hazır bulunduğunda önem kazanır. Yapılandırıcı, kiraladığımız her düğüme karşı bu kontrolün tamamını çalıştırır ve yukarıdaki tablolarla aynı yönlendirme düzeltmesini işlem hacmi tahminine uygular. Bellek aritmetiğini önce baştan sona görmek isterseniz, bunun kendi başına bir rehberi var; henüz bir sayı biçimine karar vermediyseniz, bu seçim, bundan öncedir.
Kendi uzman karışımı modelinizi gerçek makinelere karşı kontrol edin.
Yapılandırıcı, kiraladığımız her düğümü içerir, bu sayfayla aynı aritmetiği uygular ve herhangi bir ödeme yapmadan önce hangilerinin modelinizi barındırdığını size söyler.
Diğer rehberler
- Maliyet · 6 dk
Aylık kiralama ne zaman saatlikten üstün olur
Gerçek rakamlar üzerinden hesaplanan başabaş noktası, saatlik fiyatın makbuza kadar gizlediği üç maliyet ve bir tahmini üçe katlayan boşta kalma tuzağı.
Rehberi okuyun - Maliyet · 9 dk
Kendi barındırmaya karşı token bazlı API
API'ye token başına ödemekle GPU kiralamak arasındaki başabaş noktası, kendi fiyat ve hızımıza göre hesaplandı — ve hesabın dışarıda bıraktığı dört şey.
Rehberi okuyun - Uygulama · 11 dk
Llama 3.3 70B'yi tek düğümde sunmak
Teslim edilen bir makineden OpenAI uyumlu bir uç noktaya — önemli bayraklar ve işlem hacminizi sessizce yarıya indiren iki bayrakla.
Rehberi okuyun