Bir GPU'nun fiilen kaç kişiye hizmet verebileceği.
Modelinizi barındıran bir makine, kullanıcılarınıza hizmet veren bir makine değildir. Ağırlıklar bir kez ödenen bir geçiş ücretidir; onlardan sonra kalan, insanlara hizmet vermek için sahip olduğunuz bütçenin tamamıdır. Kapasitenizi belirleyen kartın boyutu değil bu kalandır — ve bu kalan, bellekten çok daha hızlı değişir.
Kısa cevap
- Kapasite kart değil, kalandır
- 4-bit'te Llama 3.3 70B, kimseye hizmet vermeden önce 40 GB ayırır. Bundan sonraki her eşzamanlı istek 2.9 GB daha fazlaya mal olur.
- Bellek neden iki kez önemlidir
- Aynı kartta, 48 GB'den 240 GB'ye geçmek belleği 5.0× kat, koltuk sayısını ise 35× kat artırır. Ağırlıklar zaten ödenmiştir.
- Kısa listedeki en kötü alım
- NVIDIA L40S, ayda $714 tutarında 2 eşzamanlı istek barındırır — koltuk başına $357.00.
- En iyisi daha ucuza mal olur
- 4 × NVIDIA L4, $564 tutarında 19 barındırır — daha ucuz bir makbuzla, koltuk başına $29.68.
Kısa özet
Bir modelin sığıp sığmadığını söyleyen her rehber, tek bir isteğe ilişkin bir soruyu yanıtlar. Bir ürün, tek bir istek değildir. İki kişi uç noktanızı aynı anda kullandığı anda, makinenin bellekte konuşmanın ikinci bir kopyasına ihtiyacı olur — sonra üçüncüsüne, sonra kırkıncısına — ağırlıkların kendisi ise tam olarak bir kez saklanırken.
Yani kaç kişiye hizmet edebileceğinizi belirleyen sayı, kartın boyutu değildir. Bu, kartın boyutundan modelin çıkarılmasıyla elde edilen değerin, bir konuşmanın maliyetine bölünmesidir. Bu iki terim de herhangi bir şey sipariş etmeden önce bilinir; bu da kapasiteyi, makine öğrenmesinde kâğıt üzerinde hesaplayıp doğru çıkarabileceğiniz nadir şeylerden biri yapar.
Ağırlıklar, bir geçiş ücretidir. Trafiğiniz ne olursa olsun, girişte bir kez ödenir. Kullanıcılarınızla birlikte büyümez ve asla geri dönmez.
Anahtar/değer önbelleği, kiradır. Her eşzamanlı istek için, o istek açık kaldığı sürece ve konuşmanın uzunluğuyla orantılı olarak ödenir.
Kapasite, geriye kalanın kiraya bölünmesiyle bulunur. Bu yüzden belleği iki katı olan bir makine, çoğu zaman iki kat değil on kat daha fazla kişiye hizmet verir.
Ve sığan en ucuz makine neden genellikle en kötü değeri sunar. Sığar, çünkü geriye neredeyse hiçbir şey kalmaz ve geriye kalan tek şey, aslında satın aldığınız kısımdır.
Aşağıdaki her şey, aynı katalogda, 4-bit'te ve 8k bağlamla, yapılandırıcıyla aynı aritmetiği çalıştırır. Bellek formülünün kendisi sizin için yeniyse, bunun kendine ait bir rehberi var — bu sayfa da, birden fazla kişi ortaya çıktığında ona ne olduğunu anlatır.
Ağırlıklardan sonra kalan
Bu sitenin referans modelini alın ve aynı karttan oluşturulan her boyuttaki düğüme yerleştirin. Aynı silikon, kart başına aynı fiyat, her şey aynı — yalnızca bellek miktarı değişir. Son iki sütunun tamamen farklı hızlarda hareket ettiğine dikkat edin.
| Düğüm | Bellek | Ağırlıklardan sonra kalan | Eşzamanlı istekler | Aylık |
|---|---|---|---|---|
| NVIDIA L4 | 24 GB | — | onu barındırmaz | $125 |
| 2 × NVIDIA L4 | 48 GB | 8 GB | 2 | $285 |
| 4 × NVIDIA L4 | 96 GB | 56 GB | 19 | $564 |
| 8 × NVIDIA L4 | 192 GB | 152 GB | 52 | $1,106 |
| 10 × NVIDIA L4 | 240 GB | 200 GB | 69 | $1,371 |
İlk satır, dersin tamamıdır: ağırlıkları bile barındıramayan bir kart kimseye hizmet vermez, hem de hiç yaklaşmaz. Ondan sonraki satırlar belleği eşit adımlarla, koltukları ise giderek hızlanan adımlarla kazanır — çünkü 40 GB'lik geçiş ücreti ilk satırda ödenir ve bir daha asla ödenmez.
koltuk = (bellek − ağırlıklar) ÷ istek_başına_önbellek. Llama 3.3 70B için 4-bit'te bu, açık bir konuşma başına 40 GB geçiş ücreti ve 2.9 GB kira demektir. Önce çıkarın, sonra bölün — bunu ters sırayla yapmak, bir makinenin demo için alınıp üretimde açığa çıkmasının yoludur.
Bir kullanıcının fiilen neye mal olduğu
Şimdi aynı modeller, bir alıcının sıralayacağı şekilde sıralanıyor: önce en ucuzu. Son sütun, aylık fiyatın, makinenin aynı anda barındırabileceği kişi sayısına bölünmesiyle bulunur — bir demodan fazlasını inşa ederken iki makineyi dürüstçe karşılaştıran tek sütun budur.
Her sayıyı değiştirdiği için belirtilen bir varsayım: her koltuk sayısı, modelin düğümün tamamına yayılmış tek bir örneği içindir — bunu size veren şey --tensor-parallel-size bayrağıdır. Ağırlıklar bir kez saklanır ve her kart, kalan belleğini aynı konuşma havuzuna katar. Aynı düğümde bunun yerine iki ayrı kopya çalıştırırsanız, geçiş ücretini iki kez ödersiniz ve toplamda daha az koltuğunuz kalır.
| Düğüm | Bellek | Aylık | Eşzamanlı istekler | Kullanıcı başına |
|---|---|---|---|---|
| 2 × NVIDIA L4 | 48 GB | $285 | 2 | $142.50 |
| NVIDIA RTX A6000 | 48 GB | $286 | 2 | $143.00 |
| 2 × NVIDIA RTX 4090 | 48 GB | $416 | 2 | $208.00 |
| 4 × NVIDIA L4 | 96 GB | $564 | 19 | $29.68 |
| 2 × NVIDIA RTX A6000 | 96 GB | $597 | 19 | $31.42 |
| 2 × NVIDIA RTX 5090 | 64 GB | $692 | 8 | $86.50 |
| NVIDIA L40S | 48 GB | $714 | 2 | $357.00 |
| 2 × NVIDIA A100 PCIe | 80 GB | $802 | 13 | $61.69 |
| 4 × NVIDIA RTX 4090 | 96 GB | $814 | 19 | $42.84 |
| NVIDIA A100 PCIe | 80 GB | $1,091 | 13 | $83.92 |
İki renkli hücreyi kendi fiyat sütunlarına karşı okuyun. NVIDIA L40S, ayda $714 tutarındadır ve 2 barındırır; 4 × NVIDIA L4 ise $564 tutarındadır — daha az parayla — ve 19 barındırır. Bu, 0.79× makbuz karşılığında 10× koltuk demektir; pahalı olan ise çoğu kısa listenin tuttuğu makinedir, çünkü modelin tek bir karta sığdığı makine odur.
Yalnızca ilk on satırda değil, kataloğun tamamında bu model için koltuk başına en iyi fiyatı veren makine 8 × NVIDIA RTX A6000: ayda $2,239 tutarında, 119 eşzamanlı istek, her biri $18.82. Bu, yukarıdaki kısa listedeki her şeyden çok daha büyük bir makbuzdur ve yine de bir kullanıcıyı oturtmanın hâlâ en ucuz yoludur — bir ürünü mü yoksa bir prototipi mi boyutlandırdığınıza karar veren cümle de budur.
Bağlam uzunluğu, diğer çarpandır
Yukarıdakilerin tümü 8k bağlam varsaydı. Bu varsayım, makine seçiminden daha fazla iş görüyor. Önbellek, kullanıcı başına olduğu kadar token başına da ödenir; bu yüzden aynı düğüm, bir konuşmanın ne kadar uzamasına izin verdiğinize bağlı olarak tamamen farklı sayıda kişiyi oturtur.
Tek bir makine, dört model, dört bağlam uzunluğu. Düğüm 8 × NVIDIA L4 — ayda $1,106 tutarında, dört modelin tümünü aynı anda barındıran kataloğumuzdaki en ucuz seçenek; böylece aşağıdaki her sayı aynı belleğe göre ölçülür.
| Model | Token başına önbellek | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Llama 3.1 8B | 128 KiB | 325 | 162 | 40 | 10 |
| Qwen 3 32B | 256 KiB | 150 | 75 | 18 | 4 |
| Llama 3.3 70B | 320 KiB | 105 | 52 | 13 | 3 |
| Qwen 3 235B-A22B (MoE) | 188 KiB | 67 | 33 | 8 | 2 |
Değişmeyen tek bir makinede Llama 3.3 70B, yalnızca komut satırında ayarladığınız bir sayı yüzünden 105 eşzamanlı kullanıcıdan 3 eşzamanlı kullanıcıya çıkar — 35× kat bir artış. Donanımla ilgili hiçbir şey yerinden oynamadı.
Buradan iki sonuç çıkar. Birincisi, okumanız gereken bağlam sütununun, model kartının reklamını yaptığı değil, fiilen sunduğunuz sütun olduğudur — 128k'yi destekleyen bir model, onu ayırmanızı zorunlu kılmaz. İkincisi, token başına önbelleğin, benzer boyuttaki modeller arasında bile büyük ölçüde değiştiğidir; çünkü bunu belirleyen parametre sayısı değil, dikkat tasarımıdır. O tablodaki en büyük modellerin bazıları en küçük önbelleklere sahiptir — bu da bu alandaki en sezgiye aykırı gerçektir.
Kapasiteyi geri kazanmanın dört yolu
Ne kadar az maliyetle ne kadar çok kazandırdıklarına göre azalan sırayla. İlki neredeyse ücretsizdir ve neredeyse her zaman değerlendirilmeden bırakılır.
--max-model-len bayrağını gerçek tavanınıza ayarlayın.| Model | 16-bit önbellek | 8-bit önbellek | Kazanılan koltuklar |
|---|---|---|---|
| Llama 3.1 8B | 162 | 325 | +163 |
| Qwen 3 32B | 75 | 150 | +75 |
| Llama 3.3 70B | 52 | 105 | +53 |
| Qwen 3 235B-A22B (MoE) | 33 | 67 | +34 |
Aynı düğüm, aynı ağırlıklar, aynı para. Tek değişen, önbelleğin hangi hassasiyette saklandığıdır — ve bu, bir ekibe hizmet veren bir makineyle bir ürüne hizmet veren bir makine arasındaki farktır.
Koltuk, hizmetle aynı şey değildir
Yukarıdaki sayılara göre herhangi bir şeyi boyutlandırmadan önce bir düzeltme — ve bu sayfayı dürüst tutan düzeltme de budur. Buradaki her şey, makinenin kaç konuşmayı açık tutabildiğini sayar. Bunların hepsinin hızla yanıtlandığını garanti etmez.
Bellek ve bant genişliği, iki farklı tavandır. 8 × NVIDIA L4 üzerinde Llama 3.3 70B, 52 eşzamanlı konuşma için yer açar; oysa o makinede tek başına bir kullanıcı saniyede yaklaşık 17 token görür. Bütün 52 koltuğu doldurmak, her birine saniyede 17 token vermez — üretim aynı bellek bant genişliğini paylaşır, bu yüzden toplam değer batching ile yükselirken kullanıcı başına hız düşer. Bant genişliği tavanına, bellek tavanından çok önce ulaşılır.
İyi haber şu ki iki tavan birlikte hareket eder: ağırlıklardan sonra geriye büyük miktarda bellek kalan makineler, az sayıdaki istisna dışında, daha fazla bant genişliğine sahip makinelerdir de. Boşluğa göre seçim yapmak, nadiren hızdan ödün verdirir. Sonunda elinizde kalan makinede sunum yığınını kurmak ayrı bir rehberin konusudur ve bu sayılar, o rehberin ele aldığı bayraklarda karşılığını bulur.
Kendi kullanıcı sayınıza göre seçim yapmak
Sırayla. Yükünüzü tanımlayan ilk satırda durun.
- Aynı anda tek bir istek. Toplu işler, bir iç araç, tek bir geliştirici. Modeli tek bir kartta barındıran en ucuz makineyi satın alın ve okumayı bırakın — bu sayfadaki her sütun, sizde olmayan bir soruyu yanıtlıyor.
- Ara sıra, bir avuç insan. Bir ekip aracı, erken aşamadaki bir ürün. Kullanıcı sayınızı değil, zirve eşzamanlı istek sayınızı hesaplayın: yüz kayıtlı kullanıcı, nadiren bir avuç eşzamanlı istekten fazlasına karşılık gelir. Ardından koltuk sayısı bu zirvenin rahatça üzerinde olan en ucuz makineyi seçin.
- Gerçek trafiğe sahip gerçek bir ürün. Kataloğu fiyata göre değil, koltuk başına fiyata göre sıralayın; bağlamınızı fiilen sunduğunuz seviyeyle sınırlayın, önbelleği 8-bit'e düşürün ve kazananın, aylık fiyatına bakarak kısa listeye almayacağınız bir makine olmasını bekleyin.
- Uzun belgeler veya uzun konuşmalar. Önce bağlam tablosunu, sonra makine tablosunu okuyun. 32k ve üzerinde önbellek o kadar baskın hâle gelir ki, model seçimi arkasındaki dikkat tasarımından daha az önemli olur.
- Dalgalı, öngörülemeyen trafik. Başarısız olamayacağınız zirveye göre boyutlandırın, çünkü önbellek tükendiğinde ödünç alınamaz — konuşmasını koyacak yeri olmayan bir istek kuyrukta bekler. Zirve nadir ve çok büyükse, taşma için token başına ücretlendirilen bir API, ayda iki kez yaşanan bir dalgalanma için boyutlandırılmış bir makineden daha ucuzdur.
Hangi satırda durduysanız durun, başka her şeyden önce çıkarma işlemini yapın: makinenin belleğini alın, modelinizin sunacağınız hassasiyetteki ağırlıklarını çıkarın ve geriye ne kaldığına bakın. O kalan, kiraladığınız üründür. Yapılandırıcı, işlettiğimiz her düğümde aynı aritmetiği çalıştırır ve bunun bir ayının ne kadara mal olduğu ayrıca hesaplanır.
Makineyi modele değil, kullanıcılara göre boyutlandırın.
Yapılandırıcı, kiraladığımız her düğümü barındırır, bu sayfayla aynı bellek aritmetiğini çalıştırır ve modeliniz yüklendikten sonra geriye ne kaldığını — herhangi bir şey için ödeme yapmadan önce — gösterir.
Diğer rehberler
- Maliyet · 6 dk
Aylık kiralama ne zaman saatlikten üstün olur
Gerçek rakamlar üzerinden hesaplanan başabaş noktası, saatlik fiyatın makbuza kadar gizlediği üç maliyet ve bir tahmini üçe katlayan boşta kalma tuzağı.
Rehberi okuyun - Maliyet · 9 dk
Kendi barındırmaya karşı token bazlı API
API'ye token başına ödemekle GPU kiralamak arasındaki başabaş noktası, kendi fiyat ve hızımıza göre hesaplandı — ve hesabın dışarıda bıraktığı dört şey.
Rehberi okuyun - Uygulama · 11 dk
Llama 3.3 70B'yi tek düğümde sunmak
Teslim edilen bir makineden OpenAI uyumlu bir uç noktaya — önemli bayraklar ve işlem hacminizi sessizce yarıya indiren iki bayrakla.
Rehberi okuyun