Tüm 6 veri merkezi çalışıyor

Kripto ile ödenir · Kimlik kontrolü yok · 5 dakikanın altında içinde root erişimi

Boyutlandırma rehberi · 10 dakikalık okuma

Bir GPU'nun fiilen kaç kişiye hizmet verebileceği.

Modelinizi barındıran bir makine, kullanıcılarınıza hizmet veren bir makine değildir. Ağırlıklar bir kez ödenen bir geçiş ücretidir; onlardan sonra kalan, insanlara hizmet vermek için sahip olduğunuz bütçenin tamamıdır. Kapasitenizi belirleyen kartın boyutu değil bu kalandır — ve bu kalan, bellekten çok daha hızlı değişir.

Kısa cevap

Kapasite kart değil, kalandır
4-bit'te Llama 3.3 70B, kimseye hizmet vermeden önce 40 GB ayırır. Bundan sonraki her eşzamanlı istek 2.9 GB daha fazlaya mal olur.
Bellek neden iki kez önemlidir
Aynı kartta, 48 GB'den 240 GB'ye geçmek belleği 5.0× kat, koltuk sayısını ise 35× kat artırır. Ağırlıklar zaten ödenmiştir.
Kısa listedeki en kötü alım
NVIDIA L40S, ayda $714 tutarında 2 eşzamanlı istek barındırır — koltuk başına $357.00.
En iyisi daha ucuza mal olur
4 × NVIDIA L4, $564 tutarında 19 barındırır — daha ucuz bir makbuzla, koltuk başına $29.68.

Kısa özet

Bir modelin sığıp sığmadığını söyleyen her rehber, tek bir isteğe ilişkin bir soruyu yanıtlar. Bir ürün, tek bir istek değildir. İki kişi uç noktanızı aynı anda kullandığı anda, makinenin bellekte konuşmanın ikinci bir kopyasına ihtiyacı olur — sonra üçüncüsüne, sonra kırkıncısına — ağırlıkların kendisi ise tam olarak bir kez saklanırken.

Yani kaç kişiye hizmet edebileceğinizi belirleyen sayı, kartın boyutu değildir. Bu, kartın boyutundan modelin çıkarılmasıyla elde edilen değerin, bir konuşmanın maliyetine bölünmesidir. Bu iki terim de herhangi bir şey sipariş etmeden önce bilinir; bu da kapasiteyi, makine öğrenmesinde kâğıt üzerinde hesaplayıp doğru çıkarabileceğiniz nadir şeylerden biri yapar.

Ağırlıklar, bir geçiş ücretidir. Trafiğiniz ne olursa olsun, girişte bir kez ödenir. Kullanıcılarınızla birlikte büyümez ve asla geri dönmez.

Anahtar/değer önbelleği, kiradır. Her eşzamanlı istek için, o istek açık kaldığı sürece ve konuşmanın uzunluğuyla orantılı olarak ödenir.

Kapasite, geriye kalanın kiraya bölünmesiyle bulunur. Bu yüzden belleği iki katı olan bir makine, çoğu zaman iki kat değil on kat daha fazla kişiye hizmet verir.

Ve sığan en ucuz makine neden genellikle en kötü değeri sunar. Sığar, çünkü geriye neredeyse hiçbir şey kalmaz ve geriye kalan tek şey, aslında satın aldığınız kısımdır.

Aşağıdaki her şey, aynı katalogda, 4-bit'te ve 8k bağlamla, yapılandırıcıyla aynı aritmetiği çalıştırır. Bellek formülünün kendisi sizin için yeniyse, bunun kendine ait bir rehberi var — bu sayfa da, birden fazla kişi ortaya çıktığında ona ne olduğunu anlatır.

Ağırlıklardan sonra kalan

Bu sitenin referans modelini alın ve aynı karttan oluşturulan her boyuttaki düğüme yerleştirin. Aynı silikon, kart başına aynı fiyat, her şey aynı — yalnızca bellek miktarı değişir. Son iki sütunun tamamen farklı hızlarda hareket ettiğine dikkat edin.

Aynı karttan oluşturulan her düğümde, Llama 3.3 70B için 4-bit'te ve 8k bağlamda eşzamanlı istek sayısı
Düğüm Bellek Ağırlıklardan sonra kalan Eşzamanlı istekler Aylık
NVIDIA L4 24 GB onu barındırmaz $125
2 × NVIDIA L4 48 GB 8 GB 2 $285
4 × NVIDIA L4 96 GB 56 GB 19 $564
8 × NVIDIA L4 192 GB 152 GB 52 $1,106
10 × NVIDIA L4 240 GB 200 GB 69 $1,371

İlk satır, dersin tamamıdır: ağırlıkları bile barındıramayan bir kart kimseye hizmet vermez, hem de hiç yaklaşmaz. Ondan sonraki satırlar belleği eşit adımlarla, koltukları ise giderek hızlanan adımlarla kazanır — çünkü 40 GB'lik geçiş ücreti ilk satırda ödenir ve bir daha asla ödenmez.

Aritmetik, tek satırda. koltuk = (bellek − ağırlıklar) ÷ istek_başına_önbellek. Llama 3.3 70B için 4-bit'te bu, açık bir konuşma başına 40 GB geçiş ücreti ve 2.9 GB kira demektir. Önce çıkarın, sonra bölün — bunu ters sırayla yapmak, bir makinenin demo için alınıp üretimde açığa çıkmasının yoludur.

Bir kullanıcının fiilen neye mal olduğu

Şimdi aynı modeller, bir alıcının sıralayacağı şekilde sıralanıyor: önce en ucuzu. Son sütun, aylık fiyatın, makinenin aynı anda barındırabileceği kişi sayısına bölünmesiyle bulunur — bir demodan fazlasını inşa ederken iki makineyi dürüstçe karşılaştıran tek sütun budur.

Her sayıyı değiştirdiği için belirtilen bir varsayım: her koltuk sayısı, modelin düğümün tamamına yayılmış tek bir örneği içindir — bunu size veren şey --tensor-parallel-size bayrağıdır. Ağırlıklar bir kez saklanır ve her kart, kalan belleğini aynı konuşma havuzuna katar. Aynı düğümde bunun yerine iki ayrı kopya çalıştırırsanız, geçiş ücretini iki kez ödersiniz ve toplamda daha az koltuğunuz kalır.

Llama 3.3 70B modelini barındıran en ucuz on düğüm ve her birinin eşzamanlı kullanıcı başına maliyeti
Düğüm Bellek Aylık Eşzamanlı istekler Kullanıcı başına
2 × NVIDIA L42 kart · her biri 24 GB 48 GB $285 2 $142.50
NVIDIA RTX A6000Tek kart · 48 GB 48 GB $286 2 $143.00
2 × NVIDIA RTX 40902 kart · her biri 24 GB 48 GB $416 2 $208.00
4 × NVIDIA L44 kart · her biri 24 GB 96 GB $564 19 $29.68
2 × NVIDIA RTX A60002 kart · her biri 48 GB 96 GB $597 19 $31.42
2 × NVIDIA RTX 50902 kart · her biri 32 GB 64 GB $692 8 $86.50
NVIDIA L40STek kart · 48 GB 48 GB $714 2 $357.00
2 × NVIDIA A100 PCIe2 kart · her biri 40 GB 80 GB $802 13 $61.69
4 × NVIDIA RTX 40904 kart · her biri 24 GB 96 GB $814 19 $42.84
NVIDIA A100 PCIeTek kart · 80 GB 80 GB $1,091 13 $83.92

İki renkli hücreyi kendi fiyat sütunlarına karşı okuyun. NVIDIA L40S, ayda $714 tutarındadır ve 2 barındırır; 4 × NVIDIA L4 ise $564 tutarındadır — daha az parayla — ve 19 barındırır. Bu, 0.79× makbuz karşılığında 10× koltuk demektir; pahalı olan ise çoğu kısa listenin tuttuğu makinedir, çünkü modelin tek bir karta sığdığı makine odur.

Bu, tek kartlı makinelere karşı bir argüman değildir. Tek bir kartta sığan bir model bölüştürme, ara bağlantı veya tensor-parallel bayrakları gerektirmez ve tek bir kullanıcıyı, aynı modelin dört karta yayılmış hâlinden daha hızlı yanıtlar. Yükünüz aynı anda tek bir istekse — bir toplu iş, bir iç araç, bir demo — doğru satın alma o makinedir ve kullanıcı başına sütunu sizi ilgilendirmez. Bu sütun, ancak insanlar aynı anda gelmeye başladığında önem kazanır ve o andan itibaren muazzam ölçüde önem kazanır.

Yalnızca ilk on satırda değil, kataloğun tamamında bu model için koltuk başına en iyi fiyatı veren makine 8 × NVIDIA RTX A6000: ayda $2,239 tutarında, 119 eşzamanlı istek, her biri $18.82. Bu, yukarıdaki kısa listedeki her şeyden çok daha büyük bir makbuzdur ve yine de bir kullanıcıyı oturtmanın hâlâ en ucuz yoludur — bir ürünü mü yoksa bir prototipi mi boyutlandırdığınıza karar veren cümle de budur.

Bağlam uzunluğu, diğer çarpandır

Yukarıdakilerin tümü 8k bağlam varsaydı. Bu varsayım, makine seçiminden daha fazla iş görüyor. Önbellek, kullanıcı başına olduğu kadar token başına da ödenir; bu yüzden aynı düğüm, bir konuşmanın ne kadar uzamasına izin verdiğinize bağlı olarak tamamen farklı sayıda kişiyi oturtur.

Tek bir makine, dört model, dört bağlam uzunluğu. Düğüm 8 × NVIDIA L4 — ayda $1,106 tutarında, dört modelin tümünü aynı anda barındıran kataloğumuzdaki en ucuz seçenek; böylece aşağıdaki her sayı aynı belleğe göre ölçülür.

4-bit'te, model ve bağlam uzunluğuna göre, tek bir düğümdeki eşzamanlı istek sayısı
Model Token başına önbellek 4k 8k 32k 128k
Llama 3.1 8B4 GB ağırlık 128 KiB 325 162 40 10
Qwen 3 32B16 GB ağırlık 256 KiB 150 75 18 4
Llama 3.3 70B35 GB ağırlık 320 KiB 105 52 13 3
Qwen 3 235B-A22B (MoE)118 GB ağırlık 188 KiB 67 33 8 2

Değişmeyen tek bir makinede Llama 3.3 70B, yalnızca komut satırında ayarladığınız bir sayı yüzünden 105 eşzamanlı kullanıcıdan 3 eşzamanlı kullanıcıya çıkar — 35× kat bir artış. Donanımla ilgili hiçbir şey yerinden oynamadı.

Buradan iki sonuç çıkar. Birincisi, okumanız gereken bağlam sütununun, model kartının reklamını yaptığı değil, fiilen sunduğunuz sütun olduğudur — 128k'yi destekleyen bir model, onu ayırmanızı zorunlu kılmaz. İkincisi, token başına önbelleğin, benzer boyuttaki modeller arasında bile büyük ölçüde değiştiğidir; çünkü bunu belirleyen parametre sayısı değil, dikkat tasarımıdır. O tablodaki en büyük modellerin bazıları en küçük önbelleklere sahiptir — bu da bu alandaki en sezgiye aykırı gerçektir.

Kapasiteyi geri kazanmanın dört yolu

Ne kadar az maliyetle ne kadar çok kazandırdıklarına göre azalan sırayla. İlki neredeyse ücretsizdir ve neredeyse her zaman değerlendirilmeden bırakılır.

Beyan edilen bağlamı sınırlayınÜcretsiz, ve en büyük kazançSunum yığınları, önbelleği kullandığınız uzunluk için değil, beyan ettiğiniz azami uzunluk için ayırır. 128k beyan edip 8k sunmak, ihtiyacınız olan belleğin on altı katını çöpe atmak demektir — ve o bellek, koltuk kapasitenizin tamamıydı. İlk günden itibaren --max-model-len bayrağını gerçek tavanınıza ayarlayın.
Önbelleği 8-bit'e nicemleyinKoltuk sayısını kabaca ikiye katlarAğırlıkları 4-bit'e nicemlemek, önbelleğe hiçbir şey yapmaz: siz istemediğiniz sürece her yaygın yığında 16 bit olarak kalır. İstemek tek bir bayraktır, kalite maliyeti genellikle sohbet iş yüklerinde görünmezdir ve aşağıdaki tablo bunun karşılığında ne verdiğini gösterir.
Ağırlıkları daha da nicemleyinBir kez yardımcı olur, sonra dururAğırlıkları yarıya indirmek, farkı doğrudan önbelleğe aktarır; böylece kalabalık bir makinede koltuk satın almış olursunuz. Ama bu, sabit bir geçiş ücretine karşı bir seferlik bir kazançtır ve kaliteye mal olur — hangi formatın ne kadara mal olduğu ise kendi başına bir karardır.
Kartı değil, kalanı kiralayınYapısal çözümYukarıdaki kaldıraçların her biri marjinal düzeyde işe yarar. Belleği ağırlıklarınızı geniş bir marjla aşan bir düğüme geçmek ise problemin şeklini değiştirir; büyüdükçe kazandırmaya devam eden, dördü arasındaki tek seçenektir.
8k bağlamda, aynı düğümde 16-bit önbellekle ve 8-bit önbellekle eşzamanlı istek sayısı
Model 16-bit önbellek 8-bit önbellek Kazanılan koltuklar
Llama 3.1 8B 162 325 +163
Qwen 3 32B 75 150 +75
Llama 3.3 70B 52 105 +53
Qwen 3 235B-A22B (MoE) 33 67 +34

Aynı düğüm, aynı ağırlıklar, aynı para. Tek değişen, önbelleğin hangi hassasiyette saklandığıdır — ve bu, bir ekibe hizmet veren bir makineyle bir ürüne hizmet veren bir makine arasındaki farktır.

Koltuk, hizmetle aynı şey değildir

Yukarıdaki sayılara göre herhangi bir şeyi boyutlandırmadan önce bir düzeltme — ve bu sayfayı dürüst tutan düzeltme de budur. Buradaki her şey, makinenin kaç konuşmayı açık tutabildiğini sayar. Bunların hepsinin hızla yanıtlandığını garanti etmez.

Bellek ve bant genişliği, iki farklı tavandır. 8 × NVIDIA L4 üzerinde Llama 3.3 70B, 52 eşzamanlı konuşma için yer açar; oysa o makinede tek başına bir kullanıcı saniyede yaklaşık 17 token görür. Bütün 52 koltuğu doldurmak, her birine saniyede 17 token vermez — üretim aynı bellek bant genişliğini paylaşır, bu yüzden toplam değer batching ile yükselirken kullanıcı başına hız düşer. Bant genişliği tavanına, bellek tavanından çok önce ulaşılır.

Koltuk sayısını hedef değil, tavan olarak kullanın. Son koltuğuna kadar dolu bir makine, herkesin beklediği bir makinedir. Koltuk sayısı, hangi donanımın eşzamanlılığınızı kaldırabildiğini söyler — bunu kaldıramayan makineleri eler, ki kısa listenin çoğu budur — ardından kullanıcı başına gerçekten istediğiniz hızı ölçersiniz ve tavandan geri çekilirsiniz. Tavana göre boyutlandırmak, önbelleği tamamen göz ardı etmekten hemen sonra, yanlış makineyi satın almanın en yaygın ikinci yoludur.

İyi haber şu ki iki tavan birlikte hareket eder: ağırlıklardan sonra geriye büyük miktarda bellek kalan makineler, az sayıdaki istisna dışında, daha fazla bant genişliğine sahip makinelerdir de. Boşluğa göre seçim yapmak, nadiren hızdan ödün verdirir. Sonunda elinizde kalan makinede sunum yığınını kurmak ayrı bir rehberin konusudur ve bu sayılar, o rehberin ele aldığı bayraklarda karşılığını bulur.

Kendi kullanıcı sayınıza göre seçim yapmak

Sırayla. Yükünüzü tanımlayan ilk satırda durun.

  1. Aynı anda tek bir istek. Toplu işler, bir iç araç, tek bir geliştirici. Modeli tek bir kartta barındıran en ucuz makineyi satın alın ve okumayı bırakın — bu sayfadaki her sütun, sizde olmayan bir soruyu yanıtlıyor.
  2. Ara sıra, bir avuç insan. Bir ekip aracı, erken aşamadaki bir ürün. Kullanıcı sayınızı değil, zirve eşzamanlı istek sayınızı hesaplayın: yüz kayıtlı kullanıcı, nadiren bir avuç eşzamanlı istekten fazlasına karşılık gelir. Ardından koltuk sayısı bu zirvenin rahatça üzerinde olan en ucuz makineyi seçin.
  3. Gerçek trafiğe sahip gerçek bir ürün. Kataloğu fiyata göre değil, koltuk başına fiyata göre sıralayın; bağlamınızı fiilen sunduğunuz seviyeyle sınırlayın, önbelleği 8-bit'e düşürün ve kazananın, aylık fiyatına bakarak kısa listeye almayacağınız bir makine olmasını bekleyin.
  4. Uzun belgeler veya uzun konuşmalar. Önce bağlam tablosunu, sonra makine tablosunu okuyun. 32k ve üzerinde önbellek o kadar baskın hâle gelir ki, model seçimi arkasındaki dikkat tasarımından daha az önemli olur.
  5. Dalgalı, öngörülemeyen trafik. Başarısız olamayacağınız zirveye göre boyutlandırın, çünkü önbellek tükendiğinde ödünç alınamaz — konuşmasını koyacak yeri olmayan bir istek kuyrukta bekler. Zirve nadir ve çok büyükse, taşma için token başına ücretlendirilen bir API, ayda iki kez yaşanan bir dalgalanma için boyutlandırılmış bir makineden daha ucuzdur.

Hangi satırda durduysanız durun, başka her şeyden önce çıkarma işlemini yapın: makinenin belleğini alın, modelinizin sunacağınız hassasiyetteki ağırlıklarını çıkarın ve geriye ne kaldığına bakın. O kalan, kiraladığınız üründür. Yapılandırıcı, işlettiğimiz her düğümde aynı aritmetiği çalıştırır ve bunun bir ayının ne kadara mal olduğu ayrıca hesaplanır.

Makineyi modele değil, kullanıcılara göre boyutlandırın.

Yapılandırıcı, kiraladığımız her düğümü barındırır, bu sayfayla aynı bellek aritmetiğini çalıştırır ve modeliniz yüklendikten sonra geriye ne kaldığını — herhangi bir şey için ödeme yapmadan önce — gösterir.

Giriş Yapın

Konsol, makbuzlar ve bant dışı erişim.

Henüz hesabınız yok mu?

Ayrı bir kayıt işlemi yoktur. Hesabınız, ilk siparişinizi verirken oluşturulur — e-postayı ve şifreyi ödeme adımında seçersiniz, ve makine hazır olduğunda konsol da açık olur.

Bir sunucu yapılandırın

Language