Boyutlandırma rehberi · 10 dakikalık okuma

# Bir GPU'nun fiilen kaç kişiye hizmet verebileceği.

Modelinizi barındıran bir makine, kullanıcılarınıza hizmet veren bir makine değildir. Ağırlıklar bir kez ödenen bir geçiş ücretidir; onlardan sonra kalan, insanlara hizmet vermek için sahip olduğunuz bütçenin tamamıdır. Kapasitenizi belirleyen kartın boyutu değil bu kalandır — ve bu kalan, bellekten çok daha hızlı değişir.

Kısa cevap

- **Kapasite kart değil, kalandır:** 4-bit'te **Llama 3.3 70B**, kimseye hizmet vermeden önce **40 GB** ayırır. Bundan sonraki her eşzamanlı istek **2.9 GB** daha fazlaya mal olur.
- **Bellek neden iki kez önemlidir:** Aynı kartta, 48 GB'den 240 GB'ye geçmek belleği 5.0× kat, koltuk sayısını ise **35×** kat artırır. Ağırlıklar zaten ödenmiştir.
- **Kısa listedeki en kötü alım:** [NVIDIA L40S](https://gpuserver.io/tr/gpu/l40s), ayda **$714** tutarında 2 eşzamanlı istek barındırır — koltuk başına **$357.00**.
- **En iyisi daha ucuza mal olur:** [4 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4), **$564** tutarında 19 barındırır — daha ucuz bir makbuzla, koltuk başına **$29.68**.

## Kısa özet

Bir modelin *sığıp sığmadığını* söyleyen her rehber, tek bir isteğe ilişkin bir soruyu yanıtlar. Bir ürün, tek bir istek değildir. İki kişi uç noktanızı aynı anda kullandığı anda, makinenin bellekte konuşmanın ikinci bir kopyasına ihtiyacı olur — sonra üçüncüsüne, sonra kırkıncısına — ağırlıkların kendisi ise tam olarak bir kez saklanırken.

Yani kaç kişiye hizmet edebileceğinizi belirleyen sayı, kartın boyutu değildir. Bu, kartın boyutundan modelin *çıkarılmasıyla* elde edilen değerin, bir konuşmanın maliyetine bölünmesidir. Bu iki terim de herhangi bir şey sipariş etmeden önce bilinir; bu da kapasiteyi, makine öğrenmesinde kâğıt üzerinde hesaplayıp doğru çıkarabileceğiniz nadir şeylerden biri yapar.

**Ağırlıklar, bir geçiş ücretidir.** Trafiğiniz ne olursa olsun, girişte bir kez ödenir. Kullanıcılarınızla birlikte büyümez ve asla geri dönmez.

**Anahtar/değer önbelleği, kiradır.** Her eşzamanlı istek için, o istek açık kaldığı sürece ve konuşmanın uzunluğuyla orantılı olarak ödenir.

**Kapasite, geriye kalanın kiraya bölünmesiyle bulunur.** Bu yüzden belleği iki katı olan bir makine, çoğu zaman iki kat değil on kat daha fazla kişiye hizmet verir.

**Ve sığan en ucuz makine neden genellikle en kötü değeri sunar.** Sığar, çünkü geriye neredeyse hiçbir şey kalmaz ve geriye kalan tek şey, aslında satın aldığınız kısımdır.

Aşağıdaki her şey, aynı katalogda, 4-bit'te ve 8k bağlamla, [yapılandırıcıyla](https://gpuserver.io/tr/configure) aynı aritmetiği çalıştırır. Bellek formülünün kendisi sizin için yeniyse, [bunun kendine ait bir rehberi var](https://gpuserver.io/tr/guides/vram-sizing) — bu sayfa da, birden fazla kişi ortaya çıktığında ona ne olduğunu anlatır.

## Ağırlıklardan sonra kalan

Bu sitenin referans modelini alın ve aynı karttan oluşturulan her boyuttaki düğüme yerleştirin. Aynı silikon, kart başına aynı fiyat, her şey aynı — yalnızca bellek miktarı değişir. Son iki sütunun tamamen farklı hızlarda hareket ettiğine dikkat edin.

**Aynı karttan oluşturulan her düğümde, Llama 3.3 70B için 4-bit'te ve 8k bağlamda eşzamanlı istek sayısı**

| Düğüm | Bellek | Ağırlıklardan sonra kalan | Eşzamanlı istekler | Aylık |
|---|---|---|---|---|
| [NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) | 24 GB | — | onu barındırmaz | $125 |
| [2 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) | 48 GB | 8 GB | 2 | $285 |
| [4 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) | 96 GB | 56 GB | 19 | $564 |
| [8 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) | 192 GB | 152 GB | 52 | $1,106 |
| [10 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) | 240 GB | 200 GB | 69 | $1,371 |

İlk satır, dersin tamamıdır: ağırlıkları bile barındıramayan bir kart kimseye hizmet vermez, hem de hiç yaklaşmaz. Ondan sonraki satırlar belleği eşit adımlarla, koltukları ise giderek hızlanan adımlarla kazanır — çünkü 40 GB'lik geçiş ücreti ilk satırda ödenir ve bir daha asla ödenmez.

**Aritmetik, tek satırda.** `koltuk = (bellek − ağırlıklar) ÷ istek_başına_önbellek`. Llama 3.3 70B için 4-bit'te bu, açık bir konuşma başına 40 GB geçiş ücreti ve 2.9 GB kira demektir. Önce çıkarın, sonra bölün — bunu ters sırayla yapmak, bir makinenin demo için alınıp üretimde açığa çıkmasının yoludur.

## Bir kullanıcının fiilen neye mal olduğu

Şimdi aynı modeller, bir alıcının sıralayacağı şekilde sıralanıyor: önce en ucuzu. Son sütun, aylık fiyatın, makinenin aynı anda barındırabileceği kişi sayısına bölünmesiyle bulunur — bir demodan fazlasını inşa ederken iki makineyi dürüstçe karşılaştıran tek sütun budur.

Her sayıyı değiştirdiği için belirtilen bir varsayım: her koltuk sayısı, modelin düğümün tamamına yayılmış *tek* bir örneği içindir — bunu size veren şey `--tensor-parallel-size` bayrağıdır. Ağırlıklar bir kez saklanır ve her kart, kalan belleğini aynı konuşma havuzuna katar. Aynı düğümde bunun yerine iki ayrı kopya çalıştırırsanız, geçiş ücretini iki kez ödersiniz ve toplamda daha az koltuğunuz kalır.

**Llama 3.3 70B modelini barındıran en ucuz on düğüm ve her birinin eşzamanlı kullanıcı başına maliyeti**

| Düğüm | Bellek | Aylık | Eşzamanlı istekler | Kullanıcı başına |
|---|---|---|---|---|
| [2 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) 2 kart · her biri 24 GB | 48 GB | $285 | 2 | $142.50 |
| [NVIDIA RTX A6000](https://gpuserver.io/tr/gpu/rtx-a6000) Tek kart · 48 GB | 48 GB | $286 | 2 | $143.00 |
| [2 × NVIDIA RTX 4090](https://gpuserver.io/tr/gpu/rtx-4090) 2 kart · her biri 24 GB | 48 GB | $416 | 2 | $208.00 |
| [4 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) 4 kart · her biri 24 GB | 96 GB | $564 | 19 | $29.68 |
| [2 × NVIDIA RTX A6000](https://gpuserver.io/tr/gpu/rtx-a6000) 2 kart · her biri 48 GB | 96 GB | $597 | 19 | $31.42 |
| [2 × NVIDIA RTX 5090](https://gpuserver.io/tr/gpu/rtx-5090) 2 kart · her biri 32 GB | 64 GB | $692 | 8 | $86.50 |
| [NVIDIA L40S](https://gpuserver.io/tr/gpu/l40s) Tek kart · 48 GB | 48 GB | $714 | 2 | $357.00 |
| [2 × NVIDIA A100 PCIe](https://gpuserver.io/tr/gpu/a100-40gb) 2 kart · her biri 40 GB | 80 GB | $802 | 13 | $61.69 |
| [4 × NVIDIA RTX 4090](https://gpuserver.io/tr/gpu/rtx-4090) 4 kart · her biri 24 GB | 96 GB | $814 | 19 | $42.84 |
| [NVIDIA A100 PCIe](https://gpuserver.io/tr/gpu/a100-80gb) Tek kart · 80 GB | 80 GB | $1,091 | 13 | $83.92 |

İki renkli hücreyi kendi fiyat sütunlarına karşı okuyun. NVIDIA L40S, ayda $714 tutarındadır ve 2 barındırır; 4 × NVIDIA L4 ise $564 tutarındadır — *daha az parayla* — ve 19 barındırır. Bu, 0.79× makbuz karşılığında 10× koltuk demektir; pahalı olan ise çoğu kısa listenin tuttuğu makinedir, çünkü modelin tek bir karta sığdığı makine odur.

**Bu, tek kartlı makinelere karşı bir argüman değildir.** Tek bir kartta sığan bir model bölüştürme, ara bağlantı veya tensor-parallel bayrakları gerektirmez ve tek bir kullanıcıyı, aynı modelin dört karta yayılmış hâlinden daha hızlı yanıtlar. Yükünüz aynı anda tek bir istekse — bir toplu iş, bir iç araç, bir demo — doğru satın alma o makinedir ve kullanıcı başına sütunu sizi ilgilendirmez. Bu sütun, ancak insanlar aynı anda gelmeye başladığında önem kazanır ve o andan itibaren muazzam ölçüde önem kazanır.

Yalnızca ilk on satırda değil, kataloğun tamamında bu model için koltuk başına en iyi fiyatı veren makine [8 × NVIDIA RTX A6000](https://gpuserver.io/tr/gpu/rtx-a6000): ayda $2,239 tutarında, 119 eşzamanlı istek, her biri $18.82. Bu, yukarıdaki kısa listedeki her şeyden çok daha büyük bir makbuzdur ve yine de bir kullanıcıyı oturtmanın hâlâ en ucuz yoludur — bir ürünü mü yoksa bir prototipi mi boyutlandırdığınıza karar veren cümle de budur.

## Bağlam uzunluğu, diğer çarpandır

Yukarıdakilerin tümü 8k bağlam varsaydı. Bu varsayım, makine seçiminden daha fazla iş görüyor. Önbellek, kullanıcı başına olduğu kadar token başına da ödenir; bu yüzden aynı düğüm, bir konuşmanın ne kadar uzamasına izin verdiğinize bağlı olarak tamamen farklı sayıda kişiyi oturtur.

Tek bir makine, dört model, dört bağlam uzunluğu. Düğüm [8 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) — ayda $1,106 tutarında, dört modelin tümünü aynı anda barındıran kataloğumuzdaki en ucuz seçenek; böylece aşağıdaki her sayı aynı belleğe göre ölçülür.

**4-bit'te, model ve bağlam uzunluğuna göre, tek bir düğümdeki eşzamanlı istek sayısı**

| Model | Token başına önbellek | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Llama 3.1 8B 4 GB ağırlık | 128 KiB | 325 | 162 | 40 | 10 |
| Qwen 3 32B 16 GB ağırlık | 256 KiB | 150 | 75 | 18 | 4 |
| Llama 3.3 70B 35 GB ağırlık | 320 KiB | 105 | 52 | 13 | 3 |
| Qwen 3 235B-A22B (MoE) 118 GB ağırlık | 188 KiB | 67 | 33 | 8 | 2 |

Değişmeyen tek bir makinede Llama 3.3 70B, yalnızca komut satırında ayarladığınız bir sayı yüzünden 105 eşzamanlı kullanıcıdan 3 eşzamanlı kullanıcıya çıkar — 35× kat bir artış. Donanımla ilgili hiçbir şey yerinden oynamadı.

Buradan iki sonuç çıkar. Birincisi, okumanız gereken bağlam sütununun, model kartının reklamını yaptığı değil, fiilen sunduğunuz sütun olduğudur — 128k'yi *destekleyen* bir model, onu ayırmanızı zorunlu kılmaz. İkincisi, token başına önbelleğin, benzer boyuttaki modeller arasında bile büyük ölçüde değiştiğidir; çünkü bunu belirleyen parametre sayısı değil, dikkat tasarımıdır. [O tablodaki en büyük modellerin bazıları en küçük önbelleklere sahiptir](https://gpuserver.io/tr/guides/mixture-of-experts) — bu da bu alandaki en sezgiye aykırı gerçektir.

## Kapasiteyi geri kazanmanın dört yolu

Ne kadar az maliyetle ne kadar çok kazandırdıklarına göre azalan sırayla. İlki neredeyse ücretsizdir ve neredeyse her zaman değerlendirilmeden bırakılır.

Beyan edilen bağlamı sınırlayın Ücretsiz, ve en büyük kazanç Sunum yığınları, önbelleği kullandığınız uzunluk için değil, beyan ettiğiniz azami uzunluk için ayırır. 128k beyan edip 8k sunmak, ihtiyacınız olan belleğin on altı katını çöpe atmak demektir — ve o bellek, koltuk kapasitenizin tamamıydı. İlk günden itibaren `--max-model-len` bayrağını gerçek tavanınıza ayarlayın.

Önbelleği 8-bit'e nicemleyin Koltuk sayısını kabaca ikiye katlar *Ağırlıkları* 4-bit'e nicemlemek, önbelleğe hiçbir şey yapmaz: siz istemediğiniz sürece her yaygın yığında 16 bit olarak kalır. İstemek tek bir bayraktır, kalite maliyeti genellikle sohbet iş yüklerinde görünmezdir ve aşağıdaki tablo bunun karşılığında ne verdiğini gösterir.

Ağırlıkları daha da nicemleyin Bir kez yardımcı olur, sonra durur Ağırlıkları yarıya indirmek, farkı doğrudan önbelleğe aktarır; böylece kalabalık bir makinede koltuk satın almış olursunuz. Ama bu, sabit bir geçiş ücretine karşı bir seferlik bir kazançtır ve kaliteye mal olur — [hangi formatın ne kadara mal olduğu](https://gpuserver.io/tr/guides/awq-vs-gptq-vs-fp8) ise kendi başına bir karardır.

Kartı değil, kalanı kiralayın Yapısal çözüm Yukarıdaki kaldıraçların her biri marjinal düzeyde işe yarar. Belleği ağırlıklarınızı geniş bir marjla aşan bir düğüme geçmek ise problemin şeklini değiştirir; büyüdükçe kazandırmaya devam eden, dördü arasındaki tek seçenektir.

**8k bağlamda, aynı düğümde 16-bit önbellekle ve 8-bit önbellekle eşzamanlı istek sayısı**

| Model | 16-bit önbellek | 8-bit önbellek | Kazanılan koltuklar |
|---|---|---|---|
| Llama 3.1 8B | 162 | 325 | +163 |
| Qwen 3 32B | 75 | 150 | +75 |
| Llama 3.3 70B | 52 | 105 | +53 |
| Qwen 3 235B-A22B (MoE) | 33 | 67 | +34 |

Aynı düğüm, aynı ağırlıklar, aynı para. Tek değişen, önbelleğin hangi hassasiyette saklandığıdır — ve bu, bir ekibe hizmet veren bir makineyle bir ürüne hizmet veren bir makine arasındaki farktır.

## Koltuk, hizmetle aynı şey değildir

Yukarıdaki sayılara göre herhangi bir şeyi boyutlandırmadan önce bir düzeltme — ve bu sayfayı dürüst tutan düzeltme de budur. Buradaki her şey, makinenin kaç konuşmayı *açık* tutabildiğini sayar. Bunların hepsinin hızla yanıtlandığını garanti etmez.

Bellek ve bant genişliği, iki farklı tavandır. [8 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) üzerinde Llama 3.3 70B, 52 eşzamanlı konuşma için yer açar; oysa o makinede tek başına bir kullanıcı saniyede yaklaşık 17 token görür. Bütün 52 koltuğu doldurmak, her birine saniyede 17 token vermez — üretim aynı bellek bant genişliğini paylaşır, bu yüzden toplam değer batching ile yükselirken kullanıcı başına hız düşer. Bant genişliği tavanına, bellek tavanından çok önce ulaşılır.

**Koltuk sayısını hedef değil, tavan olarak kullanın.** Son koltuğuna kadar dolu bir makine, herkesin beklediği bir makinedir. Koltuk sayısı, hangi donanımın eşzamanlılığınızı kaldırabildiğini söyler — bunu kaldıramayan makineleri eler, ki kısa listenin çoğu budur — ardından kullanıcı başına gerçekten istediğiniz hızı ölçersiniz ve tavandan geri çekilirsiniz. Tavana göre boyutlandırmak, önbelleği tamamen göz ardı etmekten hemen sonra, yanlış makineyi satın almanın en yaygın ikinci yoludur.

İyi haber şu ki iki tavan birlikte hareket eder: ağırlıklardan sonra geriye büyük miktarda bellek kalan makineler, az sayıdaki istisna dışında, daha fazla bant genişliğine sahip makinelerdir de. Boşluğa göre seçim yapmak, nadiren hızdan ödün verdirir. Sonunda elinizde kalan makinede [sunum yığınını kurmak](https://gpuserver.io/tr/guides/serve-llama-70b) ayrı bir rehberin konusudur ve bu sayılar, o rehberin ele aldığı bayraklarda karşılığını bulur.

## Kendi kullanıcı sayınıza göre seçim yapmak

Sırayla. Yükünüzü tanımlayan ilk satırda durun.

1. **Aynı anda tek bir istek.** Toplu işler, bir iç araç, tek bir geliştirici. Modeli tek bir kartta barındıran en ucuz makineyi satın alın ve okumayı bırakın — bu sayfadaki her sütun, sizde olmayan bir soruyu yanıtlıyor.
2. **Ara sıra, bir avuç insan.** Bir ekip aracı, erken aşamadaki bir ürün. Kullanıcı sayınızı değil, zirve eşzamanlı istek sayınızı hesaplayın: yüz kayıtlı kullanıcı, nadiren bir avuç eşzamanlı istekten fazlasına karşılık gelir. Ardından koltuk sayısı bu zirvenin rahatça üzerinde olan en ucuz makineyi seçin.
3. **Gerçek trafiğe sahip gerçek bir ürün.** Kataloğu fiyata göre değil, koltuk başına fiyata göre sıralayın; bağlamınızı fiilen sunduğunuz seviyeyle sınırlayın, önbelleği 8-bit'e düşürün ve kazananın, aylık fiyatına bakarak kısa listeye almayacağınız bir makine olmasını bekleyin.
4. **Uzun belgeler veya uzun konuşmalar.** Önce bağlam tablosunu, sonra makine tablosunu okuyun. 32k ve üzerinde önbellek o kadar baskın hâle gelir ki, model seçimi arkasındaki dikkat tasarımından daha az önemli olur.
5. **Dalgalı, öngörülemeyen trafik.** Başarısız olamayacağınız zirveye göre boyutlandırın, çünkü önbellek tükendiğinde ödünç alınamaz — konuşmasını koyacak yeri olmayan bir istek kuyrukta bekler. Zirve nadir ve çok büyükse, [taşma için token başına ücretlendirilen bir API](https://gpuserver.io/tr/guides/api-vs-self-hosting), ayda iki kez yaşanan bir dalgalanma için boyutlandırılmış bir makineden daha ucuzdur.

Hangi satırda durduysanız durun, başka her şeyden önce çıkarma işlemini yapın: makinenin belleğini alın, modelinizin sunacağınız hassasiyetteki ağırlıklarını çıkarın ve geriye ne kaldığına bakın. O kalan, kiraladığınız üründür. [Yapılandırıcı](https://gpuserver.io/tr/configure), işlettiğimiz her düğümde aynı aritmetiği çalıştırır ve [bunun bir ayının ne kadara mal olduğu](https://gpuserver.io/tr/guides/monthly-vs-hourly) ayrıca hesaplanır.

## Makineyi modele değil, kullanıcılara göre boyutlandırın.

Yapılandırıcı, kiraladığımız her düğümü barındırır, bu sayfayla aynı bellek aritmetiğini çalıştırır ve modeliniz yüklendikten sonra geriye ne kaldığını — herhangi bir şey için ödeme yapmadan önce — gösterir.

[Yapılandırıcıyı açın](https://gpuserver.io/tr/configure) [Rehberleri okuyun](https://gpuserver.io/tr/guides)

## Diğer rehberler

- [Maliyet · 6 dk Aylık kiralama ne zaman saatlikten üstün olur Gerçek rakamlar üzerinden hesaplanan başabaş noktası, saatlik fiyatın makbuza kadar gizlediği üç maliyet ve bir tahmini üçe katlayan boşta kalma tuzağı. Rehberi okuyun](https://gpuserver.io/tr/guides/monthly-vs-hourly)
- [Maliyet · 9 dk Kendi barındırmaya karşı token bazlı API API'ye token başına ödemekle GPU kiralamak arasındaki başabaş noktası, kendi fiyat ve hızımıza göre hesaplandı — ve hesabın dışarıda bıraktığı dört şey. Rehberi okuyun](https://gpuserver.io/tr/guides/api-vs-self-hosting)
- [Uygulama · 11 dk Llama 3.3 70B'yi tek düğümde sunmak Teslim edilen bir makineden OpenAI uyumlu bir uç noktaya — önemli bayraklar ve işlem hacminizi sessizce yarıya indiren iki bayrakla. Rehberi okuyun](https://gpuserver.io/tr/guides/serve-llama-70b)

---

Kaynak: https://gpuserver.io/tr/guides/concurrent-users/. Bu dosya, web sitesiyle aynı verilerden üretilir; buradaki bir rakam bir sayfadan farklıysa, o sayfa esas alınır ve bu dosya güncel değildir — asıl kaynak https://gpuserver.io/ adresidir.
