Boyutlandırma rehberi · 10 dakikalık okuma

# Bir uzman karışımının gerçek maliyeti.

“235B-A22B” gibi bir isim iki sayı içerir ve neredeyse herkes yanlış olanını okur. Bunlardan biri ne kiralayacağınızı belirler; diğeri ne kadar hızlı yanıt vereceğini belirler. Aralarında on kata varan bir fark olabilir.

Kısa cevap

- **Toplam parametreler makineyi belirler:** 4 bit'te **DeepSeek V3 671B-A37B (MoE)**, 8k bağlamla **386 GB** gerektirir. *Etkin* parametreleri büyüklüğünde yoğun bir model 22 GB gerektirirdi — yani **17.6×** daha az.
- **Etkin parametreler hızı belirler:** Token başına ağırlıkların yalnızca bir kısmı okunur, bu yüzden aynı kütledeki yoğun bir modelden daha hızlı üretim yapar — ama yönlendirme, bu avantajın büyük bir kısmını doğrudan geri alır.
- **Onu barındıran en ucuz düğüm:** Ayda **$7,906** karşılığında [8 × NVIDIA A100 PCIe](https://gpuserver.io/tr/gpu/a100-80gb). Neredeyse hiçbir zaman kiralanacak olan o değildir.
- **Kiralamaya değer olan:** **$11,790** fiyatındaki [4 × NVIDIA B200 SXM6](https://gpuserver.io/tr/gpu/b200) — 1.5× kat para karşılığında 2.8× kat işlem hacmi.

## Kısa özet

Bir uzman karışımı, her katmanın ileri beslemeli kısmını birçok küçük ağa böler ve her tokeni bunlardan yalnızca birkaçı üzerinden gönderir. Yayımlanan isim her iki gerçeği de kaydeder: toplam parametre sayısını ve herhangi bir token için etkin olan sayıyı. *Birincisinin tamamını bellekte tutmanız gerekir, ikincisini ise yalnızca token başına okursunuz.* Bu tek cümle rehberin tamamıdır ve bunu tersten anlamak, bir sipariş öncesinde insanların yaptığını gördüğümüz en pahalı hatadır.

Sonuç, garip bir maliyet biçimine sahip bir modeldir: bir dev gibi kiralanır ve orta boy bir model gibi çalışır. Bunun bir fırsat mı yoksa bir tuzak mı olduğu, tamamen darboğazınızın bu iki sayıdan hangisi olduğuna bağlıdır.

**Makineyi mi boyutlandırıyorsunuz?** Toplamı kullanın. Her uzmanın bellekte hazır bulunması gerekir, çünkü bir sonraki tokenin hangilerine ihtiyaç duyacağını önceden bilemezsiniz. Yönlendirme, çalışma zamanında, token başına karar verilir.

**Hızı mı tahmin ediyorsunuz?** Etkin sayıdan başlayın, ardından büyük bir indirim uygulayın. Üretim yalnızca etkin ağırlıkları okur, zaten bütün mesele de budur — ama yönlendirici, uzman dağıtımı ve kartlar arasındaki trafik bedavaya gelmez ve bunlar bir düğüm genelinde kötü ölçeklenir.

**Uzun bağlam mı sunuyorsunuz, yoksa çok sayıda kullanıcıya mı hizmet veriyorsunuz?** Parametre sayılarına değil, dikkat tasarımına bakın. Bu sayfadaki en büyük modeller, token başına *en küçük* anahtar/değer önbelleğine sahiptir ve belirli bir uzunluğun ötesinde bu, sıralamayı tamamen tersine çevirir.

**Sadece kaliteyi mi istiyorsunuz?** Tek bir karta sığan yoğun bir model, sekiz kart arasında paylaştırılmış bir uzman karışımından işletmesi daha kolay, daha ucuz ve daha hızlıdır. Hiçbir yoğun model ihtiyacınız olan yanıtı vermediğinde bir MoE'ye yönelin, ismi etkileyici göründüğü için değil.

Aşağıdaki aritmetik, [yapılandırıcının](https://gpuserver.io/tr/configure) aynı katalog üzerinde çalıştırdığı aritmetiğin aynısıdır. Bir modelin ne kadar belleğe ihtiyaç duyduğunu genel olarak henüz hesaplamadıysanız, [önce o formül gelir](https://gpuserver.io/tr/guides/vram-sizing) — model bir uzman karışımı olduğunda değişen şey ise bu sayfadır.

## Adın okunması

Dolaşımda üç adlandırma kuralı var ve hepsi aynı sayı çiftini kodluyor; kafa karışıklığının sürmesinin nedeni de bu. Onları okuyabildiğinizde, boyutlandırma sorusu kendiliğinden cevaplanır.

235B-A22B Toplam, sonra etkin Üçünün en açık olanı. 235 milyar parametre bellekte durur; bunlardan 22 milyarı herhangi bir token için okunur. A harfi *active* (etkin) anlamına gelir ve bu, size ne kiralayacağınızı söyleyen sayı **değildir**.

671B-A37B Aynı kural, daha büyük ölçekte Bu boyutta, fark kasıtlı olarak saçma hâle gelir: etkin pay yüzde altının altındadır. İhtiyacınız olan makineyle ilgili hiçbir şey o 37'den çıkmaz.

8×22B Uzmanlar, sonra uzman boyutu Daha eski kural ve en çok yanıltan da bu. 176 milyar parametre anlamına gelmez, çünkü dikkat ve embedding katmanları çoğaltılmak yerine paylaşılır; 22 milyar anlamına da gelmez, çünkü token başına bir değil, iki uzman etkindir.

A22B, A37B Bir ortalama, bir garanti değil Etkin sayı, tipik bir metinde yönlendirmenin maliyetidir. Bu bir tavan değildir: tokenleri birçok uzmana yayılan bir batch, modelin daha büyük bir kısmına dokunur; ölçülen işlem hacminin aritmetiğin altında kalmasının nedenlerinden biri de budur.

**Boyutlandırma kataloğumuzdaki uzman karışımı modelleri, toplam parametrelere karşı etkin parametreler**

| Model | Toplam parametreler | Token başına etkin | Etkin pay |
|---|---|---|---|
| Mixtral 8×22B (MoE) 56 katman | 141 B | 39 B | 28 % |
| Qwen 3 235B-A22B (MoE) 94 katman | 235 B | 22 B | 9 % |
| DeepSeek V3 671B-A37B (MoE) 61 katman | 671 B | 37 B | 6 % |
| Llama 3.3 70B Yoğun, karşılaştırma için | 70 B | 70 B | 100 % |

Hatırlanması gereken sütun, sonuncusudur. Yoğun bir model, sakladığı her şeyi okur; bir uzman karışımı ise bir dilimini okur. Bu modellerle ilgili tuhaf olan her şey — iyisi de kötüsü de — o tek satırdan çıkar.

## Gerçekte kiraladığınız bellek

İşte bütün tuzak tek bir tabloda. Orta sütun, modelin makinede ihtiyaç duyduğu şeydir; ondan sonraki sütun, etkin sayıyı olduğu gibi kabul eden bir okuyucunun bütçeleyeceği şeydir. Son sütun ise bu yanlış okumanın bedelidir.

**4 bit'te, 8k bağlamla gereken VRAM, etkin parametre sayısının ima ettiğine karşı**

| Model | 4 bit'te ağırlıklar | Gereken toplam | Etkin boyutunda olsaydı | Aşım |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 71 GB | 83 GB 8k bağlamında | 24 GB | 3.4× |
| Qwen 3 235B-A22B (MoE) | 118 GB | 137 GB 8k bağlamında | 14 GB | 9.5× |
| DeepSeek V3 671B-A37B (MoE) | 336 GB | 386 GB 8k bağlamında | 22 GB | 17.6× |

Son sütunu bir alışveriş hatası olarak okuyun. Yalnızca etkin sayıya göre boyutlandıran biri, tek bir kart aramaya çıkar ve sonunda koca bir düğüme ihtiyaç duyar — biraz daha büyük bir makineye değil, farklı bir fiyatta, tamamen farklı bir makine kategorisine.

**Hayır, kullanılmayan uzmanları diskte tutamazsınız.** Bu, herkesin aklına gelen ilk fikirdir ve sunum yığınları bunu gerçekten sunar. Sorun şu ki yönlendirme token başına karar verilir: ihtiyaç duyduğunuz uzman kümesi, üretilen her kelimede birkaç kez değişir, bu yüzden bir alt kümeyi barındıran bir kart, zamanının çoğunu hesaplama yapmak yerine ağırlıkları PCIe üzerinden getirip götürmekle geçirir. Sonuç, biraz daha yavaş bir model değil, hızının ancak küçük bir kısmında çalışan bir modeldir. Offloading, bir modeli tutamayan bir makinede *çalıştırmanın* bir yoludur, onu *sunmanın* değil.

## Etkin parametrelerin sağladığı

Üretim, bellek bant genişliğiyle sınırlıdır: her yeni token, kendisine katılan ağırlıkların yeniden okunmasını gerektirir. Bir uzman karışımı yalnızca kendi etkin dilimini okur, bu yüzden hızının tavanı, boyutunun ima ettiğinden çok daha küçük bir sayıyla belirlenir. Vaadin bu kısmı gerçektir ve bu modellerin var olma sebebi de zaten budur.

Aşağıdaki tablo, her modeli *aynı* makineye koyar — ayda $7,906 karşılığında [8 × NVIDIA A100 PCIe](https://gpuserver.io/tr/gpu/a100-80gb), kataloğumuzda hepsini aynı anda barındıran en ucuz düğüm. Farklı makinelerde alınmış işlem hacmi rakamlarını karşılaştırmak, hiçbir şeyi karşılaştırmamaktır.

**Tek düğümde tek akışlı üretim: uzman karışımlarına karşı yoğun modeller**

| Model | Toplam | Token başına okunan | Tahmini token/sn |
|---|---|---|---|
| DeepSeek V3 671B-A37B (MoE) Uzman karışımı · 8 kart arasında paylaştırılmış | 671 B | 18.5 GB | 37 tek akış |
| Llama 3.1 405B Yoğun · 8 kart arasında paylaştırılmış | 405 B | 202.5 GB | 19 tek akış |
| Qwen 3 235B-A22B (MoE) Uzman karışımı · 8 kart arasında paylaştırılmış | 235 B | 11.0 GB | 62 tek akış |
| Mixtral 8×22B (MoE) Uzman karışımı · 8 kart arasında paylaştırılmış | 141 B | 19.5 GB | 35 tek akış |
| Llama 3.3 70B Yoğun · tek kartta | 70 B | 35.0 GB | 25 tek akış |

Karşılaştırmaya değer iki satır, en büyük uzman karışımı ile en büyük yoğun modeldir, çünkü ikisi de düğümün tamamına paylaştırılmıştır. Karışım, çok daha büyük bir model olmasına rağmen hâlâ daha hızlı üretim yapar, çünkü token başına kendisinin yalnızca bir dilimini okur — mimarinin var oluş amacı olan takas budur. *Tek kartta* işaretli satırları farklı okuyun: bu modeller düğümün tek bir kartını kaplar ve diğer yediyi boş bırakır; bu, seçilmeyi bekleyen daha ucuz bir makinedir, daha yavaş bir makine değil.

**Bu rakamlar zaten büyük bir ceza payı taşıyor ve taşımaları da gerekiyor.** Salt etkin parametre aritmetiği, bir uzman karışımını ciddi ölçüde fazla tahmin eder. Bu tahmincinin ilk sürümü tam olarak bunu yapıyordu ve bu sayfadaki en büyük model için yayımlanmış ölçümlere karşı yaklaşık beş kat yanılıyordu. Yönlendirme kendi başına bir geçiş gerektirir, uzmanlar her katmanda kartlar arasında aktivasyon alışverişi yapmak zorundadır ve batch, ortalamanın ima ettiğinden daha fazla uzmana yayılır. Tahminci artık, seçilmek yerine ölçülmüş rakamlara göre kalibre edilmiş, kasıtlı olarak muhafazakâr bir düzeltme uygular — düşük okumasının nedeni de budur, yüksek değil. Buradaki her sayıyı, karşı planlama yapılacak bir hedef değil, makinede aşılması gereken bir taban değer olarak görün.

Aritmetiğin gizlediği ikinci şey, bir uzman karışımını iyi paylaştırmanın daha zor olduğudur. Kartlar arasında paylaştırılmış yoğun bir model, katman başına bir kez senkronize olur; bir karışım ise ayrıca tokenleri seçilen uzmanı barındıran herhangi bir karta yönlendirmek zorundadır, ki bu farklı ve daha az öngörülebilir bir trafik örüntüsüdür. Bu, [ara bağlantının yalnızca makbuzda görünmekle kalmayıp parasını gerçekten hak ettiği](https://gpuserver.io/tr/guides/nvlink-vs-pcie) az sayıdaki iş yükünden biridir.

## Ucuzlayan yarı

Şimdiye kadarki her şey büyük modeller için kötü haberdi. İşte telafisi, üstelik neredeyse hiçbir karşılaştırmanın değinmediği kadar büyük bir telafi: bu sayfadaki en fazla parametreye sahip modeller, token başına *en az* anahtar/değer önbelleğine sahiptir. Önbellek, dikkat tasarımı tarafından belirlenir — katmanlar, anahtar/değer başlıkları, başlık boyutu — ve dikkatin arkasında kaç uzman olduğuyla hiçbir ilgisi yoktur.

**Token başına anahtar/değer önbelleği ve bunun her bağlam uzunluğunda tek bir akışa maliyeti**

| Model | Token başına önbellek | 4k | 8k | 32k | 128k |
|---|---|---|---|---|---|
| Mixtral 8×22B (MoE) 8 KV başlığı | 224 KiB | 0.9 GB | 1.8 GB | 7.0 GB | 28.0 GB |
| Qwen 3 235B-A22B (MoE) 4 KV başlığı | 188 KiB | 0.7 GB | 1.5 GB | 5.9 GB | 23.5 GB |
| DeepSeek V3 671B-A37B (MoE) Latent attention | 70 KiB | 0.3 GB | 0.5 GB | 2.2 GB | 8.8 GB |
| Llama 3.3 70B 8 KV başlığı | 320 KiB | 1.3 GB | 2.5 GB | 10.0 GB | 40.0 GB |
| Llama 3.1 405B 8 KV başlığı | 504 KiB | 2.0 GB | 3.9 GB | 15.8 GB | 63.0 GB |

O sütunlar, *eşzamanlı istek* başınadır. Uç noktayı aynı anda kullanan kişi sayısıyla çarpın; son sütundaki sıralama, makinenizi ağırlıklardan çok daha fazla belirler.

**DeepSeek V3 671B-A37B (MoE), listedeki en küçük önbelleğe sahiptir: token başına 70 KiB.** 320 KiB'lik Llama 3.3 70B karşısında bu, daha büyük model yönünde **4.6×** kat bir farktır. Anahtarları ve değerleri her başlık için ayrı ayrı saklamak yerine küçük, paylaşılan bir gizil vektöre izdüşürerek önbelleği sıkıştırır. Yani yüklemesi en pahalıya mal olan model, meşgul tutması en ucuza mal olan modeldir — uzun bağlamda kullanılabilir kalmasının nedeni budur ve bir avuçtan fazla kişiye hizmet verir vermez aritmetiğin tersine dönmesinin de nedeni budur.

Pratikteki karşılığı şudur: ağırlıklar sabit bir giriş ücretidir, önbellek ise işletme maliyetidir. Bir uzman karışımı, muazzam bir giriş ücreti alır ve ardından kullanıcı başına küçük bir işletme maliyeti uygular. Benzer yetenekteki yoğun bir model ise bunun tam tersidir. İkisinden hangisinin sizin için daha ucuz olduğuna, model kartındaki parametre sayısı değil, eşzamanlılık ve bağlam uzunluğu karar verir.

## Bunları hangi makineler barındırır

4 bit'te, referans bağlamla ve her modeli barındıran kataloğumuzdaki en ucuz düğüm alınarak — ister tek bir kartta olsun, ister düğüm genelinde paylaştırılmış olsun. Bunlar giriş biletleridir, öneri değildir; bir sonraki bölüm nedenini açıklar.

**Her uzman karışımı modelini barındıran, kiraladığımız en ucuz yapılandırma**

| Model | Gereken | Onu barındıran en ucuz düğüm | Aylık | Tokens/s |
|---|---|---|---|---|
| Mixtral 8×22B (MoE) | 83 GB | [4 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) Toplam 96 GB · kart başına 24 GB | $564 | 4 |
| Qwen 3 235B-A22B (MoE) | 137 GB | [8 × NVIDIA L4](https://gpuserver.io/tr/gpu/nvidia-l4) Toplam 192 GB · kart başına 24 GB | $1,106 | 10 |
| DeepSeek V3 671B-A37B (MoE) | 386 GB | [8 × NVIDIA A100 PCIe](https://gpuserver.io/tr/gpu/a100-80gb) Toplam 640 GB · kart başına 80 GB | $7,906 | 37 |

Bunların her biri çoklu kartlı bir düğümdür ve bu sayfanın dürüst özeti de budur: etkin sayı onları ne kadar küçük gösterirse göstersin, kataloğumuzda hiçbiri tek bir kartta barındırılamaz. Kalan yapılandırmalar [tam katalogda](https://gpuserver.io/tr/#catalog) yer alır ve [yapılandırıcı](https://gpuserver.io/tr/configure) aynı kontrolü kendi modeliniz ve bağlamınız için de çalıştırır.

## En ucuz düğüm, yanlış olandır

Sığmak bir eşiktir, bir hedef değil. Bir model düğüm genelinde paylaştırıldığında, işlem hacmi, paylaştırıldığı kartların bellek bant genişliğine bağlıdır — ve dolar başına bant genişliği, hepsi aynı bellek eşiğini geçen yapılandırmalar arasında bile iki kattan fazla değişir. İşte DeepSeek V3 671B-A37B (MoE), onu barındıran her düğümde, fiyata göre sıralanmış ve önemli olan tek sütun sağda.

**DeepSeek V3 671B-A37B (MoE) modelini barındıran her düğüm, saniyede bir tokenin aylık fiyatıyla birlikte**

| Yapılandırma | VRAM | Aylık | Tokens/s | token/s başına $ |
|---|---|---|---|---|
| [8 × NVIDIA A100 PCIe](https://gpuserver.io/tr/gpu/a100-80gb) GN-A10080×8 | 640 GB | $7,906 | 37 | $213.68 |
| [8 × NVIDIA A100 SXM4](https://gpuserver.io/tr/gpu/a100-sxm4) GN-A100SXM×8 | 640 GB | $8,355 | 39 | $214.23 |
| [4 × NVIDIA H200 SXM5](https://gpuserver.io/tr/gpu/h200) GN-H200×4 | 564 GB | $8,405 | 62 | $135.56 |
| [8 × NVIDIA H100 PCIe](https://gpuserver.io/tr/gpu/h100-pcie) GN-H100PCIE×8 | 640 GB | $10,568 | 38 | $278.11 |
| [8 × NVIDIA H100 SXM5](https://gpuserver.io/tr/gpu/h100-sxm5) GN-H100SXM×8 | 640 GB | $11,509 | 64 | $179.83 |
| [4 × NVIDIA B200 SXM6](https://gpuserver.io/tr/gpu/b200) GN-B200×4 | 720 GB | $11,790 | 103 | $114.47 |
| [8 × NVIDIA H200 SXM5](https://gpuserver.io/tr/gpu/h200) GN-H200×8 | 1128 GB | $15,945 | 91 | $175.22 |
| [8 × NVIDIA B200 SXM6](https://gpuserver.io/tr/gpu/b200) GN-B200×8 | 1440 GB | $22,351 | 152 | $147.05 |

$7,906 yapılandırmasından $11,790 yapılandırmasına geçmek, makbuzu 1.5× katına, işlem hacmini ise 2.8× katına çıkarır — daha fazla ödersiniz ve her token size daha az mal olur. Bir kataloğu fiyata göre sıralayıp sığan ilk makineyi almak, bir sunum bütçesinin iki kez harcanmasının yoludur.

O sütunla ilgili bir uyarı var; bu, okuyacağınız her fiyat-işlem hacmi tablosu için geçerlidir: bu sütun tek akışlı üretimi esas alır. Sürekli batching altında toplam, her satırda birkaç kat daha yükseğe çıkar ve her satırda aynı kat kadar yükselmez — ağırlıklardan sonra daha fazla boş belleği olan bir düğüm, daha fazla eşzamanlı diziyi barındırır. Sıralama sabittir; mutlak rakamlar ise muhafazakârdır. [Bu toplamın ekonomisi](https://gpuserver.io/tr/guides/api-vs-self-hosting) ayrıca ele alınır.

## Bir uzman karışımının doğru cevap olduğu an

Sırayla. Sizi tanımlayan ilk satırda durun.

1. **Tek bir karta sığan yoğun bir model işi görür.** O zaman onu seçin ve arkanıza bakmayın. Tek kart; paylaştırma yok, ara bağlantı sorunu yok, uzman yönlendirme trafiği yok ve bir düğümün ancak bir kısmına mal olan bir makine anlamına gelir. En gelişmiş açık bir modele ihtiyacı olduğunu düşünen ürünlerin çoğu, aslında iyi bir 32B modele ihtiyaç duyar.
2. **Kaliteye ihtiyacınız var ve bağlamınız uzun.** Bir uzman karışımının gerçekten mevcut en iyi araç olduğu yer burasıdır: ağırlıklar için yalnızca bir kez ödersiniz ve küçük önbellek, makinenin uzun konuşmalara çökmeden hizmet vermeye devam etmesini sağlar. Düğümü ağırlıklara göre boyutlandırın, ardından gerçek bağlamınız için önbellek tablosunu kontrol edin.
3. **Kaliteye ihtiyacınız var ve aynı anda çok sayıda kişiye hizmet veriyorsunuz.** Aynı cevap, aynı sebep; ve bu avantaj eşzamanlılıkla birlikte büyür. Sabit maliyet her akışa yayılırken akış başına maliyet düşük kalır.
4. **Kaliteye ihtiyacınız var ama yalnızca ara sıra.** Bu durumda haftada birkaç saat sıcak tutmak için büyük bir düğüm kiralıyorsunuz demektir; bu da aylık bir sürenin mümkün olan en kötü kullanımıdır. Ya işi tek bir oturuşta çalışacak şekilde toplulaştırın, ya da bunun için barındırılan bir uç nokta kullanın ve kendi makinenizi düzenli yük için saklayın.
5. **Birini fine-tune etmek istiyorsunuz.** Farklı bir sorun, daha büyük bir makine: eğitim her uzmana dokunur ve hepsi için optimizer durumuna ihtiyaç duyar, bu yüzden çıkarımı zaten zorlaştıran bellek ihtiyacı burada karşılanamaz hâle gelir. Yoğun bir model üzerinde [adaptör fine-tuning](https://gpuserver.io/tr/guides/lora-finetune), neredeyse herkes için gerçekçi olan yoldur.

Hangi satırda durduysanız durun, önce kontrol edilecek sayı, sunmayı düşündüğünüz hassasiyette toplam parametre sayısıdır. Bu sayfadaki her şey — hız, önbellek, saniyedeki token başına fiyat — ancak model bellekte hazır bulunduğunda önem kazanır. [Yapılandırıcı](https://gpuserver.io/tr/configure), kiraladığımız her düğüme karşı bu kontrolün tamamını çalıştırır ve yukarıdaki tablolarla aynı yönlendirme düzeltmesini işlem hacmi tahminine uygular. Bellek aritmetiğini önce baştan sona görmek isterseniz, [bunun kendi başına bir rehberi var](https://gpuserver.io/tr/guides/vram-sizing); henüz bir sayı biçimine karar vermediyseniz, [bu seçim, bundan öncedir](https://gpuserver.io/tr/guides/awq-vs-gptq-vs-fp8).

## Kendi uzman karışımı modelinizi gerçek makinelere karşı kontrol edin.

Yapılandırıcı, kiraladığımız her düğümü içerir, bu sayfayla aynı aritmetiği uygular ve herhangi bir ödeme yapmadan önce hangilerinin modelinizi barındırdığını size söyler.

[Yapılandırıcıyı açın](https://gpuserver.io/tr/configure) [Rehberleri okuyun](https://gpuserver.io/tr/guides)

## Diğer rehberler

- [Maliyet · 6 dk Aylık kiralama ne zaman saatlikten üstün olur Gerçek rakamlar üzerinden hesaplanan başabaş noktası, saatlik fiyatın makbuza kadar gizlediği üç maliyet ve bir tahmini üçe katlayan boşta kalma tuzağı. Rehberi okuyun](https://gpuserver.io/tr/guides/monthly-vs-hourly)
- [Maliyet · 9 dk Kendi barındırmaya karşı token bazlı API API'ye token başına ödemekle GPU kiralamak arasındaki başabaş noktası, kendi fiyat ve hızımıza göre hesaplandı — ve hesabın dışarıda bıraktığı dört şey. Rehberi okuyun](https://gpuserver.io/tr/guides/api-vs-self-hosting)
- [Uygulama · 11 dk Llama 3.3 70B'yi tek düğümde sunmak Teslim edilen bir makineden OpenAI uyumlu bir uç noktaya — önemli bayraklar ve işlem hacminizi sessizce yarıya indiren iki bayrakla. Rehberi okuyun](https://gpuserver.io/tr/guides/serve-llama-70b)

---

Kaynak: https://gpuserver.io/tr/guides/mixture-of-experts/. Bu dosya, web sitesiyle aynı verilerden üretilir; buradaki bir rakam bir sayfadan farklıysa, o sayfa esas alınır ve bu dosya güncel değildir — asıl kaynak https://gpuserver.io/ adresidir.
