Bir milyon tokenin her iki yoldan da maliyeti.
Bir API sizi token başına, boştayken ise hiçbir şekilde faturalandırır. Bir makine sizi aylık, token başına ise hiçbir şekilde faturalandırır. Hangisinin daha ucuz olduğu tek bir bölme işlemidir — ve yanıt, ikisinin fiyatından çok, makineyi ne kadar meşgul tuttuğunuza bağlıdır.
Kısa cevap
- Başabaş noktası bir hacimdir
- Bu bir fiyat değil. Ayda $692 karşılığında, makinenin gerçekten üretebildiği kadar token elde edersiniz — asıl soru bu kadar işiniz olup olmadığıdır.
- Sınır bir API karşısında
- En ucuz düğümümüzde toplu işlenmemiş tek bir akış, milyon başına şimdiden $6.42 tutarına mal olur. Bu, herhangi bir şeyi toplu işlemeden önce, en iyi kapalı bir modelin aldığı $15.00 tutarının altındadır.
- Aynı açık ağırlıklar karşısında
- Milyon başına $0.90 rakamını geçmek için tek akış işlem hacminizin kabaca 7.1× katına ihtiyacınız var. Sürekli batchingin var olma amacı budur ve bu sıradan bir durumdur.
- API'nin kazanmaya devam ettiği yer
- Dalgalı trafik, düşük hacim ve kimsenin ağırlıklarını size satmayacağı herhangi bir model.
Kısa özet
Bu ikisinin neredeyse her karşılaştırması tek bir sayıya indirgenerek okunur — “kendi barındırmak on kat daha ucuz”, “devasa boyuta ulaşana kadar API daha ucuz” — ve ikisi de aynı hatadır: token başına faturalandırılmayan bir makine için token başına maliyet vermek. Kiralanan bir GPU'nun tam olarak tek bir fiyatı vardır ve o kıpırdamaz: bu ay bir milyar token üretseniz de hiç üretmeseniz de makbuz aynıdır. Dolayısıyla dürüst soru “burada bir token kaça mal olur” değil, “sabit fiyat sayacı yenmeden önce kaç token üretmem gerekir”dir.
Bu sayı bir bölme işlemidir ve aşağıda kendi fiyatlarımız ve kendi işlem hacmi modelimiz üzerinden hesaplanır — yapılandırıcının kullandığı modelin aynısı. Bundan sonraki her şey, bu hacme ulaşıp ulaşamayacağınızı belirleyen iki şeyle ilgilidir: batching ve makineyi boşta bıraktığınız saatler.
Aritmetik
Dört satır. Üçüncüsü bir beyaz tahtaya yazmaya değer olandır; dördüncüsü insanların atladığıdır ve onu atlamak, sağlam bir tahmini yanlış bir tahmine dönüştüren şeydir.
# 1. What the API charges. Linear in what you use, zero when you stop.
api_cost_per_month = output_tokens_per_month / 1e6 × api_price_per_million
# 2. What the machine charges. A constant. Tokens are free once you own the hours.
machine_cost_per_month = monthly_price
# 3. Set them equal. This is the break-even VOLUME, in output tokens per month.
break_even_tokens = monthly_price / api_price_per_million × 1e6
# 4. And the only question that matters: can the machine produce that many?
# 730 hours is the month we bill, so 2,628,000 seconds of it.
sustained_tokens_per_second = break_even_tokens / 2,628,000
4. satır sürdürülebilir bir hızdır, tepe değer değil. Günde bir saat saniyede 600 tokene ulaşan ve geri kalan yirmi üç saat boşta duran bir makinenin sürdürülebilir hızı 25'tir; makbuz ise ikisinden hangisinden söz ettiğinizi umursamaz.
Tek akışın maliyeti
En kötü durumla başlayın, çünkü varsayım gerektirmeden ifade edilebilecek tek rakam budur: bir seferde bir istek, batching yok, makine bunun dışında boşta. Aşağıdaki her düğüm Llama 3.3 70B modelini 4-bit (AWQ, GPTQ) hassasiyetinde çalıştırır ve işlem hacmi kendi temkinli tahminimizdir — iyi bir günde ölçülen değil, bellek bant genişliğiyle sınırlı olan tahmin.
| Düğüm | Modeli nasıl çalıştırdığı | Aylık | Tek akış | Milyon başına maliyet |
|---|---|---|---|---|
| 2 × NVIDIA RTX 5090 | Tüm 2 kart arasında paylaştırılmış | $692 | 41 tok/s | $6.42 |
| 2 × NVIDIA RTX 4090 | Tüm 2 kart arasında paylaştırılmış | $416 | 23 tok/s | $6.88 |
| 4 × NVIDIA RTX 5090 | Tüm 4 kart arasında paylaştırılmış | $1,345 | 68 tok/s | $7.53 |
| 4 × NVIDIA RTX 4090 | Tüm 4 kart arasında paylaştırılmış | $814 | 38 tok/s | $8.15 |
| 2 × NVIDIA A100 PCIe | Tüm 2 kart arasında paylaştırılmış | $802 | 36 tok/s | $8.48 |
| 8 × NVIDIA RTX 5090 | Tüm 8 kart arasında paylaştırılmış | $2,584 | 100 tok/s | $9.83 |
Bunu bir üst sınır olarak okuyun, asla bir fiyat teklifi olarak değil. Bu, makineye ayda sadece bir seferde bir soru cevaplatıp geri kalan süre boyunca boşta bıraktığınızda bir tokenin maliyetidir — var olan en verimsiz GPU sahipliği biçimi. Gerçek her sunum yığını bundan daha iyisini yapar; sonraki iki bölüm de ne kadar daha iyi olduğuyla ilgilidir.
Katmana göre başabaş noktası
Yukarıdaki en ucuz satırı alın — ayda $692 karşılığında 2 × NVIDIA RTX 5090 — ve API pazarının her katmanını geçmek için ne kadar iş yapması gerektiğini sorun.
| Bunun yerine ödeyeceğiniz | 1M çıktı başına | Başabaş hacim | Sürdürülebilir hız | Tek akışa karşı |
|---|---|---|---|---|
| Sınır tescilli model | $15.00 | 46M | 18 tok/s | Zaten daha ucuz |
| Orta seviye tescilli model | $4.00 | 173M | 66 tok/s | 1.6× |
| Açık ağırlıklı 70B, uzman sağlayıcı Aynı ağırlıklar | $0.90 | 769M | 293 tok/s | 7.1× |
| Açık ağırlıklı 70B, en ucuz sunucusuz Aynı ağırlıklar | $0.40 | 1,730M | 658 tok/s | 16.1× |
Son sütun, yazının tamamıdır. “Zaten daha ucuz” yazdığı yerde, bir $692 makinesindeki tek, batching uygulanmamış bir akış API'yi geride bırakır ve düşünecek bir şey yoktur. Bir kat gösterdiği yerdeyse makine yine de kazanabilir — ama yalnızca onu gerçekten doyurursanız, ki bir sonraki bölüm de bunu anlatır.
Batching, oyunun tamamıdır.
Bir token üretmek, etkin ağırlıkları bellekten bir kez okumayı gerektirir. Yüz farklı istek için yüz token üretmek de onları yalnızca bir kez okumayı gerektirir — aynı ağırlıklar toplu işteki her isteğe hizmet eder. Sürekli batching kullanan bir sunum yığınının aynı donanımda tek bir akışa kıyasla saniyede kat kat fazla token üretmesinin nedeni budur; o tablonun son sütunundaki oranın hiç erişilebilir olmasının nedeni de budur.
Batching size ne kazandırır
Toplam işlem hacmi, ağırlıklar darboğaz olarak kalırken eşzamanlılıkla dik biçimde tırmanır, ardından KV önbelleği kartı doldurdukça düzleşir ve aritmetiğin kendisi sınır haline gelir.
- Tek akışın kat kat üzerindeki değerler iyimser değil, sıradandır.
- Ekstra önbelleklerin kapladığı bellek dışında size hiçbir şeye mal olmaz.
- vLLM bunu varsayılan olarak yapar — onu yapılandırmazsınız, ona veri beslersiniz
Size neye mal olur
İşlem hacmi, eşzamanlılıkla doğrusal olarak artmaz ve istek başına gecikme, toplu iş büyüdükçe kötüleşir. Altmış dört akış, size altmış dört kat token vermez.
- Her akış, yalnız olsaydı görebileceğinden daha yavaş tokenler görür
- İlk tükenen şey KV önbelleğidir — onu bilinçli şekilde boyutlandırın
- Boşta bir toplu iş yuvası hiçbir şey üretmez: sahip olmadığınız eşzamanlılığın hiçbir değeri yoktur
Pratik sonuç: başabaş tablosundaki katı bir kullanıcı sayısı değil, bir işlem hacmi hedefi olarak ele alın. Tek akışın on katı bir hedef, “on kullanıcı” anlamına gelmez; sunucunun, batching uygulanmamış hızının ortalama on katına ulaşması gerektiği anlamına gelir ve bu genellikle on eşzamanlı istekten biraz fazlasını, yüzden ise biraz azını gerektirir. Bir sayıya bağlanmadan önce bunu makinede ölçün — bu tek bir kıyaslamadır ve tartışmayı sonlandırır.
Yine de ödediğiniz boşta geçen saatler
Yukarıdakilerin tümü, yükün ay boyunca eşit dağıldığını varsaydı. Asla öyle olmaz. Aylık kiralanan bir makine Pazar günü saat 04:00 için de ödenir ve o sırada üretmediğiniz tokenler sonraya devretmez. Gerçekte hizmet verdiğiniz haftayı, gerçekte ödediğiniz haftaya bölün:
| Yük geldiğinde | Haftada saat | Gereken tepe hız | Etkin milyon başına maliyet |
|---|---|---|---|
| Continuously, 24/7 | 168 h | Sürdürülebilir hız | $6.42 |
| Günde on iki saat | 84 h | 2.0× | $12.84 |
| Çalışma saatleri, hafta içi | 40 h | 4.2× | $26.97 |
| Günde iki saat | 14 h | 12.0× | $77.07 |
Üçüncü satır, çoğu iç kullanım aracının yaşadığı yerdir ve başabaş noktanızı sessizce dörtten fazla katına çıkarır. Bir self-hosting tahmininin yanlış çıkmasının en yaygın tek nedeni budur — token fiyatı değil, donanım değil, bir çalışma haftasının bütün bir hafta olduğu varsayımı.
Promptunuzun neden neredeyse bedava olduğu
Bir asimetri, makineye sahip olmaktan kesinlikle yana işler ve hiçbir token başına fiyat karşılaştırması bunu göstermez. Bir API sizden girdi tokenleri için ücret alır — genellikle token başına çıktı fiyatının dörtte biri ile üçte biri arasında. Kendi GPU'nuzda girdi tokenleri, tüm promptu paralel olarak işleyen ve bellek bant genişliği yerine aritmetikle sınırlanan prefill geçişinde işlenir. Prefill, üretimden saniyede bir büyüklük mertebesi daha fazla token işler.
Aritmetiğin gözden kaçırdığı
Token başına maliyet tablosunda asla görünmeyen, ama soruyu rakamlar kadar sık belirleyen dört şey.
Her istek bir yere gider. Bir API, isteklerinizi görür ve isteklerinizin içeriği ürününüz, müşterilerinizin belgeleri ya da kodunuzdur. Kiraladığınız bir makinede ağırlıklar ve trafik kutunun içinde kalır — ve zaten en başta kim olduğunuzu hiç sormadık. Bu bir kalem değildir, ama bazı iş yükleri için kararın tamamıdır.
Modeller kullanımdan kaldırılır; sizinki kaldırılmaz. Barındırılan bir model değişebilir, farklı davranışlı yeni bir sürüm alabilir ya da sizin olmayan bir takvimde emekliye ayrılabilir. Kendi NVMe'nizdeki bir ağırlık kümesi bir yıl sonra da aynı şekilde davranır — buna göre değerlendirme yaptıysanız bu çok şey ifade eder.
Sabit bir fiyat, farklı türde bir sayıdır. Sayaçlı faturalandırma, bir hatanın, bir yeniden deneme döngüsünün ya da bir trafik patlamasının sonradan öğrendiğiniz bir makbuza dönüşmesi demektir. Aylık bir süre sizi şaşırtamaz: en kötü ihtimal, makinenin yavaş olmasıdır, pahalı olması değil.
Birinin onu çalıştırması gerekir. Kendi kendine barındırmanın dürüst maliyeti, bir öğleden sonralık kurulumu ve bir sürücünün ya da konteynerin ara sıra bozulduğu bir akşamı da içerir. Dokümantasyonumuz, bunun bir hafta yerine bir öğleden sonra sürmesini sağlamak için var, ama sıfır değildir; aksini iddia etmek bu karşılaştırmaların güvenilirliğini kaybetmesinin nedenidir.
Hangi tarafta olduğunuz
Sırayla okuyun ve sizi tanımlayan ilk maddede durun.
- Sınır bir kapalı modelin kalitesine ihtiyacınız var. O zaman bu yazı size uymaz: o ağırlıkları kimse size kiralamaz. API'yi kullanın ve belirli göreviniz için açık bir model farkı kapattığında tekrar bakın.
- Hacminiz düşük ya da henüz bilmiyorsunuz. API'yi kullanın. Trafiğinizin gerçekte neye benzediğini öğrenmenin en ucuz yolu budur ve sayaç gayet iyi bir ölçüm aracıdır.
- Trafiğiniz sivri uçludur ve bir kuyruğa tahammül eder. API'yi kullanın, ya da bölün: düzenli taban yük için kendi makineniz, yoğunluklar için barındırılan bir uç nokta. Hiçbir şey kararı tek yönlü olmaya zorlamaz.
- Açık ağırlıklı bir model karşısında gerçek, toplu bir hacmi sürdürüyorsunuz. Donanımın kazandığı durum budur, hem de büyük farkla — sayaç işlemeye devam ederken sabit fiyat kıpırdamaz. İnanmadan önce yukarıdaki tabloda kendi sayınızı kontrol edin.
- İstemler hassastır, model değişmemelidir ya da faturanın önceden bilinmesi gerekir. O zaman aritmetik bir formaliteden ibarettir. Modelinizi barındıran makineyi kiralayın ve kimseye kim olduğunuzu söylemeden ödeyin.
Hangi satırda durduysanız durun, kontrol etmeniz gereken sayı, başabaş tablosunda kendi modeliniz ve kendi hacminiz için verilen sayıdır. Yapılandırıcı, kiraladığımız her düğüm için modelinizin tek bir karta sığıp sığmadığını, bölünmesi gerekip gerekmediğini ve işlem hacmi tahmininin ne olduğunu bildirir — bu aritmetiğin ihtiyaç duyduğu her girdi de budur. Aylık kiralama ile saatlik ölçüm arasında hâlâ karar veremediyseniz, bu farklı bir başabaş hesabıdır ve o da ayrıca ele alınmıştır.
Kendi başabaş noktanızı gerçek bir makinede hesaplayın.
Yapılandırıcı, katalogdaki her düğüm için işlem hacmi tahminini ve aylık fiyatı verir — bu rehberin böldüğü iki sayı budur.
Diğer rehberler
- Uygulama · 11 dk
Llama 3.3 70B'yi tek düğümde sunmak
Teslim edilen bir makineden OpenAI uyumlu bir uç noktaya — önemli bayraklar ve işlem hacminizi sessizce yarıya indiren iki bayrakla.
Rehberi okuyun - Uygulama · 10 dk
Bir kartta 70B model fine-tuning
Tek bir 48 GB GPU'da QLoRA: nelerin sığdığı, bir ay için maliyeti ve tam fine-tuningin neden bambaşka bir makine sınıfı gerektirdiği.
Rehberi okuyun - Ödeme · 8 dk
Sunucu için kripto ile ödeme yapmak
Ödeme tıklaması ile root alma arasında gerçekte ne olduğu, hangi coinin seçileceği ve ilk ödemede para kaybettiren dört hata.
Rehberi okuyun