Tüm 6 veri merkezi çalışıyor

Kripto ile ödenir · Kimlik kontrolü yok · 5 dakikanın altında içinde root erişimi

Maliyet rehberi · 9 dakikalık okuma

Bir milyon tokenin her iki yoldan da maliyeti.

Bir API sizi token başına, boştayken ise hiçbir şekilde faturalandırır. Bir makine sizi aylık, token başına ise hiçbir şekilde faturalandırır. Hangisinin daha ucuz olduğu tek bir bölme işlemidir — ve yanıt, ikisinin fiyatından çok, makineyi ne kadar meşgul tuttuğunuza bağlıdır.

Kısa cevap

Başabaş noktası bir hacimdir
Bu bir fiyat değil. Ayda $692 karşılığında, makinenin gerçekten üretebildiği kadar token elde edersiniz — asıl soru bu kadar işiniz olup olmadığıdır.
Sınır bir API karşısında
En ucuz düğümümüzde toplu işlenmemiş tek bir akış, milyon başına şimdiden $6.42 tutarına mal olur. Bu, herhangi bir şeyi toplu işlemeden önce, en iyi kapalı bir modelin aldığı $15.00 tutarının altındadır.
Aynı açık ağırlıklar karşısında
Milyon başına $0.90 rakamını geçmek için tek akış işlem hacminizin kabaca 7.1× katına ihtiyacınız var. Sürekli batchingin var olma amacı budur ve bu sıradan bir durumdur.
API'nin kazanmaya devam ettiği yer
Dalgalı trafik, düşük hacim ve kimsenin ağırlıklarını size satmayacağı herhangi bir model.

Kısa özet

Bu ikisinin neredeyse her karşılaştırması tek bir sayıya indirgenerek okunur — “kendi barındırmak on kat daha ucuz”, “devasa boyuta ulaşana kadar API daha ucuz” — ve ikisi de aynı hatadır: token başına faturalandırılmayan bir makine için token başına maliyet vermek. Kiralanan bir GPU'nun tam olarak tek bir fiyatı vardır ve o kıpırdamaz: bu ay bir milyar token üretseniz de hiç üretmeseniz de makbuz aynıdır. Dolayısıyla dürüst soru “burada bir token kaça mal olur” değil, “sabit fiyat sayacı yenmeden önce kaç token üretmem gerekir”dir.

Bu sayı bir bölme işlemidir ve aşağıda kendi fiyatlarımız ve kendi işlem hacmi modelimiz üzerinden hesaplanır — yapılandırıcının kullandığı modelin aynısı. Bundan sonraki her şey, bu hacme ulaşıp ulaşamayacağınızı belirleyen iki şeyle ilgilidir: batching ve makineyi boşta bıraktığınız saatler.

Aritmetik

Dört satır. Üçüncüsü bir beyaz tahtaya yazmaya değer olandır; dördüncüsü insanların atladığıdır ve onu atlamak, sağlam bir tahmini yanlış bir tahmine dönüştüren şeydir.

Başabaş hacim ve makineden talep ettikleri
# 1. What the API charges. Linear in what you use, zero when you stop.
api_cost_per_month = output_tokens_per_month / 1e6 × api_price_per_million

# 2. What the machine charges. A constant. Tokens are free once you own the hours.
machine_cost_per_month = monthly_price

# 3. Set them equal. This is the break-even VOLUME, in output tokens per month.
break_even_tokens = monthly_price / api_price_per_million × 1e6

# 4. And the only question that matters: can the machine produce that many?
#    730 hours is the month we bill, so 2,628,000 seconds of it.
sustained_tokens_per_second = break_even_tokens / 2,628,000

4. satır sürdürülebilir bir hızdır, tepe değer değil. Günde bir saat saniyede 600 tokene ulaşan ve geri kalan yirmi üç saat boşta duran bir makinenin sürdürülebilir hızı 25'tir; makbuz ise ikisinden hangisinden söz ettiğinizi umursamaz.

Tek akışın maliyeti

En kötü durumla başlayın, çünkü varsayım gerektirmeden ifade edilebilecek tek rakam budur: bir seferde bir istek, batching yok, makine bunun dışında boşta. Aşağıdaki her düğüm Llama 3.3 70B modelini 4-bit (AWQ, GPTQ) hassasiyetinde çalıştırır ve işlem hacmi kendi temkinli tahminimizdir — iyi bir günde ölçülen değil, bellek bant genişliğiyle sınırlı olan tahmin.

Düğüme göre, toplu işlenmemiş tek bir akışta milyon çıktı tokeni başına maliyet
Düğüm Modeli nasıl çalıştırdığı Aylık Tek akış Milyon başına maliyet
2 × NVIDIA RTX 5090Toplam 64 GB · PCIe 5.0 ×16 Tüm 2 kart arasında paylaştırılmış 43.1 GB gerekli, kart başına 32 GB $692 41 tok/s $6.421M çıktı başına
2 × NVIDIA RTX 4090Toplam 48 GB · PCIe 5.0 ×16 Tüm 2 kart arasında paylaştırılmış 43.1 GB gerekli, kart başına 24 GB $416 23 tok/s $6.881M çıktı başına
4 × NVIDIA RTX 5090Toplam 128 GB · PCIe 5.0 ×16 Tüm 4 kart arasında paylaştırılmış 43.1 GB gerekli, kart başına 32 GB $1,345 68 tok/s $7.531M çıktı başına
4 × NVIDIA RTX 4090Toplam 96 GB · PCIe 5.0 ×16 Tüm 4 kart arasında paylaştırılmış 43.1 GB gerekli, kart başına 24 GB $814 38 tok/s $8.151M çıktı başına
2 × NVIDIA A100 PCIeToplam 80 GB · PCIe 5.0 ×16 Tüm 2 kart arasında paylaştırılmış 43.1 GB gerekli, kart başına 40 GB $802 36 tok/s $8.481M çıktı başına
8 × NVIDIA RTX 5090Toplam 256 GB · PCIe 5.0 ×16 Tüm 8 kart arasında paylaştırılmış 43.1 GB gerekli, kart başına 32 GB $2,584 100 tok/s $9.831M çıktı başına

Bunu bir üst sınır olarak okuyun, asla bir fiyat teklifi olarak değil. Bu, makineye ayda sadece bir seferde bir soru cevaplatıp geri kalan süre boyunca boşta bıraktığınızda bir tokenin maliyetidir — var olan en verimsiz GPU sahipliği biçimi. Gerçek her sunum yığını bundan daha iyisini yapar; sonraki iki bölüm de ne kadar daha iyi olduğuyla ilgilidir.

Katmana göre başabaş noktası

Yukarıdaki en ucuz satırı alın — ayda $692 karşılığında 2 × NVIDIA RTX 5090 — ve API pazarının her katmanını geçmek için ne kadar iş yapması gerektiğini sorun.

Başabaş aylık hacim ve bunun gerektirdiği sürekli işlem hacmi
Bunun yerine ödeyeceğiniz 1M çıktı başına Başabaş hacim Sürdürülebilir hız Tek akışa karşı
Sınır tescilli modelŞu anın en iyi kapalı modeli. Kimse size onun ağırlıklarını kiralamaz. $15.00 46Mayda token 18 tok/sgece gündüz Zaten daha ucuz
Orta seviye tescilli modelÇoğu ürünün gerçekte üzerinde çalıştığı asıl iş katmanı. $4.00 173Mayda token 66 tok/sgece gündüz 1.6×tek akışın
Açık ağırlıklı 70B, uzman sağlayıcı Aynı ağırlıklarKendinizin de çalıştırabileceği aynı ağırlıklar, başka biri tarafından sunulur. $0.90 769Mayda token 293 tok/sgece gündüz 7.1×tek akışın
Açık ağırlıklı 70B, en ucuz sunucusuz Aynı ağırlıklarPiyasanın tabanı, genellikle arkasında paylaşımlı bir kuyrukla. $0.40 1,730Mayda token 658 tok/sgece gündüz 16.1×tek akışın

Son sütun, yazının tamamıdır. “Zaten daha ucuz” yazdığı yerde, bir $692 makinesindeki tek, batching uygulanmamış bir akış API'yi geride bırakır ve düşünecek bir şey yoktur. Bir kat gösterdiği yerdeyse makine yine de kazanabilir — ama yalnızca onu gerçekten doyurursanız, ki bir sonraki bölüm de bunu anlatır.

İki tescilli satır adil bir mücadele değildir ve çoğu insanın gerçekte içinde bulunduğu mücadele de budur. En gelişmiş bir modelin ağırlıklarını kiralayamazsınız, dolayısıyla “bunun yerine self-hosting yapın” bir seçenek değildir — asıl karşılaştırma, $15.00 karşılığındaki kapalı bir model ile tamamen sahibi olacağınız $6.42 karşılığındaki açık bir model arasındadır ve açık olanın işiniz için yeterince iyi olup olmadığıdır. Bu bir kalite sorusudur, maliyet sorusu değil; ve bu aritmetiğin herhangi bir önemi olmadan önce bir öğleden sonranızı ayırmaya değer olan da budur.

Batching, oyunun tamamıdır.

Bir token üretmek, etkin ağırlıkları bellekten bir kez okumayı gerektirir. Yüz farklı istek için yüz token üretmek de onları yalnızca bir kez okumayı gerektirir — aynı ağırlıklar toplu işteki her isteğe hizmet eder. Sürekli batching kullanan bir sunum yığınının aynı donanımda tek bir akışa kıyasla saniyede kat kat fazla token üretmesinin nedeni budur; o tablonun son sütunundaki oranın hiç erişilebilir olmasının nedeni de budur.

Batching size ne kazandırır

Toplam işlem hacmi, ağırlıklar darboğaz olarak kalırken eşzamanlılıkla dik biçimde tırmanır, ardından KV önbelleği kartı doldurdukça düzleşir ve aritmetiğin kendisi sınır haline gelir.

  • Tek akışın kat kat üzerindeki değerler iyimser değil, sıradandır.
  • Ekstra önbelleklerin kapladığı bellek dışında size hiçbir şeye mal olmaz.
  • vLLM bunu varsayılan olarak yapar — onu yapılandırmazsınız, ona veri beslersiniz

Size neye mal olur

İşlem hacmi, eşzamanlılıkla doğrusal olarak artmaz ve istek başına gecikme, toplu iş büyüdükçe kötüleşir. Altmış dört akış, size altmış dört kat token vermez.

  • Her akış, yalnız olsaydı görebileceğinden daha yavaş tokenler görür
  • İlk tükenen şey KV önbelleğidir — onu bilinçli şekilde boyutlandırın
  • Boşta bir toplu iş yuvası hiçbir şey üretmez: sahip olmadığınız eşzamanlılığın hiçbir değeri yoktur

Pratik sonuç: başabaş tablosundaki katı bir kullanıcı sayısı değil, bir işlem hacmi hedefi olarak ele alın. Tek akışın on katı bir hedef, “on kullanıcı” anlamına gelmez; sunucunun, batching uygulanmamış hızının ortalama on katına ulaşması gerektiği anlamına gelir ve bu genellikle on eşzamanlı istekten biraz fazlasını, yüzden ise biraz azını gerektirir. Bir sayıya bağlanmadan önce bunu makinede ölçün — bu tek bir kıyaslamadır ve tartışmayı sonlandırır.

Yine de ödediğiniz boşta geçen saatler

Yukarıdakilerin tümü, yükün ay boyunca eşit dağıldığını varsaydı. Asla öyle olmaz. Aylık kiralanan bir makine Pazar günü saat 04:00 için de ödenir ve o sırada üretmediğiniz tokenler sonraya devretmez. Gerçekte hizmet verdiğiniz haftayı, gerçekte ödediğiniz haftaya bölün:

Bir çalışma döngüsünün, yoğunken ihtiyaç duyduğunuz işlem hacmini nasıl kat kat artırdığı
Yük geldiğinde Haftada saat Gereken tepe hız Etkin milyon başına maliyet
Continuously, 24/7Ne zaman çağrılırsa yanıt veren bir uç nokta 168 h Sürdürülebilir hız $6.42tek akışta
Günde on iki saatKullanıcılarının tek bir yarım kürede olduğu bir ürün 84 h 2.0×meşgulken $12.84tek akışta
Çalışma saatleri, hafta içiKendi ekibiniz tarafından kullanılan dahili bir araç 40 h 4.2×meşgulken $26.97tek akışta
Günde iki saatBir toplu iş, ya da arada sırada açılan bir demo 14 h 12.0×meşgulken $77.07tek akışta

Üçüncü satır, çoğu iç kullanım aracının yaşadığı yerdir ve başabaş noktanızı sessizce dörtten fazla katına çıkarır. Bir self-hosting tahmininin yanlış çıkmasının en yaygın tek nedeni budur — token fiyatı değil, donanım değil, bir çalışma haftasının bütün bir hafta olduğu varsayımı.

Promptunuzun neden neredeyse bedava olduğu

Bir asimetri, makineye sahip olmaktan kesinlikle yana işler ve hiçbir token başına fiyat karşılaştırması bunu göstermez. Bir API sizden girdi tokenleri için ücret alır — genellikle token başına çıktı fiyatının dörtte biri ile üçte biri arasında. Kendi GPU'nuzda girdi tokenleri, tüm promptu paralel olarak işleyen ve bellek bant genişliği yerine aritmetikle sınırlanan prefill geçişinde işlenir. Prefill, üretimden saniyede bir büyüklük mertebesi daha fazla token işler.

Ne kadar çok bağlam gönderirseniz, self-hosting o kadar cazip görünür. 20.000 tokenlik bir istemi ve 300 tokenlik bir yanıtı olan, geri getirme destekli (RAG) bir istekte, bir API makbuzunda girdi ağır basar, kendi makinenizde ise çıktı ağır basar. Bir sağlayıcıda aylık faturaları aynı olan iki iş yükü, diğerinde donanım lehine iki kat farklı olabilir. İstemleriniz uzunsa — RAG, belge çıkarımı, uzun bağlamlı özetleme — yalnızca çıktı üzerinden değil, kendi girdi-çıktı oranınız üzerinden hesaplayın.

Aritmetiğin gözden kaçırdığı

Token başına maliyet tablosunda asla görünmeyen, ama soruyu rakamlar kadar sık belirleyen dört şey.

Her istek bir yere gider. Bir API, isteklerinizi görür ve isteklerinizin içeriği ürününüz, müşterilerinizin belgeleri ya da kodunuzdur. Kiraladığınız bir makinede ağırlıklar ve trafik kutunun içinde kalır — ve zaten en başta kim olduğunuzu hiç sormadık. Bu bir kalem değildir, ama bazı iş yükleri için kararın tamamıdır.

Modeller kullanımdan kaldırılır; sizinki kaldırılmaz. Barındırılan bir model değişebilir, farklı davranışlı yeni bir sürüm alabilir ya da sizin olmayan bir takvimde emekliye ayrılabilir. Kendi NVMe'nizdeki bir ağırlık kümesi bir yıl sonra da aynı şekilde davranır — buna göre değerlendirme yaptıysanız bu çok şey ifade eder.

Sabit bir fiyat, farklı türde bir sayıdır. Sayaçlı faturalandırma, bir hatanın, bir yeniden deneme döngüsünün ya da bir trafik patlamasının sonradan öğrendiğiniz bir makbuza dönüşmesi demektir. Aylık bir süre sizi şaşırtamaz: en kötü ihtimal, makinenin yavaş olmasıdır, pahalı olması değil.

Birinin onu çalıştırması gerekir. Kendi kendine barındırmanın dürüst maliyeti, bir öğleden sonralık kurulumu ve bir sürücünün ya da konteynerin ara sıra bozulduğu bir akşamı da içerir. Dokümantasyonumuz, bunun bir hafta yerine bir öğleden sonra sürmesini sağlamak için var, ama sıfır değildir; aksini iddia etmek bu karşılaştırmaların güvenilirliğini kaybetmesinin nedenidir.

Hangi tarafta olduğunuz

Sırayla okuyun ve sizi tanımlayan ilk maddede durun.

  1. Sınır bir kapalı modelin kalitesine ihtiyacınız var. O zaman bu yazı size uymaz: o ağırlıkları kimse size kiralamaz. API'yi kullanın ve belirli göreviniz için açık bir model farkı kapattığında tekrar bakın.
  2. Hacminiz düşük ya da henüz bilmiyorsunuz. API'yi kullanın. Trafiğinizin gerçekte neye benzediğini öğrenmenin en ucuz yolu budur ve sayaç gayet iyi bir ölçüm aracıdır.
  3. Trafiğiniz sivri uçludur ve bir kuyruğa tahammül eder. API'yi kullanın, ya da bölün: düzenli taban yük için kendi makineniz, yoğunluklar için barındırılan bir uç nokta. Hiçbir şey kararı tek yönlü olmaya zorlamaz.
  4. Açık ağırlıklı bir model karşısında gerçek, toplu bir hacmi sürdürüyorsunuz. Donanımın kazandığı durum budur, hem de büyük farkla — sayaç işlemeye devam ederken sabit fiyat kıpırdamaz. İnanmadan önce yukarıdaki tabloda kendi sayınızı kontrol edin.
  5. İstemler hassastır, model değişmemelidir ya da faturanın önceden bilinmesi gerekir. O zaman aritmetik bir formaliteden ibarettir. Modelinizi barındıran makineyi kiralayın ve kimseye kim olduğunuzu söylemeden ödeyin.

Hangi satırda durduysanız durun, kontrol etmeniz gereken sayı, başabaş tablosunda kendi modeliniz ve kendi hacminiz için verilen sayıdır. Yapılandırıcı, kiraladığımız her düğüm için modelinizin tek bir karta sığıp sığmadığını, bölünmesi gerekip gerekmediğini ve işlem hacmi tahmininin ne olduğunu bildirir — bu aritmetiğin ihtiyaç duyduğu her girdi de budur. Aylık kiralama ile saatlik ölçüm arasında hâlâ karar veremediyseniz, bu farklı bir başabaş hesabıdır ve o da ayrıca ele alınmıştır.

Kendi başabaş noktanızı gerçek bir makinede hesaplayın.

Yapılandırıcı, katalogdaki her düğüm için işlem hacmi tahminini ve aylık fiyatı verir — bu rehberin böldüğü iki sayı budur.

Giriş Yapın

Konsol, makbuzlar ve bant dışı erişim.

Henüz hesabınız yok mu?

Ayrı bir kayıt işlemi yoktur. Hesabınız, ilk siparişinizi verirken oluşturulur — e-postayı ve şifreyi ödeme adımında seçersiniz, ve makine hazır olduğunda konsol da açık olur.

Bir sunucu yapılandırın

Language