L’ensemble des 6 centres de données opérationnels

Payé en crypto · Sans vérification d’identité · Accès root en moins de 5 minutes

Coût guide · 9 min de lecture

Ce que coûte un million de tokens, dans les deux sens.

Une API vous facture au token et rien pendant que vous êtes inactif. Une machine vous facture au mois et rien par token. Savoir laquelle est la moins chère se résume à une seule division — et la réponse dépend bien plus de l’usage que vous faites de la machine que du prix de l’une ou de l’autre.

En bref

Le seuil de rentabilité est un volume
Pas un prix. $692 par mois vous achète autant de tokens que la machine peut réellement produire — la question est de savoir si vous avez autant de travail que cela.
Face à une API de pointe
Un flux unique non traité par lots sur notre nœud le moins cher coûte déjà $6.42 par million. C’est en dessous des $15.00 facturés par un modèle propriétaire de pointe, avant même de traiter quoi que ce soit par lots.
Face aux mêmes poids ouverts
Il vous faut environ 7.1× votre débit en flux unique pour battre $0.90 par million. C’est à cela que sert le traitement par lots continu, et c’est courant.
Là où l’API continue de gagner
Un trafic en pics, un faible volume, et tout modèle dont personne ne vous vendra les poids.

La version courte

Presque toutes les comparaisons de ces deux options que vous lirez se résument à un seul chiffre — « l’auto-hébergement coûte dix fois moins cher », « l’API est moins chère jusqu’à ce que vous soyez énorme » — et c’est la même erreur dans les deux cas : citer un coût par token pour une machine qui n’est pas facturée au token. Un GPU loué a exactement un prix et il ne bouge pas : que vous génériez un milliard de tokens ce mois-ci ou aucun, la facture est identique. La question honnête n’est donc pas « combien coûte un token ici » mais « combien de tokens dois-je générer avant que le prix fixe ne batte le compteur ».

Ce chiffre est une division, et elle est effectuée ci-dessous à partir de nos propres prix et de notre propre modèle de débit — le même que celui qu’utilise le configurateur. Tout ce qui suit porte sur les deux facteurs qui déterminent si vous pouvez atteindre ce volume : le traitement par lots, et les heures pendant lesquelles vous laissez la machine inactive.

Le calcul

Quatre lignes. La troisième est celle qui mérite d’être écrite sur un tableau blanc ; la quatrième est celle que les gens sautent, et c’est ce qui transforme une estimation solide en une estimation fausse.

Volume au seuil de rentabilité, et ce qu’il exige de la machine
# 1. What the API charges. Linear in what you use, zero when you stop.
api_cost_per_month = output_tokens_per_month / 1e6 × api_price_per_million

# 2. What the machine charges. A constant. Tokens are free once you own the hours.
machine_cost_per_month = monthly_price

# 3. Set them equal. This is the break-even VOLUME, in output tokens per month.
break_even_tokens = monthly_price / api_price_per_million × 1e6

# 4. And the only question that matters: can the machine produce that many?
#    730 hours is the month we bill, so 2,628,000 seconds of it.
sustained_tokens_per_second = break_even_tokens / 2,628,000

La ligne 4 est un débit soutenu, pas un pic. Une machine qui atteint 600 tokens par seconde pendant une heure par jour et reste inactive les vingt-trois heures restantes a un débit soutenu de 25, et la facture ne fait aucune différence entre les deux.

Ce que coûte le flux unique

Commencez par le pire cas, car c’est le seul chiffre qui puisse être énoncé sans hypothèse : une requête à la fois, sans traitement par lots, la machine inactive le reste du temps. Chaque nœud ci-dessous fait tourner Llama 3.3 70B à 4-bit (AWQ, GPTQ), et le débit est notre propre estimation prudente — celle qui est bornée par la bande passante mémoire plutôt que mesurée un bon jour.

Coût par million de tokens de sortie pour un flux unique non traité par lots, par nœud
Nœud Comment il fait tourner le modèle Par mois Flux unique Coût par million
2 × NVIDIA RTX 509064 GB au total · PCIe 5.0 ×16 Réparti sur les 2 cartes 43.1 GB nécessaires, 32 GB par carte $692 41 tok/s $6.42par 1M en sortie
2 × NVIDIA RTX 409048 GB au total · PCIe 5.0 ×16 Réparti sur les 2 cartes 43.1 GB nécessaires, 24 GB par carte $416 23 tok/s $6.88par 1M en sortie
4 × NVIDIA RTX 5090128 GB au total · PCIe 5.0 ×16 Réparti sur les 4 cartes 43.1 GB nécessaires, 32 GB par carte $1,345 68 tok/s $7.53par 1M en sortie
4 × NVIDIA RTX 409096 GB au total · PCIe 5.0 ×16 Réparti sur les 4 cartes 43.1 GB nécessaires, 24 GB par carte $814 38 tok/s $8.15par 1M en sortie
2 × NVIDIA A100 PCIe80 GB au total · PCIe 5.0 ×16 Réparti sur les 2 cartes 43.1 GB nécessaires, 40 GB par carte $802 36 tok/s $8.48par 1M en sortie
8 × NVIDIA RTX 5090256 GB au total · PCIe 5.0 ×16 Réparti sur les 8 cartes 43.1 GB nécessaires, 32 GB par carte $2,584 100 tok/s $9.83par 1M en sortie

Lisez ce chiffre comme un plafond, jamais comme un devis. C’est ce que coûte un token si vous faites répondre la machine à une question à la fois et que vous la laissez inactive le reste du mois — la façon la moins efficace qui soit de posséder un GPU. Toute pile de service réelle fait mieux, et les deux prochaines sections expliquent de combien.

Le seuil de rentabilité, par palier

Prenez la ligne la moins chère ci-dessus — 2 × NVIDIA RTX 5090 à $692 par mois — et demandez-vous quel travail elle doit fournir pour battre chaque palier du marché des API.

Volume mensuel au seuil de rentabilité, et le débit soutenu qu’il exige
Ce que vous paieriez à la place Par 1M en sortie Volume au seuil de rentabilité Débit soutenu Face au flux unique
Modèle propriétaire de pointeLe meilleur modèle fermé du moment. Personne ne vous loue ses poids. $15.00 46Mtokens par mois 18 tok/s24 heures sur 24 Déjà moins cher
Modèle propriétaire intermédiaireLe palier robuste sur lequel la plupart des produits tournent réellement. $4.00 173Mtokens par mois 66 tok/s24 heures sur 24 1.6×du flux unique
70B à poids ouverts, fournisseur spécialisé Mêmes poidsLes mêmes poids que vous feriez tourner vous-même, servis par quelqu’un d’autre. $0.90 769Mtokens par mois 293 tok/s24 heures sur 24 7.1×du flux unique
70B à poids ouverts, offre serverless la moins chère Mêmes poidsLe plancher du marché, généralement avec une file d’attente partagée derrière. $0.40 1,730Mtokens par mois 658 tok/s24 heures sur 24 16.1×du flux unique

La dernière colonne est tout l’article. Là où elle indique « déjà moins cher », un flux sans traitement par lots sur une machine $692 bat l’API : il n’y a rien à réfléchir. Là où elle affiche un multiple, la machine peut quand même gagner — mais seulement si vous la faites vraiment travailler, ce qui est l’objet de la section suivante.

Les deux lignes propriétaires ne sont pas un combat équitable, et c’est pourtant le combat dans lequel se trouve la plupart des gens. Vous ne pouvez pas louer les poids d’un modèle de pointe, donc « auto-hébergez-le à la place » n’est pas une option — la vraie comparaison est un modèle fermé à $15.00 face à un modèle ouvert à $6.42 que vous possédez entièrement, et si le modèle ouvert est assez bon pour votre tâche. C’est une question de qualité, pas de coût, et c’est celle qui mérite qu’on y consacre un après-midi avant que ce calcul n’ait la moindre importance.

Le traitement par lots est tout l’enjeu

Générer un token nécessite de lire une fois les poids actifs depuis la mémoire. Générer cent tokens pour cent requêtes différentes nécessite aussi de les lire une seule fois — les mêmes poids servent chaque requête du lot. C’est pourquoi une pile de service avec traitement par lots continu produit plusieurs fois plus de tokens par seconde qu’un flux unique sur un matériel identique, et pourquoi le rapport de la dernière colonne de ce tableau est atteignable.

Ce que vous apporte le traitement par lots

Le débit agrégé grimpe fortement avec la concurrence tant que les poids restent le goulot d’étranglement, puis se stabilise quand le cache clef/valeur remplit la carte et que le calcul lui-même devient la limite.

  • De grands multiples par rapport à un flux unique sont la norme, pas de l’optimisme
  • Cela ne vous coûte rien, sauf la mémoire que prennent les caches supplémentaires
  • vLLM le fait par défaut — vous ne le configurez pas, vous le nourrissez

Ce que cela vous coûte

Le débit n’augmente pas linéairement avec la concurrence, et la latence par requête se dégrade à mesure que le lot grossit. Soixante-quatre flux ne vous donnent pas soixante-quatre fois plus de tokens.

  • Chaque flux voit des tokens plus lents que s’il était seul
  • Le cache clef/valeur est ce qui s’épuise en premier — dimensionnez-le délibérément
  • Un emplacement de lot inactif ne génère rien : la concurrence que vous n’avez pas ne vaut rien

Conséquence pratique : traitez le multiple du tableau de seuil de rentabilité comme un objectif de débit, pas un nombre d’utilisateurs. Un objectif de dix fois le flux unique ne signifie pas « dix utilisateurs » ; cela signifie que le serveur doit atteindre en moyenne dix fois son débit sans traitement par lots, ce qui exige généralement plutôt plus de dix requêtes simultanées et plutôt moins d’une centaine. Mesurez-le sur la machine avant de vous engager sur un chiffre — c’est un seul benchmark, et il tranche le débat.

Les heures inactives que vous payez quand même

Tout ce qui précède supposait que la charge était répartie uniformément sur le mois. Ce n’est jamais le cas. Une machine louée au mois est payée le dimanche à 4 h 00, et les tokens que vous n’avez pas générés à ce moment-là ne se reportent pas. Divisez la semaine que vous servez réellement par la semaine que vous payez réellement :

Comment un cycle d’utilisation multiplie le débit nécessaire pendant les périodes actives
Quand la charge arrive Heures par semaine Débit de pointe nécessaire Coût effectif par million
Continuously, 24/7Un point d’accès qui répond chaque fois qu’on l’appelle 168 h Le débit soutenu $6.42à flux unique
Douze heures par jourUn produit avec un seul hémisphère d’utilisateurs 84 h 2.0×tant qu’elle est occupée $12.84à flux unique
Heures de bureau, jours ouvrésUn outil interne utilisé par votre propre équipe 40 h 4.2×tant qu’elle est occupée $26.97à flux unique
Deux heures par jourUne tâche par lots, ou une démo qu’on ouvre de temps en temps 14 h 12.0×tant qu’elle est occupée $77.07à flux unique

La troisième ligne, c’est là que vivent la plupart des outils internes, et elle multiplie discrètement votre seuil de rentabilité par plus de quatre. C’est la raison la plus fréquente pour laquelle une estimation d’auto-hébergement se révèle fausse — pas le prix du token, pas le matériel, mais l’hypothèse qu’une semaine de travail est une semaine entière.

Pourquoi votre prompt est presque gratuit

Une asymétrie joue fortement en faveur du fait de posséder la machine, et aucune comparaison de prix par token ne la montre. Une API vous facture les tokens d’entrée — généralement le quart au tiers du prix de sortie, par token. Sur votre propre GPU, les tokens d’entrée sont traités pendant la passe de prefill, qui traite l’intégralité du prompt en parallèle et qui est limitée par le calcul plutôt que par la bande passante mémoire. Le prefill tourne à un débit de tokens par seconde supérieur d’un ordre de grandeur à celui de la génération.

Plus vous envoyez de contexte, plus l’auto-hébergement devient intéressant. Une requête RAG avec un prompt de 20 000 tokens et une réponse de 300 tokens est dominée par l’entrée sur une facture d’API, et par la sortie sur votre propre machine. Deux usages avec des factures mensuelles identiques chez un fournisseur peuvent afficher un écart de deux contre un chez l’autre, en faveur du matériel. Si vos prompts sont longs — RAG, extraction de documents, synthèse à contexte long — faites le calcul sur votre ratio entrée/sortie plutôt que sur la sortie seule.

Ce que le calcul laisse de côté

Quatre choses qui n’apparaissent jamais dans un tableau de coût par token, et qui tranchent la question au moins aussi souvent que les chiffres.

Chaque requête va quelque part. Une API voit vos prompts, et vos prompts sont votre produit, les documents de vos clients ou votre code. Sur une machine que vous louez, les poids et le trafic restent sur la machine — et nous n’avons jamais demandé qui vous êtes pour commencer. Ce n’est pas une ligne budgétaire, mais pour certains usages c’est toute la décision.

Les modèles sont dépréciés ; pas le vôtre. Un modèle hébergé peut changer, recevoir une nouvelle version au comportement différent, ou être retiré selon un calendrier qui n’est pas le vôtre. Un jeu de poids sur votre propre NVMe se comporte de la même façon un an plus tard, ce qui compte énormément si vos évaluations reposent dessus.

Un prix fixe est un genre de chiffre différent. La facturation à la consommation signifie qu’un bug, une boucle de réessai ou un pic de trafic se transforme en facture que vous découvrez après coup. Une durée d’engagement mensuelle ne peut pas vous surprendre : le pire des cas est que la machine soit lente, pas qu’elle soit chère.

Quelqu’un doit le faire tourner. Le coût honnête de l’auto-hébergement comprend un après-midi d’installation et, de temps en temps, une soirée où un pilote ou un conteneur se comporte mal. Notre documentation existe pour que cela reste un après-midi plutôt qu’une semaine, mais ce n’est pas zéro, et prétendre le contraire est ce qui fait perdre toute crédibilité à ce genre de comparaison.

De quel côté vous êtes

Dans l’ordre, et arrêtez-vous au premier qui vous correspond.

  1. Vous avez besoin de la qualité d’un modèle propriétaire de pointe. Alors cet article ne s’applique pas : personne ne vous loue ces poids. Utilisez l’API, et reconsidérez la question quand un modèle ouvert comblera l’écart sur votre tâche spécifique.
  2. Votre volume est faible, ou vous ne le connaissez pas encore. Utilisez l’API. C’est le moyen le moins cher de découvrir à quoi ressemble réellement votre trafic, et le compteur est un instrument de mesure parfaitement adapté.
  3. Votre trafic est irrégulier et tolère une file d’attente. Utilisez l’API, ou répartissez : votre propre machine pour la charge de base constante, un point d’accès hébergé pour les pics. Rien n’oblige à trancher entièrement dans un sens.
  4. Vous soutenez un volume réel, traité par lots, sur un modèle à poids ouverts. C’est le cas où le matériel l’emporte, et il l’emporte largement — le prix fixe cesse de bouger pendant que le compteur continue de tourner. Vérifiez votre propre chiffre dans le tableau ci-dessus avant d’y croire.
  5. Les prompts sont sensibles, le modèle ne doit pas changer, ou la facture doit être connue à l’avance. Alors le calcul n’est qu’une formalité. Louez la machine qui héberge votre modèle, et payez-la sans dire à quiconque qui vous êtes.

Quelle que soit la ligne où vous vous êtes arrêté, le chiffre à vérifier est celui du tableau de seuil de rentabilité pour votre modèle et votre volume. Le configurateur indique, pour chaque nœud que nous louons, si votre modèle tient sur une seule carte, doit être réparti, et quelle est l’estimation de débit — ce qui représente toutes les données dont ce calcul a besoin. Si vous hésitez encore entre la location au mois et la facturation à l’heure, c’est un autre seuil de rentabilité, et il est également détaillé.

Calculez votre propre seuil de rentabilité sur une machine réelle.

Le configurateur vous donne l’estimation de débit et le prix mensuel pour chaque nœud du catalogue — les deux chiffres que ce guide divise.

Se connecter

Console, factures et accès hors bande.

Pas encore de compte ?

Il n’y a pas d’inscription séparée. Votre compte est créé au moment où vous passez votre première commande — vous choisissez l’e-mail et le mot de passe à l’étape de paiement, et la console est ouverte au moment où la machine l’est.

Configurer un serveur

Language