Ce que nous installons en baie, et ce qui se passe quand ça tombe en panne.
Un serveur dédié est une promesse à propos d’un objet physique. Cette page décrit cet objet : quelles cartes nous achetons, comment un nœud est testé avant de recevoir un client, et ce que nous faisons le jour où l’une d’elles tombe en panne.
- 12Modèles de GPU que nous exploitons
- 72 hrodage avant qu’un nœud ne reçoive un client
- 4 hobjectif de remplacement du matériel défaillant
- 0carte revendue par un tiers
Chaque carte que nous exploitons
C’est la liste complète — il n’existe pas de palier non répertorié, ni de carte que nous réservons aux grands comptes. La bande passante mémoire figure dans le tableau parce que, pour l’inférence, elle prédit le débit bien mieux qu’aucun chiffre en teraflops.
| Carte | Architecture | Mémoire | Bande passante | Tailles de nœud | À partir de |
|---|---|---|---|---|---|
| L4 | Ada Lovelace | 24 GB | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/mois |
| RTX 4090 | Ada Lovelace | 24 GB | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/mois |
| RTX 5090 | Blackwell | 32 GB | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/mois |
| RTX A6000 | Ampere | 48 GB | 768 GB/s | 1×, 2×, 4×, 8× | $286/mois |
| L40S | Ada Lovelace | 48 GB | 864 GB/s | 1×, 2×, 4×, 8× | $714/mois |
| A100 PCIe | Ampere | 40 GB | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/mois |
| A100 PCIe | Ampere | 80 GB | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/mois |
| H100 PCIe | Hopper | 80 GB | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/mois |
| A100 SXM4 | Ampere | 80 GB | 2,039 GB/s | 4×, 8× | $4,395/mois |
| H100 SXM5 | Hopper | 80 GB | 3,350 GB/s | 4×, 8× | $6,061/mois |
| H200 SXM5 | Hopper | 141 GB | 4,800 GB/s | 4×, 8× | $8,405/mois |
| B200 SXM6 | Blackwell | 180 GB | 8,000 GB/s | 4×, 8× | $11,790/mois |
Chaque carte est une pièce retail ou OEM achetée neuve, avec sa garantie à notre nom. Nous n’achetons pas de stock issu du minage, et nous n’achetons pas de cartes dont nous ne pouvons pas retracer l’historique — une RTX 4090 d’occasion est bon marché pour une raison, et cette raison arrive au quatrième mois.
Ce qui entoure les cartes
Un GPU privé de CPU, de RAM ou de débit disque est un moyen coûteux d’attendre. Le châssis est choisi en fonction du nombre de cartes, pas vendu comme une voie d’évolution.
| Nœud | CPU | RAM système | Stockage local | Port |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X | 128 GB | 2 × 2 TB NVMe | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X | 256 GB | 2 × 3.84 TB NVMe | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X | 512 GB | 4 × 3.84 TB NVMe | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ | 1 TB | 8 × 3.84 TB NVMe | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMe | 25 Gbit/s |
Lorsque deux CPU sont indiqués, l’un ou l’autre peut être livré — ils sont appariés sur le nombre de cœurs et de canaux mémoire, et le configurateur vous indique lequel équipe votre nœud avant le paiement. Les disques sont livrés bruts : nous n’imposons aucun niveau de RAID, car le bon choix dépend du fait que vous stockiez des checkpoints ou un jeu de données que vous pouvez retélécharger.
Avant la vente d’un nœud
Une machine n’entre au catalogue qu’après avoir passé trois jours à résister sans tomber en panne. Presque toutes les cartes destinées à mourir tôt meurent ici, entre nos mains, et non dans les vôtres.
ÉTAPE 1 · 2 HEURES
Assemblage et inventaire
Les numéros de série de chaque carte, module et disque sont enregistrés en regard du châssis. C’est ce registre qui nous permet de vous dire, plus tard, exactement quelle pièce physique se trouve dans votre machine.
ÉTAPE 2 · 24 HEURES
Test d’endurance mémoire et calcul
Tests de motifs ECC sur la totalité de la VRAM de chaque carte, puis multiplication matricielle soutenue à 100 % d’utilisation. Une seule erreur non corrigible et la carte repart dans sa boîte.
ÉTAPE 3 · 24 HEURES
Test d’endurance thermique et électrique
Le nœud entier est maintenu en pleine charge pendant que la température d’entrée d’air est portée au pire cas de la suite. Nous relevons la fréquence que les cartes soutiennent réellement — pas le chiffre de boost indiqué sur la boîte — et un nœud qui chute sous la spécification voit ses cartes réenfichées ou sa pâte thermique refaite avant d’être testé à nouveau.
ÉTAPE 4 · 24 HEURES
Interconnexion et stockage
Bande passante peer-to-peer NVLink ou PCIe mesurée carte à carte, endurance en écriture NVMe échantillonnée, port maintenu au débit nominal. Les chiffres sont comparés à ceux des autres nœuds du même modèle, car un nœud 15 % plus lent est un nœud qui a un problème.
DÉJÀ · INSTALLÉE EN BAIE ET EN ATTENTE
Disponible, avec une image prête à écrire
C’est pourquoi la livraison prend moins de 5 minutes et non un jour ouvré : rien n’est assemblé au moment de votre commande. La machine existe déjà, sous tension et testée, et votre paiement déclenche l’écriture d’une image, pas une construction.
Firmware et pilotes
nvidia-smi ; la conséquence sur la garantie est pour nous, pas pour vous.
Quand quelque chose tombe en panne
Le matériel tombe en panne. Ce qui distingue les fournisseurs, ce n’est pas que cela arrive, mais ce à quoi ressemblent les quatre heures suivantes.
Les pièces de rechange sont sur place
Chaque suite dispose de cartes, de PSU, de disques de rechange et d’un châssis complet par modèle. Un remplacement se fait en quelques pas dans une allée, pas par une réservation de coursier.
Objectif de quatre heures
De votre signalement au matériel de nouveau fonctionnel, 24 h/24 et 7 j/7. Si nous ne tenons pas ce délai, le SLA prolonge automatiquement votre durée d’engagement — vous n’avez rien à réclamer.
Vos disques restent les vôtres
Un GPU ou un PSU en panne est remplacé sans toucher aux disques, qui restent en place. Nous ne demandons votre accord qu’avant de toucher au stockage, et uniquement quand c’est le stockage qui est en panne.
Entre deux clients
La même machine sera louée à nouveau après vous. Tout ce qui suit se produit avant qu’elle ne réintègre le catalogue, que quelqu’un le demande ou non.
| Étape | Ce qui se passe | Vérifié par |
|---|---|---|
| 1. Réseau | La machine est coupée de son port public dès que la durée d’engagement se termine. Rien n’y reste accessible pendant qu’elle attend. | État du port, journalisé |
| 2. Stockage | Chaque périphérique NVMe reçoit un effacement cryptographique complet, puis un écrasement en une passe de tout l’espace d’adressage. | Échantillon de relecture sur chaque périphérique |
| 3. Mémoire GPU | Les cartes sont réinitialisées et leur mémoire effacée ; les compteurs ECC sont relevés et comparés aux valeurs enregistrées lors du rodage. | Journal de réinitialisation nvidia-smi |
| 4. Firmware | Les réglages du BMC et du BIOS sont reflashés vers notre référence, ce qui annule toute modification effectuée pendant la durée d’engagement. | Somme de contrôle par rapport à la référence |
| 5. Identité | Identifiants IPMI renouvelés, adresses IP rendues au pool, rDNS effacé. | Adresse retenue jusqu’à ce qu’elle soit propre |
C’est aussi pourquoi nous ne pouvons rien restaurer après la fin d’une durée d’engagement. Il n’y a pas de délai de grâce pendant lequel vos données existeraient encore quelque part — l’étape 2 a déjà été exécutée. Si vous en avez besoin, récupérez-les depuis la machine avant la fin de la durée d’engagement.
Ce que nous ne ferons pas
Partitionner une carte. Pas de MIG, pas de vGPU, pas de time-slicing. Un seul client par GPU physique, ce qui rend reproductible le débit indiqué sur la fiche.
Surallouer un nœud. Il n’y a pas de second compte sur la machine, ni d’hyperviseur entre vous et le matériel physique.
Revendre la capacité de quelqu’un d’autre. Chaque carte de cette page est une carte que nous avons achetée et installée en baie. Rien ici n’est une marge de revendeur sur un autre cloud.
Substituer une carte différente. Si le modèle que vous avez commandé ne peut pas être livré, nous ne vous envoyons pas discrètement un quasi-équivalent — nous vous prévenons et remboursons la durée d’engagement.
Entrer dans votre système d’exploitation. Le root est à vous seul. Nous disposons de l’IPMI, qui peut redémarrer la machine et monter des médias ; nous ne détenons aucun identifiant de connexion à l’intérieur de votre machine.
Conserver une copie de quoi que ce soit. Nous ne faisons aucune sauvegarde de vos disques. Les snapshots n’existent que si vous les achetez, et ils sont supprimés à la fin de la durée d’engagement.
La spécification indiquée sur la ligne est la spécification que vous obtenez.
Chaque carte ci-dessus est disponible dans les 6 centres de données, installées en baie et rodées, avec une image prête à écrire.
Pages liées
- RéseauPorts sans compteur jusqu’à 25 Gbit/s, deux opérateurs et un IX par site, filtrage DDoS permanent, IPv6 routé — et quatre choses que nous n’offrons pas, en clair.
- DocumentationPremier SSH, vérification du matériel, conteneurs CUDA, servir un modèle avec vLLM, RAID, pare-feu, IPMI et réinstallations — les commandes, sur une machine réelle.
- Accord de niveau de serviceL’engagement de 99,9 % : la définition d’une panne, la mesure externe, cinq minutes de durée d’engagement rendues par minute perdue, et les exclusions en détail.
- À proposQui gère gpuserver.io, pourquoi nous achetons le matériel au lieu de le revendre, et les quatre règles jamais transigées — y compris celles qui coûtent des ventes.