Infrastructure

# Ce que nous installons en baie, et ce qui se passe quand ça tombe en panne.

Un serveur dédié est une promesse à propos d’un objet physique. Cette page décrit cet objet : quelles cartes nous achetons, comment un nœud est testé avant de recevoir un client, et ce que nous faisons le jour où l’une d’elles tombe en panne.

- 12 Modèles de GPU que nous exploitons
- 72 h rodage avant qu’un nœud ne reçoive un client
- 4 h objectif de remplacement du matériel défaillant
- 0 carte revendue par un tiers

## Chaque carte que nous exploitons

C’est la liste complète — il n’existe pas de palier non répertorié, ni de carte que nous réservons aux grands comptes. La bande passante mémoire figure dans le tableau parce que, pour l’inférence, elle prédit le débit bien mieux qu’aucun chiffre en teraflops.

**Modèles de GPU, architecture, mémoire, bande passante, tailles de nœud et prix d’entrée**

| Carte | Architecture | Mémoire | Bande passante | Tailles de nœud | À partir de |
|---|---|---|---|---|---|
| L4 Carte d’extension PCIe | Ada Lovelace | 24 GB GDDR6 | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/mois |
| RTX 4090 Carte d’extension PCIe | Ada Lovelace | 24 GB GDDR6X | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/mois |
| RTX 5090 Carte d’extension PCIe | Blackwell | 32 GB GDDR7 | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/mois |
| RTX A6000 Carte d’extension PCIe | Ampere | 48 GB GDDR6 ECC | 768 GB/s | 1×, 2×, 4×, 8× | $286/mois |
| L40S Carte d’extension PCIe | Ada Lovelace | 48 GB GDDR6 ECC | 864 GB/s | 1×, 2×, 4×, 8× | $714/mois |
| A100 PCIe Carte d’extension PCIe | Ampere | 40 GB HBM2 | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/mois |
| A100 PCIe Carte d’extension PCIe | Ampere | 80 GB HBM2e | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/mois |
| H100 PCIe Carte d’extension PCIe | Hopper | 80 GB HBM3 | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/mois |
| A100 SXM4 Module SXM, carte HGX | Ampere | 80 GB HBM2e | 2,039 GB/s | 4×, 8× | $4,395/mois |
| H100 SXM5 Module SXM, carte HGX | Hopper | 80 GB HBM3 | 3,350 GB/s | 4×, 8× | $6,061/mois |
| H200 SXM5 Module SXM, carte HGX | Hopper | 141 GB HBM3e | 4,800 GB/s | 4×, 8× | $8,405/mois |
| B200 SXM6 Module SXM, carte HGX | Blackwell | 180 GB HBM3e | 8,000 GB/s | 4×, 8× | $11,790/mois |

Chaque carte est une pièce retail ou OEM achetée neuve, avec sa garantie à notre nom. Nous n’achetons pas de stock issu du minage, et nous n’achetons pas de cartes dont nous ne pouvons pas retracer l’historique — une RTX 4090 d’occasion est bon marché pour une raison, et cette raison arrive au quatrième mois.

## Ce qui entoure les cartes

Un GPU privé de CPU, de RAM ou de débit disque est un moyen coûteux d’attendre. Le châssis est choisi en fonction du nombre de cartes, pas vendu comme une voie d’évolution.

**Spécification du châssis par nombre de GPU**

| Nœud | CPU | RAM système | Stockage local | Port |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X 16 c / 32 t · ou Intel Xeon Silver 4410Y | 128 GB | 2 × 2 TB NVMeGen4 U.2, aucun RAID imposé | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X 24 c / 48 t · ou Intel Xeon Gold 5416S | 256 GB | 2 × 3.84 TB NVMeGen4 U.2, aucun RAID imposé | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X 32 c / 64 t · ou 2 × Intel Xeon Gold 6438Y+ | 512 GB | 4 × 3.84 TB NVMeGen4 U.2, aucun RAID imposé | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ 64 c · ou 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 3.84 TB NVMeGen4 U.2, aucun RAID imposé | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ 64 c · ou 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMeGen4 U.2, aucun RAID imposé | 25 Gbit/s |

Lorsque deux CPU sont indiqués, l’un ou l’autre peut être livré — ils sont appariés sur le nombre de cœurs et de canaux mémoire, et le configurateur vous indique lequel équipe votre nœud avant le paiement. Les disques sont livrés bruts : nous n’imposons aucun niveau de RAID, car le bon choix dépend du fait que vous stockiez des checkpoints ou un jeu de données que vous pouvez retélécharger.

## Avant la vente d’un nœud

Une machine n’entre au catalogue qu’après avoir passé trois jours à résister sans tomber en panne. Presque toutes les cartes destinées à mourir tôt meurent ici, entre nos mains, et non dans les vôtres.

ÉTAPE 1 · 2 HEURES

### Assemblage et inventaire

Les numéros de série de chaque carte, module et disque sont enregistrés en regard du châssis. C’est ce registre qui nous permet de vous dire, plus tard, exactement quelle pièce physique se trouve dans votre machine.

ÉTAPE 2 · 24 HEURES

### Test d’endurance mémoire et calcul

Tests de motifs ECC sur la totalité de la VRAM de chaque carte, puis multiplication matricielle soutenue à 100 % d’utilisation. Une seule erreur non corrigible et la carte repart dans sa boîte.

ÉTAPE 3 · 24 HEURES

### Test d’endurance thermique et électrique

Le nœud entier est maintenu en pleine charge pendant que la température d’entrée d’air est portée au pire cas de la suite. Nous relevons la fréquence que les cartes soutiennent réellement — pas le chiffre de boost indiqué sur la boîte — et un nœud qui chute sous la spécification voit ses cartes réenfichées ou sa pâte thermique refaite avant d’être testé à nouveau.

ÉTAPE 4 · 24 HEURES

### Interconnexion et stockage

Bande passante peer-to-peer NVLink ou PCIe mesurée carte à carte, endurance en écriture NVMe échantillonnée, port maintenu au débit nominal. Les chiffres sont comparés à ceux des autres nœuds du même modèle, car un nœud 15 % plus lent est un nœud qui a un problème.

DÉJÀ · INSTALLÉE EN BAIE ET EN ATTENTE

### Disponible, avec une image prête à écrire

C’est pourquoi la livraison prend moins de 5 minutes et non un jour ouvré : rien n’est assemblé au moment de votre commande. La machine existe déjà, sous tension et testée, et votre paiement déclenche l’écriture d’une image, pas une construction.

## Firmware et pilotes

Pile de pilotes Installé, figé, libre à vous de le changer Chaque image Linux est livrée avec un pilote NVIDIA à jour, CUDA, cuDNN et NCCL déjà fonctionnels. Rien ne vous empêche de tout remplacer — c’est votre root.

Mises à jour du firmware Jamais pendant votre durée d’engagement Le BIOS, le BMC et le VBIOS sont configurés avant que le nœud n’entre au catalogue. Nous ne déployons pas de firmware sur une machine que quelqu’un loue ; il est appliqué entre deux clients.

Fréquences En stock, et déverrouillé pour vous Nous livrons chaque carte à sa fréquence et à sa limite de puissance de référence. Vous pouvez les augmenter ou les réduire avec `nvidia-smi` ; la conséquence sur la garantie est pour nous, pas pour vous.

Accès hors bande IPMI, sur un réseau séparé Alimentation à distance, console série et média virtuel, accessibles même quand le système d’exploitation ne l’est pas. Cela se trouve sur un VLAN de gestion qui ne touche jamais votre port public.

## Quand quelque chose tombe en panne

Le matériel tombe en panne. Ce qui distingue les fournisseurs, ce n’est pas que cela arrive, mais ce à quoi ressemblent les quatre heures suivantes.

### Les pièces de rechange sont sur place

Chaque suite dispose de cartes, de PSU, de disques de rechange et d’un châssis complet par modèle. Un remplacement se fait en quelques pas dans une allée, pas par une réservation de coursier.

### Objectif de quatre heures

De votre signalement au matériel de nouveau fonctionnel, 24 h/24 et 7 j/7. Si nous ne tenons pas ce délai, le SLA prolonge automatiquement votre durée d’engagement — vous n’avez rien à réclamer.

### Vos disques restent les vôtres

Un GPU ou un PSU en panne est remplacé sans toucher aux disques, qui restent en place. Nous ne demandons votre accord qu’avant de toucher au stockage, et uniquement quand c’est le stockage qui est en panne.

**Un disque défaillant n’est pas lisible par le client suivant.** Les disques retirés du service sont effacés s’ils répondent encore, et détruits physiquement s’ils ne répondent plus. Un disque mort ne peut pas être effacé, il n’est donc jamais retourné à un fabricant sous garantie — nous absorbons ce coût plutôt que de laisser un disque ayant contenu vos données quitter le bâtiment intact.

## Entre deux clients

La même machine sera louée à nouveau après vous. Tout ce qui suit se produit avant qu’elle ne réintègre le catalogue, que quelqu’un le demande ou non.

**Étapes de désaffectation entre deux clients**

| Étape | Ce qui se passe | Vérifié par |
|---|---|---|
| 1. Réseau | La machine est coupée de son port public dès que la durée d’engagement se termine. Rien n’y reste accessible pendant qu’elle attend. | État du port, journalisé |
| 2. Stockage | Chaque périphérique NVMe reçoit un effacement cryptographique complet, puis un écrasement en une passe de tout l’espace d’adressage. | Échantillon de relecture sur chaque périphérique |
| 3. Mémoire GPU | Les cartes sont réinitialisées et leur mémoire effacée ; les compteurs ECC sont relevés et comparés aux valeurs enregistrées lors du rodage. | Journal de réinitialisation `nvidia-smi` |
| 4. Firmware | Les réglages du BMC et du BIOS sont reflashés vers notre référence, ce qui annule toute modification effectuée pendant la durée d’engagement. | Somme de contrôle par rapport à la référence |
| 5. Identité | Identifiants IPMI renouvelés, adresses IP rendues au pool, rDNS effacé. | Adresse retenue jusqu’à ce qu’elle soit propre |

C’est aussi pourquoi nous ne pouvons rien restaurer après la fin d’une durée d’engagement. Il n’y a pas de délai de grâce pendant lequel vos données existeraient encore quelque part — l’étape 2 a déjà été exécutée. Si vous en avez besoin, récupérez-les depuis la machine avant la fin de la durée d’engagement.

## Ce que nous ne ferons pas

**Partitionner une carte.** Pas de MIG, pas de vGPU, pas de time-slicing. Un seul client par GPU physique, ce qui rend reproductible le débit indiqué sur la fiche.

**Surallouer un nœud.** Il n’y a pas de second compte sur la machine, ni d’hyperviseur entre vous et le matériel physique.

**Revendre la capacité de quelqu’un d’autre.** Chaque carte de cette page est une carte que nous avons achetée et installée en baie. Rien ici n’est une marge de revendeur sur un autre cloud.

**Substituer une carte différente.** Si le modèle que vous avez commandé ne peut pas être livré, nous ne vous envoyons pas discrètement un quasi-équivalent — nous vous prévenons et remboursons la durée d’engagement.

**Entrer dans votre système d’exploitation.** Le root est à vous seul. Nous disposons de l’IPMI, qui peut redémarrer la machine et monter des médias ; nous ne détenons aucun identifiant de connexion à l’intérieur de votre machine.

**Conserver une copie de quoi que ce soit.** Nous ne faisons aucune sauvegarde de vos disques. Les snapshots n’existent que si vous les achetez, et ils sont supprimés à la fin de la durée d’engagement.

## La spécification indiquée sur la ligne est la spécification que vous obtenez.

Chaque carte ci-dessus est disponible dans les 6 centres de données, installées en baie et rodées, avec une image prête à écrire.

[Parcourir le catalogue](https://gpuserver.io/fr/#catalog) [Lire les guides](https://gpuserver.io/fr/guides)

## Pages liées

- [Réseau Ports sans compteur jusqu’à 25 Gbit/s, deux opérateurs et un IX par site, filtrage DDoS permanent, IPv6 routé — et quatre choses que nous n’offrons pas, en clair.](https://gpuserver.io/fr/network)
- [Documentation Premier SSH, vérification du matériel, conteneurs CUDA, servir un modèle avec vLLM, RAID, pare-feu, IPMI et réinstallations — les commandes, sur une machine réelle.](https://gpuserver.io/fr/docs)
- [Accord de niveau de service L’engagement de 99,9 % : la définition d’une panne, la mesure externe, cinq minutes de durée d’engagement rendues par minute perdue, et les exclusions en détail.](https://gpuserver.io/fr/legal/sla)
- [À propos Qui gère gpuserver.io, pourquoi nous achetons le matériel au lieu de le revendre, et les quatre règles jamais transigées — y compris celles qui coûtent des ventes.](https://gpuserver.io/fr/about)

---

Source : https://gpuserver.io/fr/hardware/. Ce fichier est généré à partir des mêmes données que le site ; si un chiffre ici diffère d’une page, la page fait foi et ce fichier est obsolète — la source canonique est https://gpuserver.io/.
