Du paiement confirmé au premier token.
Ce qui arrive dans votre message de livraison, ce qui est déjà installé, et les commandes exactes pour la première heure. Tout ce qui suit s’exécute en root sur une machine tout juste livrée.
- moins de 5 minutesdu paiement au message ci-dessous
- 10images que nous pouvons écrire pour vous
- rootpas de sudo, pas de jump host, pas de console
- 22le seul port ouvert à la livraison
Ce qui arrive
Un seul message, moins de 5 minutes après la confirmation du paiement. Il contient tout ce dont vous avez besoin, rien à parcourir en cliquant.
Première connexion
Rien à accepter, aucun agent à installer. Si vous avez fourni une clé publique dans le configurateur, elle se trouve déjà dans /root/.ssh/authorized_keys.
$ ssh root@203.0.113.42
# Ensuite, avant toute chose — l’empreinte dans le message de livraison
# doit correspondre à celle imprimée ici :
$ ssh-keygen -lf /etc/ssh/ssh_host_ed25519_key.pub
Si vous avez envoyé une clé, désactivez le mot de passe. Cela coûte une seule commande et supprime le seul identifiant qui puisse être deviné.
# Confirmez D’ABORD que votre clé fonctionne — dans un second terminal, en restant connecté ici.
$ sed -i 's/^#\?PasswordAuthentication.*/PasswordAuthentication no/' /etc/ssh/sshd_config
$ systemctl reload ssh
Vérifier le matériel
Faites cela dans les dix premières minutes. Vous avez une machine que vous n’avez pas vue, et le décompte du SLA sur une panne matérielle démarre quand vous nous le signalez.
$ nvidia-smi --query-gpu=index,name,serial,memory.total,pcie.link.gen.current --format=csv
index, name, serial, memory.total [MiB], pcie.link.gen.current
0, NVIDIA H100 80GB HBM3, 1650123456789, 81559 MiB, 5
1, NVIDIA H100 80GB HBM3, 1650123456790, 81559 MiB, 5
# Sur un nœud multi-GPU, vérifiez que la topologie correspond à ce que vous avez payé.
# NV# signifie NVLink ; PIX/PHB/SYS signifient que le trafic passe par PCIe.
$ nvidia-smi topo -m
# Maintenez chaque carte en charge pendant deux minutes et observez la fréquence à laquelle elle se stabilise.
$ nvidia-smi -q -d PERFORMANCE,TEMPERATURE,CLOCK | grep -E 'Slowdown|SW Power|Graphics *:'
# Disques : vérifiez le nombre et le modèle par rapport au message de livraison.
$ lsblk -d -o NAME,MODEL,SIZE,ROTA
$ nvme list
Ce qui est préinstallé
Choisissez un système d’exploitation dans le configurateur, et éventuellement une pile logicielle par-dessus. Tout ce qui suit est écrit avant la livraison, pas téléchargé au premier démarrage.
| Image | À quoi ça sert | VRAM minimum | OS |
|---|---|---|---|
| vLLM 0.11 | Servir des grands modèles de langage | 24 GB | Linux |
| SGLang 0.5 | Servir des grands modèles de langage | 24 GB | Linux |
| Text Generation Inference | Servir des grands modèles de langage | 24 GB | Linux |
| Ollama 0.12 | Servir des grands modèles de langage | 8 GB | Linux |
| Axolotl 0.8 | Entraînement et fine-tuning | 24 GB | Linux |
| PyTorch 2.9 · CUDA 12.8 | Entraînement et fine-tuning | 8 GB | Linux |
| ComfyUI | Génération d’images et de vidéos | 12 GB | Linux |
| JupyterLab · CUDA | Entraînement et fine-tuning | 8 GB | Linux |
| Blender 4.5 | Rendu 3D | 8 GB | Linux ou Windows |
| Votre propre image Docker | Tout ce que vous apportez | Toute quantité | Linux |
Chaque image Linux, quelle que soit la pile choisie, dispose déjà d’un pilote NVIDIA fonctionnel, de CUDA, cuDNN et NCCL. Vous êtes libre de tout remplacer — c’est votre root, et une réinstallation ne coûte rien et n’est pas limitée en fréquence.
Conteneurs et CUDA
Docker et le NVIDIA Container Toolkit sont installés et configurés. La vérification ci-dessous vaut trente secondes, car un conteneur qui ne voit pas les cartes échoue de façon confuse bien plus tard.
$ docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi
# Les tâches multi-GPU ont aussi besoin de mémoire partagée et d’IPC, que les limites par défaut cassent.
# Ces trois options sont la cause habituelle d’un blocage silencieux de NCCL :
$ docker run --rm --gpus all --ipc=host --shm-size=16g --ulimit memlock=-1 …
Servir un modèle
Le chemin utile le plus court entre une machine livrée et un point de terminaison compatible OpenAI. Remplacez le modèle par le vôtre : ce sont les options qui comptent.
$ docker run -d --name vllm --gpus all --ipc=host -p 8000:8000 \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--max-model-len 8192 \
--gpu-memory-utilization 0.92
# Sur un nœud multi-GPU, répartissez sur toutes les cartes du boîtier :
$ … --tensor-parallel-size 4
# Ensuite, depuis votre propre machine :
$ curl http://203.0.113.42:8000/v1/models
Savoir si un modèle donné tient sur une machine donnée relève du calcul, pas de l’opinion — les poids, plus un cache clef/valeur qui croît avec la longueur de contexte. Le configurateur fait ce calcul pour chaque configuration avant que vous payiez, et le guide de dimensionnement VRAM montre la formule, pour que vous puissiez vérifier la nôtre.
Disques et stockage
Les disques sont livrés bruts au-delà du volume système. Nous n’imposons aucun niveau de RAID, car le bon choix dépend du fait que vous conserviez des checkpoints que vous ne pouvez pas perdre, ou un jeu de données que vous pouvez retélécharger en une heure.
# Vérifiez d’abord ce qui n’est pas utilisé — ceci détruit les données sur les périphériques nommés.
$ lsblk
$ mdadm --create /dev/md0 --level=0 --raid-devices=2 /dev/nvme1n1 /dev/nvme2n1
$ mkfs.ext4 -E lazy_itable_init=0,lazy_journal_init=0 /dev/md0
$ mkdir -p /scratch && mount /dev/md0 /scratch
$ echo '/dev/md0 /scratch ext4 defaults,noatime 0 2' >> /etc/fstab
Des NVMe supplémentaires, un HDD d’archive et des snapshots hors machine sont des options mensuelles, ajoutables dans le configurateur ou par la suite. Les disques locaux ne sont pas sauvegardés par nous et ne le seront jamais — voir snapshots ci-dessous.
Pare-feu et ports
Tout est ouvert en entrée, sauf ce que votre propre machine bloque : il n’y a aucun filtre réseau devant vous, c’est délibéré et cela place la responsabilité ici. Le port 25 en sortie est la seule exception, fermé en amont jusqu’à ce que vous en fassiez la demande.
$ ufw default deny incoming
$ ufw default allow outgoing
$ ufw allow 22/tcp
$ ufw allow from 198.51.100.7 to any port 8000 proto tcp
$ ufw --force enable
# Plus sûr que d’ouvrir un port : gardez le service sur localhost
# et créez un tunnel vers celui-ci depuis votre propre machine.
$ ssh -N -L 8000:127.0.0.1:8000 root@203.0.113.42
IPMI et réinstallation
L’accès hors bande est présent sur chaque machine, sur sa propre adresse. C’est ce qui permet de récupérer une machine dont vous vous êtes verrouillé l’accès, à trois heures du matin, sans avoir à demander à personne.
Alimentation
Cycle d’alimentation forcé, arrêt propre, et l’état d’alimentation du châssis — indépendamment du fait que le système d’exploitation réponde ou non.
Console série et KVM
L’écran que la machine afficherait sur un moniteur, y compris le chargeur de démarrage et un kernel panic. C’est ici que vous réparez un fstab cassé.
Média virtuel
Montez n’importe quel ISO via le réseau et démarrez dessus. Cela inclut une image de secours, et cela inclut un système d’exploitation que nous ne proposons pas.
Une réinstallation propre vers n’importe quelle image que nous proposons se demande auprès de nous et prend à peu près le même temps que la livraison initiale. Cela ne coûte rien, il n’y a pas de limite de fréquence, et la machine conserve ses adresses. Tout ce qui se trouve sur les disques est détruit par l’opération — c’est le principe même d’une réinstallation, et il n’y a pas de retour en arrière.
Snapshots
Optionnelles, mensuelles, hors de la machine. Si vous ne les prenez pas, aucune copie de vos données n’existe ailleurs que sur vos propres disques — ce qui est le bon réglage par défaut pour l’essentiel de ce qui tourne sur un GPU, et un désastre pour le reste.
Fin de la durée d’engagement
Une durée d’engagement mensuelle s’arrête à la fin du mois payé, sans préavis et sans frais de résiliation. Ce qui se passe ensuite n’est pas réversible, c’est pourquoi c’est détaillé ici plutôt que dans une note de bas de page.
- Rien ne se renouvelle tout seul. Il n’y a ni carte bancaire enregistrée ni prélèvement automatique — une durée d’engagement ne se poursuit que parce que vous avez payé la suivante.
- Le port public est coupé au moment où la durée d’engagement se termine. La machine cesse d’être joignable immédiatement, pas à la fin d’un jour de grâce.
- Les disques sont effacés dans l’heure. Effacement cryptographique, puis une réécriture complète. Il n’existe aucune fenêtre pendant laquelle vos données existent encore quelque part.
- Les snapshots partent avec elle. Si vous les avez achetés, ils sont supprimés dans la même opération.
- L’adresse retourne dans le pool. Après une période de blocage, et seulement une fois qu’elle est propre.
Tout ce qui précède fonctionne sur chaque machine du catalogue.
Il n’existe aucun palier où IPMI, les réinstallations ou la bande passante sans compteur coûtent plus cher. Choisissez une carte, choisissez un site, et le reste de cette page s’applique.
Pages liées
- GuidesHuit guides pratiques : VRAM, NVLink face à PCIe, modèles d’image et vidéo, mensuel face à horaire, auto-hébergement face à une API, servir Llama 70B, et QLoRA.
- Politique matérielleLes douze GPU NVIDIA exploités, le rodage de 72 heures avant la vente d’un nœud, le remplacement sous quatre heures, et l’effacement des disques entre clients.
- RéseauPorts sans compteur jusqu’à 25 Gbit/s, deux opérateurs et un IX par site, filtrage DDoS permanent, IPv6 routé — et quatre choses que nous n’offrons pas, en clair.
- À proposQui gère gpuserver.io, pourquoi nous achetons le matériel au lieu de le revendre, et les quatre règles jamais transigées — y compris celles qui coûtent des ventes.