Dal pagamento confermato al primo token.
Cosa arriva nel messaggio di consegna, cosa è già installato, e i comandi esatti per la prima ora. Tutto quanto segue viene eseguito come root su una macchina appena consegnata.
- in meno di 5 minutidal pagamento al messaggio qui sotto
- 10immagini che può farsi scrivere su richiesta
- rootniente sudo, niente jump host, niente console
- 22l’unica porta aperta alla consegna
Cosa arriva
Un solo messaggio, in meno di 5 minuti dopo la conferma del pagamento. Contiene tutto ciò che le serve e nulla su cui deve cliccare.
Prima connessione
Niente da accettare, nessun agente da installare. Se ci ha fornito una chiave pubblica nel configuratore, è già in /root/.ssh/authorized_keys.
$ ssh root@203.0.113.42
# Poi, prima di tutto — l’impronta nel messaggio di consegna
# deve corrispondere a quella stampata qui:
$ ssh-keygen -lf /etc/ssh/ssh_host_ed25519_key.pub
Se ha inviato una chiave, disattivi la password. Costa un solo comando e rimuove l’unica credenziale che si può indovinare.
# Verifichi PRIMA che la sua chiave funzioni — in un secondo terminale, restando collegato qui.
$ sed -i 's/^#\?PasswordAuthentication.*/PasswordAuthentication no/' /etc/ssh/sshd_config
$ systemctl reload ssh
Verifica dell’hardware
Lo faccia nei primi dieci minuti. Ha una macchina che non ha ancora visto, e il conteggio dello SLA per un guasto hardware inizia quando ce lo comunica.
$ nvidia-smi --query-gpu=index,name,serial,memory.total,pcie.link.gen.current --format=csv
index, name, serial, memory.total [MiB], pcie.link.gen.current
0, NVIDIA H100 80GB HBM3, 1650123456789, 81559 MiB, 5
1, NVIDIA H100 80GB HBM3, 1650123456790, 81559 MiB, 5
# Su un nodo multi-GPU, verifichi che la topologia corrisponda a quanto ha pagato.
# NV# indica NVLink; PIX/PHB/SYS indicano che il traffico passa su PCIe.
$ nvidia-smi topo -m
# Mantenga ogni scheda sotto carico per due minuti e osservi la frequenza a cui si stabilizza.
$ nvidia-smi -q -d PERFORMANCE,TEMPERATURE,CLOCK | grep -E 'Slowdown|SW Power|Graphics *:'
# Dischi: verifichi il numero e il modello rispetto al messaggio di consegna.
$ lsblk -d -o NAME,MODEL,SIZE,ROTA
$ nvme list
Cosa è preinstallato
Scelga un sistema operativo nel configuratore e, facoltativamente, uno stack sopra di esso. Tutto quanto segue viene scritto prima della consegna, non scaricato al primo avvio.
| Immagine | A cosa serve | VRAM minima | OS |
|---|---|---|---|
| vLLM 0.11 | Serving di modelli linguistici di grandi dimensioni | 24 GB | Linux |
| SGLang 0.5 | Serving di modelli linguistici di grandi dimensioni | 24 GB | Linux |
| Text Generation Inference | Serving di modelli linguistici di grandi dimensioni | 24 GB | Linux |
| Ollama 0.12 | Serving di modelli linguistici di grandi dimensioni | 8 GB | Linux |
| Axolotl 0.8 | Addestramento e fine-tuning | 24 GB | Linux |
| PyTorch 2.9 · CUDA 12.8 | Addestramento e fine-tuning | 8 GB | Linux |
| ComfyUI | Generazione di immagini e video | 12 GB | Linux |
| JupyterLab · CUDA | Addestramento e fine-tuning | 8 GB | Linux |
| Blender 4.5 | rendering 3D | 8 GB | Linux o Windows |
| La propria immagine Docker | Ciò che porta | Nessun minimo | Linux |
Ogni immagine Linux, qualunque stack scelga, ha già un driver NVIDIA, CUDA, cuDNN e NCCL funzionanti. È libero di sostituire tutto — è il suo root, e la reinstallazione non costa nulla e non ha limiti di frequenza.
Container e CUDA
Docker e il NVIDIA Container Toolkit sono installati e configurati. Il controllo qui sotto vale trenta secondi, perché un container che non vede le schede fallisce in un modo confuso molto più avanti.
$ docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi
# I job multi-GPU richiedono anche memoria condivisa e IPC, che i limiti predefiniti compromettono.
# Questi tre flag sono la causa più comune di un blocco silenzioso di NCCL:
$ docker run --rm --gpus all --ipc=host --shm-size=16g --ulimit memlock=-1 …
Serving di un modello
Il percorso utile più breve da una macchina consegnata a un endpoint compatibile con OpenAI. Sostituisca con il proprio modello; ciò che conta sono i flag.
$ docker run -d --name vllm --gpus all --ipc=host -p 8000:8000 \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--max-model-len 8192 \
--gpu-memory-utilization 0.92
# Su un nodo multi-GPU, suddivida il carico su tutte le schede della macchina:
$ … --tensor-parallel-size 4
# Poi, dalla sua macchina:
$ curl http://203.0.113.42:8000/v1/models
Se un determinato modello ci sta su una determinata macchina è aritmetica, non opinione — pesi, più una cache KV che cresce con la lunghezza del contesto. Il configuratore esegue questo calcolo per ogni configurazione prima del pagamento, e la guida al dimensionamento della VRAM mostra la formula, così può verificare la nostra.
Dischi e storage
I dischi vengono consegnati grezzi oltre il volume di sistema. Non imponiamo alcun livello RAID, perché quello corretto dipende dal fatto che lei stia conservando checkpoint che non può permettersi di perdere, oppure un dataset che può riscaricare in un’ora.
# Verifichi prima cosa non è utilizzato — questa operazione distrugge i dati sui dispositivi indicati.
$ lsblk
$ mdadm --create /dev/md0 --level=0 --raid-devices=2 /dev/nvme1n1 /dev/nvme2n1
$ mkfs.ext4 -E lazy_itable_init=0,lazy_journal_init=0 /dev/md0
$ mkdir -p /scratch && mount /dev/md0 /scratch
$ echo '/dev/md0 /scratch ext4 defaults,noatime 0 2' >> /etc/fstab
NVMe aggiuntivi, HDD di archiviazione e snapshot fuori macchina sono opzioni mensili, aggiungibili nel configuratore o in seguito. I dischi locali non vengono sottoposti a backup da parte nostra e non lo saranno mai — vedi gli snapshot qui sotto.
Firewall e porte
Tutto è aperto in ingresso, eccetto ciò che la sua stessa macchina blocca: non c’è alcun filtro di rete davanti a lei, il che è deliberato e pone la responsabilità qui. La porta 25 in uscita è l’unica eccezione, chiusa a monte finché non lo richiede.
$ ufw default deny incoming
$ ufw default allow outgoing
$ ufw allow 22/tcp
$ ufw allow from 198.51.100.7 to any port 8000 proto tcp
$ ufw --force enable
# Più sicuro che aprire una porta: mantenga il servizio su localhost
# e vi si colleghi tramite tunnel dalla sua macchina.
$ ssh -N -L 8000:127.0.0.1:8000 root@203.0.113.42
IPMI e reinstallazione
L’accesso fuori banda è presente su ogni macchina, con un indirizzo proprio. È così che recupera una macchina di cui ha perso l’accesso, alle tre del mattino, senza dover chiedere a nessuno.
Alimentazione
Riavvio forzato, arresto controllato e lo stato di alimentazione dello chassis — indipendentemente dal fatto che il sistema operativo risponda.
Console seriale e KVM
Lo schermo che la macchina mostrerebbe su un monitor, incluso il bootloader e un kernel panic. È qui che ripara un fstab danneggiato.
Supporto virtuale
Monti qualsiasi ISO in rete e la avvii. Questo include un’immagine di ripristino, e include anche un sistema operativo che non offriamo.
Una reinstallazione pulita con una qualsiasi immagine da noi offerta va richiesta a noi e richiede circa lo stesso tempo della consegna originale. Non costa nulla, non c’è alcun limite alla frequenza, e la macchina mantiene i suoi indirizzi. Tutto ciò che si trova sui dischi viene distrutto da essa — questo è lo scopo di una reinstallazione, e non è possibile annullarla.
Snapshot
Opzionali, mensili, fuori dalla macchina. Se non li acquista, nessuna copia dei suoi dati esiste al di fuori dei suoi stessi dischi — la scelta corretta per la maggior parte di ciò che gira su una GPU, e un disastro per il resto.
Fine della durata
Una durata mensile termina alla fine del mese pagato, senza periodo di preavviso e senza penale di cancellazione. Quello che succede dopo non è reversibile, quindi viene spiegato qui e non in una nota a piè di pagina.
- Niente si rinnova automaticamente. Non è registrata alcuna carta e non è previsto alcun addebito diretto — una durata prosegue solo perché ha pagato per quella successiva.
- La porta pubblica viene chiusa nel momento in cui la durata termina. La macchina smette di essere raggiungibile immediatamente, non al termine di un giorno di grazia.
- I dischi vengono cancellati entro un’ora. Cancellazione crittografica, seguita da una sovrascrittura completa. Non esiste alcun intervallo di tempo in cui i suoi dati esistono ancora da qualche parte.
- Gli snapshot se ne vanno insieme ad essa. Se li ha acquistati, vengono eliminati nello stesso passaggio.
- L’indirizzo torna al pool. Dopo un periodo di quarantena, e solo una volta ripulito.
Tutto quanto sopra funziona su ogni macchina del catalogo.
Non esiste un livello in cui IPMI, reinstallazioni o banda senza contatore costino extra. Scelga una scheda, scelga una sede, e il resto di questa pagina si applica.
Pagine correlate
- GuideOtto guide pratiche: dimensionamento VRAM, NVLink contro PCIe, modelli immagine e video, mensile contro orario, self-hosting contro API, serving Llama 70B e QLoRA.
- Politica hardwareLe dodici GPU NVIDIA che gestiamo, il rodaggio di 72 ore prima della vendita, la sostituzione in 4 ore, e come cancelliamo i dischi tra un inquilino e l’altro.
- RetePorte senza contatore fino a 25 Gbit/s, due carrier e un IX per sede, DDoS sempre filtrato, IPv6 instradato — e quattro cose che non offriamo, dette subito.
- Chi siamoChi gestisce gpuserver.io, perché compriamo l’hardware invece di rivenderlo, e le quattro regole che non pieghiamo mai — comprese quelle che ci costano vendite.