Cosa montiamo in rack, e cosa succede quando si rompe.
Un server dedicato è una promessa su un oggetto fisico. Questa pagina descrive quell’oggetto: quali schede acquistiamo, come un nodo viene testato prima di accogliere un inquilino, e cosa facciamo il giorno in cui uno di essi si guasta.
- 12Modelli di GPU che gestiamo
- 72 hrodaggio prima che un nodo prenda un inquilino
- 4 hobiettivo per sostituire l’hardware guasto
- 0schede rivendute da un altro provider
Ogni scheda che gestiamo
Questo è l’elenco completo — non esiste alcun livello non elencato né alcuna scheda che teniamo da parte per gli account più grandi. La larghezza di banda della memoria è indicata perché, per l’inferenza, prevede il throughput molto meglio di qualsiasi valore in teraflop.
| Scheda | Architettura | Memoria | Larghezza di banda | Dimensioni del nodo | Da |
|---|---|---|---|---|---|
| L4 | Ada Lovelace | 24 GB | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/mese |
| RTX 4090 | Ada Lovelace | 24 GB | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/mese |
| RTX 5090 | Blackwell | 32 GB | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/mese |
| RTX A6000 | Ampere | 48 GB | 768 GB/s | 1×, 2×, 4×, 8× | $286/mese |
| L40S | Ada Lovelace | 48 GB | 864 GB/s | 1×, 2×, 4×, 8× | $714/mese |
| A100 PCIe | Ampere | 40 GB | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/mese |
| A100 PCIe | Ampere | 80 GB | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/mese |
| H100 PCIe | Hopper | 80 GB | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/mese |
| A100 SXM4 | Ampere | 80 GB | 2,039 GB/s | 4×, 8× | $4,395/mese |
| H100 SXM5 | Hopper | 80 GB | 3,350 GB/s | 4×, 8× | $6,061/mese |
| H200 SXM5 | Hopper | 141 GB | 4,800 GB/s | 4×, 8× | $8,405/mese |
| B200 SXM6 | Blackwell | 180 GB | 8,000 GB/s | 4×, 8× | $11,790/mese |
Ogni scheda è un componente retail o OEM acquistato nuovo, con la garanzia intestata a noi. Non acquistiamo scorte ex-mining, e non acquistiamo schede di cui non possiamo ricostruire la storia — una RTX 4090 usata costa poco per un motivo, e quel motivo si presenta al quarto mese.
Cosa circonda le schede
Una GPU affamata di CPU, RAM o throughput del disco è un modo costoso per aspettare. Lo chassis è scelto in base al numero di schede, non venduto come percorso di upgrade.
| Nodo | CPU | RAM di sistema | Storage locale | Porta |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X | 128 GB | 2 × 2 TB NVMe | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X | 256 GB | 2 × 3.84 TB NVMe | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X | 512 GB | 4 × 3.84 TB NVMe | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ | 1 TB | 8 × 3.84 TB NVMe | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMe | 25 Gbit/s |
Quando sono elencate due CPU, può essere consegnata una delle due — sono abbinate per numero di core e canali di memoria, e il configuratore Le mostra quale ha il Suo nodo prima di pagare. I dischi vengono consegnati grezzi: non imponiamo alcun livello RAID, perché quello giusto dipende dal fatto che Lei stia salvando checkpoint o un dataset che può riscaricare.
Prima che un nodo venga messo a noleggio
Una macchina entra nel catalogo solo dopo aver trascorso tre giorni senza guastarsi. Quasi ogni scheda destinata a guastarsi presto lo fa qui, nelle nostre mani, non nelle sue.
FASE 1 · 2 ORE
Assemblaggio e inventario
I numeri di serie di ogni scheda, modulo e disco vengono registrati in associazione allo chassis. Questo registro è ciò che ci permette di dirle, in seguito, esattamente quale componente fisico si trova nella sua macchina.
FASE 2 · 24 ORE
Test di carico prolungato di memoria e calcolo
Test con pattern ECC sull’intera VRAM su ogni scheda, seguiti da moltiplicazioni di matrici sostenute al 100% di utilizzo. Un solo errore non correggibile e la scheda torna nella scatola.
FASE 3 · 24 ORE
Sollecitazione termica e di potenza
L’intero nodo viene mantenuto a pieno carico mentre la temperatura in ingresso viene portata al caso peggiore della sala. Registriamo la frequenza che le schede sostengono realmente — non il valore boost indicato sulla confezione — e un nodo che scende sotto le specifiche per throttling viene rimontato o riceve nuova pasta termica prima di essere testato di nuovo.
FASE 4 · 24 ORE
Interconnessione e storage
Larghezza di banda peer-to-peer NVLink o PCIe misurata scheda per scheda, resistenza in scrittura NVMe campionata, porta mantenuta al line rate. I numeri vengono confrontati con quelli degli altri nodi dello stesso modello, perché un nodo il 15% più lento è un nodo con un problema.
POI · MONTATO IN RACK E IN ATTESA
Disponibile, con un’immagine pronta da scrivere
Ecco perché la consegna è in meno di 5 minuti e non un giorno lavorativo: nulla viene assemblato quando ordina. La macchina esiste già, accesa e testata, e il Suo pagamento avvia la scrittura di un’immagine, non una costruzione.
Firmware e driver
nvidia-smi; la conseguenza sulla garanzia è nostra, non Sua.
Quando qualcosa si guasta
L’hardware si guasta. Ciò che distingue i provider non è se succede, ma come si presentano le quattro ore successive.
I pezzi di ricambio sono in sede
Ogni sala dispone di schede di scorta, alimentatori, dischi e uno chassis completo per modello. Una sostituzione è una camminata lungo un corridoio, non una prenotazione con corriere.
Obiettivo di quattro ore
Dalla sua segnalazione all’hardware funzionante, 24 ore su 24. Se non rispettiamo il termine, lo SLA estende automaticamente la sua durata — non deve richiederlo.
I Suoi dischi restano Suoi
Una GPU o un alimentatore guasti vengono sostituiti lasciando i dischi intatti e al loro posto. Chiediamo il permesso solo prima di toccare lo storage, e solo quando è lo storage ad essersi guastato.
Tra due inquilini
La stessa macchina verrà noleggiata di nuovo dopo di Lei. Tutto ciò che segue avviene prima che rientri nel catalogo, che qualcuno lo chieda o meno.
| Fase | Cosa succede | Verificato da |
|---|---|---|
| 1. Rete | La macchina viene scollegata dalla sua porta pubblica nel momento in cui la durata termina. Nulla resta raggiungibile mentre è in attesa. | Stato della porta, registrato |
| 2. Storage | Ogni dispositivo NVMe riceve una cancellazione crittografica completa, seguita da una sovrascrittura a passaggio singolo dell’intero spazio di indirizzamento. | Campione di rilettura su ogni dispositivo |
| 3. Memoria GPU | Le schede vengono resettate e la loro memoria cancellata; i contatori ECC vengono letti e confrontati con i valori registrati durante il rodaggio. | log di reset di nvidia-smi |
| 4. Firmware | Le impostazioni di BMC e BIOS vengono riscritte secondo il nostro riferimento, scartando qualsiasi modifica effettuata durante la durata. | Checksum rispetto al riferimento |
| 5. Identità | Credenziali IPMI ruotate, indirizzi IP restituiti al pool, rDNS azzerato. | Indirizzo trattenuto finché non è pulito |
Questo è anche il motivo per cui non possiamo ripristinare nulla dopo la fine della durata. Non c’è alcun periodo di grazia durante il quale i Suoi dati esistano ancora da qualche parte — la fase 2 è già stata eseguita. Se Le servono, li tolga dalla macchina prima che la durata si concluda.
Cosa non faremo
Partizionare una scheda. Niente MIG, niente vGPU, niente time-slicing. Un inquilino per GPU fisica, il che rende riproducibile il throughput indicato nell’inserzione.
Sovrallocare un nodo. Non esiste un secondo account sulla macchina, né un hypervisor tra lei e il metallo.
Rivendere la capacità di qualcun altro. Ogni scheda in questa pagina è una scheda che abbiamo acquistato e montato in rack. Niente qui è un margine da rivenditore su un altro cloud.
Sostituire con una scheda diversa. Se il modello ordinato non può essere consegnato, non spediamo silenziosamente un quasi-equivalente — glielo diciamo e rimborsiamo la durata.
Accedere al suo sistema operativo. Il root è solo suo. Disponiamo di IPMI, che può riavviare l’alimentazione e montare supporti; non deteniamo un accesso all’interno della sua macchina.
Conservare una copia di qualsiasi cosa. Non eseguiamo backup dei suoi dischi. Gli snapshot esistono solo se li acquista, e vengono eliminati alla fine della durata.
La specifica indicata nella riga è la specifica che riceve.
Ogni scheda sopra elencata è disponibile in tutti i 6 data center, montata in rack e sottoposta a rodaggio, con un’immagine pronta da scrivere.
Pagine correlate
- RetePorte senza contatore fino a 25 Gbit/s, due carrier e un IX per sede, DDoS sempre filtrato, IPv6 instradato — e quattro cose che non offriamo, dette subito.
- DocumentazionePrimo SSH, verifica dell’hardware, container CUDA, serving di un modello con vLLM, RAID, firewall, IPMI e reinstallazioni — i comandi, su una macchina reale.
- Accordo sul livello di servizioL’impegno del 99,9%: cosa conta come downtime, come viene misurato dall’esterno, cinque minuti di durata in più per ogni minuto perso, e le esclusioni per intero.
- Chi siamoChi gestisce gpuserver.io, perché compriamo l’hardware invece di rivenderlo, e le quattro regole che non pieghiamo mai — comprese quelle che ci costano vendite.