Tutti i 6 data center operativi

Pagamento in cripto · Nessuna verifica d’identità · Accesso root in in meno di 5 minuti

Infrastruttura

Cosa montiamo in rack, e cosa succede quando si rompe.

Un server dedicato è una promessa su un oggetto fisico. Questa pagina descrive quell’oggetto: quali schede acquistiamo, come un nodo viene testato prima di accogliere un inquilino, e cosa facciamo il giorno in cui uno di essi si guasta.

  • 12Modelli di GPU che gestiamo
  • 72 hrodaggio prima che un nodo prenda un inquilino
  • 4 hobiettivo per sostituire l’hardware guasto
  • 0schede rivendute da un altro provider

Ogni scheda che gestiamo

Questo è l’elenco completo — non esiste alcun livello non elencato né alcuna scheda che teniamo da parte per gli account più grandi. La larghezza di banda della memoria è indicata perché, per l’inferenza, prevede il throughput molto meglio di qualsiasi valore in teraflop.

Modelli di GPU, architettura, memoria, larghezza di banda, dimensioni del nodo e prezzo di ingresso
Scheda Architettura Memoria Larghezza di banda Dimensioni del nodo Da
L4 Scheda PCIe add-in Ada Lovelace 24 GB GDDR6 300 GB/s 1×, 2×, 4×, 8×, 10× $125/mese
RTX 4090 Scheda PCIe add-in Ada Lovelace 24 GB GDDR6X 1,008 GB/s 1×, 2×, 4×, 8× $193/mese
RTX 5090 Scheda PCIe add-in Blackwell 32 GB GDDR7 1,792 GB/s 1×, 2×, 4×, 8× $335/mese
RTX A6000 Scheda PCIe add-in Ampere 48 GB GDDR6 ECC 768 GB/s 1×, 2×, 4×, 8× $286/mese
L40S Scheda PCIe add-in Ada Lovelace 48 GB GDDR6 ECC 864 GB/s 1×, 2×, 4×, 8× $714/mese
A100 PCIe Scheda PCIe add-in Ampere 40 GB HBM2 1,555 GB/s 1×, 2×, 4×, 8× $392/mese
A100 PCIe Scheda PCIe add-in Ampere 80 GB HBM2e 1,935 GB/s 1×, 2×, 4×, 8× $1,091/mese
H100 PCIe Scheda PCIe add-in Hopper 80 GB HBM3 2,000 GB/s 1×, 2×, 4×, 8× $1,469/mese
A100 SXM4 Modulo SXM, scheda HGX Ampere 80 GB HBM2e 2,039 GB/s 4×, 8× $4,395/mese
H100 SXM5 Modulo SXM, scheda HGX Hopper 80 GB HBM3 3,350 GB/s 4×, 8× $6,061/mese
H200 SXM5 Modulo SXM, scheda HGX Hopper 141 GB HBM3e 4,800 GB/s 4×, 8× $8,405/mese
B200 SXM6 Modulo SXM, scheda HGX Blackwell 180 GB HBM3e 8,000 GB/s 4×, 8× $11,790/mese

Ogni scheda è un componente retail o OEM acquistato nuovo, con la garanzia intestata a noi. Non acquistiamo scorte ex-mining, e non acquistiamo schede di cui non possiamo ricostruire la storia — una RTX 4090 usata costa poco per un motivo, e quel motivo si presenta al quarto mese.

Cosa circonda le schede

Una GPU affamata di CPU, RAM o throughput del disco è un modo costoso per aspettare. Lo chassis è scelto in base al numero di schede, non venduto come percorso di upgrade.

Specifiche dello chassis per numero di GPU
Nodo CPU RAM di sistema Storage locale Porta
1 × GPU AMD Ryzen 9 7950X 16 core / 32 thread · o Intel Xeon Silver 4410Y 128 GB 2 × 2 TB NVMeGen4 U.2, nessun RAID imposto 1 Gbit/s
2 × GPU AMD Threadripper 7960X 24 core / 48 thread · o Intel Xeon Gold 5416S 256 GB 2 × 3.84 TB NVMeGen4 U.2, nessun RAID imposto 2 Gbit/s
4 × GPU AMD Threadripper 7970X 32 core / 64 thread · o 2 × Intel Xeon Gold 6438Y+ 512 GB 4 × 3.84 TB NVMeGen4 U.2, nessun RAID imposto 10 Gbit/s
8 × GPU 2 × Intel Xeon Gold 6438Y+ 64 core · o 2 × Intel Xeon Platinum 8462Y+ 1 TB 8 × 3.84 TB NVMeGen4 U.2, nessun RAID imposto 25 Gbit/s
10 × GPU 2 × Intel Xeon Platinum 8462Y+ 64 core · o 2 × Intel Xeon Platinum 8462Y+ 1 TB 8 × 7.68 TB NVMeGen4 U.2, nessun RAID imposto 25 Gbit/s

Quando sono elencate due CPU, può essere consegnata una delle due — sono abbinate per numero di core e canali di memoria, e il configuratore Le mostra quale ha il Suo nodo prima di pagare. I dischi vengono consegnati grezzi: non imponiamo alcun livello RAID, perché quello giusto dipende dal fatto che Lei stia salvando checkpoint o un dataset che può riscaricare.

Prima che un nodo venga messo a noleggio

Una macchina entra nel catalogo solo dopo aver trascorso tre giorni senza guastarsi. Quasi ogni scheda destinata a guastarsi presto lo fa qui, nelle nostre mani, non nelle sue.

FASE 1 · 2 ORE

Assemblaggio e inventario

I numeri di serie di ogni scheda, modulo e disco vengono registrati in associazione allo chassis. Questo registro è ciò che ci permette di dirle, in seguito, esattamente quale componente fisico si trova nella sua macchina.

FASE 2 · 24 ORE

Test di carico prolungato di memoria e calcolo

Test con pattern ECC sull’intera VRAM su ogni scheda, seguiti da moltiplicazioni di matrici sostenute al 100% di utilizzo. Un solo errore non correggibile e la scheda torna nella scatola.

FASE 3 · 24 ORE

Sollecitazione termica e di potenza

L’intero nodo viene mantenuto a pieno carico mentre la temperatura in ingresso viene portata al caso peggiore della sala. Registriamo la frequenza che le schede sostengono realmente — non il valore boost indicato sulla confezione — e un nodo che scende sotto le specifiche per throttling viene rimontato o riceve nuova pasta termica prima di essere testato di nuovo.

FASE 4 · 24 ORE

Interconnessione e storage

Larghezza di banda peer-to-peer NVLink o PCIe misurata scheda per scheda, resistenza in scrittura NVMe campionata, porta mantenuta al line rate. I numeri vengono confrontati con quelli degli altri nodi dello stesso modello, perché un nodo il 15% più lento è un nodo con un problema.

POI · MONTATO IN RACK E IN ATTESA

Disponibile, con un’immagine pronta da scrivere

Ecco perché la consegna è in meno di 5 minuti e non un giorno lavorativo: nulla viene assemblato quando ordina. La macchina esiste già, accesa e testata, e il Suo pagamento avvia la scrittura di un’immagine, non una costruzione.

Firmware e driver

Stack di driver Installato, con versione bloccata, libero di cambiarlo Ogni immagine Linux viene fornita con un driver NVIDIA aggiornato, CUDA, cuDNN e NCCL già funzionanti. Nulla le impedisce di sostituire tutto quanto — è il suo root.
Aggiornamenti firmware Mai durante la sua durata BIOS, BMC e VBIOS vengono impostati prima che il nodo entri nel catalogo. Non applichiamo aggiornamenti firmware a una macchina che qualcuno sta noleggiando; vengono applicati tra un inquilino e l’altro.
Clock In stock, e sbloccato per lei Spediamo ogni scheda alla sua frequenza di riferimento e al suo limite di potenza. Può alzarli o abbassarli con nvidia-smi; la conseguenza sulla garanzia è nostra, non Sua.
Accesso fuori banda IPMI, su una rete separata Alimentazione remota, console seriale e supporti virtuali, raggiungibili anche quando il sistema operativo non lo è. Si trova su una VLAN di gestione che non tocca mai la sua porta pubblica.

Quando qualcosa si guasta

L’hardware si guasta. Ciò che distingue i provider non è se succede, ma come si presentano le quattro ore successive.

I pezzi di ricambio sono in sede

Ogni sala dispone di schede di scorta, alimentatori, dischi e uno chassis completo per modello. Una sostituzione è una camminata lungo un corridoio, non una prenotazione con corriere.

Obiettivo di quattro ore

Dalla sua segnalazione all’hardware funzionante, 24 ore su 24. Se non rispettiamo il termine, lo SLA estende automaticamente la sua durata — non deve richiederlo.

I Suoi dischi restano Suoi

Una GPU o un alimentatore guasti vengono sostituiti lasciando i dischi intatti e al loro posto. Chiediamo il permesso solo prima di toccare lo storage, e solo quando è lo storage ad essersi guastato.

Un disco guasto non è leggibile dall’inquilino successivo. I dischi rimossi dal servizio vengono cancellati se rispondono ancora, e distrutti fisicamente se non rispondono. Un disco morto non può essere cancellato, quindi non viene mai restituito a un produttore in garanzia — assorbiamo quel costo piuttosto che lasciare che un disco che un tempo conteneva i suoi dati lasci l’edificio intatto.

Tra due inquilini

La stessa macchina verrà noleggiata di nuovo dopo di Lei. Tutto ciò che segue avviene prima che rientri nel catalogo, che qualcuno lo chieda o meno.

Fasi di dismissione tra due inquilini
FaseCosa succedeVerificato da
1. ReteLa macchina viene scollegata dalla sua porta pubblica nel momento in cui la durata termina. Nulla resta raggiungibile mentre è in attesa.Stato della porta, registrato
2. StorageOgni dispositivo NVMe riceve una cancellazione crittografica completa, seguita da una sovrascrittura a passaggio singolo dell’intero spazio di indirizzamento.Campione di rilettura su ogni dispositivo
3. Memoria GPULe schede vengono resettate e la loro memoria cancellata; i contatori ECC vengono letti e confrontati con i valori registrati durante il rodaggio.log di reset di nvidia-smi
4. FirmwareLe impostazioni di BMC e BIOS vengono riscritte secondo il nostro riferimento, scartando qualsiasi modifica effettuata durante la durata.Checksum rispetto al riferimento
5. IdentitàCredenziali IPMI ruotate, indirizzi IP restituiti al pool, rDNS azzerato.Indirizzo trattenuto finché non è pulito

Questo è anche il motivo per cui non possiamo ripristinare nulla dopo la fine della durata. Non c’è alcun periodo di grazia durante il quale i Suoi dati esistano ancora da qualche parte — la fase 2 è già stata eseguita. Se Le servono, li tolga dalla macchina prima che la durata si concluda.

Cosa non faremo

Partizionare una scheda. Niente MIG, niente vGPU, niente time-slicing. Un inquilino per GPU fisica, il che rende riproducibile il throughput indicato nell’inserzione.

Sovrallocare un nodo. Non esiste un secondo account sulla macchina, né un hypervisor tra lei e il metallo.

Rivendere la capacità di qualcun altro. Ogni scheda in questa pagina è una scheda che abbiamo acquistato e montato in rack. Niente qui è un margine da rivenditore su un altro cloud.

Sostituire con una scheda diversa. Se il modello ordinato non può essere consegnato, non spediamo silenziosamente un quasi-equivalente — glielo diciamo e rimborsiamo la durata.

Accedere al suo sistema operativo. Il root è solo suo. Disponiamo di IPMI, che può riavviare l’alimentazione e montare supporti; non deteniamo un accesso all’interno della sua macchina.

Conservare una copia di qualsiasi cosa. Non eseguiamo backup dei suoi dischi. Gli snapshot esistono solo se li acquista, e vengono eliminati alla fine della durata.

La specifica indicata nella riga è la specifica che riceve.

Ogni scheda sopra elencata è disponibile in tutti i 6 data center, montata in rack e sottoposta a rodaggio, con un’immagine pronta da scrivere.

Accedi

Console, ricevute e accesso fuori banda.

Non ha ancora un account?

Non esiste una registrazione separata. Il suo account viene creato mentre effettua il suo primo ordine — sceglie l’email e la password nella fase di pagamento, e la console è già aperta quando lo è la macchina.

Configura un server

Language