Infrastruttura

# Cosa montiamo in rack, e cosa succede quando si rompe.

Un server dedicato è una promessa su un oggetto fisico. Questa pagina descrive quell’oggetto: quali schede acquistiamo, come un nodo viene testato prima di accogliere un inquilino, e cosa facciamo il giorno in cui uno di essi si guasta.

- 12 Modelli di GPU che gestiamo
- 72 h rodaggio prima che un nodo prenda un inquilino
- 4 h obiettivo per sostituire l’hardware guasto
- 0 schede rivendute da un altro provider

## Ogni scheda che gestiamo

Questo è l’elenco completo — non esiste alcun livello non elencato né alcuna scheda che teniamo da parte per gli account più grandi. La larghezza di banda della memoria è indicata perché, per l’inferenza, prevede il throughput molto meglio di qualsiasi valore in teraflop.

**Modelli di GPU, architettura, memoria, larghezza di banda, dimensioni del nodo e prezzo di ingresso**

| Scheda | Architettura | Memoria | Larghezza di banda | Dimensioni del nodo | Da |
|---|---|---|---|---|---|
| L4 Scheda PCIe add-in | Ada Lovelace | 24 GB GDDR6 | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/mese |
| RTX 4090 Scheda PCIe add-in | Ada Lovelace | 24 GB GDDR6X | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/mese |
| RTX 5090 Scheda PCIe add-in | Blackwell | 32 GB GDDR7 | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/mese |
| RTX A6000 Scheda PCIe add-in | Ampere | 48 GB GDDR6 ECC | 768 GB/s | 1×, 2×, 4×, 8× | $286/mese |
| L40S Scheda PCIe add-in | Ada Lovelace | 48 GB GDDR6 ECC | 864 GB/s | 1×, 2×, 4×, 8× | $714/mese |
| A100 PCIe Scheda PCIe add-in | Ampere | 40 GB HBM2 | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/mese |
| A100 PCIe Scheda PCIe add-in | Ampere | 80 GB HBM2e | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/mese |
| H100 PCIe Scheda PCIe add-in | Hopper | 80 GB HBM3 | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/mese |
| A100 SXM4 Modulo SXM, scheda HGX | Ampere | 80 GB HBM2e | 2,039 GB/s | 4×, 8× | $4,395/mese |
| H100 SXM5 Modulo SXM, scheda HGX | Hopper | 80 GB HBM3 | 3,350 GB/s | 4×, 8× | $6,061/mese |
| H200 SXM5 Modulo SXM, scheda HGX | Hopper | 141 GB HBM3e | 4,800 GB/s | 4×, 8× | $8,405/mese |
| B200 SXM6 Modulo SXM, scheda HGX | Blackwell | 180 GB HBM3e | 8,000 GB/s | 4×, 8× | $11,790/mese |

Ogni scheda è un componente retail o OEM acquistato nuovo, con la garanzia intestata a noi. Non acquistiamo scorte ex-mining, e non acquistiamo schede di cui non possiamo ricostruire la storia — una RTX 4090 usata costa poco per un motivo, e quel motivo si presenta al quarto mese.

## Cosa circonda le schede

Una GPU affamata di CPU, RAM o throughput del disco è un modo costoso per aspettare. Lo chassis è scelto in base al numero di schede, non venduto come percorso di upgrade.

**Specifiche dello chassis per numero di GPU**

| Nodo | CPU | RAM di sistema | Storage locale | Porta |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X 16 core / 32 thread · o Intel Xeon Silver 4410Y | 128 GB | 2 × 2 TB NVMeGen4 U.2, nessun RAID imposto | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X 24 core / 48 thread · o Intel Xeon Gold 5416S | 256 GB | 2 × 3.84 TB NVMeGen4 U.2, nessun RAID imposto | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X 32 core / 64 thread · o 2 × Intel Xeon Gold 6438Y+ | 512 GB | 4 × 3.84 TB NVMeGen4 U.2, nessun RAID imposto | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ 64 core · o 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 3.84 TB NVMeGen4 U.2, nessun RAID imposto | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ 64 core · o 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMeGen4 U.2, nessun RAID imposto | 25 Gbit/s |

Quando sono elencate due CPU, può essere consegnata una delle due — sono abbinate per numero di core e canali di memoria, e il configuratore Le mostra quale ha il Suo nodo prima di pagare. I dischi vengono consegnati grezzi: non imponiamo alcun livello RAID, perché quello giusto dipende dal fatto che Lei stia salvando checkpoint o un dataset che può riscaricare.

## Prima che un nodo venga messo a noleggio

Una macchina entra nel catalogo solo dopo aver trascorso tre giorni senza guastarsi. Quasi ogni scheda destinata a guastarsi presto lo fa qui, nelle nostre mani, non nelle sue.

FASE 1 · 2 ORE

### Assemblaggio e inventario

I numeri di serie di ogni scheda, modulo e disco vengono registrati in associazione allo chassis. Questo registro è ciò che ci permette di dirle, in seguito, esattamente quale componente fisico si trova nella sua macchina.

FASE 2 · 24 ORE

### Test di carico prolungato di memoria e calcolo

Test con pattern ECC sull’intera VRAM su ogni scheda, seguiti da moltiplicazioni di matrici sostenute al 100% di utilizzo. Un solo errore non correggibile e la scheda torna nella scatola.

FASE 3 · 24 ORE

### Sollecitazione termica e di potenza

L’intero nodo viene mantenuto a pieno carico mentre la temperatura in ingresso viene portata al caso peggiore della sala. Registriamo la frequenza che le schede sostengono realmente — non il valore boost indicato sulla confezione — e un nodo che scende sotto le specifiche per throttling viene rimontato o riceve nuova pasta termica prima di essere testato di nuovo.

FASE 4 · 24 ORE

### Interconnessione e storage

Larghezza di banda peer-to-peer NVLink o PCIe misurata scheda per scheda, resistenza in scrittura NVMe campionata, porta mantenuta al line rate. I numeri vengono confrontati con quelli degli altri nodi dello stesso modello, perché un nodo il 15% più lento è un nodo con un problema.

POI · MONTATO IN RACK E IN ATTESA

### Disponibile, con un’immagine pronta da scrivere

Ecco perché la consegna è in meno di 5 minuti e non un giorno lavorativo: nulla viene assemblato quando ordina. La macchina esiste già, accesa e testata, e il Suo pagamento avvia la scrittura di un’immagine, non una costruzione.

## Firmware e driver

Stack di driver Installato, con versione bloccata, libero di cambiarlo Ogni immagine Linux viene fornita con un driver NVIDIA aggiornato, CUDA, cuDNN e NCCL già funzionanti. Nulla le impedisce di sostituire tutto quanto — è il suo root.

Aggiornamenti firmware Mai durante la sua durata BIOS, BMC e VBIOS vengono impostati prima che il nodo entri nel catalogo. Non applichiamo aggiornamenti firmware a una macchina che qualcuno sta noleggiando; vengono applicati tra un inquilino e l’altro.

Clock In stock, e sbloccato per lei Spediamo ogni scheda alla sua frequenza di riferimento e al suo limite di potenza. Può alzarli o abbassarli con `nvidia-smi`; la conseguenza sulla garanzia è nostra, non Sua.

Accesso fuori banda IPMI, su una rete separata Alimentazione remota, console seriale e supporti virtuali, raggiungibili anche quando il sistema operativo non lo è. Si trova su una VLAN di gestione che non tocca mai la sua porta pubblica.

## Quando qualcosa si guasta

L’hardware si guasta. Ciò che distingue i provider non è se succede, ma come si presentano le quattro ore successive.

### I pezzi di ricambio sono in sede

Ogni sala dispone di schede di scorta, alimentatori, dischi e uno chassis completo per modello. Una sostituzione è una camminata lungo un corridoio, non una prenotazione con corriere.

### Obiettivo di quattro ore

Dalla sua segnalazione all’hardware funzionante, 24 ore su 24. Se non rispettiamo il termine, lo SLA estende automaticamente la sua durata — non deve richiederlo.

### I Suoi dischi restano Suoi

Una GPU o un alimentatore guasti vengono sostituiti lasciando i dischi intatti e al loro posto. Chiediamo il permesso solo prima di toccare lo storage, e solo quando è lo storage ad essersi guastato.

**Un disco guasto non è leggibile dall’inquilino successivo.** I dischi rimossi dal servizio vengono cancellati se rispondono ancora, e distrutti fisicamente se non rispondono. Un disco morto non può essere cancellato, quindi non viene mai restituito a un produttore in garanzia — assorbiamo quel costo piuttosto che lasciare che un disco che un tempo conteneva i suoi dati lasci l’edificio intatto.

## Tra due inquilini

La stessa macchina verrà noleggiata di nuovo dopo di Lei. Tutto ciò che segue avviene prima che rientri nel catalogo, che qualcuno lo chieda o meno.

**Fasi di dismissione tra due inquilini**

| Fase | Cosa succede | Verificato da |
|---|---|---|
| 1. Rete | La macchina viene scollegata dalla sua porta pubblica nel momento in cui la durata termina. Nulla resta raggiungibile mentre è in attesa. | Stato della porta, registrato |
| 2. Storage | Ogni dispositivo NVMe riceve una cancellazione crittografica completa, seguita da una sovrascrittura a passaggio singolo dell’intero spazio di indirizzamento. | Campione di rilettura su ogni dispositivo |
| 3. Memoria GPU | Le schede vengono resettate e la loro memoria cancellata; i contatori ECC vengono letti e confrontati con i valori registrati durante il rodaggio. | log di reset di `nvidia-smi` |
| 4. Firmware | Le impostazioni di BMC e BIOS vengono riscritte secondo il nostro riferimento, scartando qualsiasi modifica effettuata durante la durata. | Checksum rispetto al riferimento |
| 5. Identità | Credenziali IPMI ruotate, indirizzi IP restituiti al pool, rDNS azzerato. | Indirizzo trattenuto finché non è pulito |

Questo è anche il motivo per cui non possiamo ripristinare nulla dopo la fine della durata. Non c’è alcun periodo di grazia durante il quale i Suoi dati esistano ancora da qualche parte — la fase 2 è già stata eseguita. Se Le servono, li tolga dalla macchina prima che la durata si concluda.

## Cosa non faremo

**Partizionare una scheda.** Niente MIG, niente vGPU, niente time-slicing. Un inquilino per GPU fisica, il che rende riproducibile il throughput indicato nell’inserzione.

**Sovrallocare un nodo.** Non esiste un secondo account sulla macchina, né un hypervisor tra lei e il metallo.

**Rivendere la capacità di qualcun altro.** Ogni scheda in questa pagina è una scheda che abbiamo acquistato e montato in rack. Niente qui è un margine da rivenditore su un altro cloud.

**Sostituire con una scheda diversa.** Se il modello ordinato non può essere consegnato, non spediamo silenziosamente un quasi-equivalente — glielo diciamo e rimborsiamo la durata.

**Accedere al suo sistema operativo.** Il root è solo suo. Disponiamo di IPMI, che può riavviare l’alimentazione e montare supporti; non deteniamo un accesso all’interno della sua macchina.

**Conservare una copia di qualsiasi cosa.** Non eseguiamo backup dei suoi dischi. Gli snapshot esistono solo se li acquista, e vengono eliminati alla fine della durata.

## La specifica indicata nella riga è la specifica che riceve.

Ogni scheda sopra elencata è disponibile in tutti i 6 data center, montata in rack e sottoposta a rodaggio, con un’immagine pronta da scrivere.

[Sfoglia il catalogo](https://gpuserver.io/it/#catalog) [Leggi le guide](https://gpuserver.io/it/guides)

## Pagine correlate

- [Rete Porte senza contatore fino a 25 Gbit/s, due carrier e un IX per sede, DDoS sempre filtrato, IPv6 instradato — e quattro cose che non offriamo, dette subito.](https://gpuserver.io/it/network)
- [Documentazione Primo SSH, verifica dell’hardware, container CUDA, serving di un modello con vLLM, RAID, firewall, IPMI e reinstallazioni — i comandi, su una macchina reale.](https://gpuserver.io/it/docs)
- [Accordo sul livello di servizio L’impegno del 99,9%: cosa conta come downtime, come viene misurato dall’esterno, cinque minuti di durata in più per ogni minuto perso, e le esclusioni per intero.](https://gpuserver.io/it/legal/sla)
- [Chi siamo Chi gestisce gpuserver.io, perché compriamo l’hardware invece di rivenderlo, e le quattro regole che non pieghiamo mai — comprese quelle che ci costano vendite.](https://gpuserver.io/it/about)

---

Fonte: https://gpuserver.io/it/hardware/. Questo file è generato dagli stessi dati del sito web; se una cifra qui differisce da una pagina, la pagina è quella autorevole e questo file è obsoleto — la fonte canonica è https://gpuserver.io/.
