Was wir ins Rack einbauen, und was passiert, wenn es ausfällt.
Ein dedizierter Server ist ein Versprechen über ein physisches Objekt. Diese Seite beschreibt dieses Objekt: welche Karten wir kaufen, wie ein Knoten getestet wird, bevor er einen Mandanten aufnimmt, und was wir tun, wenn eine von ihnen ausfällt.
- 12GPU-Modelle, die wir betreiben
- 72 hBurn-in-Test, bevor ein Knoten einen Mandanten erhält
- 4 hZielvorgabe für den Ersatz ausgefallener Hardware
- 0von einem anderen Anbieter weiterverkaufte Karten
Jede Karte, die wir betreiben
Das ist die vollständige Liste — es gibt keine ungelistete Stufe und keine Karte, die wir für größere Konten zurückhalten. Die Speicherbandbreite steht in der Tabelle, weil sie für Inferenz den Durchsatz weit besser vorhersagt als jede Teraflop-Angabe.
| Karte | Architektur | Speicher | Bandbreite | Knotengrößen | Ab |
|---|---|---|---|---|---|
| L4 | Ada Lovelace | 24 GB | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/Monat |
| RTX 4090 | Ada Lovelace | 24 GB | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/Monat |
| RTX 5090 | Blackwell | 32 GB | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/Monat |
| RTX A6000 | Ampere | 48 GB | 768 GB/s | 1×, 2×, 4×, 8× | $286/Monat |
| L40S | Ada Lovelace | 48 GB | 864 GB/s | 1×, 2×, 4×, 8× | $714/Monat |
| A100 PCIe | Ampere | 40 GB | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/Monat |
| A100 PCIe | Ampere | 80 GB | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/Monat |
| H100 PCIe | Hopper | 80 GB | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/Monat |
| A100 SXM4 | Ampere | 80 GB | 2,039 GB/s | 4×, 8× | $4,395/Monat |
| H100 SXM5 | Hopper | 80 GB | 3,350 GB/s | 4×, 8× | $6,061/Monat |
| H200 SXM5 | Hopper | 141 GB | 4,800 GB/s | 4×, 8× | $8,405/Monat |
| B200 SXM6 | Blackwell | 180 GB | 8,000 GB/s | 4×, 8× | $11,790/Monat |
Jede Karte ist ein neu gekauftes Einzelhandels- oder OEM-Teil, mit Garantie auf unseren Namen. Wir kaufen keine Ex-Mining-Bestände, und wir kaufen keine Karten, deren Geschichte wir nicht nachvollziehen können – eine gebrauchte RTX 4090 ist aus einem Grund günstig, und dieser Grund zeigt sich im vierten Monat.
Was die Karten umgibt
Eine GPU, der es an CPU-, RAM- oder Festplattendurchsatz mangelt, ist eine teure Art zu warten. Das Chassis wird nach der Kartenanzahl gewählt, nicht als Upgrade-Pfad verkauft.
| Knoten | CPU | System-RAM | Lokaler Speicher | Port |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X | 128 GB | 2 × 2 TB NVMe | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X | 256 GB | 2 × 3.84 TB NVMe | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X | 512 GB | 4 × 3.84 TB NVMe | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ | 1 TB | 8 × 3.84 TB NVMe | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMe | 25 Gbit/s |
Wo zwei CPUs aufgeführt sind, kann jede der beiden geliefert werden — sie sind bei Kernanzahl und Speicherkanälen gleichwertig, und der Konfigurator zeigt Ihnen vor der Zahlung, welche Ihr Knoten hat. Festplatten werden roh übergeben: Wir schreiben kein RAID-Level vor, denn das richtige hängt davon ab, ob Sie Checkpoints oder einen erneut herunterladbaren Datensatz speichern.
Bevor ein Knoten verkauft wird
Eine Maschine erreicht den Katalog erst, nachdem sie drei Tage lang nicht kaputtgegangen ist. Fast jede Karte, die früh sterben wird, stirbt hier, in unseren Händen, und nicht in Ihren.
SCHRITT 1 · 2 STUNDEN
Montage und Inventarisierung
Seriennummern jeder Karte, jedes Moduls und jeder Festplatte werden dem Chassis zugeordnet erfasst. Dieser Nachweis ermöglicht es uns, Ihnen später genau zu sagen, welches physische Teil in Ihrer Maschine verbaut ist.
SCHRITT 2 · 24 STUNDEN
Speicher- und Rechen-Soak-Test
Full-VRAM-ECC-Mustertests bei jeder Karte, dann anhaltende Matrixmultiplikation bei 100 % Auslastung. Ein einziger unkorrigierbarer Fehler, und die Karte geht zurück in den Karton.
SCHRITT 3 · 24 STUNDEN
Wärme- und Leistungstest
Der gesamte Knoten wird unter Volllast gehalten, während die Zulufttemperatur auf den ungünstigsten Fall der Halle angehoben wird. Wir erfassen den Takt, den die Karten tatsächlich halten — nicht die Boost-Angabe auf der Verpackung —, und ein Knoten, der unter die Spezifikation drosselt, wird neu eingesetzt oder neu verpastet, bevor er erneut getestet wird.
SCHRITT 4 · 24 STUNDEN
Interconnect und Speicher
NVLink- oder PCIe-Peer-to-Peer-Bandbreite Karte zu Karte gemessen, NVMe-Schreibausdauer stichprobenartig geprüft, Port auf Line-Rate gehalten. Die Werte werden mit den anderen Knoten desselben Modells verglichen, denn ein Knoten, der 15 % langsamer ist, ist ein Knoten mit einem Problem.
DANN · IM RACK, WARTEND
Verfügbar, mit einem schreibbereiten Image
Deshalb erfolgt die Lieferung unter 5 Minuten und nicht an einem Werktag: Bei der Bestellung wird nichts zusammengebaut. Die Maschine existiert bereits, ist eingeschaltet und getestet, und Ihre Zahlung löst das Schreiben eines Images aus, keinen Aufbau.
Firmware und Treiber
nvidia-smi anheben oder senken; die Gewährleistungsfolge tragen wir, nicht Sie.
Wenn etwas ausfällt
Hardware geht kaputt. Was Anbieter unterscheidet, ist nicht, ob es passiert, sondern wie die nächsten vier Stunden aussehen.
Ersatzteile sind vor Ort
Jede Halle hält Ersatzkarten, Netzteile, Festplatten und ein komplettes Chassis pro Modell vor. Ein Austausch ist ein Gang durch den Gang, keine Kurierbuchung.
Vier-Stunden-Ziel
Von Ihrer Meldung bis zur funktionierenden Hardware, rund um die Uhr. Verpassen wir das, verlängert das SLA Ihre Laufzeit automatisch – Sie müssen es nicht einfordern.
Ihre Festplatten gehören weiterhin Ihnen
Eine defekte GPU oder ein defektes Netzteil wird ausgetauscht, während die Festplatten unangetastet an ihrem Platz bleiben. Wir fragen nur nach, bevor wir den Speicher anfassen, und nur wenn der Speicher das ist, was ausgefallen ist.
Zwischen zwei Mandanten
Dieselbe Maschine wird nach Ihnen erneut vermietet. Alles Folgende geschieht, bevor sie wieder in den Katalog aufgenommen wird — ob jemand danach fragt oder nicht.
| Schritt | Was geschieht | Verifiziert von |
|---|---|---|
| 1. Netzwerk | Die Maschine wird in dem Moment vom öffentlichen Port getrennt, in dem die Laufzeit endet. Nichts bleibt erreichbar, während sie wartet. | Portstatus, protokolliert |
| 2. Speicher | Jedes NVMe-Gerät erhält eine vollständige kryptografische Löschung, gefolgt von einem einmaligen Überschreiben des gesamten Adressraums. | Rücklese-Stichprobe auf jedem Gerät |
| 3. GPU-Speicher | Karten werden zurückgesetzt und ihr Speicher geleert; ECC-Zähler werden ausgelesen und mit den beim Burn-in erfassten Werten verglichen. | nvidia-smi-Reset-Protokoll |
| 4. Firmware | BMC- und BIOS-Einstellungen werden auf unsere Referenz zurückgeflasht, wodurch jede während der Laufzeit vorgenommene Änderung verworfen wird. | Prüfsumme gegen Referenz |
| 5. Identität | IPMI-Zugangsdaten rotiert, IP-Adressen an den Pool zurückgegeben, rDNS gelöscht. | Adresse zurückgehalten, bis sie sauber ist |
Das ist auch der Grund, warum wir nach Ablauf der Laufzeit nichts wiederherstellen können. Es gibt keine Karenzzeit, in der Ihre Daten noch irgendwo existieren — Schritt 2 ist bereits gelaufen. Wenn Sie sie brauchen, holen Sie sie vor Ablauf der Laufzeit von der Maschine.
Was wir nicht tun werden
Eine Karte partitionieren. Kein MIG, kein vGPU, kein Time-Slicing. Ein Mandant pro physischer GPU – das macht den Durchsatz im Angebot reproduzierbar.
Einen Knoten überbuchen. Es gibt kein zweites Konto auf der Maschine und keinen Hypervisor zwischen Ihnen und dem blanken Metall.
Die Kapazität eines Dritten weiterverkaufen. Jede Karte auf dieser Seite ist eine Karte, die wir gekauft und ins Rack eingebaut haben. Nichts hier ist eine Wiederverkäufer-Marge auf einer fremden Cloud.
Eine andere Karte unterschieben. Kann das bestellte Modell nicht geliefert werden, versenden wir nicht stillschweigend ein annähernd gleichwertiges – wir sagen es Ihnen und erstatten die Laufzeit.
In Ihr Betriebssystem eindringen. Root gehört ausschließlich Ihnen. Wir verfügen über IPMI, das einen Power-Cycle auslösen und Medien einbinden kann; wir haben keinen Zugang zu einem Login innerhalb Ihrer Maschine.
Eine Kopie von irgendetwas aufbewahren. Wir erstellen keine Backups Ihrer Festplatten. Snapshots gibt es nur, wenn Sie sie kaufen, und sie werden mit dem Ende der Laufzeit gelöscht.
Die Spezifikation in der Zeile ist die Spezifikation, die Sie erhalten.
Jede Karte oben ist in allen 6 Rechenzentren verfügbar, im Rack montiert und eingebrannt, mit einem schreibbereiten Image.
Verwandte Seiten
- NetzwerkPorts ohne Volumenbegrenzung bis 25 Gbit/s, zwei Carrier und ein IX pro Standort, ständige DDoS-Filterung, geroutetes IPv6 — und vier Dinge, die wir nicht anbieten.
- DokumentationErstes SSH, Hardware-Prüfung, CUDA-Container, ein Modell mit vLLM servieren, RAID, Firewalling, IPMI und Neuinstallation – die Befehle, auf einer echten Maschine.
- Vereinbarung zum ServicelevelDie 99,9-%-Zusage: was als Ausfallzeit zählt, wie sie von außen gemessen wird, fünf Minuten Laufzeit zurück je verlorener Minute, und die Ausschlüsse vollständig.
- Über unsWer gpuserver.io betreibt, warum wir die Hardware kaufen, statt sie weiterzuverkaufen, und die vier Regeln, die wir nicht beugen — auch die, die uns Umsatz kosten.