Von der bestätigten Zahlung bis zum ersten Token.
Was in Ihrer Liefernachricht steht, was bereits installiert ist, und die genauen Befehle für die erste Stunde. Alles Folgende wird als Root auf einer frisch gelieferten Maschine ausgeführt.
- unter 5 Minutenvon der Zahlung bis zur Nachricht unten
- 10Images, die Sie sich schreiben lassen können
- rootkein sudo, kein Jump Host, keine Konsole
- 22der einzige bei Lieferung offene Port
Was ankommt
Eine Nachricht, unter 5 Minuten nachdem die Zahlung bestätigt ist. Sie enthält alles, was Sie brauchen, und nichts, das Sie erst wegklicken müssen.
Erste Verbindung
Nichts zu akzeptieren, kein Agent zu installieren. Wenn Sie uns im Konfigurator einen öffentlichen Schlüssel angegeben haben, steht er bereits in /root/.ssh/authorized_keys.
$ ssh root@203.0.113.42
# Dann, vor allem anderen – der Fingerprint in der Liefernachricht
# muss mit dem hier angezeigten übereinstimmen:
$ ssh-keygen -lf /etc/ssh/ssh_host_ed25519_key.pub
Wenn Sie einen Schlüssel gesendet haben, deaktivieren Sie das Passwort. Das kostet einen Befehl und entfernt die einzige Anmeldeinformation, die sich erraten lässt.
# Bestätigen Sie ZUERST, dass Ihr Schlüssel funktioniert — in einem zweiten Terminal, während Sie hier noch angemeldet sind.
$ sed -i 's/^#\?PasswordAuthentication.*/PasswordAuthentication no/' /etc/ssh/sshd_config
$ systemctl reload ssh
Hardware überprüfen
Tun Sie das in den ersten zehn Minuten. Sie haben eine Maschine, die Sie noch nicht gesehen haben, und die SLA-Uhr für einen Hardwarefehler beginnt, sobald Sie es uns melden.
$ nvidia-smi --query-gpu=index,name,serial,memory.total,pcie.link.gen.current --format=csv
index, name, serial, memory.total [MiB], pcie.link.gen.current
0, NVIDIA H100 80GB HBM3, 1650123456789, 81559 MiB, 5
1, NVIDIA H100 80GB HBM3, 1650123456790, 81559 MiB, 5
# Prüfen Sie bei einem Multi-GPU-Knoten, ob die Topologie dem entspricht, wofür Sie bezahlt haben.
# NV# bedeutet NVLink; PIX/PHB/SYS bedeuten, dass der Traffic über PCIe läuft.
$ nvidia-smi topo -m
# Halten Sie jede Karte zwei Minuten unter Last und beobachten Sie den Takt, bei dem sie sich einpendelt.
$ nvidia-smi -q -d PERFORMANCE,TEMPERATURE,CLOCK | grep -E 'Slowdown|SW Power|Graphics *:'
# Festplatten: Anzahl und Modell mit der Übergabemeldung abgleichen.
$ lsblk -d -o NAME,MODEL,SIZE,ROTA
$ nvme list
Was vorinstalliert ist
Wählen Sie im Konfigurator ein Betriebssystem und optional einen Stack darauf. Alles Folgende wird vor der Lieferung geschrieben, nicht beim ersten Boot heruntergeladen.
| Image | Wofür es gedacht ist | Mindest-VRAM | OS |
|---|---|---|---|
| vLLM 0.11 | Serving großer Sprachmodelle | 24 GB | Linux |
| SGLang 0.5 | Serving großer Sprachmodelle | 24 GB | Linux |
| Text Generation Inference | Serving großer Sprachmodelle | 24 GB | Linux |
| Ollama 0.12 | Serving großer Sprachmodelle | 8 GB | Linux |
| Axolotl 0.8 | Training und Fine-Tuning | 24 GB | Linux |
| PyTorch 2.9 · CUDA 12.8 | Training und Fine-Tuning | 8 GB | Linux |
| ComfyUI | Bild- und Videogenerierung | 12 GB | Linux |
| JupyterLab · CUDA | Training und Fine-Tuning | 8 GB | Linux |
| Blender 4.5 | 3D-Rendering | 8 GB | Linux oder Windows |
| Ihr eigenes Docker-Image | Alles, was Sie mitbringen | Beliebig | Linux |
Jedes Linux-Image hat, unabhängig vom gewählten Stack, bereits einen funktionierenden NVIDIA-Treiber, CUDA, cuDNN und NCCL. Sie können alles davon ersetzen — es ist Ihr Root, und eine Neuinstallation kostet nichts und ist nicht begrenzt.
Container und CUDA
Docker und das NVIDIA Container Toolkit sind installiert und konfiguriert. Die folgende Prüfung ist die dreißig Sekunden wert, denn ein Container, der die Karten nicht sieht, scheitert später auf verwirrende Weise.
$ docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi
# Multi-GPU-Jobs benötigen außerdem Shared Memory und IPC, was an den Standardlimits scheitert.
# Diese drei Flags sind die übliche Ursache dafür, dass NCCL sich lautlos aufhängt:
$ docker run --rm --gpus all --ipc=host --shm-size=16g --ulimit memlock=-1 …
Serving eines Modells
Der kürzeste sinnvolle Weg von einer gelieferten Maschine zu einem OpenAI-kompatiblen Endpunkt. Setzen Sie Ihr eigenes Modell ein; entscheidend sind die Flags.
$ docker run -d --name vllm --gpus all --ipc=host -p 8000:8000 \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--max-model-len 8192 \
--gpu-memory-utilization 0.92
# Teilen Sie es bei einem Multi-GPU-Knoten auf jede Karte im Gehäuse auf:
$ … --tensor-parallel-size 4
# Dann, von Ihrer eigenen Maschine aus:
$ curl http://203.0.113.42:8000/v1/models
Ob ein bestimmtes Modell auf eine bestimmte Maschine passt, ist Arithmetik, keine Meinungssache – Gewichte plus ein KV-Cache, der mit der Kontextlänge wächst. Der Konfigurator rechnet das für jede Konfiguration durch, bevor Sie bezahlen, und der Guide zur VRAM-Dimensionierung zeigt die Formel, damit Sie unsere Rechnung nachprüfen können.
Festplatten und Speicher
Festplatten werden über das Systemvolume hinaus roh übergeben. Wir schreiben kein RAID-Level vor, weil das richtige davon abhängt, ob Sie Checkpoints halten, die Sie nicht verlieren dürfen, oder einen Datensatz, den Sie in einer Stunde erneut herunterladen können.
# Prüfen Sie zuerst, was ungenutzt ist — dies zerstört Daten auf den genannten Geräten.
$ lsblk
$ mdadm --create /dev/md0 --level=0 --raid-devices=2 /dev/nvme1n1 /dev/nvme2n1
$ mkfs.ext4 -E lazy_itable_init=0,lazy_journal_init=0 /dev/md0
$ mkdir -p /scratch && mount /dev/md0 /scratch
$ echo '/dev/md0 /scratch ext4 defaults,noatime 0 2' >> /etc/fstab
Zusätzliches NVMe, Archiv-HDD und maschinenexterne Snapshots sind monatliche Optionen, die im Konfigurator oder nachträglich hinzugefügt werden. Lokale Festplatten werden von uns nicht gesichert und werden es auch nie — siehe Snapshots unten.
Firewall und Ports
Eingehend ist alles offen, außer was Ihre eigene Maschine blockiert: Vor Ihnen liegt kein Netzwerkfilter, das ist Absicht und legt die Verantwortung hierhin. Ausgehender Port 25 ist die einzige Ausnahme, vorgelagert geschlossen, bis Sie ihn anfordern.
$ ufw default deny incoming
$ ufw default allow outgoing
$ ufw allow 22/tcp
$ ufw allow from 198.51.100.7 to any port 8000 proto tcp
$ ufw --force enable
# Sicherer, als überhaupt einen Port zu öffnen: Halten Sie den Dienst auf localhost
# und von Ihrer eigenen Maschine aus dorthin tunneln.
$ ssh -N -L 8000:127.0.0.1:8000 root@203.0.113.42
IPMI und Neuinstallation
Out-of-Band-Zugriff ist auf jeder Maschine vorhanden, unter einer eigenen Adresse. So stellen Sie um drei Uhr morgens wieder Zugriff auf eine Maschine her, aus der Sie sich selbst ausgesperrt haben, ohne jemanden fragen zu müssen.
Power
Harter Neustart, geordnetes Herunterfahren und der Stromstatus des Gehäuses — unabhängig davon, ob das Betriebssystem reagiert.
Serielle und KVM-Konsole
Der Bildschirm, den die Maschine auf einem Monitor zeigen würde, einschließlich Bootloader und Kernel Panic. Hier reparieren Sie eine defekte fstab.
Virtual Media
Binden Sie jede beliebige ISO über das Netzwerk ein und booten Sie sie. Das schließt ein Rescue-Image ein, und es schließt ein Betriebssystem ein, das wir nicht anbieten.
Eine saubere Neuinstallation auf jedes von uns angebotene Image fordern Sie bei uns an, sie dauert etwa so lange wie die ursprüngliche Bereitstellung. Sie kostet nichts, es gibt keine Begrenzung, wie oft, und die Maschine behält ihre Adressen. Alles auf den Festplatten wird dabei zerstört — das ist der Sinn einer Neuinstallation, und es gibt kein Zurück.
Snapshots
Optional, monatlich, außerhalb der Maschine. Wenn Sie sie nicht kaufen, existiert keine Kopie Ihrer Daten außer auf Ihren eigenen Festplatten – das ist die richtige Voreinstellung für das meiste, was auf einer GPU läuft, und eine Katastrophe für den Rest.
Die Laufzeit beenden
Eine monatliche Laufzeit endet am Ende des bezahlten Monats, ohne Kündigungsfrist und ohne Kündigungsgebühr. Was danach geschieht, ist nicht rückgängig zu machen, deshalb steht es hier und nicht in einer Fußnote.
- Nichts verlängert sich von selbst. Es ist keine Karte hinterlegt und kein Lastschriftmandat eingerichtet — eine Laufzeit läuft nur weiter, weil Sie die nächste bezahlt haben.
- Der öffentliche Port wird in dem Moment gekappt, in dem die Laufzeit endet. Die Maschine ist sofort nicht mehr erreichbar, nicht erst am Ende einer Karenzfrist.
- Festplatten werden innerhalb einer Stunde gelöscht. Kryptografisches Löschen, dann ein vollständiges Überschreiben. Es gibt kein Zeitfenster, in dem Ihre Daten noch irgendwo existieren.
- Snapshots werden mit gelöscht. Falls Sie sie gekauft haben, werden sie im selben Durchgang entfernt.
- Die Adresse kehrt in den Pool zurück. Nach einer Wartezeit, und erst, wenn sie sauber ist.
Alles oben Genannte funktioniert auf jeder Maschine im Katalog.
Es gibt keine Stufe, in der IPMI, Neuinstallationen oder Bandbreite ohne Volumenbegrenzung extra kosten. Wählen Sie eine Karte, wählen Sie einen Standort, und der Rest dieser Seite gilt.
Verwandte Seiten
- GuidesAcht praktische Guides: VRAM-Größe, NVLink vs. PCIe, Bild- und Videomodelle, monatlich vs. stündlich, Self-Hosting vs. API, Llama 70B servieren, QLoRA.
- Hardware-RichtlinieUnsere zwölf NVIDIA-GPUs, der 72-Stunden-Burn-in vor dem Verkauf eines Knotens, das Vier-Stunden-Ziel für den Austausch, und die Plattenlöschung zwischen Mandanten.
- NetzwerkPorts ohne Volumenbegrenzung bis 25 Gbit/s, zwei Carrier und ein IX pro Standort, ständige DDoS-Filterung, geroutetes IPv6 — und vier Dinge, die wir nicht anbieten.
- Über unsWer gpuserver.io betreibt, warum wir die Hardware kaufen, statt sie weiterzuverkaufen, und die vier Regeln, die wir nicht beugen — auch die, die uns Umsatz kosten.