Da confirmação do pagamento ao primeiro token.
O que chega na sua mensagem de entrega, o que já está instalado, e os comandos exatos para a primeira hora. Tudo abaixo é executado como root em uma máquina recém-entregue.
- em menos de 5 minutosdo pagamento até a mensagem abaixo
- 10imagens que podem ser gravadas para você
- rootsem sudo, sem jump host, sem console
- 22a única porta aberta na entrega
O que chega
Uma única mensagem, em menos de 5 minutos depois que o pagamento é confirmado. Ela contém tudo o que você precisa e nada que você precise clicar para passar.
Primeira conexão
Nada para aceitar, nenhum agente para instalar. Se você nos deu uma chave pública no configurador, ela já está em /root/.ssh/authorized_keys.
$ ssh root@203.0.113.42
# Depois, antes de qualquer outra coisa — a impressão digital na mensagem de entrega
# deve corresponder à impressa aqui:
$ ssh-keygen -lf /etc/ssh/ssh_host_ed25519_key.pub
Se você enviou uma chave, desative a senha. Isso custa um comando e remove a única credencial que pode ser adivinhada.
# Confirme que sua chave funciona PRIMEIRO — em um segundo terminal, ainda conectado aqui.
$ sed -i 's/^#\?PasswordAuthentication.*/PasswordAuthentication no/' /etc/ssh/sshd_config
$ systemctl reload ssh
Verifique o hardware
Faça isso nos primeiros dez minutos. Você tem uma máquina que ainda não viu, e o relógio do SLA para uma falha de hardware começa a contar quando você nos avisa.
$ nvidia-smi --query-gpu=index,name,serial,memory.total,pcie.link.gen.current --format=csv
index, name, serial, memory.total [MiB], pcie.link.gen.current
0, NVIDIA H100 80GB HBM3, 1650123456789, 81559 MiB, 5
1, NVIDIA H100 80GB HBM3, 1650123456790, 81559 MiB, 5
# Num nó multi-GPU, verifique se a topologia corresponde ao que você pagou.
# NV# significa NVLink; PIX/PHB/SYS significam que o tráfego passa pelo PCIe.
$ nvidia-smi topo -m
# Mantenha cada placa em carga por dois minutos e observe a frequência em que ela se estabiliza.
$ nvidia-smi -q -d PERFORMANCE,TEMPERATURE,CLOCK | grep -E 'Slowdown|SW Power|Graphics *:'
# Discos: confirme a quantidade e o modelo em relação à mensagem de entrega.
$ lsblk -d -o NAME,MODEL,SIZE,ROTA
$ nvme list
O que vem pré-instalado
Escolha um sistema operacional no configurador e, opcionalmente, uma stack sobre ele. Tudo abaixo é gravado antes da entrega, não baixado no primeiro boot.
| Imagem | Para que serve | VRAM mínima | SO |
|---|---|---|---|
| vLLM 0.11 | Servindo grandes modelos de linguagem | 24 GB | Linux |
| SGLang 0.5 | Servindo grandes modelos de linguagem | 24 GB | Linux |
| Text Generation Inference | Servindo grandes modelos de linguagem | 24 GB | Linux |
| Ollama 0.12 | Servindo grandes modelos de linguagem | 8 GB | Linux |
| Axolotl 0.8 | Treinamento e fine-tuning | 24 GB | Linux |
| PyTorch 2.9 · CUDA 12.8 | Treinamento e fine-tuning | 8 GB | Linux |
| ComfyUI | Geração de imagem e vídeo | 12 GB | Linux |
| JupyterLab · CUDA | Treinamento e fine-tuning | 8 GB | Linux |
| Blender 4.5 | renderização 3D | 8 GB | Linux ou Windows |
| Sua própria imagem Docker | Qualquer coisa que você traga | Sem mínimo | Linux |
Toda imagem Linux, qualquer que seja a stack escolhida, já vem com um driver NVIDIA funcional, CUDA, cuDNN e NCCL. Você é livre para substituir tudo isso — é o seu root, e reinstalar não custa nada e não tem limite de frequência.
Containers e CUDA
O Docker e o NVIDIA Container Toolkit estão instalados e configurados. A verificação abaixo vale trinta segundos, porque um container que não consegue ver as placas falha de um jeito confuso bem mais tarde.
$ docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi
# Tarefas multi-GPU também precisam de memória compartilhada e IPC, que os limites padrão restringem.
# Essas três flags são a causa mais comum de um travamento silencioso do NCCL:
$ docker run --rm --gpus all --ipc=host --shm-size=16g --ulimit memlock=-1 …
Servindo um modelo
O caminho útil mais curto entre uma máquina entregue e um endpoint compatível com a OpenAI. Substitua pelo seu próprio modelo; o que importa são as flags.
$ docker run -d --name vllm --gpus all --ipc=host -p 8000:8000 \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
--max-model-len 8192 \
--gpu-memory-utilization 0.92
# Num nó multi-GPU, divida entre todas as placas da máquina:
$ … --tensor-parallel-size 4
# Depois, a partir da sua própria máquina:
$ curl http://203.0.113.42:8000/v1/models
Se um determinado modelo cabe numa determinada máquina é aritmética, não opinião — pesos, mais um cache KV que cresce com o comprimento do contexto. O configurador faz essa conta para cada configuração antes de você pagar, e o guia de dimensionamento de VRAM mostra a fórmula para que você possa conferir a nossa.
Discos e armazenamento
Os discos são entregues em bruto além do volume de sistema. Não impomos nenhum nível de RAID, porque o nível certo depende de você estar guardando checkpoints que não pode perder ou um dataset que pode baixar novamente em uma hora.
# Verifique o que está sem uso primeiro — isso destrói dados nos dispositivos indicados.
$ lsblk
$ mdadm --create /dev/md0 --level=0 --raid-devices=2 /dev/nvme1n1 /dev/nvme2n1
$ mkfs.ext4 -E lazy_itable_init=0,lazy_journal_init=0 /dev/md0
$ mkdir -p /scratch && mount /dev/md0 /scratch
$ echo '/dev/md0 /scratch ext4 defaults,noatime 0 2' >> /etc/fstab
NVMe adicional, HDD de arquivamento e snapshots fora da máquina são opções mensais, adicionadas no configurador ou depois. Discos locais não têm backup feito por nós e nunca terão — veja snapshots abaixo.
Firewall e portas
Tudo está aberto para entrada, exceto o que sua própria máquina bloquear: não há filtro de rede na sua frente, o que é deliberado e coloca a responsabilidade aqui. A porta 25 de saída é a única exceção, fechada a montante até você pedir.
$ ufw default deny incoming
$ ufw default allow outgoing
$ ufw allow 22/tcp
$ ufw allow from 198.51.100.7 to any port 8000 proto tcp
$ ufw --force enable
# Mais seguro do que abrir uma porta: mantenha o serviço no localhost
# e crie um túnel até ele a partir da sua própria máquina.
$ ssh -N -L 8000:127.0.0.1:8000 root@203.0.113.42
IPMI e reinstalação
O acesso fora de banda está presente em toda máquina, com endereço próprio. É assim que você recupera uma máquina da qual se trancou para fora, às três da manhã, sem pedir nada a ninguém.
Energia
Ciclo de energia forçado, desligamento controlado e o estado de energia do chassi — independente de o sistema operacional estar respondendo.
Console serial e KVM
A tela que a máquina mostraria num monitor, incluindo o bootloader e um kernel panic. É aqui que você conserta um fstab quebrado.
Mídia virtual
Monte qualquer ISO pela rede e inicialize a partir dela. Isso inclui uma imagem de resgate, e inclui um sistema operacional que não oferecemos.
Uma reinstalação limpa para qualquer imagem que oferecemos é solicitada a nós e leva aproximadamente o mesmo tempo que a entrega original. Não custa nada, não há limite de frequência, e a máquina mantém seus endereços. Tudo nos discos é destruído por ela — esse é o propósito de uma reinstalação, e não há como desfazer.
Snapshots
Opcionais, mensais, fora da máquina. Se você não os contratar, nenhuma cópia dos seus dados existe em lugar nenhum além dos seus próprios discos — o padrão correto para a maior parte do que roda numa GPU, e um desastre para o resto.
Encerrando o prazo
Um prazo mensal termina ao final do mês pago, sem período de aviso prévio e sem taxa de cancelamento. O que acontece depois não é reversível, por isso está detalhado aqui, e não em uma nota de rodapé.
- Nada se renova sozinho. Não há cartão registrado nem débito automático — um prazo continua apenas porque você pagou pelo próximo.
- A porta pública é cortada no momento em que o prazo termina. A máquina para de ser alcançável imediatamente, não ao final de um dia de tolerância.
- Os discos são apagados dentro de uma hora. Apagamento criptográfico, seguido de uma sobrescrita completa. Não há uma janela durante a qual seus dados ainda existam em algum lugar.
- Os snapshots vão junto. Se você os comprou, eles são excluídos na mesma passagem.
- O endereço volta para o pool. Depois de um período de retenção, e somente quando estiver limpo.
Tudo acima funciona em todas as máquinas do catálogo.
Não existe nível em que IPMI, reinstalações ou banda sem contador custem a mais. Escolha uma placa, escolha um site, e o resto desta página se aplica.
Páginas relacionadas
- GuiasOito guias práticos: dimensionamento de VRAM, NVLink vs PCIe, imagem e vídeo, mensal vs por hora, hospedagem própria vs API, servir o Llama 70B e QLoRA.
- Política de hardwareAs doze GPUs NVIDIA que operamos, o amaciamento de 72 horas antes da venda de um nó, a meta de troca em quatro horas, e como os discos são apagados entre locatários.
- RedePortas sem contador até 25 Gbit/s, duas operadoras e um IX por site, filtragem DDoS sempre ativa, IPv6 roteado — e as quatro coisas que não oferecemos, já ditas.
- Sobre nósQuem administra o gpuserver.io, por que compramos o hardware em vez de revendê-lo, e as quatro regras que não flexibilizamos — incluindo as que já custaram vendas.