Documentação

# Da confirmação do pagamento ao primeiro token.

O que chega na sua mensagem de entrega, o que já está instalado, e os comandos exatos para a primeira hora. Tudo abaixo é executado como root em uma máquina recém-entregue.

- em menos de 5 minutos do pagamento até a mensagem abaixo
- 10 imagens que podem ser gravadas para você
- root sem sudo, sem jump host, sem console
- 22 a única porta aberta na entrega

## O que chega

Uma única mensagem, em menos de 5 minutos depois que o pagamento é confirmado. Ela contém tudo o que você precisa e nada que você precise clicar para passar.

SSH Endereço, porta 22 e sua senha root A senha é a que **você** define no configurador. Nós nunca a geramos, nunca a vemos em texto claro depois, e não podemos redefini-la para você.

Rede Endereço IPv4, gateway e seu /64 IPv6 Já configurado na máquina. O bloco é listado para que você possa planejar endereços adicionais nele.

IPMI Um endereço separado e suas próprias credenciais Numa VLAN de gerenciamento. Energia remota, console serial e mídia virtual, acessíveis quando o sistema operacional não está.

Hardware A CPU, as placas e os discos exatos do seu nó Modelo e número de série de cada placa, para que a máquina que você verifica seja comprovadamente a máquina que lhe foi vendida.

**Não podemos recuperar sua senha de root.** Ela é definida por você e armazenada apenas pelo tempo necessário para gravá-la na imagem. Se você a perder, o caminho de volta é o IPMI: inicie a imagem de resgate pela mídia virtual e redefina-a você mesmo. Essa é uma característica de não guardarmos suas credenciais, e também é um transtorno real — guarde-a num gerenciador de senhas agora.

## Primeira conexão

Nada para aceitar, nenhum agente para instalar. Se você nos deu uma chave pública no configurador, ela já está em `/root/.ssh/authorized_keys`.

Sua máquina, primeiro login

```
$ ssh root@203.0.113.42
# Depois, antes de qualquer outra coisa — a impressão digital na mensagem de entrega
# deve corresponder à impressa aqui:
$ ssh-keygen -lf /etc/ssh/ssh_host_ed25519_key.pub
```

Se você enviou uma chave, desative a senha. Isso custa um comando e remove a única credencial que pode ser adivinhada.

Acesso somente por chave

```
# Confirme que sua chave funciona PRIMEIRO — em um segundo terminal, ainda conectado aqui.
$ sed -i 's/^#\?PasswordAuthentication.*/PasswordAuthentication no/' /etc/ssh/sshd_config
$ systemctl reload ssh
```

## Verifique o hardware

Faça isso nos primeiros dez minutos. Você tem uma máquina que ainda não viu, e o relógio do SLA para uma falha de hardware começa a contar quando você nos avisa.

Placas, memória e o link entre elas

```
$ nvidia-smi --query-gpu=index,name,serial,memory.total,pcie.link.gen.current --format=csv
index, name, serial, memory.total [MiB], pcie.link.gen.current
0, NVIDIA H100 80GB HBM3, 1650123456789, 81559 MiB, 5
1, NVIDIA H100 80GB HBM3, 1650123456790, 81559 MiB, 5

# Num nó multi-GPU, verifique se a topologia corresponde ao que você pagou.
# NV# significa NVLink; PIX/PHB/SYS significam que o tráfego passa pelo PCIe.
$ nvidia-smi topo -m
```

Throughput sustentado, não um número de boost

```
# Mantenha cada placa em carga por dois minutos e observe a frequência em que ela se estabiliza.
$ nvidia-smi -q -d PERFORMANCE,TEMPERATURE,CLOCK | grep -E 'Slowdown|SW Power|Graphics *:'

# Discos: confirme a quantidade e o modelo em relação à mensagem de entrega.
$ lsblk -d -o NAME,MODEL,SIZE,ROTA
$ nvme list
```

**Se algo não corresponder, avise imediatamente.** Uma placa errada, um disco ausente, um link rodando em Gen3 em vez de Gen5 — avise-nos dentro do primeiro dia, e trocamos o nó ou reembolsamos o prazo, sem discussão. Depois de um mês de uso, o mesmo relato é um caso de suporte, não uma disputa de entrega, e é mais lento para nós dois.

## O que vem pré-instalado

Escolha um sistema operacional no configurador e, opcionalmente, uma stack sobre ele. Tudo abaixo é gravado antes da entrega, não baixado no primeiro boot.

**Imagens pré-instaladas, o que contêm e a placa mínima que exigem**

| Imagem | Para que serve | VRAM mínima | SO |
|---|---|---|---|
| vLLM 0.11 Servidor compatível com OpenAI, processamento contínuo por lotes | Servindo grandes modelos de linguagem | 24 GB | Linux |
| SGLang 0.5 Decodificação estruturada, cache RadixAttention | Servindo grandes modelos de linguagem | 24 GB | Linux |
| Text Generation Inference Stack de inferência da Hugging Face | Servindo grandes modelos de linguagem | 24 GB | Linux |
| Ollama 0.12 Um único comando, com modelos quantizados incluídos | Servindo grandes modelos de linguagem | 8 GB | Linux |
| Axolotl 0.8 Fine-tuning com LoRA e QLoRA | Treinamento e fine-tuning | 24 GB | Linux |
| PyTorch 2.9 · CUDA 12.8 Framework puro, cuDNN 9, NCCL | Treinamento e fine-tuning | 8 GB | Linux |
| ComfyUI SDXL, Flux, SD 3.5, nós de vídeo | Geração de imagem e vídeo | 12 GB | Linux |
| JupyterLab · CUDA Notebooks em uma stack CUDA pura | Treinamento e fine-tuning | 8 GB | Linux |
| Blender 4.5 Renderização de GPU no Cycles, headless | renderização 3D | 8 GB | Linux ou Windows |
| Sua própria imagem Docker Qualquer registro público ou privado | Qualquer coisa que você traga | Sem mínimo | Linux |

Toda imagem Linux, qualquer que seja a stack escolhida, já vem com um driver NVIDIA funcional, CUDA, cuDNN e NCCL. Você é livre para substituir tudo isso — é o seu root, e reinstalar não custa nada e não tem limite de frequência.

## Containers e CUDA

O Docker e o NVIDIA Container Toolkit estão instalados e configurados. A verificação abaixo vale trinta segundos, porque um container que não consegue ver as placas falha de um jeito confuso bem mais tarde.

Um container consegue ver as placas?

```
$ docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi

# Tarefas multi-GPU também precisam de memória compartilhada e IPC, que os limites padrão restringem.
# Essas três flags são a causa mais comum de um travamento silencioso do NCCL:
$ docker run --rm --gpus all --ipc=host --shm-size=16g --ulimit memlock=-1 …
```

## Servindo um modelo

O caminho útil mais curto entre uma máquina entregue e um endpoint compatível com a OpenAI. Substitua pelo seu próprio modelo; o que importa são as flags.

vLLM numa única placa

```
$ docker run -d --name vllm --gpus all --ipc=host -p 8000:8000 \
    vllm/vllm-openai:latest \
--model meta-llama/Llama-3.3-70B-Instruct \
    --max-model-len 8192 \
    --gpu-memory-utilization 0.92

# Num nó multi-GPU, divida entre todas as placas da máquina:
$ … --tensor-parallel-size 4

# Depois, a partir da sua própria máquina:
$ curl http://203.0.113.42:8000/v1/models
```

**Esse endpoint não tem autenticação.** Publicado num endereço público, é um servidor de inferência aberto, e será encontrado em questão de horas. Vincule-o ao localhost e acesse-o por um túnel SSH, ou coloque-o atrás das regras de firewall da próxima seção, antes de deixá-lo em execução.

Se um determinado modelo cabe numa determinada máquina é aritmética, não opinião — pesos, mais um cache KV que cresce com o comprimento do contexto. O configurador faz essa conta para cada configuração antes de você pagar, e o [guia de dimensionamento de VRAM](https://gpuserver.io/pt/guides/vram-sizing) mostra a fórmula para que você possa conferir a nossa.

## Discos e armazenamento

Os discos são entregues em bruto além do volume de sistema. Não impomos nenhum nível de RAID, porque o nível certo depende de você estar guardando checkpoints que não pode perder ou um dataset que pode baixar novamente em uma hora.

Um volume de scratch em striping pelos dispositivos NVMe sobressalentes

```
# Verifique o que está sem uso primeiro — isso destrói dados nos dispositivos indicados.
$ lsblk

$ mdadm --create /dev/md0 --level=0 --raid-devices=2 /dev/nvme1n1 /dev/nvme2n1
$ mkfs.ext4 -E lazy_itable_init=0,lazy_journal_init=0 /dev/md0
$ mkdir -p /scratch && mount /dev/md0 /scratch
$ echo '/dev/md0 /scratch ext4 defaults,noatime 0 2' >> /etc/fstab
```

NVMe adicional, HDD de arquivamento e snapshots fora da máquina são opções mensais, adicionadas no configurador ou depois. Discos locais não têm backup feito por nós e nunca terão — veja [snapshots](https://gpuserver.io/pt/docs#snapshots) abaixo.

## Firewall e portas

Tudo está aberto para entrada, exceto o que sua própria máquina bloquear: não há filtro de rede na sua frente, o que é deliberado e coloca a responsabilidade aqui. A porta 25 de saída é a única exceção, fechada a montante até você pedir.

Um conjunto mínimo de regras: SSH de qualquer lugar, um serviço a partir de um endereço

```
$ ufw default deny incoming
$ ufw default allow outgoing
$ ufw allow 22/tcp
$ ufw allow from 198.51.100.7 to any port 8000 proto tcp
$ ufw --force enable

# Mais seguro do que abrir uma porta: mantenha o serviço no localhost
# e crie um túnel até ele a partir da sua própria máquina.
$ ssh -N -L 8000:127.0.0.1:8000 root@203.0.113.42
```

## IPMI e reinstalação

O acesso fora de banda está presente em toda máquina, com endereço próprio. É assim que você recupera uma máquina da qual se trancou para fora, às três da manhã, sem pedir nada a ninguém.

### Energia

Ciclo de energia forçado, desligamento controlado e o estado de energia do chassi — independente de o sistema operacional estar respondendo.

### Console serial e KVM

A tela que a máquina mostraria num monitor, incluindo o bootloader e um kernel panic. É aqui que você conserta um `fstab` quebrado.

### Mídia virtual

Monte qualquer ISO pela rede e inicialize a partir dela. Isso inclui uma imagem de resgate, e inclui um sistema operacional que não oferecemos.

Uma reinstalação limpa para qualquer imagem que oferecemos é solicitada a nós e leva aproximadamente o mesmo tempo que a entrega original. Não custa nada, não há limite de frequência, e a máquina mantém seus endereços. Tudo nos discos é destruído por ela — esse é o propósito de uma reinstalação, e não há como desfazer.

## Snapshots

Opcionais, mensais, fora da máquina. Se você não os contratar, nenhuma cópia dos seus dados existe em lugar nenhum além dos seus próprios discos — o padrão correto para a maior parte do que roda numa GPU, e um desastre para o resto.

O que é capturado Nível de bloco, noturno O volume de sistema inteiro, capturado com a máquina em execução. Arrays de scratch criados por você só são incluídos se você pedir.

Onde fica Outro prédio, mesmo país Nunca na máquina que protege. Um chassi com falha não leva seus próprios snapshots junto.

Retenção 30 dias corridos Depois, sobrescrito. Não há arquivamento de longo prazo, nem como solicitar um depois do fato.

Ao final do prazo Excluído junto com a máquina Os snapshots não sobrevivem ao servidor a que pertencem. Retire o que precisar antes do fim do prazo.

## Encerrando o prazo

Um prazo mensal termina ao final do mês pago, sem período de aviso prévio e sem taxa de cancelamento. O que acontece depois não é reversível, por isso está detalhado aqui, e não em uma nota de rodapé.

1. **Nada se renova sozinho.** Não há cartão registrado nem débito automático — um prazo continua apenas porque você pagou pelo próximo.
2. **A porta pública é cortada no momento em que o prazo termina.** A máquina para de ser alcançável imediatamente, não ao final de um dia de tolerância.
3. **Os discos são apagados dentro de uma hora.** Apagamento criptográfico, seguido de uma sobrescrita completa. Não há uma janela durante a qual seus dados ainda existam em algum lugar.
4. **Os snapshots vão junto.** Se você os comprou, eles são excluídos na mesma passagem.
5. **O endereço volta para o pool.** Depois de um período de retenção, e somente quando estiver limpo.

**Copie seus dados para fora antes do último dia, não nele.** Não podemos restaurar nada depois — nem mediante pagamento, nem como favor. A limpeza já foi executada, e o motivo pelo qual podemos prometer uma máquina limpa ao próximo locatário é que ela roda sem que ninguém precise aprová-la.

## Tudo acima funciona em todas as máquinas do catálogo.

Não existe nível em que IPMI, reinstalações ou banda sem contador custem a mais. Escolha uma placa, escolha um site, e o resto desta página se aplica.

[Explorar o catálogo](https://gpuserver.io/pt/#catalog) [Ler os guias](https://gpuserver.io/pt/guides)

## Páginas relacionadas

- [Guias Oito guias práticos: dimensionamento de VRAM, NVLink vs PCIe, imagem e vídeo, mensal vs por hora, hospedagem própria vs API, servir o Llama 70B e QLoRA.](https://gpuserver.io/pt/guides)
- [Política de hardware As doze GPUs NVIDIA que operamos, o amaciamento de 72 horas antes da venda de um nó, a meta de troca em quatro horas, e como os discos são apagados entre locatários.](https://gpuserver.io/pt/hardware)
- [Rede Portas sem contador até 25 Gbit/s, duas operadoras e um IX por site, filtragem DDoS sempre ativa, IPv6 roteado — e as quatro coisas que não oferecemos, já ditas.](https://gpuserver.io/pt/network)
- [Sobre nós Quem administra o gpuserver.io, por que compramos o hardware em vez de revendê-lo, e as quatro regras que não flexibilizamos — incluindo as que já custaram vendas.](https://gpuserver.io/pt/about)

---

Fonte: https://gpuserver.io/pt/docs/. Este arquivo é gerado a partir dos mesmos dados que o site; se um número aqui divergir de uma página, a página prevalece e este arquivo está desatualizado — a fonte canônica é https://gpuserver.io/.
