O que instalamos em rack, e o que acontece quando quebra.
Um servidor dedicado é uma promessa sobre um objeto físico. Esta página descreve esse objeto: quais placas compramos, como um nó é testado antes de receber um locatário, e o que fazemos no dia em que um deles morre.
- 12Modelos de GPU que operamos
- 72 hamaciamento antes de um nó receber um locatário
- 4 hmeta para substituir hardware com falha
- 0placas revendidas de outro provedor
Toda placa que operamos
Esta é a lista completa — não há nível não listado nem placa reservada para contas maiores. A largura de banda de memória está na tabela porque, para inferência, ela prevê o throughput muito melhor do que qualquer valor de teraflops.
| Placa | Arquitetura | Memória | Largura de banda | Tamanhos de nó | A partir de |
|---|---|---|---|---|---|
| L4 | Ada Lovelace | 24 GB | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/mês |
| RTX 4090 | Ada Lovelace | 24 GB | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/mês |
| RTX 5090 | Blackwell | 32 GB | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/mês |
| RTX A6000 | Ampere | 48 GB | 768 GB/s | 1×, 2×, 4×, 8× | $286/mês |
| L40S | Ada Lovelace | 48 GB | 864 GB/s | 1×, 2×, 4×, 8× | $714/mês |
| A100 PCIe | Ampere | 40 GB | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/mês |
| A100 PCIe | Ampere | 80 GB | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/mês |
| H100 PCIe | Hopper | 80 GB | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/mês |
| A100 SXM4 | Ampere | 80 GB | 2,039 GB/s | 4×, 8× | $4,395/mês |
| H100 SXM5 | Hopper | 80 GB | 3,350 GB/s | 4×, 8× | $6,061/mês |
| H200 SXM5 | Hopper | 141 GB | 4,800 GB/s | 4×, 8× | $8,405/mês |
| B200 SXM6 | Blackwell | 180 GB | 8,000 GB/s | 4×, 8× | $11,790/mês |
Toda placa é uma peça de varejo ou OEM comprada nova, com a garantia em nosso nome. Não compramos estoque ex-mineração, e não compramos placas cujo histórico não conseguimos rastrear — uma RTX 4090 usada é barata por um motivo, e o motivo chega no quarto mês.
O que envolve as placas
Uma GPU privada de CPU, RAM ou throughput de disco é uma forma cara de esperar. O chassi é escolhido pela quantidade de placas, não vendido como um caminho de upgrade.
| Nó | CPU | RAM do sistema | Armazenamento local | Porta |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X | 128 GB | 2 × 2 TB NVMe | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X | 256 GB | 2 × 3.84 TB NVMe | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X | 512 GB | 4 × 3.84 TB NVMe | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ | 1 TB | 8 × 3.84 TB NVMe | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMe | 25 Gbit/s |
Quando duas CPUs estão listadas, qualquer uma delas pode ser entregue — elas são equivalentes em número de núcleos e canais de memória, e o configurador mostra qual delas o seu nó tem antes de você pagar. Os discos são entregues no estado bruto: não impomos nenhum nível de RAID, porque o nível correto depende de você estar armazenando checkpoints ou um dataset que pode baixar novamente.
Antes de um nó ser vendido
Uma máquina só chega ao catálogo depois de passar três dias tentando falhar sem sucesso. Quase toda placa que vai morrer cedo morre aqui, em nossas mãos, e não nas suas.
ETAPA 1 · 2 HORAS
Montagem e inventário
Os números de série de cada placa, módulo e disco são registrados em relação ao chassi. Esse registro é o que nos permite dizer a você, depois, exatamente qual peça física está na sua máquina.
ETAPA 2 · 24 HORAS
Teste de estresse de memória e computação
Testes de padrão ECC em toda a VRAM de cada placa, seguidos de multiplicação de matrizes sustentada a 100% de utilização. Um único erro não corrigível e a placa volta para a caixa.
ETAPA 3 · 24 HORAS
Teste térmico e de potência
O nó inteiro é mantido em carga total enquanto a temperatura de entrada é elevada ao pior caso da sala. Registramos o clock que as placas realmente sustentam — não o valor de boost da caixa — e um nó que reduz o clock abaixo da especificação é reencaixado ou tem a pasta térmica refeita antes de ser testado novamente.
ETAPA 4 · 24 HORAS
Interconexão e armazenamento
Largura de banda peer-to-peer de NVLink ou PCIe medida entre placas, resistência de escrita do NVMe amostrada, porta mantida na taxa de linha. Os números são comparados com os de outros nós do mesmo modelo, porque um nó 15% mais lento é um nó com problema.
DEPOIS · EM RACK E AGUARDANDO
Disponível, com uma imagem pronta para gravar
É por isso que a entrega é em menos de 5 minutos, e não um dia útil: nada é montado quando você faz o pedido. A máquina já existe, ligada e testada, e seu pagamento aciona a gravação de uma imagem, não uma montagem.
Firmware e drivers
nvidia-smi; a consequência para a garantia é nossa, não sua.
Quando algo falha
Hardware quebra. O que diferencia os provedores não é se isso acontece, mas como são as próximas quatro horas.
As peças de reposição estão no local
Cada sala mantém placas de reposição, fontes de alimentação, discos e um chassi completo por modelo. Uma substituição é uma caminhada até o corredor, não um agendamento de transportadora.
Meta de quatro horas
Do seu relato até o hardware funcionando novamente, 24 horas por dia. Se não cumprirmos, o SLA estende seu prazo automaticamente — você não precisa solicitar.
Seus discos continuam seus
Uma GPU ou fonte de alimentação com defeito é trocada com os discos intocados e no lugar. Só pedimos permissão antes de mexer no armazenamento, e somente quando o armazenamento é o que falhou.
Entre dois locatários
A mesma máquina será alugada novamente depois de você. Tudo o que vem abaixo acontece antes que ela volte ao catálogo, quer alguém pergunte ou não.
| Etapa | O que acontece | Verificado por |
|---|---|---|
| 1. Rede | A máquina é cortada da sua porta pública no momento em que o prazo termina. Nada fica acessível enquanto ela espera. | Estado da porta, registrado |
| 2. Armazenamento | Todo dispositivo NVMe recebe uma limpeza criptográfica completa, seguida de uma sobrescrita de passagem única em todo o espaço de endereçamento. | Amostra de releitura em cada dispositivo |
| 3. Memória de GPU | As placas são reiniciadas e sua memória é limpa; os contadores ECC são lidos e comparados com os valores registrados no amaciamento. | log de reset do nvidia-smi |
| 4. Firmware | As configurações de BMC e BIOS são regravadas para a nossa referência, descartando qualquer alteração feita durante o prazo. | Checksum contra a referência |
| 5. Identidade | Credenciais de IPMI rotacionadas, endereços IP devolvidos ao pool, rDNS limpo. | Endereço retido até ficar limpo |
É também por isso que não podemos restaurar nada depois que um prazo termina. Não há período de carência durante o qual seus dados ainda existem em algum lugar — a etapa 2 já foi executada. Se precisar deles, retire-os da máquina antes que o prazo se encerre.
O que não faremos
Particionar uma placa. Sem MIG, sem vGPU, sem time-slicing. Um locatário por GPU física, o que torna o throughput da listagem reprodutível.
Sobrealocar um nó. Não existe uma segunda conta na máquina, nem um hipervisor entre você e o hardware.
Revender a capacidade de outra empresa. Toda placa nesta página é uma placa que compramos e instalamos em rack. Nada aqui é margem de revenda sobre outra nuvem.
Substituir por uma placa diferente. Se o modelo que você pediu não puder ser entregue, não enviamos silenciosamente algo quase equivalente — avisamos você e reembolsamos o prazo.
Entrar no seu sistema operacional. O root é só seu. Temos IPMI, que pode reiniciar a energia e montar mídia; não guardamos um login dentro da sua máquina.
Guardar uma cópia de qualquer coisa. Não fazemos backup dos seus discos. Snapshots só existem se você comprá-los, e são apagados junto com o prazo.
A especificação na linha é a especificação que você recebe.
Toda placa acima está disponível em todos os 6 centros de dados, instalada em rack e com amaciamento feito, com uma imagem pronta para gravar.
Páginas relacionadas
- RedePortas sem contador até 25 Gbit/s, duas operadoras e um IX por site, filtragem DDoS sempre ativa, IPv6 roteado — e as quatro coisas que não oferecemos, já ditas.
- DocumentaçãoPrimeiro SSH, verificação do hardware, containers CUDA, servir um modelo com vLLM, RAID, firewall, IPMI e reinstalações — os comandos, em uma máquina real.
- Acordo de nível de serviçoO compromisso de 99,9%: o que conta como indisponibilidade, como é medido de fora, cinco minutos de prazo devolvidos por minuto perdido, e as exclusões por completo.
- Sobre nósQuem administra o gpuserver.io, por que compramos o hardware em vez de revendê-lo, e as quatro regras que não flexibilizamos — incluindo as que já custaram vendas.