Lo que instalamos en rack, y qué ocurre cuando se avería.
Un servidor dedicado es una promesa sobre un objeto físico. Esta página describe ese objeto: qué tarjetas compramos, cómo se prueba un nodo antes de asignarle un inquilino, y qué hacemos el día que una de ellas se avería.
- 12Modelos de GPU que operamos
- 72 hrodaje antes de que un nodo reciba un inquilino
- 4 hobjetivo para sustituir hardware averiado
- 0tarjetas revendidas de otro proveedor
Cada tarjeta que operamos
Esta es la lista completa —no hay ningún nivel no listado ni ninguna tarjeta que reservemos para cuentas más grandes. El ancho de banda de memoria figura en la tabla porque, para la inferencia, predice el rendimiento mucho mejor que cualquier cifra de teraflops.
| Tarjeta | Arquitectura | Memoria | Ancho de banda | Tamaños de nodo | Desde |
|---|---|---|---|---|---|
| L4 | Ada Lovelace | 24 GB | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/mes |
| RTX 4090 | Ada Lovelace | 24 GB | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/mes |
| RTX 5090 | Blackwell | 32 GB | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/mes |
| RTX A6000 | Ampere | 48 GB | 768 GB/s | 1×, 2×, 4×, 8× | $286/mes |
| L40S | Ada Lovelace | 48 GB | 864 GB/s | 1×, 2×, 4×, 8× | $714/mes |
| A100 PCIe | Ampere | 40 GB | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/mes |
| A100 PCIe | Ampere | 80 GB | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/mes |
| H100 PCIe | Hopper | 80 GB | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/mes |
| A100 SXM4 | Ampere | 80 GB | 2,039 GB/s | 4×, 8× | $4,395/mes |
| H100 SXM5 | Hopper | 80 GB | 3,350 GB/s | 4×, 8× | $6,061/mes |
| H200 SXM5 | Hopper | 141 GB | 4,800 GB/s | 4×, 8× | $8,405/mes |
| B200 SXM6 | Blackwell | 180 GB | 8,000 GB/s | 4×, 8× | $11,790/mes |
Cada tarjeta es una pieza retail u OEM comprada nueva, con su garantía a nuestro nombre. No compramos stock procedente de minería, y no compramos tarjetas cuya historia no podamos verificar — una RTX 4090 usada es barata por algo, y ese algo llega en el cuarto mes.
Qué rodea a las tarjetas
Una GPU privada de CPU, RAM o rendimiento de disco es una forma cara de esperar. El chasis se elige por el número de tarjetas, no se vende como una vía de ampliación.
| Nodo | CPU | RAM del sistema | Almacenamiento local | Puerto |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X | 128 GB | 2 × 2 TB NVMe | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X | 256 GB | 2 × 3.84 TB NVMe | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X | 512 GB | 4 × 3.84 TB NVMe | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ | 1 TB | 8 × 3.84 TB NVMe | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMe | 25 Gbit/s |
Cuando se indican dos CPU, puede entregarse cualquiera de las dos —están igualadas en número de núcleos y canales de memoria, y el configurador le muestra cuál tiene su nodo antes de pagar—. Los discos se entregan en bruto: no imponemos ningún nivel de RAID, porque el adecuado depende de si está almacenando checkpoints o un conjunto de datos que puede volver a descargar.
Antes de vender un nodo
Una máquina llega al catálogo solo después de pasar tres días intentando romperse sin conseguirlo. Casi toda tarjeta que vaya a fallar pronto lo hace aquí, en nuestras manos, y no en las suyas.
PASO 1 · 2 HORAS
Montaje e inventario
Los números de serie de cada tarjeta, módulo y disco se registran junto con el chasis. Ese registro es lo que nos permite decirle, más tarde, exactamente qué pieza física hay en su máquina.
PASO 2 · 24 HORAS
Prueba de estrés de memoria y cómputo
Pruebas de patrones ECC de VRAM completa en cada tarjeta, seguidas de multiplicación de matrices sostenida al 100 % de utilización. Un solo error no corregible y la tarjeta vuelve a la caja.
PASO 3 · 24 HORAS
Prueba de estrés térmico y de potencia
El nodo completo se somete a plena carga mientras la temperatura de entrada se eleva al peor caso de la sala. Registramos la frecuencia que las tarjetas sostienen realmente —no la cifra de boost de la caja— y un nodo cuya frecuencia cae por debajo de la especificación se vuelve a asentar o se le renueva la pasta térmica antes de volver a probarlo.
PASO 4 · 24 HORAS
Interconexión y almacenamiento
Se mide el ancho de banda punto a punto de NVLink o PCIe entre tarjetas, se muestrea la resistencia de escritura de los NVMe, y se mantiene el puerto a velocidad de línea. Las cifras se comparan con las de los demás nodos del mismo modelo, porque un nodo que rinde un 15 % menos es un nodo con un problema.
DESPUÉS · EN RACK Y ESPERANDO
Disponible, con una imagen lista para escribir
Por eso la entrega es en menos de 5 minutos y no un día laborable: no se monta nada cuando usted hace el pedido. La máquina ya existe, encendida y probada, y su pago activa la escritura de una imagen, no un montaje.
Firmware y controladores
nvidia-smi; la consecuencia sobre la garantía es nuestra, no suya.
Cuando algo falla
El hardware falla. Lo que distingue a los proveedores no es si ocurre, sino cómo son las siguientes cuatro horas.
Los repuestos están en las instalaciones
Cada sala tiene tarjetas, PSU y discos de repuesto, y un chasis completo de repuesto por modelo. Un recambio es un paseo por el pasillo, no una reserva con un mensajero.
Objetivo de cuatro horas
Desde su aviso hasta el hardware funcionando de nuevo, las 24 horas. Si no lo cumplimos, el SLA prolonga su plazo automáticamente — no tiene que reclamarlo.
Sus discos siguen siendo suyos
Una GPU o una PSU averiada se sustituye dejando los discos intactos y en su sitio. Solo pedimos permiso antes de tocar el almacenamiento, y solo cuando lo que ha fallado es el almacenamiento.
Entre dos inquilinos
La misma máquina se alquilará de nuevo después de usted. Todo lo que sigue ocurre antes de que vuelva a entrar en el catálogo, se pida o no.
| Paso | Qué ocurre | Verificado por |
|---|---|---|
| 1. Red | La máquina se desconecta de su puerto público en el momento en que termina el plazo. Nada queda accesible mientras espera. | Estado del puerto, registrado |
| 2. Almacenamiento | Cada dispositivo NVMe recibe un borrado criptográfico completo, seguido de una sobrescritura de una sola pasada de todo el espacio de direcciones. | Muestra de relectura en cada dispositivo |
| 3. Memoria de GPU | Las tarjetas se reinician y su memoria se borra; los contadores ECC se leen y se comparan con los valores registrados durante el rodaje. | Registro de reinicios de nvidia-smi |
| 4. Firmware | La configuración del BMC y el BIOS se regraba con nuestra configuración de referencia, descartando cualquier cambio realizado durante el plazo. | Suma de comprobación frente a la referencia |
| 5. Identidad | Se rotan las credenciales IPMI, las direcciones IP vuelven al pool, y se borra el rDNS. | Dirección retenida hasta que está limpia |
Esto también explica por qué no podemos restaurar nada después de que finalice el plazo. No existe ningún período de gracia durante el cual sus datos sigan existiendo en algún lugar —el paso 2 ya se ha ejecutado. Si los necesita, retírelos de la máquina antes de que finalice el plazo.
Qué no haremos
Particionar una tarjeta. Nada de MIG, nada de vGPU, nada de time-slicing. Un inquilino por GPU física, lo que hace que el rendimiento del listado sea reproducible.
Sobrevender un nodo. No hay una segunda cuenta en la máquina ni un hipervisor entre usted y el metal.
Revender la capacidad de otro. Cada tarjeta de esta página es una tarjeta que hemos comprado e instalado en rack. Nada de esto es un margen de revendedor sobre otra nube.
Sustituir por una tarjeta distinta. Si el modelo que pidió no se puede entregar, no le enviamos en silencio algo casi equivalente — se lo decimos y le reembolsamos el plazo.
Entrar en su sistema operativo. El root es solo suyo. Tenemos IPMI, que puede reiniciar la alimentación y montar medios; no guardamos ningún acceso dentro de su máquina.
Guardar copia de nada. No hacemos copias de seguridad de sus discos. Las instantáneas solo existen si las compra, y se eliminan con el plazo.
La especificación de la fila es la especificación que recibe.
Todas las tarjetas anteriores están disponibles en los 6 centros de datos, instaladas en rack y con el rodaje hecho, con una imagen lista para escribir.
Páginas relacionadas
- RedPuertos sin contador hasta 25 Gbit/s, dos operadores y un IX por sede, filtrado DDoS permanente, IPv6 enrutado — y las cuatro cosas que no ofrecemos, dichas ya.
- DocumentaciónPrimer SSH, verificación del hardware, contenedores CUDA, servir un modelo con vLLM, RAID, cortafuegos, IPMI y reinstalaciones: los comandos, en una máquina real.
- Acuerdo de nivel de servicioEl compromiso del 99,9 %: qué cuenta como inactividad, cómo se mide desde fuera, cinco minutos de plazo por cada minuto perdido, y las exclusiones completas.
- Sobre nosotrosQuién dirige gpuserver.io, por qué compramos el hardware en vez de revenderlo, y las cuatro reglas que no torcemos — incluidas las que nos cuestan ventas.