Infraestructura

# Lo que instalamos en rack, y qué ocurre cuando se avería.

Un servidor dedicado es una promesa sobre un objeto físico. Esta página describe ese objeto: qué tarjetas compramos, cómo se prueba un nodo antes de asignarle un inquilino, y qué hacemos el día que una de ellas se avería.

- 12 Modelos de GPU que operamos
- 72 h rodaje antes de que un nodo reciba un inquilino
- 4 h objetivo para sustituir hardware averiado
- 0 tarjetas revendidas de otro proveedor

## Cada tarjeta que operamos

Esta es la lista completa —no hay ningún nivel no listado ni ninguna tarjeta que reservemos para cuentas más grandes. El ancho de banda de memoria figura en la tabla porque, para la inferencia, predice el rendimiento mucho mejor que cualquier cifra de teraflops.

**Modelos de GPU, arquitectura, memoria, ancho de banda, tamaños de nodo y precio de entrada**

| Tarjeta | Arquitectura | Memoria | Ancho de banda | Tamaños de nodo | Desde |
|---|---|---|---|---|---|
| L4 Tarjeta de expansión PCIe | Ada Lovelace | 24 GB GDDR6 | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/mes |
| RTX 4090 Tarjeta de expansión PCIe | Ada Lovelace | 24 GB GDDR6X | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/mes |
| RTX 5090 Tarjeta de expansión PCIe | Blackwell | 32 GB GDDR7 | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/mes |
| RTX A6000 Tarjeta de expansión PCIe | Ampere | 48 GB GDDR6 ECC | 768 GB/s | 1×, 2×, 4×, 8× | $286/mes |
| L40S Tarjeta de expansión PCIe | Ada Lovelace | 48 GB GDDR6 ECC | 864 GB/s | 1×, 2×, 4×, 8× | $714/mes |
| A100 PCIe Tarjeta de expansión PCIe | Ampere | 40 GB HBM2 | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/mes |
| A100 PCIe Tarjeta de expansión PCIe | Ampere | 80 GB HBM2e | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/mes |
| H100 PCIe Tarjeta de expansión PCIe | Hopper | 80 GB HBM3 | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/mes |
| A100 SXM4 Módulo SXM, placa HGX | Ampere | 80 GB HBM2e | 2,039 GB/s | 4×, 8× | $4,395/mes |
| H100 SXM5 Módulo SXM, placa HGX | Hopper | 80 GB HBM3 | 3,350 GB/s | 4×, 8× | $6,061/mes |
| H200 SXM5 Módulo SXM, placa HGX | Hopper | 141 GB HBM3e | 4,800 GB/s | 4×, 8× | $8,405/mes |
| B200 SXM6 Módulo SXM, placa HGX | Blackwell | 180 GB HBM3e | 8,000 GB/s | 4×, 8× | $11,790/mes |

Cada tarjeta es una pieza retail u OEM comprada nueva, con su garantía a nuestro nombre. No compramos stock procedente de minería, y no compramos tarjetas cuya historia no podamos verificar — una RTX 4090 usada es barata por algo, y ese algo llega en el cuarto mes.

## Qué rodea a las tarjetas

Una GPU privada de CPU, RAM o rendimiento de disco es una forma cara de esperar. El chasis se elige por el número de tarjetas, no se vende como una vía de ampliación.

**Especificación del chasis por número de GPU**

| Nodo | CPU | RAM del sistema | Almacenamiento local | Puerto |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X 16 núcleos / 32 hilos · o Intel Xeon Silver 4410Y | 128 GB | 2 × 2 TB NVMeGen4 U.2, sin RAID impuesto | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X 24 núcleos / 48 hilos · o Intel Xeon Gold 5416S | 256 GB | 2 × 3.84 TB NVMeGen4 U.2, sin RAID impuesto | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X 32 núcleos / 64 hilos · o 2 × Intel Xeon Gold 6438Y+ | 512 GB | 4 × 3.84 TB NVMeGen4 U.2, sin RAID impuesto | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ 64 núcleos · o 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 3.84 TB NVMeGen4 U.2, sin RAID impuesto | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ 64 núcleos · o 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMeGen4 U.2, sin RAID impuesto | 25 Gbit/s |

Cuando se indican dos CPU, puede entregarse cualquiera de las dos —están igualadas en número de núcleos y canales de memoria, y el configurador le muestra cuál tiene su nodo antes de pagar—. Los discos se entregan en bruto: no imponemos ningún nivel de RAID, porque el adecuado depende de si está almacenando checkpoints o un conjunto de datos que puede volver a descargar.

## Antes de vender un nodo

Una máquina llega al catálogo solo después de pasar tres días intentando romperse sin conseguirlo. Casi toda tarjeta que vaya a fallar pronto lo hace aquí, en nuestras manos, y no en las suyas.

PASO 1 · 2 HORAS

### Montaje e inventario

Los números de serie de cada tarjeta, módulo y disco se registran junto con el chasis. Ese registro es lo que nos permite decirle, más tarde, exactamente qué pieza física hay en su máquina.

PASO 2 · 24 HORAS

### Prueba de estrés de memoria y cómputo

Pruebas de patrones ECC de VRAM completa en cada tarjeta, seguidas de multiplicación de matrices sostenida al 100 % de utilización. Un solo error no corregible y la tarjeta vuelve a la caja.

PASO 3 · 24 HORAS

### Prueba de estrés térmico y de potencia

El nodo completo se somete a plena carga mientras la temperatura de entrada se eleva al peor caso de la sala. Registramos la frecuencia que las tarjetas sostienen realmente —no la cifra de boost de la caja— y un nodo cuya frecuencia cae por debajo de la especificación se vuelve a asentar o se le renueva la pasta térmica antes de volver a probarlo.

PASO 4 · 24 HORAS

### Interconexión y almacenamiento

Se mide el ancho de banda punto a punto de NVLink o PCIe entre tarjetas, se muestrea la resistencia de escritura de los NVMe, y se mantiene el puerto a velocidad de línea. Las cifras se comparan con las de los demás nodos del mismo modelo, porque un nodo que rinde un 15 % menos es un nodo con un problema.

DESPUÉS · EN RACK Y ESPERANDO

### Disponible, con una imagen lista para escribir

Por eso la entrega es en menos de 5 minutos y no un día laborable: no se monta nada cuando usted hace el pedido. La máquina ya existe, encendida y probada, y su pago activa la escritura de una imagen, no un montaje.

## Firmware y controladores

Pila de controladores Instalado, con versión fijada, suyo para cambiar Toda imagen de Linux se entrega con un controlador NVIDIA actual, CUDA, cuDNN y NCCL ya funcionando. Nada le impide sustituirlo todo — es su root.

Actualizaciones de firmware Nunca durante su plazo El BIOS, el BMC y el VBIOS se configuran antes de que el nodo entre en el catálogo. No enviamos firmware a una máquina que alguien tiene alquilada; se aplica entre inquilinos.

Frecuencias En stock, y desbloqueado para usted Enviamos cada tarjeta con su frecuencia y límite de potencia de referencia. Puede subirlos o bajarlos con `nvidia-smi`; la consecuencia sobre la garantía es nuestra, no suya.

Acceso fuera de banda IPMI, en una red separada Alimentación remota, consola serie y medios virtuales, accesibles incluso cuando el sistema operativo no lo está. Está en una VLAN de gestión que nunca toca su puerto público.

## Cuando algo falla

El hardware falla. Lo que distingue a los proveedores no es si ocurre, sino cómo son las siguientes cuatro horas.

### Los repuestos están en las instalaciones

Cada sala tiene tarjetas, PSU y discos de repuesto, y un chasis completo de repuesto por modelo. Un recambio es un paseo por el pasillo, no una reserva con un mensajero.

### Objetivo de cuatro horas

Desde su aviso hasta el hardware funcionando de nuevo, las 24 horas. Si no lo cumplimos, el SLA prolonga su plazo automáticamente — no tiene que reclamarlo.

### Sus discos siguen siendo suyos

Una GPU o una PSU averiada se sustituye dejando los discos intactos y en su sitio. Solo pedimos permiso antes de tocar el almacenamiento, y solo cuando lo que ha fallado es el almacenamiento.

**Un disco averiado no es legible para el siguiente inquilino.** Las unidades retiradas de servicio se borran si todavía responden, y se destruyen físicamente si no. Un disco muerto no se puede borrar, así que nunca se devuelve a un fabricante en garantía — asumimos ese coste antes que dejar que una unidad que una vez tuvo sus datos salga intacta del edificio.

## Entre dos inquilinos

La misma máquina se alquilará de nuevo después de usted. Todo lo que sigue ocurre antes de que vuelva a entrar en el catálogo, se pida o no.

**Pasos de baja entre dos inquilinos**

| Paso | Qué ocurre | Verificado por |
|---|---|---|
| 1. Red | La máquina se desconecta de su puerto público en el momento en que termina el plazo. Nada queda accesible mientras espera. | Estado del puerto, registrado |
| 2. Almacenamiento | Cada dispositivo NVMe recibe un borrado criptográfico completo, seguido de una sobrescritura de una sola pasada de todo el espacio de direcciones. | Muestra de relectura en cada dispositivo |
| 3. Memoria de GPU | Las tarjetas se reinician y su memoria se borra; los contadores ECC se leen y se comparan con los valores registrados durante el rodaje. | Registro de reinicios de `nvidia-smi` |
| 4. Firmware | La configuración del BMC y el BIOS se regraba con nuestra configuración de referencia, descartando cualquier cambio realizado durante el plazo. | Suma de comprobación frente a la referencia |
| 5. Identidad | Se rotan las credenciales IPMI, las direcciones IP vuelven al pool, y se borra el rDNS. | Dirección retenida hasta que está limpia |

Esto también explica por qué no podemos restaurar nada después de que finalice el plazo. No existe ningún período de gracia durante el cual sus datos sigan existiendo en algún lugar —el paso 2 ya se ha ejecutado. Si los necesita, retírelos de la máquina antes de que finalice el plazo.

## Qué no haremos

**Particionar una tarjeta.** Nada de MIG, nada de vGPU, nada de time-slicing. Un inquilino por GPU física, lo que hace que el rendimiento del listado sea reproducible.

**Sobrevender un nodo.** No hay una segunda cuenta en la máquina ni un hipervisor entre usted y el metal.

**Revender la capacidad de otro.** Cada tarjeta de esta página es una tarjeta que hemos comprado e instalado en rack. Nada de esto es un margen de revendedor sobre otra nube.

**Sustituir por una tarjeta distinta.** Si el modelo que pidió no se puede entregar, no le enviamos en silencio algo casi equivalente — se lo decimos y le reembolsamos el plazo.

**Entrar en su sistema operativo.** El root es solo suyo. Tenemos IPMI, que puede reiniciar la alimentación y montar medios; no guardamos ningún acceso dentro de su máquina.

**Guardar copia de nada.** No hacemos copias de seguridad de sus discos. Las instantáneas solo existen si las compra, y se eliminan con el plazo.

## La especificación de la fila es la especificación que recibe.

Todas las tarjetas anteriores están disponibles en los 6 centros de datos, instaladas en rack y con el rodaje hecho, con una imagen lista para escribir.

[Explorar el catálogo](https://gpuserver.io/es/#catalog) [Leer las guías](https://gpuserver.io/es/guides)

## Páginas relacionadas

- [Red Puertos sin contador hasta 25 Gbit/s, dos operadores y un IX por sede, filtrado DDoS permanente, IPv6 enrutado — y las cuatro cosas que no ofrecemos, dichas ya.](https://gpuserver.io/es/network)
- [Documentación Primer SSH, verificación del hardware, contenedores CUDA, servir un modelo con vLLM, RAID, cortafuegos, IPMI y reinstalaciones: los comandos, en una máquina real.](https://gpuserver.io/es/docs)
- [Acuerdo de nivel de servicio El compromiso del 99,9 %: qué cuenta como inactividad, cómo se mide desde fuera, cinco minutos de plazo por cada minuto perdido, y las exclusiones completas.](https://gpuserver.io/es/legal/sla)
- [Sobre nosotros Quién dirige gpuserver.io, por qué compramos el hardware en vez de revenderlo, y las cuatro reglas que no torcemos — incluidas las que nos cuestan ventas.](https://gpuserver.io/es/about)

---

Fuente: https://gpuserver.io/es/hardware/. Este archivo se genera a partir de los mismos datos que el sitio web; si una cifra aquí difiere de la de una página, prevalece la página y este archivo está desactualizado: la fuente canónica es https://gpuserver.io/.
