Инфраструктура

# Что мы устанавливаем в стойки и что происходит при поломке.

Выделенный сервер — это обещание, касающееся физического объекта. Эта страница описывает этот объект: какие карты мы покупаем, как узел тестируется до того, как получает арендатора, и что мы делаем в день, когда одна из них выходит из строя.

- 12 Модели GPU, которые мы эксплуатируем
- 72 h прогрев узла до получения арендатора
- 4 h целевой срок замены неисправного оборудования
- 0 карт, перепроданных другим провайдером

## Каждая карта, которую мы эксплуатируем

Это полный список — скрытого уровня нет, и нет карты, которую мы придерживаем для крупных клиентов. Пропускная способность памяти указана в таблице, поскольку для инференса она предсказывает итоговую пропускную способность гораздо точнее, чем любая цифра в терафлопс.

**Модели GPU, архитектура, память, пропускная способность, конфигурации узлов и стартовая цена**

| Карта | Архитектура | Память | Пропускная способность | Конфигурации узла | От |
|---|---|---|---|---|---|
| L4 Карта расширения PCIe | Ada Lovelace | 24 GB GDDR6 | 300 GB/s | 1×, 2×, 4×, 8×, 10× | $125/мес |
| RTX 4090 Карта расширения PCIe | Ada Lovelace | 24 GB GDDR6X | 1,008 GB/s | 1×, 2×, 4×, 8× | $193/мес |
| RTX 5090 Карта расширения PCIe | Blackwell | 32 GB GDDR7 | 1,792 GB/s | 1×, 2×, 4×, 8× | $335/мес |
| RTX A6000 Карта расширения PCIe | Ampere | 48 GB GDDR6 ECC | 768 GB/s | 1×, 2×, 4×, 8× | $286/мес |
| L40S Карта расширения PCIe | Ada Lovelace | 48 GB GDDR6 ECC | 864 GB/s | 1×, 2×, 4×, 8× | $714/мес |
| A100 PCIe Карта расширения PCIe | Ampere | 40 GB HBM2 | 1,555 GB/s | 1×, 2×, 4×, 8× | $392/мес |
| A100 PCIe Карта расширения PCIe | Ampere | 80 GB HBM2e | 1,935 GB/s | 1×, 2×, 4×, 8× | $1,091/мес |
| H100 PCIe Карта расширения PCIe | Hopper | 80 GB HBM3 | 2,000 GB/s | 1×, 2×, 4×, 8× | $1,469/мес |
| A100 SXM4 Модуль SXM, плата HGX | Ampere | 80 GB HBM2e | 2,039 GB/s | 4×, 8× | $4,395/мес |
| H100 SXM5 Модуль SXM, плата HGX | Hopper | 80 GB HBM3 | 3,350 GB/s | 4×, 8× | $6,061/мес |
| H200 SXM5 Модуль SXM, плата HGX | Hopper | 141 GB HBM3e | 4,800 GB/s | 4×, 8× | $8,405/мес |
| B200 SXM6 Модуль SXM, плата HGX | Blackwell | 180 GB HBM3e | 8,000 GB/s | 4×, 8× | $11,790/мес |

Каждая карта — это розничная или OEM-деталь, купленная новой, с гарантией на наше имя. Мы не покупаем бывшие в майнинге карты и не покупаем карты, чью историю не можем проследить — б/у RTX 4090 дёшева не просто так, и причина проявится на четвёртый месяц.

## Что окружает карты

GPU, которому не хватает CPU, RAM или пропускной способности диска — это дорогой способ ждать. Шасси подбирается под число карт, а не продаётся как путь для апгрейда.

**Спецификация шасси по числу GPU**

| Узел | CPU | Системная RAM | Локальное хранилище | Порт |
|---|---|---|---|---|
| 1 × GPU | AMD Ryzen 9 7950X 16 ядер / 32 потока · или Intel Xeon Silver 4410Y | 128 GB | 2 × 2 TB NVMeGen4 U.2, без навязанного RAID | 1 Gbit/s |
| 2 × GPU | AMD Threadripper 7960X 24 ядра / 48 потоков · или Intel Xeon Gold 5416S | 256 GB | 2 × 3.84 TB NVMeGen4 U.2, без навязанного RAID | 2 Gbit/s |
| 4 × GPU | AMD Threadripper 7970X 32 ядра / 64 потока · или 2 × Intel Xeon Gold 6438Y+ | 512 GB | 4 × 3.84 TB NVMeGen4 U.2, без навязанного RAID | 10 Gbit/s |
| 8 × GPU | 2 × Intel Xeon Gold 6438Y+ 64 ядра · или 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 3.84 TB NVMeGen4 U.2, без навязанного RAID | 25 Gbit/s |
| 10 × GPU | 2 × Intel Xeon Platinum 8462Y+ 64 ядра · или 2 × Intel Xeon Platinum 8462Y+ | 1 TB | 8 × 7.68 TB NVMeGen4 U.2, без навязанного RAID | 25 Gbit/s |

Если в списке указаны два CPU, вам может достаться любой из них — они совпадают по числу ядер и каналам памяти, и конфигуратор покажет, какой именно установлен на вашем узле, ещё до оплаты. Диски передаются «как есть»: мы не навязываем уровень RAID, потому что нужный уровень зависит от того, храните вы чекпоинты или датасет, который можно скачать заново.

## Перед продажей узла

Машина попадает в каталог только после трёх дней, в течение которых она не сломалась. Почти каждая карта, которой суждено умереть рано, умирает здесь, в наших руках, а не в ваших.

ШАГ 1 · 2 ЧАСА

### Сборка и учёт

Серийные номера каждой карты, модуля и диска фиксируются за конкретным шасси. Именно эта запись позволяет нам позже точно сказать, какая физическая деталь стоит в вашей машине.

ШАГ 2 · 24 ЧАСА

### Прогон памяти и вычислений

Тесты ECC по всему объёму VRAM на каждой карте, затем длительное матричное умножение при загрузке 100 %. Одна неисправимая ошибка — и карта возвращается в коробку.

ШАГ 3 · 24 ЧАСА

### Тепловой и энергетический прогон

Весь узел удерживается под полной нагрузкой, пока температура на входе поднимается до худшего случая для зала. Мы фиксируем частоту, которую карты реально держат, — а не значение буста на коробке, — и узел, снижающий частоту ниже спецификации, переустанавливают или меняют термопасту перед повторным тестом.

ШАГ 4 · 24 ЧАСА

### Интерконнект и хранилище

Пропускная способность NVLink или PCIe peer-to-peer измеряется между картами, ресурс записи NVMe проверяется выборочно, порт удерживается на предельной скорости линка. Показатели сравниваются с другими узлами той же модели, потому что узел, который на 15 % медленнее, — это узел с проблемой.

ЗАТЕМ · В СТОЙКЕ И НАГОТОВЕ

### Доступна, образ готов к записи

Именно поэтому доставка занимает менее 5 минут, а не рабочий день: при заказе ничего не собирается. Машина уже существует, включена и протестирована, а ваш платёж запускает запись образа, а не сборку.

## Прошивка и драйверы

Стек драйверов Установлены, зафиксированы, вы вправе их менять Каждый Linux-образ поставляется с уже работающими актуальным драйвером NVIDIA, CUDA, cuDNN и NCCL. Ничто не мешает вам заменить всё это — это ваш root.

Обновления прошивки Никогда во время вашего срока BIOS, BMC и VBIOS настраиваются до того, как узел попадёт в каталог. Мы не обновляем прошивку на машине, которую кто-то арендует — это делается между арендаторами.

Частоты На складе и разблокирована для вас Мы отгружаем каждую карту на референсной частоте и с референсным лимитом мощности. Вы можете изменить их с помощью `nvidia-smi`; гарантийные последствия — наши, а не ваши.

Внеполосный доступ IPMI, в отдельной сети Удалённое питание, последовательная консоль и виртуальные носители, доступные, даже когда недоступна операционная система. Всё это в управляющем VLAN, который никогда не пересекается с вашим публичным портом.

## Когда что-то выходит из строя

Оборудование ломается. Провайдеров отличает не то, случится ли это, а то, как выглядят следующие четыре часа.

### Запасные части на месте

В каждом зале хранятся запасные карты, блоки питания, диски и одно полное шасси на каждую модель. Замена — это прогулка до соседнего ряда, а не заказ курьера.

### Целевой показатель — четыре часа

От вашего сообщения до работающего оборудования, круглосуточно. Если мы не укладываемся, SLA автоматически продлевает ваш срок — заявку подавать не нужно.

### Ваши диски остаются вашими

Отказавший GPU или блок питания меняются без затрагивания дисков — они остаются на месте. Мы спрашиваем разрешения, только если нужно тронуть хранилище, и только когда отказало именно оно.

**Отказавший диск недоступен для чтения следующему арендатору.** Диски, выводимые из эксплуатации, стираются, если ещё отвечают, и физически уничтожаются, если нет. Мёртвый диск нельзя очистить, поэтому он никогда не возвращается производителю по гарантии — мы берём эти расходы на себя, лишь бы диск, когда-то хранивший ваши данные, не покинул здание целым.

## Между двумя арендаторами

Эта же машина будет сдана в аренду снова после вас. Всё, что описано ниже, происходит до того, как она вернётся в каталог — независимо от того, просит об этом кто-то или нет.

**Этапы вывода из эксплуатации между двумя арендаторами**

| Шаг | Что происходит | Проверено |
|---|---|---|
| 1. Сеть | Машина отключается от публичного порта в момент окончания срока. Пока она ждёт, ничего не остаётся доступным. | Состояние порта, с журналированием |
| 2. Хранилище | Каждое устройство NVMe проходит полное криптографическое стирание, а затем однопроходную перезапись всего адресного пространства. | Выборочное считывание на каждом устройстве |
| 3. Память GPU | Карты сбрасываются, их память очищается; счётчики ECC считываются и сравниваются со значениями, зафиксированными при прогреве. | Журнал сбросов `nvidia-smi` |
| 4. Прошивка | Настройки BMC и BIOS перепрошиваются до нашего эталона, отбрасывая любые изменения, сделанные за время срока. | Контрольная сумма относительно эталона |
| 5. Идентификация | Учётные данные IPMI сменены, IP-адреса возвращены в пул, rDNS очищен. | Адрес удерживается до полной очистки |

Именно поэтому мы не можем ничего восстановить после окончания срока. Льготного периода, в течение которого ваши данные где-то ещё существуют, не бывает — шаг 2 уже выполнен. Если данные нужны, заберите их с машины до окончания срока.

## Чего мы не будем делать

**Разделять карту.** Ни MIG, ни vGPU, ни time-slicing. Один арендатор на физический GPU — именно это делает воспроизводимой пропускную способность, указанную в объявлении.

**Продавать узел нескольким арендаторам одновременно.** На машине нет второго аккаунта и нет гипервизора между вами и железом.

**Перепродавать чужие мощности.** Каждая карта на этой странице куплена и установлена в стойку нами. Ничего здесь не является наценкой перепродавца поверх другого облака.

**Подменять карту на другую.** Если заказанную модель невозможно предоставить, мы не подсовываем тихо близкий аналог — мы сообщаем вам и возвращаем деньги за срок.

**Заходить в вашу операционную систему.** Root — только ваш. У нас есть IPMI, который может перезагрузить машину и подключить носитель; но у нас нет логина внутри вашей машины.

**Хранить копию чего-либо.** Мы не делаем резервных копий ваших дисков. Снэпшоты существуют только если вы их покупаете, и удаляются вместе с окончанием срока.

## Характеристики в строке — это характеристики, которые вы получите.

Каждая карта выше доступна во всех 6 дата-центрах, установлена в стойку и прошла прогрев, с образом, готовым к записи.

[Просмотреть каталог](https://gpuserver.io/ru/#catalog) [Читать руководства](https://gpuserver.io/ru/guides)

## Похожие страницы

- [Сеть Безлимитные порты до 25 Gbit/s, два оператора и IX на площадке, постоянная фильтрация DDoS, маршрутизируемый IPv6 — и четыре вещи, которые мы прямо не предлагаем.](https://gpuserver.io/ru/network)
- [Документация Подключение по SSH, проверка оборудования, контейнеры CUDA, запуск модели через vLLM, RAID, файрвол, IPMI и переустановки — команды на реальной машине.](https://gpuserver.io/ru/docs)
- [Соглашение об уровне обслуживания Обязательство 99,9 %: что считается простоем, как это измеряется извне, пять минут срока за минуту потерь и полный список исключений.](https://gpuserver.io/ru/legal/sla)
- [О нас Кто стоит за gpuserver.io, почему мы покупаем оборудование, а не перепродаём его, и четыре правила, от которых мы не отступаем, — даже когда это стоит нам продаж.](https://gpuserver.io/ru/about)

---

Источник: https://gpuserver.io/ru/hardware/. Этот файл формируется на основе тех же данных, что и сайт; если цифра здесь отличается от страницы сайта, приоритет у страницы, а этот файл устарел — канонический источник: https://gpuserver.io/.
