Top-of-rack switch reboot, rack AMS-E08
Сеть — транзит и пиринг — AMS
Хронология
-
Устранено
Rack E08 has been stable since 06:44 UTC. Duration: 7 minutes. Running workloads were not interrupted; only reachability was lost. Affected machines receive the SLA extension automatically.
-
Причина установлена
The switch has reloaded and its uplinks are up. It rebooted on a software watchdog; we have the crash file and will send it to the vendor.
-
Идёт расследование
The top-of-rack switch in rack E08 of AMS rebooted unexpectedly at 06:37 UTC. The 7 machines in that rack are unreachable while it comes back up.
Разбор инцидента ·
Что произошло и что изменилось
Причина
The top-of-rack switch in AMS-E08 hit a memory leak in its control-plane process that the vendor has since fixed; the watchdog reloaded the switch when the process stopped responding.
Влияние
7 machines were unreachable for 7 minutes. GPU workloads continued to run and no data was lost.
Что мы изменили
- The fixed switch firmware was rolled out to every rack in the fleet during the following maintenance windows.
- The watchdog now reports a warning at 80% memory use instead of only reloading at 100%, giving us time to move the rack to its backup path first.
Время показано в вашем часовом поясе ().
Похожие страницы
- Статус сервисаТекущий статус компонентов и дата-центров gpuserver.io: проверка каждые 60 секунд из пяти городов, доступность за 90 дней и журнал инцидентов с 2022 года.
- История инцидентовКаждый инцидент и окно обслуживания на gpuserver.io с начала мониторинга в сентябре 2022 года, по месяцам, с хронологией и разбором инцидента.
- Соглашение об уровне обслуживанияОбязательство 99,9 %: что считается простоем, как это измеряется извне, пять минут срока за минуту потерь и полный список исключений.
- СетьБезлимитные порты до 25 Gbit/s, два оператора и IX на площадке, постоянная фильтрация DDoS, маршрутизируемый IPv6 — и четыре вещи, которые мы прямо не предлагаем.