Top-of-rack switch reboot, rack AMS-E08
Rede — trânsito e peering — AMS
Linha do tempo
-
Resolvido
Rack E08 has been stable since 06:44 UTC. Duration: 7 minutes. Running workloads were not interrupted; only reachability was lost. Affected machines receive the SLA extension automatically.
-
Causa identificada
The switch has reloaded and its uplinks are up. It rebooted on a software watchdog; we have the crash file and will send it to the vendor.
-
Investigando
The top-of-rack switch in rack E08 of AMS rebooted unexpectedly at 06:37 UTC. The 7 machines in that rack are unreachable while it comes back up.
Revisão pós-incidente ·
O que aconteceu, e o que mudou
Causa
The top-of-rack switch in AMS-E08 hit a memory leak in its control-plane process that the vendor has since fixed; the watchdog reloaded the switch when the process stopped responding.
Impacto
7 machines were unreachable for 7 minutes. GPU workloads continued to run and no data was lost.
O que mudamos
- The fixed switch firmware was rolled out to every rack in the fleet during the following maintenance windows.
- The watchdog now reports a warning at 80% memory use instead of only reloading at 100%, giving us time to move the rack to its backup path first.
Os horários são mostrados no seu fuso horário ().
Páginas relacionadas
- Status do serviçoStatus de cada componente e centro de dados do gpuserver.io, sondados a cada 60s em cinco cidades, com disponibilidade de 90 dias e log de incidentes desde 2022.
- Histórico de incidentesTodos os incidentes e janelas de manutenção em gpuserver.io desde setembro de 2022, mês a mês, com linha do tempo e revisão pós-incidente.
- Acordo de nível de serviçoO compromisso de 99,9%: o que conta como indisponibilidade, como é medido de fora, cinco minutos de prazo devolvidos por minuto perdido, e as exclusões por completo.
- RedePortas sem contador até 25 Gbit/s, duas operadoras e um IX por site, filtragem DDoS sempre ativa, IPv6 roteado — e as quatro coisas que não oferecemos, já ditas.