Cooling alarm in YUL, row D; some nodes thermally throttled
Alimentazione e raffreddamento — YUL
Cronologia
-
Risolto
Row D is back at target temperature and no GPU is throttling. Duration: 36 minutes. Affected workloads ran slower during the event but were not interrupted.
-
In osservazione
The tripped unit is back in service and inlet temperatures are falling. GPU clocks are returning to normal.
-
Causa individuata
One of the two CRAC units serving row D tripped on a pressure alarm. The remaining unit is holding the row a few degrees above target. The facility has an engineer on the unit.
-
In analisi
Inlet temperatures in row D of YUL rose above the alert threshold at 20:12 UTC. GPUs on 17 machines in that row have reduced their clocks to stay within limits. Machines remain reachable and workloads continue at lower performance.
Gli orari sono mostrati nel fuso orario locale ().
Pagine correlate
- Stato del servizioStato di ogni componente e data center gpuserver.io, sondati ogni 60 secondi da cinque città: disponibilità su 90 giorni e registro incidenti dal 2022.
- Cronologia incidentiOgni incidente e finestra di manutenzione su gpuserver.io dall’inizio del monitoraggio, a settembre 2022, mese per mese, con cronologia e analisi post-incidente.
- Accordo sul livello di servizioL’impegno del 99,9%: cosa conta come downtime, come viene misurato dall’esterno, cinque minuti di durata in più per ogni minuto perso, e le esclusioni per intero.
- RetePorte senza contatore fino a 25 Gbit/s, due carrier e un IX per sede, DDoS sempre filtrato, IPv6 instradato — e quattro cose che non offriamo, dette subito.