Cooling alarm in YUL, row D; some nodes thermally throttled
Alimentation et refroidissement — YUL
Chronologie
-
Résolu
Row D is back at target temperature and no GPU is throttling. Duration: 36 minutes. Affected workloads ran slower during the event but were not interrupted.
-
Sous surveillance
The tripped unit is back in service and inlet temperatures are falling. GPU clocks are returning to normal.
-
Cause identifiée
One of the two CRAC units serving row D tripped on a pressure alarm. The remaining unit is holding the row a few degrees above target. The facility has an engineer on the unit.
-
Investigation en cours
Inlet temperatures in row D of YUL rose above the alert threshold at 20:12 UTC. GPUs on 17 machines in that row have reduced their clocks to stay within limits. Machines remain reachable and workloads continue at lower performance.
Les heures sont affichées dans votre fuseau horaire ().
Pages liées
- État du serviceÉtat en direct des composants et centres de données gpuserver.io, sondés toutes les 60 s depuis cinq villes : disponibilité sur 90 jours et incidents depuis 2022.
- Historique des incidentsChaque incident et fenêtre de maintenance sur gpuserver.io depuis septembre 2022, mois par mois, avec chronologie et revue post-incident.
- Accord de niveau de serviceL’engagement de 99,9 % : la définition d’une panne, la mesure externe, cinq minutes de durée d’engagement rendues par minute perdue, et les exclusions en détail.
- RéseauPorts sans compteur jusqu’à 25 Gbit/s, deux opérateurs et un IX par site, filtrage DDoS permanent, IPv6 routé — et quatre choses que nous n’offrons pas, en clair.