Acordo de nível de serviço.
Um compromisso, medido por máquina, por mês corrido. Não creditamos uma conta porque não existe saldo de conta aqui; nós estendemos seu prazo pelo tempo perdido.
- 99.9%por máquina, por mês-calendário
- ×5o tempo perdido, devolvido como prazo
- 0formulários para preencher para reivindicá-lo
- 4 hmeta para substituir hardware com falha
1. O compromisso
99,9% de disponibilidade, por máquina, por mês-calendário, quanto à conectividade de rede e à energia.
Isso equivale a um orçamento de cerca de 43 minutos em um mês de trinta dias. Para efeito de comparação:
| Compromisso | Por mês | Por ano | Na prática |
|---|---|---|---|
| 99% | 7.2 h | 86.4 h | Um dia útil por ano fora do ar |
| 99.5% | 3.6 h | 43.2 h | Meio dia por mês é aceitável |
| 99.9% Nossa | 43 min | 8.6 h | Uma reinicialização e uma nova rota, e nada além disso |
| 99.99% | 4 min | 0.9 h | Exige máquinas redundantes, o que um único servidor dedicado não é |
Nos comprometemos com 99,9% e não mais do que isso, porque uma única máquina dedicada não pode prometer honestamente mais. Quatro noves exigem redundância entre máquinas, e isso é algo que você constrói em cima do que alugamos a você — não algo que possamos vender numa única caixa.
2. O que conta como indisponibilidade
Um minuto conta como tempo de inatividade quando sua máquina fica inacessível de fora da nossa rede, ou perde energia, por um motivo sob nosso controle.
- Rede: o endereço público da sua máquina não responde de fora da nossa rede, por causa dos nossos roteadores, dos nossos switches, dos nossos uplinks ou do nosso trânsito.
- Energia: a máquina perdeu energia, ou foi desligada por nós.
- Hardware: um componente que fornecemos falhou e a máquina não consegue funcionar por causa disso. Contado a partir do seu relato — veja a cláusula 5.
O tempo de inatividade é contado por máquina. Se você aluga quatro servidores e um fica inacessível, esse tem um incidente; os outros três não.
3. Como é medido
- De fora do centro de dados, pelo endereço público, não a partir de uma sonda no mesmo rack.
- Com resolução de um minuto. Um incidente é contado a partir da primeira verificação com falha até a primeira bem-sucedida.
- São necessárias três verificações consecutivas com falha para abrir um incidente, para que um único pacote perdido não vire uma interrupção. Uma vez aberto, os três minutos contam.
- A medição é contínua e automática. Ela não depende de você ter percebido.
A página de status publica o que as sondas registraram, componente por componente e local por local, e mantém cada incidente em seu histórico — os mesmos dados sobre os quais este acordo se baseia, e o mesmo log desde setembro de 2022.
4. O que você recebe de volta
Tempo, não dinheiro. Não há saldo de conta aqui para creditar, então o tempo de inatividade é reposto na única moeda realmente equivalente: mais tempo da máquina que você alugou.
5. Substituição de hardware
Separado do compromisso de disponibilidade, e vale mencionar isoladamente porque é o que você mais provavelmente vai usar.
- Prazo de quatro horas entre o seu relato e o hardware funcionando novamente, a qualquer hora do dia, em qualquer máquina.
- Peças de reposição — placas, PSUs, discos e um chassi completo por modelo — ficam na mesma sala. Uma substituição é uma caminhada pelo corredor, não uma reserva com transportadora.
- Os seus discos permanecem no lugar em uma substituição de GPU, PSU ou ventoinha. Só mexemos no armazenamento quando o armazenamento é o que falhou, e pedimos permissão antes.
- Se não cumprirmos as quatro horas, o excedente conta como tempo de inatividade nos termos da cláusula 1 e é reposto nos termos da cláusula 4.
Uma falha causada por algo que você fez — um kernel que não inicializa, uma regra de firewall que bloqueou seu próprio acesso, um fstab que trava a máquina em pânico — não é uma falha de hardware. Também não é um problema nosso para resolver, porque você tem IPMI e pode consertá-lo você mesmo. Veja a documentação.
6. Manutenção programada
A manutenção programada é excluída do cálculo de disponibilidade, mas apenas quando é de fato programada:
- Pelo menos 72 horas de aviso prévio, no contato que você nos informou.
- Uma janela informada, com uma duração máxima informada.
- Entre 01h00 e 05h00 no horário local do centro de dados, a menos que uma questão de segurança torne isso impossível.
O trabalho que ultrapassa a janela informada conta como tempo de inatividade pelo excedente. Trabalhos emergenciais — uma falha no caminho de energia, uma correção de segurança que não pode esperar — são anunciados assim que possível e contam como tempo de inatividade; não vamos reclassificar a nossa própria emergência como a sua manutenção programada.
Não enviamos atualizações de firmware para uma máquina durante um prazo. BIOS, BMC e VBIOS são definidos antes de o nó entrar no catálogo e aplicados novamente entre locatários, nunca debaixo de você.
7. Exclusões
O que segue não conta como tempo de inatividade. Esta é a lista completa, e se algo não estiver nela, conta.
- Qualquer coisa dentro do seu sistema operacional. Um kernel travado, um disco cheio, um serviço mal configurado, uma regra de firewall que bloqueou seu próprio acesso, um driver que você substituiu. Você tem root; esse lado da fronteira é seu.
- Manutenção programada anunciada nos termos da cláusula 6, dentro da janela informada.
- Suspensão nos termos da política de uso aceitável.
- Falta de pagamento. Um prazo já encerrado não tem compromisso de disponibilidade.
- Ataques de negação de serviço contra você, além da capacidade de mitigação do site. Nós filtramos, em vez de aplicar null-route ao seu endereço, e continuaremos filtrando; não podemos nos comprometer a absorver um ataque de tamanho ilimitado.
- Falhas da internet pública fora da nossa rede — uma queda em um peer, um cabo submarino, um vazamento de rota causado por terceiros.
- Força maior: desastre natural, guerra, uma ordem governamental, uma falha de utilidade pública que afete toda a instalação além da autonomia do gerador.
- Qualquer coisa que você nos pediu para fazer, incluindo uma reinstalação ou um ciclo de energia solicitado por você.
8. Contestando uma medição
Se o seu próprio monitoramento indicar que uma máquina ficou fora do ar e o nosso não, nos avise. Traga registros de data e hora com fuso horário e, se você os tiver, os resultados brutos das verificações.
Vamos analisar a mesma janela pelo nosso lado e dizer o que vemos. Se a nossa medição estiver errada, nós a corrigimos e aplicamos a cláusula 4 — para nós, estar certo vale menos do que ser confiável nisso.
Uma coisa que vale a pena saber com antecedência: uma máquina inacessível a partir de um único ponto da internet, mas acessível de todos os outros, costuma ser um problema de roteamento entre a sua rede e a nossa. Ainda vale a pena relatar — muitas vezes conseguimos corrigir — mas isso não aparecerá como tempo de inatividade em uma medição feita de fora.
Páginas relacionadas
- Status do serviçoStatus de cada componente e centro de dados do gpuserver.io, sondados a cada 60s em cinco cidades, com disponibilidade de 90 dias e log de incidentes desde 2022.
- Histórico de incidentesTodos os incidentes e janelas de manutenção em gpuserver.io desde setembro de 2022, mês a mês, com linha do tempo e revisão pós-incidente.
- Termos de serviçoO contrato entre você e o gpuserver.io: o que oferecemos, o que paga, como um prazo termina, reembolsos, suspensão, responsabilidade — para ler, não passar os olhos.
- RedePortas sem contador até 25 Gbit/s, duas operadoras e um IX por site, filtragem DDoS sempre ativa, IPv6 roteado — e as quatro coisas que não oferecemos, já ditas.