Pago em cripto · Sem verificação de identidade · Acesso root em em menos de 5 minutos
Ada Lovelace · Placa PCIe
Alugue um servidor GPU L40S dedicado.
48 GB de GDDR6 ECC a 864 GB/s, numa máquina só sua. Mensal, pago em cripto, aberta sem verificação de identidade e entregue em under 5 minutes.
$714/mouma placa, tudo incluído
48 GBGDDR6 ECC
864 GB/slargura de banda de memória
1×, 2×, 4×, 8×tamanhos de nó disponíveis
Preço, por tamanho de nó e prazo
Um número por linha, e é o número inteiro: sem taxa de instalação, sem taxa de reinstalação, sem cobrança de banda, sem plano de suporte. Prazos mais longos são pagos antecipadamente.
Preço mensal de um servidor L40S, por tamanho de nó e duração do prazo
Cada configuração acima está disponível em todos os 6 centros de dados, instalada em rack e com amaciamento feito, com uma imagem pronta para gravar — por isso a entrega é under 5 minutes, em vez de um dia útil.
Especificação completa
GPUNVIDIA L40SArquitetura Ada Lovelace, Placa de expansão PCIe.
Memória48 GB GDDR6 ECC864 GB/s de largura de banda — o número que prevê a velocidade de geração, muito melhor do que qualquer número de teraflops.
InterconexãoPCIe 5.0 ×16Ponto a ponto pelo PCIe. Adequado para um modelo por placa e para paralelismo de pipeline; mais lento que o NVLink para paralelismo de tensores. Qual delas o seu trabalho exige.
Tamanhos de nó1 × placa, 2 × placa, 4 × placa, 8 × placaPlacas PCIe vão até oito num chassi padrão, e dez apenas em placas de baixo consumo.
Armazenamento2 × 2 TB NVMeEntregue em estado bruto além do volume de sistema — não impomos nenhum nível de RAID. Mais NVMe e HDD de arquivamento são opções mensais.
Rede1 Gbit/s, sem contadorNas duas direções, sem volume incluído e sem excedente em nenhum nível de tráfego. Um IPv4, um /64 IPv6 roteado, filtragem DDoS ativa desde a entrega.
O que roda em an L40S
Cada modelo abaixo cabe numa única placa a 8k de contexto — sem sharding, sem interconexão para se preocupar. A precisão mostrada é a melhor que cabe; a conta está no guia de dimensionamento de VRAM, para você conferir.
Modelos de linguagem que cabem numa única L40S a 8k de contexto
Modelo
Melhor precisão que cabe
Memória necessária
Tokens/s estimados
Llama 3.1 8B8B de parâmetros
BF16 / FP16Qualidade de referência
20 GBde 48 GB
~24
Llama 3.3 70B70B de parâmetros
4-bit (AWQ, GPTQ)Pesos menores, cache permanece em FP16
43 GBde 48 GB
~11
Qwen 3 32B32B de parâmetros
FP8Quase referência, Hopper e Blackwell
38 GBde 48 GB
~12
Mistral Small 24B24B de parâmetros
FP8Quase referência, Hopper e Blackwell
28 GBde 48 GB
~16
Gemma 3 27B27B de parâmetros
FP8Quase referência, Hopper e Blackwell
33 GBde 48 GB
~14
Phi-4 14B14B de parâmetros
BF16 / FP16Qualidade de referência
34 GBde 48 GB
~14
No nó de 8 placas, os mesmos modelos são distribuídos por 384 GB no total, o que muda completamente o que é possível — até Llama 3.1 405B. O sharding custa sincronização em cada camada, então um modelo que cabe numa placa deve permanecer numa placa.
Throughput esperado
A geração é limitada pela largura de banda de memória: cada token exige reler os pesos ativos. A 864 GB/s, isso impõe um teto que nenhum ajuste consegue superar.
Nossos números são um piso, não uma promessa.
As estimativas nesta página são calibradas com base em medições publicadas e são deliberadamente conservadoras — elas modelam a geração em fluxo único. Com processamento contínuo por lotes no vLLM, o agregado entre requisições simultâneas é várias vezes maior. Se um número aqui parecer baixo em comparação com um benchmark que você já viu, geralmente essa é a diferença.
Comparado com placas próximas
As três placas mais próximas desta em preço. A memória decide o que carrega; a largura de banda decide com que rapidez ela responde.
A L40S comparada com as três placas mais próximas em preço
Sem documento, sem selfie, sem número de telefone, sem registro da empresa.
Nada verificado · em qualquer valor gasto
A placa inteira
A GPU é atribuída em passthrough a uma única máquina, e essa máquina é sua.
Sem MIG · sem vGPU · sem hipervisor
Root e IPMI
Root completo desde o primeiro minuto, além de energia remota e mídia virtual.
Fora de banda, em sua própria VLAN
Largura de banda sem contador
Sem volume incluído, sem nível de excedente, nada para observar em um gráfico.
1 a 25 Gbit/s · nas duas direções
Sem taxa de instalação ou reinstalação
Reinstale a imagem quantas vezes quiser, para qualquer sistema operacional que oferecemos.
$0 · reinstalações ilimitadas
Hardware trocado, rápido
A partir de peças de reposição guardadas na mesma sala, a qualquer hora, com os discos mantidos no lugar.
Meta de quatro horas · 24/7
Onde você pode tê-la
Cada configuração de L40S está disponível em todos os 6 centros de dados. Não há site onde uma placa custe mais, nem nenhum onde esteja indisponível.
AMSDisponível
Amsterdã
Países Baixos
Ida e volta7 ms até Frankfurt, 12 ms até Londres
InstalaçãoTier III · 100% eólica
STODisponível
Estocolmo
Suécia
Ida e volta22 ms até Frankfurt, 31 ms até Londres
InstalaçãoTier III · 100% hídrica
ZRHDisponível
Zurique
Suíça
Ida e volta9 ms até Milão, 15 ms até Frankfurt
InstalaçãoTier IV · 96% livre de carbono
REYDisponível
Reykjavík
Islândia
Ida e volta18 ms até Londres, 40 ms até Nova York
InstalaçãoTier III · 100% geotérmica + hídrica
YULDisponível
Montreal
Canadá
Ida e volta12 ms até Nova York, 19 ms até Toronto
InstalaçãoTier III · 99% hídrica
SINDisponível
Cingapura
Cingapura
Ida e volta38 ms até Tóquio, 45 ms até Sydney
InstalaçãoTier III · Rede + compensação REC
Perguntas sobre servidor L40S
Quanto custa um servidor L40S por mês?
Um servidor L40S de uma placa custa $714 por mês, com tudo incluído: 128 GB de RAM do sistema, 2 × 2 TB NVMe, 1 Gbit/s sem contador, um endereço IPv4 e um /64 IPv6 roteado. Não há taxa de instalação nem cobrança de banda. Nós multi-GPU vão de $1,427 para 2 placas até $5,251 para 8.
Quanta VRAM tem a L40S, e o que cabe nela?
48 GB de GDDR6 ECC por placa, a 864 GB/s. O maior modelo que ela comporta numa placa a 8k de contexto é Llama 3.3 70B (4-bit (AWQ, GPTQ)).Um nó de 8 placas tem 384 GB no total, suficiente para Llama 3.1 405B.
A L40S é dedicada, ou compartilhada com outros clientes?
Dedicada. A placa é repassada por passthrough a uma única máquina física na qual só você tem conta — sem particionamento MIG, sem camada de vGPU e sem nenhum outro locatário no mesmo silício. Num nó multi-GPU, você recebe o nó inteiro, incluindo o fabric PCIe 5.0 ×16 entre as placas.
Preciso verificar minha identidade para alugar um L40S?
Não. Não há envio de documento, nem selfie, nem número de telefone, nem registro de empresa, em nenhum nível de gasto — um nó de oito placas abre exatamente nas mesmas condições que a placa avulsa mais barata. Abrir uma conta exige um endereço de e-mail, uma senha e um endereço de cobrança, e nada disso é verificado.
Como eu pago, e com que rapidez o servidor é entregue?
Somente em criptomoeda: Bitcoin, Monero, Ethereum (ERC-20), Tether (ERC-20) e outras. Cada fatura recebe seu próprio endereço, o valor é fixado à taxa mostrada no momento da emissão, e a máquina é provisionada na primeira confirmação — acesso root em under 5 minutes, a qualquer hora.
Posso alugar um L40S por hora, em vez de por mês?
Não aqui. Todo preço deste site é um preço mensal, sem contador e sem cobrança por segundo. Contra uma nuvem típica de $2.99/hora, um prazo mensal fica mais barato a partir de cerca de 239 horas da máquina simplesmente existindo — cerca de 10 dias em trinta.
An L40S só seu, a partir de $714 por mês.
Instalada em rack, com amaciamento feito e à espera em todos os 6 centros de dados. Pague em cripto e ela é sua em under 5 minutes.