Uma placa, não uma fatia de uma
Uma GPU compartilhada é algo de outra pessoa terminando antes do seu começar. Cada placa nesta linha é passada para uma instância sobre um link completo de dezesseis canais e fica lá até você cancelar, ociosa ou não.
A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.
| Plano | Núcleos dedicados | Memória | Armazenamento NVMe | Gráficos | Velocidade da porta | Preço | |
|---|---|---|---|---|---|---|---|
| G-ADA Inference and light training | 8 | 64 GB | 1 TB | 1 × RTX 4000 Ada · 20 GB | 40 Gbit/s | €239.00 /mês | Configurar |
| G-L40SMais consumido 48 GB of VRAM, undivided | 16 | 128 GB | 2 TB | 1 × L40S · 48 GB | 40 Gbit/s | €749.00 /mês | Configurar |
| G-L40S×2 Two cards, one NUMA node | 32 | 256 GB | 4 TB | 2 × L40S · 96 GB | 40 Gbit/s | €1420.00 /mês | Configurar |
Os preços não incluem impostos, quando aplicável. Tráfego: Sem medição, uso justo.
EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing
Trinta e quatro cidades, vinte e nove países
Os números de latência são medianas medidas de nossas próprias sondas, não folhetos de fornecedores. Eles mudam; a página atualiza quando isso acontece.
Passthrough, e por que isso importa
A maior parte da capacidade GPU barata é uma fração de uma placa passada numa fila. O número na página do produto é a memória da placa, não a sua, e o throughput que você mede depende de quem mais acordou esta manhã.
Sem vGPU, sem time-slicing, sem agendador entre você e o silício.
Aqui a placa é vinculada à sua instância no nível do hypervisor sobre um link PCIe 4.0 de dezesseis canais. O dispositivo inteiro é seu: toda a memória, todas as unidades de computação, a largura de banda completa do copy engine. Nada é particionado, nada é enfileirado, e nenhum outro inquilino aparece na sua lista de dispositivos.
A consequência prática é que seu benchmark esta noite corresponde ao seu benchmark da terça-feira passada. Execuções de fine-tuning que levam dois dias terminam no tempo que sua primeira hora previu. O trabalho interativo permanece interativo, porque não há o batch job de outro inquilino na sua frente.
Toda a VRAM, o tempo todo
Quarenta e oito gigabytes em um L40S, vinte em uma RTX 4000 Ada, e nenhum reservado para uma partição de hypervisor. O que a placa tem é o que seu processo pode endereçar.
Ocioso não custa nada extra
A placa é sua por mês, não por segundo. Deixe um modelo residente por três semanas entre experimentos e ninguém o reivindica enquanto você dorme.
Duas placas, um host
O nível de duas placas coloca ambos os dispositivos no mesmo domínio NUMA do mesmo host. Eles falam via PCIe em vez de um link placa-a-placa, o que vale a pena saber antes de planejar uma topologia de treinamento em torno deles.
Sua própria pilha
Entregamos uma máquina com uma placa dentro e não interferimos. Drivers, runtime de contêiner, versões de framework e kernel são seus. Não há camada gerenciada com opiniões sobre seu Python.
Para que estas placas servem
Ambas as placas são de classe workstation, não o topo de um cluster de treinamento, e o posicionamento honesto decorre disso.
Inferência, fine-tuning, renderização e trabalho numérico em lote. Nessa ordem.
Se seu modelo cabe em quarenta e oito gigabytes, uma L40S o servirá com competência pelo tempo que você continuar pagando por ela. Se não couber, nenhum entusiasmo o fará caber, e o próximo passo honesto é quantização, fragmentação no nível de duas placas ou uma classe completamente diferente de máquina.
| Carga de trabalho | Qual placa | A limitação real |
|---|---|---|
| Servir um modelo quantizado para usuários reais | RTX 4000 Ada | Memória, depois concorrência de requisições |
| Servir um modelo de porte médio em precisão total | L40S | Quarenta e oito gigabytes é o teto que decide isso |
| Fine-tuning com adaptadores | L40S | VRAM durante o backward pass, não throughput bruto |
| Fine-tuning completo de um modelo grande | Duas L40S, ou outro lugar | Largura de banda entre placas via PCIe torna-se o limite |
| Renderização em lote e codificação de vídeo | Qualquer uma | Disco e rede, muito mais frequentemente do que a placa |
| Simulação numérica em precisão dupla | Nenhuma, geralmente | Estas não são peças de precisão dupla. Leve núcleos EPYC |
Quem não deveria comprar isto
Capacidade de GPU atrai dimensionamento otimista mais do que qualquer outro produto que vendemos. Três grupos de pessoas devem passar direto nesta linha.
A coisa mais útil que podemos dizer a alguns clientes é que somos a loja errada.
Você está treinando algo enorme do zero
Treinamento multi-nó com interconexão de alta largura de banda entre hosts não é o que isto é. Duas placas via PCIe em um único host é o nosso teto, e fingir o contrário desperdiçaria semanas do seu tempo.
Você quer cobrança por segundo
As placas são alugadas por mês. Se seu uso é genuinamente vinte minutos por semana, uma plataforma com medição custará menos do que nós, e preferimos dizer isso agora.
Seu modelo não cabe
Noventa e seis gigabytes em duas placas é o máximo endereçável aqui. Faça a aritmética de memória para pesos, ativações e estado do otimizador antes de pedir, não depois.
Você precisa de precisão dupla
Estas são peças de precisão simples e precisão mista. Códigos científicos que insistem em throughput FP64 rodarão mais rápido em quarenta e oito núcleos EPYC do que em qualquer uma das placas.
Você quer que a gente gerencie a pilha
Não mantemos seu driver, sua versão CUDA ou sua matriz de frameworks. O add-on de endurecimento cobre a base do sistema operacional e para aí.
O host ao redor da placa
Uma GPU faminta é um aquecedor de espaço caro. O host importa tanto quanto a placa, e é onde a maioria das ofertas baratas de GPU corta custos silenciosamente.
EPYC 9354P, memória ECC, NVMe local à máquina, porta de quarenta gigabits.
Núcleos que podem alimentá-la
De oito a trinta e dois núcleos EPYC dedicados, dependendo do nível, fixados no mesmo domínio NUMA que a placa. Carregamento de dados e pré-processamento são os motivos usuais de um loop de treinamento travar, e são trabalho de CPU.
Memória ECC no host
DDR5-4800 registrada, de sessenta e quatro a duzentos e cinquenta e seis gigabytes. Um trabalho de quarenta e oito horas é exatamente o tipo de coisa que não deveria ser desfeita por um único bit invertido em um buffer do dataloader.
NVMe que acompanha
Um a quatro terabytes de NVMe Gen4 local, em espelho. Os conjuntos de dados são transmitidos da própria máquina, em vez de um volume de rede que outra pessoa também está lendo.
Porta de quarenta gigabits
Baixar um conjunto de dados de vários terabytes deve levar uma noite. Uso justo em uma porta de quarenta gigabits é de duzentos e cinquenta terabytes por mês, publicado na página de preços.
Console out-of-band
Serial e VNC através de um túnel autenticado, incluído. Quando uma instalação de driver dá errado à meia-noite, você ainda consegue alcançar a máquina, que é exatamente o motivo pelo qual ela existe.
A placa é passada diretamente, então o driver é instalado dentro da sua instância como em qualquer outra máquina. Nada no host toca no seu framework, e uma reinicialização não renegocia nada.
Onde as placas estão
Amsterdã, Frankfurt, Londres, Nova York, Dallas, Los Angeles, Singapura e Tóquio. Esses são os andares com densidade de energia e refrigeração para rodar placas em carga total continuamente, em vez de em rajadas educadas.
Oito locais em seis países. GPUs precisam de energia e refrigeração, não de códigos postais.
Frankfurt é o andar de GPU mais movimentado que operamos e recebe novas placas primeiro. Dallas é o lugar mais fácil para obter capacidade em cima da hora, porque a energia lá é barata e o andar é grande. Los Angeles tem placas, mas fica lotado com frequência, então peça cedo se a rota para o oeste em direção à Ásia é o que você está comprando.
O estoque realmente muda nesta linha. Uma placa que aparece como disponível ao meio-dia pode não estar lá à noite, e preferimos mostrar um rótulo preciso de esgotado do que aceitar um pedido que não podemos atender esta semana.
| Site | Observações | Uso típico |
|---|---|---|
| Amesterdã | Local mais denso da frota, tudo chega aqui primeiro | Inferência europeia com baixa latência para a maior parte do continente |
| Frankfurt | Andar de GPU mais movimentado, primeiro a receber novas placas | Treinamento e ajuste fino onde a capacidade importa mais que o último milissegundo |
| Londres | Menor latência transatlântica na Europa | Atender usuários em ambos os lados do Atlântico a partir de um lugar |
| Nova York | Âncora da costa leste, gama completa de produtos | Inferência norte-americana |
| Dallas | Energia barata, andar grande, capacidade mais fácil | Trabalhos em lote longos e qualquer coisa sensível a preço |
| Los Angeles | Melhores rotas para o oeste que temos fora da Ásia | Atender a orla do Pacífico a partir da América do Norte |
| Singapura | Escolha padrão para o Sudeste Asiático | Inferência regional |
| Tóquio | Tempo de ida e volta mais estável na região | Tráfego japonês e coreano sensível à latência |
Trabalhos longos, e como não perder um
Um ajuste fino de quarenta e oito horas é uma aposta em nada dar errado por dois dias. Estruture o trabalho para que perder a aposta custe uma hora em vez do fim de semana.
Checkpoint. Ainda vamos repetir isso depois que você já ouviu cem vezes.
- 01
Checkpoint para NVMe local, com frequência
A cada poucas centenas de passos, para o disco local, porque é rápido o suficiente para que o custo seja insignificante. Um trabalho que não pode ser retomado é um trabalho que você acabará rodando duas vezes.
- 02
Copie checkpoints para fora da máquina
NVMe local é espelhado, não imortal. O backup fora do nó grava em uma cidade diferente toda noite, e é o seguro mais barato desta página.
- 03
Snapshot antes de mexer no driver
Atualizações de driver e framework são a principal causa de um ambiente funcional se tornar um não funcional. Um snapshot leva segundos para criar e segundos para restaurar.
- 04
Observe a temperatura e os clocks, não apenas a perda
As placas reduzem a frequência quando a sala está em um dia ruim. Se sua taxa de transferência cair sem que seu código mude, olhe os valores de clock antes de reescrever o dataloader.
- 05
Pergunte antes de escalar horizontalmente
Se o próximo passo for quatro ou oito placas, informe ao suporte o que você está tentando fazer. Às vezes a resposta é uma máquina bare-metal, e ocasionalmente a resposta é que não somos o fornecedor certo.
Quando o hardware falha
GPUs geralmente degradam em vez de morrer: clocks caindo, erros de memória corrigidos na placa, um job que de repente roda um terço mais devagar por nenhum motivo que você encontra no seu código.
Placas falham de forma diferente dos discos. Mais lentamente e com mais aviso.
Nosso monitoramento observa temperatura da placa, comportamento do clock e contadores de erro em todos os hosts. Quando uma placa começa a se comportar mal, entramos em contato antes que ela pare de funcionar e agendamos a troca em torno do seu job, não no meio dele. Quando a placa falha de vez, sua instância é reconstruída em outro host no mesmo site, com volumes e endereços intactos.
A recuperação nesta linha é mais lenta que em outras partes da frota, e vale ser claro sobre o porquê: um terabyte de dataset e um modelo residente levam minutos reais para mover e recarregar. Planeje uma hora em vez de quinze minutos e mantenha checkpoints em outro lugar que não a máquina em chamas.
Aviso antes da falha, quando possível
Contadores de erro e telemetria de clock são lidos continuamente. A maioria das substituições de placa acontece em uma janela que acordamos com o cliente antecipadamente.
Volumes e endereços sobrevivem
A reconstrução carrega o conteúdo do seu NVMe e endereços IP. Nada no seu DNS ou certificados precisa mudar.
Créditos são automáticos
A mesma disponibilidade contratual de 99.99% se aplica aqui como em qualquer outro lugar, e o crédito chega sem formulário de reclamação.
Perguntas sobre esta linha
O dispositivo físico é vinculado à sua instância através de um link completo de dezesseis lanes. Não há particionamento vGPU, nem fatiamento de tempo, nem outro inquilino nela. Sua lista de dispositivos mostra uma placa porque há uma placa.
Não. Placas são mensais, e o compromisso mínimo é de um mês. Se sua carga de trabalho é verdadeiramente intermitente, um provedor com cobrança por uso será mais barato, e não existe versão desta conversa em que fingimos o contrário.
Nenhum, a menos que você peça. As imagens saem limpas e o driver é instalado dentro da sua instância, porque metade dos nossos clientes de GPU tem opiniões fortes sobre versões e a outra metade tem um container que carrega o seu próprio.
Não. Elas estão no mesmo host e no mesmo domínio NUMA, e comunicam via PCIe. Para trabalho paralelo de dados com troca de gradiente modesta, isso é suficiente. Para qualquer coisa que assuma um tecido de alta largura de banda entre placas, não é, e você deve dimensionar suas expectativas de acordo.
Não. O passthrough exige que o host seja construído para isso, com a topologia PCIe e o orçamento de energia em vigor. Migrar para esta linha significa uma nova instância e uma cópia de dados.
O volume é apagado e a placa volta para o pool. Leve seus checkpoints antes do término do prazo, porque uma instância cancelada está realmente desaparecida, não estacionada em algum lugar esperando que você mude de ideia.
Pegue uma placa inteira
Verifique primeiro a aritmética de memória, escolha o site com capacidade e pague em moeda. O acesso root chega em menos de um minuto, a decisão do driver continua sua, e os primeiros sete dias são reembolsáveis sem motivo.