Linha três de cinco

Uma placa, não uma fatia de uma

Uma GPU compartilhada é algo de outra pessoa terminando antes do seu começar. Cada placa nesta linha é passada para uma instância sobre um link completo de dezesseis canais e fica lá até você cancelar, ociosa ou não.

Frota
de€239
ImplantaçãoEm menos de um minuto
Disponível em8
TráfegoSem medição, uso justo

A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.

Preço
PlanoNúcleos dedicadosMemóriaArmazenamento NVMeGráficosVelocidade da portaPreço
G-ADA
Inference and light training
864 GB1 TB1 × RTX 4000 Ada · 20 GB40 Gbit/s€239.00
/mês
Configurar
G-L40SMais consumido
48 GB of VRAM, undivided
16128 GB2 TB1 × L40S · 48 GB40 Gbit/s€749.00
/mês
Configurar
G-L40S×2
Two cards, one NUMA node
32256 GB4 TB2 × L40S · 96 GB40 Gbit/s€1420.00
/mês
Configurar

Os preços não incluem impostos, quando aplicável. Tráfego: Sem medição, uso justo.

EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing

00

Trinta e quatro cidades, vinte e nove países

Os números de latência são medianas medidas de nossas próprias sondas, não folhetos de fornecedores. Eles mudam; a página atualiza quando isso acontece.

01

Passthrough, e por que isso importa

A maior parte da capacidade GPU barata é uma fração de uma placa passada numa fila. O número na página do produto é a memória da placa, não a sua, e o throughput que você mede depende de quem mais acordou esta manhã.

Sem vGPU, sem time-slicing, sem agendador entre você e o silício.

Aqui a placa é vinculada à sua instância no nível do hypervisor sobre um link PCIe 4.0 de dezesseis canais. O dispositivo inteiro é seu: toda a memória, todas as unidades de computação, a largura de banda completa do copy engine. Nada é particionado, nada é enfileirado, e nenhum outro inquilino aparece na sua lista de dispositivos.

A consequência prática é que seu benchmark esta noite corresponde ao seu benchmark da terça-feira passada. Execuções de fine-tuning que levam dois dias terminam no tempo que sua primeira hora previu. O trabalho interativo permanece interativo, porque não há o batch job de outro inquilino na sua frente.

01

Toda a VRAM, o tempo todo

Quarenta e oito gigabytes em um L40S, vinte em uma RTX 4000 Ada, e nenhum reservado para uma partição de hypervisor. O que a placa tem é o que seu processo pode endereçar.

02

Ocioso não custa nada extra

A placa é sua por mês, não por segundo. Deixe um modelo residente por três semanas entre experimentos e ninguém o reivindica enquanto você dorme.

03

Duas placas, um host

O nível de duas placas coloca ambos os dispositivos no mesmo domínio NUMA do mesmo host. Eles falam via PCIe em vez de um link placa-a-placa, o que vale a pena saber antes de planejar uma topologia de treinamento em torno deles.

04

Sua própria pilha

Entregamos uma máquina com uma placa dentro e não interferimos. Drivers, runtime de contêiner, versões de framework e kernel são seus. Não há camada gerenciada com opiniões sobre seu Python.

02

Para que estas placas servem

Ambas as placas são de classe workstation, não o topo de um cluster de treinamento, e o posicionamento honesto decorre disso.

Inferência, fine-tuning, renderização e trabalho numérico em lote. Nessa ordem.

Se seu modelo cabe em quarenta e oito gigabytes, uma L40S o servirá com competência pelo tempo que você continuar pagando por ela. Se não couber, nenhum entusiasmo o fará caber, e o próximo passo honesto é quantização, fragmentação no nível de duas placas ou uma classe completamente diferente de máquina.

Carga de trabalhoQual placaA limitação real
Servir um modelo quantizado para usuários reaisRTX 4000 AdaMemória, depois concorrência de requisições
Servir um modelo de porte médio em precisão totalL40SQuarenta e oito gigabytes é o teto que decide isso
Fine-tuning com adaptadoresL40SVRAM durante o backward pass, não throughput bruto
Fine-tuning completo de um modelo grandeDuas L40S, ou outro lugarLargura de banda entre placas via PCIe torna-se o limite
Renderização em lote e codificação de vídeoQualquer umaDisco e rede, muito mais frequentemente do que a placa
Simulação numérica em precisão duplaNenhuma, geralmenteEstas não são peças de precisão dupla. Leve núcleos EPYC
03

Quem não deveria comprar isto

Capacidade de GPU atrai dimensionamento otimista mais do que qualquer outro produto que vendemos. Três grupos de pessoas devem passar direto nesta linha.

A coisa mais útil que podemos dizer a alguns clientes é que somos a loja errada.

01

Você está treinando algo enorme do zero

Treinamento multi-nó com interconexão de alta largura de banda entre hosts não é o que isto é. Duas placas via PCIe em um único host é o nosso teto, e fingir o contrário desperdiçaria semanas do seu tempo.

02

Você quer cobrança por segundo

As placas são alugadas por mês. Se seu uso é genuinamente vinte minutos por semana, uma plataforma com medição custará menos do que nós, e preferimos dizer isso agora.

03

Seu modelo não cabe

Noventa e seis gigabytes em duas placas é o máximo endereçável aqui. Faça a aritmética de memória para pesos, ativações e estado do otimizador antes de pedir, não depois.

04

Você precisa de precisão dupla

Estas são peças de precisão simples e precisão mista. Códigos científicos que insistem em throughput FP64 rodarão mais rápido em quarenta e oito núcleos EPYC do que em qualquer uma das placas.

05

Você quer que a gente gerencie a pilha

Não mantemos seu driver, sua versão CUDA ou sua matriz de frameworks. O add-on de endurecimento cobre a base do sistema operacional e para aí.

04

O host ao redor da placa

Uma GPU faminta é um aquecedor de espaço caro. O host importa tanto quanto a placa, e é onde a maioria das ofertas baratas de GPU corta custos silenciosamente.

EPYC 9354P, memória ECC, NVMe local à máquina, porta de quarenta gigabits.

01

Núcleos que podem alimentá-la

De oito a trinta e dois núcleos EPYC dedicados, dependendo do nível, fixados no mesmo domínio NUMA que a placa. Carregamento de dados e pré-processamento são os motivos usuais de um loop de treinamento travar, e são trabalho de CPU.

02

Memória ECC no host

DDR5-4800 registrada, de sessenta e quatro a duzentos e cinquenta e seis gigabytes. Um trabalho de quarenta e oito horas é exatamente o tipo de coisa que não deveria ser desfeita por um único bit invertido em um buffer do dataloader.

03

NVMe que acompanha

Um a quatro terabytes de NVMe Gen4 local, em espelho. Os conjuntos de dados são transmitidos da própria máquina, em vez de um volume de rede que outra pessoa também está lendo.

04

Porta de quarenta gigabits

Baixar um conjunto de dados de vários terabytes deve levar uma noite. Uso justo em uma porta de quarenta gigabits é de duzentos e cinquenta terabytes por mês, publicado na página de preços.

05

Console out-of-band

Serial e VNC através de um túnel autenticado, incluído. Quando uma instalação de driver dá errado à meia-noite, você ainda consegue alcançar a máquina, que é exatamente o motivo pelo qual ela existe.

A placa é passada diretamente, então o driver é instalado dentro da sua instância como em qualquer outra máquina. Nada no host toca no seu framework, e uma reinicialização não renegocia nada.

05

Onde as placas estão

Amsterdã, Frankfurt, Londres, Nova York, Dallas, Los Angeles, Singapura e Tóquio. Esses são os andares com densidade de energia e refrigeração para rodar placas em carga total continuamente, em vez de em rajadas educadas.

Oito locais em seis países. GPUs precisam de energia e refrigeração, não de códigos postais.

Frankfurt é o andar de GPU mais movimentado que operamos e recebe novas placas primeiro. Dallas é o lugar mais fácil para obter capacidade em cima da hora, porque a energia lá é barata e o andar é grande. Los Angeles tem placas, mas fica lotado com frequência, então peça cedo se a rota para o oeste em direção à Ásia é o que você está comprando.

O estoque realmente muda nesta linha. Uma placa que aparece como disponível ao meio-dia pode não estar lá à noite, e preferimos mostrar um rótulo preciso de esgotado do que aceitar um pedido que não podemos atender esta semana.

SiteObservaçõesUso típico
AmesterdãLocal mais denso da frota, tudo chega aqui primeiroInferência europeia com baixa latência para a maior parte do continente
FrankfurtAndar de GPU mais movimentado, primeiro a receber novas placasTreinamento e ajuste fino onde a capacidade importa mais que o último milissegundo
LondresMenor latência transatlântica na EuropaAtender usuários em ambos os lados do Atlântico a partir de um lugar
Nova YorkÂncora da costa leste, gama completa de produtosInferência norte-americana
DallasEnergia barata, andar grande, capacidade mais fácilTrabalhos em lote longos e qualquer coisa sensível a preço
Los AngelesMelhores rotas para o oeste que temos fora da ÁsiaAtender a orla do Pacífico a partir da América do Norte
SingapuraEscolha padrão para o Sudeste AsiáticoInferência regional
TóquioTempo de ida e volta mais estável na regiãoTráfego japonês e coreano sensível à latência
06

Trabalhos longos, e como não perder um

Um ajuste fino de quarenta e oito horas é uma aposta em nada dar errado por dois dias. Estruture o trabalho para que perder a aposta custe uma hora em vez do fim de semana.

Checkpoint. Ainda vamos repetir isso depois que você já ouviu cem vezes.

  1. 01

    Checkpoint para NVMe local, com frequência

    A cada poucas centenas de passos, para o disco local, porque é rápido o suficiente para que o custo seja insignificante. Um trabalho que não pode ser retomado é um trabalho que você acabará rodando duas vezes.

  2. 02

    Copie checkpoints para fora da máquina

    NVMe local é espelhado, não imortal. O backup fora do nó grava em uma cidade diferente toda noite, e é o seguro mais barato desta página.

  3. 03

    Snapshot antes de mexer no driver

    Atualizações de driver e framework são a principal causa de um ambiente funcional se tornar um não funcional. Um snapshot leva segundos para criar e segundos para restaurar.

  4. 04

    Observe a temperatura e os clocks, não apenas a perda

    As placas reduzem a frequência quando a sala está em um dia ruim. Se sua taxa de transferência cair sem que seu código mude, olhe os valores de clock antes de reescrever o dataloader.

  5. 05

    Pergunte antes de escalar horizontalmente

    Se o próximo passo for quatro ou oito placas, informe ao suporte o que você está tentando fazer. Às vezes a resposta é uma máquina bare-metal, e ocasionalmente a resposta é que não somos o fornecedor certo.

07

Quando o hardware falha

GPUs geralmente degradam em vez de morrer: clocks caindo, erros de memória corrigidos na placa, um job que de repente roda um terço mais devagar por nenhum motivo que você encontra no seu código.

Placas falham de forma diferente dos discos. Mais lentamente e com mais aviso.

Nosso monitoramento observa temperatura da placa, comportamento do clock e contadores de erro em todos os hosts. Quando uma placa começa a se comportar mal, entramos em contato antes que ela pare de funcionar e agendamos a troca em torno do seu job, não no meio dele. Quando a placa falha de vez, sua instância é reconstruída em outro host no mesmo site, com volumes e endereços intactos.

A recuperação nesta linha é mais lenta que em outras partes da frota, e vale ser claro sobre o porquê: um terabyte de dataset e um modelo residente levam minutos reais para mover e recarregar. Planeje uma hora em vez de quinze minutos e mantenha checkpoints em outro lugar que não a máquina em chamas.

01

Aviso antes da falha, quando possível

Contadores de erro e telemetria de clock são lidos continuamente. A maioria das substituições de placa acontece em uma janela que acordamos com o cliente antecipadamente.

02

Volumes e endereços sobrevivem

A reconstrução carrega o conteúdo do seu NVMe e endereços IP. Nada no seu DNS ou certificados precisa mudar.

03

Créditos são automáticos

A mesma disponibilidade contratual de 99.99% se aplica aqui como em qualquer outro lugar, e o crédito chega sem formulário de reclamação.

08

Perguntas sobre esta linha

O dispositivo físico é vinculado à sua instância através de um link completo de dezesseis lanes. Não há particionamento vGPU, nem fatiamento de tempo, nem outro inquilino nela. Sua lista de dispositivos mostra uma placa porque há uma placa.

Não. Placas são mensais, e o compromisso mínimo é de um mês. Se sua carga de trabalho é verdadeiramente intermitente, um provedor com cobrança por uso será mais barato, e não existe versão desta conversa em que fingimos o contrário.

Nenhum, a menos que você peça. As imagens saem limpas e o driver é instalado dentro da sua instância, porque metade dos nossos clientes de GPU tem opiniões fortes sobre versões e a outra metade tem um container que carrega o seu próprio.

Não. Elas estão no mesmo host e no mesmo domínio NUMA, e comunicam via PCIe. Para trabalho paralelo de dados com troca de gradiente modesta, isso é suficiente. Para qualquer coisa que assuma um tecido de alta largura de banda entre placas, não é, e você deve dimensionar suas expectativas de acordo.

Não. O passthrough exige que o host seja construído para isso, com a topologia PCIe e o orçamento de energia em vigor. Migrar para esta linha significa uma nova instância e uma cópia de dados.

O volume é apagado e a placa volta para o pool. Leve seus checkpoints antes do término do prazo, porque uma instância cancelada está realmente desaparecida, não estacionada em algum lugar esperando que você mude de ideia.

Pronto quando você estiver

Pegue uma placa inteira

Verifique primeiro a aritmética de memória, escolha o site com capacidade e pague em moeda. O acesso root chega em menos de um minuto, a decisão do driver continua sua, e os primeiros sete dias são reembolsáveis sem motivo.