As instâncias de GPU entraram no ar este mês em Frankfurt, Dallas e Singapura. Duas configurações para começar: uma RTX 4000 Ada com vinte gigabytes de VRAM e uma L40S com quarenta e oito. Ambas ficam em um host EPYC 9354P, conectadas via PCIe 4.0 com dezesseis linhas completas, passadas diretamente para uma instância.
Passadas diretamente significa que a placa é vinculada à sua instância pelo hipervisor na inicialização e permanece lá até você cancelar. Sem agendador, sem fila, sem outro locatário, sem partição de VRAM que outra pessoa também esteja usando.
A decisão que realmente tomamos
Fatiar o tempo de uma placa entre locatários é uma forma suportada, bem documentada e totalmente legítima de operar esse negócio. Gastamos cerca de três semanas precificando isso, porque a aritmética é atraente: uma única placa de quarenta e oito gigabytes pode ser apresentada como quatro instâncias de doze gigabytes, o que significa quatro aluguéis de uma compra e quatro clientes de um orçamento de energia.
Então analisamos as latências de cauda.
Uma placa compartilhada funciona bem quando os outros locatários estão ociosos e é desagradável no momento em que não estão. A latência de inferência em uma placa com três outros locatários ativos foi aproximadamente o que se esperaria na mediana e de quatro a nove vezes pior no percentil 99, dependendo do que os outros estavam fazendo. Trabalhos de treinamento tiveram um desempenho pior, porque um trabalho de treinamento não é intermitente e, portanto, nunca aproveita as lacunas.
Há também o problema da licença. O software de virtualização que possibilita a partição limpa tem uma licença anual por placa, e esse custo não desaparece; ele recai sobre a fatura de quem aluga a fatia. Teríamos cobrado de você pelo privilégio de compartilhar.
Como o host é construído
| Elemento | O que é |
|---|---|
| CPU do host | EPYC 9354P, trinta e dois núcleos, ECC DDR5-4800 |
| Conexão | PCIe 4.0, dezesseis linhas, um grupo IOMMU por placa |
| Afinidade de vCPU | Afinado ao socket e nó NUMA do qual a placa depende |
| Memória | Alocada do mesmo nó NUMA, nunca intercalada |
| Placas por nó | Máximo de quatro, no máximo dois nos sites, limitado pela energia do rack |
| Porta | 40 Gbit/s, porque um modelo que não cabe na VRAM precisa vir de algum lugar |
A afinidade NUMA importa mais do que a folha de especificações sugere. Uma vCPU no socket errado alimentando uma placa através da interconexão perde rendimento real em qualquer coisa que transmita dados, e é a configuração incorreta mais comum que vemos em hosts GPU de terceiros.
Energia e por que há apenas três sites
Uma placa de trezentos e cinquenta watts muda a aritmética de um rack. Sites que comportam confortavelmente doze nós de propósito geral comportam quatro nós de GPU e depois ficam sem resfriamento. Frankfurt, Dallas e Singapura foram escolhidos porque todos os três tinham folga de energia e um layout que poderia suportar a densidade sem que precisássemos renegociar nada.
Mais sites virão conforme a energia permitir, e a restrição honesta é sempre eletricidade, não demanda. Onde um site não suporta o consumo, preferimos não vender o produto a vendê-lo com throttling térmico.
O que você não pode fazer
- Sem pareamento de placas entre nós. Uma instância de duas placas existe e ambas ficam em um nó NUMA. Qualquer coisa maior é uma conversa sobre bare metal.
- Sem particionamento dentro da sua instância. Você tem a placa inteira, e como dividi-la é entre você e seu framework.
- Sem hot swap. Alterar a GPU significa uma reconstrução, porque a placa é vinculada na inicialização.
- Sem placas de jogos para consumidores. Perguntado semanalmente. Elas não têm o perfil de resfriamento para um rack e, na maioria dos casos, a licença para serem alugadas de forma alguma.
Preços, claramente
As placas custam o que custam e a margem sobre elas é mais fina do que no restante do catálogo. Não há cobrança por hora, porque cobrança por hora em hardware dedicado significa manter placas ociosas e cobrar de todos os outros pelo privilégio. Mensal, com o reembolso padrão de sete dias, e o mesmo pagamento apenas em criptomoedas de todo o resto.
Se sua carga de trabalho for genuinamente intermitente e por hora, somos o fornecedor errado e um grande hyperscaler é o certo. Isso será verdade enquanto recusarmos o tempo fatiado, o que é por tempo indeterminado.