Mantido desde outubro de 2019

Passthrough, não time-slicing

Cada GPU que vendemos é uma placa física inteira vinculada a uma instância. Time-slicing nos teria permitido vender cada placa quatro vezes, e precificamos adequadamente.

As instâncias de GPU entraram no ar este mês em Frankfurt, Dallas e Singapura. Duas configurações para começar: uma RTX 4000 Ada com vinte gigabytes de VRAM e uma L40S com quarenta e oito. Ambas ficam em um host EPYC 9354P, conectadas via PCIe 4.0 com dezesseis linhas completas, passadas diretamente para uma instância.

Passadas diretamente significa que a placa é vinculada à sua instância pelo hipervisor na inicialização e permanece lá até você cancelar. Sem agendador, sem fila, sem outro locatário, sem partição de VRAM que outra pessoa também esteja usando.

A decisão que realmente tomamos

Fatiar o tempo de uma placa entre locatários é uma forma suportada, bem documentada e totalmente legítima de operar esse negócio. Gastamos cerca de três semanas precificando isso, porque a aritmética é atraente: uma única placa de quarenta e oito gigabytes pode ser apresentada como quatro instâncias de doze gigabytes, o que significa quatro aluguéis de uma compra e quatro clientes de um orçamento de energia.

Então analisamos as latências de cauda.

Uma placa compartilhada funciona bem quando os outros locatários estão ociosos e é desagradável no momento em que não estão. A latência de inferência em uma placa com três outros locatários ativos foi aproximadamente o que se esperaria na mediana e de quatro a nove vezes pior no percentil 99, dependendo do que os outros estavam fazendo. Trabalhos de treinamento tiveram um desempenho pior, porque um trabalho de treinamento não é intermitente e, portanto, nunca aproveita as lacunas.

Há também o problema da licença. O software de virtualização que possibilita a partição limpa tem uma licença anual por placa, e esse custo não desaparece; ele recai sobre a fatura de quem aluga a fatia. Teríamos cobrado de você pelo privilégio de compartilhar.

Como o host é construído

ElementoO que é
CPU do hostEPYC 9354P, trinta e dois núcleos, ECC DDR5-4800
ConexãoPCIe 4.0, dezesseis linhas, um grupo IOMMU por placa
Afinidade de vCPUAfinado ao socket e nó NUMA do qual a placa depende
MemóriaAlocada do mesmo nó NUMA, nunca intercalada
Placas por nóMáximo de quatro, no máximo dois nos sites, limitado pela energia do rack
Porta40 Gbit/s, porque um modelo que não cabe na VRAM precisa vir de algum lugar

A afinidade NUMA importa mais do que a folha de especificações sugere. Uma vCPU no socket errado alimentando uma placa através da interconexão perde rendimento real em qualquer coisa que transmita dados, e é a configuração incorreta mais comum que vemos em hosts GPU de terceiros.

Energia e por que há apenas três sites

Uma placa de trezentos e cinquenta watts muda a aritmética de um rack. Sites que comportam confortavelmente doze nós de propósito geral comportam quatro nós de GPU e depois ficam sem resfriamento. Frankfurt, Dallas e Singapura foram escolhidos porque todos os três tinham folga de energia e um layout que poderia suportar a densidade sem que precisássemos renegociar nada.

Mais sites virão conforme a energia permitir, e a restrição honesta é sempre eletricidade, não demanda. Onde um site não suporta o consumo, preferimos não vender o produto a vendê-lo com throttling térmico.

O que você não pode fazer

  • Sem pareamento de placas entre nós. Uma instância de duas placas existe e ambas ficam em um nó NUMA. Qualquer coisa maior é uma conversa sobre bare metal.
  • Sem particionamento dentro da sua instância. Você tem a placa inteira, e como dividi-la é entre você e seu framework.
  • Sem hot swap. Alterar a GPU significa uma reconstrução, porque a placa é vinculada na inicialização.
  • Sem placas de jogos para consumidores. Perguntado semanalmente. Elas não têm o perfil de resfriamento para um rack e, na maioria dos casos, a licença para serem alugadas de forma alguma.

Preços, claramente

As placas custam o que custam e a margem sobre elas é mais fina do que no restante do catálogo. Não há cobrança por hora, porque cobrança por hora em hardware dedicado significa manter placas ociosas e cobrar de todos os outros pelo privilégio. Mensal, com o reembolso padrão de sete dias, e o mesmo pagamento apenas em criptomoedas de todo o resto.

Se sua carga de trabalho for genuinamente intermitente e por hora, somos o fornecedor errado e um grande hyperscaler é o certo. Isso será verdade enquanto recusarmos o tempo fatiado, o que é por tempo indeterminado.

Pronto quando você estiver

Escolha uma cidade. Escolha um tamanho. Pague em cripto.

Sem formulários sobre quem você é, sem esperar aprovação de um humano, sem ligação para verificar nada. O pagamento é confirmado e as credenciais chegam na sua caixa de entrada.