Графические ускорители появились в этом месяце во Франкфурте, Далласе и Сингапуре. Для начала доступны две конфигурации: один RTX 4000 Ada с двадцатью гигабайтами видеопамяти и один L40S с сорока восемью. Оба установлены на хосте EPYC 9354P, подключены по PCIe 4.0 на полных шестнадцати линиях и переданы напрямую одному инстансу.
«Передано напрямую» означает, что карта привязывается к вашему инстансу гипервизором при загрузке и остаётся там до тех пор, пока вы не отмените подписку. Никакого планировщика, очереди, других арендаторов или разделения видеопамяти, которую использует кто-то ещё.
То, что мы решили на самом деле
Разделение карты по времени между арендаторами — это поддерживаемый, хорошо документированный и вполне легитимный способ ведения бизнеса. Мы потратили около трёх недель на расчёт затрат, потому что арифметика привлекательна: одну карту на сорок восемь гигабайт можно представить как четыре инстанса по двенадцать гигабайт, что даёт четыре платежа от одной покупки и четырёх клиентов с одного бюджета мощности.
Затем мы измерили хвостовую задержку.
Общая карта приемлема, когда другие арендаторы простаивают, и неприятна, как только они начинают работать. Задержка вывода на карте с тремя активными арендаторами была примерно такой, как вы ожидали бы на медиане, и в четыре-девять раз хуже на 99-м процентиле, в зависимости от того, что делают остальные. Обучающие задачи пострадали сильнее, потому что обучение не носит взрывного характера и поэтому никогда не получает пауз.
Есть также проблема лицензий. Программное обеспечение виртуализации, обеспечивающее чистое разделение, требует ежегодной лицензии на каждую карту, и эти затраты не исчезают; они ложатся на счёт того, кто арендует срез. Мы бы брали с вас плату за право делиться.
Как устроен хост
| Элемент | Что это |
|---|---|
| CPU хоста | EPYC 9354P, тридцать два ядра, ECC DDR5-4800 |
| Подключение | PCIe 4.0, шестнадцать линий, одна группа IOMMU на карту |
| Привязка vCPU | Привязаны к сокету и NUMA-узлу, к которому подключена карта |
| Память | Выделяется с того же NUMA-узла, никогда не чередуется |
| Карт на узел | Максимум четыре, на большинстве площадок две, ограничено мощностью стоек |
| Порт | 40 Гбит/с, потому что модель, которая не помещается в VRAM, должна откуда-то загружаться |
Привязка NUMA важнее, чем следует из спецификации. vCPU на неправильном сокете, питающий карту через межпроцессорную шину, теряет реальную пропускную способность при передаче данных, и это самая распространённая ошибка конфигурации, которую мы видим на чужих GPU-хостах.
Мощность и почему есть только три площадки
Карта с потреблением триста пятьдесят ватт меняет арифметику стойки. Площадки, где удобно размещаются двенадцать универсальных узлов, вмещают четыре GPU-узла и затем упираются в охлаждение. Франкфурт, Даллас и Сингапур выбраны потому, что на всех трёх есть запас по мощности и планировка, способная выдержать такую плотность без пересмотра условий.
Появятся и другие площадки, когда позволит мощность, и реальное ограничение всегда заключается в электричестве, а не в спросе. Там, где площадка не может обеспечить необходимое потребление, мы предпочитаем не продавать продукт вообще, чем продавать его с тепловым тротлингом.
Чего вы не сможете сделать
- Нет объединения карт между узлами. Инстанс с двумя картами существует, и обе карты находятся на одном NUMA-узле. Всё, что больше, — это разговор о выделенном железе.
- Нет разделения внутри вашего инстанса. У вас вся карта целиком, и как вы её делите — это ваше дело и вашего фреймворка.
- Нет горячей замены. Смена GPU означает пересборку, потому что карта привязана при загрузке.
- Нет потребительских игровых карт. Спрашивают каждую неделю. У них нет подходящего для стойки теплового профиля и в большинстве случаев вообще нет лицензии на сдачу в аренду.
Цены без прикрас
Карты стоят столько, сколько стоят, и маржа на них тоньше, чем на остальном каталоге. Нет почасовой оплаты, потому что почасовая оплата выделенного оборудования означает простой карт и плату всем остальным за это удовольствие. Помесячно, со стандартным семидневным возвратом, и та же оплата только криптовалютой, как и для всего остального.
Если ваша нагрузка действительно имеет взрывной характер и требует почасовой оплаты, мы — неправильный поставщик, а правильный — крупный гиперскейлер. Так будет до тех пор, пока мы отказываемся от разделения по времени, то есть бессрочно.