Линия три из пяти

Карта, а не её часть

Общий GPU — это когда чужая задача завершается раньше, чем начинается ваша. Каждая карта в этой линейке пробрасывается одному инстансу по полному линку из шестнадцати линий и остаётся там до вашей отмены, простаивая или нет.

Флот
от€239
РазвёртываниеМенее чем за минуту
Доступно в8
ТрафикБезлимит, fair use

A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.

Цена
ТарифВыделенные ядра内存NVMe-хранилищеГрафикаСкорость портаЦена
G-ADA
Inference and light training
864 GB1 TB1 × RTX 4000 Ada · 20 GB40 Gbit/s€239.00
/мес
Настроить
G-L40SЧаще всего берут
48 GB of VRAM, undivided
16128 GB2 TB1 × L40S · 48 GB40 Gbit/s€749.00
/мес
Настроить
G-L40S×2
Two cards, one NUMA node
32256 GB4 TB2 × L40S · 96 GB40 Gbit/s€1420.00
/мес
Настроить

Цены указаны без учёта НДС, где применимо. Трафик: Безлимит, fair use.

EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing

00

Тридцать четыре города, двадцать девять стран

Значения задержки — это измеренные медианы с наших собственных зондов, а не данные из маркетинговых брошюр. Они меняются; страница обновляется, когда они меняются.

01

Проброс напрямую — и почему это важно

Большая часть дешёвых GPU-мощностей — это доля карты, распределяемая через очередь. Число на странице товара — это память карты, а не ваша, и измеряемая пропускная способность зависит от того, кто ещё проснулся этим утром.

Никакого vGPU, никакого разделения времени, никакого планировщика между вами и кремнием.

Здесь карта привязана к вашему инстансу на уровне гипервизора через линк PCIe 4.0 из шестнадцати линий. Всё устройство ваше: вся память, все вычислительные блоки, полная пропускная способность копировального движка. Ничего не разделено, ничего не стоит в очереди, и никакой другой арендатор не появляется в вашем списке устройств.

Практическое следствие — ваш бенчмарк сегодняшним вечером совпадает с бенчмарком прошлого вторника. Тонкая настройка, занимающая два дня, завершается за время, предсказанное первым часом. Интерактивная работа остаётся интерактивной, потому что перед вашей нет пакетной задачи другого арендатора.

01

Вся VRAM — всегда

Сорок восемь гигабайт на L40S, двадцать на RTX 4000 Ada, и ни один из них не зарезервирован под раздел гипервизора. Что есть у карты — то и может адресовать ваш процесс.

02

Простой не стоит вам ничего сверх

Карта ваша помесячно, а не посекундно. Оставьте модель резидентной на три недели между экспериментами — никто не заберёт её, пока вы спите.

03

Две карты — один хост

Уровень с двумя картами размещает оба устройства в одном NUMA-домене одного хоста. Они общаются через PCIe, а не через линк карта-к-карте, о чём стоит знать перед планированием топологии обучения вокруг них.

04

Ваш собственный стек

Мы передаём вам машину с картой внутри и не вмешиваемся. Драйверы, среда выполнения контейнеров, версии фреймворков и ядро — ваши. Нет управляемого слоя, который имел бы собственное мнение о вашем Python.

02

Под какие задачи эти карты

Обе карты относятся к рабочей станции, а не к вершине обучающего кластера, и честное позиционирование вытекает из этого.

Инференс, дообучение, рендеринг и пакетные численные расчёты. В таком порядке.

Если ваша модель помещается в сорок восемь гигабайт, L40S будет исправно её обслуживать, пока вы за неё платите. Если не помещается, никакой энтузиазм этого не изменит, и следующий честный шаг — квантование, шардирование на тарифе с двумя картами или машина совершенно другого класса.

НагрузкаКакая картаРеальное ограничение
Обслуживание квантованной модели для реальных пользователейRTX 4000 AdaПамять, затем конкурентность запросов
Обслуживание модели среднего размера с полной точностьюL40SСорок восемь гигабайт — вот потолок, который всё решает
Дообучение с адаптерамиL40SVRAM во время обратного прохода, а не сырая пропускная способность
Полное дообучение большой моделиДве L40S или где-то ещёПропускная способность карта-карта по PCIe становится пределом
Пакетный рендеринг и кодирование видеоЛюбаяДиск и сеть гораздо чаще, чем карта
Численное моделирование с двойной точностьюОбычно ни однаЭто не компоненты с двойной точностью. Возьмите ядра EPYC
03

Кому это не стоит покупать

GPU-мощности привлекают оптимистичный подбор размеров сильнее, чем любой другой наш продукт. Три группы людей должны пройти мимо этой линейки.

Самое полезное, что мы можем сказать некоторым клиентам, — что мы не тот магазин.

01

Вы обучаете что-то огромное с нуля

Многоузловое обучение с высокоскоростным межхостовым соединением — это не то. Две карты по PCIe на одном хосте — наш потолок, и притворяться иначе значило бы впустую потратить недели вашего времени.

02

Вам нужна посекундная оплата

Карты арендуются помесячно. Если вам реально нужно двадцать минут в неделю, метрическая платформа обойдётся дешевле, чем мы, и мы предпочтём сказать это сейчас.

03

Ваша модель не помещается

Девяносто шесть гигабайт на две карты — это максимум адресуемой памяти здесь. Посчитайте арифметику памяти для весов, активаций и состояния оптимизатора до заказа, а не после.

04

Вам нужна двойная точность

Это компоненты с одинарной и смешанной точностью. Научные коды, требующие пропускной способности FP64, будут работать быстрее на сорока восьми ядрах EPYC, чем на любой из карт.

05

Вы хотите, чтобы мы управляли стеком

Мы не обслуживаем ваш драйвер, версию CUDA или матрицу фреймворков. Аддон по усилению защиты покрывает базовую ОС и на этом останавливается.

04

Хост вокруг карты

Голодный GPU — дорогой обогреватель. Хост важен не меньше карты, и именно на нём большинство дешёвых GPU-предложений тихо экономят.

EPYC 9354P, память ECC, NVMe локально на машине, порт сорок гигабит.

01

Ядра, которые могут его накормить

От восьми до тридцати двух выделенных ядер EPYC в зависимости от тарифа, закреплённых в том же NUMA-домене, что и карта. Загрузка данных и предобработка — обычная причина простоя цикла обучения, а это работа CPU.

02

Память ECC на хосте

Регистровая DDR5-4800, от шестидесяти четырёх до двухсот пятидесяти шести гигабайт. Сорокавосьмичасовая работа — это как раз то, что не должно быть сведено на нет одним перевёрнутым битом в буфере загрузчика данных.

03

NVMe, который успевает

От одного до четырёх терабайт локального Gen4 NVMe, в зеркале. Датасеты читаются с самой машины, а не через сетевой том, который кто-то ещё тоже читает.

04

Сорокагигабитный порт

Загрузка многотерабайтного датасета займёт вечер. Честное использование на сорокагигабитном порту — двести пятьдесят терабайт в месяц, это указано на странице с ценами.

05

Внеполосная консоль

Serial и VNC через аутентифицированный туннель, включено. Если установка драйвера пойдёт не так в полночь, вы всё равно сможете добраться до машины — ради этого она и существует.

Карта проброшена напрямую, поэтому драйвер устанавливается внутри вашего инстанса, как на любой другой машине. Ничто на хосте не касается вашего фреймворка, и перезагрузка ничего не перенастраивает.

05

Где находятся карты

Амстердам, Франкфурт, Лондон, Нью-Йорк, Даллас, Лос-Анджелес, Сингапур и Токио. Это площадки с плотностью питания и охлаждением, достаточными для постоянной работы карт на полной нагрузке, а не в коротких всплесках.

Восемь площадок в шести странах. GPU нужны питание и охлаждение, а не почтовые индексы.

Франкфурт — самая загруженная GPU-площадка, и новые карты поступают туда первыми. В Далласе проще всего получить ёмкость в короткий срок, потому что электроэнергия там дёшева, а площадка большая. В Лос-Анджелесе карты есть, но они часто заканчиваются, так что заказывайте заранее, если вам нужен западный маршрут в Азию.

По этой линейке наличие реально меняется. Карта, которая есть в наличии в полдень, может исчезнуть к вечеру; мы предпочтём показать честную пометку «sold out», чем принять заказ, который не сможем выполнить на этой неделе.

ПлощадкаПримечанияТипичное использование
АмстердамСамая плотная площадка в парке, всё поставляется сюда первымИнференс в Европе с низкой задержкой до большей части континента
ФранкфуртСамая загруженная GPU-площадка, первой получает новые картыОбучение и дообучение, где ёмкость важнее последней миллисекунды
ЛондонСамая низкая трансатлантическая задержка в ЕвропеОбслуживание пользователей по обе стороны Атлантики из одного места
Нью-ЙоркВосточное побережье, полный ассортиментИнференс в Северной Америке
ДалласДёшевое электричество, большая площадка, проще всего с ёмкостьюДолгие пакетные задания и всё, что чувствительно к цене
Лос-АнджелесЛучшие западные маршруты вне АзииОбслуживание тихоокеанского региона из Северной Америки
СингапурВыбор по умолчанию для Юго-Восточной АзииРегиональный инференс
ТокиоСамый стабильный RTT в регионеЧувствительный к задержке трафик из Японии и Кореи
06

Долгие задания: как не потерять результат

Сорокавосьмичасовое дообучение — это ставка на то, что за два дня ничего не пойдёт не так. Структурируйте задание так, чтобы проигрыш стоил вам часа, а не выходных.

Контрольные точки. Мы всё равно будем говорить об этом, даже если вы слышали это сто раз.

  1. 01

    Контрольная точка на локальный NVMe, часто

    Каждые несколько сотен шагов, на локальный диск, потому что это достаточно быстро, и затраты ничтожны. Задание, которое не может возобновиться, вы в итоге запустите дважды.

  2. 02

    Копируйте контрольные точки с машины

    Локальный NVMe зеркалирован, но не бессмертен. Резервное копирование вне узла пишется в другой город каждую ночь, и это самая дешёвая страховка на этой странице.

  3. 03

    Снимок (snapshot) перед установкой драйвера

    Обновления драйверов и фреймворков — главная причина, по которой рабочее окружение перестаёт работать. Снимок делается за секунды, и восстановление тоже занимает секунды.

  4. 04

    Следите за температурой и тактовой частотой, а не только за потерями

    Карты троттлят, когда в помещении неудачный день. Если пропускная способность падает без изменений в коде, посмотрите на показатели тактовой частоты, прежде чем переписывать загрузчик данных.

  5. 05

    Спрашивайте перед масштабированием

    Если следующий шаг — четыре или восемь карт, сообщите поддержке, что вы пытаетесь сделать. Иногда ответ — это выделенный сервер, а иногда ответ в том, что мы не подходящий поставщик.

07

Когда оборудование выходит из строя

GPU обычно деградируют, а не умирают: падение тактовой частоты, исправленные ошибки памяти на карте, задача, которая вдруг выполняется на треть медленнее без видимой причины в вашем коде.

Карты выходят из строя иначе, чем диски. Медленнее и с большим количеством предупреждений.

Наш мониторинг отслеживает температуру карт, поведение тактовой частоты и счётчики ошибок на каждом хосте. Когда карта начинает вести себя некорректно, мы связываемся с вами до того, как она перестанет работать, и планируем замену с учётом вашей задачи, а не в её разгар. Если карта выходит из строя полностью, ваш экземпляр пересоздаётся на другом хосте в том же дата-центре с сохранением томов и адресов.

Восстановление в этой линейке медленнее, чем в остальной части парка, и стоит прямо сказать почему: терабайт данных и постоянно загруженная модель требуют реальных минут на перенос и перезагрузку. Планируйте час, а не пятнадцать минут, и храните контрольные точки где-то, кроме машины, которая горит.

01

Предупреждение до отказа, когда возможно

Счётчики ошибок и телеметрия тактовой частоты считываются непрерывно. Большинство замен карт происходит в окно, согласованное с клиентом заранее.

02

Тома и адреса сохраняются

Пересоздание переносит содержимое NVMe и IP-адреса. Ничего в вашем DNS или сертификатах менять не нужно.

03

Компенсация автоматическая

Здесь действует тот же контрактный аптайм 99.99%, что и везде, и компенсация начисляется без заполнения формы.

08

Вопросы об этой линии

Физическое устройство привязано к вашему экземпляру по полному линку в шестнадцать линий. Здесь нет разделения vGPU, нет временных срезов и нет других арендаторов. В списке устройств отображается одна карта, потому что она одна.

Нет. Карты сдаются помесячно, минимальный срок — один месяц. Если ваша нагрузка действительно всплесковая, провайдер с поминутной оплатой будет дешевле, и в этом разговоре нет варианта, где мы притворяемся иначе.

Никакой, если вы не попросите. Образы поставляются чистыми, и драйвер устанавливается внутри вашего экземпляра, потому что половина наших GPU-клиентов имеют сильные предпочтения по версиям, а у другой половины есть контейнер, который несёт свой собственный.

Нет. Они находятся на одном хосте и в одном домене NUMA и общаются через PCIe. Для данных с параллельной обработкой с умеренным обменом градиентами этого достаточно. Для всего, что предполагает высокоскоростную ткань между картами, — нет, и вам следует соответствующим образом оценивать ожидания.

Нет. Passthrough требует, чтобы хост был построен для этого, с соответствующей топологией PCIe и запасом по питанию. Переход на эту линейку означает новый экземпляр и копирование данных.

Том затирается, а карта возвращается в пул. Снимайте контрольные точки до окончания срока, потому что отменённый экземпляр действительно исчезает, а не остаётся где-то в ожидании вашего решения передумать.

Готовы, когда вы готовы

Возьмите целую карту

Сначала проверьте арифметику памяти, выберите дата-центр с нужной ёмкостью и оплатите в криптовалюте. Root-доступ приходит менее чем за минуту, решение о драйвере остаётся за вами, а первые семь дней возвращаются без объяснения причин.