5つのラインのうちの3つ目

スライスではなく、カード

共有GPUは、他人のジョブが自分のジョブより先に終わることが前提です。このラインのすべてのカードは、フル16レーンリンクで1つのインスタンスに直接渡され、アイドルでもキャンセルまでそこに留まります。

フリート
から€239
デプロイ1分未満
利用可能場所8
トラフィック無制限、フェアユース

A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.

価格
プラン専用コアメモリNVMe storageグラフィックスポート速度価格
G-ADA
Inference and light training
864 GB1 TB1 × RTX 4000 Ada · 20 GB40 Gbit/s€239.00
/月
設定
G-L40S最も使用されている
48 GB of VRAM, undivided
16128 GB2 TB1 × L40S · 48 GB40 Gbit/s€749.00
/月
設定
G-L40S×2
Two cards, one NUMA node
32256 GB4 TB2 × L40S · 96 GB40 Gbit/s€1420.00
/月
設定

価格は該当する場合、VATを除く。 トラフィック: 無制限、フェアユース.

EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing

00

34都市、29か国

レイテンシ値はベンダーのパンフレットではなく、当社のプローブからの測定中央値です。数値は変動し、ページもそれに応じて更新されます。

01

パススルーとその重要性

安価なGPU容量のほとんどは、キューで回されるカードの一部です。製品ページの数字はカードのメモリであり、あなたのものではありません。測定するスループットは、今朝他に誰が起きているかに依存します。

vGPUもタイムスライシングも、あなたとシリコンの間にスケジューラもありません。

ここでは、カードがハイパーバイザーレベルで16レーンPCIe 4.0リンクを通じてインスタンスにバインドされています。デバイス全体があなたのもの:すべてのメモリ、すべてのコンピュートユニット、コピーエンジンの帯域幅全体。何もパーティション分割されておらず、キューもなく、あなたのデバイスリストに他のテナントは表示されません。

実際の結果として、今晩のベンチマークは先週の火曜日のベンチマークと一致します。2日かかるファインチューニングが、最初の1時間で予測した時間で完了します。対話型の作業も、あなたの前の他のテナントのバッチジョブがないため、対話性を維持します。

01

すべてのVRAM、常に

L40Sで48ギガバイト、RTX 4000 Adaで20ギガバイト、ハイパーバイザーパーティション用に予約されたものはありません。カードが持つものは、あなたのプロセスがアドレス指定できるものです。

02

アイドルでも追加コストなし

カードは秒単位ではなく月単位で借用します。実験の合間にモデルを3週間常駐させても、睡眠中に回収されることはありません。

03

2枚のカード、1つのホスト

デュアルカードティアでは、両方のデバイスが同じホストの同じNUMAドメインに置かれます。カード間リンクではなくPCIeで通信します。これは、トレーニングトポロジを計画する前に知っておくべきことです。

04

あなた自身のスタック

カードが挿さったマシンを渡して、こちらは関与しない。ドライバ、コンテナランタイム、フレームワークのバージョン、カーネルはあなたのものだ。あなたのPythonについて意見を持つ管理レイヤーは存在しない。

02

これらのカードが適している用途

どちらのカードもトレーニングクラスターの最上位ではなくワークステーションクラスであり、正直な位置づけはそれに従う。

推論、ファインチューニング、レンダリング、バッチ数値計算。この順序。

モデルが48ギガバイトに収まるなら、L40Sは支払いを続ける限り、しっかりとサービスを提供する。収まらないなら、どんな熱意でも収まるようにはならず、次の正直なステップは量子化、デュアルカード層へのシャーディング、またはまったく別のクラスのマシンだ。

ワークロードどのカード実際の制約
量子化されたモデルを実ユーザーに提供RTX 4000 Adaメモリ、次いでリクエストの同時実行性
中規模モデルをフル精度で提供L40S48ギガバイトが上限となり、これが決定要因
アダプターを使ったファインチューニングL40Sバックワードパス中のVRAMであり、生のスループットではない
大規模モデルのフルファインチューニングL40S 2枚、または別の場所PCIe上のカード間帯域幅が限界になる
バッチレンダリングとビデオエンコードどちらでもカードよりもディスクとネットワークがボトルネックになることがはるかに多い
倍精度での数値シミュレーション通常はどちらも不向きこれらは倍精度向け部品ではない。EPYCコアを選ぶこと
03

これを買うべきでない人

GPU容量は、当社が販売する他のどの製品よりも楽観的なサイジングを引き寄せる。3つのグループの人々はこの製品をスキップすべきだ。

一部の顧客に伝えられる最も有益なことは、当社が適切なショップではないということだ。

01

何か巨大なものをゼロからトレーニングしている

ホスト間の高帯域幅インターコネクトを使用したマルチノードトレーニングは、これの目的ではない。1台のホスト上のPCIe経由の2カードが当社の上限であり、そうでないふりをするとあなたの数週間を無駄にする。

02

1秒単位の課金が必要

カードは月単位でレンタルされる。使用が本当に週20分なら、メーター制のプラットフォームの方が当社より安くなるだろう。今それを言う方が良い。

03

モデルが収まらない

2枚のカードで96ギガバイトがここでアドレス指定できる最大値だ。注文する前に、重み、アクティベーション、オプティマイザー状態のメモリ計算を行うこと。後ではなく。

04

倍精度が必要

これらは単精度および混合精度の部品だ。FP64スループットを要求する科学計算コードは、どちらのカードよりも48個のEPYCコアで速く実行されるだろう。

05

スタックを管理してほしい

当社はドライバ、CUDAバージョン、フレームワークマトリックスを保守しない。ハードニングアドオンはOSベースラインを対象としており、そこで終わる。

04

カードの周囲のホスト

飢えたGPUは高価なスペースヒーターだ。ホストはカードと同じくらい重要であり、ここでほとんどの安価なGPU製品が静かにコストを削減している。

EPYC 9354P、ECCメモリ、マシンローカルのNVMe、40ギガビットポート。

01

それを供給できるコア

層に応じて8〜32個の専用EPYCコアが、カードと同じNUMAドメインに固定される。データロードと前処理は通常、トレーニングループが停止する原因であり、それはCPUの仕事だ。

02

ホスト上のECCメモリ

Registered DDR5-4800、64〜256ギガバイト。48時間のジョブは、データローダーバッファの1ビット反転で台無しにされるべきではないまさにその種のものだ。

03

NVMe が追いつく

1〜4テラバイトのローカルGen4 NVMe(ミラーリング対応)。データセットは、他の誰かが同時に読み取っているネットワークボリュームではなく、マシン自体からストリーミングされます。

04

40ギガビットポート

数テラバイトのデータセットの取り込みは一晩で完了します。40ギガビットポートでのフェアユースは月間250テラバイトで、価格ページに公開されています。

05

帯域外コンソール

認証済みトンネルを介したシリアルおよびVNCが含まれます。深夜にドライバのインストールが失敗しても、マシンにはアクセスできます。これこそがこの機能が存在する理由です。

GPUはパススルーされるため、ドライバは他のマシンと同様にインスタンス内にインストールされます。ホスト上の何もフレームワークに干渉せず、再起動しても再交渉は発生しません。

05

カードが置かれている場所

アムステルダム、フランクフルト、ロンドン、ニューヨーク、ダラス、ロサンゼルス、シンガポール、東京。これらのフロアには、カードを控えめなバーストではなくフル負荷で継続的に実行するための電力密度と冷却があります。

6か国8サイト。GPUが必要とするのは電力と冷却であり、郵便番号ではありません。

フランクフルトは当社が運営する最も混雑するGPUフロアであり、新しいカードが最初に入荷します。ダラスは電力が安くフロアが広いため、短時間でのキャパシティ確保が最も容易な場所です。ロサンゼルスはカードを搭載していますが、稼働率が低いことが多いため、アジアへの西行きルートを購入する場合は早めに注文してください。

このラインでは在庫は本当に動きます。正午に利用可能と表示されたカードが夕方にはなくなることがあり、今週中に満たせない注文を受けるよりも、正確な売り切れラベルを表示する方が良いと考えています。

サイト備考一般的な用途
アムステルダムフリートで最も密度が高いサイト、すべてが最初にここに出荷される欧州大陸の大半に低遅延な欧州での推論
フランクフルト最も混雑するGPUフロア、新しいカードが最初に届く最後のミリ秒よりもキャパシティが重要なトレーニングとファインチューニング
ロンドンヨーロッパで最も低い大西洋横断レイテンシ大西洋の両側のユーザーに1か所からサービスを提供
ニューヨーク東海岸の拠点、全製品ラインアップ北米での推論
ダラス安価な電力、広いフロア、最も容易なキャパシティ長時間のバッチジョブと価格に敏感なもの
ロサンゼルスアジア以外で最高の西行きルート北米から太平洋周辺地域にサービスを提供
シンガポール東南アジアのデフォルトの選択肢地域内推論
東京この地域で最も安定したラウンドトリップタイムレイテンシに敏感な日本語・韓国語のトラフィック
06

長時間ジョブとその失い方

48時間のファインチューニングは、2日間何も問題が起こらないという賭けです。負けても失うのが数時間ではなく週末にならないよう、ジョブを構成してください。

チェックポイント。100回聞いた後でも、私たちはそれを言い続けます。

  1. 01

    ローカルNVMeへ頻繁にチェックポイントを保存

    数百ステップごとにローカルディスクへ保存します。十分に高速でコストは無視できるからです。再開できないジョブは、結局2回実行することになります。

  2. 02

    チェックポイントをボックスからコピー

    ローカルNVMeはミラーリングされていますが、不滅ではありません。ノード外バックアップは毎晩別の都市に書き込まれ、このページで最も安価な保険です。

  3. 03

    ドライバーに触れる前にスナップショットを作成

    ドライバーとフレームワークのアップグレードは、正常に動作していた環境が動作しなくなる主な原因です。スナップショットは作成も復元も数秒で完了します。

  4. 04

    Watch temperature and clocks, not just loss

    Cards throttle when the room is having a bad day. If your throughput drops without your code changing, look at the clock figures before you rewrite the dataloader.

  5. 05

    Ask before you scale sideways

    If the next step is four or eight cards, tell support what you are trying to do. Sometimes the answer is a bare-metal machine, and occasionally the answer is that we are not the right supplier.

07

When the hardware fails

GPUs usually degrade rather than die: falling clocks, corrected memory errors on the card, a job that suddenly runs a third slower for no reason you can find in your code.

Cards fail differently from disks. Slower, and with more warning.

Our monitoring watches card temperature, clock behaviour and error counters on every host. When a card starts misbehaving we contact you before it stops working, and we schedule the swap around your job rather than through the middle of it. Where the card fails outright, your instance is rebuilt on another host in the same site with its volumes and addresses intact.

Recovery on this line is slower than elsewhere in the fleet, and it is worth being plain about why: a terabyte of dataset and a resident model take real minutes to move and reload. Plan for an hour rather than fifteen minutes, and keep checkpoints somewhere other than the machine that is on fire.

01

Warning before failure, where possible

Error counters and clock telemetry are read continuously. Most card replacements happen in a window we agreed with the customer in advance.

02

Volumes and addresses survive

The rebuild carries your NVMe contents and IP addresses across. Nothing in your DNS or your certificates needs to change.

03

クレジットは自動的

The same 99.99% contractual uptime applies here as everywhere else, and the credit lands without a claim form.

08

このラインに関する質問

The physical device is bound to your instance over a full sixteen-lane link. There is no vGPU partitioning, no time-slicing and no other tenant on it. Your device list shows one card because there is one card.

No. Cards are monthly, and the shortest commitment is one month. If your workload is genuinely bursty, a metered provider will be cheaper, and there is no version of this conversation where we pretend otherwise.

None, unless you ask. Images ship clean and the driver goes on inside your instance, because half of our GPU customers have strong views about versions and the other half have a container that carries its own.

No. They sit on the same host and the same NUMA domain, and they communicate over PCIe. For data-parallel work with modest gradient exchange this is fine. For anything that assumes a high-bandwidth card-to-card fabric, it is not, and you should size your expectations accordingly.

No. Passthrough requires the host to be built for it, with the PCIe topology and the power budget in place. Moving to this line means a new instance and a data copy.

The volume is wiped and the card goes back into the pool. Take your checkpoints off before the term ends, because a cancelled instance is genuinely gone rather than parked somewhere waiting for you to change your mind.

準備はできている

Take a whole card

Check the memory arithmetic first, pick the site with the capacity, and pay in coin. Root access arrives in under a minute, the driver decision stays yours, and the first seven days are refundable without a reason.