スライスではなく、カード
共有GPUは、他人のジョブが自分のジョブより先に終わることが前提です。このラインのすべてのカードは、フル16レーンリンクで1つのインスタンスに直接渡され、アイドルでもキャンセルまでそこに留まります。
A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.
| プラン | 専用コア | メモリ | NVMe storage | グラフィックス | ポート速度 | 価格 | |
|---|---|---|---|---|---|---|---|
| G-ADA Inference and light training | 8 | 64 GB | 1 TB | 1 × RTX 4000 Ada · 20 GB | 40 Gbit/s | €239.00 /月 | 設定 |
| G-L40S最も使用されている 48 GB of VRAM, undivided | 16 | 128 GB | 2 TB | 1 × L40S · 48 GB | 40 Gbit/s | €749.00 /月 | 設定 |
| G-L40S×2 Two cards, one NUMA node | 32 | 256 GB | 4 TB | 2 × L40S · 96 GB | 40 Gbit/s | €1420.00 /月 | 設定 |
価格は該当する場合、VATを除く。 トラフィック: 無制限、フェアユース.
EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing
34都市、29か国
レイテンシ値はベンダーのパンフレットではなく、当社のプローブからの測定中央値です。数値は変動し、ページもそれに応じて更新されます。
パススルーとその重要性
安価なGPU容量のほとんどは、キューで回されるカードの一部です。製品ページの数字はカードのメモリであり、あなたのものではありません。測定するスループットは、今朝他に誰が起きているかに依存します。
vGPUもタイムスライシングも、あなたとシリコンの間にスケジューラもありません。
ここでは、カードがハイパーバイザーレベルで16レーンPCIe 4.0リンクを通じてインスタンスにバインドされています。デバイス全体があなたのもの:すべてのメモリ、すべてのコンピュートユニット、コピーエンジンの帯域幅全体。何もパーティション分割されておらず、キューもなく、あなたのデバイスリストに他のテナントは表示されません。
実際の結果として、今晩のベンチマークは先週の火曜日のベンチマークと一致します。2日かかるファインチューニングが、最初の1時間で予測した時間で完了します。対話型の作業も、あなたの前の他のテナントのバッチジョブがないため、対話性を維持します。
すべてのVRAM、常に
L40Sで48ギガバイト、RTX 4000 Adaで20ギガバイト、ハイパーバイザーパーティション用に予約されたものはありません。カードが持つものは、あなたのプロセスがアドレス指定できるものです。
アイドルでも追加コストなし
カードは秒単位ではなく月単位で借用します。実験の合間にモデルを3週間常駐させても、睡眠中に回収されることはありません。
2枚のカード、1つのホスト
デュアルカードティアでは、両方のデバイスが同じホストの同じNUMAドメインに置かれます。カード間リンクではなくPCIeで通信します。これは、トレーニングトポロジを計画する前に知っておくべきことです。
あなた自身のスタック
カードが挿さったマシンを渡して、こちらは関与しない。ドライバ、コンテナランタイム、フレームワークのバージョン、カーネルはあなたのものだ。あなたのPythonについて意見を持つ管理レイヤーは存在しない。
これらのカードが適している用途
どちらのカードもトレーニングクラスターの最上位ではなくワークステーションクラスであり、正直な位置づけはそれに従う。
推論、ファインチューニング、レンダリング、バッチ数値計算。この順序。
モデルが48ギガバイトに収まるなら、L40Sは支払いを続ける限り、しっかりとサービスを提供する。収まらないなら、どんな熱意でも収まるようにはならず、次の正直なステップは量子化、デュアルカード層へのシャーディング、またはまったく別のクラスのマシンだ。
| ワークロード | どのカード | 実際の制約 |
|---|---|---|
| 量子化されたモデルを実ユーザーに提供 | RTX 4000 Ada | メモリ、次いでリクエストの同時実行性 |
| 中規模モデルをフル精度で提供 | L40S | 48ギガバイトが上限となり、これが決定要因 |
| アダプターを使ったファインチューニング | L40S | バックワードパス中のVRAMであり、生のスループットではない |
| 大規模モデルのフルファインチューニング | L40S 2枚、または別の場所 | PCIe上のカード間帯域幅が限界になる |
| バッチレンダリングとビデオエンコード | どちらでも | カードよりもディスクとネットワークがボトルネックになることがはるかに多い |
| 倍精度での数値シミュレーション | 通常はどちらも不向き | これらは倍精度向け部品ではない。EPYCコアを選ぶこと |
これを買うべきでない人
GPU容量は、当社が販売する他のどの製品よりも楽観的なサイジングを引き寄せる。3つのグループの人々はこの製品をスキップすべきだ。
一部の顧客に伝えられる最も有益なことは、当社が適切なショップではないということだ。
何か巨大なものをゼロからトレーニングしている
ホスト間の高帯域幅インターコネクトを使用したマルチノードトレーニングは、これの目的ではない。1台のホスト上のPCIe経由の2カードが当社の上限であり、そうでないふりをするとあなたの数週間を無駄にする。
1秒単位の課金が必要
カードは月単位でレンタルされる。使用が本当に週20分なら、メーター制のプラットフォームの方が当社より安くなるだろう。今それを言う方が良い。
モデルが収まらない
2枚のカードで96ギガバイトがここでアドレス指定できる最大値だ。注文する前に、重み、アクティベーション、オプティマイザー状態のメモリ計算を行うこと。後ではなく。
倍精度が必要
これらは単精度および混合精度の部品だ。FP64スループットを要求する科学計算コードは、どちらのカードよりも48個のEPYCコアで速く実行されるだろう。
スタックを管理してほしい
当社はドライバ、CUDAバージョン、フレームワークマトリックスを保守しない。ハードニングアドオンはOSベースラインを対象としており、そこで終わる。
カードの周囲のホスト
飢えたGPUは高価なスペースヒーターだ。ホストはカードと同じくらい重要であり、ここでほとんどの安価なGPU製品が静かにコストを削減している。
EPYC 9354P、ECCメモリ、マシンローカルのNVMe、40ギガビットポート。
それを供給できるコア
層に応じて8〜32個の専用EPYCコアが、カードと同じNUMAドメインに固定される。データロードと前処理は通常、トレーニングループが停止する原因であり、それはCPUの仕事だ。
ホスト上のECCメモリ
Registered DDR5-4800、64〜256ギガバイト。48時間のジョブは、データローダーバッファの1ビット反転で台無しにされるべきではないまさにその種のものだ。
NVMe が追いつく
1〜4テラバイトのローカルGen4 NVMe(ミラーリング対応)。データセットは、他の誰かが同時に読み取っているネットワークボリュームではなく、マシン自体からストリーミングされます。
40ギガビットポート
数テラバイトのデータセットの取り込みは一晩で完了します。40ギガビットポートでのフェアユースは月間250テラバイトで、価格ページに公開されています。
帯域外コンソール
認証済みトンネルを介したシリアルおよびVNCが含まれます。深夜にドライバのインストールが失敗しても、マシンにはアクセスできます。これこそがこの機能が存在する理由です。
GPUはパススルーされるため、ドライバは他のマシンと同様にインスタンス内にインストールされます。ホスト上の何もフレームワークに干渉せず、再起動しても再交渉は発生しません。
カードが置かれている場所
アムステルダム、フランクフルト、ロンドン、ニューヨーク、ダラス、ロサンゼルス、シンガポール、東京。これらのフロアには、カードを控えめなバーストではなくフル負荷で継続的に実行するための電力密度と冷却があります。
6か国8サイト。GPUが必要とするのは電力と冷却であり、郵便番号ではありません。
フランクフルトは当社が運営する最も混雑するGPUフロアであり、新しいカードが最初に入荷します。ダラスは電力が安くフロアが広いため、短時間でのキャパシティ確保が最も容易な場所です。ロサンゼルスはカードを搭載していますが、稼働率が低いことが多いため、アジアへの西行きルートを購入する場合は早めに注文してください。
このラインでは在庫は本当に動きます。正午に利用可能と表示されたカードが夕方にはなくなることがあり、今週中に満たせない注文を受けるよりも、正確な売り切れラベルを表示する方が良いと考えています。
| サイト | 備考 | 一般的な用途 |
|---|---|---|
| アムステルダム | フリートで最も密度が高いサイト、すべてが最初にここに出荷される | 欧州大陸の大半に低遅延な欧州での推論 |
| フランクフルト | 最も混雑するGPUフロア、新しいカードが最初に届く | 最後のミリ秒よりもキャパシティが重要なトレーニングとファインチューニング |
| ロンドン | ヨーロッパで最も低い大西洋横断レイテンシ | 大西洋の両側のユーザーに1か所からサービスを提供 |
| ニューヨーク | 東海岸の拠点、全製品ラインアップ | 北米での推論 |
| ダラス | 安価な電力、広いフロア、最も容易なキャパシティ | 長時間のバッチジョブと価格に敏感なもの |
| ロサンゼルス | アジア以外で最高の西行きルート | 北米から太平洋周辺地域にサービスを提供 |
| シンガポール | 東南アジアのデフォルトの選択肢 | 地域内推論 |
| 東京 | この地域で最も安定したラウンドトリップタイム | レイテンシに敏感な日本語・韓国語のトラフィック |
長時間ジョブとその失い方
48時間のファインチューニングは、2日間何も問題が起こらないという賭けです。負けても失うのが数時間ではなく週末にならないよう、ジョブを構成してください。
チェックポイント。100回聞いた後でも、私たちはそれを言い続けます。
- 01
ローカルNVMeへ頻繁にチェックポイントを保存
数百ステップごとにローカルディスクへ保存します。十分に高速でコストは無視できるからです。再開できないジョブは、結局2回実行することになります。
- 02
チェックポイントをボックスからコピー
ローカルNVMeはミラーリングされていますが、不滅ではありません。ノード外バックアップは毎晩別の都市に書き込まれ、このページで最も安価な保険です。
- 03
ドライバーに触れる前にスナップショットを作成
ドライバーとフレームワークのアップグレードは、正常に動作していた環境が動作しなくなる主な原因です。スナップショットは作成も復元も数秒で完了します。
- 04
Watch temperature and clocks, not just loss
Cards throttle when the room is having a bad day. If your throughput drops without your code changing, look at the clock figures before you rewrite the dataloader.
- 05
Ask before you scale sideways
If the next step is four or eight cards, tell support what you are trying to do. Sometimes the answer is a bare-metal machine, and occasionally the answer is that we are not the right supplier.
When the hardware fails
GPUs usually degrade rather than die: falling clocks, corrected memory errors on the card, a job that suddenly runs a third slower for no reason you can find in your code.
Cards fail differently from disks. Slower, and with more warning.
Our monitoring watches card temperature, clock behaviour and error counters on every host. When a card starts misbehaving we contact you before it stops working, and we schedule the swap around your job rather than through the middle of it. Where the card fails outright, your instance is rebuilt on another host in the same site with its volumes and addresses intact.
Recovery on this line is slower than elsewhere in the fleet, and it is worth being plain about why: a terabyte of dataset and a resident model take real minutes to move and reload. Plan for an hour rather than fifteen minutes, and keep checkpoints somewhere other than the machine that is on fire.
Warning before failure, where possible
Error counters and clock telemetry are read continuously. Most card replacements happen in a window we agreed with the customer in advance.
Volumes and addresses survive
The rebuild carries your NVMe contents and IP addresses across. Nothing in your DNS or your certificates needs to change.
クレジットは自動的
The same 99.99% contractual uptime applies here as everywhere else, and the credit lands without a claim form.
このラインに関する質問
The physical device is bound to your instance over a full sixteen-lane link. There is no vGPU partitioning, no time-slicing and no other tenant on it. Your device list shows one card because there is one card.
No. Cards are monthly, and the shortest commitment is one month. If your workload is genuinely bursty, a metered provider will be cheaper, and there is no version of this conversation where we pretend otherwise.
None, unless you ask. Images ship clean and the driver goes on inside your instance, because half of our GPU customers have strong views about versions and the other half have a container that carries its own.
No. They sit on the same host and the same NUMA domain, and they communicate over PCIe. For data-parallel work with modest gradient exchange this is fine. For anything that assumes a high-bandwidth card-to-card fabric, it is not, and you should size your expectations accordingly.
No. Passthrough requires the host to be built for it, with the PCIe topology and the power budget in place. Moving to this line means a new instance and a data copy.
The volume is wiped and the card goes back into the pool. Take your checkpoints off before the term ends, because a cancelled instance is genuinely gone rather than parked somewhere waiting for you to change your mind.
Take a whole card
Check the memory arithmetic first, pick the site with the capacity, and pay in coin. Root access arrives in under a minute, the driver decision stays yours, and the first seven days are refundable without a reason.