GPUインスタンスは今月、フランクフルト、ダラス、シンガポールで稼働を開始しました。まずは2つの構成から: VRAM 20GBのRTX 4000 Ada 1枚、および48GBのL40S 1枚です。どちらもEPYC 9354Pホスト上に置かれ、PCIe 4.0 x16レーンで接続され、1つのインスタンスに直接透過されます。
透過とは、カードがブート時にハイパーバイザーによってインスタンスにバインドされ、キャンセルするまでそこに留まることを意味します。スケジューラーもキューも他のテナントもなく、他の誰かが同時に使っているVRAMの分割もありません。
私たちが実際に行った決定
テナント間でのカードのタイムスライシングは、サポートされ文書化され完全に合法的なこのビジネスの運営方法です。私たちはその原価計算に約3週間を費やしました。なぜなら計算は魅力的だからです: 1枚の48GBカードを4つの12GBインスタンスとして提示でき、1つの購入から4つの家賃と1つの電力予算から4人の顧客が得られます。
次に99パーセンタイルレイテンシを測定しました。
共有カードは、他のテナントがアイドル状態のときは問題なく、彼らがアクティブになると不快です。3つの他のアクティブなテナントがいるカードでの推論レイテンシは、中央値ではおおよそ期待通りで、99パーセンタイルでは他の全員の状況に応じて4〜9倍悪化しました。トレーニングジョブはさらに悪化しました。なぜならトレーニングジョブはバースト的ではなく、ギャップが決して発生しないからです。
ライセンス問題もあります。クリーンなパーティショニングを可能にする仮想化ソフトウェアにはカードごとの年間ライセンスがあり、そのコストは消えず、スライスを借りる人のインボイスに載ります。私たちは共有の特権に対してあなたに請求していたことになります。
ホストの構成
| 要素 | 内容 |
|---|---|
| ホストCPU | EPYC 9354P、32コア、ECC DDR5-4800 |
| 接続 | PCIe 4.0、16レーン、カードごとに1つのIOMMUグループ |
| vCPUピニング | カードが接続されているソケットとNUMAノードに固定 |
| メモリ | 同じNUMAノードから割り当て、インターリーブなし |
| ノードあたりのカード数 | 最大4枚、ほとんどのサイトで2枚、ラック電力に制限される |
| ポート | 40 Gbit/s。なぜなら、VRAMに収まらないモデルはどこかから取得する必要があるからです |
NUMAピニングは、スペックシートが示唆する以上に重要です。間違ったソケット上のvCPUがカードにインターコネクト経由でデータを供給すると、ストリーミングデータのスループットが実質的に低下し、これは他のGPUホストで最も一般的な設定ミスです。
電力、そしてなぜ3サイトのみか
350ワットのカードはラックの計算を変えます。12台の汎用ノードを快適に収容できるサイトは、4台のGPUノードで冷却が尽きます。フランクフルト、ダラス、シンガポールが選ばれたのは、これら3サイトすべてが電力余裕と、再交渉なしで密度に対応できるフロアプランを持っていたからです。
電力が許す限りさらにサイトが追加されますが、正直な制約は需要ではなく常に電力です。サイトが引き込みに対応できない場合、私たちはサーマルスロットリングされた製品を販売するよりも販売しないことを選びます。
できないこと
- ノード間でのカードペアリングは不可。 2カードインスタンスは存在し、両カードは1つのNUMAノード上にあります。それ以上はベアメタルに関する相談です。
- インスタンス内でのパーティショニングは不可。 あなたはカード全体を持ち、それをどう分割するかはあなたとフレームワークの問題です。
- ホットスワップは不可。 GPU変更は再ビルドを意味します。カードはブート時にバインドされるためです。
- コンシューマーゲーミングカードは不可。 毎週質問されます。ラック用の冷却プロファイルを欠いており、ほとんどの場合そもそもレンタルするライセンスがありません。
価格、率直に
カードは原価がかかり、マージンはカタログの他の部分よりも薄いです。時間単位の請求はありません。なぜなら専用ハードウェアでの時間単位請求は、カードをアイドル状態で保持し、他の全員にその特権を請求することを意味するからです。月額、標準の7日間返金付き、他のすべてと同じ暗号通貨のみの支払いです。
あなたのワークロードが本当にバースト的で時間単位の場合、私たちは間違ったサプライヤーであり、大規模ハイパースケーラーが正しいです。私たちがタイムスライシングを拒否する限りこれは真実であり、それは無期限です。