プラットフォーム

ラックに実際に何があるか

2つのCPU世代、第3のものはありません。重要なラインでは自らエラーを修正するメモリ、エンタープライズNVMeをミラー化し、その横にアイドル状態のスペアを置き、ノードが顧客に会うことを許される前に3日間のバーンイン。

01

2世代のみで、それより古いものはありません

ほとんどのホスティング企業は、3〜4世代のハードウェアを同時に運用し、同じ価格で販売しています。そのため、同じ仕様の2台のサーバーでも、同じワークロードで40%もの性能差が出ることがあります。当社は代わりに、機器の種類を絞り込んでいます。

本番稼働中のものは、現行世代より1世代以上古いものはありません。このルールは2022年から続いています。

01

Ryzen 9 9950X、Zen 5

16コア、32スレッド、5.7GHzまでブースト。これは私たちが購入できる最速のシングルスレッドであり、実際の多くのアプリケーションでは、シングルスレッドの速度がリクエストの完了時間を決定します。

02

EPYC 9354P、Zen 4

1ソケットあたり32コア、64スレッド、12チャネルのメモリ、Registered ECC。コア数、メモリ容量、予測可能なNUMA動作がピーククロックよりも重要である場合、このパーツが最適です。

03

可能な限りシングルソケット

ソケット間のメモリアクセスは、チューニングで回避できないレイテンシの崖です。最大のベアメタル構成のみがデュアルソケットであり、64コアを明示的に要求した顧客のためだけにデュアルソケットになっています。

04

コアは一度だけ割り当てられます

あなたに販売されたコアは、あなた専用にスケジュールされます。バーストクレジットも、オーバーサブスクリプション率も、負荷がかかると出現し、スクリーンショットを撮る前に消えるスチールタイムもありません。

05

なぜ最新のサーバーシリコンを使わないのか

Zen 5サーバーパーツはラボにあり、フリートにはありません。9354Pを置き換える際には、購入可能になる6か月前にフロントページに載せるのではなく、移行日とともにチェンジログに表示されます。

02

メモリ、そしてECCが実際に存在する場所

メモリエラーは珍しいものではなく、何か重要なことが微妙に間違うまで単に見えません。サーバーラインでは、すべてのエラーが修正され、記録されます。

EPYCノードは、チャネルごとに1つずつ、すべてのチャネルにDDR5-4800 Registered ECCモジュールを搭載しています。すべてのチャネルを埋めることは容量のためではなく、帯域幅のためです。32コアパーツでメモリバスが半分しか埋まっていないと、RAMに高速でアクセスするすべての処理でボトルネックになります。

Ryzenノードは、DDR5-5600をECCなしで実行します。これは、コンシューマープラットフォームが信頼できる形式でECCを提供しないためです。これは埋もれずにここで明確に述べられています。ワークロードにエラー訂正が必要な場合、EPYCラインは89ユーロから始まり、まさにそのために存在します。

01

訂正可能なエラーはカウントされます

1日に数件以上の訂正を生成するランクはフラグが立てられ、何か問題が発生していなくても、次のメンテナンスウィンドウでモジュールが交換されます。

02

訂正不可能なエラーはノードをドレインします

インスタンスは移行され、ノードはプールから外れ、DIMMは交換されてから戻ります。ライブマイグレーションは見えるかもしれませんが、クラッシュは見えないはずです。

03

バルーニングもページマージもありません

メモリは一度だけ割り当てられ、2回カウントされることはありません。同一ページマージはフリート全体でオフです。なぜなら、これはテナント間のサイドチャネルであり、実際の負荷で消えてしまうパフォーマンスの主張だからです。

04

ノードあたりの容量は意図的に余裕があります

EPYCノードには、ホストする最大プランがまだヘッドルームを残すのに十分なメモリが搭載されています。最後のギガバイトまで詰まったノードには、隣接ノードが移動する必要があるときに移行先がありません。

03

NVMe、耐久性、そして何もしないスペア

すべてのドライブは、エンタープライズGen4パーツで、パワーロス保護(フラッシュ中に電源が切れたときに、確認済みの書き込みを完了させるコンデンサバンク)を備えています。

ノードごとにホットスペアを1台、アイドル状態で待機。これは建物内で最も安価な保険です。

01

常にミラーリングペア

読み取りは両方の半分に分散され、書き込みは保護されたキャッシュから確認され、両方に書き込まれます。単一のドライブ障害は、パフォーマンスプロファイルをわずかに変更しますが、可用性はまったく変更しません。

02

ノードごとにホットスペア1台

各ノードに1台のドライブがアイドル状態で空きとして置かれている。ミラーが片方を失うと、スペアが自動的に引き継ぎ、誰かがアラートを読む前に再構築が始まる。

03

耐久性の限界ではなく、耐久性のヘッドルーム

一般的なノードは1 DWPDクラスのドライブを使用し、ストレージノードは書き込み層に3 DWPDを使用します。ドライブは、データシートの数値まで使い切るのではなく、定格寿命の80%で交換されます。

04

コンシューマードライブはどこにもない

キャッシュ層にも、バルク層にも、2021年に誰かが急いで組み立てて忘れ去ったノードにも、コンシューマーNVMeはない。コンシューマーNVMeは11秒間は速いが、その後は速くない。これはノートPCでは良いトレードオフだ。

05

容量は約束ではなく、割り当てられる

ストレージはテナント間でシンプロビジョニングされない。プランが800 GBを謳うなら、そのノードにはあなたの名前で800 GBが存在し、他の誰もその領域に拡張できない。

04

各ノードクラスの内容

5つのノードクラスが5つの製品ラインを支える。Sクラスのバルクストレージは、NVMeライト層の後ろにあるエンタープライズSATAで、これがフリート全体で唯一のスピンドルメディアである。

クラスCPUメモリNVMeネットワーク電源
R — Ryzen NVMeRyzen 9 9950X, 16C/32T128 GB DDR5-56002 × 3.84 TB ミラー、スペア1台2 × 10 GbE, LACP2 × 800 W, AおよびB
E — EPYC ハイメモリEPYC 9354P, 32C/64T12 × DDR5-4800 ECC RDIMM4 × 3.84 TB ミラー、スペア1台2 × 25 GbE, LACP2 × 1200 W, AおよびB
G — GPUEPYC 9354P, 32C/64T256 GB ECC DDR5-48004 × 3.84 TB ミラー、スペア1台2 × 40 GbE, LACP2 × 2000 W, AおよびB
S — ストレージEPYC 9354P, 32C/64T128 GB ECC DDR5-48002 × 3.84 TB ライト層、その後ろにSATAバルク2 × 25 GbE, LACP2 × 1200 W, AおよびB
BM — ベアメタルRyzen 9950X、またはEPYC 9354P 1基または2基128 GB ~ 1 TB最大 8 × 7.68 TB10 ~ 40 GbE2 × 1200 W, AおよびB

GPUノードは物理カード全体をPCIe 4.0 x16でタイムスライスなしに透過的に提供する。だから電源数値がこの値になる。1インスタンスに2枚のカードを載せる場合、同じNUMAノードに置く。ソケットをまたぐと2枚目のカードが得る利得以上のコストがかかるからだ。

05

電源供給、およびインターネットに接続されていない管理

二重化できるものはすべて二重化し、管理ネットワークは外部へのルートを持ったことがない。

01

AおよびB供給、独立した経路

各ノードに独立した配電に2つの電源を備え、それぞれが単独でマシン全体を賄えるサイズ。供給の喪失は記録されたイベントであり、それ以上のものではない。そして、バーンイン中にすべてのノードでそれを実証する。

02

バッテリー、その後ジェネレーター

バッテリーは切り替えをカバーし、ジェネレーターは残りをカバーする。切り替えは各サイトでスケジュールに従ってテストされ、テストに合格しないサイトは、合格するまで新しいノードを受け取らない。

03

Tier 番号はお答えしません

格付けは建物と、それを発注した事業者に属するものであり、マーケティング文書の数字を繰り返すテナントに属するものではありません。サイトごとにお伝えするのは、給電トポロジーと最終転送テストの結果です。

04

専用VLAN上の帯域外管理

管理インターフェースには公開ルートがなく、これまで一度もありませんでした。アクセスは認証済みトンネルを通り、記録され、私たちだけでなくお客様にも利用可能です。

05

コンソール込み、無料

そのトンネル経由でインスタンスへのシリアルコンソールとVNCを提供します。これはネットワーク設定が機能しないときに動作し、それが誰もが望む唯一の瞬間です。

06

ベアメタルはIPMI、期間ごとに認証情報を更新

ベアメタル顧客には、VPN経由でIPMIを提供し、電源制御、起動順序、仮想メディアが利用可能です。期間終了時に認証情報はローテーションされ、コントローラのファームウェアはお客様のスケジュールではなく当社のスケジュールでパッチ適用されます。

06

バーンイン: 顧客に届く前に3日間

約9台に1台のノードが最初のテストで何かしら失敗します。そのほとんどは単一のDIMMです。

  1. 01

    ファームウェアを既知のベースラインに

    システム、コントローラー、ネットワーク、ドライブのファームウェアは、テストを開始する前にフリートが実行しているバージョンに固定されます。間違ったファームウェアでテストされたノードは、何も有用なテストをしていません。

  2. 02

    メモリを徹底的に

    すべての実装モジュールに対して複数回のフルパスを実行し、数分ではなく数時間かけます。この段階でバーンインが検出するほとんどの問題が検出され、スケジュールが日単位で測定される理由です。

  3. 03

    サーマルソーク

    すべてのコアをフル負荷で6時間、吸気口をレンジの高温側にして実行します。温度だけでなく持続ブーストクロックの低下も監視します。5時間目に熱スロットリングするノードは、3ヶ月目にお客様に影響するからです。

  4. 04

    全表面ストレージの検証

    各ドライブを端から端まで書き込み、読み戻して比較します。この段階の終了時のSMARTカウンターが、そのドライブの残りの寿命にわたって評価されるベースラインになります。

  5. 05

    ライン速度、双方向同時

    すべてのポートを1時間、双方向で最大容量に駆動し、スイッチ側のカウンターでホストが気付かないエラーをチェックします。

  6. 06

    フィードを1本抜く、次にもう1本

    フィードを1本抜いて復元し、反対側でも同じことを行います。わずかにでも瞬断したノードは運用に入りません。

  7. 07

    フリートでの静かな一日

    インスタンスを一切載せずにモニタリングで24時間過ごします。その後、顧客を受け入れ始めます。

合計所要時間は約72時間です。これが理由で、新サイトの在庫が少しずつではなくバッチで出現します。ラックが到着し、3日後にすべてが一度に利用可能になります。

07

ドライブが故障し始めるとき

ドライブは通常、突然死にません。誰も読まないカウンターで数日間予告します。だからこそ、私たちは5分ごとにそれらを読み取ります。

  1. 01

    しきい値であって、追悼ではない

    メディアエラー、再割り当てセクター、摩耗レベル、レイテンシの外れ値を継続的にサンプリングします。いずれかのしきい値を超えたドライブは、まだ完全に正常に動作しているうちに交換対象としてマークされます。

  2. 02

    スペアが先に引き継ぐ

    マークされたドライブを除去する前にホットスペアをミラーに組み込み、技術者を待つ間にペアが単一コピーとして実行されることはありません。

  3. 03

    リビルド、意図的にスロットル

    3.84 TBミラーはフルスピードで約40分でリビルドできます。当社は約2時間かけて遅めに実行します。フルスピードでのリビルドは、そのノード上のインスタンスにとってパフォーマンス障害と区別がつかないからです。

  4. 04

    お客様には通知され、他は何も変わらない

    インスタンスページにメモが表示されます。再起動も、マイグレーションも、メンテナンスウィンドウも、回答が必要なチケットもありません。

  5. 05

    ドライブはバラバラになって出ていく

    故障して退役したドライブは、保証クレジットのために返却するのではなく、現場で破棄されます。クレジットは確実性ほどの価値はありません。

ミラーは冗長性であって、バックアップではありません。ドライブ障害からは守ってくれますが、移行ミスやうっかり削除からは守ってくれません。スナップショットは5スロットで5ユーロ、オフノードバックアップは500GBごとに9ユーロで、インスタンスとは別のサイトに書き込まれます。

08

ハードウェアに関する質問

いいえ。Ryzenノードは non-ECC DDR5-5600 を使用しています。後でデータシートで知るよりは、ここで明言しておきます。メモリのサイレント破損が許されないものは EPYC に載せるべきです。

はい、確認可能です。午前3時とピーク時に負荷をかけたシングルコアベンチマークを実行してみてください。数値は変わるべきではありません。もし変わったら、チケットを開いてください。何かがおかしいので、私たちも知りたいからです。

名前では指定できませんが、アンチアフィニティをリクエストできます。あなたの2つのインスタンスを別々のノード、別々のスイッチ、別々の電源系統に配置します。費用はかからず、チケット1枚で済みます。

作業が許せば、インスタンスはライブマイグレーションされ、数百ミリ秒の一時停止が見られます。それ以外の場合は、少なくとも5日前までに通知があり、都合が悪ければ一度だけウィンドウを変更できます。

いいえ。コア、メモリ、NVMeはそれぞれ一度だけ割り当てられます。唯一の共有リソースはアップリンクであり、それがフェアユースの数値が明示されている理由です。

本番稼働中のすべてのノードは Zen 4 または Zen 5 です。前世代の最後のノードは2022年に退役し、それ以降、古いシリコンで販売されたものはありません。

準備はできている

同じハードウェア、34都市

ノードの仕様は、建物の旗によって変わりません。管轄とレイテンシーを選び、サイズを選んでください。