第2弾(全5弾)

ワーキングセットが収まらなくなったとき

データがメモリに収まらなくなった瞬間、マニュアルのすべてのチューニングテクニックは効力を失います。このラインは、それを収め続けるために存在します:レジスタードECC DDR5、本物のサーバートポロジー、そしてそれを活用できる十分なコア数。

フリート
から€89
デプロイ1分未満
利用可能場所27
トラフィック無制限、フェアユース

When the working set stops fitting in RAM, nothing else you tune matters. This line exists so that it keeps fitting: ECC memory, real server topology, and enough cores to use it.

価格
プラン専用コアメモリNVMe storageポート速度価格
E-8
Entry into ECC
864 GB500 GB25 Gbit/s€89.00
/月
設定
E-16最も使用されている
The workhorse tier
16128 GB1 TB25 Gbit/s€165.00
/月
設定
E-32
A full socket
32256 GB2 TB25 Gbit/s€310.00
/月
設定
E-48
Half a terabyte of RAM
48512 GB4 TB25 Gbit/s€580.00
/月
設定

価格は該当する場合、VATを除く。 トラフィック: 無制限、フェアユース.

AMD EPYC 9354P · Zen 4 · 32C/64T · ECC DDR5-4800 · NUMA-aware pinning

01

サーバーシリコンの目的

大型クーラーを搭載したデスクトップパーツはサーバーではありません。違いはバッジではなく、メモリ容量、メモリ訂正、PCIeレーン、そして全コアに同時に供給できる能力です。

EPYC 9354P、32コア、12メモリチャンネル、1ソケット。

9354Pは、1ソケットに32個のZen 4コアと64スレッドを搭載し、12チャンネルのレジスタードDDR5-4800に接続されます。12チャンネルが重要なポイントです。2チャンネルのデスクトッププラットフォームでは、16のビジーコアが計算ではなくメモリ待ちにかなりの時間を費やしますが、ここではそれがありません。

シングルソケットも意図的です。第2プロセッサにジャンプする必要も、インターソケットリンクを飽和させる必要も、スケジューラーがスレッドをマシンの片側に配置し、メモリを反対側に配置するリスクもありません。間違えることが少なければ、「昨日は問題なかった」というサポートチケットも減ります。

01

1インスタンスで最大512 GB

最上位は512 GBの訂正メモリを搭載。分析データベース、インメモリキャッシュ、誰もプロファイルする勇気がなかったJVMヒープ—すべてシャーディングプロジェクトなしで収まります。

02

同時にビジー状態を維持するコア

48スレッドがすべて実際の作業を行うことは、1スレッドが高速に動作することとは異なる問題です。コアあたりの帯域幅が2番目のケースを可能にするものであり、デスクトッププラットフォームがどのクロック速度でも一致できない数値です。

03

余裕のあるPCIeレーン

NVMe、ネットワーク、パススルーデバイスが同じ狭い経路を奪い合わない十分なレーン。これがGPUおよびストレージラインの下にあるのと同じホストプラットフォームである理由です。

04

ピーキーではなく予測可能

ここでのクロック速度はRyzenラインよりも低く、はるかに平坦です。99パーセンタイルで測定されるレイテンシーバジェットを持つものにとって、平坦さは速さよりも価値があります。

02

ECC、そして実際に何をするか

メモリエラーは珍しいものではありません。大規模なフリートでは毎週発生し、訂正のないマシンでは目に見えない形で発生します。それが心配すべき部分です。

訂正はチェックボックスではありません。読めるログです。

レジスタードECC DDR5-4800は、シングルビットエラーを飛行中に訂正し、マルチビットエラーを検出します。訂正されたエラーは、結果セットの間違った数値ではなく、ログの1行になります。モジュールが好ましくない割合でエラーを生成し始めると、スケジュールされたウィンドウ中に交換され、訂正不能なエラーと計画外の再起動になる前に処理されます。

これの実際的なケースは信頼性理論ではありません。ページキャッシュで1ビット反転したデータベースはクラッシュしません:反転した値をディスクに書き込み、すべてのスタンバイに忠実にレプリケートし、6週間後にレポートが自己矛盾したときに問題を発見させます。

お使いのインスタンスの訂正カウンターはパネルで確認できます。自分で監視したい場合は、同じ数値がAPIでも公開されています。

03

これを買うべきでない人

サーバーシリコンは自動的により良い選択ではありません。特定のかなり狭い問題に対してより良い選択です。

EPYCを要求する人の半数は、Ryzenラインとぐっすり眠りたいと思っています。

01

ボトルネックが1スレッド

9354Pのコアは9950Xのコアよりも遅く、メモリ帯域幅がいくらあってもそれは変わりません。プロファイラが1つのスレッドが100%で、31コアがアイドル状態を示しているなら、間違ったラインを選んでいます。

02

バッジが欲しいから買う

ワークロードが「EPYC」と書かれた部品で動いただけでエンタープライズ向けになるわけではありません。メモリ容量やコア数が本当に制約になっている場合はこれを買い、そうでない場合はより安いラインを買ってください。

03

40テラバイトが必要

このラインのNVMeは最大で数テラバイト台です。大量容量はストレージラインにあります。同じホストプラットフォーム上で、テラバイトあたりのコストは数分の一です。

04

後でGPUを載せたい

稼働中のEPYCインスタンスにカードを追加することはできません。GPUラインが存在するのは、パススルーにはホストが最初からそのように構成されている必要があるからです。

05

マシン全体が欲しい

E-32ティア以上ではソケット全体を占有しますが、ハイパーバイザーは当社のものです。独自カーネル、独自スケジューラ、またはフルスピードのネスト仮想化が必要な場合は、ベアメタルを購入してください。

04

割り当てとNUMAの関与

メモリを買うのは簡単です。それを使用するコアが物理的に近い場所にあることを確認する部分が、サーバープラットフォームを仕様のスプレッドシートから区別するポイントです。

コアは固定、メモリは予約、そして両方をマシンの同じ側に。

コアは物理コアにピン留めされ、テナントごとに1コアとその兄弟スレッド、Ryzenラインとまったく同じです。ここで変わるのは配置です。メモリはコアが置かれているNUMAドメインから割り当てられるため、メモリアクセスはファブリックを横断して目的のアドレスに到達する必要がありません。1つのドメインに収まらない大きいインスタンスは、それらを保持できる最小数のドメインにまたがってピン留めされ、トポロジーがパススルーされるため、独自のスケジューラが真実を見ることができます。

32コアのうち2コアは、ハイパーバイザー、ストレージ、監視用に予約されています。残りは一度だけ販売されます。それらがなくなると、このラインのコンフィギュレーターからサイトが表示されなくなります。これは時々迷惑ですが、常に正直です。

リソース割り当て方法共有されるもの
CPUコアサイズが許す限りNUMAドメイン内にピン留めなし
メモリ起動時にローカルドメインから予約。Registered ECCなし
トポロジーパススルーされ、ゲストスケジューラが実際の距離を認識該当なし
NVMe容量作成時に厚いプロビジョニングなし
ネットワークポート毎秒25ギガビット、専用サイトアップリンク、合計以上に設計
ハイパーバイザーオーバーヘッドノードあたり2コア予約、割り当て外該当なし
05

ディスクと配線

リファレンスノードには、ホットスペア付きミラーペアのエンタープライズNVMeドライブ4台と、別々のスイッチにボンディングされた25ギガビットインターフェース2つが搭載されています。

ノードあたりGen4 NVMe 4台、ミラーリング、25ギガビットポート。

01

ミラーリング、電力損失保護付き

書き込みはキャパシタバックアップキャッシュから確認応答されます。停電イベントはそのキャッシュを破棄するのではなくフラッシュします。これがクリーンなジャーナルリプレイと長い夜の違いです。

02

ボンディングされたアップリンク、別々のスイッチ

リンクアグリゲーショングループの2つのインターフェースが別々のスイッチに到達します。スイッチの再起動は、停止ではなく数パケットの損失で済みます。

03

フィルタリングはすでに適用済み

エッジで毎秒最大12テラビットのスクラビングを常時パスに実行。攻撃が始まったときに有効にする必要はありません。攻撃が始まったときには、すでにフィルタリングされているからです。

04

従量なし、公表された数値

25ギガビットポートでのフェアユースは月間150テラバイトです。この数値は料金ページに明記されており、後であなたに不利に使えるように曖昧にはされていません。

05

自前のアドレスを持ち込む

E-32プラン以上では、アップストリームが許可しているサイトで、お客様自身のIP空間を宣告できます。オブジェクトの詳細を添えてチケットを開くと、1日以内に回答します。

06

必要なら40ギガビット

このラインでは、サイトに舞台裏の容量があれば、専用の40ギガビットポートが利用可能です。これは有料オプションで、料金ページに価格が記載されており、ほとんどの人には必要ありません。

06

実行される場所、そして移行

7つのサイトにはありません:レイキャビク、ソフィア、キシナウ、パナマシティ、サンティアゴ、ムンバイ、ヨハネスブルグです。これらはRyzenとストレージのサイトであり、設定ツールはあなたがそのアイデアに惹かれる前に教えてくれます。

34サイトのうち27サイトがEPYC容量を保有しています。

他のすべてのサイトにはあり、北米の5サイトすべてと、ムンバイを除くアジアの全サイトが含まれます。フランクフルトとアムステルダムが最も多くの容量を持ち、新しいハードウェアが最初に入ります。チューリッヒはEPYCを搭載していますが、ラックのスペースがチューリッヒのラックスペースの値段であるため、割り当てを制限しています。

  1. 01

    コア数ではなくメモリでサイズを決める

    ピーク時のレジデントセットを計算し、ページキャッシュが実際に稼ぐ分を加え、その上のプランを購入します。このラインのコア数は、別の決定ではなく、メモリ数の結果として得られる傾向があります。

  2. 02

    月額プランで試す

    2年間の割引料金にコミットする前に、1ヶ月間1インスタンスを試してください。7日間の返金が最初の週をカバーします。答えが「いいえ」になった場合に備えて。

  3. 03

    データを回線経由で移す

    25ギガビットで従量なしトラフィックなら、数テラバイトのコピーは一晩の仕事です。それ以上のものについては、宅配便の計画を考案する代わりに、シード転送についてサポートに問い合わせてください。

  4. 04

    トポロジーを念頭に置く

    アプリケーションが独自のスレッドを固定する場合は、フラットなマシンを想定するのではなく、公開されているトポロジーを読んでください。これを間違えると、移行が置き換えられたハードウェアよりも遅く見える最も一般的な原因になります。

  5. 05

    可能な場合はその場で拡張する

    メモリとNVMeは、同じノードに容量があれば拡張できます。ノードが吸収できないジャンプは、ライブマイグレーションとなり、通常は営業日内に、あなたとスケジュールを調整します。

07

ノードが故障したとき

大きなインスタンスは回復に時間がかかります。なぜなら、半テラバイトのメモリをどこかから投入する必要があるからです。私たちはそれをほのめかすよりも、はっきりと言う方がましだと考えています。

他のフリートと同じ失敗パスですが、埋め戻すメモリが多くなります。

ドライブ障害はミラーとホットスペアで吸収され、インスタンスに中断はありません。メモリモジュールの不良は通常、訂正不能になる前に訂正カウントの増加で検出され、あなたと合意した時間枠で交換されます。いずれも日常的なことであり、インシデントではありません。

ノードが完全に失われた場合は、同じサイトのスタンバイハードウェアに再構築され、あなたのアドレスが引き継がれます。小規模インスタンスの再起動には数分かかります。最大のプランでは、正直な数字は30分に近く、そのほとんどは何をすべきかの決定ではなくデータの移動に費やされます。

01

訂正カウントはお客様が読める

インスタンスの下にあるメモリの健全性について、当社の言葉を信じる必要はありません。カウンタはパネルとAPIにあります。

02

クレジットは自動的

契約上の稼働時間は月間99.99%です。それを下回ると、クレームフォームや電話、因果関係の議論なしに、アカウントにクレジットが付与されます。

03

レプリケーションは希望に勝る

単一のインスタンスは、ハードウェアのコストがどうであれ、単一のインスタンスです。ワークロードが30分を失うことが許されない場合は、2番目のサイトでスタンバイを実行し、必要になる前にフェイルオーバーを練習してください。

08

このラインに関する質問

現在の価格帯でこのラインを維持できる価格で、量産調達・ラック実装・冷却が可能なのがこのCPUだからです。9354Pは成熟した部品であり、熱特性が既知で、ファームウェア上の驚きはありません。新しいサーバー世代がフリートにとって合理的になったときは、既存インスタンスに静かに追加されるのではなく、チェンジログに登場します。

ノードあたり12本のレジスタードDDR5-4800モジュール、訂正機能オン、カウンタ公開。パネルまたはAPIで確認できます。カウンタを見せずにECCを主張する人は、仕様書の信頼を求めているだけです。

E-32ティア以上では可能で、サポート対象のイメージです。ネスト型仮想化は動作しますが、実際のパフォーマンスコストがかかります。ネストしたゲストが実際のプロダクトであるなら、ベアメタルが正直な答えです。

データベースがRyzenのメモリに収まり、クエリのほとんどがシングルスレッドなら、Ryzenはレイテンシで勝り、コストも低くなります。しかし、ワーキングセットが128ギガバイトを超えるか、多数の同時実行の高コストなクエリがある場合、EPYCが問題の規模に応じて差を広げて勝ちます。

コアとメモリが同じドメインに配置され、アクセスがファブリックを横断しません。1つのドメインに収まらないインスタンスは、収まる最小数のドメインにまたがり、実際のトポロジーを渡すため、自身のスケジューラが推測する必要はありません。

E-32ティア以上で、上位プロバイダが許可するサイトで可能です。チケットでオブジェクト詳細を送っていただければ、1日以内に回答します。サイトが対応できない場合は、明確な「ノー」も含みます。

準備はできている

実際に必要なメモリ容量で購入

コア数ではなく常駐セットでティアを選び、1ヶ月試して、間違いならその場でアップグレード。支払いはコイン、サインアップはメールアドレス、最初の1週間は理由なしで返金可能。