카드의 일부가 아닌 카드 전체
공유 GPU는 다른 사람의 작업이 끝나야 내 작업이 시작되는 것입니다. 이 라인의 모든 카드는 전체 16레인 링크를 통해 하나의 인스턴스에 패스스루되며, 유휴 상태든 아니든 취소할 때까지 그대로 유지됩니다.
A shared GPU is someone else’s job finishing before yours starts. Every card in this line is passed straight through to a single instance and stays there until you cancel.
| 요금제 | 전용 코어 | 메모리 | NVMe 스토리지 | 그래픽 | 포트 속도 | 가격 | |
|---|---|---|---|---|---|---|---|
| G-ADA Inference and light training | 8 | 64 GB | 1 TB | 1 × RTX 4000 Ada · 20 GB | 40 Gbit/s | €239.00 /월 | 구성 |
| G-L40S대부분 선택됨 48 GB of VRAM, undivided | 16 | 128 GB | 2 TB | 1 × L40S · 48 GB | 40 Gbit/s | €749.00 /월 | 구성 |
| G-L40S×2 Two cards, one NUMA node | 32 | 256 GB | 4 TB | 2 × L40S · 96 GB | 40 Gbit/s | €1420.00 /월 | 구성 |
가격은 해당되는 경우 VAT를 제외한 금액입니다. 트래픽: 무제한, 합리적 사용.
EPYC 9354P host · PCIe 4.0 x16 passthrough · no vGPU time-slicing
34개 도시, 29개국
지연 시간 수치는 공급업체 브로셔가 아닌 자체 프로브의 측정된 중앙값입니다. 이동하며, 페이지는 그에 따라 업데이트됩니다.
패스스루와 그 중요성
대부분의 저렴한 GPU 용량은 대기열을 통해 공유되는 카드의 일부입니다. 제품 페이지의 숫자는 카드 메모리이지 내 것이 아니며, 측정하는 처리량은 오늘 아침 다른 누가 깨어났는지에 따라 달라집니다.
vGPU 없음, 시간 분할 없음, 실리콘과 사용자 사이의 스케줄러 없음.
여기서 카드는 16레인 PCIe 4.0 링크를 통해 하이퍼바이저 수준에서 인스턴스에 바인딩됩니다. 전체 장치가 내 것입니다: 모든 메모리, 모든 컴퓨트 유닛, 전체 복사 엔진 대역폭. 분할되는 것도, 대기열에 들어가는 것도 없으며, 다른 테넌트가 내 장치 목록에 나타나지 않습니다.
실질적인 결과는 오늘 저녁 벤치마크가 지난주 화요일 벤치마크와 일치한다는 것입니다. 이틀 걸리는 파인튜닝 실행이 첫 시간에 예측한 시간 안에 끝납니다. 대화형 작업은 다른 테넌트의 배치 작업이 앞에 없기 때문에 대화형으로 유지됩니다.
항상 모든 VRAM
L40S에서 48GB, RTX 4000 Ada에서 20GB, 하이퍼바이저 파티션용으로 예약되지 않음. 카드가 가진 것이 프로세스가 주소 지정할 수 있는 것입니다.
유휴 상태여도 추가 비용 없음
카드는 초 단위가 아닌 월 단위로 소유합니다. 실험 사이에 3주 동안 모델을 상주시켜도 잠자는 동안 아무도 회수하지 않습니다.
한 호스트에 두 카드
듀얼 카드 등급은 두 장치를 같은 호스트의 같은 NUMA 도메인에 배치합니다. 카드 간 링크가 아닌 PCIe를 통해 통신하므로, 학습 토폴로지를 계획하기 전에 알아야 할 사항입니다.
자체 스택
카드가 들어 있는 머신을 넘겨드리고, 우리는 관여하지 않습니다. 드라이버, 컨테이너 런타임, 프레임워크 버전, 커널은 모두 여러분의 몫입니다. 여러분의 Python에 대해 의견을 갖는 관리 계층은 없습니다.
이 카드들이 적합한 용도
두 카드 모두 트레이닝 클러스터의 최상위가 아닌 워크스테이션급이며, 그에 따른 정직한 포지셔닝이 이어집니다.
추론, 파인튜닝, 렌더링, 배치 수치 작업. 이 순서로.
모델이 사십팔 기가바이트에 맞는다면, L40S는 비용을 지불하는 한 그럭저럭 서빙할 수 있습니다. 맞지 않는다면, 아무리 열정적이어도 맞지 않으며, 다음 정직한 단계는 양자화, 듀얼 카드 티어로의 샤딩, 또는 완전히 다른 등급의 머신입니다.
| 워크로드 | 어떤 카드 | 실제 제약 조건 |
|---|---|---|
| 실사용자에게 양자화 모델 서빙 | RTX 4000 Ada | 메모리, 그리고 요청 동시성 |
| 중간 크기 모델을 전체 정밀도로 서빙 | L40S | 사십팔 기가바이트는 이를 결정짓는 상한선입니다 |
| 어댑터로 파인튜닝 | L40S | 역전파 중 VRAM, 순수 처리량이 아님 |
| 대형 모델 전체 파인튜닝 | L40S 두 개, 또는 다른 곳 | 카드 간 PCIe 대역폭이 한계가 됩니다 |
| 배치 렌더링 및 비디오 인코딩 | 둘 다 | 카드보다 훨씬 자주 디스크와 네트워크가 병목입니다 |
| 배정밀도 수치 시뮬레이션 | 보통 둘 다 아님 | 이들은 배정밀도 부품이 아닙니다. EPYC 코어를 사용하세요 |
이 상품을 구매하지 말아야 하는 분들
GPU 용량은 우리가 파는 어떤 제품보다 낙관적인 사이징을 유발합니다. 세 부류의 사람들은 이 제품군을 지나쳐야 합니다.
일부 고객에게 우리가 잘못된 곳이라고 말하는 것이 가장 유용한 조언일 수 있습니다.
완전히 새로운 거대한 모델을 훈련하는 경우
호스트 간 고대역폭 상호 연결을 통한 다중 노드 훈련은 이것이 아닙니다. 한 호스트에서 PCIe를 통한 두 카드가 우리의 상한선이며, 그렇지 않은 척하는 것은 여러분의 몇 주를 낭비할 것입니다.
초 단위 과금을 원하는 경우
카드는 월 단위로 임대됩니다. 사용량이 정말로 주당 이십 분이라면, 미터링 플랫폼이 우리보다 비용이 덜 들 것이며, 우리는 지금 그렇게 말하는 편이 낫습니다.
모델이 맞지 않는 경우
두 카드에 걸친 구십육 기가바이트가 여기서 주소 지정 가능한 최대치입니다. 주문 전에 가중치, 활성화, 옵티마이저 상태에 대한 메모리 계산을 미리 하십시오. 주문 후가 아니라.
배정밀도가 필요한 경우
이들은 단정밀도 및 혼합 정밀도 부품입니다. FP64 처리량을 요구하는 과학 코드는 두 카드보다 사십팔 개의 EPYC 코어에서 더 빠르게 실행됩니다.
스택 관리가 필요한 경우
드라이버, CUDA 버전 또는 프레임워크 매트릭스를 관리하지 않습니다. 강화 애드온은 운영 체제 베이스라인을 다루며 거기서 끝납니다.
카드를 둘러싼 호스트
굶주린 GPU는 값비싼 전기히터입니다. 호스트는 카드만큼 중요하며, 대부분의 저가 GPU 제공업체가 비용을 줄이는 지점이기도 합니다.
EPYC 9354P, ECC 메모리, 머신 로컬 NVMe, 사십 기가비트 포트.
카드를 공급할 수 있는 코어
티어에 따라 전용 EPYC 코어 8~32개, 카드와 동일한 NUMA 도메인에 고정됩니다. 데이터 로딩과 전처리는 훈련 루프가 멈추는 일반적인 이유이며, 이는 CPU 작업입니다.
호스트의 ECC 메모리
레지스터드 DDR5-4800, 64~256 기가바이트. 48시간 작업은 데이터로더 버퍼의 비트 하나 뒤집힘으로 무산되어서는 안 되는 바로 그런 종류입니다.
속도를 따라가는 NVMe
1~4 테라바이트의 로컬 Gen4 NVMe, 미러링됨. 데이터셋은 다른 사람도 읽고 있는 네트워크 볼륨을 통하지 않고 머신 자체에서 스트리밍됩니다.
40기가비트 포트
멀티 테라바이트 데이터셋을 당겨오는 데 저녁 하나면 충분합니다. 40기가비트 포트의 페어 유즈는 월 250테라바이트이며, 가격 페이지에 게시되어 있습니다.
대역 외 콘솔
인증된 터널을 통한 시리얼 및 VNC, 포함됨. 드라이버 설치가 한밤중에 잘못되어도 머신에 도달할 수 있으며, 그것이 존재하는 이유입니다.
카드는 패스스루되므로 드라이버는 다른 머신과 마찬가지로 인스턴스 내부에 설치됩니다. 호스트는 프레임워크에 접촉하지 않으며, 재부팅 시 아무것도 재협상되지 않습니다.
카드가 있는 곳
암스테르담, 프랑크푸르트, 런던, 뉴욕, 달라스, 로스앤젤레스, 싱가포르, 도쿄. 이들은 정중한 버스트가 아닌 연속적으로 최대 부하로 카드를 실행할 수 있는 전력 밀도와 냉각 성능을 갖춘 층입니다.
6개국 8개 사이트. GPU는 전력과 냉각이 필요하며, 우편번호는 필요하지 않습니다.
프랑크푸르트는 우리가 운영하는 가장 분주한 GPU 층이며 새 카드가 먼저 도착합니다. 달라스는 전력이 저렴하고 층이 넓어 단기 용량을 확보하기 가장 쉬운 곳입니다. 로스앤젤레스는 카드를 보유하지만 재고가 자주 낮아지므로, 아시아로 향하는 서쪽 경로를 구매하려면 일찍 주문하십시오.
이 라인에서는 재고가 실제로 움직입니다. 정오에 사용 가능으로 표시된 카드는 저녁에는 없을 수 있으며, 이번 주에 채울 수 없는 주문을 받는 것보다 정확한 품절 라벨을 보여주는 것이 낫습니다.
| 사이트 | 참고 | 일반적인 용도 |
|---|---|---|
| 암스테르담 | 플릿에서 가장 조밀한 사이트, 모든 것이 먼저 배송됨 | 대륙 대부분에 낮은 지연 시간을 제공하는 유럽 추론 |
| 프랑크푸르트 | 가장 분주한 GPU 층, 새 카드를 먼저 수령 | 용량이 마지막 밀리초보다 중요한 훈련 및 파인튜닝 |
| 런던 | 유럽에서 가장 낮은 대서양 횡단 지연 시간 | 한 곳에서 대서양 양쪽 사용자에게 서비스 제공 |
| 뉴욕 | 동부 해안 앵커, 전체 제품 범위 | 북미 추론 |
| 달라스 | 저렴한 전력, 넓은 층, 가장 쉬운 용량 | 긴 배치 작업 및 가격에 민감한 모든 것 |
| 로스앤젤레스 | 아시아 외 최고의 서쪽 경로 | 북미에서 태평양 연안 서비스 제공 |
| 싱가포르 | 동남아시아의 기본 선택 | 지역 추론 |
| 도쿄 | 지역에서 가장 안정적인 왕복 시간 | 지연 시간에 민감한 일본 및 한국 트래픽 |
긴 작업 및 작업을 잃지 않는 방법
48시간 파인튜닝은 이틀 동안 아무 문제가 없을 것이라는 내기입니다. 내기에서 지는 비용이 주말이 아닌 한 시간이 되도록 작업을 구성하십시오.
체크포인트. 백 번 들어도 다시 말할 것입니다.
- 01
로컬 NVMe에 자주 체크포인트
수백 단계마다 로컬 디스크에 저장하는 것은 충분히 빠르므로 비용이 무시할 수 있습니다. 재개할 수 없는 작업은 결국 두 번 실행하게 될 작업입니다.
- 02
체크포인트를 상자에서 복사
로컬 NVMe는 미러링되지만 불멸은 아닙니다. 노드 외부 백업은 매일 밤 다른 도시에 쓰며, 이것이 이 페이지에서 가장 저렴한 보험입니다.
- 03
드라이버를 건드리기 전에 스냅샷
드라이버 및 프레임워크 업그레이드는 작동하는 환경이 작동하지 않는 환경이 되는 주요 원인입니다. 스냅샷은 생성하는 데 몇 초 걸리고 복원하는 데 몇 초 걸립니다.
- 04
온도와 클록을 보세요. 손실만 보지 마세요.
방이 안 좋은 날이면 카드가 열조절됩니다. 코드를 바꾸지 않았는데 처리량이 떨어지면 데이터로더를 다시 쓰기 전에 클록 수치를 확인하세요.
- 05
수평 확장 전에 물어보세요.
다음 단계가 4개 또는 8개 카드라면 지원팀에 무엇을 하려는지 알려주세요. 때로는 답이 베어메탈 머신이고, 때로는 우리가 적절한 공급업체가 아니라는 답입니다.
하드웨어 장애 시
GPU는 보통 갑자기 죽기보다 점진적으로 성능이 저하됩니다: 클록 하락, 카드의 정정된 메모리 오류, 코드에서는 찾을 수 없는 이유로 작업이 갑자기 3분의 1 느려지는 경우 등입니다.
카드는 디스크와 다르게 실패합니다. 더 느리고, 경고가 더 많습니다.
모니터링은 모든 호스트의 카드 온도, 클록 동작 및 오류 카운터를 감시합니다. 카드가 오작동하기 시작하면 작동이 중지되기 전에 연락드리고, 작업 중간이 아니라 작업 일정에 맞춰 교체를 예약합니다. 카드가 완전히 고장난 경우 인스턴스는 동일한 사이트의 다른 호스트에 볼륨과 주소를 그대로 유지한 채 재구축됩니다.
이 라인의 복구는 다른 곳보다 느립니다. 그 이유를 분명히 말할 가치가 있습니다: 테라바이트 규모의 데이터셋과 상주 모델은 이동하고 다시 로드하는 데 실제로 몇 분이 걸립니다. 15분이 아니라 1시간을 계획하고, 체크포인트를 불타는 기계가 아닌 다른 곳에 저장하세요.
가능한 경우 사전 경고
오류 카운터와 클록 텔레메트리를 지속적으로 읽습니다. 대부분의 카드 교체는 사전에 고객과 협의한 시간대에 이루어집니다.
볼륨과 주소는 유지됩니다.
재구축 시 NVMe 내용과 IP 주소가 그대로 유지됩니다. DNS나 인증서를 변경할 필요가 없습니다.
크레딧은 자동입니다.
계약상 가동 시간 99.99%가 다른 곳과 동일하게 적용되며, 청구서 제출 없이 크레딧이 적립됩니다.
이 제품군에 대한 질문
물리적 장치는 16레인 링크로 인스턴스에 바인딩됩니다. vGPU 분할, 시간 분할, 다른 테넌트가 없습니다. 장치 목록에 카드가 하나 표시되는 이유는 카드가 하나이기 때문입니다.
아니요. 카드는 월 단위이며 최소 약정은 1개월입니다. 워크로드가 정말로 버스트성이라면 종량제 제공업체가 더 저렴할 수 있으며, 이 대화에서 그렇지 않다고 말할 수는 없습니다.
요청하지 않으면 없습니다. 이미지는 깨끗한 상태로 제공되며 드라이버는 인스턴스 내부에 설치됩니다. GPU 고객의 절반은 버전에 대한 강한 의견이 있고 나머지 절반은 자체 드라이버를 포함한 컨테이너를 사용하기 때문입니다.
아니요. 같은 호스트와 같은 NUMA 도메인에 있으며 PCIe로 통신합니다. 적당한 그라디언트 교환을 사용하는 데이터 병렬 작업에는 적합합니다. 고대역폭 카드 간 패브릭을 가정하는 작업에는 적합하지 않으므로 기대치를 조정하세요.
아니요. 패스스루는 PCIe 토폴로지와 전력 예산이 갖춰진 호스트가 필요합니다. 이 라인으로 이동하려면 새 인스턴스와 데이터 복사가 필요합니다.
볼륨은 삭제되고 카드는 풀로 돌아갑니다. 기간이 끝나기 전에 체크포인트를 가져가세요. 취소된 인스턴스는 마음을 바꿀 때까지 어딘가에 대기하는 것이 아니라 실제로 사라집니다.
전체 카드를 사용하세요
먼저 메모리 계산을 확인하고, 용량이 있는 사이트를 선택하고, 코인으로 결제하세요. 루트 액세스는 1분 이내에 제공되며, 드라이버 결정은 사용자의 몫이고, 처음 7일은 사유 없이 환불됩니다.