
NVIDIA
NVIDIA DGX B300
블랙웰 울트라 GPU 8장의 10RU 통합 AI 시스템

블랙웰 GPU 8장, 1.4TB 메모리 통합 AI 시스템
핵심만 먼저 — 자세한 설명은 아래에서 펼쳐 볼 수 있습니다.
NVIDIA DGX B200은 Blackwell 세대의 8-GPU DGX 노드로, 학습과 파인튜닝, 추론을 한 장비에서 처리하도록 구성된 완제품 AI 시스템입니다. DGX H100의 후속 위치이며, 하드웨어와 소프트웨어 스택을 NVIDIA가 함께 검증해 공급합니다. DGX BasePOD와 DGX SuperPOD의 구성 단위로도 쓰여 단일 노드 도입 이후 동일한 구조로 확장할 수 있습니다. 국내 공급과 도입 지원은 엑스디노드가 담당합니다.
| GPU 구성 | Blackwell ×8 — NVSwitch 2기, NVLink 14.4TB/s all-to-all |
|---|---|
| GPU 메모리 | 1,440GB — HBM3e, 시스템 합산 대역폭 64TB/s |
| 학습 / 추론 | 72 / 144 PFLOPS — FP8 학습, FP4 추론 기준 |
| 호스트 | Xeon Platinum 8570 ×2 — 112코어, 시스템 메모리 2TB(최대 4TB) |
| 전력·폼팩터 | 약 14.3kW / 10RU — 444×482.2×897.1mm, 동작 온도 5~30°C |
| 공급 | 엑스디노드 — 구성·수량에 따라 가격 별도 문의 |
NVIDIA Blackwell GPU 8장을 탑재하며 FP8 기준 학습 72 PFLOPS, FP4 기준 추론 144 PFLOPS를 제공합니다. GPU 간 연결은 NVSwitch 2기를 통해 14.4TB/s의 all-to-all 대역폭으로 구성됩니다. NVIDIA는 DGX H100과 비교해 학습 3배, 추론 15배 수준을 제시하며, 이 수치는 GPT-MoE-1.8T 모델을 기준으로 한 예상치입니다. 실제 처리량은 모델 구조와 배치 설정, 네트워크 구성에 따라 달라집니다.
GPU 메모리는 총 1,440GB이고 HBM3e 메모리 대역폭은 시스템 합산 64TB/s입니다. 호스트는 Intel Xeon Platinum 8570 2소켓 구성으로 총 112코어, 기본 2.1GHz에 최대 4GHz까지 동작하며 시스템 메모리는 2TB 기본에 4TB까지 구성할 수 있습니다. 스케일아웃 네트워크는 OSFP 4포트에 단일 포트 ConnectX-7 VPI 8장으로 최대 400Gb/s를 지원하고, 듀얼포트 BlueField-3 DPU 2장이 최대 400Gb/s를 추가로 담당합니다. 스토리지는 OS용 1.9TB NVMe M.2 2개와 내장 3.84TB NVMe U.2 8개이며, 관리망은 10Gb/s RJ45 온보드 NIC, 100Gb/s 듀얼포트 이더넷 NIC, RJ45 BMC로 나뉩니다.
최대 소비전력은 약 14.3kW이고 10RU 랙마운트 폼팩터입니다. 치수는 높이 444mm, 폭 482.2mm, 길이 897.1mm로 길이가 900mm에 가까워 랙 깊이와 후면 케이블 관리 공간을 함께 확인해야 합니다. 동작 온도 범위는 5~30°C로 상한이 30°C이므로 랙 흡기 온도 관리가 필요합니다. 노드를 여러 대 넣는 경우 랙당 전력 용량과 배기 경로가 실제 집적도를 제한하는 경우가 많으므로 시설 조건을 먼저 확인하는 것이 좋습니다.
학습과 추론을 한 장비에서 함께 돌리고 400Gb/s 스케일아웃 네트워크로 충분한 규모의 조직에 맞습니다. 더 큰 GPU 메모리 풀이나 포트당 800Gb/s ConnectX-8 기반 스케일아웃이 필요하면 DGX B300 쪽이 요구를 더 잘 맞춥니다. 상시 학습 수요 없이 모델 실험과 로컬 추론이 주 용도라면 DGX Spark 같은 데스크톱형 장비로 시작하고 필요할 때 확장하는 편이 비용 부담이 적습니다. 기존 H100 클러스터를 운영 중이라면 GPU 교체와 함께 네트워크 세대와 스토리지 대역폭이 병목이 되지 않는지 함께 검토해야 합니다.
제조사 공식 문서 기준입니다.
| GPU | NVIDIA Blackwell GPU 8장 |
|---|---|
| 총 GPU 메모리 | 1,440GB |
| GPU 메모리 대역폭 | 64TB/s (HBM3e, 시스템 합산) |
| 학습 성능 | 72 PFLOPS (FP8) |
| 추론 성능 | 144 PFLOPS (FP4) |
| NVSwitch | 2기 |
| NVLink 총 대역폭 | 14.4TB/s (all-to-all GPU 대역폭) |
| 세대 간 성능 (NVIDIA 제시) | DGX H100 대비 학습 3배, 추론 15배 (GPT-MoE-1.8T 기준 예상치) |
| CPU | Intel Xeon Platinum 8570 프로세서 2개 (5세대 Xeon Scalable) |
|---|---|
| CPU 코어 | 총 112코어 |
| CPU 클럭 | 기본 2.1GHz / 최대 부스트 4GHz |
| 시스템 메모리 | 2TB (최대 4TB 구성 가능) |
| OS 스토리지 | 1.9TB NVMe M.2 2개 |
| 내장 스토리지 | 3.84TB NVMe U.2 8개 |
| 스케일아웃 포트 | OSFP 4포트, 단일 포트 NVIDIA ConnectX-7 VPI 8장 |
|---|---|
| 스케일아웃 최대 속도 | 최대 400Gb/s (InfiniBand / 이더넷) |
| DPU | 듀얼포트 QSFP112 NVIDIA BlueField-3 DPU 2장 |
| DPU 최대 속도 | 최대 400Gb/s (InfiniBand / 이더넷) |
| 관리 네트워크 | 10Gb/s 온보드 NIC (RJ45) |
| 추가 관리 NIC | 100Gb/s 듀얼포트 이더넷 NIC |
| BMC | RJ45 호스트 baseboard management controller |
| 최대 소비전력 | 약 14.3kW |
|---|---|
| 폼팩터 | 10RU 랙마운트 |
| 높이 | 17.5in (444mm) |
| 폭 | 19.0in (482.2mm) |
| 길이 | 35.3in (897.1mm) |
| 동작 온도 | 5°C ~ 30°C (41~86°F) |
| AI 소프트웨어 | NVIDIA AI Enterprise |
| 운영·관리 | NVIDIA Mission Control (NVIDIA Run:ai 기술 포함) |
| 운영체제 | NVIDIA DGX OS / Ubuntu |
| 지원 | 3년 Enterprise Business-Standard 하드웨어·소프트웨어 지원, 24/7 지원 포털 |
실제 도입 문의가 많은 방향입니다.
FP8 학습 72 PFLOPS와 FP4 추론 144 PFLOPS를 한 노드에서 제공해, 개발 단계의 파인튜닝과 서비스용 추론 검증을 같은 환경에서 처리할 수 있습니다. 워크로드 분리는 Mission Control과 Run:ai 기반 스케줄링으로 관리합니다.
BasePOD·SuperPOD 구성 단위가 동일해 기존 DGX 기반 운영 체계를 유지한 채 노드를 교체하거나 증설할 수 있습니다. 운영 도구와 소프트웨어 스택이 이어지므로 재교육 부담이 적습니다.
Xeon Platinum 8570 2소켓 112코어와 최대 4TB 시스템 메모리, 내장 3.84TB NVMe U.2 8개로 호스트 측 전처리와 데이터 상주 처리를 함께 감당합니다. BlueField-3 DPU가 스토리지 트래픽을 분리해 GPU 통신 경로와 간섭을 줄입니다.
1,440GB GPU 메모리와 64TB/s HBM3e 대역폭으로 대형 모델을 단일 노드에 적재해 서비스할 수 있습니다. 온프레미스 운영이 필요해 외부 클라우드로 데이터를 보내기 어려운 환경에 적합합니다.
구매 담당자가 실제로 묻는 것들입니다.
NVIDIA는 GPT-MoE-1.8T 기준 예상치로 DGX H100 대비 학습 3배, 추론 15배를 제시합니다. 다만 스케일아웃 네트워크는 양쪽 모두 최대 400Gb/s대이므로, 다중 노드 학습에서는 GPU 성능보다 네트워크와 공유 스토리지 대역폭이 먼저 병목이 되는 경우가 있습니다. 현재 클러스터의 병목 지점을 확인한 뒤 노드 교체 범위를 정하는 것이 실효가 큽니다.
10RU를 차지하고 치수는 높이 444mm, 폭 482.2mm, 길이 897.1mm입니다. 길이가 900mm에 가까워 랙 깊이와 후면 케이블 정리 공간을 함께 확인해야 합니다. 최대 소비전력이 약 14.3kW이므로 랙당 전력 용량과 PDU 구성, 바닥 하중도 같이 검토 대상입니다.
기본 2TB에서 4TB까지 구성할 수 있습니다. 데이터 전처리와 로딩을 호스트에서 많이 수행하거나 대용량 데이터셋을 메모리에 상주시키는 파이프라인이라면 4TB 구성이 도움이 됩니다. GPU 연산 위주이고 스토리지에서 스트리밍하는 구조라면 2TB로도 운용되는 경우가 많으므로 워크로드 특성을 알려주시면 함께 판단해 드립니다.
ConnectX-7 VPI와 BlueField-3 DPU 모두 InfiniBand와 이더넷을 지원해 도입 시점에 선택할 수 있습니다. 다중 노드 학습에서 집합 통신 지연이 중요한 구성이면 InfiniBand가, 기존 이더넷 기반 데이터센터 표준을 유지해야 하면 이더넷이 관리 측면에서 유리합니다. 스위치와 케이블링까지 포함한 총 구성으로 비교하는 것이 정확합니다.
B300은 GPU가 Blackwell Ultra이고 총 GPU 메모리가 2.1TB, 스케일아웃이 ConnectX-8 기반 포트당 최대 800Gb/s입니다. B200은 GPU 메모리 1,440GB에 ConnectX-7 기반 최대 400Gb/s로, 대신 호스트 시스템 메모리 사양(2TB, 최대 4TB)이 공식 사양표에 명시되어 있어 구성 산정이 명확합니다. 단일 노드 운용 비중이 높고 400Gb/s로 충분하면 B200이 합리적인 선택입니다.
구성, 수량, 시스템 메모리 옵션, 네트워크 장비와 스토리지 포함 범위, 설치 및 유지보수 조건에 따라 달라져 별도 문의로 안내합니다. 도입 대수와 설치 환경을 알려주시면 엑스디노드에서 구성안과 함께 회신드립니다.
같은 분류에서 자주 비교됩니다.