NVIDIA DGX B200 제품 이미지
NVIDIA · AI 슈퍼컴퓨터

NVIDIA DGX B200

블랙웰 GPU 8장, 1.4TB 메모리 통합 AI 시스템

별도 문의구성·수량에 따라 견적이 달라집니다
GPU 구성Blackwell ×8GPU 메모리1,440GB학습 / 추론72 / 144 PFLOPS호스트Xeon Platinum 8570 ×2전력·폼팩터약 14.3kW / 10RU공급엑스디노드

제품 개요

핵심만 먼저 — 자세한 설명은 아래에서 펼쳐 볼 수 있습니다.

NVIDIA DGX B200은 Blackwell 세대의 8-GPU DGX 노드로, 학습과 파인튜닝, 추론을 한 장비에서 처리하도록 구성된 완제품 AI 시스템입니다. DGX H100의 후속 위치이며, 하드웨어와 소프트웨어 스택을 NVIDIA가 함께 검증해 공급합니다. DGX BasePOD와 DGX SuperPOD의 구성 단위로도 쓰여 단일 노드 도입 이후 동일한 구조로 확장할 수 있습니다. 국내 공급과 도입 지원은 엑스디노드가 담당합니다.

GPU 구성Blackwell ×8NVSwitch 2기, NVLink 14.4TB/s all-to-all
GPU 메모리1,440GBHBM3e, 시스템 합산 대역폭 64TB/s
학습 / 추론72 / 144 PFLOPSFP8 학습, FP4 추론 기준
호스트Xeon Platinum 8570 ×2112코어, 시스템 메모리 2TB(최대 4TB)
전력·폼팩터약 14.3kW / 10RU444×482.2×897.1mm, 동작 온도 5~30°C
공급엑스디노드구성·수량에 따라 가격 별도 문의
개요 전체 읽기

NVIDIA Blackwell GPU 8장을 탑재하며 FP8 기준 학습 72 PFLOPS, FP4 기준 추론 144 PFLOPS를 제공합니다. GPU 간 연결은 NVSwitch 2기를 통해 14.4TB/s의 all-to-all 대역폭으로 구성됩니다. NVIDIA는 DGX H100과 비교해 학습 3배, 추론 15배 수준을 제시하며, 이 수치는 GPT-MoE-1.8T 모델을 기준으로 한 예상치입니다. 실제 처리량은 모델 구조와 배치 설정, 네트워크 구성에 따라 달라집니다.

GPU 메모리는 총 1,440GB이고 HBM3e 메모리 대역폭은 시스템 합산 64TB/s입니다. 호스트는 Intel Xeon Platinum 8570 2소켓 구성으로 총 112코어, 기본 2.1GHz에 최대 4GHz까지 동작하며 시스템 메모리는 2TB 기본에 4TB까지 구성할 수 있습니다. 스케일아웃 네트워크는 OSFP 4포트에 단일 포트 ConnectX-7 VPI 8장으로 최대 400Gb/s를 지원하고, 듀얼포트 BlueField-3 DPU 2장이 최대 400Gb/s를 추가로 담당합니다. 스토리지는 OS용 1.9TB NVMe M.2 2개와 내장 3.84TB NVMe U.2 8개이며, 관리망은 10Gb/s RJ45 온보드 NIC, 100Gb/s 듀얼포트 이더넷 NIC, RJ45 BMC로 나뉩니다.

최대 소비전력은 약 14.3kW이고 10RU 랙마운트 폼팩터입니다. 치수는 높이 444mm, 폭 482.2mm, 길이 897.1mm로 길이가 900mm에 가까워 랙 깊이와 후면 케이블 관리 공간을 함께 확인해야 합니다. 동작 온도 범위는 5~30°C로 상한이 30°C이므로 랙 흡기 온도 관리가 필요합니다. 노드를 여러 대 넣는 경우 랙당 전력 용량과 배기 경로가 실제 집적도를 제한하는 경우가 많으므로 시설 조건을 먼저 확인하는 것이 좋습니다.

학습과 추론을 한 장비에서 함께 돌리고 400Gb/s 스케일아웃 네트워크로 충분한 규모의 조직에 맞습니다. 더 큰 GPU 메모리 풀이나 포트당 800Gb/s ConnectX-8 기반 스케일아웃이 필요하면 DGX B300 쪽이 요구를 더 잘 맞춥니다. 상시 학습 수요 없이 모델 실험과 로컬 추론이 주 용도라면 DGX Spark 같은 데스크톱형 장비로 시작하고 필요할 때 확장하는 편이 비용 부담이 적습니다. 기존 H100 클러스터를 운영 중이라면 GPU 교체와 함께 네트워크 세대와 스토리지 대역폭이 병목이 되지 않는지 함께 검토해야 합니다.

상세 사양

제조사 공식 문서 기준입니다.

가속기 및 성능

GPUNVIDIA Blackwell GPU 8장
총 GPU 메모리1,440GB
GPU 메모리 대역폭64TB/s (HBM3e, 시스템 합산)
학습 성능72 PFLOPS (FP8)
추론 성능144 PFLOPS (FP4)
NVSwitch2기
NVLink 총 대역폭14.4TB/s (all-to-all GPU 대역폭)
세대 간 성능 (NVIDIA 제시)DGX H100 대비 학습 3배, 추론 15배 (GPT-MoE-1.8T 기준 예상치)

호스트 및 스토리지

CPUIntel Xeon Platinum 8570 프로세서 2개 (5세대 Xeon Scalable)
CPU 코어총 112코어
CPU 클럭기본 2.1GHz / 최대 부스트 4GHz
시스템 메모리2TB (최대 4TB 구성 가능)
OS 스토리지1.9TB NVMe M.2 2개
내장 스토리지3.84TB NVMe U.2 8개

네트워킹

스케일아웃 포트OSFP 4포트, 단일 포트 NVIDIA ConnectX-7 VPI 8장
스케일아웃 최대 속도최대 400Gb/s (InfiniBand / 이더넷)
DPU듀얼포트 QSFP112 NVIDIA BlueField-3 DPU 2장
DPU 최대 속도최대 400Gb/s (InfiniBand / 이더넷)
관리 네트워크10Gb/s 온보드 NIC (RJ45)
추가 관리 NIC100Gb/s 듀얼포트 이더넷 NIC
BMCRJ45 호스트 baseboard management controller

전력·물리·소프트웨어

최대 소비전력약 14.3kW
폼팩터10RU 랙마운트
높이17.5in (444mm)
19.0in (482.2mm)
길이35.3in (897.1mm)
동작 온도5°C ~ 30°C (41~86°F)
AI 소프트웨어NVIDIA AI Enterprise
운영·관리NVIDIA Mission Control (NVIDIA Run:ai 기술 포함)
운영체제NVIDIA DGX OS / Ubuntu
지원3년 Enterprise Business-Standard 하드웨어·소프트웨어 지원, 24/7 지원 포털

구성 예시와 활용

실제 도입 문의가 많은 방향입니다.

학습과 추론을 한 장비에서 병행

FP8 학습 72 PFLOPS와 FP4 추론 144 PFLOPS를 한 노드에서 제공해, 개발 단계의 파인튜닝과 서비스용 추론 검증을 같은 환경에서 처리할 수 있습니다. 워크로드 분리는 Mission Control과 Run:ai 기반 스케줄링으로 관리합니다.

DGX H100 클러스터 세대 교체

BasePOD·SuperPOD 구성 단위가 동일해 기존 DGX 기반 운영 체계를 유지한 채 노드를 교체하거나 증설할 수 있습니다. 운영 도구와 소프트웨어 스택이 이어지므로 재교육 부담이 적습니다.

데이터 전처리 비중이 큰 파이프라인

Xeon Platinum 8570 2소켓 112코어와 최대 4TB 시스템 메모리, 내장 3.84TB NVMe U.2 8개로 호스트 측 전처리와 데이터 상주 처리를 함께 감당합니다. BlueField-3 DPU가 스토리지 트래픽을 분리해 GPU 통신 경로와 간섭을 줄입니다.

사내 LLM 서비스 백엔드

1,440GB GPU 메모리와 64TB/s HBM3e 대역폭으로 대형 모델을 단일 노드에 적재해 서비스할 수 있습니다. 온프레미스 운영이 필요해 외부 클라우드로 데이터를 보내기 어려운 환경에 적합합니다.

자주 묻는 질문

구매 담당자가 실제로 묻는 것들입니다.

DGX H100을 쓰고 있는데 B200으로 넘어갈 만합니까?

NVIDIA는 GPT-MoE-1.8T 기준 예상치로 DGX H100 대비 학습 3배, 추론 15배를 제시합니다. 다만 스케일아웃 네트워크는 양쪽 모두 최대 400Gb/s대이므로, 다중 노드 학습에서는 GPU 성능보다 네트워크와 공유 스토리지 대역폭이 먼저 병목이 되는 경우가 있습니다. 현재 클러스터의 병목 지점을 확인한 뒤 노드 교체 범위를 정하는 것이 실효가 큽니다.

기존 랙에 그대로 들어갑니까?

10RU를 차지하고 치수는 높이 444mm, 폭 482.2mm, 길이 897.1mm입니다. 길이가 900mm에 가까워 랙 깊이와 후면 케이블 정리 공간을 함께 확인해야 합니다. 최대 소비전력이 약 14.3kW이므로 랙당 전력 용량과 PDU 구성, 바닥 하중도 같이 검토 대상입니다.

시스템 메모리를 4TB로 올려야 합니까?

기본 2TB에서 4TB까지 구성할 수 있습니다. 데이터 전처리와 로딩을 호스트에서 많이 수행하거나 대용량 데이터셋을 메모리에 상주시키는 파이프라인이라면 4TB 구성이 도움이 됩니다. GPU 연산 위주이고 스토리지에서 스트리밍하는 구조라면 2TB로도 운용되는 경우가 많으므로 워크로드 특성을 알려주시면 함께 판단해 드립니다.

InfiniBand와 이더넷 중 무엇을 선택해야 합니까?

ConnectX-7 VPI와 BlueField-3 DPU 모두 InfiniBand와 이더넷을 지원해 도입 시점에 선택할 수 있습니다. 다중 노드 학습에서 집합 통신 지연이 중요한 구성이면 InfiniBand가, 기존 이더넷 기반 데이터센터 표준을 유지해야 하면 이더넷이 관리 측면에서 유리합니다. 스위치와 케이블링까지 포함한 총 구성으로 비교하는 것이 정확합니다.

DGX B300과 비교하면 어떤 차이가 있습니까?

B300은 GPU가 Blackwell Ultra이고 총 GPU 메모리가 2.1TB, 스케일아웃이 ConnectX-8 기반 포트당 최대 800Gb/s입니다. B200은 GPU 메모리 1,440GB에 ConnectX-7 기반 최대 400Gb/s로, 대신 호스트 시스템 메모리 사양(2TB, 최대 4TB)이 공식 사양표에 명시되어 있어 구성 산정이 명확합니다. 단일 노드 운용 비중이 높고 400Gb/s로 충분하면 B200이 합리적인 선택입니다.

가격은 얼마입니까?

구성, 수량, 시스템 메모리 옵션, 네트워크 장비와 스토리지 포함 범위, 설치 및 유지보수 조건에 따라 달라져 별도 문의로 안내합니다. 도입 대수와 설치 환경을 알려주시면 엑스디노드에서 구성안과 함께 회신드립니다.

함께 검토하는 제품

같은 분류에서 자주 비교됩니다.

NVIDIA

NVIDIA DGX B300

블랙웰 울트라 GPU 8장의 10RU 통합 AI 시스템

별도 문의

NVIDIA

NVIDIA DGX Spark

GB10 그레이스 블랙웰 데스크톱 AI 슈퍼컴퓨터

별도 문의

ASUS

ASUS Ascent GX10

PCIe 5.0 4TB까지 선택되는 GB10 데스크톱

별도 문의

MSI

MSI IPC EdgeXpert MS-C931

1.2kg 산업용 설계의 GB10 데스크톱

별도 문의