
NVIDIA
NVIDIA RTX PRO 6000 Blackwell Server Edition
패시브 냉각 96GB 데이터센터 GPU

72GB 단일 GPU, 300W 이중폭 Gen5 카드
핵심만 먼저 — 자세한 설명은 아래에서 펼쳐 볼 수 있습니다.
NVIDIA RTX PRO 5000 72GB Blackwell은 Blackwell 세대 RTX PRO 라인업에서 96GB의 RTX PRO 6000과 48GB의 RTX PRO 5000 사이를 메우는 카드다. 기본 RTX PRO 5000과 GPU 연산 구성은 같고 메모리만 48GB에서 72GB로 늘린 파생 모델로, 2025년 10월자 데이터시트에서 사양이 공개됐다. 단일 카드에 올릴 수 있는 모델·데이터셋 크기를 키우면서 총 보드 전력은 300W에 묶어 둔 것이 이 제품의 성격이다. 워크스테이션과 GPU 확장형 서버 양쪽에 들어가는 이중 슬롯 풀하이트 카드이며, 국내 공급과 구성 문의는 엑스디노드에서 받는다.
| 메모리 | 72GB GDDR7 ECC — 384-bit, 1,344GB/s |
|---|---|
| CUDA 코어 | 14,080개 — Blackwell, 5세대 텐서·4세대 RT |
| 연산 성능 | FP32 65 TFLOPS — RT 196 TFLOPS, 2,064 AI TOPS |
| 전력 | 300W — PCIe CEM5 16핀 1개 |
| 폼팩터 | 이중 슬롯 FHFL — 4.4" x 10.5", 액티브 블로워 |
| MIG | 최대 2분할 — 36GB x 2 또는 72GB x 1 |
연산부는 CUDA 코어 14,080개, 5세대 텐서 코어, 4세대 RT 코어로 구성된다. 부스트 클럭 기준 단정밀도(FP32) 성능은 65 TFLOPS, RT 코어 성능은 196 TFLOPS이며, AI 성능은 FP4·희소성 적용 유효치 기준 2,064 AI TOPS로 표기된다. 5세대 텐서 코어는 FP4 데이터 포맷을 지원해 같은 파라미터를 더 적은 메모리로 적재할 수 있다. 영상 워크로드용으로는 9세대 NVENC 3기와 6세대 NVDEC 3기를 갖추고 4:2:2 색상 포맷 인코딩·디코딩을 처리한다.
메모리는 GDDR7 72GB이며 ECC를 지원하고, 384-bit 인터페이스에서 1,344GB/s 대역폭이 나온다. 48GB 모델과 대역폭·연산 구성은 같고 용량만 1.5배이므로, 실제 차이는 용량이 병목이 되는 구간에서만 드러난다. MIG로 카드를 나눌 수 있어 최대 1x 72GB 또는 2x 36GB 인스턴스 구성이 가능하며, 한 장을 두 사용자·두 작업으로 격리해 배분할 수 있다. 시스템 연결은 PCIe 5.0 x16이고, NVIDIA 공식 사양표에는 NVLink 항목이 없어 다중 GPU 간 통신은 PCIe 경유를 전제로 설계해야 한다. DisplayPort 2.1b 출력 4개가 그대로 있어 서버 전용이 아닌 워크스테이션 겸용 배치도 가능하다.
총 보드 전력은 300W이고 보조 전원은 PCIe CEM5 16핀 커넥터 1개를 사용한다. 데이터시트에는 프로그래머블 파워 항목이 있어 nvidia-smi로 전력 상한을 350W까지 올릴 수 있으며, 이 설정은 드라이버가 다시 로드될 때마다 재적용해야 한다. 냉각은 액티브 방식이고 카드 크기는 높이 4.4인치, 길이 10.5인치, 이중 슬롯 풀하이트다. 섀시 쪽에서는 이중폭 FHFL 슬롯 공간과 16핀 케이블 확보, 카드 전면 흡기가 막히지 않는 배치가 함께 필요하다.
장착 대상 서버는 이중폭 FHFL PCIe Gen5 x16 슬롯을 제공하고 슬롯당 300W 이상을 공급할 수 있는 모델이어야 한다. 엑스디노드가 취급하는 MSI·GIGABYTE·Advantech 서버 중 GPU 확장을 전제로 설계된 기종이 여기에 해당하며, 600W급 RTX PRO 6000을 받도록 설계된 섀시라면 이 카드는 전력과 공간 양쪽에서 여유가 생긴다. 다만 이 카드는 액티브 블로워 방식이라, 패시브 서버 GPU를 전제로 한 고정압 팬 구성과는 궁합을 따로 확인해야 한다. RTX PRO 5000 계열에는 패시브 서버 에디션이 없으므로 랙 밀집 구성에서는 섀시별 지원 목록 확인이 먼저다. 어떤 섀시에 몇 장까지 올릴 수 있는지는 구성마다 달라 엑스디노드로 문의하면 된다.
메모리 용량 때문에 카드 수를 늘려 오던 조직에 맞는다. 70B급 모델을 양자화해 한 장에 올리려는 팀, 대형 씬 전체를 GPU 메모리에 적재해 렌더링하는 팀, 여러 사용자에게 36GB씩 나눠 주려는 팀이 대표적이다. 반대로 GPU 간 통신량이 큰 대규모 분산 학습이라면 NVLink와 HBM을 갖춘 데이터센터 GPU 쪽이 맞고, 이 카드는 PCIe 경유 통신이 상한으로 작용한다. 용량이 48GB로 충분하면 연산 성능이 같은 RTX PRO 5000 48GB가 합리적이고, 96GB가 필요하면 RTX PRO 6000으로 올라가는 편이 낫다. 랙 전력 예산이 200W대로 제한된 경우에는 RTX PRO 4500도 함께 검토 대상이다.
제조사 공식 문서 기준입니다.
| 메모리 용량 | 72GB |
|---|---|
| 메모리 종류 | GDDR7 (ECC 지원) |
| 메모리 인터페이스 | 384-bit |
| 메모리 대역폭 | 1,344GB/s |
| MIG 인스턴스 | 최대 1x 72GB 또는 2x 36GB |
| GPU 아키텍처 | NVIDIA Blackwell |
|---|---|
| CUDA 코어 | 14,080개 |
| 텐서 코어 | 5세대 / 440개 (코어 수는 보드 파트너 사양표 기준) |
| RT 코어 | 4세대 / 110개 (코어 수는 보드 파트너 사양표 기준) |
| 단정밀도(FP32) 성능 | 65 TFLOPS (부스트 클럭 기준) |
| RT 코어 성능 | 196 TFLOPS (부스트 클럭 기준) |
| AI 성능 | 2,064 AI TOPS (FP4·희소성 적용 유효치) |
| 지원 정밀도 | FP4 지원 명시 (5세대 텐서 코어) |
| 시스템 인터페이스 | PCIe 5.0 x16 |
|---|---|
| 총 보드 전력(TDP) | 300W |
| 보조 전원 커넥터 | PCIe CEM5 16핀 1개 |
| 전력 상한 조정 | nvidia-smi로 350W까지 상향 가능(드라이버 재로드 시 재설정 필요) |
| NVLink | NVIDIA 공식 사양표에 항목 없음 — 다중 GPU는 PCIe 5.0 x16 경유 |
| 디스플레이 출력 | DisplayPort 2.1b 4개 |
| 카드 크기 | 4.4인치(H) x 10.5인치(L) |
|---|---|
| 슬롯 폭 | 이중 슬롯(dual slot) |
| 브래킷 | 풀 하이트(full height) |
| 냉각 방식 | 액티브 (블로워 팬) |
| 필요 슬롯 | 이중폭 FHFL PCIe Gen5 x16 |
| 디스플레이 커넥터 | DisplayPort 2.1b 4개 |
|---|---|
| 최대 동시 디스플레이 | 4x 4,096x2,160 @120Hz / 4x 5,120x2,880 @60Hz / 2x 7,680x4,320 @60Hz |
| 인코더 | NVENC 9세대 3기 (4:2:2 지원) |
| 디코더 | NVDEC 6세대 3기 (4:2:2 지원) |
| 그래픽 API | DirectX 12, Shader Model 6.6, OpenGL 4.6, Vulkan 1.3 |
| 컴퓨트 API | CUDA 12.8, OpenCL 3.0, DirectCompute |
실제 도입 문의가 많은 방향입니다.
72GB 단일 주소 공간에 양자화된 70B급 모델과 KV 캐시를 함께 올려 카드 분할 없이 추론 서비스를 구성할 수 있습니다. FP4를 지원하는 5세대 텐서 코어를 사용하면 같은 파라미터를 더 적은 메모리로 적재할 수 있어 컨텍스트 길이나 동시 요청 수에 여유가 생깁니다. GPU 간 통신이 PCIe 경유로 제한되는 구조이므로, 모델을 쪼개지 않아도 되는 단일 카드 추론에 특히 맞습니다.
사내 데이터로 중형 모델을 LoRA·QLoRA 방식으로 조정하거나, 배포 전 프롬프트·파이프라인을 반복 검증하는 개발 환경에 적합합니다. 데이터센터 GPU 클러스터를 예약하지 않고 팀 단위로 상시 점유할 수 있어 실험 회전이 빨라집니다. MIG로 36GB씩 두 인스턴스로 나누면 두 명의 연구자가 서로 간섭 없이 같은 카드를 쓸 수 있습니다.
지오메트리와 텍스처를 GPU 메모리에 통째로 올려야 하는 대형 3D 씬, 시각화, 물리 시뮬레이션에 씁니다. 4세대 RT 코어 기준 196 TFLOPS의 레이트레이싱 성능과 1,344GB/s 대역폭이 씬 크기가 커질 때의 성능 저하를 완화합니다. DisplayPort 2.1b 4개가 있어 렌더 노드와 작업용 워크스테이션을 겸하는 배치도 가능합니다.
MIG로 카드를 두 개의 격리된 36GB 인스턴스로 나눠 사용자·프로젝트별로 자원을 분리해 배분할 수 있습니다. 각 인스턴스가 자체 자원을 갖기 때문에 한 작업의 부하가 다른 작업으로 번지지 않습니다. GPU 한 장을 상시 점유하기에는 부담스러운 소규모 팀이 카드 수를 늘리지 않고 사용자를 늘릴 때 쓰는 방식입니다.
구매 담당자가 실제로 묻는 것들입니다.
CUDA 코어 14,080개, 384-bit 인터페이스, 1,344GB/s 대역폭, 300W TDP, 이중 슬롯 폼팩터가 모두 동일합니다. 차이는 메모리 용량(48GB→72GB)과 그에 따른 MIG 분할 단위(24GB x 2 → 36GB x 2)뿐입니다. 따라서 연산 성능이 아니라 용량이 병목인 워크로드에서만 이 모델을 선택할 실익이 있습니다.
이중폭 FHFL PCIe Gen5 x16 슬롯과 PCIe CEM5 16핀 보조 전원 케이블 1개가 필요합니다. 카드 길이는 10.5인치이므로 섀시 내부 여유 길이도 확인해야 합니다. 엑스디노드가 취급하는 MSI·GIGABYTE·Advantech GPU 서버 중 어떤 기종이 몇 장을 수용하는지는 구성별로 달라 별도 문의로 확인하시면 됩니다.
NVIDIA 공식 데이터시트 사양표에 NVLink 항목이 없습니다. 다중 GPU 구성은 PCIe 5.0 x16 경유 통신을 전제로 설계해야 하며, 두 장을 하나의 144GB 주소 공간으로 합치는 방식은 지원 대상으로 표기되어 있지 않습니다. 카드 간 통신량이 큰 분산 학습이라면 이 점을 먼저 검토하시는 것이 좋습니다.
데이터시트의 프로그래머블 파워 항목에 따라 nvidia-smi로 전력 상한을 350W까지 올릴 수 있습니다. 다만 이 설정은 드라이버가 다시 로드될 때마다 재적용해야 하고, 섀시의 슬롯당 전력·냉각 여유가 확보된 경우에만 의미가 있습니다. 반대로 랙 전력이 빠듯하면 상한을 낮춰 운용하는 방향도 가능합니다.
이 카드는 블로워 팬을 쓰는 액티브 냉각 제품이고, RTX PRO 5000 계열에는 패시브 서버 에디션이 없습니다. 패시브 GPU를 전제로 고정압 팬을 구성한 섀시에서는 팬 프로파일과 흡기 간섭을 확인해야 합니다. 도입 전 섀시 제조사의 GPU 지원 목록을 대조하시는 편이 안전합니다.
엑스디노드는 GPU 단품, 서버 동시 구성, 수량, 유지보수 조건에 따라 견적이 달라져 전 제품 별도 문의로 안내합니다. 장착 대상 서버 모델과 필요 수량을 알려 주시면 슬롯·전력 검토를 포함한 구성안과 함께 회신드립니다.
같은 분류에서 자주 비교됩니다.

NVIDIA
패시브 냉각 96GB 데이터센터 GPU

NVIDIA
600W 96GB 워크스테이션 플래그십

NVIDIA
300W로 낮춘 96GB 다중 장착형

NVIDIA
48GB GDDR7, 1.3TB/s 대역폭 300W 카드