NVIDIA RTX PRO 5000 72GB Blackwell 제품 이미지
NVIDIA · GPU

NVIDIA RTX PRO 5000 72GB Blackwell

72GB 단일 GPU, 300W 이중폭 Gen5 카드

별도 문의구성·수량에 따라 견적이 달라집니다
메모리72GB GDDR7 ECCCUDA 코어14,080개연산 성능FP32 65 TFLOPS전력300W폼팩터이중 슬롯 FHFLMIG최대 2분할

제품 개요

핵심만 먼저 — 자세한 설명은 아래에서 펼쳐 볼 수 있습니다.

NVIDIA RTX PRO 5000 72GB Blackwell은 Blackwell 세대 RTX PRO 라인업에서 96GB의 RTX PRO 6000과 48GB의 RTX PRO 5000 사이를 메우는 카드다. 기본 RTX PRO 5000과 GPU 연산 구성은 같고 메모리만 48GB에서 72GB로 늘린 파생 모델로, 2025년 10월자 데이터시트에서 사양이 공개됐다. 단일 카드에 올릴 수 있는 모델·데이터셋 크기를 키우면서 총 보드 전력은 300W에 묶어 둔 것이 이 제품의 성격이다. 워크스테이션과 GPU 확장형 서버 양쪽에 들어가는 이중 슬롯 풀하이트 카드이며, 국내 공급과 구성 문의는 엑스디노드에서 받는다.

메모리72GB GDDR7 ECC384-bit, 1,344GB/s
CUDA 코어14,080개Blackwell, 5세대 텐서·4세대 RT
연산 성능FP32 65 TFLOPSRT 196 TFLOPS, 2,064 AI TOPS
전력300WPCIe CEM5 16핀 1개
폼팩터이중 슬롯 FHFL4.4" x 10.5", 액티브 블로워
MIG최대 2분할36GB x 2 또는 72GB x 1
개요 전체 읽기

연산부는 CUDA 코어 14,080개, 5세대 텐서 코어, 4세대 RT 코어로 구성된다. 부스트 클럭 기준 단정밀도(FP32) 성능은 65 TFLOPS, RT 코어 성능은 196 TFLOPS이며, AI 성능은 FP4·희소성 적용 유효치 기준 2,064 AI TOPS로 표기된다. 5세대 텐서 코어는 FP4 데이터 포맷을 지원해 같은 파라미터를 더 적은 메모리로 적재할 수 있다. 영상 워크로드용으로는 9세대 NVENC 3기와 6세대 NVDEC 3기를 갖추고 4:2:2 색상 포맷 인코딩·디코딩을 처리한다.

메모리는 GDDR7 72GB이며 ECC를 지원하고, 384-bit 인터페이스에서 1,344GB/s 대역폭이 나온다. 48GB 모델과 대역폭·연산 구성은 같고 용량만 1.5배이므로, 실제 차이는 용량이 병목이 되는 구간에서만 드러난다. MIG로 카드를 나눌 수 있어 최대 1x 72GB 또는 2x 36GB 인스턴스 구성이 가능하며, 한 장을 두 사용자·두 작업으로 격리해 배분할 수 있다. 시스템 연결은 PCIe 5.0 x16이고, NVIDIA 공식 사양표에는 NVLink 항목이 없어 다중 GPU 간 통신은 PCIe 경유를 전제로 설계해야 한다. DisplayPort 2.1b 출력 4개가 그대로 있어 서버 전용이 아닌 워크스테이션 겸용 배치도 가능하다.

총 보드 전력은 300W이고 보조 전원은 PCIe CEM5 16핀 커넥터 1개를 사용한다. 데이터시트에는 프로그래머블 파워 항목이 있어 nvidia-smi로 전력 상한을 350W까지 올릴 수 있으며, 이 설정은 드라이버가 다시 로드될 때마다 재적용해야 한다. 냉각은 액티브 방식이고 카드 크기는 높이 4.4인치, 길이 10.5인치, 이중 슬롯 풀하이트다. 섀시 쪽에서는 이중폭 FHFL 슬롯 공간과 16핀 케이블 확보, 카드 전면 흡기가 막히지 않는 배치가 함께 필요하다.

장착 대상 서버는 이중폭 FHFL PCIe Gen5 x16 슬롯을 제공하고 슬롯당 300W 이상을 공급할 수 있는 모델이어야 한다. 엑스디노드가 취급하는 MSI·GIGABYTE·Advantech 서버 중 GPU 확장을 전제로 설계된 기종이 여기에 해당하며, 600W급 RTX PRO 6000을 받도록 설계된 섀시라면 이 카드는 전력과 공간 양쪽에서 여유가 생긴다. 다만 이 카드는 액티브 블로워 방식이라, 패시브 서버 GPU를 전제로 한 고정압 팬 구성과는 궁합을 따로 확인해야 한다. RTX PRO 5000 계열에는 패시브 서버 에디션이 없으므로 랙 밀집 구성에서는 섀시별 지원 목록 확인이 먼저다. 어떤 섀시에 몇 장까지 올릴 수 있는지는 구성마다 달라 엑스디노드로 문의하면 된다.

메모리 용량 때문에 카드 수를 늘려 오던 조직에 맞는다. 70B급 모델을 양자화해 한 장에 올리려는 팀, 대형 씬 전체를 GPU 메모리에 적재해 렌더링하는 팀, 여러 사용자에게 36GB씩 나눠 주려는 팀이 대표적이다. 반대로 GPU 간 통신량이 큰 대규모 분산 학습이라면 NVLink와 HBM을 갖춘 데이터센터 GPU 쪽이 맞고, 이 카드는 PCIe 경유 통신이 상한으로 작용한다. 용량이 48GB로 충분하면 연산 성능이 같은 RTX PRO 5000 48GB가 합리적이고, 96GB가 필요하면 RTX PRO 6000으로 올라가는 편이 낫다. 랙 전력 예산이 200W대로 제한된 경우에는 RTX PRO 4500도 함께 검토 대상이다.

상세 사양

제조사 공식 문서 기준입니다.

메모리

메모리 용량72GB
메모리 종류GDDR7 (ECC 지원)
메모리 인터페이스384-bit
메모리 대역폭1,344GB/s
MIG 인스턴스최대 1x 72GB 또는 2x 36GB

연산

GPU 아키텍처NVIDIA Blackwell
CUDA 코어14,080개
텐서 코어5세대 / 440개 (코어 수는 보드 파트너 사양표 기준)
RT 코어4세대 / 110개 (코어 수는 보드 파트너 사양표 기준)
단정밀도(FP32) 성능65 TFLOPS (부스트 클럭 기준)
RT 코어 성능196 TFLOPS (부스트 클럭 기준)
AI 성능2,064 AI TOPS (FP4·희소성 적용 유효치)
지원 정밀도FP4 지원 명시 (5세대 텐서 코어)

인터페이스·전력

시스템 인터페이스PCIe 5.0 x16
총 보드 전력(TDP)300W
보조 전원 커넥터PCIe CEM5 16핀 1개
전력 상한 조정nvidia-smi로 350W까지 상향 가능(드라이버 재로드 시 재설정 필요)
NVLinkNVIDIA 공식 사양표에 항목 없음 — 다중 GPU는 PCIe 5.0 x16 경유
디스플레이 출력DisplayPort 2.1b 4개

폼팩터

카드 크기4.4인치(H) x 10.5인치(L)
슬롯 폭이중 슬롯(dual slot)
브래킷풀 하이트(full height)
냉각 방식액티브 (블로워 팬)
필요 슬롯이중폭 FHFL PCIe Gen5 x16

디스플레이·영상 엔진·API

디스플레이 커넥터DisplayPort 2.1b 4개
최대 동시 디스플레이4x 4,096x2,160 @120Hz / 4x 5,120x2,880 @60Hz / 2x 7,680x4,320 @60Hz
인코더NVENC 9세대 3기 (4:2:2 지원)
디코더NVDEC 6세대 3기 (4:2:2 지원)
그래픽 APIDirectX 12, Shader Model 6.6, OpenGL 4.6, Vulkan 1.3
컴퓨트 APICUDA 12.8, OpenCL 3.0, DirectCompute

구성 예시와 활용

실제 도입 문의가 많은 방향입니다.

단일 GPU LLM 추론

72GB 단일 주소 공간에 양자화된 70B급 모델과 KV 캐시를 함께 올려 카드 분할 없이 추론 서비스를 구성할 수 있습니다. FP4를 지원하는 5세대 텐서 코어를 사용하면 같은 파라미터를 더 적은 메모리로 적재할 수 있어 컨텍스트 길이나 동시 요청 수에 여유가 생깁니다. GPU 간 통신이 PCIe 경유로 제한되는 구조이므로, 모델을 쪼개지 않아도 되는 단일 카드 추론에 특히 맞습니다.

파인튜닝·모델 개발 워크스테이션

사내 데이터로 중형 모델을 LoRA·QLoRA 방식으로 조정하거나, 배포 전 프롬프트·파이프라인을 반복 검증하는 개발 환경에 적합합니다. 데이터센터 GPU 클러스터를 예약하지 않고 팀 단위로 상시 점유할 수 있어 실험 회전이 빨라집니다. MIG로 36GB씩 두 인스턴스로 나누면 두 명의 연구자가 서로 간섭 없이 같은 카드를 쓸 수 있습니다.

대용량 씬 렌더링·시뮬레이션

지오메트리와 텍스처를 GPU 메모리에 통째로 올려야 하는 대형 3D 씬, 시각화, 물리 시뮬레이션에 씁니다. 4세대 RT 코어 기준 196 TFLOPS의 레이트레이싱 성능과 1,344GB/s 대역폭이 씬 크기가 커질 때의 성능 저하를 완화합니다. DisplayPort 2.1b 4개가 있어 렌더 노드와 작업용 워크스테이션을 겸하는 배치도 가능합니다.

다중 사용자 가상 워크스테이션

MIG로 카드를 두 개의 격리된 36GB 인스턴스로 나눠 사용자·프로젝트별로 자원을 분리해 배분할 수 있습니다. 각 인스턴스가 자체 자원을 갖기 때문에 한 작업의 부하가 다른 작업으로 번지지 않습니다. GPU 한 장을 상시 점유하기에는 부담스러운 소규모 팀이 카드 수를 늘리지 않고 사용자를 늘릴 때 쓰는 방식입니다.

자주 묻는 질문

구매 담당자가 실제로 묻는 것들입니다.

48GB 모델과 실제로 무엇이 다릅니까?

CUDA 코어 14,080개, 384-bit 인터페이스, 1,344GB/s 대역폭, 300W TDP, 이중 슬롯 폼팩터가 모두 동일합니다. 차이는 메모리 용량(48GB→72GB)과 그에 따른 MIG 분할 단위(24GB x 2 → 36GB x 2)뿐입니다. 따라서 연산 성능이 아니라 용량이 병목인 워크로드에서만 이 모델을 선택할 실익이 있습니다.

서버에 장착하려면 어떤 슬롯 조건이 필요합니까?

이중폭 FHFL PCIe Gen5 x16 슬롯과 PCIe CEM5 16핀 보조 전원 케이블 1개가 필요합니다. 카드 길이는 10.5인치이므로 섀시 내부 여유 길이도 확인해야 합니다. 엑스디노드가 취급하는 MSI·GIGABYTE·Advantech GPU 서버 중 어떤 기종이 몇 장을 수용하는지는 구성별로 달라 별도 문의로 확인하시면 됩니다.

NVLink로 두 장을 묶어 메모리를 합칠 수 있습니까?

NVIDIA 공식 데이터시트 사양표에 NVLink 항목이 없습니다. 다중 GPU 구성은 PCIe 5.0 x16 경유 통신을 전제로 설계해야 하며, 두 장을 하나의 144GB 주소 공간으로 합치는 방식은 지원 대상으로 표기되어 있지 않습니다. 카드 간 통신량이 큰 분산 학습이라면 이 점을 먼저 검토하시는 것이 좋습니다.

300W를 넘겨 운용할 수 있습니까?

데이터시트의 프로그래머블 파워 항목에 따라 nvidia-smi로 전력 상한을 350W까지 올릴 수 있습니다. 다만 이 설정은 드라이버가 다시 로드될 때마다 재적용해야 하고, 섀시의 슬롯당 전력·냉각 여유가 확보된 경우에만 의미가 있습니다. 반대로 랙 전력이 빠듯하면 상한을 낮춰 운용하는 방향도 가능합니다.

액티브 냉각인데 랙 서버에 넣어도 됩니까?

이 카드는 블로워 팬을 쓰는 액티브 냉각 제품이고, RTX PRO 5000 계열에는 패시브 서버 에디션이 없습니다. 패시브 GPU를 전제로 고정압 팬을 구성한 섀시에서는 팬 프로파일과 흡기 간섭을 확인해야 합니다. 도입 전 섀시 제조사의 GPU 지원 목록을 대조하시는 편이 안전합니다.

가격은 어떻게 됩니까?

엑스디노드는 GPU 단품, 서버 동시 구성, 수량, 유지보수 조건에 따라 견적이 달라져 전 제품 별도 문의로 안내합니다. 장착 대상 서버 모델과 필요 수량을 알려 주시면 슬롯·전력 검토를 포함한 구성안과 함께 회신드립니다.

함께 검토하는 제품

같은 분류에서 자주 비교됩니다.

NVIDIA

NVIDIA RTX PRO 6000 Blackwell Server Edition

패시브 냉각 96GB 데이터센터 GPU

별도 문의

NVIDIA

NVIDIA RTX PRO 6000 Blackwell Workstation Edition

600W 96GB 워크스테이션 플래그십

별도 문의

NVIDIA

NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition

300W로 낮춘 96GB 다중 장착형

별도 문의

NVIDIA

NVIDIA RTX PRO 5000 Blackwell (48GB)

48GB GDDR7, 1.3TB/s 대역폭 300W 카드

별도 문의