
NVIDIA
NVIDIA RTX PRO 6000 Blackwell Workstation Edition
600W 96GB 워크스테이션 플래그십

패시브 냉각 96GB 데이터센터 GPU
핵심만 먼저 — 자세한 설명은 아래에서 펼쳐 볼 수 있습니다.
NVIDIA RTX PRO 6000 Blackwell Server Edition은 랙마운트 서버에 장착하는 PCIe 폼팩터 데이터센터 GPU다. 같은 계열의 워크스테이션 에디션과 GB202 다이, 96GB GDDR7 메모리 구성을 공유하지만 팬이 없는 패시브 냉각과 서버 집적을 전제로 설계된 점이 다르다. NVIDIA는 이 카드를 추론, 파인튜닝, 분산 렌더링, HPC, 가상 워크스테이션을 한 대의 서버에서 함께 처리하는 범용 데이터센터 GPU로 분류한다. 엑스디노드는 이 GPU를 단품이 아니라 장착 검증된 서버 본체와 묶어 구성한다.
| GPU 메모리 | 96GB GDDR7 ECC — 512-bit, 최대 1,597GB/s |
|---|---|
| 연산 코어 | CUDA 24,064개 — 5세대 Tensor 752개 / 4세대 RT 188개 |
| 저정밀도 성능 | FP4 4 PFLOPS — FP8 2 PFLOPS, FP16/BF16 1 PFLOPS |
| 최대 소비전력 | 최대 600W — 400~600W 구성 가능, 450W 캡 운용 사례 |
| 냉각·폼팩터 | 패시브 듀얼슬롯 — 4.4×10.5in FHFL, 서버 섀시 팬 필수 |
| GPU 분할 | MIG 최대 4분할 — 인스턴스당 24GB, vGPU 소프트웨어 지원 |
Blackwell 아키텍처 기반으로 CUDA 코어 24,064개, 5세대 Tensor 코어 752개, 4세대 RT 코어 188개를 탑재한다. Tensor 연산 성능은 FP4 4 PFLOPS, FP8 2 PFLOPS, FP16/BF16 1 PFLOPS, TF32 234 TFLOPS로 공시되어 있으며 단정밀도(FP32)는 120 TFLOPS다. RT 코어 성능은 355 TFLOPS로, 같은 카드에서 레이트레이싱 렌더링까지 처리할 수 있다. FP4와 FP8을 하드웨어에서 지원하므로 양자화된 LLM 추론에서 메모리 점유와 연산량 양쪽의 이득을 볼 수 있다. 인코딩·디코딩은 9세대 NVENC 4개와 6세대 NVDEC 4개를 갖춰 비디오 파이프라인도 GPU에서 처리된다.
메모리는 96GB GDDR7 ECC, 512-bit 인터페이스에 최대 1,597GB/s 대역폭이다. 워크스테이션 에디션의 1,792GB/s보다 낮게 설정되어 있으므로 대역폭에 민감한 워크로드에서는 이 차이를 계산에 넣어야 한다. MIG로 한 장을 최대 4개의 격리된 인스턴스(각 24GB)로 나눌 수 있어 그래픽과 AI 작업을 동시에 돌리거나 사용자별로 분리 할당하는 운용이 가능하다. 호스트 인터페이스는 PCI Express 5.0 x16이며 NVLink는 지원하지 않으므로 다중 GPU 간 통신은 PCIe 경로를 따르고 메모리는 카드별로 분리된다. DisplayPort 2.1b 출력이 물리적으로 4개 있으나 서버 용도 특성상 기본 비활성 상태로 출고된다.
최대 소비전력은 600W이며 구성에 따라 400~600W 범위로 설정할 수 있다. 팬이 없는 완전 패시브 카드라서 냉각을 서버 섀시 팬이 만드는 풍압에 전적으로 의존한다. 따라서 타워 케이스나 일반 워크스테이션에 그대로 꽂아 쓸 수 없고, GPU 장착이 검증된 랙마운트 서버가 전제 조건이다. 카드를 4장 이상 집적할 때는 카드당 450W 수준으로 전력 상한을 낮춰 섀시의 전력·발열 예산에 맞추는 방식이 실제 서버 제조사 구성 가이드에서 사용된다.
장착 서버는 듀얼 슬롯 폭의 풀하이트·풀렝스(4.4×10.5인치) PCIe Gen5 x16 슬롯을 확보한 모델이어야 한다. 엑스디노드가 취급하는 MSI·GIGABYTE·Advantech 서버 중 GPU 집적형 랙마운트 라인이 대상이며, 카드당 600W를 감당하려면 슬롯 폭뿐 아니라 PSU 용량과 섀시 에어플로 설계를 함께 확인해야 한다. NVIDIA MGX 기반 시스템 기준으로는 4U 공랭 섀시와 6U 액랭 섀시에 최대 8장 구성이 정의되어 있고, 액랭 SKU는 싱글 슬롯 FHXL 폼팩터로 별도 제공된다. 실제 장착 가능 수량은 서버 모델의 라이저 구성, PSU 용량, 상면 전력에 따라 달라지므로 서버와 GPU를 묶어 검토하는 편이 안전하다.
여러 사용자와 여러 종류의 워크로드를 한 서버에 태워야 하는 조직에 맞는다. 추론 서비스와 렌더 팜, 가상 워크스테이션을 각각 다른 장비로 나눠 두던 환경을 MIG와 vGPU로 통합할 때 특히 효율이 난다. 반대로 책상 옆 워크스테이션에서 개인이 쓸 목적이라면 액티브 냉각을 갖춘 워크스테이션 에디션이나 Max-Q 쪽이 맞다. 수백 GB 파라미터를 단일 GPU 메모리에 올려야 하거나 GPU 간 초고속 상호연결이 필수인 대규모 사전학습이라면 HBM과 NVLink를 갖춘 데이터센터 GPU를 검토해야 한다.
제조사 공식 문서 기준입니다.
| 메모리 용량 | 96GB GDDR7 |
|---|---|
| ECC | 지원 |
| 메모리 인터페이스 | 512-bit |
| 메모리 대역폭 | 최대 1,597GB/s |
| MIG 분할 | 최대 4분할 (인스턴스당 24GB) |
| GPU 아키텍처 | NVIDIA Blackwell |
|---|---|
| CUDA 코어 | 24,064개 |
| Tensor 코어 | 752개 (5세대) |
| RT 코어 | 188개 (4세대) |
| FP4 Tensor 성능 | 4 PFLOPS |
| FP8 Tensor 성능 | 2 PFLOPS |
| FP16 / BF16 Tensor 성능 | 1 PFLOPS |
| TF32 Tensor 성능 | 234 TFLOPS |
| 단정밀도(FP32) 성능 | 120 TFLOPS |
| RT 코어 성능 | 355 TFLOPS |
| 인코더 / 디코더 | NVENC 4개(9세대) / NVDEC 4개(6세대) |
| 호스트 인터페이스 | PCI Express 5.0 x16 |
|---|---|
| 최대 소비전력 | 최대 600W (400~600W 구성 가능) |
| 전력 상한 운용 | 450W 캡 설정 시 서버당 4장 구성 사례 있음 |
| NVLink | 미지원 (다중 GPU 통신은 PCIe Gen5 경로) |
| 디스플레이 출력 | DisplayPort 2.1b 4개 (기본 비활성화) |
| 가상화 | NVIDIA vGPU 소프트웨어 지원 |
| 크기 (공랭) | 4.4in(H) × 10.5in(L) |
|---|---|
| 슬롯 폭 (공랭) | 듀얼 슬롯, FHFL (풀하이트·풀렝스) |
| 폼팩터 (액랭) | 싱글 슬롯, FHXL |
| 냉각 방식 | 패시브 (자체 팬 없음, 서버 섀시 팬 의존) |
| 장착 밀도 | NVIDIA MGX 4U/6U 기준 최대 8장 |
실제 도입 문의가 많은 방향입니다.
96GB 단일 메모리 공간에 중형 모델과 KV 캐시를 함께 올릴 수 있고, FP4·FP8을 하드웨어에서 처리하므로 양자화 모델 서빙에 유리하다. MIG로 24GB 인스턴스 4개를 만들어 서로 다른 모델이나 테넌트를 한 카드에서 격리 운용하는 구성도 가능하다.
96GB 메모리 덕분에 LoRA·QLoRA 계열 파인튜닝과 중소 규모 모델의 전체 학습을 단일 카드에서 소화할 수 있다. 다만 NVLink가 없어 GPU 간 통신이 PCIe Gen5에 묶이므로, 노드 내 다중 GPU를 촘촘히 동기화해야 하는 대규모 분산 학습에는 적합도가 떨어진다.
4세대 RT 코어 188개와 355 TFLOPS의 RT 성능으로 오프라인 레이트레이싱 렌더링을 서버에서 배치 처리할 수 있다. NVENC 4개를 활용한 렌더 결과 인코딩까지 같은 카드에서 이어지므로 렌더-인코딩 파이프라인을 한 노드로 묶기 좋다.
vGPU 소프트웨어와 MIG를 조합해 CAD·DCC 작업자 여러 명에게 GPU 자원을 분할 제공할 수 있다. 디스플레이 출력이 기본 비활성인 서버 카드이므로 물리 모니터 없이 원격 세션 기반으로 운용하는 구조에 맞는다.
구매 담당자가 실제로 묻는 것들입니다.
코어 구성(CUDA 24,064개, Tensor 752개, RT 188개)과 96GB GDDR7 용량은 같습니다. 다른 것은 냉각 방식(패시브 대 듀얼 플로우스루), 크기(4.4×10.5인치 대 5.4×12인치), 메모리 대역폭(1,597GB/s 대 1,792GB/s), FP32 성능(120 TFLOPS 대 125 TFLOPS)입니다. 서버 에디션은 디스플레이 출력이 기본 비활성이고 vGPU 소프트웨어 지원이 명시되어 있습니다.
권장하지 않습니다. 자체 팬이 없는 완전 패시브 카드라 서버 섀시 팬의 강제 급기가 있어야 정상 냉각됩니다. 데스크사이드 환경이 목적이라면 액티브 냉각의 워크스테이션 에디션 또는 Max-Q 에디션을 검토하십시오.
NVIDIA MGX 기반 4U·6U 시스템 기준으로 최대 8장 구성이 정의되어 있습니다. 다만 카드당 600W를 유지하면 전력·발열 부담이 커서, 450W로 전력 상한을 낮춰 4장을 넣는 구성 사례도 있습니다. 실제 수량은 서버 모델의 라이저 배치와 PSU 용량에 따라 달라지므로 엑스디노드에서 서버 모델과 함께 확인해 드립니다.
아니요. 이 GPU는 NVLink를 지원하지 않습니다. 다중 GPU 통신은 PCIe Gen5 x16 경로로 이루어지고 메모리는 카드별로 분리됩니다. 단일 주소 공간에 대용량 파라미터를 올려야 한다면 NVLink 기반 데이터센터 GPU를 검토해야 합니다.
MIG로 최대 4개의 완전 격리된 인스턴스(각 24GB)로 분할할 수 있습니다. 각 인스턴스가 전용 자원을 갖기 때문에 그래픽 작업과 AI 작업을 동시에 실행하거나 애플리케이션·사용자 단위로 분리하는 운용이 가능합니다.
구성과 수량, 함께 도입하는 서버 모델에 따라 달라져 별도 문의로 안내합니다. GPU 단품보다 서버 섀시·PSU·냉각 구성까지 함께 검토해야 정확한 견적이 나옵니다.
같은 분류에서 자주 비교됩니다.

NVIDIA
600W 96GB 워크스테이션 플래그십

NVIDIA
300W로 낮춘 96GB 다중 장착형

NVIDIA
72GB 단일 GPU, 300W 이중폭 Gen5 카드

NVIDIA
48GB GDDR7, 1.3TB/s 대역폭 300W 카드