
NVIDIA
NVIDIA RTX PRO 6000 Blackwell Server Edition
패시브 냉각 96GB 데이터센터 GPU

32GB ECC 메모리, 250W 듀얼슬롯 Ada 중상위
핵심만 먼저 — 자세한 설명은 아래에서 펼쳐 볼 수 있습니다.
NVIDIA RTX 5000 Ada Generation은 Ada Lovelace 아키텍처 프로페셔널 라인업에서 최상위 RTX 6000 Ada 바로 아래에 위치하는 모델입니다. 32GB GDDR6 ECC 메모리에 총 보드 전력 250W라는 조합으로, 48GB까지는 필요 없지만 24GB로는 부족한 구간의 워크로드를 겨냥합니다. NVIDIA는 이 제품을 생성형 AI와 렌더링, 설계·해석을 함께 다루는 프로페셔널 워크플로용으로 포지셔닝하고 있으며, 주요 ISV 인증과 워크스테이션 제조사 검증을 거칩니다. 엑스디노드는 서버·워크스테이션 구성 부품으로 이 카드를 공급합니다.
| 메모리 | 32GB GDDR6 ECC — 256-bit / 576GB/s. 24GB와 48GB 사이 구간 |
|---|---|
| 연산 코어 | CUDA 12,800 / Tensor 400 — 3세대 RT 코어 100개, FP32 65.3 TFLOPS |
| 전력 | 250W (TBP) — RTX 6000 Ada 대비 카드당 50W 낮음 |
| 폼팩터 | 듀얼 슬롯 — 10.5in(266.7mm) 길이, 액티브 냉각 |
| 인터페이스 | PCIe 4.0 x16 — Gen5 슬롯 하위 호환 장착 가능 |
| 미디어 엔진 | 인코드 2 / 디코드 2 — AV1 인코드·디코드 지원 |
연산 자원은 Ada Lovelace 기반 CUDA 코어 12,800개, 4세대 Tensor 코어 400개, 3세대 RT 코어 100개입니다. 공식 데이터시트 기준 단정밀도(FP32)는 65.3 TFLOPS, RT 코어 성능은 151.0 TFLOPS, Tensor 성능은 1,044.4 TFLOPS입니다. 앞의 두 값은 GPU Boost 클럭 기준 피크값이고 Tensor 수치는 FP8에 희소성을 적용한 실효 성능이므로, 실제 워크로드 성능은 애플리케이션에 따라 달라집니다. 4세대 Tensor 코어는 학습용 BF16·FP16·TF32·FP32와 추론용 FP8·INT8을 지원하며, FP4는 Ada 세대가 아닌 Blackwell 세대 형식이라 지원하지 않습니다.
메모리는 256-bit 인터페이스에 576GB/s 대역폭이며 ECC를 지원합니다. RTX 6000 Ada 대비 용량은 3분의 2, 대역폭은 60% 수준이므로 메모리 용량과 대역폭이 곧 처리량이 되는 작업에서는 차이가 그대로 드러납니다. 반대로 32GB 안에서 끝나는 작업이라면 250W라는 낮은 전력 덕분에 같은 섀시에 더 많은 카드를 넣거나 전원 여유를 확보하기 쉽습니다. 시스템 인터페이스는 PCIe 4.0 x16이며 Gen5 슬롯에도 하위 호환으로 장착됩니다. NVLink는 지원하지 않으므로 여러 장을 꽂아도 카드당 32GB가 상한입니다.
총 보드 전력은 250W, 냉각 방식은 액티브입니다. NVIDIA 공식 전력 가이드라인 문서(DA-07261-001)에도 RTX 5000 Ada Generation이 250W / CEM5 16-pin으로 등재돼 있어 보조 전원은 16-pin 커넥터를 사용합니다. 다만 같은 문서에서 NVIDIA는 보조 전원 입력이 카드 전체 TGP로 규정된 제품의 경우 250W를 PCIe 8-pin 1개로 감당할 수 없다고 명시하고 있으므로, 8-pin 1개를 16-pin으로 변환하는 150W급 어댑터는 사용할 수 없습니다. 물리 규격은 4.4인치(약 111.8mm) 높이에 10.5인치(약 266.7mm) 길이의 듀얼 슬롯 카드입니다.
서버 장착 조건은 듀얼 슬롯 PCIe x16 슬롯 확보와 CEM5 16-pin 250W 급전, 그리고 266.7mm 길이를 수용하는 GPU 영역입니다. 엑스디노드가 취급하는 MSI·GIGABYTE·Advantech 서버 중 이 조건을 만족하고 액티브 냉각 카드를 허용하는 모델이 대상이 됩니다. 250W는 300W인 RTX 6000 Ada보다 카드당 50W 낮아, 4장 장착 시 GPU 합산 전력에서 200W의 여유가 생기므로 PSU 용량이 빠듯한 구성에서 선택 폭이 넓어집니다. NVIDIA 전력 가이드라인상 600W급인 RTX 6000 Blackwell 같은 카드가 요구하는 대형 전원·슬롯 설계는 필요하지 않습니다. 액티브 냉각 카드를 밀집 배치할 때는 섀시의 흡기 온도 사양과 카드 간 간격을 확인해야 하며, 최종 지원 여부는 서버 모델별 GPU 지원 목록 기준입니다.
32GB 범위의 모델 추론과 파인튜닝, 프로덕션 렌더링, 설계·해석 작업을 함께 돌리는 팀에 균형이 맞는 선택입니다. 카드 수를 늘려 동시 처리량을 확보하려는 구성에서도 250W라는 전력이 유리하게 작용합니다. 반대로 단일 작업이 32GB를 넘어서 메모리에서 먼저 막힌다면 48GB인 RTX 6000 Ada로 올라가는 편이 카드 수를 늘리는 것보다 효과적이고, GPU 간 메모리 풀링이 필요한 대규모 분산 학습이라면 NVLink를 지원하는 데이터센터 가속기가 맞습니다. 워크로드가 24GB 안에서 끝나고 대수와 전력 효율이 더 중요하다면 하위 RTX 4500 Ada를 검토할 수 있습니다.
제조사 공식 문서 기준입니다.
| 메모리 용량 | 32GB GDDR6 |
|---|---|
| 메모리 인터페이스 | 256-bit |
| 메모리 대역폭 | 576 GB/s |
| ECC(오류 정정 코드) | 지원 |
| 아키텍처 | NVIDIA Ada Lovelace |
|---|---|
| CUDA 코어 | 12,800개 |
| Tensor 코어 | 400개 (4세대) |
| RT 코어 | 100개 (3세대) |
| 단정밀도(FP32) 성능 | 65.3 TFLOPS (GPU Boost 클럭 기준 피크) |
| RT 코어 성능 | 151.0 TFLOPS (피크) |
| Tensor 성능 | 1,044.4 TFLOPS (FP8, 희소성 적용 실효치) |
| 지원 정밀도 | FP8 / FP16 / BF16 / TF32 / FP32 / INT8 (FP4 미지원) |
| 컴퓨트 API | CUDA 12.2, OpenCL 3.0, DirectCompute |
| 시스템 인터페이스 | PCIe 4.0 x16 |
|---|---|
| 총 보드 전력(TBP) | 250 W |
| 보조 전원 커넥터 | PCIe CEM5 16-pin (NVIDIA 전력 가이드라인 기준) |
| 냉각 방식 | 액티브(Active) |
| NVLink | 미지원 |
| 카드 크기 | 4.4in(H) x 10.5in(L) / 약 111.8mm x 266.7mm |
|---|---|
| 슬롯 폭 | 듀얼 슬롯(2슬롯) |
| 냉각 구조 | 액티브 냉각 카드 |
| 디스플레이 출력 | DisplayPort 1.4a 4개 |
|---|---|
| 최대 동시 디스플레이 | 4x 4096x2160@120Hz / 4x 5120x2880@60Hz / 2x 7680x4320@60Hz |
| 인코더·디코더 | 인코드 2개, 디코드 2개 (AV1 인코드·디코드 포함) |
| 그래픽 API | DirectX 12, Shader Model 6.7, OpenGL 4.6, Vulkan 1.3 |
| vGPU 소프트웨어 | NVIDIA vPC/vApps, NVIDIA RTX Virtual Workstation |
| 기타 지원 | GPUDirect for Video, GPUDirect RDMA, Quadro Sync II 호환, HDCP 2.2, Mosaic |
| VR Ready | 지원 |
실제 도입 문의가 많은 방향입니다.
32GB ECC 메모리와 FP8을 가속하는 4세대 Tensor 코어로, 카드 한 장 메모리 안에서 처리되는 규모의 모델을 사내 서버에 올려 추론 서비스로 운용하거나 파인튜닝하는 용도에 적합합니다. 250W라는 전력 덕분에 같은 섀시에 여러 장을 넣어 동시 요청 처리량을 늘리는 구성도 잡기 쉽습니다. NVLink가 없으므로 32GB를 넘는 단일 모델은 분할 배치가 필요합니다.
3세대 RT 코어 100개와 151.0 TFLOPS의 RT 성능으로 레이트레이싱 기반 렌더링 작업을 처리합니다. 인코더 2개·디코더 2개와 AV1 인코드·디코드를 지원해 고해상도 영상 입출력이 포함된 파이프라인에도 대응합니다. 32GB 메모리로 텍스처와 지오메트리가 많은 씬을 GPU 메모리에 유지한 채 작업할 수 있습니다.
설계 뷰포트 조작과 해석 계산을 하루 종일 돌리는 환경에서, ECC 지원과 ISV 인증 드라이버가 결과 신뢰성과 안정성을 뒷받침합니다. 65.3 TFLOPS의 FP32 성능으로 GPU 가속을 지원하는 해석 솔버의 처리 시간을 단축할 수 있습니다. 부품 수가 많은 어셈블리를 다룰 때 32GB 용량이 뷰포트 응답성 유지에 도움이 됩니다.
NVIDIA RTX Virtual Workstation과 vPC/vApps를 지원해, 서버에 장착한 GPU를 여러 사용자에게 분할해 제공할 수 있습니다. 32GB 용량을 프로파일 단위로 나눠 설계 인력에게 배정하는 구성이 가능하며, 사용자별 요구 용량에 따라 동시 사용자 수를 조정합니다. vGPU 사용 시 카드의 물리 디스플레이 출력은 비활성화됩니다.
구매 담당자가 실제로 묻는 것들입니다.
판단 기준은 단일 작업이 32GB 안에서 끝나는지입니다. 메모리에서 막히지 않는다면 250W라는 낮은 전력이 카드 수를 늘리거나 PSU 여유를 확보하는 데 유리합니다. 반대로 배치 크기나 씬 크기를 키우면 32GB를 넘어서는 작업이라면, 카드를 여러 장 넣어도 NVLink가 없어 메모리가 합쳐지지 않으므로 48GB인 RTX 6000 Ada로 올라가는 편이 맞습니다.
듀얼 슬롯 PCIe x16 슬롯, CEM5 16-pin 보조 전원 250W, 그리고 10.5인치(약 266.7mm) 카드 길이를 수용하는 GPU 영역이 필요합니다. PCIe 4.0 카드지만 Gen5 슬롯에도 하위 호환으로 장착됩니다. 액티브 냉각 카드라 여러 장을 밀집 배치할 때는 섀시 흡기 온도와 카드 간 간격을 확인해야 하며, 최종 지원 여부는 서버 모델별 GPU 지원 목록으로 확인해 드립니다.
안 됩니다. NVIDIA 전력 가이드라인에 따르면 8-pin 1개를 16-pin으로 변환하는 어댑터는 센스 핀이 150W로 고정돼 있어, 250W가 필요한 이 카드는 부팅하지 않습니다. PCIe 8-pin 2개 또는 CPU 8-pin 1개를 16-pin으로 변환하는 300W급 어댑터를 쓰거나, 16-pin을 네이티브로 제공하는 서버 전원 구성을 사용해야 합니다.
불가능합니다. NVIDIA 공식 데이터시트에 NVLink 미지원으로 명시돼 있어, 여러 장을 장착해도 카드당 32GB가 상한입니다. 카드 간 통신은 PCIe를 경유합니다. 여러 장 구성은 메모리를 키우는 용도가 아니라 동시 처리량을 늘리는 용도로 설계해야 합니다.
4세대 Tensor 코어가 FP8을 가속하며, 학습용으로 BF16·FP16·TF32·FP32, 추론용으로 FP8·INT8을 지원합니다. 데이터시트의 Tensor 성능 1,044.4 TFLOPS는 FP8에 희소성을 적용한 실효 수치입니다. FP4는 Ada 세대가 아닌 후속 Blackwell 세대에서 도입된 형식이라 이 카드에서는 지원하지 않습니다.
엑스디노드는 전 제품 별도 문의 정책입니다. 카드 단품 여부, 장착 수량, 서버 모델과 전원·냉각 구성, 보증 조건에 따라 금액이 달라집니다. 사용하실 워크로드와 서버 사양을 알려주시면 구성안과 함께 안내해 드립니다.
같은 분류에서 자주 비교됩니다.

NVIDIA
패시브 냉각 96GB 데이터센터 GPU

NVIDIA
600W 96GB 워크스테이션 플래그십

NVIDIA
300W로 낮춘 96GB 다중 장착형

NVIDIA
72GB 단일 GPU, 300W 이중폭 Gen5 카드