
NVIDIA
NVIDIA RTX PRO 6000 Blackwell Server Edition
패시브 냉각 96GB 데이터센터 GPU

80GB HBM2e·1.9TB/s의 Ampere 가속기
핵심만 먼저 — 자세한 설명은 아래에서 펼쳐 볼 수 있습니다.
NVIDIA A100 80GB PCIe는 Ampere 세대 데이터센터 가속기로, Hopper 이전 세대의 표준 제품이다. 40GB 모델의 메모리 확장판이며 HBM2e 80GB를 탑재한다. Hopper 제품군이 나온 뒤에도 검증된 드라이버·프레임워크 조합, 300W라는 낮은 전력, PCIe Gen4 서버와의 폭넓은 호환성 때문에 여전히 도입 대상으로 남아 있다. 특히 FP64 배정밀도 연산이 필요한 HPC·과학계산 영역에서 선택지로 검토된다.
| 메모리 | 80GB HBM2e — 5,120비트 버스, 최대 1.94TB/s |
|---|---|
| 배정밀도 | FP64 9.7 TFLOPS — FP64 Tensor Core 19.5 TFLOPS |
| 연산 유닛 | CUDA 6,912 / Tensor 432 — 108 SM, 3세대 Tensor 코어 |
| 전력 | 300W — CPU 8핀 1개, 최소 150W |
| 폼팩터 | FHFL 이중폭 — 10.5인치 패시브, PCIe Gen4 x16 |
| 분할 운영 | MIG 7개 @10GB — 하드웨어 격리 인스턴스 |
GA100 다이는 108개 SM에 6,912개 FP32 CUDA 코어와 432개 3세대 Tensor 코어를 담고 있다. 연산 성능은 FP64 9.7 TFLOPS, FP64 Tensor Core 19.5 TFLOPS, FP32 19.5 TFLOPS다. Tensor Core는 TF32 156 TFLOPS(희소성 적용 312), BFLOAT16과 FP16 각 312 TFLOPS(희소성 적용 624), INT8 624 TOPS(희소성 적용 1,248)를 낸다. Hopper 이후 세대의 FP8과 Blackwell의 FP4는 지원하지 않으므로, FP8 기반 추론 최적화를 전제로 한 워크로드에는 맞지 않는다. GPU 클럭은 베이스 1,065MHz, 부스트 1,410MHz다.
메모리는 80GB HBM2e에 5,120비트 버스폭, 메모리 클럭 1,512MHz로 최대 1.94TB/s 대역폭을 제공한다. 인터페이스는 PCI Express 4.0 x16(64GB/s)으로, Gen5가 아니라는 점이 최신 세대와의 명확한 차이다. NVLink는 인접한 A100 80GB 카드 1장과만 연결할 수 있고, 브리지 3개를 모두 장착해야 600GB/s가 나온다. MIG는 최대 7개 인스턴스(인스턴스당 10GB)로 하드웨어 격리 분할을 지원해, 한 장을 여러 사용자에게 나눠 주는 운영에 활용된다.
전력은 기본 300W, 최대 300W, 최소 150W다. 보조 전원은 CPU 8핀 커넥터 1개를 사용하는데, 최근 세대가 쓰는 16핀과 다르므로 서버가 제공하는 케이블 종류를 확인해야 한다. 방열은 패시브이며 폼팩터는 FHFL 10.5인치 이중폭이다. 디스플레이 커넥터는 없어 모니터를 연결하는 용도로는 쓸 수 없다. 보드 단품 무게는 약 1,170g이다.
서버 조건은 최신 세대보다 완만하다. 300W·PCIe Gen4 x16·CPU 8핀 조합이라, GPU 확장형 4U 서버뿐 아니라 이중폭 카드를 수용하는 일부 2U GPU 서버에도 들어갈 여지가 있다. 엑스디노드가 취급하는 MSI·GIGABYTE·Advantech 서버 중 A100 세대를 검증한 모델을 기준으로 구성하면 되고, PCIe Gen5 백플레인이 아니어도 성능 손실 없이 동작한다. 다만 패시브 방열이라는 점은 동일하므로 전면 흡기 기류를 갖춘 서버 섀시가 필요하고, 데스크톱 워크스테이션 섀시에는 장착할 수 없다. NVLink로 묶을 계획이라면 인접 슬롯 2장 단위로 배치하고 이중 CPU 서버에서는 같은 CPU 도메인 아래에 두는 것이 좋다.
FP64 비중이 큰 과학계산·시뮬레이션, 이미 A100 기반으로 검증된 파이프라인의 증설, MIG로 다수 사용자에게 GPU를 분할해 제공하는 사내 공용 환경에 적합하다. 반대로 LLM 추론에서 FP8 최적화를 쓰거나 70B급 모델을 단일 카드에 올려야 한다면 H100 NVL 94GB나 H200 NVL 141GB가 맞는 선택이다. 영상 인코딩·렌더링·가상 워크스테이션이 주 용도라면 RT 코어와 AV1 인코더를 갖춘 L40S가 낫다. 재고와 리드타임이 구성마다 달라지므로 엑스디노드로 별도 문의하면 확인해 드린다.
제조사 공식 문서 기준입니다.
| 메모리 용량 | 80GB |
|---|---|
| 메모리 종류 | HBM2e (ECC) |
| 메모리 대역폭 | 최대 1.94TB/s (1,935GB/s) |
| 메모리 버스폭 | 5,120비트 |
| 메모리 클럭 | 1,512MHz |
| MIG (분할) | 최대 7개 인스턴스 @ 10GB |
| 아키텍처 | NVIDIA Ampere (GA100) |
|---|---|
| SM 수 | 108개 |
| CUDA 코어 | 6,912개 (FP32) |
| Tensor 코어 | 432개 (3세대) |
| FP64 | 9.7 TFLOPS |
| FP64 Tensor Core | 19.5 TFLOPS |
| FP32 | 19.5 TFLOPS |
| TF32 Tensor Core | 156 TFLOPS (희소성 적용 312 TFLOPS) |
| BFLOAT16 / FP16 Tensor Core | 각 312 TFLOPS (희소성 적용 624 TFLOPS) |
| INT8 Tensor Core | 624 TOPS (희소성 적용 1,248 TOPS) |
| FP8 / FP4 | 미지원 (Ampere 세대) |
| GPU 클럭 | 베이스 1,065MHz / 부스트 1,410MHz |
| PCIe 인터페이스 | PCI Express 4.0 x16 (64GB/s) |
|---|---|
| NVLink | 브리지 3개 사용, 인접 A100 80GB 1장과 600GB/s |
| 최대 소비전력 (TDP) | 300W (기본 300W, 최소 150W) |
| 보조 전원 커넥터 | CPU 8핀 1개 |
| 디스플레이 출력 | 없음 (디스플레이 커넥터 미탑재) |
| 폼팩터 | 풀하이트·풀렝스(FHFL) 10.5인치 |
|---|---|
| 슬롯 폭 | 이중폭(듀얼 슬롯) |
| 냉각 방식 | 패시브 (섀시 기류 필요) |
| 보드 무게 | 약 1,170g (브래킷·브리지 제외) |
| 규격 | NVIDIA Form Factor 5.0 준수 |
| Multi-Instance GPU | 지원 (7개 인스턴스) |
|---|---|
| Root of Trust | 지원 |
| SXM 버전 참고 | 메모리 대역폭 2,039GB/s, TDP 400W (커스텀 열설계 SKU 최대 500W) |
| VBIOS | UEFI 지원, EEPROM 8Mbit |
구매 담당자가 실제로 묻는 것들입니다.
FP64 배정밀도 성능이 필요한 HPC·과학계산, 이미 A100 기반으로 검증이 끝난 파이프라인의 증설, 300W라는 낮은 전력과 PCIe Gen4 서버 호환성이 중요한 환경에서 유효합니다. 반면 FP8을 쓰는 최신 LLM 추론 최적화는 Ampere 세대가 지원하지 않으므로 이 경우에는 Hopper 이상을 검토해야 합니다.
메모리는 80GB HBM2e·1.94TB/s 대 94GB HBM3·3.9TB/s, 인터페이스는 PCIe Gen4 x16(64GB/s) 대 Gen5 x16(128GB/s)입니다. Tensor 연산은 A100이 FP16 312 TFLOPS(희소성 624), H100 NVL이 FP16 1,671 TFLOPS 수준이고 A100은 FP8을 지원하지 않습니다. 대신 A100은 300W로 H100 NVL의 400W보다 전력 부담이 적습니다.
다릅니다. A100 80GB PCIe는 CPU 8핀 보조 전원 커넥터 1개를 사용하며, H100 NVL·H200 NVL·L40S가 쓰는 16핀과 호환되지 않습니다. 서버에서 제공하는 케이블 종류를 반드시 확인해야 하며, NVIDIA는 CPU 8핀에서 PCIe 8핀으로 변환하는 어댑터 사용 방식을 문서로 정의하고 있습니다.
MIG로 최대 7개 인스턴스(인스턴스당 10GB)까지 하드웨어 수준에서 격리 분할할 수 있습니다. 연구실이나 사내 공용 GPU 환경처럼 여러 사용자가 동시에 쓰는 구성에 활용됩니다.
불가능합니다. 디스플레이 커넥터가 없는 연산 전용 가속기이므로 화면 출력 용도로는 쓸 수 없습니다. 디스플레이 출력이 필요하다면 DisplayPort 1.4a 4개를 갖춘 L40S를 검토하십시오.
구성과 수량, 서버 조합에 따라 달라져 별도 문의로 안내드립니다. 신규 도입인지 기존 클러스터 증설인지 알려주시면 재고와 리드타임까지 함께 확인해 드립니다.
같은 분류에서 자주 비교됩니다.

NVIDIA
패시브 냉각 96GB 데이터센터 GPU

NVIDIA
600W 96GB 워크스테이션 플래그십

NVIDIA
300W로 낮춘 96GB 다중 장착형

NVIDIA
72GB 단일 GPU, 300W 이중폭 Gen5 카드