NVIDIA L40S 48GB 제품 이미지
NVIDIA · GPU

NVIDIA L40S 48GB

48GB GDDR6에 RT 코어를 갖춘 범용 가속기

별도 문의구성·수량에 따라 견적이 달라집니다
메모리48GB GDDR6 ECC연산 유닛CUDA 18,176개FP8 성능733 TFLOPS전력350W디스플레이DP 1.4a x4영상AV1 인코드·디코드

제품 개요

핵심만 먼저 — 자세한 설명은 아래에서 펼쳐 볼 수 있습니다.

NVIDIA L40S는 Ada Lovelace 아키텍처 기반 데이터센터 GPU로, AI 연산과 그래픽 처리를 한 장에서 함께 다루도록 만들어진 제품이다. HBM을 쓰는 H100·H200 계열이 대규모 학습과 추론에 특화된 것과 달리, L40S는 GDDR6 48GB에 RT 코어와 AV1 인코더를 얹어 추론·렌더링·가상 워크스테이션을 한 인프라에서 소화하는 자리를 노린다. NVLink와 MIG를 지원하지 않는 대신 단일 카드 완결형 워크로드에 맞춰져 있다. 350W라는 전력과 PCIe Gen4 인터페이스 덕분에 도입 가능한 서버 폭이 넓은 편이다.

메모리48GB GDDR6 ECC864GB/s 대역폭
연산 유닛CUDA 18,176개RT 코어 142개, Tensor 코어 568개
FP8 성능733 TFLOPS희소성 적용 시 1,466 TFLOPS
전력350W16핀 보조 전원, 이중폭 패시브
디스플레이DP 1.4a x4이 목록에서 유일한 화면 출력 지원
영상AV1 인코드·디코드NVENC 3개, NVDEC 3개
개요 전체 읽기

연산 유닛은 CUDA 코어 18,176개, 3세대 RT 코어 142개, 4세대 Tensor 코어 568개로 구성된다. FP32 성능은 91.6 TFLOPS이고 RT 코어 성능은 212 TFLOPS다. Tensor Core는 TF32 183 TFLOPS(희소성 적용 366), BFLOAT16과 FP16 각 362.05 TFLOPS(희소성 적용 733), FP8 733 TFLOPS(희소성 적용 1,466), INT8과 INT4 733 TOPS(희소성 적용 1,466)를 낸다. Ada 세대이므로 FP8까지 지원하고 FP4는 지원하지 않는다. FP64 배정밀도는 이 제품군의 목적이 아니므로 HPC 계산 용도로는 적합하지 않다.

메모리는 48GB GDDR6에 ECC가 적용되고 대역폭은 864GB/s다. HBM3e 계열의 수 TB/s급과 비교하면 낮지만, 40GB 안팎의 모델 추론이나 대용량 3D 씬 처리에는 충분한 용량을 확보한다. 인터페이스는 PCI Express Gen4 x16(양방향 64GB/s)이며 NVLink는 지원하지 않으므로, 여러 장을 쓰더라도 GPU 간 통신은 PCIe를 통해 이뤄진다. MIG 분할도 지원하지 않는 대신 vGPU 소프트웨어를 지원해 가상 워크스테이션 형태로 여러 사용자에게 배분할 수 있다. 미디어 엔진은 NVENC 3개와 NVDEC 3개를 갖췄고 AV1 인코딩과 디코딩을 모두 처리한다.

최대 소비전력은 350W이고 보조 전원은 16핀 커넥터를 쓴다. 폼팩터는 높이 4.4인치, 길이 10.5인치의 이중폭이며 방열은 패시브다. 카드에 자체 팬이 없으므로 서버 섀시가 만드는 기류가 필요하고, 워크스테이션 섀시에는 그대로 넣을 수 없다. DisplayPort 1.4a 출력 4개를 갖추고 있어 이 목록의 다른 제품과 달리 화면 출력이 가능하다는 점이 특징이다. Secure Boot와 Root of Trust를 지원하고 NEBS Ready Level 3 등급을 충족한다.

서버 선택 폭은 600W급보다 훨씬 넓다. 이중폭 PCIe Gen4 x16 슬롯과 16핀 보조 전원만 제공되면 되므로, 엑스디노드가 취급하는 MSI·GIGABYTE·Advantech 서버 중 GPU 확장형 4U 모델은 물론 이중폭 카드를 수용하는 2U GPU 서버에도 대응하는 경우가 많다. 다만 패시브 방열이라 서버용 섀시가 전제이며, 여러 장을 조밀하게 배치할수록 슬롯 간 기류 확보가 중요해진다. NVLink가 없으므로 카드 간 간격이나 브리지 슬롯 배치를 신경 쓸 필요는 없고, 대신 GPU 수만큼 16핀 케이블이 확보되는지 확인하면 된다. 4장 구성 시 GPU만 1.4kW 수준이라 전력 계획도 상대적으로 단순하다.

중소형 모델 추론, 파인튜닝, 3D 렌더링과 시각화, Omniverse 계열 시뮬레이션, 대량 영상 트랜스코딩, RTX 가상 워크스테이션처럼 AI와 그래픽이 섞인 워크로드에 맞는다. 반대로 70B급 이상 대형 모델을 단일 카드에 올려야 하거나 GPU 간 고속 통신이 필요한 다중 GPU 학습이라면 NVLink와 HBM을 갖춘 H100 NVL·H200 NVL이 맞고, FP64 위주의 과학계산은 A100 쪽이 적합하다. 전력과 슬롯이 더 빠듯한 환경이라면 72W 싱글슬롯의 L4가 대안이 된다. 구성과 수량에 따라 조건이 달라지므로 엑스디노드로 별도 문의하면 된다.

상세 사양

제조사 공식 문서 기준입니다.

메모리

메모리 용량48GB
메모리 종류GDDR6 (ECC 지원)
메모리 대역폭864GB/s
MIG (분할)미지원
vGPU 소프트웨어지원

연산

아키텍처NVIDIA Ada Lovelace
CUDA 코어18,176개
RT 코어142개 (3세대)
Tensor 코어568개 (4세대)
FP3291.6 TFLOPS
RT 코어 성능212 TFLOPS
TF32 Tensor Core183 TFLOPS (희소성 적용 366 TFLOPS)
BFLOAT16 / FP16 Tensor Core각 362.05 TFLOPS (희소성 적용 733 TFLOPS)
FP8 Tensor Core733 TFLOPS (희소성 적용 1,466 TFLOPS)
INT8 / INT4 Tensor Core733 TOPS (희소성 적용 1,466 TOPS)
FP4미지원 (Ada 세대)

인터페이스·전력

PCIe 인터페이스PCI Express Gen4 x16 (양방향 64GB/s)
NVLink미지원
최대 소비전력350W
보조 전원 커넥터16핀
디스플레이 출력DisplayPort 1.4a x4

폼팩터

폼팩터높이 4.4인치 x 길이 10.5인치
슬롯 폭이중폭(듀얼 슬롯)
냉각 방식패시브 (섀시 기류 필요)
NEBS 등급NEBS Ready Level 3

미디어·보안

인코더 / 디코더NVENC 3개 / NVDEC 3개
AV1 지원인코딩·디코딩 모두 지원
Secure Boot지원 (Root of Trust)

자주 묻는 질문

구매 담당자가 실제로 묻는 것들입니다.

L40S와 H100 계열 중 어느 쪽을 골라야 합니까?

워크로드 성격으로 갈립니다. 40GB 안팎의 모델 추론, 렌더링, 영상 트랜스코딩, 가상 워크스테이션이 섞여 있다면 RT 코어와 AV1 인코더를 갖춘 L40S가 맞습니다. 70B급 대형 모델 추론이나 다중 GPU 학습처럼 HBM 대역폭과 NVLink가 필요한 경우에는 H100 NVL 94GB나 H200 NVL 141GB가 적합합니다. L40S는 NVLink와 MIG를 지원하지 않는다는 점도 판단 기준입니다.

여러 장을 묶어 쓸 수 있습니까?

NVLink를 지원하지 않으므로 GPU 간 통신은 PCIe Gen4 x16(양방향 64GB/s)을 통해 이뤄집니다. 카드마다 독립적으로 돌아가는 추론 인스턴스나 렌더링 잡을 배분하는 방식에는 문제가 없지만, 하나의 큰 모델을 여러 장에 나눠 올리는 텐서 병렬 구성에는 통신 대역폭이 제약이 될 수 있습니다.

디스플레이 출력이 실제로 쓸 수 있는 사양입니까?

DisplayPort 1.4a 출력 4개를 갖추고 있어 사양상 화면 출력이 가능합니다. 다만 패시브 방열의 서버용 카드이므로 실제로는 vGPU 소프트웨어를 통한 원격 가상 워크스테이션 형태로 쓰는 구성이 일반적입니다. 서버 모델에 따라 출력 사용 가능 여부가 다를 수 있어 도입 전 확인을 권합니다.

어떤 서버에 장착할 수 있습니까?

이중폭 PCIe Gen4 x16 슬롯과 16핀 보조 전원이 있는 서버면 대응 범위가 넓습니다. 엑스디노드가 취급하는 MSI·GIGABYTE·Advantech 서버 중 GPU 확장형 4U 모델은 물론 이중폭 카드를 수용하는 2U GPU 서버도 대상이 됩니다. 카드에 팬이 없는 패시브 방식이라 서버 섀시 기류가 필수이며, 워크스테이션 섀시에는 그대로 장착할 수 없습니다.

MIG로 나눠 쓸 수 있습니까?

MIG는 지원하지 않습니다. 대신 vGPU 소프트웨어를 지원하므로 가상 워크스테이션이나 가상 데스크톱 형태로 여러 사용자에게 배분하는 방식이 가능합니다. 하드웨어 수준의 격리 분할이 반드시 필요하다면 A100이나 H100·H200 계열을 검토해야 합니다.

가격은 어떻게 됩니까?

구성과 수량, 서버 조합에 따라 달라져 별도 문의로 안내드립니다. 용도가 추론 중심인지 렌더링·가상 워크스테이션 중심인지 알려주시면 GPU 수량과 서버 조합까지 함께 제안드립니다.

함께 검토하는 제품

같은 분류에서 자주 비교됩니다.

NVIDIA

NVIDIA RTX PRO 6000 Blackwell Server Edition

패시브 냉각 96GB 데이터센터 GPU

별도 문의

NVIDIA

NVIDIA RTX PRO 6000 Blackwell Workstation Edition

600W 96GB 워크스테이션 플래그십

별도 문의

NVIDIA

NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition

300W로 낮춘 96GB 다중 장착형

별도 문의

NVIDIA

NVIDIA RTX PRO 5000 72GB Blackwell

72GB 단일 GPU, 300W 이중폭 Gen5 카드

별도 문의