NVIDIA GPU
Jump to navigation
Jump to search
NVIDIA GPU
Overview
NVIDIA GPU(Graphics Processing Unit)는 병렬 컴퓨팅을 위한 그래픽 처리 장치입니다. 게이밍부터 HPC, AI/ML까지 광범위하게 사용됩니다. Ampere, Hopper, Blackwell 아키텍처를 통해 지속적인 성능 향상을 이루고 있습니다.
Summary
- 무엇인가? — NVIDIA의 그래픽 및 컴퓨팅 처리 장치
- 왜 필요한가? — 병렬 컴퓨팅, AI/ML 훈련/추론, 그래픽 렌더링
- 언제 사용하는가? — AI 서버, HPC 클러스터, 워크스테이션
Purpose
이 문서가 존재하는 이유
- Goal: NVIDIA GPU 제품군, 아키텍처, MIG, 드라이버, 모니터링 방법 제공
- Scope: GPU 라인업, 아키텍처 비교, MIG, 드라이버 설치, nvidia-smi
- Non-goals: CUDA 프로그래밍, 특정 애플리케이션 설정은 별도 문서
Key Concepts
| Concept | Description | Related |
|---|---|---|
| Ampere | SM80 아키텍처 — A100/H100 기반 | NVIDIA GPU |
| Hopper | SM90 아키텍처 — H200/B200 기반 | NVIDIA GPU |
| Blackwell | SM100 아키텍처 — B200 기반 | NVIDIA GPU |
| MIG | Multi-Instance GPU — GPU 분할 | MIG |
| CUDA | NVIDIA 병렬 컴퓨팅 플랫폼 | CUDA |
| Tensor Core | AI 연산 전용 코어 | NVIDIA GPU |
| NVLink | GPU 간 고속 연결 | NVIDIA GPU |
| nvidia-smi | GPU 모니터링/관리 도구 | NVIDIA GPU |
Architecture
NVIDIA GPU 아키텍처 진화:
graph LR
A[Turing] --> B[Ampere]
B --> C[Hopper]
C --> D[Blackwell]
B --> E[A100]
B --> F[A30]
C --> G[H100]
C --> H[H200]
D --> I[B200]
D --> J[RTX PRO 6000]
D --> K[RTX PRO 5000]
Workflow
| Stage | Input | Output |
|---|---|---|
| Install Driver | NVIDIA driver package | nvidia-smi |
| Check Status | nvidia-smi | GPU info |
| Enable MIG | nvidia-smi -mig 1 | MIG Mode |
| Create Instance | nvidia-smi -cgi | GPU Instances |
| Monitor | nvidia-smi / dcgmi | Metrics |
Detailed Explanation
GPU 제품군
| 제품군 | 아키텍처 | 주요 모델 | 용도 |
|---|---|---|---|
| Data Center | Ampere/Hopper/Blackwell | A100, H100, H200, B200 | AI/ML, HPC |
| RTX Workstation | Ada/Blackwell | RTX 6000 Ada, RTX PRO 6000 | 워크스테이션, VFX |
| GeForce | Ada | RTX 4090, RTX 4080 | 게이밍, 엔트리 AI |
| L-Series | Ada | L40S, L4 | 가상 데스크톱, 인퍼런스 |
아키텍처 비교
| 아키텍처 | SM | Tensor Core | Memory Type | 대표 모델 |
|---|---|---|---|---|
| Ampere (SM80) | 80 | 3rd Gen | HBM2e/HBM2 | A100, A30 |
| Hopper (SM90) | 90 | 4th Gen | HBM3/HBM3e | H100, H200 |
| Blackwell (SM100) | 100 | 5th Gen | HBM3e | B200, RTX PRO 6000 |
MIG (Multi-Instance GPU)
단일 GPU를 여러 격리된 인스턴스로 분할합니다. Ampere 아키텍처부터 도입되었습니다.
- GI(GPU Instance): 완전 격리된 리소스 집합
- CI(Compute Instance): GI 내 부분 격리된 SM 집합
- 18가지 프로파일 조합 가능
자세한 내용은 MIG 문서를 참조하세요.
NVIDIA 드라이버
| GPU | CUDA Version | NVIDIA Driver Version |
|---|---|---|
| A100 / A30 | CUDA 11 | R525 (>= 525.53) |
| H100 / H200 | CUDA 12 | R450 (>= 450.80.02) |
| B200 | CUDA 12 | R570 (>= 570.133.20) |
| RTX PRO 6000 Blackwell | CUDA 12 | R575 (>= 575.51.03) |
nvidia-smi 기본 명령어
# GPU 상태 확인
$ nvidia-smi
# GPU 목록 확인
$ nvidia-smi -L
# 모니터링 (1초 간격)
$ nvidia-smi -l 1
# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv
# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1
# MIG 활성화
$ sudo nvidia-smi -mig 1
GPU 모니터링
| 명령어 | 설명 |
|---|---|
| nvidia-smi | 기본 GPU 상태 |
| nvidia-smi -L | GPU UUID 목록 |
| nvidia-smi mig -lgi | MIG 인스턴스 목록 |
| nvidia-smi mig -lgip | MIG 프로파일 목록 |
| dcgmi dmon | DCGM 고급 모니터링 |
| nvtop | 실시간 모니터링 (nvtop 설치 필요) |
Configuration
# NVIDIA 드라이버 설치
$ sudo apt-get install nvidia-driver-535
# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1
# MIG 활성화
$ sudo nvidia-smi -mig 1
# GPU 상태 확인
$ nvidia-smi
# MIG 인스턴스 생성
$ sudo nvidia-smi mig -cgi 9,19,19,19 -C
Examples
Example 1: GPU 상태 확인
# 전체 GPU 상태
$ nvidia-smi
# GPU UUID 확인
$ nvidia-smi -L
# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv
Example 2: Docker에서 GPU 사용
# 전체 GPU 사용
$ docker run --gpus all --rm nvidia/cuda:12.0 nvidia-smi
# 특정 GPU 사용
$ docker run --gpus '"device=0"' --rm nvidia/cuda:12.0 nvidia-smi
# MIG 디바이스 사용
$ docker run --gpus '"device=MIG-UUID"' --rm nvidia/cuda:12.0 nvidia-smi
Best Practices
- Persistence Mode 필수 활성화
- MIG 활성화 시 nvsm/dcgm 중지 후 진행
- 워크로드에 맞는 MIG 프로파일 선택
- DCGM v2.0.13+ 사용 (MIG 모니터링)
- 정기적인 드라이버 업데이트
- RTX PRO Blackwell은 Display Mode 먼저 Compute로 설정
- SSH 접근 확인 후 Display Mode 변경
Limitations
- MIG 활성화/비활성화는 GPU 리셋 필요
- 그래픽 컨텍스트 미지원 (MIG)
- P2P/NVLink 미지원 (MIG)
- nvidia-smi만으로는 MIG 메트릭 확인 불가
- RTX PRO Blackwell primary display GPU는 Display Mode 변경 시 디스플레이 출력 중단
References
Related Pages
Knowledge Graph
Related
→ CUDA → GPU → H100 → NVLink → AMD GPUs → A100 → MIG → NVIDIA GPUs
Latest GPU Lineup (2024-2025)
NVIDIA는 2024년 Blackwell 아키텍처와 H200를 출시. AI/ML 워크로드 성능이 크게 향상.
Blackwell B100/B200
- 아키텍처: Blackwell (SM 10.x)
- TFLOPS (FP4): 2,900 TFLOPS
- 메모리: HBM3e, 192GB
- 메모리 대역폭: 8 TB/s
- TDP: 1,000W
- NVLink: 1.8 TB/s (B200)
- 출시: 2024년
H200
- 아키텍처: Hopper (SM 9.0)
- 메모리: HBM3e, 141GB
- 메모리 대역폭: 4.8 TB/s
- TDP: 700W
- NVLink: 900 GB/s
- 출시: 2024년 Q2
- H100 대비 메모리 27% 증가, 대역폭 20% 증가
H100 (기존)
- 아키텍처: Hopper (SM 9.0)
- Tensor TFLOPS (FP8): 989 TFLOPS
- 메모리: HBM3, 80GB
- 메모리 대역폭: 3.35 TB/s
- TDP: 700W
- NVLink: 900 GB/s
Blackwell vs Hopper 비교
| Feature ! H100 ! H200 ! B100 ! B200 |
|---|
| Hopper | Hopper | Blackwell | Blackwell |
| 989 | 989 | ~1500 | ~2000 |
| HBM3 80GB | HBM3e 141GB | HBM3e 192GB | HBM3e 288GB |
| 3.35 TB/s | 4.8 TB/s | ~6 TB/s | ~8 TB/s |
| 700W | 700W | 1000W | 1000W |
| 900 GB/s | 900 GB/s | 1.8 TB/s | 1.8 TB/s |