NVIDIA GPU: Difference between revisions

From HPCWIKI
Jump to navigation Jump to search
No edit summary
(Phase 0.4: Expand NVIDIA GPU)
 
(70 intermediate revisions by 2 users not shown)
Line 1: Line 1:
=== NVIDIA GPU Architecture ===
= NVIDIA GPU =
{| class="wikitable sortable"
 
!Series
{{Status
!Architecture
|status=Draft
!Notable Models
|owner=Knowledge Agent
!Key Features
|last_update=2026-07-15
|-
|review=Pending
|Tesla
}}
|Tesla
 
|C1060, M2050, K80, P100, V100, A100
{{TOC}}
|First dedicated GPGPU series
 
== Overview ==
 
NVIDIA GPU(Graphics Processing Unit)는 병렬 컴퓨팅을 위한 그래픽 처리 장치입니다. 게이밍부터 HPC, AI/ML까지 광범위하게 사용됩니다. Ampere, Hopper, Blackwell 아키텍처를 통해 지속적인 성능 향상을 이루고 있습니다.
 
=== Summary ===
 
* 무엇인가? — NVIDIA의 그래픽 및 컴퓨팅 처리 장치
* 왜 필요한가? — 병렬 컴퓨팅, AI/ML 훈련/추론, 그래픽 렌더링
* 언제 사용하는가? — AI 서버, HPC 클러스터, 워크스테이션
 
 
== Purpose ==
 
이 문서가 존재하는 이유
 
* Goal: NVIDIA GPU 제품군, 아키텍처, MIG, 드라이버, 모니터링 방법 제공
* Scope: GPU 라인업, 아키텍처 비교, MIG, 드라이버 설치, nvidia-smi
* Non-goals: CUDA 프로그래밍, 특정 애플리케이션 설정은 별도 문서
 
 
== Key Concepts ==
 
{| class="wikitable"
! Concept
! Description
! Related
|-
|-
|Fermi
| Ampere
|Fermi
| SM80 아키텍처 — A100/H100 기반
|GTX 400, GTX 500, Tesla 20-series, Quadro 4000/5000
| [[NVIDIA GPU]]
|First to feature CUDA cores and support for ECC memory
|-
|-
|Kepler
| Hopper
|Kepler
| SM90 아키텍처 — H200/B200 기반
|GTX 600, GTX 700, Tesla K-series, Quadro K-series
| [[NVIDIA GPU]]
|First to feature Dynamic Parallelism and Hyper-Q
|-
|-
|Maxwell
| Blackwell
|Maxwell
| SM100 아키텍처 — B200 기반
|GTX 900, GTX 1000, Quadro M-series
| [[NVIDIA GPU]]
|First to support VR and 4K displays
|-
|-
|Pascal
| MIG
|Pascal
| Multi-Instance GPU — GPU 분할
|GTX 1000, Quadro P-series
| [[MIG]]
|First to support simultaneous multi-projection
|-
|-
|Volta
| CUDA
|Volta
| NVIDIA 병렬 컴퓨팅 플랫폼
|Titan V, Tesla V100, Quadro GV100
| [[CUDA]]
|First to feature Tensor Cores and NVLink 2.0
|-
|-
|Turing
| Tensor Core
|Turing
| AI 연산 전용 코어
|RTX 2000, GTX 1600, Quadro RTX
| [[NVIDIA GPU]]
|First to feature Ray Tracing Cores and RTX technology
|-
|-
|Ampere
| NVLink
|Ampere
| GPU 간 고속 연결
|RTX 3000, A-series
| [[NVIDIA GPU]]
|Features third-generation Tensor Cores and more
|-
|-
|
| nvidia-smi
|
| GPU 모니터링/관리 도구
|
| [[NVIDIA GPU]]
|
|}
|}


=== NVIDIA GPU Models ===
 
{| class="wikitable sortable"
== Architecture ==
!Model
 
!Architecture
NVIDIA GPU 아키텍처 진화:
!CUDA Cores
 
!Tensor Cores
<syntaxhighlight lang="mermaid">
!RT Cores
graph LR
!Memory Size
    A[Turing] --> B[Ampere]
!Memory Type
    B --> C[Hopper]
!Memory Bandwidth
    C --> D[Blackwell]
!TDP
    B --> E[A100]
!Launch Date
    B --> F[A30]
    C --> G[H100]
    C --> H[H200]
    D --> I[B200]
    D --> J[RTX PRO 6000]
    D --> K[RTX PRO 5000]
</syntaxhighlight>
 
 
== Workflow ==
 
{| class="wikitable"
! Stage
! Input
! Output
|-
|-
|Tesla C870
| Install Driver
|Tesla
| NVIDIA driver package
|128
| nvidia-smi
|No
|No
|1.5 GB GDDR3
|GDDR3
|76.8 GB/s
|105W
|Jun 2006
|-
|-
|Tesla C1060
| Check Status
|Tesla
| nvidia-smi
|240
| GPU info
|No
|No
|4 GB GDDR3
|GDDR3
|102 GB/s
|238W
|Dec 2008
|-
|-
|Tesla M1060
| Enable MIG
|Tesla
| nvidia-smi -mig 1
|240
| MIG Mode
|No
|No
|4 GB GDDR3
|GDDR3
|102 GB/s
|225W
|Dec 2008
|-
|-
|Tesla M2050
| Create Instance
|Fermi
| nvidia-smi -cgi
|448
| GPU Instances
|No
|No
|3 GB GDDR5
|GDDR5
|148 GB/s
|225W
|May 2010
|-
|-
|Tesla M2070
| Monitor
|Fermi
| nvidia-smi / dcgmi
|448
| Metrics
|No
|}
|No
 
|6 GB GDDR5
 
|GDDR5
== Detailed Explanation ==
|150 GB/s
 
|225W
=== GPU 제품군 ===
|May 2010
 
{| class="wikitable"
! 제품군
! 아키텍처
! 주요 모델
! 용도
|-
|-
|Tesla K10
| Data Center
|Kepler
| Ampere/Hopper/Blackwell
|3072
| A100, H100, H200, B200
|No
| AI/ML, HPC
|No
|8 GB GDDR5
|GDDR5
|320 GB/s
|225W
|May 2012
|-
|-
|Tesla K20
| RTX Workstation
|Kepler
| Ada/Blackwell
|2496
| RTX 6000 Ada, RTX PRO 6000
|No
| 워크스테이션, VFX
|No
|5/6 GB GDDR5
|GDDR5
|208 GB/s
|225W
|Nov 2012
|-
|-
|Tesla K40
| GeForce
|Kepler
| Ada
|2880
| RTX 4090, RTX 4080
|No
| 게이밍, 엔트리 AI
|No
|12 GB GDDR5
|GDDR5
|288 GB/s
|235W
|Nov 2013
|-
|-
|Tesla K80
| L-Series
|Kepler
| Ada
|4992
| L40S, L4
|No
| 가상 데스크톱, 인퍼런스
|No
|}
|24 GB GDDR5
 
|GDDR5
=== 아키텍처 비교 ===
|480 GB/s
 
|300W
{| class="wikitable"
|Nov 2014
! 아키텍처
! SM
! Tensor Core
! Memory Type
! 대표 모델
|-
|-
|Tesla M40
| Ampere (SM80)
|Maxwell
| 80
|3072
| 3rd Gen
|No
| HBM2e/HBM2
|No
| A100, A30
|12 GB GDDR5
|GDDR5
|288 GB/s
|250W
|Nov 2015
|-
|-
|Tesla P4
| Hopper (SM90)
|Pascal
| 90
|2560
| 4th Gen
|No
| HBM3/HBM3e
|No
| H100, H200
|8 GB GDDR5
|GDDR5
|192 GB/s
|75W
|Sep 2016
|-
|-
|Tesla P40
| Blackwell (SM100)
|Pascal
| 100
|3840
| 5th Gen
|No
| HBM3e
|No
| B200, RTX PRO 6000
|24 GB GDDR5X
|}
|GDDR5X
 
|480 GB/s
=== MIG (Multi-Instance GPU) ===
|250W
 
|Sep 2016
단일 GPU를 여러 격리된 인스턴스로 분할합니다. Ampere 아키텍처부터 도입되었습니다.
 
* GI(GPU Instance): 완전 격리된 리소스 집합
* CI(Compute Instance): GI 내 부분 격리된 SM 집합
* 18가지 프로파일 조합 가능
 
자세한 내용은 [[MIG]] 문서를 참조하세요.
 
=== NVIDIA 드라이버 ===
 
{| class="wikitable"
! GPU
! CUDA Version
! NVIDIA Driver Version
|-
|-
|Tesla V100
| A100 / A30
|Volta
| CUDA 11
|5120
| R525 (>= 525.53)
|640
|Yes
|16/32 GB HBM2
|HBM2
|900 GB/s
|300W
|May 2017
|-
|-
|Tesla T4
| H100 / H200
|Turing
| CUDA 12
|2560
| R450 (>= 450.80.02)
|320
|No
|16 GB
|
|
|
|
|-
|-
|A100 PCIe
| B200
|Ampere
| CUDA 12
|6912
| R570 (>= 570.133.20)
|432
|Yes
|40 GB HBM2 / 80 GB HBM2
|HBM2
|1555 GB/s
|250W
|May 2020
|-
|-
|A100 SXM4
| RTX PRO 6000 Blackwell
|Ampere
| CUDA 12
|6912
| R575 (>= 575.51.03)
|432
|}
|Yes
 
|40 GB HBM2 / 80 GB HBM2
=== nvidia-smi 기본 명령어 ===
|HBM2
 
|1555 GB/s
<syntaxhighlight lang="bash">
|400W
# GPU 상태 확인
|May 2020
$ nvidia-smi
|-
 
|A30
# GPU 목록 확인
|Ampere
$ nvidia-smi -L
|7424
 
|184
# 모니터링 (1초 간격)
|No
$ nvidia-smi -l 1
|24 GB GDDR6
 
|GDDR6
# MIG 상태 확인
|696 GB/s
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv
|165W
 
|Apr 2021
# Persistence Mode 활성화
|-
$ sudo nvidia-smi -pm 1
|A40
 
|Ampere
# MIG 활성화
|10752
$ sudo nvidia-smi -mig 1
|336
</syntaxhighlight>
|No
 
|48 GB GDDR6
=== GPU 모니터링 ===
|GDDR6
 
|696 GB/s
{| class="wikitable"
|300W
! 명령어
|Apr 2021
! 설명
|-
|A10
|Ampere
|10240
|320
|No
|24 GB GDDR6
|GDDR6
|624 GB/s
|150W
|Mar 2021
|-
|A16
|Ampere
|16384
|512
|No
|48 GB GDDR6
|GDDR6
|768 GB/s
|400W
|Mar 2021
|-
|A100 80GB
|Ampere
|6912
|432
|Yes
|80 GB HBM2
|HBM2
|2025 GB/s
|400W
|Apr 2021
|-
|A100 40GB
|Ampere
|6912
|432
|Yes
|40 GB HBM2
|HBM2
|1555 GB/s
|250W
|May 2020
|-
|A200 PCIe
|Ampere
|10752
|672
|Yes
|80 GB HBM2 / 160 GB HBM2
|HBM2
|2050 GB/s
|400W
|Nov 2021
|-
|A200 SXM4
|Ampere
|10752
|672
|Yes
|80 GB HBM2 / 160 GB HBM2
|HBM2
|2050 GB/s
|400W
|Nov 2021
|-
|A5000
|Ampere
|8192
|256
|Yes
|24 GB GDDR6
|GDDR6
|768 GB/s
|230W
|Apr 2021
|-
|A4000
|Ampere
|6144
|192
|Yes
|16 GB GDDR6
|GDDR6
|512 GB/s
|140W
|Apr 2021
|-
|A3000
|Ampere
|3584
|112
|Yes
|24 GB G
|
|
|
|
|-
|Titan RTX
|Turing
|4608
|576
|Yes
|24 GB GDDR6
|GDDR6
|672 GB/s
|280W
|Dec 2018
|-
|GeForce RTX 3090
|Turing
|10496
|328
|Yes
|24 GB GDDR6X
|GDDR6X
|936 GB/s
|350W
|Sep 2020
|-
|GeForce RTX 3080 Ti
|Turing
|10240
|320
|Yes
|12 GB GDDR6X
|GDDR6X
|912 GB/s
|350W
|May 2021
|-
|GeForce RTX 3080
|Turing
|8704
|272
|Yes
|10 GB GDDR6X
|GDDR6X
|760 GB/s
|320W
|Sep 2020
|-
|GeForce RTX 3070 Ti
|Turing
|6144
|192
|Yes
|8 GB GDDR6X
|GDDR6X
|608 GB/s
|290W
|Jun 2021
|-
|GeForce RTX 3070
|Turing
|5888
|184
|Yes
|8 GB GDDR6
|GDDR6
|448 GB/s
|220W
|Oct 2020
|-
|GeForce RTX 3060 Ti
|Turing
|4864
|152
|Yes
|8 GB GDDR6
|GDDR6
|448 GB/s
|200W
|Dec 2020
|-
|GeForce RTX 3060
|Turing
|3584
|112
|No
|12 GB GDDR6
|GDDR6
|360 GB/s
|170W
|Feb 2021
|-
|Quadro RTX 8000
|Turing
|4608
|576
|Yes
|48 GB GDDR6
|GDDR6
|624 GB/s
|295W
|Aug 2018
|-
|Quadro RTX 6000
|Turing
|4608
|576
|Yes
|24 GB GDDR6
|GDDR6
|432 GB/s
|260W
|Aug 2018
|-
|Quadro RTX 5000
|Turing
|3072
|384
|Yes
|16 GB GDDR6
|GDDR6
|448 GB/s
|230W
|Nov 2018
|-
|Quadro RTX 4000
|Turing
|2304
|288
|Yes
|8 GB GDDR6
|GDDR6
|416 GB/s
|160W
|Nov 2018
|-
|Titan RTX (T-Rex)
|Turing
|4608
|576
|Yes
|24 GB
|
|
|
|
|-
|-
|Titan V
| nvidia-smi
|Volta
| 기본 GPU 상태
|5120
|640
|
|12 GB HBM2
|HBM2
|652.8 GB/s
|250W
|Dec 2017
|-
|-
|Tesla V100 (PCIe)
| nvidia-smi -L
|Volta
| GPU UUID 목록
|5120
|640
|
|16 GB HBM2
|HBM2
|900 GB/s
|250W
|June 2017
|-
|-
|Tesla V100 (SXM2)
| nvidia-smi mig -lgi
|Volta
| MIG 인스턴스 목록
|5120
|640
|
|16 GB HBM2
|HBM2
|900 GB/s
|300W
|June 2017
|-
|-
|Quadro GV100
| nvidia-smi mig -lgip
|Volta
| MIG 프로파일 목록
|5120
|640
|
|32 GB HBM2
|HBM2
|870 GB/s
|250W
|Mar 2018
|-
|-
|Tesla GV100 (SXM2)
| dcgmi dmon
|Volta
| DCGM 고급 모니터링
|5120
|640
|
|32 GB HBM2
|HBM2
|900 GB/s
|300W
|Mar 2018
|-
|-
|DGX-1 (Volta)
| nvtop
|Volta
| 실시간 모니터링 (nvtop 설치 필요)
|5120
|640
|
|16 x 32 GB HBM2 (512 GB total)
|HBM2
|2.7 TB/s
|3200W
|Mar 2018
|}
|}


=== NVIDIA Grace Architecture ===
 
NVIDIA has announced that they will be partnering with server manufacturers such as HPE, Atos, and Supermicro to create servers that integrate the Grace architecture with ARM-based CPUs. These servers are expected to be available in the second half of 2023
== Configuration ==
 
<syntaxhighlight lang="bash">
# NVIDIA 드라이버 설치
$ sudo apt-get install nvidia-driver-535
 
# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1
 
# MIG 활성화
$ sudo nvidia-smi -mig 1
 
# GPU 상태 확인
$ nvidia-smi
 
# MIG 인스턴스 생성
$ sudo nvidia-smi mig -cgi 9,19,19,19 -C
</syntaxhighlight>
 
 
== Examples ==
 
=== Example 1: GPU 상태 확인 ===
 
<syntaxhighlight lang="bash">
# 전체 GPU 상태
$ nvidia-smi
 
# GPU UUID 확인
$ nvidia-smi -L
 
# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv
</syntaxhighlight>
 
=== Example 2: Docker에서 GPU 사용 ===
 
<syntaxhighlight lang="bash">
# 전체 GPU 사용
$ docker run --gpus all --rm nvidia/cuda:12.0 nvidia-smi
 
# 특정 GPU 사용
$ docker run --gpus '"device=0"' --rm nvidia/cuda:12.0 nvidia-smi
 
# MIG 디바이스 사용
$ docker run --gpus '"device=MIG-UUID"' --rm nvidia/cuda:12.0 nvidia-smi
</syntaxhighlight>
 
 
== Best Practices ==
 
* Persistence Mode 필수 활성화
* MIG 활성화 시 nvsm/dcgm 중지 후 진행
* 워크로드에 맞는 MIG 프로파일 선택
* DCGM v2.0.13+ 사용 (MIG 모니터링)
* 정기적인 드라이버 업데이트
* RTX PRO Blackwell은 Display Mode 먼저 Compute로 설정
* SSH 접근 확인 후 Display Mode 변경
 
 
== Limitations ==
 
* MIG 활성화/비활성화는 GPU 리셋 필요
* 그래픽 컨텍스트 미지원 (MIG)
* P2P/NVLink 미지원 (MIG)
* nvidia-smi만으로는 MIG 메트릭 확인 불가
* RTX PRO Blackwell primary display GPU는 Display Mode 변경 시 디스플레이 출력 중단
 
 
== References ==
 
* https://docs.nvidia.com/datacenter/tesla/mig-user-guide/
* https://www.nvidia.com/en-us/data-center/
 
 
== Related Pages ==
 
* [[MIG]]
* [[CUDA]]
* [[NVIDIA driver]]
* [[NVIDIA GPU Cloud (NGC)]]
* [[DCGM]]
 
 
[[Category:GPU]]
== Knowledge Graph ==
 
Related
 
→ [[CUDA]]
→ [[GPU]]
→ [[H100]]
→ [[NVLink]]
→ [[AMD GPUs]]
→ [[A100]]
→ [[MIG]]
→ [[NVIDIA GPUs]]
 
[[Category:Reference]]
 
== Latest GPU Lineup (2024-2025) ==
 
NVIDIA는 2024년 Blackwell 아키텍처와 H200를 출시. AI/ML 워크로드 성능이 크게 향상.
 
=== Blackwell B100/B200 ===
 
* 아키텍처: Blackwell (SM 10.x)
* TFLOPS (FP4): 2,900 TFLOPS
* 메모리: HBM3e, 192GB
* 메모리 대역폭: 8 TB/s
* TDP: 1,000W
* NVLink: 1.8 TB/s (B200)
* 출시: 2024년
 
=== H200 ===
 
* 아키텍처: Hopper (SM 9.0)
* 메모리: HBM3e, 141GB
* 메모리 대역폭: 4.8 TB/s
* TDP: 700W
* NVLink: 900 GB/s
* 출시: 2024년 Q2
* H100 대비 메모리 27% 증가, 대역폭 20% 증가
 
=== H100 (기존) ===
 
* 아키텍처: Hopper (SM 9.0)
* Tensor TFLOPS (FP8): 989 TFLOPS
* 메모리: HBM3, 80GB
* 메모리 대역폭: 3.35 TB/s
* TDP: 700W
* NVLink: 900 GB/s
 
=== Blackwell vs Hopper 비교 ===
 
{| class="wikitable"
{| class="wikitable"
!Architecture
! Feature ! H100 ! H200 ! B100 ! B200
!Key Features
|-
| 아키텍처 | Hopper | Hopper | Blackwell | Blackwell
|-
| Tensor TFLOPS (FP8) | 989 | 989 | ~1500 | ~2000
|-
|-
| rowspan="4" |Grace
| 메모리 | HBM3 80GB | HBM3e 141GB | HBM3e 192GB | HBM3e 288GB
|CPU-GPU integration, ARM Neoverse CPU, HBM2E memory
|-
|-
|900 GB/s memory bandwidth, support for PCIe 5.0 and NVLink
| 대역폭 | 3.35 TB/s | 4.8 TB/s | ~6 TB/s | ~8 TB/s
|-
|-
|10x performance improvement for certain HPC workloads
| TDP | 700W | 700W | 1000W | 1000W
|-
|-
|Energy efficiency improvements through unified memory space
| NVLink | 900 GB/s | 900 GB/s | 1.8 TB/s | 1.8 TB/s
|}
|}

Latest revision as of 13:37, 17 July 2026

NVIDIA GPU

Template:Status

Template:TOC

Overview

NVIDIA GPU(Graphics Processing Unit)는 병렬 컴퓨팅을 위한 그래픽 처리 장치입니다. 게이밍부터 HPC, AI/ML까지 광범위하게 사용됩니다. Ampere, Hopper, Blackwell 아키텍처를 통해 지속적인 성능 향상을 이루고 있습니다.

Summary

  • 무엇인가? — NVIDIA의 그래픽 및 컴퓨팅 처리 장치
  • 왜 필요한가? — 병렬 컴퓨팅, AI/ML 훈련/추론, 그래픽 렌더링
  • 언제 사용하는가? — AI 서버, HPC 클러스터, 워크스테이션


Purpose

이 문서가 존재하는 이유

  • Goal: NVIDIA GPU 제품군, 아키텍처, MIG, 드라이버, 모니터링 방법 제공
  • Scope: GPU 라인업, 아키텍처 비교, MIG, 드라이버 설치, nvidia-smi
  • Non-goals: CUDA 프로그래밍, 특정 애플리케이션 설정은 별도 문서


Key Concepts

Concept Description Related
Ampere SM80 아키텍처 — A100/H100 기반 NVIDIA GPU
Hopper SM90 아키텍처 — H200/B200 기반 NVIDIA GPU
Blackwell SM100 아키텍처 — B200 기반 NVIDIA GPU
MIG Multi-Instance GPU — GPU 분할 MIG
CUDA NVIDIA 병렬 컴퓨팅 플랫폼 CUDA
Tensor Core AI 연산 전용 코어 NVIDIA GPU
NVLink GPU 간 고속 연결 NVIDIA GPU
nvidia-smi GPU 모니터링/관리 도구 NVIDIA GPU


Architecture

NVIDIA GPU 아키텍처 진화:

graph LR
    A[Turing] --> B[Ampere]
    B --> C[Hopper]
    C --> D[Blackwell]
    B --> E[A100]
    B --> F[A30]
    C --> G[H100]
    C --> H[H200]
    D --> I[B200]
    D --> J[RTX PRO 6000]
    D --> K[RTX PRO 5000]


Workflow

Stage Input Output
Install Driver NVIDIA driver package nvidia-smi
Check Status nvidia-smi GPU info
Enable MIG nvidia-smi -mig 1 MIG Mode
Create Instance nvidia-smi -cgi GPU Instances
Monitor nvidia-smi / dcgmi Metrics


Detailed Explanation

GPU 제품군

제품군 아키텍처 주요 모델 용도
Data Center Ampere/Hopper/Blackwell A100, H100, H200, B200 AI/ML, HPC
RTX Workstation Ada/Blackwell RTX 6000 Ada, RTX PRO 6000 워크스테이션, VFX
GeForce Ada RTX 4090, RTX 4080 게이밍, 엔트리 AI
L-Series Ada L40S, L4 가상 데스크톱, 인퍼런스

아키텍처 비교

아키텍처 SM Tensor Core Memory Type 대표 모델
Ampere (SM80) 80 3rd Gen HBM2e/HBM2 A100, A30
Hopper (SM90) 90 4th Gen HBM3/HBM3e H100, H200
Blackwell (SM100) 100 5th Gen HBM3e B200, RTX PRO 6000

MIG (Multi-Instance GPU)

단일 GPU를 여러 격리된 인스턴스로 분할합니다. Ampere 아키텍처부터 도입되었습니다.

  • GI(GPU Instance): 완전 격리된 리소스 집합
  • CI(Compute Instance): GI 내 부분 격리된 SM 집합
  • 18가지 프로파일 조합 가능

자세한 내용은 MIG 문서를 참조하세요.

NVIDIA 드라이버

GPU CUDA Version NVIDIA Driver Version
A100 / A30 CUDA 11 R525 (>= 525.53)
H100 / H200 CUDA 12 R450 (>= 450.80.02)
B200 CUDA 12 R570 (>= 570.133.20)
RTX PRO 6000 Blackwell CUDA 12 R575 (>= 575.51.03)

nvidia-smi 기본 명령어

# GPU 상태 확인
$ nvidia-smi

# GPU 목록 확인
$ nvidia-smi -L

# 모니터링 (1초 간격)
$ nvidia-smi -l 1

# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv

# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1

# MIG 활성화
$ sudo nvidia-smi -mig 1

GPU 모니터링

명령어 설명
nvidia-smi 기본 GPU 상태
nvidia-smi -L GPU UUID 목록
nvidia-smi mig -lgi MIG 인스턴스 목록
nvidia-smi mig -lgip MIG 프로파일 목록
dcgmi dmon DCGM 고급 모니터링
nvtop 실시간 모니터링 (nvtop 설치 필요)


Configuration

# NVIDIA 드라이버 설치
$ sudo apt-get install nvidia-driver-535

# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1

# MIG 활성화
$ sudo nvidia-smi -mig 1

# GPU 상태 확인
$ nvidia-smi

# MIG 인스턴스 생성
$ sudo nvidia-smi mig -cgi 9,19,19,19 -C


Examples

Example 1: GPU 상태 확인

# 전체 GPU 상태
$ nvidia-smi

# GPU UUID 확인
$ nvidia-smi -L

# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv

Example 2: Docker에서 GPU 사용

# 전체 GPU 사용
$ docker run --gpus all --rm nvidia/cuda:12.0 nvidia-smi

# 특정 GPU 사용
$ docker run --gpus '"device=0"' --rm nvidia/cuda:12.0 nvidia-smi

# MIG 디바이스 사용
$ docker run --gpus '"device=MIG-UUID"' --rm nvidia/cuda:12.0 nvidia-smi


Best Practices

  • Persistence Mode 필수 활성화
  • MIG 활성화 시 nvsm/dcgm 중지 후 진행
  • 워크로드에 맞는 MIG 프로파일 선택
  • DCGM v2.0.13+ 사용 (MIG 모니터링)
  • 정기적인 드라이버 업데이트
  • RTX PRO Blackwell은 Display Mode 먼저 Compute로 설정
  • SSH 접근 확인 후 Display Mode 변경


Limitations

  • MIG 활성화/비활성화는 GPU 리셋 필요
  • 그래픽 컨텍스트 미지원 (MIG)
  • P2P/NVLink 미지원 (MIG)
  • nvidia-smi만으로는 MIG 메트릭 확인 불가
  • RTX PRO Blackwell primary display GPU는 Display Mode 변경 시 디스플레이 출력 중단


References


Related Pages

Knowledge Graph

Related

CUDAGPUH100NVLinkAMD GPUsA100MIGNVIDIA GPUs

Latest GPU Lineup (2024-2025)

NVIDIA는 2024년 Blackwell 아키텍처와 H200를 출시. AI/ML 워크로드 성능이 크게 향상.

Blackwell B100/B200

  • 아키텍처: Blackwell (SM 10.x)
  • TFLOPS (FP4): 2,900 TFLOPS
  • 메모리: HBM3e, 192GB
  • 메모리 대역폭: 8 TB/s
  • TDP: 1,000W
  • NVLink: 1.8 TB/s (B200)
  • 출시: 2024년

H200

  • 아키텍처: Hopper (SM 9.0)
  • 메모리: HBM3e, 141GB
  • 메모리 대역폭: 4.8 TB/s
  • TDP: 700W
  • NVLink: 900 GB/s
  • 출시: 2024년 Q2
  • H100 대비 메모리 27% 증가, 대역폭 20% 증가

H100 (기존)

  • 아키텍처: Hopper (SM 9.0)
  • Tensor TFLOPS (FP8): 989 TFLOPS
  • 메모리: HBM3, 80GB
  • 메모리 대역폭: 3.35 TB/s
  • TDP: 700W
  • NVLink: 900 GB/s

Blackwell vs Hopper 비교

Feature ! H100 ! H200 ! B100 ! B200
Hopper | Hopper | Blackwell | Blackwell
989 | 989 | ~1500 | ~2000
HBM3 80GB | HBM3e 141GB | HBM3e 192GB | HBM3e 288GB
3.35 TB/s | 4.8 TB/s | ~6 TB/s | ~8 TB/s
700W | 700W | 1000W | 1000W
900 GB/s | 900 GB/s | 1.8 TB/s | 1.8 TB/s