NVIDIA GPU: Difference between revisions

From HPCWIKI
Jump to navigation Jump to search
(Phase 0.4: Expand NVIDIA GPU)
 
(62 intermediate revisions by 2 users not shown)
Line 1: Line 1:
=== NVIDIA GPU Architecture ===
= NVIDIA GPU =


{{Status
|status=Draft
|owner=Knowledge Agent
|last_update=2026-07-15
|review=Pending
}}


nvcc sm flags and what they’re used for: When compiling with NVCC,
{{TOC}}


* the arch flag (‘'''<code>-arch</code>'''‘) specifies the name of the NVIDIA GPU architecture that the CUDA files will be compiled for.
== Overview ==
* Gencodes (‘'''<code>-gencode</code>'''‘) allows for more PTX generations and can be repeated many times for different architectures.


NVIDIA GPU(Graphics Processing Unit)는 병렬 컴퓨팅을 위한 그래픽 처리 장치입니다. 게이밍부터 HPC, AI/ML까지 광범위하게 사용됩니다. Ampere, Hopper, Blackwell 아키텍처를 통해 지속적인 성능 향상을 이루고 있습니다.


Matching CUDA arch and CUDA gencode for various NVIDIA architectures
=== Summary ===
{| class="wikitable sortable"
 
!Series
* 무엇인가? — NVIDIA의 그래픽 및 컴퓨팅 처리 장치
!Architecture
* 왜 필요한가? — 병렬 컴퓨팅, AI/ML 훈련/추론, 그래픽 렌더링
(--arch)
* 언제 사용하는가? — AI 서버, HPC 클러스터, 워크스테이션
!CUDA gencode
 
(--sm)
 
!Compute Capability
== Purpose ==
!Notable Models
 
!Key Features
이 문서가 존재하는 이유
 
* Goal: NVIDIA GPU 제품군, 아키텍처, MIG, 드라이버, 모니터링 방법 제공
* Scope: GPU 라인업, 아키텍처 비교, MIG, 드라이버 설치, nvidia-smi
* Non-goals: CUDA 프로그래밍, 특정 애플리케이션 설정은 별도 문서
 
 
== Key Concepts ==
 
{| class="wikitable"
! Concept
! Description
! Related
|-
|-
|Tesla
| Ampere
|Tesla
| SM80 아키텍처 — A100/H100 기반
|
| [[NVIDIA GPU]]
|1.0, 1.1, 2.0, 2.1
|C1060, M2050, K80, P100, V100, A100
|First dedicated GPGPU series
|-
|-
|Fermi
| Hopper
|Fermi
| SM90 아키텍처 — H200/B200 기반
|sm_20
| [[NVIDIA GPU]]
|3.0, 3.1
|GTX 400, GTX 500, Tesla 20-series, Quadro 4000/5000
|First to feature CUDA cores and support for ECC memory
|-
|-
|Kepler
| Blackwell
|Kepler
| SM100 아키텍처 — B200 기반
|sm_30,
| [[NVIDIA GPU]]
sm_35,
sm_37
|3.2, 3.5, 3.7
|GTX 600, GTX 700, Tesla K-series, Quadro K-series
|First to feature Dynamic Parallelism and Hyper-Q
|-
|-
|Maxwell
| MIG
|Maxwell
| Multi-Instance GPU — GPU 분할
|sm_50,
| [[MIG]]
sm_52,
sm_53
|5.0, 5.2
|GTX 900, GTX 1000, Quadro M-series
|First to support VR and 4K displays
|-
|-
|Pascal
| CUDA
|Pascal
| NVIDIA 병렬 컴퓨팅 플랫폼
|sm_60,
| [[CUDA]]
sm_61,
sm_62
|6.0, 6.1, 6.2
|GTX 1000, Quadro P-series
|First to support simultaneous multi-projection
|-
|-
|Volta
| Tensor Core
|Volta
| AI 연산 전용 코어
|sm_70,
| [[NVIDIA GPU]]
sm_72
(Xavier)
|7.0, 7.2, 7.5
|Titan V, Tesla V100, Quadro GV100
|First to feature Tensor Cores and NVLink 2.0
|-
|-
|Turing
| NVLink
|Turing
| GPU 간 고속 연결
|sm_75
| [[NVIDIA GPU]]
|7.5, 7.6
|RTX 2000, GTX 1600, Quadro RTX
|First to feature Ray Tracing Cores and RTX technology
|-
|-
|Ampere
| nvidia-smi
|Ampere
| GPU 모니터링/관리 도구
|sm_80,
| [[NVIDIA GPU]]
sm_86,
|}
sm_87 (Orin)
 
|8.0, 8.6
 
|RTX 3000, A-series
== Architecture ==
|Features third-generation Tensor Cores and more
|-
|Lovelace
|Ada Lovelace<ref>https://en.wikipedia.org/wiki/Ada_Lovelace_(microarchitecture)</ref>
|sm_89
|8.7, 8.9
|GeForce RTX 4070 Ti (AD104)


GeForce RTX 4080 (AD103)
NVIDIA GPU 아키텍처 진화:


GeForce RTX 4090 (AD102)
<syntaxhighlight lang="mermaid">
graph LR
    A[Turing] --> B[Ampere]
    B --> C[Hopper]
    C --> D[Blackwell]
    B --> E[A100]
    B --> F[A30]
    C --> G[H100]
    C --> H[H200]
    D --> I[B200]
    D --> J[RTX PRO 6000]
    D --> K[RTX PRO 5000]
</syntaxhighlight>


Nvidia RTX 6000 Ada Generation (AD102, formerly Quadro)


Nvidia L40 (AD102, formerly Tesla)
== Workflow ==
|
* Fourth-Gen Tensor Cores  increasing throughput by up to 5X, to 1.4 Tensor-petaFLOPS using the new FP8 Transformer Engine (like H100 model)
* Third-generation RT Cores have twice the ray-triangle intersection throughput, increasing RT-TFLOP performance by over 2x
* The new RT Cores also include a new Opacity Micromap (OMM) Engine and a new Displaced Micro-Mesh (DMM) Engine. The OMM Engine enables much faster ray tracing of alpha-tested textures often used for foliage, particles, and fences. The DMM Engine delivers up to 10X faster Bounding Volume Hierarchy (BVH) build time with up to 20X less BVH storage space, enabling real-time ray tracing of geometrically complex scenes
* Shader Execution Reordering (SER) technology dynamically reorganizes these previously inefficient workloads into considerably more efficient ones. SER can improve shader performance for ray tracing operations by up to 3X, and in-game frame rates by up to 25%.
* DLSS 3 is a revolutionary breakthrough in AI-powered graphics that massively boosts performance. Powered by the new fourth-gen Tensor Cores and Optical Flow Accelerator on GeForce RTX 40 Series GPUs, DLSS 3 uses AI to create additional high-quality frames
* Graphics cards built upon the Ada architecture feature new eighth generation NVIDIA Encoders (NVENC) with AV1 encoding, enabling a raft of new possibilities for streamers, broadcasters, and video callers.
* It’s 40% more efficient than H.264 and allows users who are streaming at 1080p to increase their stream resolution to 1440p while running at the same bitrate and quality.
|-
|Hopper
|
|sm_90, sm_90a(Thor)
|9.0
|
|
|}


=== NVIDIA GPU Models ===
{| class="wikitable"
{| class="wikitable sortable"
! Stage
!Model
! Input
!Architecture
! Output
!CUDA Cores
!Tensor Cores
!RT Cores
!Memory Size
!Memory Type
!Memory Bandwidth
!TDP
!Launch Date
|-
|-
|Tesla C870
| Install Driver
|Tesla
| NVIDIA driver package
|128
| nvidia-smi
|No
|No
|1.5 GB GDDR3
|GDDR3
|76.8 GB/s
|105W
|Jun 2006
|-
|-
|Tesla C1060
| Check Status
|Tesla
| nvidia-smi
|240
| GPU info
|No
|No
|4 GB GDDR3
|GDDR3
|102 GB/s
|238W
|Dec 2008
|-
|-
|Tesla M1060
| Enable MIG
|Tesla
| nvidia-smi -mig 1
|240
| MIG Mode
|No
|No
|4 GB GDDR3
|GDDR3
|102 GB/s
|225W
|Dec 2008
|-
|-
|Tesla M2050
| Create Instance
|Fermi
| nvidia-smi -cgi
|448
| GPU Instances
|No
|No
|3 GB GDDR5
|GDDR5
|148 GB/s
|225W
|May 2010
|-
|-
|Tesla M2070
| Monitor
|Fermi
| nvidia-smi / dcgmi
|448
| Metrics
|No
|}
|No
 
|6 GB GDDR5
 
|GDDR5
== Detailed Explanation ==
|150 GB/s
 
|225W
=== GPU 제품군 ===
|May 2010
 
{| class="wikitable"
! 제품군
! 아키텍처
! 주요 모델
! 용도
|-
|-
|Tesla K10
| Data Center
|Kepler
| Ampere/Hopper/Blackwell
|3072
| A100, H100, H200, B200
|No
| AI/ML, HPC
|No
|8 GB GDDR5
|GDDR5
|320 GB/s
|225W
|May 2012
|-
|-
|Tesla K20
| RTX Workstation
|Kepler
| Ada/Blackwell
|2496
| RTX 6000 Ada, RTX PRO 6000
|No
| 워크스테이션, VFX
|No
|5/6 GB GDDR5
|GDDR5
|208 GB/s
|225W
|Nov 2012
|-
|-
|Tesla K40
| GeForce
|Kepler
| Ada
|2880
| RTX 4090, RTX 4080
|No
| 게이밍, 엔트리 AI
|No
|12 GB GDDR5
|GDDR5
|288 GB/s
|235W
|Nov 2013
|-
|-
|Tesla K80
| L-Series
|Kepler
| Ada
|4992
| L40S, L4
|No
| 가상 데스크톱, 인퍼런스
|No
|}
|24 GB GDDR5
 
|GDDR5
=== 아키텍처 비교 ===
|480 GB/s
 
|300W
{| class="wikitable"
|Nov 2014
! 아키텍처
! SM
! Tensor Core
! Memory Type
! 대표 모델
|-
|-
|Tesla M40
| Ampere (SM80)
|Maxwell
| 80
|3072
| 3rd Gen
|No
| HBM2e/HBM2
|No
| A100, A30
|12 GB GDDR5
|GDDR5
|288 GB/s
|250W
|Nov 2015
|-
|-
|Tesla P4
| Hopper (SM90)
|Pascal
| 90
|2560
| 4th Gen
|No
| HBM3/HBM3e
|No
| H100, H200
|8 GB GDDR5
|GDDR5
|192 GB/s
|75W
|Sep 2016
|-
|-
|Tesla P40
| Blackwell (SM100)
|Pascal
| 100
|3840
| 5th Gen
|No
| HBM3e
|No
| B200, RTX PRO 6000
|24 GB GDDR5X
|}
|GDDR5X
 
|480 GB/s
=== MIG (Multi-Instance GPU) ===
|250W
 
|Sep 2016
단일 GPU를 여러 격리된 인스턴스로 분할합니다. Ampere 아키텍처부터 도입되었습니다.
 
* GI(GPU Instance): 완전 격리된 리소스 집합
* CI(Compute Instance): GI 내 부분 격리된 SM 집합
* 18가지 프로파일 조합 가능
 
자세한 내용은 [[MIG]] 문서를 참조하세요.
 
=== NVIDIA 드라이버 ===
 
{| class="wikitable"
! GPU
! CUDA Version
! NVIDIA Driver Version
|-
|-
|Tesla V100
| A100 / A30
|Volta
| CUDA 11
|5120
| R525 (>= 525.53)
|640
|Yes
|16/32 GB HBM2
|HBM2
|900 GB/s
|300W
|May 2017
|-
|-
|Tesla T4
| H100 / H200
|Turing
| CUDA 12
|2560
| R450 (>= 450.80.02)
|320
|No
|16 GB
|
|
|
|
|-
|-
|A100 PCIe
| B200
|Ampere
| CUDA 12
|6912
| R570 (>= 570.133.20)
|432
|Yes
|40 GB HBM2 / 80 GB HBM2
|HBM2
|1555 GB/s
|250W
|May 2020
|-
|-
|A100 SXM4
| RTX PRO 6000 Blackwell
|Ampere
| CUDA 12
|6912
| R575 (>= 575.51.03)
|432
|}
|Yes
 
|40 GB HBM2 / 80 GB HBM2
=== nvidia-smi 기본 명령어 ===
|HBM2
 
|1555 GB/s
<syntaxhighlight lang="bash">
|400W
# GPU 상태 확인
|May 2020
$ nvidia-smi
|-
 
|A30
# GPU 목록 확인
|Ampere
$ nvidia-smi -L
|7424
 
|184
# 모니터링 (1초 간격)
|No
$ nvidia-smi -l 1
|24 GB GDDR6
 
|GDDR6
# MIG 상태 확인
|696 GB/s
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv
|165W
 
|Apr 2021
# Persistence Mode 활성화
|-
$ sudo nvidia-smi -pm 1
|A40
 
|Ampere
# MIG 활성화
|10752
$ sudo nvidia-smi -mig 1
|336
</syntaxhighlight>
|No
 
|48 GB GDDR6
=== GPU 모니터링 ===
|GDDR6
 
|696 GB/s
{| class="wikitable"
|300W
! 명령어
|Apr 2021
! 설명
|-
|A10
|Ampere
|10240
|320
|No
|24 GB GDDR6
|GDDR6
|624 GB/s
|150W
|Mar 2021
|-
|A16
|Ampere
|16384
|512
|No
|48 GB GDDR6
|GDDR6
|768 GB/s
|400W
|Mar 2021
|-
|A100 80GB
|Ampere
|6912
|432
|Yes
|80 GB HBM2
|HBM2
|2025 GB/s
|400W
|Apr 2021
|-
|A100 40GB
|Ampere
|6912
|432
|Yes
|40 GB HBM2
|HBM2
|1555 GB/s
|250W
|May 2020
|-
|A200 PCIe
|Ampere
|10752
|672
|Yes
|80 GB HBM2 / 160 GB HBM2
|HBM2
|2050 GB/s
|400W
|Nov 2021
|-
|A200 SXM4
|Ampere
|10752
|672
|Yes
|80 GB HBM2 / 160 GB HBM2
|HBM2
|2050 GB/s
|400W
|Nov 2021
|-
|A5000
|Ampere
|8192
|256
|Yes
|24 GB GDDR6
|GDDR6
|768 GB/s
|230W
|Apr 2021
|-
|-
|A4000
| nvidia-smi
|Ampere
| 기본 GPU 상태
|6144
|192
|Yes
|16 GB GDDR6
|GDDR6
|512 GB/s
|140W
|Apr 2021
|-
|-
|A3000
| nvidia-smi -L
|Ampere
| GPU UUID 목록
|3584
|112
|Yes
|24 GB G
|
|
|
|
|-
|-
|Titan RTX
| nvidia-smi mig -lgi
|Turing
| MIG 인스턴스 목록
|4608
|576
|Yes
|24 GB GDDR6
|GDDR6
|672 GB/s
|280W
|Dec 2018
|-
|-
|GeForce RTX 3090
| nvidia-smi mig -lgip
|Turing
| MIG 프로파일 목록
|10496
|328
|Yes
|24 GB GDDR6X
|GDDR6X
|936 GB/s
|350W
|Sep 2020
|-
|-
|GeForce RTX 3080 Ti
| dcgmi dmon
|Turing
| DCGM 고급 모니터링
|10240
|320
|Yes
|12 GB GDDR6X
|GDDR6X
|912 GB/s
|350W
|May 2021
|-
|-
|GeForce RTX 3080
| nvtop
|Turing
| 실시간 모니터링 (nvtop 설치 필요)
|8704
|272
|Yes
|10 GB GDDR6X
|GDDR6X
|760 GB/s
|320W
|Sep 2020
|-
|GeForce RTX 3070 Ti
|Turing
|6144
|192
|Yes
|8 GB GDDR6X
|GDDR6X
|608 GB/s
|290W
|Jun 2021
|-
|GeForce RTX 3070
|Turing
|5888
|184
|Yes
|8 GB GDDR6
|GDDR6
|448 GB/s
|220W
|Oct 2020
|-
|GeForce RTX 3060 Ti
|Turing
|4864
|152
|Yes
|8 GB GDDR6
|GDDR6
|448 GB/s
|200W
|Dec 2020
|-
|GeForce RTX 3060
|Turing
|3584
|112
|No
|12 GB GDDR6
|GDDR6
|360 GB/s
|170W
|Feb 2021
|-
|Quadro RTX 8000
|Turing
|4608
|576
|Yes
|48 GB GDDR6
|GDDR6
|624 GB/s
|295W
|Aug 2018
|-
|Quadro RTX 6000
|Turing
|4608
|576
|Yes
|24 GB GDDR6
|GDDR6
|432 GB/s
|260W
|Aug 2018
|-
|Quadro RTX 5000
|Turing
|3072
|384
|Yes
|16 GB GDDR6
|GDDR6
|448 GB/s
|230W
|Nov 2018
|-
|Quadro RTX 4000
|Turing
|2304
|288
|Yes
|8 GB GDDR6
|GDDR6
|416 GB/s
|160W
|Nov 2018
|-
|Titan RTX (T-Rex)
|Turing
|4608
|576
|Yes
|24 GB
|
|
|
|
|-
|Titan V
|Volta
|5120
|640
|
|12 GB HBM2
|HBM2
|652.8 GB/s
|250W
|Dec 2017
|-
|Tesla V100 (PCIe)
|Volta
|5120
|640
|
|16 GB HBM2
|HBM2
|900 GB/s
|250W
|June 2017
|-
|Tesla V100 (SXM2)
|Volta
|5120
|640
|
|16 GB HBM2
|HBM2
|900 GB/s
|300W
|June 2017
|-
|Quadro GV100
|Volta
|5120
|640
|
|32 GB HBM2
|HBM2
|870 GB/s
|250W
|Mar 2018
|-
|Tesla GV100 (SXM2)
|Volta
|5120
|640
|
|32 GB HBM2
|HBM2
|900 GB/s
|300W
|Mar 2018
|-
|DGX-1 (Volta)
|Volta
|5120
|640
|
|16 x 32 GB HBM2 (512 GB total)
|HBM2
|2.7 TB/s
|3200W
|Mar 2018
|}
|}


=== NVIDIA Grace Architecture ===
 
NVIDIA has announced that they will be partnering with server manufacturers such as HPE, Atos, and Supermicro to create servers that integrate the Grace architecture with ARM-based CPUs. These servers are expected to be available in the second half of 2023
== Configuration ==
 
<syntaxhighlight lang="bash">
# NVIDIA 드라이버 설치
$ sudo apt-get install nvidia-driver-535
 
# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1
 
# MIG 활성화
$ sudo nvidia-smi -mig 1
 
# GPU 상태 확인
$ nvidia-smi
 
# MIG 인스턴스 생성
$ sudo nvidia-smi mig -cgi 9,19,19,19 -C
</syntaxhighlight>
 
 
== Examples ==
 
=== Example 1: GPU 상태 확인 ===
 
<syntaxhighlight lang="bash">
# 전체 GPU 상태
$ nvidia-smi
 
# GPU UUID 확인
$ nvidia-smi -L
 
# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv
</syntaxhighlight>
 
=== Example 2: Docker에서 GPU 사용 ===
 
<syntaxhighlight lang="bash">
# 전체 GPU 사용
$ docker run --gpus all --rm nvidia/cuda:12.0 nvidia-smi
 
# 특정 GPU 사용
$ docker run --gpus '"device=0"' --rm nvidia/cuda:12.0 nvidia-smi
 
# MIG 디바이스 사용
$ docker run --gpus '"device=MIG-UUID"' --rm nvidia/cuda:12.0 nvidia-smi
</syntaxhighlight>
 
 
== Best Practices ==
 
* Persistence Mode 필수 활성화
* MIG 활성화 시 nvsm/dcgm 중지 후 진행
* 워크로드에 맞는 MIG 프로파일 선택
* DCGM v2.0.13+ 사용 (MIG 모니터링)
* 정기적인 드라이버 업데이트
* RTX PRO Blackwell은 Display Mode 먼저 Compute로 설정
* SSH 접근 확인 후 Display Mode 변경
 
 
== Limitations ==
 
* MIG 활성화/비활성화는 GPU 리셋 필요
* 그래픽 컨텍스트 미지원 (MIG)
* P2P/NVLink 미지원 (MIG)
* nvidia-smi만으로는 MIG 메트릭 확인 불가
* RTX PRO Blackwell primary display GPU는 Display Mode 변경 시 디스플레이 출력 중단
 
 
== References ==
 
* https://docs.nvidia.com/datacenter/tesla/mig-user-guide/
* https://www.nvidia.com/en-us/data-center/
 
 
== Related Pages ==
 
* [[MIG]]
* [[CUDA]]
* [[NVIDIA driver]]
* [[NVIDIA GPU Cloud (NGC)]]
* [[DCGM]]
 
 
[[Category:GPU]]
== Knowledge Graph ==
 
Related
 
→ [[CUDA]]
→ [[GPU]]
→ [[H100]]
→ [[NVLink]]
→ [[AMD GPUs]]
→ [[A100]]
→ [[MIG]]
→ [[NVIDIA GPUs]]
 
[[Category:Reference]]
 
== Latest GPU Lineup (2024-2025) ==
 
NVIDIA는 2024년 Blackwell 아키텍처와 H200를 출시. AI/ML 워크로드 성능이 크게 향상.
 
=== Blackwell B100/B200 ===
 
* 아키텍처: Blackwell (SM 10.x)
* TFLOPS (FP4): 2,900 TFLOPS
* 메모리: HBM3e, 192GB
* 메모리 대역폭: 8 TB/s
* TDP: 1,000W
* NVLink: 1.8 TB/s (B200)
* 출시: 2024년
 
=== H200 ===
 
* 아키텍처: Hopper (SM 9.0)
* 메모리: HBM3e, 141GB
* 메모리 대역폭: 4.8 TB/s
* TDP: 700W
* NVLink: 900 GB/s
* 출시: 2024년 Q2
* H100 대비 메모리 27% 증가, 대역폭 20% 증가
 
=== H100 (기존) ===
 
* 아키텍처: Hopper (SM 9.0)
* Tensor TFLOPS (FP8): 989 TFLOPS
* 메모리: HBM3, 80GB
* 메모리 대역폭: 3.35 TB/s
* TDP: 700W
* NVLink: 900 GB/s
 
=== Blackwell vs Hopper 비교 ===
 
{| class="wikitable"
{| class="wikitable"
!Architecture
! Feature ! H100 ! H200 ! B100 ! B200
!Key Features
|-
|-
| rowspan="4" |Grace
| 아키텍처 | Hopper | Hopper | Blackwell | Blackwell
|CPU-GPU integration, ARM Neoverse CPU, HBM2E memory
|-
|-
|900 GB/s memory bandwidth, support for PCIe 5.0 and NVLink
| Tensor TFLOPS (FP8) | 989 | 989 | ~1500 | ~2000
|-
|-
|10x performance improvement for certain HPC workloads
| 메모리 | HBM3 80GB | HBM3e 141GB | HBM3e 192GB | HBM3e 288GB
|-
|-
|Energy efficiency improvements through unified memory space
| 대역폭 | 3.35 TB/s | 4.8 TB/s | ~6 TB/s | ~8 TB/s
|-
| TDP | 700W | 700W | 1000W | 1000W
|-
| NVLink | 900 GB/s | 900 GB/s | 1.8 TB/s | 1.8 TB/s
|}
|}
=== Reference ===
<references/>

Latest revision as of 13:37, 17 July 2026

NVIDIA GPU

Template:Status

Template:TOC

Overview

NVIDIA GPU(Graphics Processing Unit)는 병렬 컴퓨팅을 위한 그래픽 처리 장치입니다. 게이밍부터 HPC, AI/ML까지 광범위하게 사용됩니다. Ampere, Hopper, Blackwell 아키텍처를 통해 지속적인 성능 향상을 이루고 있습니다.

Summary

  • 무엇인가? — NVIDIA의 그래픽 및 컴퓨팅 처리 장치
  • 왜 필요한가? — 병렬 컴퓨팅, AI/ML 훈련/추론, 그래픽 렌더링
  • 언제 사용하는가? — AI 서버, HPC 클러스터, 워크스테이션


Purpose

이 문서가 존재하는 이유

  • Goal: NVIDIA GPU 제품군, 아키텍처, MIG, 드라이버, 모니터링 방법 제공
  • Scope: GPU 라인업, 아키텍처 비교, MIG, 드라이버 설치, nvidia-smi
  • Non-goals: CUDA 프로그래밍, 특정 애플리케이션 설정은 별도 문서


Key Concepts

Concept Description Related
Ampere SM80 아키텍처 — A100/H100 기반 NVIDIA GPU
Hopper SM90 아키텍처 — H200/B200 기반 NVIDIA GPU
Blackwell SM100 아키텍처 — B200 기반 NVIDIA GPU
MIG Multi-Instance GPU — GPU 분할 MIG
CUDA NVIDIA 병렬 컴퓨팅 플랫폼 CUDA
Tensor Core AI 연산 전용 코어 NVIDIA GPU
NVLink GPU 간 고속 연결 NVIDIA GPU
nvidia-smi GPU 모니터링/관리 도구 NVIDIA GPU


Architecture

NVIDIA GPU 아키텍처 진화:

graph LR
    A[Turing] --> B[Ampere]
    B --> C[Hopper]
    C --> D[Blackwell]
    B --> E[A100]
    B --> F[A30]
    C --> G[H100]
    C --> H[H200]
    D --> I[B200]
    D --> J[RTX PRO 6000]
    D --> K[RTX PRO 5000]


Workflow

Stage Input Output
Install Driver NVIDIA driver package nvidia-smi
Check Status nvidia-smi GPU info
Enable MIG nvidia-smi -mig 1 MIG Mode
Create Instance nvidia-smi -cgi GPU Instances
Monitor nvidia-smi / dcgmi Metrics


Detailed Explanation

GPU 제품군

제품군 아키텍처 주요 모델 용도
Data Center Ampere/Hopper/Blackwell A100, H100, H200, B200 AI/ML, HPC
RTX Workstation Ada/Blackwell RTX 6000 Ada, RTX PRO 6000 워크스테이션, VFX
GeForce Ada RTX 4090, RTX 4080 게이밍, 엔트리 AI
L-Series Ada L40S, L4 가상 데스크톱, 인퍼런스

아키텍처 비교

아키텍처 SM Tensor Core Memory Type 대표 모델
Ampere (SM80) 80 3rd Gen HBM2e/HBM2 A100, A30
Hopper (SM90) 90 4th Gen HBM3/HBM3e H100, H200
Blackwell (SM100) 100 5th Gen HBM3e B200, RTX PRO 6000

MIG (Multi-Instance GPU)

단일 GPU를 여러 격리된 인스턴스로 분할합니다. Ampere 아키텍처부터 도입되었습니다.

  • GI(GPU Instance): 완전 격리된 리소스 집합
  • CI(Compute Instance): GI 내 부분 격리된 SM 집합
  • 18가지 프로파일 조합 가능

자세한 내용은 MIG 문서를 참조하세요.

NVIDIA 드라이버

GPU CUDA Version NVIDIA Driver Version
A100 / A30 CUDA 11 R525 (>= 525.53)
H100 / H200 CUDA 12 R450 (>= 450.80.02)
B200 CUDA 12 R570 (>= 570.133.20)
RTX PRO 6000 Blackwell CUDA 12 R575 (>= 575.51.03)

nvidia-smi 기본 명령어

# GPU 상태 확인
$ nvidia-smi

# GPU 목록 확인
$ nvidia-smi -L

# 모니터링 (1초 간격)
$ nvidia-smi -l 1

# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv

# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1

# MIG 활성화
$ sudo nvidia-smi -mig 1

GPU 모니터링

명령어 설명
nvidia-smi 기본 GPU 상태
nvidia-smi -L GPU UUID 목록
nvidia-smi mig -lgi MIG 인스턴스 목록
nvidia-smi mig -lgip MIG 프로파일 목록
dcgmi dmon DCGM 고급 모니터링
nvtop 실시간 모니터링 (nvtop 설치 필요)


Configuration

# NVIDIA 드라이버 설치
$ sudo apt-get install nvidia-driver-535

# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1

# MIG 활성화
$ sudo nvidia-smi -mig 1

# GPU 상태 확인
$ nvidia-smi

# MIG 인스턴스 생성
$ sudo nvidia-smi mig -cgi 9,19,19,19 -C


Examples

Example 1: GPU 상태 확인

# 전체 GPU 상태
$ nvidia-smi

# GPU UUID 확인
$ nvidia-smi -L

# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv

Example 2: Docker에서 GPU 사용

# 전체 GPU 사용
$ docker run --gpus all --rm nvidia/cuda:12.0 nvidia-smi

# 특정 GPU 사용
$ docker run --gpus '"device=0"' --rm nvidia/cuda:12.0 nvidia-smi

# MIG 디바이스 사용
$ docker run --gpus '"device=MIG-UUID"' --rm nvidia/cuda:12.0 nvidia-smi


Best Practices

  • Persistence Mode 필수 활성화
  • MIG 활성화 시 nvsm/dcgm 중지 후 진행
  • 워크로드에 맞는 MIG 프로파일 선택
  • DCGM v2.0.13+ 사용 (MIG 모니터링)
  • 정기적인 드라이버 업데이트
  • RTX PRO Blackwell은 Display Mode 먼저 Compute로 설정
  • SSH 접근 확인 후 Display Mode 변경


Limitations

  • MIG 활성화/비활성화는 GPU 리셋 필요
  • 그래픽 컨텍스트 미지원 (MIG)
  • P2P/NVLink 미지원 (MIG)
  • nvidia-smi만으로는 MIG 메트릭 확인 불가
  • RTX PRO Blackwell primary display GPU는 Display Mode 변경 시 디스플레이 출력 중단


References


Related Pages

Knowledge Graph

Related

CUDAGPUH100NVLinkAMD GPUsA100MIGNVIDIA GPUs

Latest GPU Lineup (2024-2025)

NVIDIA는 2024년 Blackwell 아키텍처와 H200를 출시. AI/ML 워크로드 성능이 크게 향상.

Blackwell B100/B200

  • 아키텍처: Blackwell (SM 10.x)
  • TFLOPS (FP4): 2,900 TFLOPS
  • 메모리: HBM3e, 192GB
  • 메모리 대역폭: 8 TB/s
  • TDP: 1,000W
  • NVLink: 1.8 TB/s (B200)
  • 출시: 2024년

H200

  • 아키텍처: Hopper (SM 9.0)
  • 메모리: HBM3e, 141GB
  • 메모리 대역폭: 4.8 TB/s
  • TDP: 700W
  • NVLink: 900 GB/s
  • 출시: 2024년 Q2
  • H100 대비 메모리 27% 증가, 대역폭 20% 증가

H100 (기존)

  • 아키텍처: Hopper (SM 9.0)
  • Tensor TFLOPS (FP8): 989 TFLOPS
  • 메모리: HBM3, 80GB
  • 메모리 대역폭: 3.35 TB/s
  • TDP: 700W
  • NVLink: 900 GB/s

Blackwell vs Hopper 비교

Feature ! H100 ! H200 ! B100 ! B200
Hopper | Hopper | Blackwell | Blackwell
989 | 989 | ~1500 | ~2000
HBM3 80GB | HBM3e 141GB | HBM3e 192GB | HBM3e 288GB
3.35 TB/s | 4.8 TB/s | ~6 TB/s | ~8 TB/s
700W | 700W | 1000W | 1000W
900 GB/s | 900 GB/s | 1.8 TB/s | 1.8 TB/s