NVIDIA GPU: Difference between revisions

From HPCWIKI
Jump to navigation Jump to search
(새 문서: NVIDIA Gpu Architecture {| class="wikitable sortable" !Series !Architecture !Notable Models !Key Features |- |Tesla |Tesla |C1060, M2050, K80, P100, V100, A100 |First dedicated GPGPU series |- |Fermi |Fermi |GTX 400, GTX 500, Tesla 20-series, Quadro 4000/5000 |First to feature CUDA cores and support for ECC memory |- |Kepler |Kepler |GTX 600, GTX 700, Tesla K-series, Quadro K-series |First to feature Dynamic Parallelism and Hyper-Q |- |Maxwell |Maxwell |GTX 900, GTX 1000, Quadro...)
 
(Phase 0.4: Expand NVIDIA GPU)
 
(71 intermediate revisions by 2 users not shown)
Line 1: Line 1:
NVIDIA Gpu Architecture
= NVIDIA GPU =
{| class="wikitable sortable"
 
!Series
{{Status
!Architecture
|status=Draft
!Notable Models
|owner=Knowledge Agent
!Key Features
|last_update=2026-07-15
|review=Pending
}}
 
{{TOC}}
 
== Overview ==
 
NVIDIA GPU(Graphics Processing Unit)는 병렬 컴퓨팅을 위한 그래픽 처리 장치입니다. 게이밍부터 HPC, AI/ML까지 광범위하게 사용됩니다. Ampere, Hopper, Blackwell 아키텍처를 통해 지속적인 성능 향상을 이루고 있습니다.
 
=== Summary ===
 
* 무엇인가? — NVIDIA의 그래픽 및 컴퓨팅 처리 장치
* 왜 필요한가? — 병렬 컴퓨팅, AI/ML 훈련/추론, 그래픽 렌더링
* 언제 사용하는가? — AI 서버, HPC 클러스터, 워크스테이션
 
 
== Purpose ==
 
이 문서가 존재하는 이유
 
* Goal: NVIDIA GPU 제품군, 아키텍처, MIG, 드라이버, 모니터링 방법 제공
* Scope: GPU 라인업, 아키텍처 비교, MIG, 드라이버 설치, nvidia-smi
* Non-goals: CUDA 프로그래밍, 특정 애플리케이션 설정은 별도 문서
 
 
== Key Concepts ==
 
{| class="wikitable"
! Concept
! Description
! Related
|-
|-
|Tesla
| Ampere
|Tesla
| SM80 아키텍처 — A100/H100 기반
|C1060, M2050, K80, P100, V100, A100
| [[NVIDIA GPU]]
|First dedicated GPGPU series
|-
|-
|Fermi
| Hopper
|Fermi
| SM90 아키텍처 — H200/B200 기반
|GTX 400, GTX 500, Tesla 20-series, Quadro 4000/5000
| [[NVIDIA GPU]]
|First to feature CUDA cores and support for ECC memory
|-
|-
|Kepler
| Blackwell
|Kepler
| SM100 아키텍처 — B200 기반
|GTX 600, GTX 700, Tesla K-series, Quadro K-series
| [[NVIDIA GPU]]
|First to feature Dynamic Parallelism and Hyper-Q
|-
|-
|Maxwell
| MIG
|Maxwell
| Multi-Instance GPU — GPU 분할
|GTX 900, GTX 1000, Quadro M-series
| [[MIG]]
|First to support VR and 4K displays
|-
|-
|Pascal
| CUDA
|Pascal
| NVIDIA 병렬 컴퓨팅 플랫폼
|GTX 1000, Quadro P-series
| [[CUDA]]
|First to support simultaneous multi-projection
|-
|-
|Volta
| Tensor Core
|Volta
| AI 연산 전용 코어
|Titan V, Tesla V100, Quadro GV100
| [[NVIDIA GPU]]
|First to feature Tensor Cores and NVLink 2.0
|-
|-
|Turing
| NVLink
|Turing
| GPU 간 고속 연결
|RTX 2000, GTX 1600, Quadro RTX
| [[NVIDIA GPU]]
|First to feature Ray Tracing Cores and RTX technology
|-
|-
|Ampere
| nvidia-smi
|Ampere
| GPU 모니터링/관리 도구
|RTX 3000, A-series
| [[NVIDIA GPU]]
|Features third-generation Tensor Cores and more
|}
 
 
== Architecture ==
 
NVIDIA GPU 아키텍처 진화:
 
<syntaxhighlight lang="mermaid">
graph LR
    A[Turing] --> B[Ampere]
    B --> C[Hopper]
    C --> D[Blackwell]
    B --> E[A100]
    B --> F[A30]
    C --> G[H100]
    C --> H[H200]
    D --> I[B200]
    D --> J[RTX PRO 6000]
    D --> K[RTX PRO 5000]
</syntaxhighlight>
 
 
== Workflow ==
 
{| class="wikitable"
! Stage
! Input
! Output
|-
|-
|Grace
| Install Driver
|
| NVIDIA driver package
|
| nvidia-smi
|
|-
* CPU-GPU integration, ARM Neoverse CPU, HBM2E memory
| Check Status
* 900 GB/s memory bandwidth, support for PCIe 5.0 and NVLink
| nvidia-smi
* 10x performance improvement for certain HPC workloads
| GPU info
* Energy efficiency improvements through unified memory space
|-
| Enable MIG
| nvidia-smi -mig 1
| MIG Mode
|-
| Create Instance
| nvidia-smi -cgi
| GPU Instances
|-
| Monitor
| nvidia-smi / dcgmi
| Metrics
|}
 
 
== Detailed Explanation ==
 
=== GPU 제품군 ===
 
{| class="wikitable"
! 제품군
! 아키텍처
! 주요 모델
! 용도
|-
| Data Center
| Ampere/Hopper/Blackwell
| A100, H100, H200, B200
| AI/ML, HPC
|-
| RTX Workstation
| Ada/Blackwell
| RTX 6000 Ada, RTX PRO 6000
| 워크스테이션, VFX
|-
| GeForce
| Ada
| RTX 4090, RTX 4080
| 게이밍, 엔트리 AI
|-
| L-Series
| Ada
| L40S, L4
| 가상 데스크톱, 인퍼런스
|}
 
=== 아키텍처 비교 ===
 
{| class="wikitable"
! 아키텍처
! SM
! Tensor Core
! Memory Type
! 대표 모델
|-
| Ampere (SM80)
| 80
| 3rd Gen
| HBM2e/HBM2
| A100, A30
|-
| Hopper (SM90)
| 90
| 4th Gen
| HBM3/HBM3e
| H100, H200
|-
| Blackwell (SM100)
| 100
| 5th Gen
| HBM3e
| B200, RTX PRO 6000
|}
 
=== MIG (Multi-Instance GPU) ===
 
단일 GPU를 여러 격리된 인스턴스로 분할합니다. Ampere 아키텍처부터 도입되었습니다.
 
* GI(GPU Instance): 완전 격리된 리소스 집합
* CI(Compute Instance): GI 내 부분 격리된 SM 집합
* 18가지 프로파일 조합 가능
 
자세한 내용은 [[MIG]] 문서를 참조하세요.
 
=== NVIDIA 드라이버 ===
 
{| class="wikitable"
! GPU
! CUDA Version
! NVIDIA Driver Version
|-
| A100 / A30
| CUDA 11
| R525 (>= 525.53)
|-
| H100 / H200
| CUDA 12
| R450 (>= 450.80.02)
|-
| B200
| CUDA 12
| R570 (>= 570.133.20)
|-
| RTX PRO 6000 Blackwell
| CUDA 12
| R575 (>= 575.51.03)
|}
 
=== nvidia-smi 기본 명령어 ===
 
<syntaxhighlight lang="bash">
# GPU 상태 확인
$ nvidia-smi
 
# GPU 목록 확인
$ nvidia-smi -L
 
# 모니터링 (1초 간격)
$ nvidia-smi -l 1
 
# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv
 
# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1
 
# MIG 활성화
$ sudo nvidia-smi -mig 1
</syntaxhighlight>
 
=== GPU 모니터링 ===
 
{| class="wikitable"
! 명령어
! 설명
|-
| nvidia-smi
| 기본 GPU 상태
|-
| nvidia-smi -L
| GPU UUID 목록
|-
| nvidia-smi mig -lgi
| MIG 인스턴스 목록
|-
| nvidia-smi mig -lgip
| MIG 프로파일 목록
|-
| dcgmi dmon
| DCGM 고급 모니터링
|-
| nvtop
| 실시간 모니터링 (nvtop 설치 필요)
|}
 
 
== Configuration ==
 
<syntaxhighlight lang="bash">
# NVIDIA 드라이버 설치
$ sudo apt-get install nvidia-driver-535
 
# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1
 
# MIG 활성화
$ sudo nvidia-smi -mig 1
 
# GPU 상태 확인
$ nvidia-smi
 
# MIG 인스턴스 생성
$ sudo nvidia-smi mig -cgi 9,19,19,19 -C
</syntaxhighlight>
 
 
== Examples ==
 
=== Example 1: GPU 상태 확인 ===
 
<syntaxhighlight lang="bash">
# 전체 GPU 상태
$ nvidia-smi
 
# GPU UUID 확인
$ nvidia-smi -L
 
# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv
</syntaxhighlight>
 
=== Example 2: Docker에서 GPU 사용 ===
 
<syntaxhighlight lang="bash">
# 전체 GPU 사용
$ docker run --gpus all --rm nvidia/cuda:12.0 nvidia-smi
 
# 특정 GPU 사용
$ docker run --gpus '"device=0"' --rm nvidia/cuda:12.0 nvidia-smi
 
# MIG 디바이스 사용
$ docker run --gpus '"device=MIG-UUID"' --rm nvidia/cuda:12.0 nvidia-smi
</syntaxhighlight>
 
 
== Best Practices ==
 
* Persistence Mode 필수 활성화
* MIG 활성화 시 nvsm/dcgm 중지 후 진행
* 워크로드에 맞는 MIG 프로파일 선택
* DCGM v2.0.13+ 사용 (MIG 모니터링)
* 정기적인 드라이버 업데이트
* RTX PRO Blackwell은 Display Mode 먼저 Compute로 설정
* SSH 접근 확인 후 Display Mode 변경
 
 
== Limitations ==
 
* MIG 활성화/비활성화는 GPU 리셋 필요
* 그래픽 컨텍스트 미지원 (MIG)
* P2P/NVLink 미지원 (MIG)
* nvidia-smi만으로는 MIG 메트릭 확인 불가
* RTX PRO Blackwell primary display GPU는 Display Mode 변경 시 디스플레이 출력 중단
 
 
== References ==
 
* https://docs.nvidia.com/datacenter/tesla/mig-user-guide/
* https://www.nvidia.com/en-us/data-center/
 
 
== Related Pages ==
 
* [[MIG]]
* [[CUDA]]
* [[NVIDIA driver]]
* [[NVIDIA GPU Cloud (NGC)]]
* [[DCGM]]
 
 
[[Category:GPU]]
== Knowledge Graph ==
 
Related
 
→ [[CUDA]]
→ [[GPU]]
→ [[H100]]
→ [[NVLink]]
→ [[AMD GPUs]]
→ [[A100]]
→ [[MIG]]
→ [[NVIDIA GPUs]]
 
[[Category:Reference]]
 
== Latest GPU Lineup (2024-2025) ==
 
NVIDIA는 2024년 Blackwell 아키텍처와 H200를 출시. AI/ML 워크로드 성능이 크게 향상.
 
=== Blackwell B100/B200 ===
 
* 아키텍처: Blackwell (SM 10.x)
* TFLOPS (FP4): 2,900 TFLOPS
* 메모리: HBM3e, 192GB
* 메모리 대역폭: 8 TB/s
* TDP: 1,000W
* NVLink: 1.8 TB/s (B200)
* 출시: 2024년
 
=== H200 ===
 
* 아키텍처: Hopper (SM 9.0)
* 메모리: HBM3e, 141GB
* 메모리 대역폭: 4.8 TB/s
* TDP: 700W
* NVLink: 900 GB/s
* 출시: 2024년 Q2
* H100 대비 메모리 27% 증가, 대역폭 20% 증가
 
=== H100 (기존) ===
 
* 아키텍처: Hopper (SM 9.0)
* Tensor TFLOPS (FP8): 989 TFLOPS
* 메모리: HBM3, 80GB
* 메모리 대역폭: 3.35 TB/s
* TDP: 700W
* NVLink: 900 GB/s
 
=== Blackwell vs Hopper 비교 ===
 
{| class="wikitable"
! Feature ! H100 ! H200 ! B100 ! B200
|-
| 아키텍처 | Hopper | Hopper | Blackwell | Blackwell
|-
| Tensor TFLOPS (FP8) | 989 | 989 | ~1500 | ~2000
|-
| 메모리 | HBM3 80GB | HBM3e 141GB | HBM3e 192GB | HBM3e 288GB
|-
| 대역폭 | 3.35 TB/s | 4.8 TB/s | ~6 TB/s | ~8 TB/s
|-
| TDP | 700W | 700W | 1000W | 1000W
|-
| NVLink | 900 GB/s | 900 GB/s | 1.8 TB/s | 1.8 TB/s
|}
|}

Latest revision as of 13:37, 17 July 2026

NVIDIA GPU

Template:Status

Template:TOC

Overview

NVIDIA GPU(Graphics Processing Unit)는 병렬 컴퓨팅을 위한 그래픽 처리 장치입니다. 게이밍부터 HPC, AI/ML까지 광범위하게 사용됩니다. Ampere, Hopper, Blackwell 아키텍처를 통해 지속적인 성능 향상을 이루고 있습니다.

Summary

  • 무엇인가? — NVIDIA의 그래픽 및 컴퓨팅 처리 장치
  • 왜 필요한가? — 병렬 컴퓨팅, AI/ML 훈련/추론, 그래픽 렌더링
  • 언제 사용하는가? — AI 서버, HPC 클러스터, 워크스테이션


Purpose

이 문서가 존재하는 이유

  • Goal: NVIDIA GPU 제품군, 아키텍처, MIG, 드라이버, 모니터링 방법 제공
  • Scope: GPU 라인업, 아키텍처 비교, MIG, 드라이버 설치, nvidia-smi
  • Non-goals: CUDA 프로그래밍, 특정 애플리케이션 설정은 별도 문서


Key Concepts

Concept Description Related
Ampere SM80 아키텍처 — A100/H100 기반 NVIDIA GPU
Hopper SM90 아키텍처 — H200/B200 기반 NVIDIA GPU
Blackwell SM100 아키텍처 — B200 기반 NVIDIA GPU
MIG Multi-Instance GPU — GPU 분할 MIG
CUDA NVIDIA 병렬 컴퓨팅 플랫폼 CUDA
Tensor Core AI 연산 전용 코어 NVIDIA GPU
NVLink GPU 간 고속 연결 NVIDIA GPU
nvidia-smi GPU 모니터링/관리 도구 NVIDIA GPU


Architecture

NVIDIA GPU 아키텍처 진화:

graph LR
    A[Turing] --> B[Ampere]
    B --> C[Hopper]
    C --> D[Blackwell]
    B --> E[A100]
    B --> F[A30]
    C --> G[H100]
    C --> H[H200]
    D --> I[B200]
    D --> J[RTX PRO 6000]
    D --> K[RTX PRO 5000]


Workflow

Stage Input Output
Install Driver NVIDIA driver package nvidia-smi
Check Status nvidia-smi GPU info
Enable MIG nvidia-smi -mig 1 MIG Mode
Create Instance nvidia-smi -cgi GPU Instances
Monitor nvidia-smi / dcgmi Metrics


Detailed Explanation

GPU 제품군

제품군 아키텍처 주요 모델 용도
Data Center Ampere/Hopper/Blackwell A100, H100, H200, B200 AI/ML, HPC
RTX Workstation Ada/Blackwell RTX 6000 Ada, RTX PRO 6000 워크스테이션, VFX
GeForce Ada RTX 4090, RTX 4080 게이밍, 엔트리 AI
L-Series Ada L40S, L4 가상 데스크톱, 인퍼런스

아키텍처 비교

아키텍처 SM Tensor Core Memory Type 대표 모델
Ampere (SM80) 80 3rd Gen HBM2e/HBM2 A100, A30
Hopper (SM90) 90 4th Gen HBM3/HBM3e H100, H200
Blackwell (SM100) 100 5th Gen HBM3e B200, RTX PRO 6000

MIG (Multi-Instance GPU)

단일 GPU를 여러 격리된 인스턴스로 분할합니다. Ampere 아키텍처부터 도입되었습니다.

  • GI(GPU Instance): 완전 격리된 리소스 집합
  • CI(Compute Instance): GI 내 부분 격리된 SM 집합
  • 18가지 프로파일 조합 가능

자세한 내용은 MIG 문서를 참조하세요.

NVIDIA 드라이버

GPU CUDA Version NVIDIA Driver Version
A100 / A30 CUDA 11 R525 (>= 525.53)
H100 / H200 CUDA 12 R450 (>= 450.80.02)
B200 CUDA 12 R570 (>= 570.133.20)
RTX PRO 6000 Blackwell CUDA 12 R575 (>= 575.51.03)

nvidia-smi 기본 명령어

# GPU 상태 확인
$ nvidia-smi

# GPU 목록 확인
$ nvidia-smi -L

# 모니터링 (1초 간격)
$ nvidia-smi -l 1

# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv

# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1

# MIG 활성화
$ sudo nvidia-smi -mig 1

GPU 모니터링

명령어 설명
nvidia-smi 기본 GPU 상태
nvidia-smi -L GPU UUID 목록
nvidia-smi mig -lgi MIG 인스턴스 목록
nvidia-smi mig -lgip MIG 프로파일 목록
dcgmi dmon DCGM 고급 모니터링
nvtop 실시간 모니터링 (nvtop 설치 필요)


Configuration

# NVIDIA 드라이버 설치
$ sudo apt-get install nvidia-driver-535

# Persistence Mode 활성화
$ sudo nvidia-smi -pm 1

# MIG 활성화
$ sudo nvidia-smi -mig 1

# GPU 상태 확인
$ nvidia-smi

# MIG 인스턴스 생성
$ sudo nvidia-smi mig -cgi 9,19,19,19 -C


Examples

Example 1: GPU 상태 확인

# 전체 GPU 상태
$ nvidia-smi

# GPU UUID 확인
$ nvidia-smi -L

# MIG 상태 확인
$ nvidia-smi --query-gpu=pci.bus_id,mig.mode.current --format=csv

Example 2: Docker에서 GPU 사용

# 전체 GPU 사용
$ docker run --gpus all --rm nvidia/cuda:12.0 nvidia-smi

# 특정 GPU 사용
$ docker run --gpus '"device=0"' --rm nvidia/cuda:12.0 nvidia-smi

# MIG 디바이스 사용
$ docker run --gpus '"device=MIG-UUID"' --rm nvidia/cuda:12.0 nvidia-smi


Best Practices

  • Persistence Mode 필수 활성화
  • MIG 활성화 시 nvsm/dcgm 중지 후 진행
  • 워크로드에 맞는 MIG 프로파일 선택
  • DCGM v2.0.13+ 사용 (MIG 모니터링)
  • 정기적인 드라이버 업데이트
  • RTX PRO Blackwell은 Display Mode 먼저 Compute로 설정
  • SSH 접근 확인 후 Display Mode 변경


Limitations

  • MIG 활성화/비활성화는 GPU 리셋 필요
  • 그래픽 컨텍스트 미지원 (MIG)
  • P2P/NVLink 미지원 (MIG)
  • nvidia-smi만으로는 MIG 메트릭 확인 불가
  • RTX PRO Blackwell primary display GPU는 Display Mode 변경 시 디스플레이 출력 중단


References


Related Pages

Knowledge Graph

Related

CUDAGPUH100NVLinkAMD GPUsA100MIGNVIDIA GPUs

Latest GPU Lineup (2024-2025)

NVIDIA는 2024년 Blackwell 아키텍처와 H200를 출시. AI/ML 워크로드 성능이 크게 향상.

Blackwell B100/B200

  • 아키텍처: Blackwell (SM 10.x)
  • TFLOPS (FP4): 2,900 TFLOPS
  • 메모리: HBM3e, 192GB
  • 메모리 대역폭: 8 TB/s
  • TDP: 1,000W
  • NVLink: 1.8 TB/s (B200)
  • 출시: 2024년

H200

  • 아키텍처: Hopper (SM 9.0)
  • 메모리: HBM3e, 141GB
  • 메모리 대역폭: 4.8 TB/s
  • TDP: 700W
  • NVLink: 900 GB/s
  • 출시: 2024년 Q2
  • H100 대비 메모리 27% 증가, 대역폭 20% 증가

H100 (기존)

  • 아키텍처: Hopper (SM 9.0)
  • Tensor TFLOPS (FP8): 989 TFLOPS
  • 메모리: HBM3, 80GB
  • 메모리 대역폭: 3.35 TB/s
  • TDP: 700W
  • NVLink: 900 GB/s

Blackwell vs Hopper 비교

Feature ! H100 ! H200 ! B100 ! B200
Hopper | Hopper | Blackwell | Blackwell
989 | 989 | ~1500 | ~2000
HBM3 80GB | HBM3e 141GB | HBM3e 192GB | HBM3e 288GB
3.35 TB/s | 4.8 TB/s | ~6 TB/s | ~8 TB/s
700W | 700W | 1000W | 1000W
900 GB/s | 900 GB/s | 1.8 TB/s | 1.8 TB/s