NVIDIA GPUs: Difference between revisions

From HPCWIKI
Jump to navigation Jump to search
(Added Knowledge Graph section)
(Fix: remove --- horizontal lines (12 removed))
 
Line 20: Line 20:
* 언제 사용하는가? — AI 서버, 워크스테이션, 데이터센터, 클라우드
* 언제 사용하는가? — AI 서버, 워크스테이션, 데이터센터, 클라우드


---


== Purpose ==
== Purpose ==
Line 30: Line 29:
* Non-goals: [[AMD GPU]] 정보는 [[AMD GPUs]] 문서에서 다룸
* Non-goals: [[AMD GPU]] 정보는 [[AMD GPUs]] 문서에서 다룸


---


== Key Concepts ==
== Key Concepts ==
Line 64: Line 62:
|}
|}


---


== Architecture ==
== Architecture ==
Line 81: Line 78:
</syntaxhighlight>
</syntaxhighlight>


---


== Workflow ==
== Workflow ==
Line 103: Line 99:
|}
|}


---


== Detailed Explanation ==
== Detailed Explanation ==
Line 123: Line 118:
NVIDIA GPU 관련 실용적인 팁, 문제 해결, 성능 최적화 방법을 제공합니다.
NVIDIA GPU 관련 실용적인 팁, 문제 해결, 성능 최적화 방법을 제공합니다.


---


== Configuration ==
== Configuration ==
Line 139: Line 133:
</syntaxhighlight>
</syntaxhighlight>


---


== Examples ==
== Examples ==
Line 157: Line 150:
</syntaxhighlight>
</syntaxhighlight>


---


== Best Practices ==
== Best Practices ==
Line 167: Line 159:
* XID 에러 로그 정기 확인
* XID 에러 로그 정기 확인


---


== Limitations ==
== Limitations ==
Line 175: Line 166:
* 특정 OS 지원 제한
* 특정 OS 지원 제한


---


== References ==
== References ==
Line 183: Line 173:
* https://ngc.nvidia.com/
* https://ngc.nvidia.com/


---


== Related Pages ==
== Related Pages ==
Line 194: Line 183:
* [[GPUDirect]]
* [[GPUDirect]]


---


[[Category:GPU]]
[[Category:GPU]]

Latest revision as of 11:29, 17 July 2026

NVIDIA GPUs

Template:Status

Template:TOC

Overview

NVIDIA GPUs는 그래픽 처리 장치(GPU)의 선두 주자로, 게이밍, 전문가용 워크스테이션, AI/ML 훈련 및 추론, HPC 컴퓨팅 등 다양한 분야에서 사용됩니다.

Summary

  • 무엇인가? — NVIDIA의 GPU 제품군 (GeForce, RTX, A100, H100 등)
  • 왜 필요한가? — AI/ML 훈련, 고성능 그래픽, HPC 컴퓨팅
  • 언제 사용하는가? — AI 서버, 워크스테이션, 데이터센터, 클라우드


Purpose

이 문서가 존재하는 이유

  • Goal: NVIDIA GPU 제품군과 아키텍처, 드라이버, NGC 정보를 한 곳에서 제공
  • Scope: GPU 아키텍처, 드라이버 설치, NGC 플랫폼, GPU 팁/트릭
  • Non-goals: AMD GPU 정보는 AMD GPUs 문서에서 다룸


Key Concepts

Concept Description Related
CUDA NVIDIA의 병렬 컴퓨팅 플랫폼 및 프로그래밍 모델 NVIDIA driver
Tensor Core AI 연산 전용 하드웨어 코어 NVIDIA GPU
NGC NVIDIA GPU Cloud — AI 프레임워크 및 컨테이너 제공 NVIDIA GPU Cloud (NGC)
Volta NVIDIA GPU 아키텍처 (2세대) NVIDIA GPU
Ampere NVIDIA GPU 아키텍처 (3세대) NVIDIA GPU
Hopper NVIDIA GPU 아키텍처 (4세대, H100) NVIDIA GPU


Architecture

NVIDIA GPU는 Streaming Multiprocessor(SM) 기반 설계로, 각 SM은 CUDA 코어, Tensor 코어, RT 코어를 포함합니다.

graph TD
    A[NVIDIA GPU] --> B[Streaming Multiprocessors]
    B --> C[CUDA Cores]
    B --> D[Tensor Cores]
    B --> E[RT Cores]
    A --> F[Memory Controller]
    A --> G[PCIe Interface]
    A --> H[CUDA Runtime]


Workflow

Stage Input Output
Driver Install NVIDIA driver package GPU driver loaded
CUDA Install CUDA toolkit CUDA development environment
AI Training Model + Dataset Trained model


Detailed Explanation

NVIDIA GPU

NVIDIA는 GeForce(게이밍), RTX(전문가용), A100/H100(데이터센터) 등 다양한 GPU 제품군을 제공합니다. 각 아키텍처(Volta, Ampere, Hopper)마다 성능과 기능이 다릅니다.

NVIDIA Driver

NVIDIA GPU 드라이버는 GPU 하드웨어와 소프트웨어 사이의 중재자입니다. 최신 드라이버는 보안 패치와 성능 개선을 제공합니다.

NVIDIA GPU Cloud (NGC)

NGC는 NVIDIA가 제공하는 클라우드 서비스로, 사전 최적화된 AI 컨테이너, 프레임워크, 모델을 제공합니다. TensorFlow, PyTorch, Caffe2 등을 빠르게 시작할 수 있습니다.

NVIDIA GPU Tips and Tricks

NVIDIA GPU 관련 실용적인 팁, 문제 해결, 성능 최적화 방법을 제공합니다.


Configuration

# NVIDIA GPU 정보 확인
nvidia-smi
nvidia-smi -q

# CUDA 버전 확인
nvcc --version

# GPU 드라이버 상태 확인
lsmod | grep nvidia


Examples

Example 1: nvidia-smi 출력

+-----------------------------------------------------------------------------+
| NVIDIA-SMI 535.129.03   Driver Version: 535.129.03   CUDA Version: 12.2     |
|-------------------------------+----------------------+----------------------+
| GPU  Name        Persistence-M| Bus-Id        Disp.A | Volatile Uncorr. ECC |
| Fan  Temp  Perf  Pwr:Usage/Cap|         Memory-Usage | GPU-Util  Compute M. |
|===============================+======================+======================|
|   0  NVIDIA A100       On   | 00000000:00:05.0 Off |                    0 |
| N/A   32C    P0    42W / 300W |      0MiB / 40960MiB |      0%      Default |
+-------------------------------+----------------------+----------------------+


Best Practices

  • 최신 NVIDIA 드라이버 유지
  • CUDA 버전과 드라이버 호환성 확인
  • GPU 메모리 모니터링 (nvidia-smi)
  • NGC 컨테이너 활용
  • XID 에러 로그 정기 확인


Limitations

  • CUDA 생태계 종속
  • 라이선스 비용
  • 특정 OS 지원 제한


References


Related Pages

Knowledge Graph

Related

CUDAGPUNVIDIA GPUH100NVLinkAMD GPUsA100MIG