NVLink
Jump to navigation
Jump to search
NVLink
Overview
NVLink는 NVIDIA가 개발한 GPU 간 초고속 연결 기술. PCIe 대비 3-6배 빠른 대역폭. Multi-GPU 서버와 AI 훈련의 핵심.
Summary
- * 무엇인가? NVIDIA GPU 간 직접 연결. PCIe 3x-6x 빠른 대역폭
- * 왜 필요한가? Multi-GPU 통신 지연 최소화. 분산 학습 속도↑
- * 언제 사용하는가? Multi-GPU 서버, AI 훈련, HPC 워크로드
---
Purpose
이 문서가 존재하는 이유
- Goal: NVLink의 개념, 사용법, 설정 가이드 제공
- Scope: 기본 개념, 설치/설정, 사용 예제, 모범 사례
- Non-goals: 고급 커스터마이징, 내부 소스 코드 분석
---
Key Concepts
---
Architecture
NVLink는 GPU 간 직접 연결. HGX 기반 시스템에서는 NVSwitch로 여러 GPU를 연결. Full-duplex 통신. PCIe와 병렬로 사용 가능. GPU 메모리 간 직접 접근(GPUDirect).
---
Workflow
1. 1. NVLink 지원 GPU 설치 (A100/H100 등)
2. 2. HGX 기반 서버 또는 NVLink 카드 설치
3. 3. nvidia-smi topo -m으로 토폴로지 확인
4. 4. NCCL로 Multi-GPU 연동
5. 5. 성능 테스트 (NCCL 테스트)
6. 6. GPU 간 통신 대역폭 확인
---
Configuration
{config_code}---
Best Practices
- NVLink 지원 GPU(A100/H100/MI300)로 Multi-GPU 구축
- NCCL_AUTO_COLLAPSE=0으로 NVLink 우선 사용
- nvidia-smi topo -m으로 토폴로지 확인
- GPUDirect RDMA로 네트워크와 GPU 직접 연동
- HGX 기반 서버로 NVSwitch 활용
---
Limitations
- NVLink 지원 GPU는 고가 (A100/H100)
- 물리적 제한: 최대 8-16 GPU 연결
- AMD GPU는 NVLink 미지원 (Infinity Fabric 사용)
---
References
---