NVLink

From HPCWIKI
Revision as of 13:26, 17 July 2026 by Clara (talk | contribs) (Phase 0.3: Create NVLink)
(diff) ← Older revision | Latest revision (diff) | Newer revision → (diff)
Jump to navigation Jump to search

NVLink

Template:Status

Template:TOC

Overview

NVLink는 NVIDIA가 개발한 GPU 간 초고속 연결 기술. PCIe 대비 3-6배 빠른 대역폭. Multi-GPU 서버와 AI 훈련의 핵심.

Summary

  • * 무엇인가? NVIDIA GPU 간 직접 연결. PCIe 3x-6x 빠른 대역폭
  • * 왜 필요한가? Multi-GPU 통신 지연 최소화. 분산 학습 속도↑
  • * 언제 사용하는가? Multi-GPU 서버, AI 훈련, HPC 워크로드

---

Purpose

이 문서가 존재하는 이유

  • Goal: NVLink의 개념, 사용법, 설정 가이드 제공
  • Scope: 기본 개념, 설치/설정, 사용 예제, 모범 사례
  • Non-goals: 고급 커스터마이징, 내부 소스 코드 분석

---

Key Concepts

Template:KeyConcepts

---

Architecture

NVLink는 GPU 간 직접 연결. HGX 기반 시스템에서는 NVSwitch로 여러 GPU를 연결. Full-duplex 통신. PCIe와 병렬로 사용 가능. GPU 메모리 간 직접 접근(GPUDirect).

---

Workflow

1. 1. NVLink 지원 GPU 설치 (A100/H100 등)

2. 2. HGX 기반 서버 또는 NVLink 카드 설치

3. 3. nvidia-smi topo -m으로 토폴로지 확인

4. 4. NCCL로 Multi-GPU 연동

5. 5. 성능 테스트 (NCCL 테스트)

6. 6. GPU 간 통신 대역폭 확인

---

Configuration

{config_code}

---

Best Practices

  • NVLink 지원 GPU(A100/H100/MI300)로 Multi-GPU 구축
  • NCCL_AUTO_COLLAPSE=0으로 NVLink 우선 사용
  • nvidia-smi topo -m으로 토폴로지 확인
  • GPUDirect RDMA로 네트워크와 GPU 직접 연동
  • HGX 기반 서버로 NVSwitch 활용

---

Limitations

  • NVLink 지원 GPU는 고가 (A100/H100)
  • 물리적 제한: 최대 8-16 GPU 연결
  • AMD GPU는 NVLink 미지원 (Infinity Fabric 사용)

---

References

---

Related Pages