Top 10 오픈소스 AI 모델 동향

From HPCWIKI
Revision as of 10:05, 31 July 2026 by Clara (talk | contribs) (Top 10 오픈소스 AI 모델 동향 페이지 생성 (HuggingFace Open LLM Leaderboard 기준))
(diff) ← Older revision | Latest revision (diff) | Newer revision → (diff)
Jump to navigation Jump to search

Top 10 오픈소스 AI 모델 동향

Template:Status

Template:TOC

Overview

HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.

Summary

  • 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
  • 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
  • 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시

---

Purpose

이 문서가 존재하는 이유

  • Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
  • Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
  • Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음

---

Key Concepts

개념 ! 설명 ! 관련 문서
모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함
HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정
23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가
다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨

---

Top 10 Models

HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)

Rank Model Type Average IFEval BBH MATH GPQA MUSR MMLU-PRO CO₂ Cost
1 MaziyarPanahi/calme-3.2-instruct-78b fine-tuned 52.08% 80.63% 62.61% 40.33% 20.36% 38.53% 70.03% 66.01 kg
2 MaziyarPanahi/calme-3.1-instruct-78b chat 51.29% 81.36% 62.41% 39.27% 19.46% 36.50% 68.72% 64.44 kg
3 dfurman/CalmeRys-78B-Orpo-v0.1 chat 51.23% 81.63% 61.92% 40.63% 20.02% 36.37% 66.80% 25.99 kg
4 MaziyarPanahi/calme-2.4-rys-78b chat 50.77% 80.11% 62.16% 40.71% 20.36% 34.57% 66.69% 25.95 kg
5 huihui-ai/Qwen2.5-72B-Instruct-abliterated fine-tuned 48.11% 85.93% 60.49% 60.12% 19.35% 12.34% 50.41% 76.77 kg
6 Qwen/Qwen2.5-72B-Instruct chat 47.98% 86.38% 61.87% 59.82% 16.67% 11.74% 51.40% 47.65 kg
7 MaziyarPanahi/calme-2.1-qwen2.5-72b chat 47.86% 86.62% 61.66% 59.14% 15.10% 13.30% 51.32% 29.50 kg
8 newsbang/Homer-v1.0-Qwen2.5-72B fine-tuned 47.46% 76.28% 62.27% 49.02% 22.15% 17.90% 57.17% 29.55 kg
9 ehristoforu/qwen2.5-test-32b-it chat 47.37% 78.89% 58.28% 59.74% 15.21% 19.13% 52.95% 29.54 kg
10 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B fine-tuned 47.34% 79.72% 57.63% 60.27% 14.99% 18.16% 53.25% 7.95 kg

---

Performance Analysis

파라미터 규모별 성능 트렌드

78B 모델의 지배적 위치 상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).

Qwen2.5-72B: 공식 오픈소스 모델의 기준 Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.

32B 모델의 경쟁력 부상 Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.

CO₂ Cost 분석

파라미터 규모 평균 CO₂ Cost Rank 10 대비 배수
78B (Calme 시리즈) ~46.60 kg ~5.9배
72B (Qwen2.5 기반) ~50.93 kg ~6.4배
32B ~28.75 kg 기준

32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.

벤치마크 지표별 강점

  • IFEval (지시 따르기): Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
  • MATH (수학): huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
  • GPQA (전문 지식): newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
  • MMLU-PRO (종합 지식): MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위

---

Architecture

모델 아키텍처 비교

Top 10 모델의 아키텍처 및 베이스 정보
Rank Model 베이스 아키텍처 Type Notes
1-4 Calme 시리즈 Llama 기반 추정 fine-tuned / chat MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터
5 Qwen2.5-72B-Instruct-abliterated Qwen2.5-72B-Instruct fine-tuned Abliterated 버전 — 안전 필터 제거로 성능 향상
6 Qwen2.5-72B-Instruct Qwen2.5-72B-Instruct chat Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처
7 calme-2.1-qwen2.5-72b Qwen2.5-72B chat Qwen2.5 기반 Calme 모델
8 Homer-v1.0-Qwen2.5-72B Qwen2.5-72B fine-tuned newsbang 가 개발한 Homer 시리즈
9 qwen2.5-test-32b-it Qwen2.5-32B chat Qwen2.5-32B 기반 지시 따르기 최적화 모델
10 Linkbricks-Horizon-AI-Avengers-V1-32B 추정됨 fine-tuned Saxo 가 개발한 32B 모델

아키텍처 트렌드

  • Qwen2.5 기반 모델의 확산: Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능
  • Calme 시리즈의 독자적 진화: 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델
  • 32B 모델의 실용성: 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합

---

Best Practices

모델 선택 가이드라인

성능 최우선 시 (78B/72B 모델 권장)

  • 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
  • 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
  • IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)

환경 비용 고려 시 (32B 모델 권장)

  • CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
  • Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
  • 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위

균형 잡힌 선택 (Qwen2.5-72B 권장)

  • 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
  • Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)

모델 선택 의사결정 트리

  1. 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
  2. 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
  3. 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
  4. 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated

---

Limitations

  • Leaderboard Archived: HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.
  • 벤치마크 한계: Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.
  • CO₂ Cost 변동성: CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.
  • 모델 타입 구분: fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.
  • 데이터 시점: 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.

---

References

---

Related Pages

---