Top 10 오픈소스 AI 모델 동향
Top 10 오픈소스 AI 모델 동향
Overview
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.
Summary
- 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
- 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
- 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시
Purpose
이 문서가 존재하는 이유
- Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
- Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
- Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음
Key Concepts
| 개념 ! 설명 ! 관련 문서 |
|---|
| 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함 |
| HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄 |
| 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정 |
| 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가 |
| 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정 |
| 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가 |
| 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정 |
| Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가 |
| 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨 |
| 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델 |
| 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨 |
Top 10 Models
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)
| Rank | Model | Type | Average | IFEval | BBH | MATH | GPQA | MUSR | MMLU-PRO | CO₂ Cost |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | MaziyarPanahi/calme-3.2-instruct-78b | fine-tuned | 52.08% | 80.63% | 62.61% | 40.33% | 20.36% | 38.53% | 70.03% | 66.01 kg |
| 2 | MaziyarPanahi/calme-3.1-instruct-78b | chat | 51.29% | 81.36% | 62.41% | 39.27% | 19.46% | 36.50% | 68.72% | 64.44 kg |
| 3 | dfurman/CalmeRys-78B-Orpo-v0.1 | chat | 51.23% | 81.63% | 61.92% | 40.63% | 20.02% | 36.37% | 66.80% | 25.99 kg |
| 4 | MaziyarPanahi/calme-2.4-rys-78b | chat | 50.77% | 80.11% | 62.16% | 40.71% | 20.36% | 34.57% | 66.69% | 25.95 kg |
| 5 | huihui-ai/Qwen2.5-72B-Instruct-abliterated | fine-tuned | 48.11% | 85.93% | 60.49% | 60.12% | 19.35% | 12.34% | 50.41% | 76.77 kg |
| 6 | Qwen/Qwen2.5-72B-Instruct | chat | 47.98% | 86.38% | 61.87% | 59.82% | 16.67% | 11.74% | 51.40% | 47.65 kg |
| 7 | MaziyarPanahi/calme-2.1-qwen2.5-72b | chat | 47.86% | 86.62% | 61.66% | 59.14% | 15.10% | 13.30% | 51.32% | 29.50 kg |
| 8 | newsbang/Homer-v1.0-Qwen2.5-72B | fine-tuned | 47.46% | 76.28% | 62.27% | 49.02% | 22.15% | 17.90% | 57.17% | 29.55 kg |
| 9 | ehristoforu/qwen2.5-test-32b-it | chat | 47.37% | 78.89% | 58.28% | 59.74% | 15.21% | 19.13% | 52.95% | 29.54 kg |
| 10 | Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B | fine-tuned | 47.34% | 79.72% | 57.63% | 60.27% | 14.99% | 18.16% | 53.25% | 7.95 kg |
Performance Analysis
파라미터 규모별 성능 트렌드
78B 모델의 지배적 위치 상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).
Qwen2.5-72B: 공식 오픈소스 모델의 기준 Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.
32B 모델의 경쟁력 부상 Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.
CO₂ Cost 분석
| 파라미터 규모 | 평균 CO₂ Cost | Rank 10 대비 배수 |
|---|---|---|
| 78B (Calme 시리즈) | ~46.60 kg | ~5.9배 |
| 72B (Qwen2.5 기반) | ~50.93 kg | ~6.4배 |
| 32B | ~28.75 kg | 기준 |
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.
벤치마크 지표별 강점
- IFEval (지시 따르기): Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
- MATH (수학): huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
- GPQA (전문 지식): newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
- MMLU-PRO (종합 지식): MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위
Architecture
모델 아키텍처 비교
| Rank | Model | 베이스 아키텍처 | Type | Notes |
|---|---|---|---|---|
| 1-4 | Calme 시리즈 | Llama 기반 추정 | fine-tuned / chat | MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터 |
| 5 | Qwen2.5-72B-Instruct-abliterated | Qwen2.5-72B-Instruct | fine-tuned | Abliterated 버전 — 안전 필터 제거로 성능 향상 |
| 6 | Qwen2.5-72B-Instruct | Qwen2.5-72B-Instruct | chat | Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처 |
| 7 | calme-2.1-qwen2.5-72b | Qwen2.5-72B | chat | Qwen2.5 기반 Calme 모델 |
| 8 | Homer-v1.0-Qwen2.5-72B | Qwen2.5-72B | fine-tuned | newsbang 가 개발한 Homer 시리즈 |
| 9 | qwen2.5-test-32b-it | Qwen2.5-32B | chat | Qwen2.5-32B 기반 지시 따르기 최적화 모델 |
| 10 | Linkbricks-Horizon-AI-Avengers-V1-32B | 추정됨 | fine-tuned | Saxo 가 개발한 32B 모델 |
아키텍처 트렌드
- Qwen2.5 기반 모델의 확산: Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능
- Calme 시리즈의 독자적 진화: 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델
- 32B 모델의 실용성: 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합
Best Practices
모델 선택 가이드라인
성능 최우선 시 (78B/72B 모델 권장)
- 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
- 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
- IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)
환경 비용 고려 시 (32B 모델 권장)
- CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
- Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
- 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위
균형 잡힌 선택 (Qwen2.5-72B 권장)
- 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
- Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)
모델 선택 의사결정 트리
- 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
- 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
- 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
- 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated
Limitations
- Leaderboard Archived: HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.
- 벤치마크 한계: Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.
- CO₂ Cost 변동성: CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.
- 모델 타입 구분: fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.
- 데이터 시점: 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.
References
- [HuggingFace Open LLM Leaderboard (Archived)](https://huggingface.co/spaces/huggingface/open-llm-leaderboard) — HuggingFace 공식 오픈소스 LLM 벤치마크 Leaderboard
- [Qwen2.5 모델 패밀리](https://huggingface.co/Qwen) — Alibaba/Qwen 공식 Qwen2.5 모델 페이지
- [Calme 모델 시리즈](https://huggingface.co/MaziyarPanahi) — MaziyarPanahi 의 Calme 모델 컬렉션
Related Pages
- Qwen2.5
- Llama
- LLM Benchmark
- Transformer Architecture
- Parameter-Efficient Fine-Tuning
- MoE (Mixture of Experts)
- Context Window
- Instruction Tuning
References
HuggingFace Open LLM Leaderboard
- Open LLM Leaderboard — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.
- URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
- 접근일: 2026-07-31
- 상태: Archived (2026년 5월 기준)
Top 10 모델 상세 링크
Rank 1: MaziyarPanahi/calme-3.2-instruct-78b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&model=MaziyarPanahi%2Fcalme-3.2-instruct-78b
- 파라미터: 78B | Type: fine-tuned | Average: 52.08%
- CO₂ Cost: 66.01 kg
Rank 2: MaziyarPanahi/calme-3.1-instruct-78b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&model=MaziyarPanahi%2Fcalme-3.1-instruct-78b
- 파라미터: 78B | Type: chat | Average: 51.29%
- CO₂ Cost: 64.44 kg
Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1
- HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&model=dfurman%2FCalmeRys-78B-Orpo-v0.1
- 파라미터: 78B | Type: chat | Average: 51.23%
- CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)
Rank 4: MaziyarPanahi/calme-2.4-rys-78b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&model=MaziyarPanahi%2Fcalme-2.4-rys-78b
- 파라미터: 78B | Type: chat | Average: 50.77%
- CO₂ Cost: 25.95 kg
Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated
- HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated
- 파라미터: 72B | Type: fine-tuned | Average: 48.11%
- CO₂ Cost: 76.77 kg (가장 높음)
Rank 6: Qwen/Qwen2.5-72B-Instruct
- HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct
- Qwen 공식 문서: https://qwenlm.github.io/
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&model=Qwen%2FQwen2.5-72B-Instruct
- 파라미터: 72B | Type: chat | Average: 47.98%
- CO₂ Cost: 47.65 kg
Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b
- 파라미터: 72B | Type: chat | Average: 47.86%
- CO₂ Cost: 29.50 kg
Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B
- HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&model=newsbang%2FHomer-v1.0-Qwen2.5-72B
- 파라미터: 72B | Type: fine-tuned | Average: 47.46%
- CO₂ Cost: 29.55 kg
Rank 9: ehristoforu/qwen2.5-test-32b-it
- HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&model=ehristoforu%2Fqwen2.5-test-32b-it
- 파라미터: 32B | Type: chat | Average: 47.37%
- CO₂ Cost: 29.54 kg
Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
- HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B
- 파라미터: 32B | Type: fine-tuned | Average: 47.34%
- CO₂ Cost: 7.95 kg (전체 중 가장 효율적)
벤치마크 지표 설명
- IFEval (Instruction Following Evaluation): https://github.com/google-research/google-research/tree/master/instruction_following_eval
- BBH (Big Bench Hard): https://github.com/suzgunmirac/BIG-Bench-Hard
- MATH: https://github.com/hendrycks/math
- GPQA (Graduate-Level Google-Proof Q&A): https://github.com/idavidrein/gpqa
- MUSR (Multi-Step Reasoning): https://github.com/...
- MMLU-PRO: https://github.com/hendrycks/test
관련 문서
- Qwen2.5 — 알리바바 그룹에서 개발한 오픈소스 LLM
- Llama — Meta에서 개발한 오픈소스 LLM
- LLM Benchmark — 대규모 언어 모델 벤치마킹 방법론
- Fine-tuning — 사전 학습 모델의 추가 학습 기법
- CO₂ Emissions in AI — AI 모델의 환경 영향