Top 10 오픈소스 AI 모델 동향: Difference between revisions

From HPCWIKI
Jump to navigation Jump to search
(Top 10 오픈소스 AI 모델 동향 페이지 생성 (HuggingFace Open LLM Leaderboard 기준))
 
(정기 재조사 2026-09-07: Open LLM Leaderboard(동결 2025-03-20)/LiveCodeBench(윈도우 2024-08~2025-05) 모델·점수 변동 없음 — 조사일시/다음 업데이트/last_update/데이터 신선도만 갱신)
 
(18 intermediate revisions by the same user not shown)
Line 4: Line 4:
|status=Draft
|status=Draft
|owner=Knowledge Agent
|owner=Knowledge Agent
|last_update=2026-07-31
|last_update=2026-09-07
|review=Pending
|review=Pending
}}
}}
Line 11: Line 11:


== Overview ==
== Overview ==
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.
 
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 9월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.


=== Summary ===
=== Summary ===
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시


---
* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고
 
=== 조사 정보 ===
 
* 조사 일자: 2026-09-07 14:46 KST
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)
* 다음 업데이트 예정: 2026-09-14
 


== Purpose ==
== Purpose ==
이 문서가 존재하는 이유
이 문서가 존재하는 이유
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음


---
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행
 


== Key Concepts ==
== Key Concepts ==
{| class="wikitable"
 
! 개념 ! 설명 ! 관련 문서
{{! class="wikitable"
! Concept ! Description ! Related
|-
|-
| 파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함
| [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | 오픈소스 LLM 종합 성능 벤치마크 | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval), [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard), [MMLU-PRO](https://github.com/hendrycks/test)
|-
|-
| Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
| [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) | 코딩 능력 평가 벤치마크 | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)
|-
|-
| IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정
| [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)
|-
|-
| BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
| [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)
|-
|-
| MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
| [MMLU-PRO](https://github.com/hendrycks/test) | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)
|-
|-
| GPQA (Graduate-Level Google-Proof Q&A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가
| [MATH](https://github.com/hendrycks/math) | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)
|-
|-
| MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
| [GPQA](https://github.com/idavidrein/gpqa) | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)
|-
|-
| MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
| [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)
}}
 
 
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==
 
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.
 
{{! class="wikitable"
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) ! [MATH](https://github.com/hendrycks/math) Lvl 5 ! [GPQA](https://github.com/idavidrein/gpqa) ! [MMLU-PRO](https://github.com/hendrycks/test)
|-
|-
| CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0
|-
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7
| fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8
|-
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7
| chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4
|}
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3
}}
 
=== General 카테고리 분석 ===
 
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4
 


---
== Coding 카테고리: LiveCodeBench Pass@1 ==


== Top 10 Models ==
LiveCodeBench Code Generation 리더보드 기준 Top 10 모델 (평가 기간 2024-08-01 ~ 2025-05-01 기준, 최신 릴리스 모델). Pass@1과 Easy, Medium, Hard 난이도별 점수 포함.
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)


{| class="wikitable" style="text-align:center; font-size:90%"
{{! class="wikitable"
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MUSR !! MMLU-PRO !! CO₂ Cost
! Rank ! Model ! [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Easy-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Medium-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Hard-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)
|-
|-
| 1 || MaziyarPanahi/calme-3.2-instruct-78b || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg
| 1 | [https://platform.openai.com/docs/api-reference/chat/create O4-Mini (High)] | 80.2 | 99.1 | 89.4 | 63.5
|-
|-
| 2 || MaziyarPanahi/calme-3.1-instruct-78b || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg
| 2 | [https://platform.openai.com/docs/api-reference/chat/create O3 (High)] | 75.8 | 99.1 | 84.4 | 57.1
|-
|-
| 3 || dfurman/CalmeRys-78B-Orpo-v0.1 || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg
| 3 | [https://platform.openai.com/docs/api-reference/chat/create O4-Mini (Medium)] | 74.2 | 98.2 | 86.5 | 52.7
|-
|-
| 4 || MaziyarPanahi/calme-2.4-rys-78b || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg
| 4 | [https://ai.google.dev/gemini-api/docs/models/gemini Gemini-2.5-Pro-06-05] | 73.6 | 99.1 | 87.2 | 50.2
|-
|-
| 5 || huihui-ai/Qwen2.5-72B-Instruct-abliterated || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg
| 5 | [https://huggingface.co/deepseek-ai/DeepSeek-R1-0528 DeepSeek-R1-0528] | 73.1 | 98.7 | 85.2 | 50.7
|-
|-
| 6 || Qwen/Qwen2.5-72B-Instruct || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg
| 6 | [https://ai.google.dev/gemini-api/docs/models/gemini Gemini-2.5-Pro-05-06] | 71.8 | 98.2 | 82.3 | 50.2
|-
|-
| 7 || MaziyarPanahi/calme-2.1-qwen2.5-72b || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg
| 7 | [https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-32B EXAONE-4.0-32B] | 70.0 | 98.4 | 82.3 | 46.2
|-
|-
| 8 || newsbang/Homer-v1.0-Qwen2.5-72B || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg
| 8 | [https://huggingface.co/nvidia/OpenReasoning-Nemotron-32B OpenReasoning-Nemotron-32B] | 69.8 | 98.3 | 81.4 | 46.3
|-
|-
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg
| 9 | [https://platform.openai.com/docs/api-reference/chat/create O3-Mini-2025-01-31 (High)] | 67.4 | 99.1 | 84.4 | 38.4
|-
|-
| 10 || Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg
| 10 | [https://huggingface.co/nvidia/OpenCodeReasoning-Nemotron-1.1-32B OpenCodeReasoning-Nemotron-1.1-32B] | 66.8 | 97.9 | 79.6 | 41.1
|}
}}


---
=== Coding 카테고리 분석 ===


== Performance Analysis ==
* **상용 추론 모델 주도**: Top 6이 OpenAI O4-Mini/O3 계열과 Google Gemini 2.5 Pro 등 상용 추론 모델
* **오픈소스 모델 부상**: DeepSeek-R1-0528(5위), EXAONE-4.0-32B(7위), Nemotron 계열(8위, 10위)이 Top 10에 진입
* **Pass@1 최고점**: O4-Mini (High)이 80.2로 종합 1위
* **경량 추론 모델 경쟁**: 32B급 오픈소스(EXAONE, Nemotron)가 66~70 Pass@1로 상용 모델과 격차 축소


=== 파라미터 규모별 성능 트렌드 ===


'''78B 모델의 지배적 위치'''
== Edge Devices 카테고리: HuggingFace Edge Devices ==
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).


'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.


'''32B 모델의 경쟁력 부상'''
{{! class="wikitable"
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard)
 
=== CO₂ Cost 분석 ===
 
{| class="wikitable" style="text-align:center; font-size:90%"
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수
|-
|-
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5
|-
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0
|-
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1
| 32B || ~28.75 kg || 기준
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4
|}
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5
}}


32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.
=== Edge Devices 카테고리 분석 ===


=== 벤치마크 지표별 강점 ===
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)


* '''IFEval (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
* '''MATH (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
* '''GPQA (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
* '''MMLU-PRO (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위


---
== Performance Analysis ==


== Architecture ==
{{! class="wikitable"
 
! Category ! Top Model ! Score ! Key Insight
=== 모델 아키텍처 비교 ===
 
{| class="wikitable" style="font-size:90%"
|+ Top 10 모델의 아키텍처 및 베이스 정보
|-
|-
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능
|-
|-
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터
| Coding | O4-Mini (High) | 80.2 Pass@1 | 상용 추론 모델 1위, 오픈소스(DeepSeek/EXAONE/Nemotron) 부상
|-
|-
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 최고 (계산 오류 가능성)
|-
}}
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처
|-
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델
|-
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈
|-
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델
|-
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델
|}
 
=== 아키텍처 트렌드 ===
* '''Qwen2.5 기반 모델의 확산''': Top 10 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합
 
---
 
== Best Practices ==
 
=== 모델 선택 가이드라인 ===
 
'''성능 최우선 시 (78B/72B 모델 권장)'''
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)


'''환경 비용 고려 시 (32B 모델 권장)'''
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)
=== 모델 선택 의사결정 트리 ===
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated
---


== Limitations ==
== Limitations ==


* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.
* **데이터 신선도**: 2026-09-07 재확인 — General/Coding/Edge 데이터 모두 동일 (Open LLM Leaderboard 동결: 2025-03-20, LiveCodeBench 윈도우 2024-08~2025-05)
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.


---


== References ==
== References ==
* [HuggingFace Open LLM Leaderboard (Archived)](https://huggingface.co/spaces/huggingface/open-llm-leaderboard) — HuggingFace 공식 오픈소스 LLM 벤치마크 Leaderboard
* [Qwen2.5 모델 패밀리](https://huggingface.co/Qwen) — Alibaba/Qwen 공식 Qwen2.5 모델 페이지
* [Calme 모델 시리즈](https://huggingface.co/MaziyarPanahi) — MaziyarPanahi 의 Calme 모델 컬렉션


---
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)
* [MATH GitHub](https://github.com/hendrycks/math)
* [GPQA GitHub](https://github.com/idavidrein/gpqa)
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)
* [DeepSeek-R1-0528 Hub](https://huggingface.co/deepseek-ai/DeepSeek-R1-0528)
* [LGAI-EXAONE/EXAONE-4.0-32B Hub](https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-32B)
* [nvidia/OpenReasoning-Nemotron-32B Hub](https://huggingface.co/nvidia/OpenReasoning-Nemotron-32B)
* [nvidia/OpenCodeReasoning-Nemotron-1.1-32B Hub](https://huggingface.co/nvidia/OpenCodeReasoning-Nemotron-1.1-32B)
* [LiveCodeBench 공식 리더보드](https://livecodebench.github.io/leaderboard.html)
 


== Related Pages ==
== Related Pages ==
* [[Qwen2.5]]
* [[Llama]]
* [[LLM Benchmark]]
* [[Transformer Architecture]]
* [[Parameter-Efficient Fine-Tuning]]
* [[MoE (Mixture of Experts)]]
* [[Context Window]]
* [[Instruction Tuning]]


---
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
* [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)
* [LLM 벤치마크](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
* [Open Source Models](https://huggingface.co/models)


[[Category:AI]]
[[Category:AI]]
[[Category:Reference]]
[[Category:Reference]]

Latest revision as of 15:11, 7 September 2026

Top 10 오픈소스 AI 모델 동향

Template:Status

Template:TOC

Overview

HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 9월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.

Summary

  • 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록
  • 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고
  • 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고

조사 정보


Purpose

이 문서가 존재하는 이유

  • Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리
  • Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)
  • Non-goals: 상용 모델 비교, 자체 벤치마크 수행


Key Concepts

{{! class="wikitable" ! Concept ! Description ! Related |- | [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | 오픈소스 LLM 종합 성능 벤치마크 | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval), [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard), [MMLU-PRO](https://github.com/hendrycks/test) |- | [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) | 코딩 능력 평가 벤치마크 | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) |- | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval) |- | [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard) |- | [MMLU-PRO](https://github.com/hendrycks/test) | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test) |- | [MATH](https://github.com/hendrycks/math) | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math) |- | [GPQA](https://github.com/idavidrein/gpqa) | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa) |- | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench) }}


General 카테고리: HuggingFace Open LLM Leaderboard Overall Average

HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.

{{! class="wikitable" ! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) ! [MATH](https://github.com/hendrycks/math) Lvl 5 ! [GPQA](https://github.com/idavidrein/gpqa) ! [MMLU-PRO](https://github.com/hendrycks/test) |- | 1 | MaziyarPanahi/calme-3.2-instruct-78b | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0 | 2 | MaziyarPanahi/calme-3.1-instruct-78b | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7 | 3 | dfurman/CalmeRys-78B-Orpo-v0.1 | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8 | 4 | MaziyarPanahi/calme-2.4-rys-78b | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7 | 5 | huihui-ai/Qwen2.5-72B-Instruct-abliterated | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4 | 6 | Qwen/Qwen2.5-72B-Instruct | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4 | 7 | MaziyarPanahi/calme-2.1-qwen2.5-72b | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3 | 8 | newsbang/Homer-v1.0-Qwen2.5-72B | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2 | 9 | ehristoforu/qwen2.5-test-32b-it | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9 | 10 | Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3 }}

General 카테고리 분석

  • **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모
  • **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)
  • **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함
  • **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4


Coding 카테고리: LiveCodeBench Pass@1

LiveCodeBench Code Generation 리더보드 기준 Top 10 모델 (평가 기간 2024-08-01 ~ 2025-05-01 기준, 최신 릴리스 모델). Pass@1과 Easy, Medium, Hard 난이도별 점수 포함.

{{! class="wikitable" ! Rank ! Model ! [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Easy-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Medium-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Hard-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) |- | 1 | O4-Mini (High) | 80.2 | 99.1 | 89.4 | 63.5 |- | 2 | O3 (High) | 75.8 | 99.1 | 84.4 | 57.1 |- | 3 | O4-Mini (Medium) | 74.2 | 98.2 | 86.5 | 52.7 |- | 4 | Gemini-2.5-Pro-06-05 | 73.6 | 99.1 | 87.2 | 50.2 |- | 5 | DeepSeek-R1-0528 | 73.1 | 98.7 | 85.2 | 50.7 |- | 6 | Gemini-2.5-Pro-05-06 | 71.8 | 98.2 | 82.3 | 50.2 |- | 7 | EXAONE-4.0-32B | 70.0 | 98.4 | 82.3 | 46.2 |- | 8 | OpenReasoning-Nemotron-32B | 69.8 | 98.3 | 81.4 | 46.3 |- | 9 | O3-Mini-2025-01-31 (High) | 67.4 | 99.1 | 84.4 | 38.4 |- | 10 | OpenCodeReasoning-Nemotron-1.1-32B | 66.8 | 97.9 | 79.6 | 41.1 }}

Coding 카테고리 분석

  • **상용 추론 모델 주도**: Top 6이 OpenAI O4-Mini/O3 계열과 Google Gemini 2.5 Pro 등 상용 추론 모델
  • **오픈소스 모델 부상**: DeepSeek-R1-0528(5위), EXAONE-4.0-32B(7위), Nemotron 계열(8위, 10위)이 Top 10에 진입
  • **Pass@1 최고점**: O4-Mini (High)이 80.2로 종합 1위
  • **경량 추론 모델 경쟁**: 32B급 오픈소스(EXAONE, Nemotron)가 66~70 Pass@1로 상용 모델과 격차 축소


Edge Devices 카테고리: HuggingFace Edge Devices

7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.

{{! class="wikitable" ! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) |- | 1 | JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 | 0.0 | 47.09 | 73.2 | 65.5 | 2 | Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview | 7.616 | 37.30 | 76.4 | 36.6 | 3 | gz987/qwen2.5-7b-cabs-v0.3 | 7.616 | 36.94 | 75.7 | 36.0 | 4 | marcuscedricridia/pre-cursa-o1-v1.2 | 7.613 | 36.89 | 75.5 | 36.1 | 5 | gz987/qwen2.5-7b-cabs-v0.4 | 7.616 | 36.88 | 75.8 | 36.4 | 6 | suayptalha/Clarus-7B-v0.2 | 7.613 | 36.86 | 76.8 | 36.0 | 7 | marcuscedricridia/cursa-o1-7b-v1.2-normalize-false | 7.613 | 36.80 | 76.2 | 36.1 | 8 | marcuscedricridia/pre-cursa-o1-v1.6 | 7.613 | 36.80 | 75.3 | 35.9 | 9 | suayptalha/Clarus-7B-v0.3 | 7.616 | 36.78 | 75.1 | 36.5 | 10 | marcuscedricridia/pre-cursa-o1-v1.3 | 7.613 | 36.71 | 75.1 | 35.5 }}

Edge Devices 카테고리 분석

  • **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델
  • **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터
  • **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지
  • **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)


Performance Analysis

{{! class="wikitable" ! Category ! Top Model ! Score ! Key Insight |- | General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능 |- | Coding | O4-Mini (High) | 80.2 Pass@1 | 상용 추론 모델 1위, 오픈소스(DeepSeek/EXAONE/Nemotron) 부상 |- | Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성) }}


Limitations

  • **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨
  • **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재
  • **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)
  • **데이터 신선도**: 2026-09-07 재확인 — General/Coding/Edge 데이터 모두 동일 (Open LLM Leaderboard 동결: 2025-03-20, LiveCodeBench 윈도우 2024-08~2025-05)


References


Related Pages