Top 10 오픈소스 AI 모델 동향: Difference between revisions

From HPCWIKI
Jump to navigation Jump to search
(Replace all internal wiki links with external official URLs (GitHub, arXiv, HuggingFace) for benchmarks and models)
(정기 재조사 2026-09-07: Open LLM Leaderboard(동결 2025-03-20)/LiveCodeBench(윈도우 2024-08~2025-05) 모델·점수 변동 없음 — 조사일시/다음 업데이트/last_update/데이터 신선도만 갱신)
 
(12 intermediate revisions by the same user not shown)
Line 4: Line 4:
|status=Draft
|status=Draft
|owner=Knowledge Agent
|owner=Knowledge Agent
|last_update=2026-07-31
|last_update=2026-09-07
|review=Pending
|review=Pending
}}
}}
Line 11: Line 11:


== Overview ==
== Overview ==
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.
 
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 9월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.


=== Summary ===
=== Summary ===
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시


* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고


=== 조사 정보 ===
=== 조사 정보 ===


* 조사 일자: 2026-07-31 10:00 KST (한국 표준시)
* 조사 일자: 2026-09-07 14:46 KST
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)
* 데이터 기준일: 2026-07-31
* 다음 업데이트 예정: 2026-09-14
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)
 


== Purpose ==
== Purpose ==
이 문서가 존재하는 이유
이 문서가 존재하는 이유
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
 
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행




== Key Concepts ==
== Key Concepts ==
{| class="wikitable"
 
! 개념 ! 설명 ! 관련 문서
{{! class="wikitable"
! Concept ! Description ! Related
|-
|-
|| [[Parameters|파라미터 수 (Parameters)]] | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함
| [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | 오픈소스 LLM 종합 성능 벤치마크 | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval), [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard), [MMLU-PRO](https://github.com/hendrycks/test)
|-
|-
|| [[Overall Average]] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
| [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) | 코딩 능력 평가 벤치마크 | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)
|-
|-
|| [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정
| [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)
|-
|-
|| [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
| [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)
|-
|-
|| [https://github.com/hendrycks/math MATH] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
| [MMLU-PRO](https://github.com/hendrycks/test) | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)
|-
|-
|| [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&A)] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가
| [MATH](https://github.com/hendrycks/math) | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)
|-
|-
|| [[MUSR|MUSR (Multi-Step Reasoning)]] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
| [GPQA](https://github.com/idavidrein/gpqa) | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)
|-
|-
|| [https://github.com/hendrycks/test MMLU-PRO] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
| [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)
|-
}}
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
|-
|| [[Fine-tuning|fine-tuned]] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
|-
|| [[Chat model|chat]] | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨
|-
|| [[HuggingFace Open LLM Leaderboard]] | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 | [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard HuggingFace]
|}
== Top 10 Models ==


HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.


=== General (전체 능력) ===
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==


HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.


이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.
{{! class="wikitable"
 
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) ! [MATH](https://github.com/hendrycks/math) Lvl 5 ! [GPQA](https://github.com/idavidrein/gpqa) ! [MMLU-PRO](https://github.com/hendrycks/test)
{| class="wikitable" style="text-align:center; font-size:90%"
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]
|-
|-
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0
|-
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7
| 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8
|-
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7
| 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4
|-
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4
| 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3
|-
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2
| 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9
|-
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3
| 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg
}}
|-
| 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg
|-
| 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg
|-
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg
|-
| 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg
|}


'''General 카테고리 특징''':
=== General 카테고리 분석 ===
* 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)
* Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능
* 32B 모델도 경쟁력 있음 (Rank 9, 10)
* CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적
 
=== Coding (코딩 능력) ===
 
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)
 
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.
 
{| class="wikitable" style="text-align:center; font-size:90%"
! Rank !! Model !! [https://github.com/LiveCodeBench/LiveCodeBench Pass@1] !! Easy !! Medium !! Hard !! Source
|-
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI
|-
| 2 || [https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct LLaMA-3-70B-Instruct] || 28.3% || 60.7% || 15.8% || 1.4% || Meta
|-
| 3 || [https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1 Mixtral-8x22B-Instruct] || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI
|-
| 4 || [https://huggingface.co/models?search=dscoder DSCoder-33B-Instruct] || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek
|-
| 5 || [https://huggingface.co/models?search=opencoder OC-DS-33B] || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder
|-
| 6 || [https://huggingface.co/Phind/Phind-CodeLlama-34B-v2 Phind-34B-V2] || 21.0% || 53.4% || 4.7% || 0.1% || Phind
|-
| 7 || [https://huggingface.co/models?search=magicoders MagiCoderS-DS-6.7B] || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek
|-
| 8 || [https://huggingface.co/meta-llama/Llama-3.1-70B LLaMA-3-70B-Base] || 20.1% || 52.2% || 3.2% || 0.6% || Meta
|-
| 9 || [https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat CodeQwen1.5-7B-Chat] || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)
|-
| 10 || [https://huggingface.co/models?search=dscoder DSCoder-6.7B-Instruct] || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek
|}


'''Coding 카테고리 특징''':
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모
* Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)
* LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함
* CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4
* Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)


=== Edge Devices (경량 모델) ===


HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리 기준 상위 10개 모델 (2026-07-31 기준)
== Coding 카테고리: LiveCodeBench Pass@1 ==


Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.
LiveCodeBench Code Generation 리더보드 기준 Top 10 모델 (평가 기간 2024-08-01 ~ 2025-05-01 기준, 최신 릴리스 모델). Pass@1과 Easy, Medium, Hard 난이도별 점수 포함.


{| class="wikitable" style="text-align:center; font-size:90%"
{{! class="wikitable"
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]
! Rank ! Model ! [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Easy-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Medium-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Hard-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)
|-
|-
| 1 || [https://huggingface.co/PJMixers-Dev/Qwen2.5-RomboTiesTest-7B PJMixers-Dev/Qwen2.5-RomboTiesTest-7B] || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg
| 1 | [https://platform.openai.com/docs/api-reference/chat/create O4-Mini (High)] | 80.2 | 99.1 | 89.4 | 63.5
|-
|-
| 2 || [https://huggingface.co/brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial] || basemergesandmoerges || 31.48% || 56.77% || 37.25% || 34.97% || 8.17% || 38.95% || 2.01 kg
| 2 | [https://platform.openai.com/docs/api-reference/chat/create O3 (High)] | 75.8 | 99.1 | 84.4 | 57.1
|-
|-
| 3 || [https://huggingface.co/DreadPoor/Here_We_Go_Again-8B-SLERP DreadPoor/Here_We_Go_Again-8B-SLERP] || basemergesandmoerges || 30.13% || 74.42% || 35.53% || 17.30% || 9.17% || 31.92% || 1.23 kg
| 3 | [https://platform.openai.com/docs/api-reference/chat/create O4-Mini (Medium)] | 74.2 | 98.2 | 86.5 | 52.7
|-
|-
| 4 || [https://huggingface.co/microsoft/Phi-4-mini-instruct microsoft/Phi-4-mini-instruct] || chat || 29.41% || 73.78% || 38.74% || 16.99% || 7.94% || 32.58% || 0.83 kg
| 4 | [https://ai.google.dev/gemini-api/docs/models/gemini Gemini-2.5-Pro-06-05] | 73.6 | 99.1 | 87.2 | 50.2
|-
|-
| 5 || [https://huggingface.co/T145/ZEUS-8B-V15 T145/ZEUS-8B-V15] || chat || 29.37% || 70.13% || 36.18% || 23.04% || 3.47% || 33.99% || 1.39 kg
| 5 | [https://huggingface.co/deepseek-ai/DeepSeek-R1-0528 DeepSeek-R1-0528] | 73.1 | 98.7 | 85.2 | 50.7
|-
|-
| 6 || [https://huggingface.co/DreadPoor/Asymmetric_Linearity-8B-Model_Stock DreadPoor/Asymmetric_Linearity-8B-Model_Stock] || basemergesandmoerges || 29.35% || 71.74% || 35.44% || 16.47% || 8.61% || 31.60% || 1.28 kg
| 6 | [https://ai.google.dev/gemini-api/docs/models/gemini Gemini-2.5-Pro-05-06] | 71.8 | 98.2 | 82.3 | 50.2
|-
|-
| 7 || [https://huggingface.co/DreadPoor/VENN_1.2-8B-Model_Stock DreadPoor/VENN_1.2-8B-Model_Stock] || basemergesandmoerges || 28.85% || 72.26% || 35.13% || 17.07% || 6.26% || 30.23% || 1.28 kg
| 7 | [https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-32B EXAONE-4.0-32B] | 70.0 | 98.4 | 82.3 | 46.2
|-
|-
| 8 || [https://huggingface.co/PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B] || basemergesandmoerges || 28.82% || 78.25% || 29.89% || 20.02% || 5.59% || 30.75% || 1.44 kg
| 8 | [https://huggingface.co/nvidia/OpenReasoning-Nemotron-32B OpenReasoning-Nemotron-32B] | 69.8 | 98.3 | 81.4 | 46.3
|-
|-
| 9 || [https://huggingface.co/DreadPoor/Elusive_Dragon_Heart-8B-LINEAR DreadPoor/Elusive_Dragon_Heart-8B-LINEAR] || basemergesandmoerges || 28.66% || 71.31% || 35.31% || 14.80% || 7.49% || 31.27% || 1.27 kg
| 9 | [https://platform.openai.com/docs/api-reference/chat/create O3-Mini-2025-01-31 (High)] | 67.4 | 99.1 | 84.4 | 38.4
|-
|-
| 10 || [https://huggingface.co/ehristoforu/coolqwen-3b-it ehristoforu/coolqwen-3b-it] || fine-tunedondomain-specificdatasets || 28.65% || 64.73% || 27.46% || 36.71% || 4.36% || 28.90% || 1.45 kg
| 10 | [https://huggingface.co/nvidia/OpenCodeReasoning-Nemotron-1.1-32B OpenCodeReasoning-Nemotron-1.1-32B] | 66.8 | 97.9 | 79.6 | 41.1
|}
}}
 
'''Edge Devices 카테고리 특징''':
* 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능
* Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적
* Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능
* 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)


=== Coding 카테고리 분석 ===


== Performance Analysis ==
* **상용 추론 모델 주도**: Top 6이 OpenAI O4-Mini/O3 계열과 Google Gemini 2.5 Pro 등 상용 추론 모델
* **오픈소스 모델 부상**: DeepSeek-R1-0528(5위), EXAONE-4.0-32B(7위), Nemotron 계열(8위, 10위)이 Top 10에 진입
* **Pass@1 최고점**: O4-Mini (High)이 80.2로 종합 1위
* **경량 추론 모델 경쟁**: 32B급 오픈소스(EXAONE, Nemotron)가 66~70 Pass@1로 상용 모델과 격차 축소


=== 파라미터 규모별 성능 트렌드 ===


'''78B 모델의 지배적 위치'''
== Edge Devices 카테고리: HuggingFace Edge Devices ==
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).


'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.


'''32B 모델의 경쟁력 부상'''
{{! class="wikitable"
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard)
 
=== CO₂ Cost 분석 ===
 
{| class="wikitable" style="text-align:center; font-size:90%"
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수
|-
|-
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5
|-
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0
|-
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1
| 32B || ~28.75 kg || 기준
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4
|}
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5
}}


32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.
=== Edge Devices 카테고리 분석 ===


=== 벤치마크 지표별 강점 ===
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)


* '''[https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
* '''[https://github.com/hendrycks/math MATH] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
* '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
* '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위


== Performance Analysis ==


== Architecture ==
{{! class="wikitable"
 
! Category ! Top Model ! Score ! Key Insight
=== 모델 아키텍처 비교 ===
 
{| class="wikitable" style="font-size:90%"
|+ Top 10 모델의 아키텍처 및 베이스 정보
|-
|-
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능
|-
|-
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터
| Coding | O4-Mini (High) | 80.2 Pass@1 | 상용 추론 모델 1위, 오픈소스(DeepSeek/EXAONE/Nemotron) 부상
|-
|-
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 최고 (계산 오류 가능성)
|-
}}
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처
|-
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델
|-
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈
|-
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델
|-
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델
|}
 
=== 아키텍처 트렌드 ===
* '''Qwen2.5 기반 모델의 확산''': Top 10 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합
 
 
== Best Practices ==
 
=== 모델 선택 가이드라인 ===
 
'''성능 최우선 시 (78B/72B 모델 권장)'''
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)
 
'''환경 비용 고려 시 (32B 모델 권장)'''
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위
 
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)
 
=== 모델 선택 의사결정 트리 ===
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated




== Limitations ==
== Limitations ==


* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.
* **데이터 신선도**: 2026-09-07 재확인 — General/Coding/Edge 데이터 모두 동일 (Open LLM Leaderboard 동결: 2025-03-20, LiveCodeBench 윈도우 2024-08~2025-05)
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.




== References ==
== References ==


=== HuggingFace Open LLM Leaderboard ===
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
 
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)
* [[Wikipedia:Open LLM Leaderboard|Open LLM Leaderboard]] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)
* 접근일: 2026-07-31
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)
* 상태: Archived (2026년 5월 기준)
* [MATH GitHub](https://github.com/hendrycks/math)
 
* [GPQA GitHub](https://github.com/idavidrein/gpqa)
=== LiveCodeBench (코딩 평가) ===
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)
 
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)
* LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)
* URL: https://huggingface.co/spaces/livecodebench/leaderboard
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)
* Paper: https://arxiv.org/abs/2406.15877
* [DeepSeek-R1-0528 Hub](https://huggingface.co/deepseek-ai/DeepSeek-R1-0528)
* GitHub: https://github.com/LiveCodeBench/LiveCodeBench
* [LGAI-EXAONE/EXAONE-4.0-32B Hub](https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-32B)
* 접근일: 2026-07-31
* [nvidia/OpenReasoning-Nemotron-32B Hub](https://huggingface.co/nvidia/OpenReasoning-Nemotron-32B)
 
* [nvidia/OpenCodeReasoning-Nemotron-1.1-32B Hub](https://huggingface.co/nvidia/OpenCodeReasoning-Nemotron-1.1-32B)
=== Top 10 모델 상세 링크 ===
* [LiveCodeBench 공식 리더보드](https://livecodebench.github.io/leaderboard.html)
 
==== General 카테고리 (전체 능력) ====
 
===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b =====
 
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&model=MaziyarPanahi%2Fcalme-3.2-instruct-78b
* 파라미터: 78B | Type: fine-tuned | Average: 52.08%
* CO₂ Cost: 66.01 kg
 
===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b =====
 
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&model=MaziyarPanahi%2Fcalme-3.1-instruct-78b
* 파라미터: 78B | Type: chat | Average: 51.29%
* CO₂ Cost: 64.44 kg
 
===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 =====
 
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&model=dfurman%2FCalmeRys-78B-Orpo-v0.1
* 파라미터: 78B | Type: chat | Average: 51.23%
* CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)
 
===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b =====
 
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&model=MaziyarPanahi%2Fcalme-2.4-rys-78b
* 파라미터: 78B | Type: chat | Average: 50.77%
* CO₂ Cost: 25.95 kg
 
===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated =====
 
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated
* 파라미터: 72B | Type: fine-tuned | Average: 48.11%
* CO₂ Cost: 76.77 kg (가장 높음)
 
===== Rank 6: Qwen/Qwen2.5-72B-Instruct =====
 
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct
* Qwen 공식 문서: https://qwenlm.github.io/
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&model=Qwen%2FQwen2.5-72B-Instruct
* 파라미터: 72B | Type: chat | Average: 47.98%
* CO₂ Cost: 47.65 kg
 
===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b =====
 
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b
* 파라미터: 72B | Type: chat | Average: 47.86%
* CO₂ Cost: 29.50 kg
 
===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B =====
 
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&model=newsbang%2FHomer-v1.0-Qwen2.5-72B
* 파라미터: 72B | Type: fine-tuned | Average: 47.46%
* CO₂ Cost: 29.55 kg
 
===== Rank 9: ehristoforu/qwen2.5-test-32b-it =====
 
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&model=ehristoforu%2Fqwen2.5-test-32b-it
* 파라미터: 32B | Type: chat | Average: 47.37%
* CO₂ Cost: 29.54 kg
 
===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B =====
 
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B
* 파라미터: 32B | Type: fine-tuned | Average: 47.34%
* CO₂ Cost: 7.95 kg (전체 중 가장 효율적)
 
==== Coding 카테고리 (코딩 능력) ====
 
===== Rank 1: Codestral-Latest =====
 
* HuggingFace Hub: https://huggingface.co/models?search=codestral
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%
* 개발사: Mistral AI
 
===== Rank 2: LLaMA-3-70B-Instruct =====
 
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%
* 개발사: Meta
 
===== Rank 3: Mixtral-8x22B-Instruct =====
 
* HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%
* 개발사: Mistral AI
 
===== Rank 4: DSCoder-33B-Instruct =====
 
* HuggingFace Hub: https://huggingface.co/models?search=dscoder
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%
* 개발사: DeepSeek
 
===== Rank 5: OC-DS-33B =====
 
* HuggingFace Hub: https://huggingface.co/models?search=opencoder
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%
* 개발사: OpenCoder
 
===== Rank 6: Phind-34B-V2 =====
 
* HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%
* 개발사: Phind
 
===== Rank 7: MagiCoderS-DS-6.7B =====
 
* HuggingFace Hub: https://huggingface.co/models?search=magicoders
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%
* 개발사: DeepSeek
 
===== Rank 8: LLaMA-3-70B-Base =====
 
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%
* 개발사: Meta (Instruct 버전 아님)
 
===== Rank 9: CodeQwen1.5-7B-Chat =====
 
* HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat
* Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%
* 개발사: Alibaba (Qwen)
 
===== Rank 10: DSCoder-6.7B-Instruct =====
 
* HuggingFace Hub: https://huggingface.co/models?search=dscoder
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%
* 개발사: DeepSeek
 
==== Edge Devices 카테고리 (경량 모델) ====
 
* HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
* 7B 이하 경량 모델 평가 기준


=== 벤치마크 지표 설명 ===


* [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가
== Related Pages ==
* [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
* [https://github.com/hendrycks/math MATH] — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
* [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&A)] — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도
* [https://github.com/hendrycks/test MMLU-PRO] — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
* [https://github.com/LiveCodeBench/LiveCodeBench Pass@1 (LiveCodeBench)] — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율


=== 관련 문서 ===
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
* [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)
* [LLM 벤치마크](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
* [Open Source Models](https://huggingface.co/models)


* [[Qwen2.5]] — 알리바바 그룹에서 개발한 오픈소스 LLM
[[Category:AI]]
* [[Llama]] — Meta에서 개발한 오픈소스 LLM
[[Category:Reference]]
* [[LLM Benchmark]] — 대규모 언어 모델 벤치마킹 방법론
* [[Fine-tuning]] — 사전 학습 모델의 추가 학습 기법
* [[CO₂ Emissions in AI]] — AI 모델의 환경 영향
* [[Codestral]] — Mistral AI의 코딩 특화 LLM
* [[LiveCodeBench]] — 코딩 능력 평가 벤치마크

Latest revision as of 15:11, 7 September 2026

Top 10 오픈소스 AI 모델 동향

Template:Status

Template:TOC

Overview

HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 9월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.

Summary

  • 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록
  • 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고
  • 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고

조사 정보


Purpose

이 문서가 존재하는 이유

  • Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리
  • Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)
  • Non-goals: 상용 모델 비교, 자체 벤치마크 수행


Key Concepts

{{! class="wikitable" ! Concept ! Description ! Related |- | [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | 오픈소스 LLM 종합 성능 벤치마크 | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval), [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard), [MMLU-PRO](https://github.com/hendrycks/test) |- | [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) | 코딩 능력 평가 벤치마크 | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) |- | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval) |- | [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard) |- | [MMLU-PRO](https://github.com/hendrycks/test) | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test) |- | [MATH](https://github.com/hendrycks/math) | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math) |- | [GPQA](https://github.com/idavidrein/gpqa) | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa) |- | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench) }}


General 카테고리: HuggingFace Open LLM Leaderboard Overall Average

HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.

{{! class="wikitable" ! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) ! [MATH](https://github.com/hendrycks/math) Lvl 5 ! [GPQA](https://github.com/idavidrein/gpqa) ! [MMLU-PRO](https://github.com/hendrycks/test) |- | 1 | MaziyarPanahi/calme-3.2-instruct-78b | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0 | 2 | MaziyarPanahi/calme-3.1-instruct-78b | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7 | 3 | dfurman/CalmeRys-78B-Orpo-v0.1 | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8 | 4 | MaziyarPanahi/calme-2.4-rys-78b | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7 | 5 | huihui-ai/Qwen2.5-72B-Instruct-abliterated | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4 | 6 | Qwen/Qwen2.5-72B-Instruct | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4 | 7 | MaziyarPanahi/calme-2.1-qwen2.5-72b | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3 | 8 | newsbang/Homer-v1.0-Qwen2.5-72B | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2 | 9 | ehristoforu/qwen2.5-test-32b-it | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9 | 10 | Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3 }}

General 카테고리 분석

  • **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모
  • **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)
  • **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함
  • **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4


Coding 카테고리: LiveCodeBench Pass@1

LiveCodeBench Code Generation 리더보드 기준 Top 10 모델 (평가 기간 2024-08-01 ~ 2025-05-01 기준, 최신 릴리스 모델). Pass@1과 Easy, Medium, Hard 난이도별 점수 포함.

{{! class="wikitable" ! Rank ! Model ! [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Easy-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Medium-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Hard-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) |- | 1 | O4-Mini (High) | 80.2 | 99.1 | 89.4 | 63.5 |- | 2 | O3 (High) | 75.8 | 99.1 | 84.4 | 57.1 |- | 3 | O4-Mini (Medium) | 74.2 | 98.2 | 86.5 | 52.7 |- | 4 | Gemini-2.5-Pro-06-05 | 73.6 | 99.1 | 87.2 | 50.2 |- | 5 | DeepSeek-R1-0528 | 73.1 | 98.7 | 85.2 | 50.7 |- | 6 | Gemini-2.5-Pro-05-06 | 71.8 | 98.2 | 82.3 | 50.2 |- | 7 | EXAONE-4.0-32B | 70.0 | 98.4 | 82.3 | 46.2 |- | 8 | OpenReasoning-Nemotron-32B | 69.8 | 98.3 | 81.4 | 46.3 |- | 9 | O3-Mini-2025-01-31 (High) | 67.4 | 99.1 | 84.4 | 38.4 |- | 10 | OpenCodeReasoning-Nemotron-1.1-32B | 66.8 | 97.9 | 79.6 | 41.1 }}

Coding 카테고리 분석

  • **상용 추론 모델 주도**: Top 6이 OpenAI O4-Mini/O3 계열과 Google Gemini 2.5 Pro 등 상용 추론 모델
  • **오픈소스 모델 부상**: DeepSeek-R1-0528(5위), EXAONE-4.0-32B(7위), Nemotron 계열(8위, 10위)이 Top 10에 진입
  • **Pass@1 최고점**: O4-Mini (High)이 80.2로 종합 1위
  • **경량 추론 모델 경쟁**: 32B급 오픈소스(EXAONE, Nemotron)가 66~70 Pass@1로 상용 모델과 격차 축소


Edge Devices 카테고리: HuggingFace Edge Devices

7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.

{{! class="wikitable" ! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) |- | 1 | JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 | 0.0 | 47.09 | 73.2 | 65.5 | 2 | Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview | 7.616 | 37.30 | 76.4 | 36.6 | 3 | gz987/qwen2.5-7b-cabs-v0.3 | 7.616 | 36.94 | 75.7 | 36.0 | 4 | marcuscedricridia/pre-cursa-o1-v1.2 | 7.613 | 36.89 | 75.5 | 36.1 | 5 | gz987/qwen2.5-7b-cabs-v0.4 | 7.616 | 36.88 | 75.8 | 36.4 | 6 | suayptalha/Clarus-7B-v0.2 | 7.613 | 36.86 | 76.8 | 36.0 | 7 | marcuscedricridia/cursa-o1-7b-v1.2-normalize-false | 7.613 | 36.80 | 76.2 | 36.1 | 8 | marcuscedricridia/pre-cursa-o1-v1.6 | 7.613 | 36.80 | 75.3 | 35.9 | 9 | suayptalha/Clarus-7B-v0.3 | 7.616 | 36.78 | 75.1 | 36.5 | 10 | marcuscedricridia/pre-cursa-o1-v1.3 | 7.613 | 36.71 | 75.1 | 35.5 }}

Edge Devices 카테고리 분석

  • **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델
  • **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터
  • **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지
  • **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)


Performance Analysis

{{! class="wikitable" ! Category ! Top Model ! Score ! Key Insight |- | General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능 |- | Coding | O4-Mini (High) | 80.2 Pass@1 | 상용 추론 모델 1위, 오픈소스(DeepSeek/EXAONE/Nemotron) 부상 |- | Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성) }}


Limitations

  • **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨
  • **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재
  • **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)
  • **데이터 신선도**: 2026-09-07 재확인 — General/Coding/Edge 데이터 모두 동일 (Open LLM Leaderboard 동결: 2025-03-20, LiveCodeBench 윈도우 2024-08~2025-05)


References


Related Pages