Top 10 오픈소스 AI 모델 동향: Difference between revisions

From HPCWIKI
Jump to navigation Jump to search
m (Top 10 모델 데이터 업데이트 (2026-08-03) - HuggingFace Open LLM Leaderboard 최신 데이터 반영)
(Weekly update: Top 10 models refreshed (2026-08-07))
Line 4: Line 4:
|status=Draft
|status=Draft
|owner=Knowledge Agent
|owner=Knowledge Agent
|last_update=2026-08-03
|last_update=2026-08-07
|review=Pending
|review=Pending
}}
}}
Line 11: Line 11:


== Overview ==
== Overview ==
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.
 
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.


=== Summary ===
=== Summary ===
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시


* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고


=== 조사 정보 ===
=== 조사 정보 ===


* 조사 일자: 2026-08-03 09:24 KST
* 조사 일자: 2026-08-07 10:00 KST
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)
* 데이터 기준일: 2026-08-03
* 다음 업데이트 예정: 2026-08-14
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)
 
---


== Purpose ==
== Purpose ==
이 문서가 존재하는 이유
이 문서가 존재하는 이유
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음


* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행
---


== Key Concepts ==
== Key Concepts ==
{| class="wikitable"
 
! 개념 ! 설명 ! 관련 문서
{{! class="wikitable"
! Concept ! Description ! Related
|-
|-
|| [https://huggingface.co/docs/transformers/model_sizes_parameters Parameters (파라미터 수)] | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함
| [[HuggingFace Open LLM Leaderboard]] | 오픈소스 LLM 종합 성능 벤치마크 | [[IFEval]], [[BBH]], [[MMLU-PRO]]
|-
|-
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Overall Average] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
| [[LiveCodeBench]] | 코딩 능력 평가 벤치마크 | [[Pass@1]]
|-
|-
|| [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정
| [[IFEval]] | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)
|-
|-
|| [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
| [[BBH]] | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)
|-
|-
|| [https://github.com/hendrycks/math MATH] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
| [[MMLU-PRO]] | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)
|-
|-
|| [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&A)] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가
| [[MATH]] | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)
|-
|-
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard MUSR (Multi-Step Reasoning)] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
| [[GPQA]] | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)
|-
|-
|| [https://github.com/hendrycks/test MMLU-PRO] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
| [[Pass@1]] | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)
|-
}}
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
|-
|| [https://huggingface.co/docs/transformers/training fine-tuned] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
|-
|| [https://huggingface.co/docs/transformers/model_sharing chat] | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨
|-
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard HuggingFace Open LLM Leaderboard] | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공
|}
== Top 10 Models ==
 
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.


=== General (전체 능력) ===
---


HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-08-03 기준)
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==


이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.


{| class="wikitable" style="text-align:center; font-size:90%"
{{! class="wikitable"
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]
! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH ! MATH Lvl 5 ! GPQA ! MMLU-PRO
|-
|-
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || 🔶 fine-tuned on domain-specific datasets || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0
|-
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7
| 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || 💬 chat models (RLHF, DPO, IFT, ...) || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8
|-
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7
| 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || 💬 chat models (RLHF, DPO, IFT, ...) || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4
|-
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4
| 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || 💬 chat models (RLHF, DPO, IFT, ...) || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3
|-
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2
| 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || 🔶 fine-tuned on domain-specific datasets || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9
|-
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3
| 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg
}}
|-
| 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg
|-
| 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || 🔶 fine-tuned on domain-specific datasets || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg
|-
| 9 || [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg
|-
| 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || 🔶 fine-tuned on domain-specific datasets || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg
|}


'''General 카테고리 특징''':
=== General 카테고리 분석 ===
* 78B 파라미터 모델이 상위권을 지배 (상위 4개 모두 78B)
* CO₂ Cost 효율: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg)가 가장 효율적
* huihui-ai/Qwen2.5-72B-Instruct-abliterated (76.77kg)가 가장 높은 환경 비용
* IFEval 최고: MaziyarPanahi/calme-2.1-qwen2.5-72b (86.62%)
* MATH 최고: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (60.27%)
* MMLU-PRO 최고: MaziyarPanahi/calme-3.2-instruct-78b (70.03%)


=== Coding (코딩 능력) ===
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4


LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-08-03 기준)
---


LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.
== Coding 카테고리: LiveCodeBench Pass@1 ==


{| class="wikitable" style="text-align:center; font-size:90%"
LiveCodeBench Code Generation 카테고리 Pass@1 기준 Top 10 모델.
! Rank !! Model !! [https://github.com/LiveCodeBench/LiveCodeBench Pass@1] !! Easy !! Medium !! Hard !! Source
|-
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI
|-
| 2 || [https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct LLaMA-3-70B-Instruct] || 28.3% || 60.7% || 15.8% || 1.4% || Meta
|-
| 3 || [https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1 Mixtral-8x22B-Instruct] || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI
|-
| 4 || [https://huggingface.co/models?search=dscoder DSCoder-33B-Instruct] || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek
|-
| 5 || [https://huggingface.co/models?search=opencoder OC-DS-33B] || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder
|-
| 6 || [https://huggingface.co/Phind/Phind-CodeLlama-34B-v2 Phind-34B-V2] || 21.0% || 53.4% || 4.7% || 0.1% || Phind
|-
| 7 || [https://huggingface.co/models?search=magicoders MagiCoderS-DS-6.7B] || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek
|-
| 8 || [https://huggingface.co/meta-llama/Llama-3.1-70B LLaMA-3-70B-Base] || 20.1% || 52.2% || 3.2% || 0.6% || Meta
|-
| 9 || [https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat CodeQwen1.5-7B-Chat] || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)
|-
| 10 || [https://huggingface.co/models?search=dscoder DSCoder-6.7B-Instruct] || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek
|}


'''Coding 카테고리 특징''':
{{! class="wikitable"
* Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능
! Rank ! Model ! Pass@1 ! Easy-Pass@1 ! Medium-Pass@1 ! Hard-Pass@1
* LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수
* CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화
* Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)
 
=== Edge Devices (경량 모델) ===
 
HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리 기준 상위 10개 모델 (2026-08-03 기준)
 
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.
 
{| class="wikitable" style="text-align:center; font-size:90%"
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]
|-
|-
| 1 || [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] || 🤝 base merges and moerges || 37.30% || 76.40% || 36.62% || 48.79% || 8.95% || 37.51% || 0.62 kg
| 1 | GPT-4O-2024-05-13 | 45.6 | 88.3 | 33.2 | 4.2
|-
|-
| 2 || [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] || 🤝 base merges and moerges || 36.94% || 75.70% || 35.96% || 49.32% || 7.61% || 37.80% || 0.63 kg
| 2 | GPT-4-Turbo-2024-04-09 | 44.7 | 85.3 | 33.0 | 5.1
|-
|-
| 3 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] || 🤝 base merges and moerges || 36.89% || 75.49% || 36.12% || 50.68% || 8.39% || 37.80% || 0.69 kg
| 3 | GPT-4-Turbo-1106 | 39.7 | 84.4 | 24.0 | 0.5
|-
|-
| 4 || [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] || 🤝 base merges and moerges || 36.88% || 75.83% || 36.36% || 48.49% || 7.72% || 37.73% || 0.63 kg
| 4 | GPT-4-0613 | 36.9 | 78.4 | 21.2 | 2.3
|-
|-
| 5 || [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] || 🤝 base merges and moerges || 36.86% || 76.79% || 36.02% || 48.56% || 6.94% || 37.78% || 0.67 kg
| 5 | Gemini-Pro-1.5-May | 35.7 | 76.0 | 19.4 | 3.5
|-
|-
| 6 || [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] || 🤝 base merges and moerges || 36.80% || 76.16% || 36.13% || 49.92% || 7.61% || 38.17% || 0.68 kg
| 6 | Claude-3-Opus | 35.4 | 78.8 | 16.3 | 3.2
|-
|-
| 7 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] || 🤝 base merges and moerges || 36.80% || 75.28% || 35.92% || 50.00% || 9.40% || 37.92% || 0.67 kg
| 7 | Codestral-Latest | 32.2 | 69.0 | 18.7 | 0.9
|-
|-
| 8 || [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] || 🤝 base merges and moerges || 36.78% || 75.09% || 36.46% || 48.79% || 8.28% || 37.61% || 0.64 kg
| 8 | Gemini-Flash-1.5-May | 30.0 | 68.1 | 12.6 | 2.7
|-
|-
| 9 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] || 🤝 base merges and moerges || 36.71% || 75.07% || 35.47% || 50.76% || 8.39% || 38.00% || 0.68 kg
| 9 | LLama3-70b-Ins | 28.3 | 60.7 | 15.8 | 1.4
|-
|-
| 10 || [https://huggingface.co/marcuscedricridia/cursa-o1-7b marcuscedricridia/cursa-o1-7b] || 🤝 base merges and moerges || 36.71% || 76.28% || 35.70% || 49.55% || 7.61% || 37.69% || 0.68 kg
| 10 | Claude-3-Sonnet | 26.9 | 67.6 | 6.3 | 1.1
|}
}}
 
'''Edge Devices 카테고리 특징''':
* Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview이(가) 평균 점수 37.30%로 가장 우수
* Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview이(가) CO₂ Cost 0.62kg으로 가장 효율적
* Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능
* 7B 모델들이 엣지 디바이스 배포에 적합
 
 
=== 파라미터 규모별 성능 트렌드 ===


'''78B 모델의 지배적 위치'''
=== Coding 카테고리 분석 ===
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).


'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''
* **상용 모델 독점**: Top 10 모두 상용 모델 (GPT, Gemini, Claude)
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.
* **GPT-4 계열 강세**: Top 4 중 3개 차지
* **오픈소스 모델 부재**: Top 10에 오픈소스 모델 없음
* **LLama3-70b**: 70b 파라미터로 9위 기록 (28.3 Pass@1)


'''32B 모델의 경쟁력 부상'''
---
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.


'''Edge Devices (7B 이하 경량 모델)'''
== Edge Devices 카테고리: HuggingFace Edge Devices ==
7B 이하 경량 모델 중 Qwen2.5 기반 모델이 우수 성능을 보이고 있습니다. Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview가 37.30%로 가장 높은 평균 점수를 기록했으며, CO₂ Cost는 0.62kg으로 매우 효율적입니다.


=== CO₂ Cost 분석 ===
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.


{| class="wikitable" style="text-align:center; font-size:90%"
{{! class="wikitable"
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수
! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH
|-
|-
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6
| 32B || ~28.75 kg || 기준
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0
| 7B (Edge) || ~0.65 kg || 기준
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1
|}
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5
}}


32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다. Edge Devices 카테고리에서는 7B 모델이 0.62kg으로 가장 효율적입니다.
=== Edge Devices 카테고리 분석 ===


=== 벤치마크 지표별 강점 ===
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)


* '''[https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
---
* '''[https://github.com/hendrycks/math MATH] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
* '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
* '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위


=== 모델 아키텍처 비교 ===
== Performance Analysis ==


{| class="wikitable" style="font-size:90%"
{{! class="wikitable"
|+ Top 10 모델의 아키텍처 및 베이스 정보
! Category ! Top Model ! Score ! Key Insight
|-
|-
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능
|-
|-
| 1 || [MaziyarPanahi/calme-3.2-instruct-78b](MaziyarPanahi/calme-3.2-instruct-78b) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터
| Coding | GPT-4O-2024-05-13 | 45.6 Pass@1 | 상용 모델 독점
| 2 || [MaziyarPanahi/calme-3.1-instruct-78b](MaziyarPanahi/calme-3.1-instruct-78b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터
|-
| 3 || [dfurman/CalmeRys-78B-Orpo-v0.1](dfurman/CalmeRys-78B-Orpo-v0.1) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || dfurman 이 개발한 Calme 계열 모델. ORPO 최적화
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성)
| 4 || [MaziyarPanahi/calme-2.4-rys-78b](MaziyarPanahi/calme-2.4-rys-78b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터
}}
| 5 || [huihui-ai/Qwen2.5-72B-Instruct-abliterated](huihui-ai/Qwen2.5-72B-Instruct-abliterated) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || Abliterated 버전 — 안전 필터 제거로 성능 향상
| 6 || [Qwen/Qwen2.5-72B-Instruct](Qwen/Qwen2.5-72B-Instruct) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처
| 7 || [MaziyarPanahi/calme-2.1-qwen2.5-72b](MaziyarPanahi/calme-2.1-qwen2.5-72b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Qwen2.5 기반 Calme 모델
| 8 || [newsbang/Homer-v1.0-Qwen2.5-72B](newsbang/Homer-v1.0-Qwen2.5-72B) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || newsbang 가 개발한 Homer 시리즈
| 9 || [ehristoforu/qwen2.5-test-32b-it](ehristoforu/qwen2.5-test-32b-it) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Qwen2.5-32B 기반 지시 따르기 최적화 모델
| 10 || [Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B](Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || Saxo 가 개발한 32B 모델
|}
 
== Best Practices ==
 
=== 모델 선택 가이드라인 ===
 
'''성능 최우선 시 (78B/72B 모델 권장)'''
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)
 
'''환경 비용 고려 시 (32B 모델 권장)'''
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위
 
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)
 
=== 모델 선택 의사결정 트리 ===
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated


---


== Limitations ==
== Limitations ==


* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.
* **데이터 신선도**: 2026-08-07 기준, 주기적 업데이트 필요
* '''데이터 시점''': 본 데이터는 2026-08-03 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.


---


== References ==
== References ==


=== HuggingFace Open LLM Leaderboard ===
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
 
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Open LLM Leaderboard] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)
* 접근일: 2026-08-03
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)
* 상태: Archived (2026년 5월 기준)
* [MATH GitHub](https://github.com/hendrycks/math)
 
* [GPQA GitHub](https://github.com/idavidrein/gpqa)
=== LiveCodeBench (코딩 평가) ===
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)
 
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)
* LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)
* URL: https://huggingface.co/spaces/livecodebench/leaderboard
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)
* Paper: https://arxiv.org/abs/2406.15877
* GitHub: https://github.com/LiveCodeBench/LiveCodeBench
* 접근일: 2026-08-03
 
=== Top 10 모델 상세 링크 ===
 
==== General 카테고리 (전체 능력) 상세 링크 ====
===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b =====
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&model=MaziyarPanahi/calme-3.2-instruct-78b
* 파라미터: 78B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 52.08%
* CO₂ Cost: 66.01 kg
 
===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b =====
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&model=MaziyarPanahi/calme-3.1-instruct-78b
* 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 51.29%
* CO₂ Cost: 64.44 kg
 
===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 =====
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&model=dfurman/CalmeRys-78B-Orpo-v0.1
* 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 51.23%
* CO₂ Cost: 25.99 kg
 
===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b =====
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&model=MaziyarPanahi/calme-2.4-rys-78b
* 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 50.77%
* CO₂ Cost: 25.95 kg
 
===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated =====
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&model=huihui-ai/Qwen2.5-72B-Instruct-abliterated
* 파라미터: 73B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 48.11%
* CO₂ Cost: 76.77 kg
 
===== Rank 6: Qwen/Qwen2.5-72B-Instruct =====
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&model=Qwen/Qwen2.5-72B-Instruct
* 파라미터: 73B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.98%
* CO₂ Cost: 47.65 kg
 
===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b =====
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&model=MaziyarPanahi/calme-2.1-qwen2.5-72b
* 파라미터: 73B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.86%
* CO₂ Cost: 29.50 kg
 
===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B =====
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&model=newsbang/Homer-v1.0-Qwen2.5-72B
* 파라미터: 73B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 47.46%
* CO₂ Cost: 29.55 kg
 
===== Rank 9: ehristoforu/qwen2.5-test-32b-it =====
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&model=ehristoforu/qwen2.5-test-32b-it
* 파라미터: 33B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.37%
* CO₂ Cost: 29.54 kg
 
===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B =====
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&model=Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
* 파라미터: 33B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 47.34%
* CO₂ Cost: 7.95 kg
 
 
==== Coding 카테고리 (코딩 능력) ====
 
===== Rank 1: Codestral-Latest =====
 
* HuggingFace Hub: https://huggingface.co/models?search=codestral
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%
* 개발사: Mistral AI
 
===== Rank 2: LLaMA-3-70B-Instruct =====
 
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%
* 개발사: Meta
 
===== Rank 3: Mixtral-8x22B-Instruct =====
 
* HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%
* 개발사: Mistral AI
 
===== Rank 4: DSCoder-33B-Instruct =====
 
* HuggingFace Hub: https://huggingface.co/models?search=dscoder
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%
* 개발사: DeepSeek
 
===== Rank 5: OC-DS-33B =====
 
* HuggingFace Hub: https://huggingface.co/models?search=opencoder
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%
* 개발사: OpenCoder
 
===== Rank 6: Phind-34B-V2 =====
 
* HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%
* 개발사: Phind
 
===== Rank 7: MagiCoderS-DS-6.7B =====
 
* HuggingFace Hub: https://huggingface.co/models?search=magicoders
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%
* 개발사: DeepSeek
 
===== Rank 8: LLaMA-3-70B-Base =====
 
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%
* 개발사: Meta (Instruct 버전 아님)
 
===== Rank 9: CodeQwen1.5-7B-Chat =====
 
* HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat
* Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%
* 개발사: Alibaba (Qwen)
 
===== Rank 10: DSCoder-6.7B-Instruct =====
 
* HuggingFace Hub: https://huggingface.co/models?search=dscoder
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
* Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%
* 개발사: DeepSeek
 
==== Edge Devices 카테고리 (경량 모델) ====
 
* HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
* 7B 이하 경량 모델 평가 기준


=== 벤치마크 지표 설명 ===
---


* [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가
== Related Pages ==
* [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
* [https://github.com/hendrycks/math MATH] — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
* [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&A)] — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도
* [https://github.com/hendrycks/test MMLU-PRO] — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
* [https://github.com/LiveCodeBench/LiveCodeBench Pass@1 (LiveCodeBench)] — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율


=== 관련 문서 ===
* [[HuggingFace Open LLM Leaderboard]]
* [[LiveCodeBench]]
* [[LLM Benchmark]]
* [[Open Source Models]]


* [https://qwenlm.github.io/ Qwen2.5] — 알리바바 그룹에서 개발한 오픈소스 LLM
[[Category:AI]]
* [https://ai.meta.com/llama/ Llama] — Meta에서 개발한 오픈소스 LLM
[[Category:Reference]]
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard LLM Benchmark] — 대규모 언어 모델 벤치마킹 방법론
* [https://huggingface.co/docs/transformers/training Fine-tuning] — 사전 학습 모델의 추가 학습 기법
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Emissions in AI] — AI 모델의 환경 영향
* [https://huggingface.co/models?search=codestral Codestral] — Mistral AI의 코딩 특화 LLM
* [https://github.com/LiveCodeBench/LiveCodeBench LiveCodeBench] — 코딩 능력 평가 벤치마크

Revision as of 12:21, 7 August 2026

Top 10 오픈소스 AI 모델 동향

Template:Status

Template:TOC

Overview

HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.

Summary

  • 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록
  • 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고
  • 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고

조사 정보

---

Purpose

이 문서가 존재하는 이유

  • Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리
  • Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)
  • Non-goals: 상용 모델 비교, 자체 벤치마크 수행

---

Key Concepts

{{! class="wikitable" ! Concept ! Description ! Related |- | HuggingFace Open LLM Leaderboard | 오픈소스 LLM 종합 성능 벤치마크 | IFEval, BBH, MMLU-PRO |- | LiveCodeBench | 코딩 능력 평가 벤치마크 | Pass@1 |- | IFEval | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval) |- | BBH | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard) |- | MMLU-PRO | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test) |- | MATH | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math) |- | GPQA | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa) |- | Pass@1 | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench) }}

---

General 카테고리: HuggingFace Open LLM Leaderboard Overall Average

HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.

{{! class="wikitable" ! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH ! MATH Lvl 5 ! GPQA ! MMLU-PRO |- | 1 | MaziyarPanahi/calme-3.2-instruct-78b | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0 | 2 | MaziyarPanahi/calme-3.1-instruct-78b | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7 | 3 | dfurman/CalmeRys-78B-Orpo-v0.1 | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8 | 4 | MaziyarPanahi/calme-2.4-rys-78b | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7 | 5 | huihui-ai/Qwen2.5-72B-Instruct-abliterated | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4 | 6 | Qwen/Qwen2.5-72B-Instruct | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4 | 7 | MaziyarPanahi/calme-2.1-qwen2.5-72b | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3 | 8 | newsbang/Homer-v1.0-Qwen2.5-72B | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2 | 9 | ehristoforu/qwen2.5-test-32b-it | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9 | 10 | Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3 }}

General 카테고리 분석

  • **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모
  • **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)
  • **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함
  • **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4

---

Coding 카테고리: LiveCodeBench Pass@1

LiveCodeBench Code Generation 카테고리 Pass@1 기준 Top 10 모델.

{{! class="wikitable" ! Rank ! Model ! Pass@1 ! Easy-Pass@1 ! Medium-Pass@1 ! Hard-Pass@1 |- | 1 | GPT-4O-2024-05-13 | 45.6 | 88.3 | 33.2 | 4.2 |- | 2 | GPT-4-Turbo-2024-04-09 | 44.7 | 85.3 | 33.0 | 5.1 |- | 3 | GPT-4-Turbo-1106 | 39.7 | 84.4 | 24.0 | 0.5 |- | 4 | GPT-4-0613 | 36.9 | 78.4 | 21.2 | 2.3 |- | 5 | Gemini-Pro-1.5-May | 35.7 | 76.0 | 19.4 | 3.5 |- | 6 | Claude-3-Opus | 35.4 | 78.8 | 16.3 | 3.2 |- | 7 | Codestral-Latest | 32.2 | 69.0 | 18.7 | 0.9 |- | 8 | Gemini-Flash-1.5-May | 30.0 | 68.1 | 12.6 | 2.7 |- | 9 | LLama3-70b-Ins | 28.3 | 60.7 | 15.8 | 1.4 |- | 10 | Claude-3-Sonnet | 26.9 | 67.6 | 6.3 | 1.1 }}

Coding 카테고리 분석

  • **상용 모델 독점**: Top 10 모두 상용 모델 (GPT, Gemini, Claude)
  • **GPT-4 계열 강세**: Top 4 중 3개 차지
  • **오픈소스 모델 부재**: Top 10에 오픈소스 모델 없음
  • **LLama3-70b**: 70b 파라미터로 9위 기록 (28.3 Pass@1)

---

Edge Devices 카테고리: HuggingFace Edge Devices

7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.

{{! class="wikitable" ! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH |- | 1 | JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 | 0.0 | 47.09 | 73.2 | 65.5 | 2 | Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview | 7.616 | 37.30 | 76.4 | 36.6 | 3 | gz987/qwen2.5-7b-cabs-v0.3 | 7.616 | 36.94 | 75.7 | 36.0 | 4 | marcuscedricridia/pre-cursa-o1-v1.2 | 7.613 | 36.89 | 75.5 | 36.1 | 5 | gz987/qwen2.5-7b-cabs-v0.4 | 7.616 | 36.88 | 75.8 | 36.4 | 6 | suayptalha/Clarus-7B-v0.2 | 7.613 | 36.86 | 76.8 | 36.0 | 7 | marcuscedricridia/cursa-o1-7b-v1.2-normalize-false | 7.613 | 36.80 | 76.2 | 36.1 | 8 | marcuscedricridia/pre-cursa-o1-v1.6 | 7.613 | 36.80 | 75.3 | 35.9 | 9 | suayptalha/Clarus-7B-v0.3 | 7.616 | 36.78 | 75.1 | 36.5 | 10 | marcuscedricridia/pre-cursa-o1-v1.3 | 7.613 | 36.71 | 75.1 | 35.5 }}

Edge Devices 카테고리 분석

  • **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델
  • **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터
  • **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지
  • **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)

---

Performance Analysis

{{! class="wikitable" ! Category ! Top Model ! Score ! Key Insight |- | General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능 |- | Coding | GPT-4O-2024-05-13 | 45.6 Pass@1 | 상용 모델 독점 |- | Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성) }}

---

Limitations

  • **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨
  • **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재
  • **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)
  • **데이터 신선도**: 2026-08-07 기준, 주기적 업데이트 필요

---

References

---

Related Pages