Top 10 오픈소스 AI 모델 동향: Difference between revisions

From HPCWIKI
Jump to navigation Jump to search
(Category-based Top 10 separation (General/Coding/Edge), detailed references with model URLs, benchmark links, --- removed)
(Fix Key Concepts table structure, add HuggingFace Hub links to all model names, add benchmark header links)
Line 37: Line 37:
! 개념 ! 설명 ! 관련 문서
! 개념 ! 설명 ! 관련 문서
|-
|-
| 파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함
|| [[Parameters|파라미터 수 (Parameters)]] | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함
|-
|-
| Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
|| [[Overall Average]] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
|-
|-
| IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정
|| [[IFEval|IFEval (Instruction Following Evaluation)]] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정 | [https://github.com/google-research/google-research/tree/master/instruction_following_eval GitHub]
|-
|-
| BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
|| [[BBH|BBH (Big Bench Hard)]] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가 | [https://github.com/suzgunmirac/BIG-Bench-Hard GitHub]
|-
|-
| MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
|| [[MATH (벤치마크)|MATH]] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정 | [https://github.com/hendrycks/math GitHub]
|-
|-
| GPQA (Graduate-Level Google-Proof Q&A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가
|| [[GPQA|GPQA (Graduate-Level Google-Proof Q&A)]] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가 | [https://github.com/idavidrein/gpqa GitHub]
|-
|-
| MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
|| [[MUSR|MUSR (Multi-Step Reasoning)]] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
|-
|-
| MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
|| [[MMLU-PRO|MMLU-PRO]] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가 | [https://github.com/hendrycks/test GitHub]
|-
|-
| CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
|| [[CO₂ Cost|CO₂ Cost]] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
|-
|-
| fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
|| [[Fine-tuning|fine-tuned]] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
|-
|-
| chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨
|| [[Chat model|chat]] | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨
| HuggingFace Open LLM Leaderboard | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 | https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard |
|-
|| [[HuggingFace Open LLM Leaderboard]] | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 | [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard HuggingFace]
|}
|}
== Top 10 Models ==
== Top 10 Models ==


Line 73: Line 72:


{| class="wikitable" style="text-align:center; font-size:90%"
{| class="wikitable" style="text-align:center; font-size:90%"
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MUSR !! MMLU-PRO !! CO₂ Cost
! Rank !! Model !! Type !! Average !! [[IFEval|IFEval]] !! [[BBH|BBH]] !! [[MATH (벤치마크)|MATH]] !! [[GPQA|GPQA]] !! [[MUSR|MUSR]] !! [[MMLU-PRO|MMLU-PRO]] !! [[CO₂ Cost|CO₂ Cost]]
|-
|-
| 1 || MaziyarPanahi/calme-3.2-instruct-78b || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg
|-
|-
| 2 || MaziyarPanahi/calme-3.1-instruct-78b || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg
| 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg
|-
|-
| 3 || dfurman/CalmeRys-78B-Orpo-v0.1 || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg
| 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg
|-
|-
| 4 || MaziyarPanahi/calme-2.4-rys-78b || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg
| 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg
|-
|-
| 5 || huihui-ai/Qwen2.5-72B-Instruct-abliterated || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg
| 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg
|-
|-
| 6 || Qwen/Qwen2.5-72B-Instruct || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg
| 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg
|-
|-
| 7 || MaziyarPanahi/calme-2.1-qwen2.5-72b || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg
| 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg
|-
|-
| 8 || newsbang/Homer-v1.0-Qwen2.5-72B || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg
| 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg
|-
|-
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg
|-
|-
| 10 || Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg
| 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg
|}
|}


Line 109: Line 108:


{| class="wikitable" style="text-align:center; font-size:90%"
{| class="wikitable" style="text-align:center; font-size:90%"
! Rank !! Model !! Pass@1 !! Easy !! Medium !! Hard !! Source
! Rank !! Model !! [[Pass@1|Pass@1]] !! Easy !! Medium !! Hard !! Source
|-
|-
| 1 || Codestral-Latest || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI
|-
|-
| 2 || LLaMA-3-70B-Instruct || 28.3% || 60.7% || 15.8% || 1.4% || Meta
| 2 || [https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct LLaMA-3-70B-Instruct] || 28.3% || 60.7% || 15.8% || 1.4% || Meta
|-
|-
| 3 || Mixtral-8x22B-Instruct || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI
| 3 || [https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1 Mixtral-8x22B-Instruct] || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI
|-
|-
| 4 || DSCoder-33B-Instruct || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek
| 4 || [https://huggingface.co/models?search=dscoder DSCoder-33B-Instruct] || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek
|-
|-
| 5 || OC-DS-33B || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder
| 5 || [https://huggingface.co/models?search=opencoder OC-DS-33B] || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder
|-
|-
| 6 || Phind-34B-V2 || 21.0% || 53.4% || 4.7% || 0.1% || Phind
| 6 || [https://huggingface.co/Phind/Phind-CodeLlama-34B-v2 Phind-34B-V2] || 21.0% || 53.4% || 4.7% || 0.1% || Phind
|-
|-
| 7 || MagiCoderS-DS-6.7B || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek
| 7 || [https://huggingface.co/models?search=magicoders MagiCoderS-DS-6.7B] || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek
|-
|-
| 8 || LLaMA-3-70B-Base || 20.1% || 52.2% || 3.2% || 0.6% || Meta
| 8 || [https://huggingface.co/meta-llama/Llama-3.1-70B LLaMA-3-70B-Base] || 20.1% || 52.2% || 3.2% || 0.6% || Meta
|-
|-
| 9 || CodeQwen1.5-7B-Chat || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)
| 9 || [https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat CodeQwen1.5-7B-Chat] || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)
|-
|-
| 10 || DSCoder-6.7B-Instruct || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek
| 10 || [https://huggingface.co/models?search=dscoder DSCoder-6.7B-Instruct] || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek
|}
|}


Line 147: Line 146:
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MMLU-PRO !! CO₂ Cost
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MMLU-PRO !! CO₂ Cost
|-
|-
| 1 || PJMixers-Dev/Qwen2.5-RomboTiesTest-7B || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg
| 1 || [https://huggingface.co/PJMixers-Dev/Qwen2.5-RomboTiesTest-7B PJMixers-Dev/Qwen2.5-RomboTiesTest-7B] || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg
|-
|-
| 2 || brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial || basemergesandmoerges || 31.48% || 56.77% || 37.25% || 34.97% || 8.17% || 38.95% || 2.01 kg
| 2 || [https://huggingface.co/brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial] || basemergesandmoerges || 31.48% || 56.77% || 37.25% || 34.97% || 8.17% || 38.95% || 2.01 kg
|-
|-
| 3 || DreadPoor/Here_We_Go_Again-8B-SLERP || basemergesandmoerges || 30.13% || 74.42% || 35.53% || 17.30% || 9.17% || 31.92% || 1.23 kg
| 3 || [https://huggingface.co/DreadPoor/Here_We_Go_Again-8B-SLERP DreadPoor/Here_We_Go_Again-8B-SLERP] || basemergesandmoerges || 30.13% || 74.42% || 35.53% || 17.30% || 9.17% || 31.92% || 1.23 kg
|-
|-
| 4 || microsoft/Phi-4-mini-instruct || chat || 29.41% || 73.78% || 38.74% || 16.99% || 7.94% || 32.58% || 0.83 kg
| 4 || [https://huggingface.co/microsoft/Phi-4-mini-instruct microsoft/Phi-4-mini-instruct] || chat || 29.41% || 73.78% || 38.74% || 16.99% || 7.94% || 32.58% || 0.83 kg
|-
|-
| 5 || T145/ZEUS-8B-V15 || chat || 29.37% || 70.13% || 36.18% || 23.04% || 3.47% || 33.99% || 1.39 kg
| 5 || [https://huggingface.co/T145/ZEUS-8B-V15 T145/ZEUS-8B-V15] || chat || 29.37% || 70.13% || 36.18% || 23.04% || 3.47% || 33.99% || 1.39 kg
|-
|-
| 6 || DreadPoor/Asymmetric_Linearity-8B-Model_Stock || basemergesandmoerges || 29.35% || 71.74% || 35.44% || 16.47% || 8.61% || 31.60% || 1.28 kg
| 6 || [https://huggingface.co/DreadPoor/Asymmetric_Linearity-8B-Model_Stock DreadPoor/Asymmetric_Linearity-8B-Model_Stock] || basemergesandmoerges || 29.35% || 71.74% || 35.44% || 16.47% || 8.61% || 31.60% || 1.28 kg
|-
|-
| 7 || DreadPoor/VENN_1.2-8B-Model_Stock || basemergesandmoerges || 28.85% || 72.26% || 35.13% || 17.07% || 6.26% || 30.23% || 1.28 kg
| 7 || [https://huggingface.co/DreadPoor/VENN_1.2-8B-Model_Stock DreadPoor/VENN_1.2-8B-Model_Stock] || basemergesandmoerges || 28.85% || 72.26% || 35.13% || 17.07% || 6.26% || 30.23% || 1.28 kg
|-
|-
| 8 || PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B || basemergesandmoerges || 28.82% || 78.25% || 29.89% || 20.02% || 5.59% || 30.75% || 1.44 kg
| 8 || [https://huggingface.co/PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B] || basemergesandmoerges || 28.82% || 78.25% || 29.89% || 20.02% || 5.59% || 30.75% || 1.44 kg
|-
|-
| 9 || DreadPoor/Elusive_Dragon_Heart-8B-LINEAR || basemergesandmoerges || 28.66% || 71.31% || 35.31% || 14.80% || 7.49% || 31.27% || 1.27 kg
| 9 || [https://huggingface.co/DreadPoor/Elusive_Dragon_Heart-8B-LINEAR DreadPoor/Elusive_Dragon_Heart-8B-LINEAR] || basemergesandmoerges || 28.66% || 71.31% || 35.31% || 14.80% || 7.49% || 31.27% || 1.27 kg
|-
|-
| 10 || ehristoforu/coolqwen-3b-it || fine-tunedondomain-specificdatasets || 28.65% || 64.73% || 27.46% || 36.71% || 4.36% || 28.90% || 1.45 kg
| 10 || [https://huggingface.co/ehristoforu/coolqwen-3b-it ehristoforu/coolqwen-3b-it] || fine-tunedondomain-specificdatasets || 28.65% || 64.73% || 27.46% || 36.71% || 4.36% || 28.90% || 1.45 kg
|}
|}


Line 204: Line 203:
=== 벤치마크 지표별 강점 ===
=== 벤치마크 지표별 강점 ===


* '''IFEval (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
* '''[[IFEval|IFEval]] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
* '''MATH (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
* '''[[MATH (벤치마크)|MATH]] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
* '''GPQA (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
* '''[[GPQA|GPQA]] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
* '''MMLU-PRO (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위
* '''[[MMLU-PRO|MMLU-PRO]] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위





Revision as of 11:14, 31 July 2026

Top 10 오픈소스 AI 모델 동향

Template:Status

Template:TOC

Overview

HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.

Summary

  • 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
  • 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
  • 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시


조사 정보

Purpose

이 문서가 존재하는 이유

  • Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
  • Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
  • Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음


Key Concepts

개념 ! 설명 ! 관련 문서
파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함
Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정 | GitHub
BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가 | GitHub
MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정 | GitHub
GPQA (Graduate-Level Google-Proof Q&A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가 | GitHub
MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가 | GitHub
CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨
HuggingFace Open LLM Leaderboard | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 | HuggingFace

Top 10 Models

HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.

General (전체 능력)

HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)

이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.

Rank Model Type Average IFEval BBH MATH GPQA MUSR MMLU-PRO CO₂ Cost
1 MaziyarPanahi/calme-3.2-instruct-78b fine-tuned 52.08% 80.63% 62.61% 40.33% 20.36% 38.53% 70.03% 66.01 kg
2 MaziyarPanahi/calme-3.1-instruct-78b chat 51.29% 81.36% 62.41% 39.27% 19.46% 36.50% 68.72% 64.44 kg
3 dfurman/CalmeRys-78B-Orpo-v0.1 chat 51.23% 81.63% 61.92% 40.63% 20.02% 36.37% 66.80% 25.99 kg
4 MaziyarPanahi/calme-2.4-rys-78b chat 50.77% 80.11% 62.16% 40.71% 20.36% 34.57% 66.69% 25.95 kg
5 huihui-ai/Qwen2.5-72B-Instruct-abliterated fine-tuned 48.11% 85.93% 60.49% 60.12% 19.35% 12.34% 50.41% 76.77 kg
6 Qwen/Qwen2.5-72B-Instruct chat 47.98% 86.38% 61.87% 59.82% 16.67% 11.74% 51.40% 47.65 kg
7 MaziyarPanahi/calme-2.1-qwen2.5-72b chat 47.86% 86.62% 61.66% 59.14% 15.10% 13.30% 51.32% 29.50 kg
8 newsbang/Homer-v1.0-Qwen2.5-72B fine-tuned 47.46% 76.28% 62.27% 49.02% 22.15% 17.90% 57.17% 29.55 kg
9 ehristoforu/qwen2.5-test-32b-it chat 47.37% 78.89% 58.28% 59.74% 15.21% 19.13% 52.95% 29.54 kg
10 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B fine-tuned 47.34% 79.72% 57.63% 60.27% 14.99% 18.16% 53.25% 7.95 kg

General 카테고리 특징:

  • 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)
  • Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능
  • 32B 모델도 경쟁력 있음 (Rank 9, 10)
  • CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적

Coding (코딩 능력)

LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)

LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.

Rank Model Pass@1 Easy Medium Hard Source
1 Codestral-Latest 32.2% 69.0% 18.7% 0.9% Mistral AI
2 LLaMA-3-70B-Instruct 28.3% 60.7% 15.8% 1.4% Meta
3 Mixtral-8x22B-Instruct 26.4% 59.8% 12.7% 0.0% Mistral AI
4 DSCoder-33B-Instruct 23.6% 55.6% 9.0% 0.7% DeepSeek
5 OC-DS-33B 21.3% 53.9% 5.1% 0.0% OpenCoder
6 Phind-34B-V2 21.0% 53.4% 4.7% 0.1% Phind
7 MagiCoderS-DS-6.7B 20.5% 49.2% 7.5% 0.0% DeepSeek
8 LLaMA-3-70B-Base 20.1% 52.2% 3.2% 0.6% Meta
9 CodeQwen1.5-7B-Chat 19.3% 39.2% 13.1% 0.5% Alibaba (Qwen)
10 DSCoder-6.7B-Instruct 19.1% 46.4% 5.8% 0.7% DeepSeek

Coding 카테고리 특징:

  • Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능
  • LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수
  • CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화
  • Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)

Edge Devices (경량 모델)

HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리 기준 상위 10개 모델 (2026-07-31 기준)

Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.

Rank Model Type Average IFEval BBH MATH GPQA MMLU-PRO CO₂ Cost
1 PJMixers-Dev/Qwen2.5-RomboTiesTest-7B basemergesandmoerges 35.29% 75.58% 34.93% 49.62% 6.38% 36.50% 1.34 kg
2 brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial basemergesandmoerges 31.48% 56.77% 37.25% 34.97% 8.17% 38.95% 2.01 kg
3 DreadPoor/Here_We_Go_Again-8B-SLERP basemergesandmoerges 30.13% 74.42% 35.53% 17.30% 9.17% 31.92% 1.23 kg
4 microsoft/Phi-4-mini-instruct chat 29.41% 73.78% 38.74% 16.99% 7.94% 32.58% 0.83 kg
5 T145/ZEUS-8B-V15 chat 29.37% 70.13% 36.18% 23.04% 3.47% 33.99% 1.39 kg
6 DreadPoor/Asymmetric_Linearity-8B-Model_Stock basemergesandmoerges 29.35% 71.74% 35.44% 16.47% 8.61% 31.60% 1.28 kg
7 DreadPoor/VENN_1.2-8B-Model_Stock basemergesandmoerges 28.85% 72.26% 35.13% 17.07% 6.26% 30.23% 1.28 kg
8 PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B basemergesandmoerges 28.82% 78.25% 29.89% 20.02% 5.59% 30.75% 1.44 kg
9 DreadPoor/Elusive_Dragon_Heart-8B-LINEAR basemergesandmoerges 28.66% 71.31% 35.31% 14.80% 7.49% 31.27% 1.27 kg
10 ehristoforu/coolqwen-3b-it fine-tunedondomain-specificdatasets 28.65% 64.73% 27.46% 36.71% 4.36% 28.90% 1.45 kg

Edge Devices 카테고리 특징:

  • 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능
  • Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적
  • Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능
  • 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)


Performance Analysis

파라미터 규모별 성능 트렌드

78B 모델의 지배적 위치 상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).

Qwen2.5-72B: 공식 오픈소스 모델의 기준 Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.

32B 모델의 경쟁력 부상 Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.

CO₂ Cost 분석

파라미터 규모 평균 CO₂ Cost Rank 10 대비 배수
78B (Calme 시리즈) ~46.60 kg ~5.9배
72B (Qwen2.5 기반) ~50.93 kg ~6.4배
32B ~28.75 kg 기준

32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.

벤치마크 지표별 강점

  • IFEval (지시 따르기): Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
  • MATH (수학): huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
  • GPQA (전문 지식): newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
  • MMLU-PRO (종합 지식): MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위


Architecture

모델 아키텍처 비교

Top 10 모델의 아키텍처 및 베이스 정보
Rank Model 베이스 아키텍처 Type Notes
1-4 Calme 시리즈 Llama 기반 추정 fine-tuned / chat MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터
5 Qwen2.5-72B-Instruct-abliterated Qwen2.5-72B-Instruct fine-tuned Abliterated 버전 — 안전 필터 제거로 성능 향상
6 Qwen2.5-72B-Instruct Qwen2.5-72B-Instruct chat Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처
7 calme-2.1-qwen2.5-72b Qwen2.5-72B chat Qwen2.5 기반 Calme 모델
8 Homer-v1.0-Qwen2.5-72B Qwen2.5-72B fine-tuned newsbang 가 개발한 Homer 시리즈
9 qwen2.5-test-32b-it Qwen2.5-32B chat Qwen2.5-32B 기반 지시 따르기 최적화 모델
10 Linkbricks-Horizon-AI-Avengers-V1-32B 추정됨 fine-tuned Saxo 가 개발한 32B 모델

아키텍처 트렌드

  • Qwen2.5 기반 모델의 확산: Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능
  • Calme 시리즈의 독자적 진화: 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델
  • 32B 모델의 실용성: 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합


Best Practices

모델 선택 가이드라인

성능 최우선 시 (78B/72B 모델 권장)

  • 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
  • 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
  • IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)

환경 비용 고려 시 (32B 모델 권장)

  • CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
  • Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
  • 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위

균형 잡힌 선택 (Qwen2.5-72B 권장)

  • 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
  • Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)

모델 선택 의사결정 트리

  1. 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
  2. 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
  3. 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
  4. 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated


Limitations

  • Leaderboard Archived: HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.
  • 벤치마크 한계: Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.
  • CO₂ Cost 변동성: CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.
  • 모델 타입 구분: fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.
  • 데이터 시점: 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.


References

HuggingFace Open LLM Leaderboard

LiveCodeBench (코딩 평가)

Top 10 모델 상세 링크

General 카테고리 (전체 능력)

Rank 1: MaziyarPanahi/calme-3.2-instruct-78b
Rank 2: MaziyarPanahi/calme-3.1-instruct-78b
Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1
Rank 4: MaziyarPanahi/calme-2.4-rys-78b
Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated
Rank 6: Qwen/Qwen2.5-72B-Instruct
Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b
Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B
Rank 9: ehristoforu/qwen2.5-test-32b-it
Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B

Coding 카테고리 (코딩 능력)

Rank 1: Codestral-Latest
Rank 2: LLaMA-3-70B-Instruct
Rank 3: Mixtral-8x22B-Instruct
Rank 4: DSCoder-33B-Instruct
Rank 5: OC-DS-33B
Rank 6: Phind-34B-V2
Rank 7: MagiCoderS-DS-6.7B
Rank 8: LLaMA-3-70B-Base
Rank 9: CodeQwen1.5-7B-Chat
Rank 10: DSCoder-6.7B-Instruct

Edge Devices 카테고리 (경량 모델)

벤치마크 지표 설명

관련 문서