Top 10 오픈소스 AI 모델 동향
Top 10 오픈소스 AI 모델 동향
Overview
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.
Summary
- 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
- 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
- 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시
조사 정보
- 조사 일자: 2026-07-31 10:00 KST (한국 표준시)
- 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
- 데이터 기준일: 2026-07-31
- 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)
Purpose
이 문서가 존재하는 이유
- Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
- Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
- Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음
Key Concepts
| 개념 ! 설명 ! 관련 문서 |
|---|
| 파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함 |
| Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄 |
| IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정 |
| BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가 |
| MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정 |
| GPQA (Graduate-Level Google-Proof Q&A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가 |
| MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정 |
| MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가 |
| CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨 |
| fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델 |
| chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨 |
| HuggingFace Open LLM Leaderboard | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 | HuggingFace |
Top 10 Models
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.
General (전체 능력)
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)
이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.
| Rank | Model | Type | Average | IFEval | BBH | MATH | GPQA | MUSR | MMLU-PRO | CO₂ Cost |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | MaziyarPanahi/calme-3.2-instruct-78b | fine-tuned | 52.08% | 80.63% | 62.61% | 40.33% | 20.36% | 38.53% | 70.03% | 66.01 kg |
| 2 | MaziyarPanahi/calme-3.1-instruct-78b | chat | 51.29% | 81.36% | 62.41% | 39.27% | 19.46% | 36.50% | 68.72% | 64.44 kg |
| 3 | dfurman/CalmeRys-78B-Orpo-v0.1 | chat | 51.23% | 81.63% | 61.92% | 40.63% | 20.02% | 36.37% | 66.80% | 25.99 kg |
| 4 | MaziyarPanahi/calme-2.4-rys-78b | chat | 50.77% | 80.11% | 62.16% | 40.71% | 20.36% | 34.57% | 66.69% | 25.95 kg |
| 5 | huihui-ai/Qwen2.5-72B-Instruct-abliterated | fine-tuned | 48.11% | 85.93% | 60.49% | 60.12% | 19.35% | 12.34% | 50.41% | 76.77 kg |
| 6 | Qwen/Qwen2.5-72B-Instruct | chat | 47.98% | 86.38% | 61.87% | 59.82% | 16.67% | 11.74% | 51.40% | 47.65 kg |
| 7 | MaziyarPanahi/calme-2.1-qwen2.5-72b | chat | 47.86% | 86.62% | 61.66% | 59.14% | 15.10% | 13.30% | 51.32% | 29.50 kg |
| 8 | newsbang/Homer-v1.0-Qwen2.5-72B | fine-tuned | 47.46% | 76.28% | 62.27% | 49.02% | 22.15% | 17.90% | 57.17% | 29.55 kg |
| 9 | ehristoforu/qwen2.5-test-32b-it | chat | 47.37% | 78.89% | 58.28% | 59.74% | 15.21% | 19.13% | 52.95% | 29.54 kg |
| 10 | Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B | fine-tuned | 47.34% | 79.72% | 57.63% | 60.27% | 14.99% | 18.16% | 53.25% | 7.95 kg |
General 카테고리 특징:
- 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)
- Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능
- 32B 모델도 경쟁력 있음 (Rank 9, 10)
- CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적
Coding (코딩 능력)
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.
| Rank | Model | Pass@1 | Easy | Medium | Hard | Source |
|---|---|---|---|---|---|---|
| 1 | Codestral-Latest | 32.2% | 69.0% | 18.7% | 0.9% | Mistral AI |
| 2 | LLaMA-3-70B-Instruct | 28.3% | 60.7% | 15.8% | 1.4% | Meta |
| 3 | Mixtral-8x22B-Instruct | 26.4% | 59.8% | 12.7% | 0.0% | Mistral AI |
| 4 | DSCoder-33B-Instruct | 23.6% | 55.6% | 9.0% | 0.7% | DeepSeek |
| 5 | OC-DS-33B | 21.3% | 53.9% | 5.1% | 0.0% | OpenCoder |
| 6 | Phind-34B-V2 | 21.0% | 53.4% | 4.7% | 0.1% | Phind |
| 7 | MagiCoderS-DS-6.7B | 20.5% | 49.2% | 7.5% | 0.0% | DeepSeek |
| 8 | LLaMA-3-70B-Base | 20.1% | 52.2% | 3.2% | 0.6% | Meta |
| 9 | CodeQwen1.5-7B-Chat | 19.3% | 39.2% | 13.1% | 0.5% | Alibaba (Qwen) |
| 10 | DSCoder-6.7B-Instruct | 19.1% | 46.4% | 5.8% | 0.7% | DeepSeek |
Coding 카테고리 특징:
- Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능
- LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수
- CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화
- Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)
Edge Devices (경량 모델)
HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리 기준 상위 10개 모델 (2026-07-31 기준)
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.
| Rank | Model | Type | Average | IFEval | BBH | MATH | GPQA | MMLU-PRO | CO₂ Cost |
|---|---|---|---|---|---|---|---|---|---|
| 1 | PJMixers-Dev/Qwen2.5-RomboTiesTest-7B | basemergesandmoerges | 35.29% | 75.58% | 34.93% | 49.62% | 6.38% | 36.50% | 1.34 kg |
| 2 | brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial | basemergesandmoerges | 31.48% | 56.77% | 37.25% | 34.97% | 8.17% | 38.95% | 2.01 kg |
| 3 | DreadPoor/Here_We_Go_Again-8B-SLERP | basemergesandmoerges | 30.13% | 74.42% | 35.53% | 17.30% | 9.17% | 31.92% | 1.23 kg |
| 4 | microsoft/Phi-4-mini-instruct | chat | 29.41% | 73.78% | 38.74% | 16.99% | 7.94% | 32.58% | 0.83 kg |
| 5 | T145/ZEUS-8B-V15 | chat | 29.37% | 70.13% | 36.18% | 23.04% | 3.47% | 33.99% | 1.39 kg |
| 6 | DreadPoor/Asymmetric_Linearity-8B-Model_Stock | basemergesandmoerges | 29.35% | 71.74% | 35.44% | 16.47% | 8.61% | 31.60% | 1.28 kg |
| 7 | DreadPoor/VENN_1.2-8B-Model_Stock | basemergesandmoerges | 28.85% | 72.26% | 35.13% | 17.07% | 6.26% | 30.23% | 1.28 kg |
| 8 | PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B | basemergesandmoerges | 28.82% | 78.25% | 29.89% | 20.02% | 5.59% | 30.75% | 1.44 kg |
| 9 | DreadPoor/Elusive_Dragon_Heart-8B-LINEAR | basemergesandmoerges | 28.66% | 71.31% | 35.31% | 14.80% | 7.49% | 31.27% | 1.27 kg |
| 10 | ehristoforu/coolqwen-3b-it | fine-tunedondomain-specificdatasets | 28.65% | 64.73% | 27.46% | 36.71% | 4.36% | 28.90% | 1.45 kg |
Edge Devices 카테고리 특징:
- 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능
- Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적
- Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능
- 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)
Performance Analysis
파라미터 규모별 성능 트렌드
78B 모델의 지배적 위치 상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).
Qwen2.5-72B: 공식 오픈소스 모델의 기준 Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.
32B 모델의 경쟁력 부상 Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.
CO₂ Cost 분석
| 파라미터 규모 | 평균 CO₂ Cost | Rank 10 대비 배수 |
|---|---|---|
| 78B (Calme 시리즈) | ~46.60 kg | ~5.9배 |
| 72B (Qwen2.5 기반) | ~50.93 kg | ~6.4배 |
| 32B | ~28.75 kg | 기준 |
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.
벤치마크 지표별 강점
- IFEval (지시 따르기): Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
- MATH (수학): huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
- GPQA (전문 지식): newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
- MMLU-PRO (종합 지식): MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위
Architecture
모델 아키텍처 비교
| Rank | Model | 베이스 아키텍처 | Type | Notes |
|---|---|---|---|---|
| 1-4 | Calme 시리즈 | Llama 기반 추정 | fine-tuned / chat | MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터 |
| 5 | Qwen2.5-72B-Instruct-abliterated | Qwen2.5-72B-Instruct | fine-tuned | Abliterated 버전 — 안전 필터 제거로 성능 향상 |
| 6 | Qwen2.5-72B-Instruct | Qwen2.5-72B-Instruct | chat | Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처 |
| 7 | calme-2.1-qwen2.5-72b | Qwen2.5-72B | chat | Qwen2.5 기반 Calme 모델 |
| 8 | Homer-v1.0-Qwen2.5-72B | Qwen2.5-72B | fine-tuned | newsbang 가 개발한 Homer 시리즈 |
| 9 | qwen2.5-test-32b-it | Qwen2.5-32B | chat | Qwen2.5-32B 기반 지시 따르기 최적화 모델 |
| 10 | Linkbricks-Horizon-AI-Avengers-V1-32B | 추정됨 | fine-tuned | Saxo 가 개발한 32B 모델 |
아키텍처 트렌드
- Qwen2.5 기반 모델의 확산: Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능
- Calme 시리즈의 독자적 진화: 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델
- 32B 모델의 실용성: 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합
Best Practices
모델 선택 가이드라인
성능 최우선 시 (78B/72B 모델 권장)
- 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
- 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
- IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)
환경 비용 고려 시 (32B 모델 권장)
- CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
- Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
- 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위
균형 잡힌 선택 (Qwen2.5-72B 권장)
- 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
- Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)
모델 선택 의사결정 트리
- 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
- 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
- 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
- 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated
Limitations
- Leaderboard Archived: HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.
- 벤치마크 한계: Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.
- CO₂ Cost 변동성: CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.
- 모델 타입 구분: fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.
- 데이터 시점: 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.
References
HuggingFace Open LLM Leaderboard
- Open LLM Leaderboard — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.
- URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
- 접근일: 2026-07-31
- 상태: Archived (2026년 5월 기준)
LiveCodeBench (코딩 평가)
- LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.
- URL: https://huggingface.co/spaces/livecodebench/leaderboard
- Paper: https://arxiv.org/abs/2406.15877
- GitHub: https://github.com/LiveCodeBench/LiveCodeBench
- 접근일: 2026-07-31
Top 10 모델 상세 링크
General 카테고리 (전체 능력)
Rank 1: MaziyarPanahi/calme-3.2-instruct-78b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&model=MaziyarPanahi%2Fcalme-3.2-instruct-78b
- 파라미터: 78B | Type: fine-tuned | Average: 52.08%
- CO₂ Cost: 66.01 kg
Rank 2: MaziyarPanahi/calme-3.1-instruct-78b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&model=MaziyarPanahi%2Fcalme-3.1-instruct-78b
- 파라미터: 78B | Type: chat | Average: 51.29%
- CO₂ Cost: 64.44 kg
Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1
- HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&model=dfurman%2FCalmeRys-78B-Orpo-v0.1
- 파라미터: 78B | Type: chat | Average: 51.23%
- CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)
Rank 4: MaziyarPanahi/calme-2.4-rys-78b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&model=MaziyarPanahi%2Fcalme-2.4-rys-78b
- 파라미터: 78B | Type: chat | Average: 50.77%
- CO₂ Cost: 25.95 kg
Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated
- HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated
- 파라미터: 72B | Type: fine-tuned | Average: 48.11%
- CO₂ Cost: 76.77 kg (가장 높음)
Rank 6: Qwen/Qwen2.5-72B-Instruct
- HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct
- Qwen 공식 문서: https://qwenlm.github.io/
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&model=Qwen%2FQwen2.5-72B-Instruct
- 파라미터: 72B | Type: chat | Average: 47.98%
- CO₂ Cost: 47.65 kg
Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b
- 파라미터: 72B | Type: chat | Average: 47.86%
- CO₂ Cost: 29.50 kg
Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B
- HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&model=newsbang%2FHomer-v1.0-Qwen2.5-72B
- 파라미터: 72B | Type: fine-tuned | Average: 47.46%
- CO₂ Cost: 29.55 kg
Rank 9: ehristoforu/qwen2.5-test-32b-it
- HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&model=ehristoforu%2Fqwen2.5-test-32b-it
- 파라미터: 32B | Type: chat | Average: 47.37%
- CO₂ Cost: 29.54 kg
Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
- HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B
- 파라미터: 32B | Type: fine-tuned | Average: 47.34%
- CO₂ Cost: 7.95 kg (전체 중 가장 효율적)
Coding 카테고리 (코딩 능력)
Rank 1: Codestral-Latest
- HuggingFace Hub: https://huggingface.co/models?search=codestral
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%
- 개발사: Mistral AI
Rank 2: LLaMA-3-70B-Instruct
- HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%
- 개발사: Meta
Rank 3: Mixtral-8x22B-Instruct
- HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%
- 개발사: Mistral AI
Rank 4: DSCoder-33B-Instruct
- HuggingFace Hub: https://huggingface.co/models?search=dscoder
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%
- 개발사: DeepSeek
Rank 5: OC-DS-33B
- HuggingFace Hub: https://huggingface.co/models?search=opencoder
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%
- 개발사: OpenCoder
Rank 6: Phind-34B-V2
- HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%
- 개발사: Phind
Rank 7: MagiCoderS-DS-6.7B
- HuggingFace Hub: https://huggingface.co/models?search=magicoders
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%
- 개발사: DeepSeek
Rank 8: LLaMA-3-70B-Base
- HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%
- 개발사: Meta (Instruct 버전 아님)
Rank 9: CodeQwen1.5-7B-Chat
- HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat
- Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%
- 개발사: Alibaba (Qwen)
Rank 10: DSCoder-6.7B-Instruct
- HuggingFace Hub: https://huggingface.co/models?search=dscoder
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%
- 개발사: DeepSeek
Edge Devices 카테고리 (경량 모델)
- HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
- 7B 이하 경량 모델 평가 기준
벤치마크 지표 설명
- IFEval (Instruction Following Evaluation) — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가
- BBH (Big Bench Hard) — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
- MATH — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
- GPQA (Graduate-Level Google-Proof Q&A) — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도
- MMLU-PRO — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
- Pass@1 (LiveCodeBench) — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율
관련 문서
- Qwen2.5 — 알리바바 그룹에서 개발한 오픈소스 LLM
- Llama — Meta에서 개발한 오픈소스 LLM
- LLM Benchmark — 대규모 언어 모델 벤치마킹 방법론
- Fine-tuning — 사전 학습 모델의 추가 학습 기법
- CO₂ Emissions in AI — AI 모델의 환경 영향
- Codestral — Mistral AI의 코딩 특화 LLM
- LiveCodeBench — 코딩 능력 평가 벤치마크