|
|
| Line 4: |
Line 4: |
| |status=Draft | | |status=Draft |
| |owner=Knowledge Agent | | |owner=Knowledge Agent |
| |last_update=2026-08-03 | | |last_update=2026-08-07 |
| |review=Pending | | |review=Pending |
| }} | | }} |
| Line 11: |
Line 11: |
|
| |
|
| == Overview == | | == Overview == |
| HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다. | | |
| | HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석. |
|
| |
|
| === Summary === | | === Summary === |
| * 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
| |
| * 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
| |
| * 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시
| |
|
| |
|
| | * 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록 |
| | * 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고 |
| | * 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고 |
|
| |
|
| === 조사 정보 === | | === 조사 정보 === |
|
| |
|
| * 조사 일자: 2026-08-03 09:24 KST | | * 조사 일자: 2026-08-07 10:00 KST |
| * 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | | * 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) |
| * 데이터 기준일: 2026-08-03 | | * 다음 업데이트 예정: 2026-08-14 |
| * 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)
| | |
| | --- |
|
| |
|
| == Purpose == | | == Purpose == |
| | |
| 이 문서가 존재하는 이유 | | 이 문서가 존재하는 이유 |
| * Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
| |
| * Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
| |
| * Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음
| |
|
| |
|
| | * Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리 |
| | * Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding) |
| | * Non-goals: 상용 모델 비교, 자체 벤치마크 수행 |
| | |
| | --- |
|
| |
|
| == Key Concepts == | | == Key Concepts == |
| {| class="wikitable" | | |
| ! 개념 ! 설명 ! 관련 문서 | | {{! class="wikitable" |
| | ! Concept ! Description ! Related |
| |- | | |- |
| || [https://huggingface.co/docs/transformers/model_sizes_parameters Parameters (파라미터 수)] | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함 | | | [[HuggingFace Open LLM Leaderboard]] | 오픈소스 LLM 종합 성능 벤치마크 | [[IFEval]], [[BBH]], [[MMLU-PRO]] |
| |- | | |- |
| || [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Overall Average] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄 | | | [[LiveCodeBench]] | 코딩 능력 평가 벤치마크 | [[Pass@1]] |
| |- | | |- |
| || [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정 | | | [[IFEval]] | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval) |
| |- | | |- |
| || [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가 | | | [[BBH]] | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard) |
| |- | | |- |
| || [https://github.com/hendrycks/math MATH] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정 | | | [[MMLU-PRO]] | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test) |
| |- | | |- |
| || [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&A)] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가 | | | [[MATH]] | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math) |
| |- | | |- |
| || [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard MUSR (Multi-Step Reasoning)] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정 | | | [[GPQA]] | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa) |
| |- | | |- |
| || [https://github.com/hendrycks/test MMLU-PRO] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
| | | [[Pass@1]] | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench) |
| |-
| | }} |
| || [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
| |
| |-
| |
| || [https://huggingface.co/docs/transformers/training fine-tuned] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
| |
| |-
| |
| || [https://huggingface.co/docs/transformers/model_sharing chat] | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨
| |
| |-
| |
| || [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard HuggingFace Open LLM Leaderboard] | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공
| |
| |}
| |
| == Top 10 Models ==
| |
| | |
| HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.
| |
|
| |
|
| === General (전체 능력) ===
| | --- |
|
| |
|
| HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-08-03 기준) | | == General 카테고리: HuggingFace Open LLM Leaderboard Overall Average == |
|
| |
|
| 이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.
| | HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델. |
|
| |
|
| {| class="wikitable" style="text-align:center; font-size:90%" | | {{! class="wikitable" |
| ! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | | ! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH ! MATH Lvl 5 ! GPQA ! MMLU-PRO |
| |- | | |- |
| | 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || 🔶 fine-tuned on domain-specific datasets || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg | | | 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0 |
| |-
| | | 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7 |
| | 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || 💬 chat models (RLHF, DPO, IFT, ...) || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg | | | 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8 |
| |-
| | | 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7 |
| | 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || 💬 chat models (RLHF, DPO, IFT, ...) || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg | | | 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4 |
| |-
| | | 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4 |
| | 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || 💬 chat models (RLHF, DPO, IFT, ...) || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg | | | 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3 |
| |-
| | | 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2 |
| | 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || 🔶 fine-tuned on domain-specific datasets || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg | | | 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9 |
| |-
| | | 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3 |
| | 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg | | }} |
| |-
| |
| | 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg | |
| |-
| |
| | 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || 🔶 fine-tuned on domain-specific datasets || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg | |
| |-
| |
| | 9 || [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg | |
| |-
| |
| | 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || 🔶 fine-tuned on domain-specific datasets || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg | |
| |}
| |
|
| |
|
| '''General 카테고리 특징''':
| | === General 카테고리 분석 === |
| * 78B 파라미터 모델이 상위권을 지배 (상위 4개 모두 78B)
| |
| * CO₂ Cost 효율: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg)가 가장 효율적
| |
| * huihui-ai/Qwen2.5-72B-Instruct-abliterated (76.77kg)가 가장 높은 환경 비용
| |
| * IFEval 최고: MaziyarPanahi/calme-2.1-qwen2.5-72b (86.62%)
| |
| * MATH 최고: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (60.27%)
| |
| * MMLU-PRO 최고: MaziyarPanahi/calme-3.2-instruct-78b (70.03%)
| |
|
| |
|
| === Coding (코딩 능력) ===
| | * **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모 |
| | * **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생) |
| | * **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함 |
| | * **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4 |
|
| |
|
| LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-08-03 기준)
| | --- |
|
| |
|
| LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.
| | == Coding 카테고리: LiveCodeBench Pass@1 == |
|
| |
|
| {| class="wikitable" style="text-align:center; font-size:90%"
| | LiveCodeBench Code Generation 카테고리 Pass@1 기준 Top 10 모델. |
| ! Rank !! Model !! [https://github.com/LiveCodeBench/LiveCodeBench Pass@1] !! Easy !! Medium !! Hard !! Source
| |
| |-
| |
| | 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI
| |
| |-
| |
| | 2 || [https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct LLaMA-3-70B-Instruct] || 28.3% || 60.7% || 15.8% || 1.4% || Meta
| |
| |-
| |
| | 3 || [https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1 Mixtral-8x22B-Instruct] || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI
| |
| |-
| |
| | 4 || [https://huggingface.co/models?search=dscoder DSCoder-33B-Instruct] || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek
| |
| |-
| |
| | 5 || [https://huggingface.co/models?search=opencoder OC-DS-33B] || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder
| |
| |-
| |
| | 6 || [https://huggingface.co/Phind/Phind-CodeLlama-34B-v2 Phind-34B-V2] || 21.0% || 53.4% || 4.7% || 0.1% || Phind
| |
| |-
| |
| | 7 || [https://huggingface.co/models?search=magicoders MagiCoderS-DS-6.7B] || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek
| |
| |-
| |
| | 8 || [https://huggingface.co/meta-llama/Llama-3.1-70B LLaMA-3-70B-Base] || 20.1% || 52.2% || 3.2% || 0.6% || Meta
| |
| |-
| |
| | 9 || [https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat CodeQwen1.5-7B-Chat] || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)
| |
| |-
| |
| | 10 || [https://huggingface.co/models?search=dscoder DSCoder-6.7B-Instruct] || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek
| |
| |}
| |
|
| |
|
| '''Coding 카테고리 특징''':
| | {{! class="wikitable" |
| * Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능
| | ! Rank ! Model ! Pass@1 ! Easy-Pass@1 ! Medium-Pass@1 ! Hard-Pass@1 |
| * LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수
| |
| * CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화
| |
| * Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)
| |
| | |
| === Edge Devices (경량 모델) ===
| |
| | |
| HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리 기준 상위 10개 모델 (2026-08-03 기준)
| |
| | |
| Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.
| |
| | |
| {| class="wikitable" style="text-align:center; font-size:90%" | |
| ! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | |
| |- | | |- |
| | 1 || [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] || 🤝 base merges and moerges || 37.30% || 76.40% || 36.62% || 48.79% || 8.95% || 37.51% || 0.62 kg | | | 1 | GPT-4O-2024-05-13 | 45.6 | 88.3 | 33.2 | 4.2 |
| |- | | |- |
| | 2 || [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] || 🤝 base merges and moerges || 36.94% || 75.70% || 35.96% || 49.32% || 7.61% || 37.80% || 0.63 kg | | | 2 | GPT-4-Turbo-2024-04-09 | 44.7 | 85.3 | 33.0 | 5.1 |
| |- | | |- |
| | 3 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] || 🤝 base merges and moerges || 36.89% || 75.49% || 36.12% || 50.68% || 8.39% || 37.80% || 0.69 kg | | | 3 | GPT-4-Turbo-1106 | 39.7 | 84.4 | 24.0 | 0.5 |
| |- | | |- |
| | 4 || [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] || 🤝 base merges and moerges || 36.88% || 75.83% || 36.36% || 48.49% || 7.72% || 37.73% || 0.63 kg | | | 4 | GPT-4-0613 | 36.9 | 78.4 | 21.2 | 2.3 |
| |- | | |- |
| | 5 || [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] || 🤝 base merges and moerges || 36.86% || 76.79% || 36.02% || 48.56% || 6.94% || 37.78% || 0.67 kg | | | 5 | Gemini-Pro-1.5-May | 35.7 | 76.0 | 19.4 | 3.5 |
| |- | | |- |
| | 6 || [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] || 🤝 base merges and moerges || 36.80% || 76.16% || 36.13% || 49.92% || 7.61% || 38.17% || 0.68 kg | | | 6 | Claude-3-Opus | 35.4 | 78.8 | 16.3 | 3.2 |
| |- | | |- |
| | 7 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] || 🤝 base merges and moerges || 36.80% || 75.28% || 35.92% || 50.00% || 9.40% || 37.92% || 0.67 kg | | | 7 | Codestral-Latest | 32.2 | 69.0 | 18.7 | 0.9 |
| |- | | |- |
| | 8 || [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] || 🤝 base merges and moerges || 36.78% || 75.09% || 36.46% || 48.79% || 8.28% || 37.61% || 0.64 kg | | | 8 | Gemini-Flash-1.5-May | 30.0 | 68.1 | 12.6 | 2.7 |
| |- | | |- |
| | 9 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] || 🤝 base merges and moerges || 36.71% || 75.07% || 35.47% || 50.76% || 8.39% || 38.00% || 0.68 kg | | | 9 | LLama3-70b-Ins | 28.3 | 60.7 | 15.8 | 1.4 |
| |- | | |- |
| | 10 || [https://huggingface.co/marcuscedricridia/cursa-o1-7b marcuscedricridia/cursa-o1-7b] || 🤝 base merges and moerges || 36.71% || 76.28% || 35.70% || 49.55% || 7.61% || 37.69% || 0.68 kg | | | 10 | Claude-3-Sonnet | 26.9 | 67.6 | 6.3 | 1.1 |
| |}
| | }} |
| | |
| '''Edge Devices 카테고리 특징''':
| |
| * Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview이(가) 평균 점수 37.30%로 가장 우수
| |
| * Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview이(가) CO₂ Cost 0.62kg으로 가장 효율적
| |
| * Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능
| |
| * 7B 모델들이 엣지 디바이스 배포에 적합
| |
| | |
| | |
| === 파라미터 규모별 성능 트렌드 ===
| |
|
| |
|
| '''78B 모델의 지배적 위치'''
| | === Coding 카테고리 분석 === |
| 상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).
| |
|
| |
|
| '''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''
| | * **상용 모델 독점**: Top 10 모두 상용 모델 (GPT, Gemini, Claude) |
| Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.
| | * **GPT-4 계열 강세**: Top 4 중 3개 차지 |
| | * **오픈소스 모델 부재**: Top 10에 오픈소스 모델 없음 |
| | * **LLama3-70b**: 70b 파라미터로 9위 기록 (28.3 Pass@1) |
|
| |
|
| '''32B 모델의 경쟁력 부상'''
| | --- |
| Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.
| |
|
| |
|
| '''Edge Devices (7B 이하 경량 모델)'''
| | == Edge Devices 카테고리: HuggingFace Edge Devices == |
| 7B 이하 경량 모델 중 Qwen2.5 기반 모델이 우수 성능을 보이고 있습니다. Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview가 37.30%로 가장 높은 평균 점수를 기록했으며, CO₂ Cost는 0.62kg으로 매우 효율적입니다.
| |
|
| |
|
| === CO₂ Cost 분석 ===
| | 7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10. |
|
| |
|
| {| class="wikitable" style="text-align:center; font-size:90%" | | {{! class="wikitable" |
| ! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수 | | ! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH |
| |- | | |- |
| | 78B (Calme 시리즈) || ~46.60 kg || ~5.9배 | | | 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5 |
| | 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배 | | | 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6 |
| | 32B || ~28.75 kg || 기준 | | | 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0 |
| | 7B (Edge) || ~0.65 kg || 기준 | | | 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1 |
| |} | | | 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4 |
| | | 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0 |
| | | 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1 |
| | | 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9 |
| | | 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5 |
| | | 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5 |
| | }} |
|
| |
|
| 32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다. Edge Devices 카테고리에서는 7B 모델이 0.62kg으로 가장 효율적입니다.
| | === Edge Devices 카테고리 분석 === |
|
| |
|
| === 벤치마크 지표별 강점 ===
| | * **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델 |
| | * **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터 |
| | * **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지 |
| | * **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성) |
|
| |
|
| * '''[https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
| | --- |
| * '''[https://github.com/hendrycks/math MATH] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
| |
| * '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
| |
| * '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위
| |
|
| |
|
| === 모델 아키텍처 비교 === | | == Performance Analysis == |
|
| |
|
| {| class="wikitable" style="font-size:90%" | | {{! class="wikitable" |
| |+ Top 10 모델의 아키텍처 및 베이스 정보
| | ! Category ! Top Model ! Score ! Key Insight |
| |- | | |- |
| ! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes
| | | General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능 |
| |- | | |- |
| | 1 || [MaziyarPanahi/calme-3.2-instruct-78b](MaziyarPanahi/calme-3.2-instruct-78b) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터 | | | Coding | GPT-4O-2024-05-13 | 45.6 Pass@1 | 상용 모델 독점 |
| | 2 || [MaziyarPanahi/calme-3.1-instruct-78b](MaziyarPanahi/calme-3.1-instruct-78b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터
| | |- |
| | 3 || [dfurman/CalmeRys-78B-Orpo-v0.1](dfurman/CalmeRys-78B-Orpo-v0.1) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || dfurman 이 개발한 Calme 계열 모델. ORPO 최적화 | | | Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성) |
| | 4 || [MaziyarPanahi/calme-2.4-rys-78b](MaziyarPanahi/calme-2.4-rys-78b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터 | | }} |
| | 5 || [huihui-ai/Qwen2.5-72B-Instruct-abliterated](huihui-ai/Qwen2.5-72B-Instruct-abliterated) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || Abliterated 버전 — 안전 필터 제거로 성능 향상
| |
| | 6 || [Qwen/Qwen2.5-72B-Instruct](Qwen/Qwen2.5-72B-Instruct) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처
| |
| | 7 || [MaziyarPanahi/calme-2.1-qwen2.5-72b](MaziyarPanahi/calme-2.1-qwen2.5-72b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Qwen2.5 기반 Calme 모델
| |
| | 8 || [newsbang/Homer-v1.0-Qwen2.5-72B](newsbang/Homer-v1.0-Qwen2.5-72B) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || newsbang 가 개발한 Homer 시리즈
| |
| | 9 || [ehristoforu/qwen2.5-test-32b-it](ehristoforu/qwen2.5-test-32b-it) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Qwen2.5-32B 기반 지시 따르기 최적화 모델
| |
| | 10 || [Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B](Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || Saxo 가 개발한 32B 모델
| |
| |}
| |
| | |
| == Best Practices ==
| |
| | |
| === 모델 선택 가이드라인 ===
| |
| | |
| '''성능 최우선 시 (78B/72B 모델 권장)'''
| |
| * 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
| |
| * 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
| |
| * IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)
| |
| | |
| '''환경 비용 고려 시 (32B 모델 권장)'''
| |
| * CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
| |
| * Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
| |
| * 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위
| |
| | |
| '''균형 잡힌 선택 (Qwen2.5-72B 권장)'''
| |
| * 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
| |
| * Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)
| |
| | |
| === 모델 선택 의사결정 트리 ===
| |
| # 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
| |
| # 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
| |
| # 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
| |
| # 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated
| |
|
| |
|
| | --- |
|
| |
|
| == Limitations == | | == Limitations == |
|
| |
|
| * '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다. | | * **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨 |
| * '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요. | | * **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재 |
| * '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다. | | * **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B) |
| * '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다. | | * **데이터 신선도**: 2026-08-07 기준, 주기적 업데이트 필요 |
| * '''데이터 시점''': 본 데이터는 2026-08-03 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다. | |
|
| |
|
| | --- |
|
| |
|
| == References == | | == References == |
|
| |
|
| === HuggingFace Open LLM Leaderboard ===
| | * [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) |
| | | * [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard) |
| * [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Open LLM Leaderboard] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함. | | * [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval) |
| * URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
| | * [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard) |
| * 접근일: 2026-08-03 | | * [MMLU-PRO GitHub](https://github.com/hendrycks/test) |
| * 상태: Archived (2026년 5월 기준)
| | * [MATH GitHub](https://github.com/hendrycks/math) |
| | | * [GPQA GitHub](https://github.com/idavidrein/gpqa) |
| === LiveCodeBench (코딩 평가) ===
| | * [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench) |
| | | * [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b) |
| * LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.
| | * [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct) |
| * URL: https://huggingface.co/spaces/livecodebench/leaderboard
| | * [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3) |
| * Paper: https://arxiv.org/abs/2406.15877 | |
| * GitHub: https://github.com/LiveCodeBench/LiveCodeBench
| |
| * 접근일: 2026-08-03
| |
| | |
| === Top 10 모델 상세 링크 ===
| |
| | |
| ==== General 카테고리 (전체 능력) 상세 링크 ====
| |
| ===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b =====
| |
| * HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b
| |
| * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&model=MaziyarPanahi/calme-3.2-instruct-78b | |
| * 파라미터: 78B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 52.08% | |
| * CO₂ Cost: 66.01 kg
| |
| | |
| ===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b =====
| |
| * HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b
| |
| * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&model=MaziyarPanahi/calme-3.1-instruct-78b | |
| * 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 51.29% | |
| * CO₂ Cost: 64.44 kg
| |
| | |
| ===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 =====
| |
| * HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1
| |
| * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&model=dfurman/CalmeRys-78B-Orpo-v0.1 | |
| * 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 51.23%
| |
| * CO₂ Cost: 25.99 kg | |
| | |
| ===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b =====
| |
| * HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b
| |
| * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&model=MaziyarPanahi/calme-2.4-rys-78b
| |
| * 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 50.77%
| |
| * CO₂ Cost: 25.95 kg | |
| | |
| ===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated =====
| |
| * HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated
| |
| * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&model=huihui-ai/Qwen2.5-72B-Instruct-abliterated
| |
| * 파라미터: 73B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 48.11%
| |
| * CO₂ Cost: 76.77 kg
| |
| | |
| ===== Rank 6: Qwen/Qwen2.5-72B-Instruct =====
| |
| * HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct
| |
| * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&model=Qwen/Qwen2.5-72B-Instruct | |
| * 파라미터: 73B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.98%
| |
| * CO₂ Cost: 47.65 kg
| |
| | |
| ===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b =====
| |
| * HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b
| |
| * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&model=MaziyarPanahi/calme-2.1-qwen2.5-72b
| |
| * 파라미터: 73B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.86%
| |
| * CO₂ Cost: 29.50 kg
| |
| | |
| ===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B =====
| |
| * HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B
| |
| * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&model=newsbang/Homer-v1.0-Qwen2.5-72B
| |
| * 파라미터: 73B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 47.46%
| |
| * CO₂ Cost: 29.55 kg
| |
| | |
| ===== Rank 9: ehristoforu/qwen2.5-test-32b-it =====
| |
| * HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it
| |
| * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&model=ehristoforu/qwen2.5-test-32b-it
| |
| * 파라미터: 33B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.37%
| |
| * CO₂ Cost: 29.54 kg
| |
| | |
| ===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B =====
| |
| * HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
| |
| * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&model=Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
| |
| * 파라미터: 33B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 47.34%
| |
| * CO₂ Cost: 7.95 kg
| |
| | |
| | |
| ==== Coding 카테고리 (코딩 능력) ====
| |
| | |
| ===== Rank 1: Codestral-Latest =====
| |
| | |
| * HuggingFace Hub: https://huggingface.co/models?search=codestral
| |
| * LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
| |
| * Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%
| |
| * 개발사: Mistral AI
| |
| | |
| ===== Rank 2: LLaMA-3-70B-Instruct =====
| |
| | |
| * HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct
| |
| * LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
| |
| * Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%
| |
| * 개발사: Meta
| |
| | |
| ===== Rank 3: Mixtral-8x22B-Instruct =====
| |
| | |
| * HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1
| |
| * LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
| |
| * Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%
| |
| * 개발사: Mistral AI
| |
| | |
| ===== Rank 4: DSCoder-33B-Instruct =====
| |
| | |
| * HuggingFace Hub: https://huggingface.co/models?search=dscoder
| |
| * LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
| |
| * Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%
| |
| * 개발사: DeepSeek
| |
| | |
| ===== Rank 5: OC-DS-33B =====
| |
| | |
| * HuggingFace Hub: https://huggingface.co/models?search=opencoder
| |
| * LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
| |
| * Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%
| |
| * 개발사: OpenCoder
| |
| | |
| ===== Rank 6: Phind-34B-V2 =====
| |
| | |
| * HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2
| |
| * LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
| |
| * Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%
| |
| * 개발사: Phind
| |
| | |
| ===== Rank 7: MagiCoderS-DS-6.7B =====
| |
| | |
| * HuggingFace Hub: https://huggingface.co/models?search=magicoders
| |
| * LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
| |
| * Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%
| |
| * 개발사: DeepSeek
| |
| | |
| ===== Rank 8: LLaMA-3-70B-Base =====
| |
| | |
| * HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B
| |
| * LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
| |
| * Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%
| |
| * 개발사: Meta (Instruct 버전 아님)
| |
| | |
| ===== Rank 9: CodeQwen1.5-7B-Chat =====
| |
| | |
| * HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat
| |
| * Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/
| |
| * LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
| |
| * Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%
| |
| * 개발사: Alibaba (Qwen)
| |
| | |
| ===== Rank 10: DSCoder-6.7B-Instruct =====
| |
| | |
| * HuggingFace Hub: https://huggingface.co/models?search=dscoder
| |
| * LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
| |
| * Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%
| |
| * 개발사: DeepSeek
| |
| | |
| ==== Edge Devices 카테고리 (경량 모델) ====
| |
| | |
| * HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
| |
| * 7B 이하 경량 모델 평가 기준
| |
|
| |
|
| === 벤치마크 지표 설명 ===
| | --- |
|
| |
|
| * [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가
| | == Related Pages == |
| * [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
| |
| * [https://github.com/hendrycks/math MATH] — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
| |
| * [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&A)] — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도
| |
| * [https://github.com/hendrycks/test MMLU-PRO] — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
| |
| * [https://github.com/LiveCodeBench/LiveCodeBench Pass@1 (LiveCodeBench)] — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율
| |
|
| |
|
| === 관련 문서 ===
| | * [[HuggingFace Open LLM Leaderboard]] |
| | * [[LiveCodeBench]] |
| | * [[LLM Benchmark]] |
| | * [[Open Source Models]] |
|
| |
|
| * [https://qwenlm.github.io/ Qwen2.5] — 알리바바 그룹에서 개발한 오픈소스 LLM
| | [[Category:AI]] |
| * [https://ai.meta.com/llama/ Llama] — Meta에서 개발한 오픈소스 LLM
| | [[Category:Reference]] |
| * [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard LLM Benchmark] — 대규모 언어 모델 벤치마킹 방법론
| |
| * [https://huggingface.co/docs/transformers/training Fine-tuning] — 사전 학습 모델의 추가 학습 기법
| |
| * [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Emissions in AI] — AI 모델의 환경 영향
| |
| * [https://huggingface.co/models?search=codestral Codestral] — Mistral AI의 코딩 특화 LLM
| |
| * [https://github.com/LiveCodeBench/LiveCodeBench LiveCodeBench] — 코딩 능력 평가 벤치마크
| |