Top 10 오픈소스 AI 모델 동향: Difference between revisions
(Fix remaining 2 wiki internal links: ehristoforu model and Wikipedia reference) |
m (Top 10 모델 데이터 업데이트 (2026-08-03) - HuggingFace Open LLM Leaderboard 최신 데이터 반영) |
||
| Line 4: | Line 4: | ||
|status=Draft | |status=Draft | ||
|owner=Knowledge Agent | |owner=Knowledge Agent | ||
|last_update=2026- | |last_update=2026-08-03 | ||
|review=Pending | |review=Pending | ||
}} | }} | ||
| Line 21: | Line 21: | ||
=== 조사 정보 === | === 조사 정보 === | ||
* 조사 일자: 2026- | * 조사 일자: 2026-08-03 09:24 KST | ||
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | * 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | ||
* 데이터 기준일: 2026- | * 데이터 기준일: 2026-08-03 | ||
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동) | * 다음 업데이트 예정: 매주 월요일 09:00 KST (자동) | ||
| Line 67: | Line 67: | ||
=== General (전체 능력) === | === General (전체 능력) === | ||
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026- | HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-08-03 기준) | ||
이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다. | 이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다. | ||
| Line 74: | Line 74: | ||
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | ! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | ||
|- | |- | ||
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg | | 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || 🔶 fine-tuned on domain-specific datasets || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg | ||
|- | |- | ||
| 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg | | 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || 💬 chat models (RLHF, DPO, IFT, ...) || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg | ||
|- | |- | ||
| 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg | | 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || 💬 chat models (RLHF, DPO, IFT, ...) || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg | ||
|- | |- | ||
| 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg | | 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || 💬 chat models (RLHF, DPO, IFT, ...) || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg | ||
|- | |- | ||
| 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg | | 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || 🔶 fine-tuned on domain-specific datasets || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg | ||
|- | |- | ||
| 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg | | 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg | ||
|- | |- | ||
| 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg | | 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg | ||
|- | |- | ||
| 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg | | 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || 🔶 fine-tuned on domain-specific datasets || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg | ||
|- | |- | ||
| 9 || [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg | | 9 || [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg | ||
|- | |- | ||
| 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg | | 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || 🔶 fine-tuned on domain-specific datasets || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg | ||
|} | |} | ||
'''General 카테고리 특징''': | '''General 카테고리 특징''': | ||
* 78B 파라미터 모델이 상위권을 지배 (상위 | * 78B 파라미터 모델이 상위권을 지배 (상위 4개 모두 78B) | ||
* Qwen2.5- | * CO₂ Cost 효율: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg)가 가장 효율적 | ||
* 32B | * huihui-ai/Qwen2.5-72B-Instruct-abliterated (76.77kg)가 가장 높은 환경 비용 | ||
* | * IFEval 최고: MaziyarPanahi/calme-2.1-qwen2.5-72b (86.62%) | ||
* MATH 최고: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (60.27%) | |||
* MMLU-PRO 최고: MaziyarPanahi/calme-3.2-instruct-78b (70.03%) | |||
=== Coding (코딩 능력) === | === Coding (코딩 능력) === | ||
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026- | LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-08-03 기준) | ||
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다. | LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다. | ||
| Line 139: | Line 141: | ||
=== Edge Devices (경량 모델) === | === Edge Devices (경량 모델) === | ||
HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리 기준 상위 10개 모델 (2026- | HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리 기준 상위 10개 모델 (2026-08-03 기준) | ||
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다. | Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다. | ||
| Line 146: | Line 148: | ||
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | ! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | ||
|- | |- | ||
| 1 || [https://huggingface.co/ | | 1 || [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] || 🤝 base merges and moerges || 37.30% || 76.40% || 36.62% || 48.79% || 8.95% || 37.51% || 0.62 kg | ||
|- | |- | ||
| 2 || [https://huggingface.co/ | | 2 || [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] || 🤝 base merges and moerges || 36.94% || 75.70% || 35.96% || 49.32% || 7.61% || 37.80% || 0.63 kg | ||
|- | |- | ||
| 3 || [https://huggingface.co/ | | 3 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] || 🤝 base merges and moerges || 36.89% || 75.49% || 36.12% || 50.68% || 8.39% || 37.80% || 0.69 kg | ||
|- | |- | ||
| 4 || [https://huggingface.co/ | | 4 || [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] || 🤝 base merges and moerges || 36.88% || 75.83% || 36.36% || 48.49% || 7.72% || 37.73% || 0.63 kg | ||
|- | |- | ||
| 5 || [https://huggingface.co/ | | 5 || [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] || 🤝 base merges and moerges || 36.86% || 76.79% || 36.02% || 48.56% || 6.94% || 37.78% || 0.67 kg | ||
|- | |- | ||
| 6 || [https://huggingface.co/ | | 6 || [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] || 🤝 base merges and moerges || 36.80% || 76.16% || 36.13% || 49.92% || 7.61% || 38.17% || 0.68 kg | ||
|- | |- | ||
| 7 || [https://huggingface.co/ | | 7 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] || 🤝 base merges and moerges || 36.80% || 75.28% || 35.92% || 50.00% || 9.40% || 37.92% || 0.67 kg | ||
|- | |- | ||
| 8 || [https://huggingface.co/ | | 8 || [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] || 🤝 base merges and moerges || 36.78% || 75.09% || 36.46% || 48.79% || 8.28% || 37.61% || 0.64 kg | ||
|- | |- | ||
| 9 || [https://huggingface.co/ | | 9 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] || 🤝 base merges and moerges || 36.71% || 75.07% || 35.47% || 50.76% || 8.39% || 38.00% || 0.68 kg | ||
|- | |- | ||
| 10 || [https://huggingface.co/ | | 10 || [https://huggingface.co/marcuscedricridia/cursa-o1-7b marcuscedricridia/cursa-o1-7b] || 🤝 base merges and moerges || 36.71% || 76.28% || 35.70% || 49.55% || 7.61% || 37.69% || 0.68 kg | ||
|} | |} | ||
'''Edge Devices 카테고리 특징''': | '''Edge Devices 카테고리 특징''': | ||
* 7B | * Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview이(가) 평균 점수 37.30%로 가장 우수 | ||
* | * Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview이(가) CO₂ Cost 0.62kg으로 가장 효율적 | ||
* Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능 | * Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능 | ||
* | * 7B 모델들이 엣지 디바이스 배포에 적합 | ||
=== 파라미터 규모별 성능 트렌드 === | === 파라미터 규모별 성능 트렌드 === | ||
| Line 185: | Line 185: | ||
'''32B 모델의 경쟁력 부상''' | '''32B 모델의 경쟁력 부상''' | ||
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5- | Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다. | ||
'''Edge Devices (7B 이하 경량 모델)''' | |||
7B 이하 경량 모델 중 Qwen2.5 기반 모델이 우수 성능을 보이고 있습니다. Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview가 37.30%로 가장 높은 평균 점수를 기록했으며, CO₂ Cost는 0.62kg으로 매우 효율적입니다. | |||
=== CO₂ Cost 분석 === | === CO₂ Cost 분석 === | ||
| Line 193: | Line 196: | ||
|- | |- | ||
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배 | | 78B (Calme 시리즈) || ~46.60 kg || ~5.9배 | ||
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배 | | 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배 | ||
| 32B || ~28.75 kg || 기준 | | 32B || ~28.75 kg || 기준 | ||
| 7B (Edge) || ~0.65 kg || 기준 | |||
|} | |} | ||
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다. | 32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다. Edge Devices 카테고리에서는 7B 모델이 0.62kg으로 가장 효율적입니다. | ||
=== 벤치마크 지표별 강점 === | === 벤치마크 지표별 강점 === | ||
| Line 207: | Line 209: | ||
* '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고 | * '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고 | ||
* '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위 | * '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위 | ||
=== 모델 아키텍처 비교 === | === 모델 아키텍처 비교 === | ||
| Line 218: | Line 217: | ||
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes | ! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes | ||
|- | |- | ||
| 1 | | 1 || [MaziyarPanahi/calme-3.2-instruct-78b](MaziyarPanahi/calme-3.2-instruct-78b) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터 | ||
|- | | 2 || [MaziyarPanahi/calme-3.1-instruct-78b](MaziyarPanahi/calme-3.1-instruct-78b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터 | ||
| 5 || Qwen2.5-72B-Instruct-abliterated | | 3 || [dfurman/CalmeRys-78B-Orpo-v0.1](dfurman/CalmeRys-78B-Orpo-v0.1) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || dfurman 이 개발한 Calme 계열 모델. ORPO 최적화 | ||
| 4 || [MaziyarPanahi/calme-2.4-rys-78b](MaziyarPanahi/calme-2.4-rys-78b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터 | |||
| 6 || Qwen2.5-72B-Instruct | | 5 || [huihui-ai/Qwen2.5-72B-Instruct-abliterated](huihui-ai/Qwen2.5-72B-Instruct-abliterated) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || Abliterated 버전 — 안전 필터 제거로 성능 향상 | ||
| 6 || [Qwen/Qwen2.5-72B-Instruct](Qwen/Qwen2.5-72B-Instruct) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처 | |||
| 7 || calme-2.1-qwen2.5-72b | | 7 || [MaziyarPanahi/calme-2.1-qwen2.5-72b](MaziyarPanahi/calme-2.1-qwen2.5-72b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Qwen2.5 기반 Calme 모델 | ||
| 8 || [newsbang/Homer-v1.0-Qwen2.5-72B](newsbang/Homer-v1.0-Qwen2.5-72B) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || newsbang 가 개발한 Homer 시리즈 | |||
| 8 || Homer-v1.0-Qwen2.5-72B | | 9 || [ehristoforu/qwen2.5-test-32b-it](ehristoforu/qwen2.5-test-32b-it) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Qwen2.5-32B 기반 지시 따르기 최적화 모델 | ||
| 10 || [Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B](Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || Saxo 가 개발한 32B 모델 | |||
| 9 || qwen2.5-test-32b-it | |||
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || | |||
|} | |} | ||
== Best Practices == | == Best Practices == | ||
| Line 270: | Line 260: | ||
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다. | * '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다. | ||
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다. | * '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다. | ||
* '''데이터 시점''': 본 데이터는 2026- | * '''데이터 시점''': 본 데이터는 2026-08-03 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다. | ||
| Line 279: | Line 269: | ||
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Open LLM Leaderboard] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함. | * [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Open LLM Leaderboard] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함. | ||
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard | * URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard | ||
* 접근일: 2026- | * 접근일: 2026-08-03 | ||
* 상태: Archived (2026년 5월 기준) | * 상태: Archived (2026년 5월 기준) | ||
| Line 288: | Line 278: | ||
* Paper: https://arxiv.org/abs/2406.15877 | * Paper: https://arxiv.org/abs/2406.15877 | ||
* GitHub: https://github.com/LiveCodeBench/LiveCodeBench | * GitHub: https://github.com/LiveCodeBench/LiveCodeBench | ||
* 접근일: 2026- | * 접근일: 2026-08-03 | ||
=== Top 10 모델 상세 링크 === | === Top 10 모델 상세 링크 === | ||
==== General 카테고리 (전체 능력) ==== | ==== General 카테고리 (전체 능력) 상세 링크 ==== | ||
===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b ===== | ===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b ===== | ||
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b | * HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b | ||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&model=MaziyarPanahi | * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&model=MaziyarPanahi/calme-3.2-instruct-78b | ||
* 파라미터: 78B | Type: fine-tuned | Average: 52.08% | * 파라미터: 78B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 52.08% | ||
* CO₂ Cost: 66.01 kg | * CO₂ Cost: 66.01 kg | ||
===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b ===== | ===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b ===== | ||
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b | * HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b | ||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&model=MaziyarPanahi | * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&model=MaziyarPanahi/calme-3.1-instruct-78b | ||
* 파라미터: 78B | Type: chat | Average: 51.29% | * 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 51.29% | ||
* CO₂ Cost: 64.44 kg | * CO₂ Cost: 64.44 kg | ||
===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 ===== | ===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 ===== | ||
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 | * HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 | ||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&model=dfurman | * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&model=dfurman/CalmeRys-78B-Orpo-v0.1 | ||
* 파라미터: 78B | Type: chat | Average: 51.23% | * 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 51.23% | ||
* CO₂ Cost: 25.99 kg | * CO₂ Cost: 25.99 kg | ||
===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b ===== | ===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b ===== | ||
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b | * HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b | ||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&model=MaziyarPanahi | * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&model=MaziyarPanahi/calme-2.4-rys-78b | ||
* 파라미터: 78B | Type: chat | Average: 50.77% | * 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 50.77% | ||
* CO₂ Cost: 25.95 kg | * CO₂ Cost: 25.95 kg | ||
===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated ===== | ===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated ===== | ||
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated | * HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated | ||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&model=huihui-ai | * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&model=huihui-ai/Qwen2.5-72B-Instruct-abliterated | ||
* 파라미터: | * 파라미터: 73B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 48.11% | ||
* CO₂ Cost: 76.77 kg | * CO₂ Cost: 76.77 kg | ||
===== Rank 6: Qwen/Qwen2.5-72B-Instruct ===== | ===== Rank 6: Qwen/Qwen2.5-72B-Instruct ===== | ||
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct | * HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct | ||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&model=Qwen/Qwen2.5-72B-Instruct | |||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&model=Qwen | * 파라미터: 73B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.98% | ||
* 파라미터: | |||
* CO₂ Cost: 47.65 kg | * CO₂ Cost: 47.65 kg | ||
===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b ===== | ===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b ===== | ||
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b | * HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b | ||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&model=MaziyarPanahi | * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&model=MaziyarPanahi/calme-2.1-qwen2.5-72b | ||
* 파라미터: | * 파라미터: 73B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.86% | ||
* CO₂ Cost: 29.50 kg | * CO₂ Cost: 29.50 kg | ||
===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B ===== | ===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B ===== | ||
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B | * HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B | ||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&model=newsbang | * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&model=newsbang/Homer-v1.0-Qwen2.5-72B | ||
* 파라미터: | * 파라미터: 73B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 47.46% | ||
* CO₂ Cost: 29.55 kg | * CO₂ Cost: 29.55 kg | ||
===== Rank 9: ehristoforu/qwen2.5-test-32b-it ===== | ===== Rank 9: ehristoforu/qwen2.5-test-32b-it ===== | ||
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it | * HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it | ||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&model=ehristoforu | * Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&model=ehristoforu/qwen2.5-test-32b-it | ||
* 파라미터: | * 파라미터: 33B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.37% | ||
* CO₂ Cost: 29.54 kg | * CO₂ Cost: 29.54 kg | ||
===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B ===== | ===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B ===== | ||
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B | |||
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&model=Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B | |||
* 파라미터: 33B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 47.34% | |||
* CO₂ Cost: 7.95 kg | |||
==== Coding 카테고리 (코딩 능력) ==== | ==== Coding 카테고리 (코딩 능력) ==== | ||
Revision as of 09:24, 3 August 2026
Top 10 오픈소스 AI 모델 동향
Overview
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.
Summary
- 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
- 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
- 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시
조사 정보
- 조사 일자: 2026-08-03 09:24 KST
- 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)
- 데이터 기준일: 2026-08-03
- 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)
Purpose
이 문서가 존재하는 이유
- Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
- Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
- Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음
Key Concepts
| 개념 ! 설명 ! 관련 문서 |
|---|
| Parameters (파라미터 수) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함 |
| Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄 |
| IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정 |
| BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가 |
| MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정 |
| GPQA (Graduate-Level Google-Proof Q&A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가 |
| MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정 |
| MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가 |
| CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨 |
| fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델 |
| chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨 |
| HuggingFace Open LLM Leaderboard | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 |
Top 10 Models
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.
General (전체 능력)
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-08-03 기준)
이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.
| Rank | Model | Type | Average | IFEval | BBH | MATH | GPQA | MUSR | MMLU-PRO | CO₂ Cost |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | MaziyarPanahi/calme-3.2-instruct-78b | 🔶 fine-tuned on domain-specific datasets | 52.08% | 80.63% | 62.61% | 40.33% | 20.36% | 38.53% | 70.03% | 66.01 kg |
| 2 | MaziyarPanahi/calme-3.1-instruct-78b | 💬 chat models (RLHF, DPO, IFT, ...) | 51.29% | 81.36% | 62.41% | 39.27% | 19.46% | 36.50% | 68.72% | 64.44 kg |
| 3 | dfurman/CalmeRys-78B-Orpo-v0.1 | 💬 chat models (RLHF, DPO, IFT, ...) | 51.23% | 81.63% | 61.92% | 40.63% | 20.02% | 36.37% | 66.80% | 25.99 kg |
| 4 | MaziyarPanahi/calme-2.4-rys-78b | 💬 chat models (RLHF, DPO, IFT, ...) | 50.77% | 80.11% | 62.16% | 40.71% | 20.36% | 34.57% | 66.69% | 25.95 kg |
| 5 | huihui-ai/Qwen2.5-72B-Instruct-abliterated | 🔶 fine-tuned on domain-specific datasets | 48.11% | 85.93% | 60.49% | 60.12% | 19.35% | 12.34% | 50.41% | 76.77 kg |
| 6 | Qwen/Qwen2.5-72B-Instruct | 💬 chat models (RLHF, DPO, IFT, ...) | 47.98% | 86.38% | 61.87% | 59.82% | 16.67% | 11.74% | 51.40% | 47.65 kg |
| 7 | MaziyarPanahi/calme-2.1-qwen2.5-72b | 💬 chat models (RLHF, DPO, IFT, ...) | 47.86% | 86.62% | 61.66% | 59.14% | 15.10% | 13.30% | 51.32% | 29.50 kg |
| 8 | newsbang/Homer-v1.0-Qwen2.5-72B | 🔶 fine-tuned on domain-specific datasets | 47.46% | 76.28% | 62.27% | 49.02% | 22.15% | 17.90% | 57.17% | 29.55 kg |
| 9 | ehristoforu/qwen2.5-test-32b-it | 💬 chat models (RLHF, DPO, IFT, ...) | 47.37% | 78.89% | 58.28% | 59.74% | 15.21% | 19.13% | 52.95% | 29.54 kg |
| 10 | Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B | 🔶 fine-tuned on domain-specific datasets | 47.34% | 79.72% | 57.63% | 60.27% | 14.99% | 18.16% | 53.25% | 7.95 kg |
General 카테고리 특징:
- 78B 파라미터 모델이 상위권을 지배 (상위 4개 모두 78B)
- CO₂ Cost 효율: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg)가 가장 효율적
- huihui-ai/Qwen2.5-72B-Instruct-abliterated (76.77kg)가 가장 높은 환경 비용
- IFEval 최고: MaziyarPanahi/calme-2.1-qwen2.5-72b (86.62%)
- MATH 최고: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (60.27%)
- MMLU-PRO 최고: MaziyarPanahi/calme-3.2-instruct-78b (70.03%)
Coding (코딩 능력)
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-08-03 기준)
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.
| Rank | Model | Pass@1 | Easy | Medium | Hard | Source |
|---|---|---|---|---|---|---|
| 1 | Codestral-Latest | 32.2% | 69.0% | 18.7% | 0.9% | Mistral AI |
| 2 | LLaMA-3-70B-Instruct | 28.3% | 60.7% | 15.8% | 1.4% | Meta |
| 3 | Mixtral-8x22B-Instruct | 26.4% | 59.8% | 12.7% | 0.0% | Mistral AI |
| 4 | DSCoder-33B-Instruct | 23.6% | 55.6% | 9.0% | 0.7% | DeepSeek |
| 5 | OC-DS-33B | 21.3% | 53.9% | 5.1% | 0.0% | OpenCoder |
| 6 | Phind-34B-V2 | 21.0% | 53.4% | 4.7% | 0.1% | Phind |
| 7 | MagiCoderS-DS-6.7B | 20.5% | 49.2% | 7.5% | 0.0% | DeepSeek |
| 8 | LLaMA-3-70B-Base | 20.1% | 52.2% | 3.2% | 0.6% | Meta |
| 9 | CodeQwen1.5-7B-Chat | 19.3% | 39.2% | 13.1% | 0.5% | Alibaba (Qwen) |
| 10 | DSCoder-6.7B-Instruct | 19.1% | 46.4% | 5.8% | 0.7% | DeepSeek |
Coding 카테고리 특징:
- Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능
- LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수
- CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화
- Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)
Edge Devices (경량 모델)
HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리 기준 상위 10개 모델 (2026-08-03 기준)
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.
| Rank | Model | Type | Average | IFEval | BBH | MATH | GPQA | MMLU-PRO | CO₂ Cost |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview | 🤝 base merges and moerges | 37.30% | 76.40% | 36.62% | 48.79% | 8.95% | 37.51% | 0.62 kg |
| 2 | gz987/qwen2.5-7b-cabs-v0.3 | 🤝 base merges and moerges | 36.94% | 75.70% | 35.96% | 49.32% | 7.61% | 37.80% | 0.63 kg |
| 3 | marcuscedricridia/pre-cursa-o1-v1.2 | 🤝 base merges and moerges | 36.89% | 75.49% | 36.12% | 50.68% | 8.39% | 37.80% | 0.69 kg |
| 4 | gz987/qwen2.5-7b-cabs-v0.4 | 🤝 base merges and moerges | 36.88% | 75.83% | 36.36% | 48.49% | 7.72% | 37.73% | 0.63 kg |
| 5 | suayptalha/Clarus-7B-v0.2 | 🤝 base merges and moerges | 36.86% | 76.79% | 36.02% | 48.56% | 6.94% | 37.78% | 0.67 kg |
| 6 | marcuscedricridia/cursa-o1-7b-v1.2-normalize-false | 🤝 base merges and moerges | 36.80% | 76.16% | 36.13% | 49.92% | 7.61% | 38.17% | 0.68 kg |
| 7 | marcuscedricridia/pre-cursa-o1-v1.6 | 🤝 base merges and moerges | 36.80% | 75.28% | 35.92% | 50.00% | 9.40% | 37.92% | 0.67 kg |
| 8 | suayptalha/Clarus-7B-v0.3 | 🤝 base merges and moerges | 36.78% | 75.09% | 36.46% | 48.79% | 8.28% | 37.61% | 0.64 kg |
| 9 | marcuscedricridia/pre-cursa-o1-v1.3 | 🤝 base merges and moerges | 36.71% | 75.07% | 35.47% | 50.76% | 8.39% | 38.00% | 0.68 kg |
| 10 | marcuscedricridia/cursa-o1-7b | 🤝 base merges and moerges | 36.71% | 76.28% | 35.70% | 49.55% | 7.61% | 37.69% | 0.68 kg |
Edge Devices 카테고리 특징:
- Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview이(가) 평균 점수 37.30%로 가장 우수
- Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview이(가) CO₂ Cost 0.62kg으로 가장 효율적
- Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능
- 7B 모델들이 엣지 디바이스 배포에 적합
파라미터 규모별 성능 트렌드
78B 모델의 지배적 위치 상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).
Qwen2.5-72B: 공식 오픈소스 모델의 기준 Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.
32B 모델의 경쟁력 부상 Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.
Edge Devices (7B 이하 경량 모델) 7B 이하 경량 모델 중 Qwen2.5 기반 모델이 우수 성능을 보이고 있습니다. Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview가 37.30%로 가장 높은 평균 점수를 기록했으며, CO₂ Cost는 0.62kg으로 매우 효율적입니다.
CO₂ Cost 분석
| 파라미터 규모 | 평균 CO₂ Cost | Rank 10 대비 배수 | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 78B (Calme 시리즈) | ~46.60 kg | ~5.9배 | 72B (Qwen2.5 기반) | ~50.93 kg | ~6.4배 | 32B | ~28.75 kg | 기준 | 7B (Edge) | ~0.65 kg | 기준 |
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다. Edge Devices 카테고리에서는 7B 모델이 0.62kg으로 가장 효율적입니다.
벤치마크 지표별 강점
- IFEval (지시 따르기): Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
- MATH (수학): huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
- GPQA (전문 지식): newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
- MMLU-PRO (종합 지식): MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위
모델 아키텍처 비교
| Rank | Model | 베이스 아키텍처 | Type | Notes | |||||||||||||||||||||||||||||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | [MaziyarPanahi/calme-3.2-instruct-78b](MaziyarPanahi/calme-3.2-instruct-78b) | Qwen2ForCausalLM | 🔶 fine-tuned on domain-specific datasets | MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터 | 2 | [MaziyarPanahi/calme-3.1-instruct-78b](MaziyarPanahi/calme-3.1-instruct-78b) | Qwen2ForCausalLM | 💬 chat models (RLHF, DPO, IFT, ...) | MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터 | 3 | [dfurman/CalmeRys-78B-Orpo-v0.1](dfurman/CalmeRys-78B-Orpo-v0.1) | Qwen2ForCausalLM | 💬 chat models (RLHF, DPO, IFT, ...) | dfurman 이 개발한 Calme 계열 모델. ORPO 최적화 | 4 | [MaziyarPanahi/calme-2.4-rys-78b](MaziyarPanahi/calme-2.4-rys-78b) | Qwen2ForCausalLM | 💬 chat models (RLHF, DPO, IFT, ...) | MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터 | 5 | [huihui-ai/Qwen2.5-72B-Instruct-abliterated](huihui-ai/Qwen2.5-72B-Instruct-abliterated) | Qwen2ForCausalLM | 🔶 fine-tuned on domain-specific datasets | Abliterated 버전 — 안전 필터 제거로 성능 향상 | 6 | [Qwen/Qwen2.5-72B-Instruct](Qwen/Qwen2.5-72B-Instruct) | Qwen2ForCausalLM | 💬 chat models (RLHF, DPO, IFT, ...) | Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처 | 7 | [MaziyarPanahi/calme-2.1-qwen2.5-72b](MaziyarPanahi/calme-2.1-qwen2.5-72b) | Qwen2ForCausalLM | 💬 chat models (RLHF, DPO, IFT, ...) | Qwen2.5 기반 Calme 모델 | 8 | [newsbang/Homer-v1.0-Qwen2.5-72B](newsbang/Homer-v1.0-Qwen2.5-72B) | Qwen2ForCausalLM | 🔶 fine-tuned on domain-specific datasets | newsbang 가 개발한 Homer 시리즈 | 9 | [ehristoforu/qwen2.5-test-32b-it](ehristoforu/qwen2.5-test-32b-it) | Qwen2ForCausalLM | 💬 chat models (RLHF, DPO, IFT, ...) | Qwen2.5-32B 기반 지시 따르기 최적화 모델 | 10 | [Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B](Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B) | Qwen2ForCausalLM | 🔶 fine-tuned on domain-specific datasets | Saxo 가 개발한 32B 모델 |
Best Practices
모델 선택 가이드라인
성능 최우선 시 (78B/72B 모델 권장)
- 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
- 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
- IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)
환경 비용 고려 시 (32B 모델 권장)
- CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
- Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
- 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위
균형 잡힌 선택 (Qwen2.5-72B 권장)
- 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
- Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)
모델 선택 의사결정 트리
- 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
- 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
- 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
- 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated
Limitations
- Leaderboard Archived: HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.
- 벤치마크 한계: Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.
- CO₂ Cost 변동성: CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.
- 모델 타입 구분: fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.
- 데이터 시점: 본 데이터는 2026-08-03 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.
References
HuggingFace Open LLM Leaderboard
- Open LLM Leaderboard — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.
- URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
- 접근일: 2026-08-03
- 상태: Archived (2026년 5월 기준)
LiveCodeBench (코딩 평가)
- LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.
- URL: https://huggingface.co/spaces/livecodebench/leaderboard
- Paper: https://arxiv.org/abs/2406.15877
- GitHub: https://github.com/LiveCodeBench/LiveCodeBench
- 접근일: 2026-08-03
Top 10 모델 상세 링크
General 카테고리 (전체 능력) 상세 링크
Rank 1: MaziyarPanahi/calme-3.2-instruct-78b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&model=MaziyarPanahi/calme-3.2-instruct-78b
- 파라미터: 78B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 52.08%
- CO₂ Cost: 66.01 kg
Rank 2: MaziyarPanahi/calme-3.1-instruct-78b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&model=MaziyarPanahi/calme-3.1-instruct-78b
- 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 51.29%
- CO₂ Cost: 64.44 kg
Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1
- HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&model=dfurman/CalmeRys-78B-Orpo-v0.1
- 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 51.23%
- CO₂ Cost: 25.99 kg
Rank 4: MaziyarPanahi/calme-2.4-rys-78b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&model=MaziyarPanahi/calme-2.4-rys-78b
- 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 50.77%
- CO₂ Cost: 25.95 kg
Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated
- HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&model=huihui-ai/Qwen2.5-72B-Instruct-abliterated
- 파라미터: 73B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 48.11%
- CO₂ Cost: 76.77 kg
Rank 6: Qwen/Qwen2.5-72B-Instruct
- HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&model=Qwen/Qwen2.5-72B-Instruct
- 파라미터: 73B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.98%
- CO₂ Cost: 47.65 kg
Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b
- HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&model=MaziyarPanahi/calme-2.1-qwen2.5-72b
- 파라미터: 73B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.86%
- CO₂ Cost: 29.50 kg
Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B
- HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&model=newsbang/Homer-v1.0-Qwen2.5-72B
- 파라미터: 73B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 47.46%
- CO₂ Cost: 29.55 kg
Rank 9: ehristoforu/qwen2.5-test-32b-it
- HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&model=ehristoforu/qwen2.5-test-32b-it
- 파라미터: 33B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.37%
- CO₂ Cost: 29.54 kg
Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
- HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
- Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&model=Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B
- 파라미터: 33B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 47.34%
- CO₂ Cost: 7.95 kg
Coding 카테고리 (코딩 능력)
Rank 1: Codestral-Latest
- HuggingFace Hub: https://huggingface.co/models?search=codestral
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%
- 개발사: Mistral AI
Rank 2: LLaMA-3-70B-Instruct
- HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%
- 개발사: Meta
Rank 3: Mixtral-8x22B-Instruct
- HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%
- 개발사: Mistral AI
Rank 4: DSCoder-33B-Instruct
- HuggingFace Hub: https://huggingface.co/models?search=dscoder
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%
- 개발사: DeepSeek
Rank 5: OC-DS-33B
- HuggingFace Hub: https://huggingface.co/models?search=opencoder
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%
- 개발사: OpenCoder
Rank 6: Phind-34B-V2
- HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%
- 개발사: Phind
Rank 7: MagiCoderS-DS-6.7B
- HuggingFace Hub: https://huggingface.co/models?search=magicoders
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%
- 개발사: DeepSeek
Rank 8: LLaMA-3-70B-Base
- HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%
- 개발사: Meta (Instruct 버전 아님)
Rank 9: CodeQwen1.5-7B-Chat
- HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat
- Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%
- 개발사: Alibaba (Qwen)
Rank 10: DSCoder-6.7B-Instruct
- HuggingFace Hub: https://huggingface.co/models?search=dscoder
- LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard
- Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%
- 개발사: DeepSeek
Edge Devices 카테고리 (경량 모델)
- HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard
- 7B 이하 경량 모델 평가 기준
벤치마크 지표 설명
- IFEval (Instruction Following Evaluation) — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가
- BBH (Big Bench Hard) — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
- MATH — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
- GPQA (Graduate-Level Google-Proof Q&A) — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도
- MMLU-PRO — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
- Pass@1 (LiveCodeBench) — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율
관련 문서
- Qwen2.5 — 알리바바 그룹에서 개발한 오픈소스 LLM
- Llama — Meta에서 개발한 오픈소스 LLM
- LLM Benchmark — 대규모 언어 모델 벤치마킹 방법론
- Fine-tuning — 사전 학습 모델의 추가 학습 기법
- CO₂ Emissions in AI — AI 모델의 환경 영향
- Codestral — Mistral AI의 코딩 특화 LLM
- LiveCodeBench — 코딩 능력 평가 벤치마크