Top 10 오픈소스 AI 모델 동향: Difference between revisions

From HPCWIKI
Jump to navigation Jump to search
(Fix Key Concepts table structure, add HuggingFace Hub links to all model names, add benchmark header links)
(Replace all internal wiki links with external official URLs (GitHub, arXiv, HuggingFace) for benchmarks and models)
Line 41: Line 41:
|| [[Overall Average]] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
|| [[Overall Average]] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
|-
|-
|| [[IFEval|IFEval (Instruction Following Evaluation)]] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정 | [https://github.com/google-research/google-research/tree/master/instruction_following_eval GitHub]
|| [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정
|-
|-
|| [[BBH|BBH (Big Bench Hard)]] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가 | [https://github.com/suzgunmirac/BIG-Bench-Hard GitHub]
|| [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
|-
|-
|| [[MATH (벤치마크)|MATH]] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정 | [https://github.com/hendrycks/math GitHub]
|| [https://github.com/hendrycks/math MATH] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
|-
|-
|| [[GPQA|GPQA (Graduate-Level Google-Proof Q&A)]] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가 | [https://github.com/idavidrein/gpqa GitHub]
|| [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&A)] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가
|-
|-
|| [[MUSR|MUSR (Multi-Step Reasoning)]] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
|| [[MUSR|MUSR (Multi-Step Reasoning)]] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
|-
|-
|| [[MMLU-PRO|MMLU-PRO]] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가 | [https://github.com/hendrycks/test GitHub]
|| [https://github.com/hendrycks/test MMLU-PRO] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
|-
|-
|| [[CO₂ Cost|CO₂ Cost]] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
|-
|-
|| [[Fine-tuning|fine-tuned]] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
|| [[Fine-tuning|fine-tuned]] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
Line 72: Line 72:


{| class="wikitable" style="text-align:center; font-size:90%"
{| class="wikitable" style="text-align:center; font-size:90%"
! Rank !! Model !! Type !! Average !! [[IFEval|IFEval]] !! [[BBH|BBH]] !! [[MATH (벤치마크)|MATH]] !! [[GPQA|GPQA]] !! [[MUSR|MUSR]] !! [[MMLU-PRO|MMLU-PRO]] !! [[CO₂ Cost|CO₂ Cost]]
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]
|-
|-
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg
Line 108: Line 108:


{| class="wikitable" style="text-align:center; font-size:90%"
{| class="wikitable" style="text-align:center; font-size:90%"
! Rank !! Model !! [[Pass@1|Pass@1]] !! Easy !! Medium !! Hard !! Source
! Rank !! Model !! [https://github.com/LiveCodeBench/LiveCodeBench Pass@1] !! Easy !! Medium !! Hard !! Source
|-
|-
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI
Line 144: Line 144:


{| class="wikitable" style="text-align:center; font-size:90%"
{| class="wikitable" style="text-align:center; font-size:90%"
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MMLU-PRO !! CO₂ Cost
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]
|-
|-
| 1 || [https://huggingface.co/PJMixers-Dev/Qwen2.5-RomboTiesTest-7B PJMixers-Dev/Qwen2.5-RomboTiesTest-7B] || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg
| 1 || [https://huggingface.co/PJMixers-Dev/Qwen2.5-RomboTiesTest-7B PJMixers-Dev/Qwen2.5-RomboTiesTest-7B] || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg
Line 203: Line 203:
=== 벤치마크 지표별 강점 ===
=== 벤치마크 지표별 강점 ===


* '''[[IFEval|IFEval]] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
* '''[https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
* '''[[MATH (벤치마크)|MATH]] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
* '''[https://github.com/hendrycks/math MATH] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
* '''[[GPQA|GPQA]] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
* '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
* '''[[MMLU-PRO|MMLU-PRO]] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위
* '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위




Line 445: Line 445:
=== 벤치마크 지표 설명 ===
=== 벤치마크 지표 설명 ===


* IFEval (Instruction Following Evaluation): https://github.com/google-research/google-research/tree/master/instruction_following_eval — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가
* [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가
* BBH (Big Bench Hard): https://github.com/suzgunmirac/BIG-Bench-Hard — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
* [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
* MATH: https://github.com/hendrycks/math — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
* [https://github.com/hendrycks/math MATH] — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
* GPQA (Graduate-Level Google-Proof Q&A): https://github.com/idavidrein/gpqa — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도
* [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&A)] — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도
* MMLU-PRO: https://github.com/hendrycks/test — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
* [https://github.com/hendrycks/test MMLU-PRO] — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
* Pass@1 (LiveCodeBench): https://github.com/LiveCodeBench/LiveCodeBench — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율
* [https://github.com/LiveCodeBench/LiveCodeBench Pass@1 (LiveCodeBench)] — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율


=== 관련 문서 ===
=== 관련 문서 ===

Revision as of 11:28, 31 July 2026

Top 10 오픈소스 AI 모델 동향

Template:Status

Template:TOC

Overview

HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.

Summary

  • 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
  • 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
  • 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시


조사 정보

Purpose

이 문서가 존재하는 이유

  • Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
  • Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
  • Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음


Key Concepts

개념 ! 설명 ! 관련 문서
파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함
Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정
BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
GPQA (Graduate-Level Google-Proof Q&A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가
MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨
HuggingFace Open LLM Leaderboard | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 | HuggingFace

Top 10 Models

HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.

General (전체 능력)

HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)

이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.

Rank Model Type Average IFEval BBH MATH GPQA MUSR MMLU-PRO CO₂ Cost
1 MaziyarPanahi/calme-3.2-instruct-78b fine-tuned 52.08% 80.63% 62.61% 40.33% 20.36% 38.53% 70.03% 66.01 kg
2 MaziyarPanahi/calme-3.1-instruct-78b chat 51.29% 81.36% 62.41% 39.27% 19.46% 36.50% 68.72% 64.44 kg
3 dfurman/CalmeRys-78B-Orpo-v0.1 chat 51.23% 81.63% 61.92% 40.63% 20.02% 36.37% 66.80% 25.99 kg
4 MaziyarPanahi/calme-2.4-rys-78b chat 50.77% 80.11% 62.16% 40.71% 20.36% 34.57% 66.69% 25.95 kg
5 huihui-ai/Qwen2.5-72B-Instruct-abliterated fine-tuned 48.11% 85.93% 60.49% 60.12% 19.35% 12.34% 50.41% 76.77 kg
6 Qwen/Qwen2.5-72B-Instruct chat 47.98% 86.38% 61.87% 59.82% 16.67% 11.74% 51.40% 47.65 kg
7 MaziyarPanahi/calme-2.1-qwen2.5-72b chat 47.86% 86.62% 61.66% 59.14% 15.10% 13.30% 51.32% 29.50 kg
8 newsbang/Homer-v1.0-Qwen2.5-72B fine-tuned 47.46% 76.28% 62.27% 49.02% 22.15% 17.90% 57.17% 29.55 kg
9 ehristoforu/qwen2.5-test-32b-it chat 47.37% 78.89% 58.28% 59.74% 15.21% 19.13% 52.95% 29.54 kg
10 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B fine-tuned 47.34% 79.72% 57.63% 60.27% 14.99% 18.16% 53.25% 7.95 kg

General 카테고리 특징:

  • 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)
  • Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능
  • 32B 모델도 경쟁력 있음 (Rank 9, 10)
  • CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적

Coding (코딩 능력)

LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)

LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.

Rank Model Pass@1 Easy Medium Hard Source
1 Codestral-Latest 32.2% 69.0% 18.7% 0.9% Mistral AI
2 LLaMA-3-70B-Instruct 28.3% 60.7% 15.8% 1.4% Meta
3 Mixtral-8x22B-Instruct 26.4% 59.8% 12.7% 0.0% Mistral AI
4 DSCoder-33B-Instruct 23.6% 55.6% 9.0% 0.7% DeepSeek
5 OC-DS-33B 21.3% 53.9% 5.1% 0.0% OpenCoder
6 Phind-34B-V2 21.0% 53.4% 4.7% 0.1% Phind
7 MagiCoderS-DS-6.7B 20.5% 49.2% 7.5% 0.0% DeepSeek
8 LLaMA-3-70B-Base 20.1% 52.2% 3.2% 0.6% Meta
9 CodeQwen1.5-7B-Chat 19.3% 39.2% 13.1% 0.5% Alibaba (Qwen)
10 DSCoder-6.7B-Instruct 19.1% 46.4% 5.8% 0.7% DeepSeek

Coding 카테고리 특징:

  • Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능
  • LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수
  • CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화
  • Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)

Edge Devices (경량 모델)

HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리 기준 상위 10개 모델 (2026-07-31 기준)

Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.

Rank Model Type Average IFEval BBH MATH GPQA MMLU-PRO CO₂ Cost
1 PJMixers-Dev/Qwen2.5-RomboTiesTest-7B basemergesandmoerges 35.29% 75.58% 34.93% 49.62% 6.38% 36.50% 1.34 kg
2 brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial basemergesandmoerges 31.48% 56.77% 37.25% 34.97% 8.17% 38.95% 2.01 kg
3 DreadPoor/Here_We_Go_Again-8B-SLERP basemergesandmoerges 30.13% 74.42% 35.53% 17.30% 9.17% 31.92% 1.23 kg
4 microsoft/Phi-4-mini-instruct chat 29.41% 73.78% 38.74% 16.99% 7.94% 32.58% 0.83 kg
5 T145/ZEUS-8B-V15 chat 29.37% 70.13% 36.18% 23.04% 3.47% 33.99% 1.39 kg
6 DreadPoor/Asymmetric_Linearity-8B-Model_Stock basemergesandmoerges 29.35% 71.74% 35.44% 16.47% 8.61% 31.60% 1.28 kg
7 DreadPoor/VENN_1.2-8B-Model_Stock basemergesandmoerges 28.85% 72.26% 35.13% 17.07% 6.26% 30.23% 1.28 kg
8 PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B basemergesandmoerges 28.82% 78.25% 29.89% 20.02% 5.59% 30.75% 1.44 kg
9 DreadPoor/Elusive_Dragon_Heart-8B-LINEAR basemergesandmoerges 28.66% 71.31% 35.31% 14.80% 7.49% 31.27% 1.27 kg
10 ehristoforu/coolqwen-3b-it fine-tunedondomain-specificdatasets 28.65% 64.73% 27.46% 36.71% 4.36% 28.90% 1.45 kg

Edge Devices 카테고리 특징:

  • 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능
  • Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적
  • Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능
  • 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)


Performance Analysis

파라미터 규모별 성능 트렌드

78B 모델의 지배적 위치 상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).

Qwen2.5-72B: 공식 오픈소스 모델의 기준 Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.

32B 모델의 경쟁력 부상 Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.

CO₂ Cost 분석

파라미터 규모 평균 CO₂ Cost Rank 10 대비 배수
78B (Calme 시리즈) ~46.60 kg ~5.9배
72B (Qwen2.5 기반) ~50.93 kg ~6.4배
32B ~28.75 kg 기준

32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.

벤치마크 지표별 강점

  • IFEval (지시 따르기): Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
  • MATH (수학): huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
  • GPQA (전문 지식): newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
  • MMLU-PRO (종합 지식): MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위


Architecture

모델 아키텍처 비교

Top 10 모델의 아키텍처 및 베이스 정보
Rank Model 베이스 아키텍처 Type Notes
1-4 Calme 시리즈 Llama 기반 추정 fine-tuned / chat MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터
5 Qwen2.5-72B-Instruct-abliterated Qwen2.5-72B-Instruct fine-tuned Abliterated 버전 — 안전 필터 제거로 성능 향상
6 Qwen2.5-72B-Instruct Qwen2.5-72B-Instruct chat Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처
7 calme-2.1-qwen2.5-72b Qwen2.5-72B chat Qwen2.5 기반 Calme 모델
8 Homer-v1.0-Qwen2.5-72B Qwen2.5-72B fine-tuned newsbang 가 개발한 Homer 시리즈
9 qwen2.5-test-32b-it Qwen2.5-32B chat Qwen2.5-32B 기반 지시 따르기 최적화 모델
10 Linkbricks-Horizon-AI-Avengers-V1-32B 추정됨 fine-tuned Saxo 가 개발한 32B 모델

아키텍처 트렌드

  • Qwen2.5 기반 모델의 확산: Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능
  • Calme 시리즈의 독자적 진화: 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델
  • 32B 모델의 실용성: 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합


Best Practices

모델 선택 가이드라인

성능 최우선 시 (78B/72B 모델 권장)

  • 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
  • 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
  • IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)

환경 비용 고려 시 (32B 모델 권장)

  • CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
  • Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
  • 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위

균형 잡힌 선택 (Qwen2.5-72B 권장)

  • 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
  • Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)

모델 선택 의사결정 트리

  1. 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
  2. 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
  3. 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
  4. 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated


Limitations

  • Leaderboard Archived: HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.
  • 벤치마크 한계: Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.
  • CO₂ Cost 변동성: CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.
  • 모델 타입 구분: fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.
  • 데이터 시점: 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.


References

HuggingFace Open LLM Leaderboard

LiveCodeBench (코딩 평가)

Top 10 모델 상세 링크

General 카테고리 (전체 능력)

Rank 1: MaziyarPanahi/calme-3.2-instruct-78b
Rank 2: MaziyarPanahi/calme-3.1-instruct-78b
Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1
Rank 4: MaziyarPanahi/calme-2.4-rys-78b
Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated
Rank 6: Qwen/Qwen2.5-72B-Instruct
Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b
Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B
Rank 9: ehristoforu/qwen2.5-test-32b-it
Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B

Coding 카테고리 (코딩 능력)

Rank 1: Codestral-Latest
Rank 2: LLaMA-3-70B-Instruct
Rank 3: Mixtral-8x22B-Instruct
Rank 4: DSCoder-33B-Instruct
Rank 5: OC-DS-33B
Rank 6: Phind-34B-V2
Rank 7: MagiCoderS-DS-6.7B
Rank 8: LLaMA-3-70B-Base
Rank 9: CodeQwen1.5-7B-Chat
Rank 10: DSCoder-6.7B-Instruct

Edge Devices 카테고리 (경량 모델)

벤치마크 지표 설명

  • IFEval (Instruction Following Evaluation) — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가
  • BBH (Big Bench Hard) — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가
  • MATH — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정
  • GPQA (Graduate-Level Google-Proof Q&A) — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도
  • MMLU-PRO — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가
  • Pass@1 (LiveCodeBench) — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율

관련 문서