Top 10 오픈소스 AI 모델 동향

From HPCWIKI
Revision as of 11:14, 31 July 2026 by Clara (talk | contribs) (Fix Key Concepts table structure, add HuggingFace Hub links to all model names, add benchmark header links)
Jump to navigation Jump to search

Top 10 오픈소스 AI 모델 동향

Template:Status

Template:TOC

Overview

HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.

Summary

  • 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서
  • 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공
  • 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시


조사 정보

Purpose

이 문서가 존재하는 이유

  • Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원
  • Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석
  • Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음


Key Concepts

개념 ! 설명 ! 관련 문서
파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함
Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄
IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정 | GitHub
BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가 | GitHub
MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정 | GitHub
GPQA (Graduate-Level Google-Proof Q&A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가 | GitHub
MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정
MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가 | GitHub
CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨
fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델
chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨
HuggingFace Open LLM Leaderboard | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 | HuggingFace

Top 10 Models

HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.

General (전체 능력)

HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)

이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.

Rank Model Type Average IFEval BBH MATH GPQA MUSR MMLU-PRO CO₂ Cost
1 MaziyarPanahi/calme-3.2-instruct-78b fine-tuned 52.08% 80.63% 62.61% 40.33% 20.36% 38.53% 70.03% 66.01 kg
2 MaziyarPanahi/calme-3.1-instruct-78b chat 51.29% 81.36% 62.41% 39.27% 19.46% 36.50% 68.72% 64.44 kg
3 dfurman/CalmeRys-78B-Orpo-v0.1 chat 51.23% 81.63% 61.92% 40.63% 20.02% 36.37% 66.80% 25.99 kg
4 MaziyarPanahi/calme-2.4-rys-78b chat 50.77% 80.11% 62.16% 40.71% 20.36% 34.57% 66.69% 25.95 kg
5 huihui-ai/Qwen2.5-72B-Instruct-abliterated fine-tuned 48.11% 85.93% 60.49% 60.12% 19.35% 12.34% 50.41% 76.77 kg
6 Qwen/Qwen2.5-72B-Instruct chat 47.98% 86.38% 61.87% 59.82% 16.67% 11.74% 51.40% 47.65 kg
7 MaziyarPanahi/calme-2.1-qwen2.5-72b chat 47.86% 86.62% 61.66% 59.14% 15.10% 13.30% 51.32% 29.50 kg
8 newsbang/Homer-v1.0-Qwen2.5-72B fine-tuned 47.46% 76.28% 62.27% 49.02% 22.15% 17.90% 57.17% 29.55 kg
9 ehristoforu/qwen2.5-test-32b-it chat 47.37% 78.89% 58.28% 59.74% 15.21% 19.13% 52.95% 29.54 kg
10 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B fine-tuned 47.34% 79.72% 57.63% 60.27% 14.99% 18.16% 53.25% 7.95 kg

General 카테고리 특징:

  • 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)
  • Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능
  • 32B 모델도 경쟁력 있음 (Rank 9, 10)
  • CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적

Coding (코딩 능력)

LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)

LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.

Rank Model Pass@1 Easy Medium Hard Source
1 Codestral-Latest 32.2% 69.0% 18.7% 0.9% Mistral AI
2 LLaMA-3-70B-Instruct 28.3% 60.7% 15.8% 1.4% Meta
3 Mixtral-8x22B-Instruct 26.4% 59.8% 12.7% 0.0% Mistral AI
4 DSCoder-33B-Instruct 23.6% 55.6% 9.0% 0.7% DeepSeek
5 OC-DS-33B 21.3% 53.9% 5.1% 0.0% OpenCoder
6 Phind-34B-V2 21.0% 53.4% 4.7% 0.1% Phind
7 MagiCoderS-DS-6.7B 20.5% 49.2% 7.5% 0.0% DeepSeek
8 LLaMA-3-70B-Base 20.1% 52.2% 3.2% 0.6% Meta
9 CodeQwen1.5-7B-Chat 19.3% 39.2% 13.1% 0.5% Alibaba (Qwen)
10 DSCoder-6.7B-Instruct 19.1% 46.4% 5.8% 0.7% DeepSeek

Coding 카테고리 특징:

  • Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능
  • LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수
  • CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화
  • Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)

Edge Devices (경량 모델)

HuggingFace Open LLM Leaderboard "For Edge Devices" 카테고리 기준 상위 10개 모델 (2026-07-31 기준)

Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.

Rank Model Type Average IFEval BBH MATH GPQA MMLU-PRO CO₂ Cost
1 PJMixers-Dev/Qwen2.5-RomboTiesTest-7B basemergesandmoerges 35.29% 75.58% 34.93% 49.62% 6.38% 36.50% 1.34 kg
2 brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial basemergesandmoerges 31.48% 56.77% 37.25% 34.97% 8.17% 38.95% 2.01 kg
3 DreadPoor/Here_We_Go_Again-8B-SLERP basemergesandmoerges 30.13% 74.42% 35.53% 17.30% 9.17% 31.92% 1.23 kg
4 microsoft/Phi-4-mini-instruct chat 29.41% 73.78% 38.74% 16.99% 7.94% 32.58% 0.83 kg
5 T145/ZEUS-8B-V15 chat 29.37% 70.13% 36.18% 23.04% 3.47% 33.99% 1.39 kg
6 DreadPoor/Asymmetric_Linearity-8B-Model_Stock basemergesandmoerges 29.35% 71.74% 35.44% 16.47% 8.61% 31.60% 1.28 kg
7 DreadPoor/VENN_1.2-8B-Model_Stock basemergesandmoerges 28.85% 72.26% 35.13% 17.07% 6.26% 30.23% 1.28 kg
8 PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B basemergesandmoerges 28.82% 78.25% 29.89% 20.02% 5.59% 30.75% 1.44 kg
9 DreadPoor/Elusive_Dragon_Heart-8B-LINEAR basemergesandmoerges 28.66% 71.31% 35.31% 14.80% 7.49% 31.27% 1.27 kg
10 ehristoforu/coolqwen-3b-it fine-tunedondomain-specificdatasets 28.65% 64.73% 27.46% 36.71% 4.36% 28.90% 1.45 kg

Edge Devices 카테고리 특징:

  • 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능
  • Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적
  • Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능
  • 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)


Performance Analysis

파라미터 규모별 성능 트렌드

78B 모델의 지배적 위치 상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).

Qwen2.5-72B: 공식 오픈소스 모델의 기준 Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.

32B 모델의 경쟁력 부상 Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.

CO₂ Cost 분석

파라미터 규모 평균 CO₂ Cost Rank 10 대비 배수
78B (Calme 시리즈) ~46.60 kg ~5.9배
72B (Qwen2.5 기반) ~50.93 kg ~6.4배
32B ~28.75 kg 기준

32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.

벤치마크 지표별 강점

  • IFEval (지시 따르기): Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고
  • MATH (수학): huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수
  • GPQA (전문 지식): newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고
  • MMLU-PRO (종합 지식): MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위


Architecture

모델 아키텍처 비교

Top 10 모델의 아키텍처 및 베이스 정보
Rank Model 베이스 아키텍처 Type Notes
1-4 Calme 시리즈 Llama 기반 추정 fine-tuned / chat MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터
5 Qwen2.5-72B-Instruct-abliterated Qwen2.5-72B-Instruct fine-tuned Abliterated 버전 — 안전 필터 제거로 성능 향상
6 Qwen2.5-72B-Instruct Qwen2.5-72B-Instruct chat Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처
7 calme-2.1-qwen2.5-72b Qwen2.5-72B chat Qwen2.5 기반 Calme 모델
8 Homer-v1.0-Qwen2.5-72B Qwen2.5-72B fine-tuned newsbang 가 개발한 Homer 시리즈
9 qwen2.5-test-32b-it Qwen2.5-32B chat Qwen2.5-32B 기반 지시 따르기 최적화 모델
10 Linkbricks-Horizon-AI-Avengers-V1-32B 추정됨 fine-tuned Saxo 가 개발한 32B 모델

아키텍처 트렌드

  • Qwen2.5 기반 모델의 확산: Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능
  • Calme 시리즈의 독자적 진화: 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델
  • 32B 모델의 실용성: 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합


Best Practices

모델 선택 가이드라인

성능 최우선 시 (78B/72B 모델 권장)

  • 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)
  • 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)
  • IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)

환경 비용 고려 시 (32B 모델 권장)

  • CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)
  • Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)
  • 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위

균형 잡힌 선택 (Qwen2.5-72B 권장)

  • 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)
  • Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)

모델 선택 의사결정 트리

  1. 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)
  2. 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct
  3. 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b
  4. 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated


Limitations

  • Leaderboard Archived: HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.
  • 벤치마크 한계: Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.
  • CO₂ Cost 변동성: CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.
  • 모델 타입 구분: fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.
  • 데이터 시점: 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.


References

HuggingFace Open LLM Leaderboard

LiveCodeBench (코딩 평가)

Top 10 모델 상세 링크

General 카테고리 (전체 능력)

Rank 1: MaziyarPanahi/calme-3.2-instruct-78b
Rank 2: MaziyarPanahi/calme-3.1-instruct-78b
Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1
Rank 4: MaziyarPanahi/calme-2.4-rys-78b
Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated
Rank 6: Qwen/Qwen2.5-72B-Instruct
Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b
Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B
Rank 9: ehristoforu/qwen2.5-test-32b-it
Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B

Coding 카테고리 (코딩 능력)

Rank 1: Codestral-Latest
Rank 2: LLaMA-3-70B-Instruct
Rank 3: Mixtral-8x22B-Instruct
Rank 4: DSCoder-33B-Instruct
Rank 5: OC-DS-33B
Rank 6: Phind-34B-V2
Rank 7: MagiCoderS-DS-6.7B
Rank 8: LLaMA-3-70B-Base
Rank 9: CodeQwen1.5-7B-Chat
Rank 10: DSCoder-6.7B-Instruct

Edge Devices 카테고리 (경량 모델)

벤치마크 지표 설명

관련 문서