<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="en">
	<id>http://wiki.hpcmate.com/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Clara</id>
	<title>HPCWIKI - User contributions [en]</title>
	<link rel="self" type="application/atom+xml" href="http://wiki.hpcmate.com/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Clara"/>
	<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php/Special:Contributions/Clara"/>
	<updated>2026-09-09T03:31:40Z</updated>
	<subtitle>User contributions</subtitle>
	<generator>MediaWiki 1.39.2</generator>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3594</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3594"/>
		<updated>2026-09-07T06:11:55Z</updated>

		<summary type="html">&lt;p&gt;Clara: 정기 재조사 2026-09-07: Open LLM Leaderboard(동결 2025-03-20)/LiveCodeBench(윈도우 2024-08~2025-05) 모델·점수 변동 없음 — 조사일시/다음 업데이트/last_update/데이터 신선도만 갱신&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-09-07&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 9월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
&lt;br /&gt;
* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록&lt;br /&gt;
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고&lt;br /&gt;
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-09-07 14:46 KST&lt;br /&gt;
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* 다음 업데이트 예정: 2026-09-14&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
&lt;br /&gt;
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)&lt;br /&gt;
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Concept ! Description ! Related&lt;br /&gt;
|-&lt;br /&gt;
| [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | 오픈소스 LLM 종합 성능 벤치마크 | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval), [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard), [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) | 코딩 능력 평가 벤치마크 | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
|-&lt;br /&gt;
| [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| [MMLU-PRO](https://github.com/hendrycks/test) | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [MATH](https://github.com/hendrycks/math) | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
|-&lt;br /&gt;
| [GPQA](https://github.com/idavidrein/gpqa) | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
|-&lt;br /&gt;
| [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) ! [MATH](https://github.com/hendrycks/math) Lvl 5 ! [GPQA](https://github.com/idavidrein/gpqa) ! [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0&lt;br /&gt;
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7&lt;br /&gt;
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8&lt;br /&gt;
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7&lt;br /&gt;
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4&lt;br /&gt;
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4&lt;br /&gt;
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3&lt;br /&gt;
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2&lt;br /&gt;
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9&lt;br /&gt;
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== General 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모&lt;br /&gt;
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)&lt;br /&gt;
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함&lt;br /&gt;
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Coding 카테고리: LiveCodeBench Pass@1 ==&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench Code Generation 리더보드 기준 Top 10 모델 (평가 기간 2024-08-01 ~ 2025-05-01 기준, 최신 릴리스 모델). Pass@1과 Easy, Medium, Hard 난이도별 점수 포함.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Easy-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Medium-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Hard-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://platform.openai.com/docs/api-reference/chat/create O4-Mini (High)] | 80.2 | 99.1 | 89.4 | 63.5&lt;br /&gt;
|-&lt;br /&gt;
| 2 | [https://platform.openai.com/docs/api-reference/chat/create O3 (High)] | 75.8 | 99.1 | 84.4 | 57.1&lt;br /&gt;
|-&lt;br /&gt;
| 3 | [https://platform.openai.com/docs/api-reference/chat/create O4-Mini (Medium)] | 74.2 | 98.2 | 86.5 | 52.7&lt;br /&gt;
|-&lt;br /&gt;
| 4 | [https://ai.google.dev/gemini-api/docs/models/gemini Gemini-2.5-Pro-06-05] | 73.6 | 99.1 | 87.2 | 50.2&lt;br /&gt;
|-&lt;br /&gt;
| 5 | [https://huggingface.co/deepseek-ai/DeepSeek-R1-0528 DeepSeek-R1-0528] | 73.1 | 98.7 | 85.2 | 50.7&lt;br /&gt;
|-&lt;br /&gt;
| 6 | [https://ai.google.dev/gemini-api/docs/models/gemini Gemini-2.5-Pro-05-06] | 71.8 | 98.2 | 82.3 | 50.2&lt;br /&gt;
|-&lt;br /&gt;
| 7 | [https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-32B EXAONE-4.0-32B] | 70.0 | 98.4 | 82.3 | 46.2&lt;br /&gt;
|-&lt;br /&gt;
| 8 | [https://huggingface.co/nvidia/OpenReasoning-Nemotron-32B OpenReasoning-Nemotron-32B] | 69.8 | 98.3 | 81.4 | 46.3&lt;br /&gt;
|-&lt;br /&gt;
| 9 | [https://platform.openai.com/docs/api-reference/chat/create O3-Mini-2025-01-31 (High)] | 67.4 | 99.1 | 84.4 | 38.4&lt;br /&gt;
|-&lt;br /&gt;
| 10 | [https://huggingface.co/nvidia/OpenCodeReasoning-Nemotron-1.1-32B OpenCodeReasoning-Nemotron-1.1-32B] | 66.8 | 97.9 | 79.6 | 41.1&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Coding 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **상용 추론 모델 주도**: Top 6이 OpenAI O4-Mini/O3 계열과 Google Gemini 2.5 Pro 등 상용 추론 모델&lt;br /&gt;
* **오픈소스 모델 부상**: DeepSeek-R1-0528(5위), EXAONE-4.0-32B(7위), Nemotron 계열(8위, 10위)이 Top 10에 진입&lt;br /&gt;
* **Pass@1 최고점**: O4-Mini (High)이 80.2로 종합 1위&lt;br /&gt;
* **경량 추론 모델 경쟁**: 32B급 오픈소스(EXAONE, Nemotron)가 66~70 Pass@1로 상용 모델과 격차 축소&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Edge Devices 카테고리: HuggingFace Edge Devices ==&lt;br /&gt;
&lt;br /&gt;
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5&lt;br /&gt;
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6&lt;br /&gt;
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0&lt;br /&gt;
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1&lt;br /&gt;
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4&lt;br /&gt;
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0&lt;br /&gt;
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1&lt;br /&gt;
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9&lt;br /&gt;
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5&lt;br /&gt;
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델&lt;br /&gt;
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터&lt;br /&gt;
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지&lt;br /&gt;
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Category ! Top Model ! Score ! Key Insight&lt;br /&gt;
|-&lt;br /&gt;
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능&lt;br /&gt;
|-&lt;br /&gt;
| Coding | O4-Mini (High) | 80.2 Pass@1 | 상용 추론 모델 1위, 오픈소스(DeepSeek/EXAONE/Nemotron) 부상&lt;br /&gt;
|-&lt;br /&gt;
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨&lt;br /&gt;
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재&lt;br /&gt;
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)&lt;br /&gt;
* **데이터 신선도**: 2026-09-07 재확인 — General/Coding/Edge 데이터 모두 동일 (Open LLM Leaderboard 동결: 2025-03-20, LiveCodeBench 윈도우 2024-08~2025-05)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
* [MATH GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
* [GPQA GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)&lt;br /&gt;
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)&lt;br /&gt;
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)&lt;br /&gt;
* [DeepSeek-R1-0528 Hub](https://huggingface.co/deepseek-ai/DeepSeek-R1-0528)&lt;br /&gt;
* [LGAI-EXAONE/EXAONE-4.0-32B Hub](https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-32B)&lt;br /&gt;
* [nvidia/OpenReasoning-Nemotron-32B Hub](https://huggingface.co/nvidia/OpenReasoning-Nemotron-32B)&lt;br /&gt;
* [nvidia/OpenCodeReasoning-Nemotron-1.1-32B Hub](https://huggingface.co/nvidia/OpenCodeReasoning-Nemotron-1.1-32B)&lt;br /&gt;
* [LiveCodeBench 공식 리더보드](https://livecodebench.github.io/leaderboard.html)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [LLM 벤치마크](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [Open Source Models](https://huggingface.co/models)&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3590</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3590"/>
		<updated>2026-08-31T00:46:22Z</updated>

		<summary type="html">&lt;p&gt;Clara: 정기 업데이트 (2026-08-31): 데이터 무변경 확인 (General/Edge/Coding 3개 카테고리 Top 10 1:1 매칭 확인) → 조사일시·last_update·다음 업데이트·신선도 날짜만 갱신&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-08-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
&lt;br /&gt;
* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록&lt;br /&gt;
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고&lt;br /&gt;
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-08-31 09:45 KST&lt;br /&gt;
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* 다음 업데이트 예정: 2026-09-07&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
&lt;br /&gt;
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)&lt;br /&gt;
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Concept ! Description ! Related&lt;br /&gt;
|-&lt;br /&gt;
| [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | 오픈소스 LLM 종합 성능 벤치마크 | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval), [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard), [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) | 코딩 능력 평가 벤치마크 | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
|-&lt;br /&gt;
| [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| [MMLU-PRO](https://github.com/hendrycks/test) | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [MATH](https://github.com/hendrycks/math) | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
|-&lt;br /&gt;
| [GPQA](https://github.com/idavidrein/gpqa) | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
|-&lt;br /&gt;
| [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) ! [MATH](https://github.com/hendrycks/math) Lvl 5 ! [GPQA](https://github.com/idavidrein/gpqa) ! [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0&lt;br /&gt;
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7&lt;br /&gt;
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8&lt;br /&gt;
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7&lt;br /&gt;
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4&lt;br /&gt;
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4&lt;br /&gt;
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3&lt;br /&gt;
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2&lt;br /&gt;
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9&lt;br /&gt;
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== General 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모&lt;br /&gt;
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)&lt;br /&gt;
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함&lt;br /&gt;
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Coding 카테고리: LiveCodeBench Pass@1 ==&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench Code Generation 리더보드 기준 Top 10 모델 (평가 기간 2024-08-01 ~ 2025-05-01 기준, 최신 릴리스 모델). Pass@1과 Easy, Medium, Hard 난이도별 점수 포함.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Easy-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Medium-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Hard-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://platform.openai.com/docs/api-reference/chat/create O4-Mini (High)] | 80.2 | 99.1 | 89.4 | 63.5&lt;br /&gt;
|-&lt;br /&gt;
| 2 | [https://platform.openai.com/docs/api-reference/chat/create O3 (High)] | 75.8 | 99.1 | 84.4 | 57.1&lt;br /&gt;
|-&lt;br /&gt;
| 3 | [https://platform.openai.com/docs/api-reference/chat/create O4-Mini (Medium)] | 74.2 | 98.2 | 86.5 | 52.7&lt;br /&gt;
|-&lt;br /&gt;
| 4 | [https://ai.google.dev/gemini-api/docs/models/gemini Gemini-2.5-Pro-06-05] | 73.6 | 99.1 | 87.2 | 50.2&lt;br /&gt;
|-&lt;br /&gt;
| 5 | [https://huggingface.co/deepseek-ai/DeepSeek-R1-0528 DeepSeek-R1-0528] | 73.1 | 98.7 | 85.2 | 50.7&lt;br /&gt;
|-&lt;br /&gt;
| 6 | [https://ai.google.dev/gemini-api/docs/models/gemini Gemini-2.5-Pro-05-06] | 71.8 | 98.2 | 82.3 | 50.2&lt;br /&gt;
|-&lt;br /&gt;
| 7 | [https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-32B EXAONE-4.0-32B] | 70.0 | 98.4 | 82.3 | 46.2&lt;br /&gt;
|-&lt;br /&gt;
| 8 | [https://huggingface.co/nvidia/OpenReasoning-Nemotron-32B OpenReasoning-Nemotron-32B] | 69.8 | 98.3 | 81.4 | 46.3&lt;br /&gt;
|-&lt;br /&gt;
| 9 | [https://platform.openai.com/docs/api-reference/chat/create O3-Mini-2025-01-31 (High)] | 67.4 | 99.1 | 84.4 | 38.4&lt;br /&gt;
|-&lt;br /&gt;
| 10 | [https://huggingface.co/nvidia/OpenCodeReasoning-Nemotron-1.1-32B OpenCodeReasoning-Nemotron-1.1-32B] | 66.8 | 97.9 | 79.6 | 41.1&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Coding 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **상용 추론 모델 주도**: Top 6이 OpenAI O4-Mini/O3 계열과 Google Gemini 2.5 Pro 등 상용 추론 모델&lt;br /&gt;
* **오픈소스 모델 부상**: DeepSeek-R1-0528(5위), EXAONE-4.0-32B(7위), Nemotron 계열(8위, 10위)이 Top 10에 진입&lt;br /&gt;
* **Pass@1 최고점**: O4-Mini (High)이 80.2로 종합 1위&lt;br /&gt;
* **경량 추론 모델 경쟁**: 32B급 오픈소스(EXAONE, Nemotron)가 66~70 Pass@1로 상용 모델과 격차 축소&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Edge Devices 카테고리: HuggingFace Edge Devices ==&lt;br /&gt;
&lt;br /&gt;
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5&lt;br /&gt;
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6&lt;br /&gt;
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0&lt;br /&gt;
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1&lt;br /&gt;
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4&lt;br /&gt;
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0&lt;br /&gt;
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1&lt;br /&gt;
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9&lt;br /&gt;
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5&lt;br /&gt;
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델&lt;br /&gt;
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터&lt;br /&gt;
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지&lt;br /&gt;
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Category ! Top Model ! Score ! Key Insight&lt;br /&gt;
|-&lt;br /&gt;
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능&lt;br /&gt;
|-&lt;br /&gt;
| Coding | O4-Mini (High) | 80.2 Pass@1 | 상용 추론 모델 1위, 오픈소스(DeepSeek/EXAONE/Nemotron) 부상&lt;br /&gt;
|-&lt;br /&gt;
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨&lt;br /&gt;
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재&lt;br /&gt;
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)&lt;br /&gt;
* **데이터 신선도**: 2026-08-31 재확인 — General/Edge Devices 데이터 동일, Coding(LiveCodeBench) 최신화&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
* [MATH GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
* [GPQA GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)&lt;br /&gt;
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)&lt;br /&gt;
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)&lt;br /&gt;
* [DeepSeek-R1-0528 Hub](https://huggingface.co/deepseek-ai/DeepSeek-R1-0528)&lt;br /&gt;
* [LGAI-EXAONE/EXAONE-4.0-32B Hub](https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-32B)&lt;br /&gt;
* [nvidia/OpenReasoning-Nemotron-32B Hub](https://huggingface.co/nvidia/OpenReasoning-Nemotron-32B)&lt;br /&gt;
* [nvidia/OpenCodeReasoning-Nemotron-1.1-32B Hub](https://huggingface.co/nvidia/OpenCodeReasoning-Nemotron-1.1-32B)&lt;br /&gt;
* [LiveCodeBench 공식 리더보드](https://livecodebench.github.io/leaderboard.html)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [LLM 벤치마크](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [Open Source Models](https://huggingface.co/models)&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3588</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3588"/>
		<updated>2026-08-28T09:35:08Z</updated>

		<summary type="html">&lt;p&gt;Clara: 주 1회 정기 업데이트 (2026-08-28): General/Edge Devices 동일, Coding(LiveCodeBench) 최신 Top 10 반영, 조사일시/last_update 갱신&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-08-28&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
&lt;br /&gt;
* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록&lt;br /&gt;
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고&lt;br /&gt;
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-08-28 17:47 KST&lt;br /&gt;
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* 다음 업데이트 예정: 2026-09-04&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
&lt;br /&gt;
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)&lt;br /&gt;
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Concept ! Description ! Related&lt;br /&gt;
|-&lt;br /&gt;
| [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | 오픈소스 LLM 종합 성능 벤치마크 | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval), [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard), [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) | 코딩 능력 평가 벤치마크 | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
|-&lt;br /&gt;
| [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| [MMLU-PRO](https://github.com/hendrycks/test) | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [MATH](https://github.com/hendrycks/math) | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
|-&lt;br /&gt;
| [GPQA](https://github.com/idavidrein/gpqa) | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
|-&lt;br /&gt;
| [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) ! [MATH](https://github.com/hendrycks/math) Lvl 5 ! [GPQA](https://github.com/idavidrein/gpqa) ! [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0&lt;br /&gt;
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7&lt;br /&gt;
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8&lt;br /&gt;
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7&lt;br /&gt;
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4&lt;br /&gt;
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4&lt;br /&gt;
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3&lt;br /&gt;
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2&lt;br /&gt;
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9&lt;br /&gt;
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== General 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모&lt;br /&gt;
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)&lt;br /&gt;
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함&lt;br /&gt;
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Coding 카테고리: LiveCodeBench Pass@1 ==&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench Code Generation 리더보드 기준 Top 10 모델 (평가 기간 2024-08-01 ~ 2025-05-01 기준, 최신 릴리스 모델). Pass@1과 Easy, Medium, Hard 난이도별 점수 포함.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Easy-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Medium-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Hard-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://platform.openai.com/docs/api-reference/chat/create O4-Mini (High)] | 80.2 | 99.1 | 89.4 | 63.5&lt;br /&gt;
|-&lt;br /&gt;
| 2 | [https://platform.openai.com/docs/api-reference/chat/create O3 (High)] | 75.8 | 99.1 | 84.4 | 57.1&lt;br /&gt;
|-&lt;br /&gt;
| 3 | [https://platform.openai.com/docs/api-reference/chat/create O4-Mini (Medium)] | 74.2 | 98.2 | 86.5 | 52.7&lt;br /&gt;
|-&lt;br /&gt;
| 4 | [https://ai.google.dev/gemini-api/docs/models/gemini Gemini-2.5-Pro-06-05] | 73.6 | 99.1 | 87.2 | 50.2&lt;br /&gt;
|-&lt;br /&gt;
| 5 | [https://huggingface.co/deepseek-ai/DeepSeek-R1-0528 DeepSeek-R1-0528] | 73.1 | 98.7 | 85.2 | 50.7&lt;br /&gt;
|-&lt;br /&gt;
| 6 | [https://ai.google.dev/gemini-api/docs/models/gemini Gemini-2.5-Pro-05-06] | 71.8 | 98.2 | 82.3 | 50.2&lt;br /&gt;
|-&lt;br /&gt;
| 7 | [https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-32B EXAONE-4.0-32B] | 70.0 | 98.4 | 82.3 | 46.2&lt;br /&gt;
|-&lt;br /&gt;
| 8 | [https://huggingface.co/nvidia/OpenReasoning-Nemotron-32B OpenReasoning-Nemotron-32B] | 69.8 | 98.3 | 81.4 | 46.3&lt;br /&gt;
|-&lt;br /&gt;
| 9 | [https://platform.openai.com/docs/api-reference/chat/create O3-Mini-2025-01-31 (High)] | 67.4 | 99.1 | 84.4 | 38.4&lt;br /&gt;
|-&lt;br /&gt;
| 10 | [https://huggingface.co/nvidia/OpenCodeReasoning-Nemotron-1.1-32B OpenCodeReasoning-Nemotron-1.1-32B] | 66.8 | 97.9 | 79.6 | 41.1&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Coding 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **상용 추론 모델 주도**: Top 6이 OpenAI O4-Mini/O3 계열과 Google Gemini 2.5 Pro 등 상용 추론 모델&lt;br /&gt;
* **오픈소스 모델 부상**: DeepSeek-R1-0528(5위), EXAONE-4.0-32B(7위), Nemotron 계열(8위, 10위)이 Top 10에 진입&lt;br /&gt;
* **Pass@1 최고점**: O4-Mini (High)이 80.2로 종합 1위&lt;br /&gt;
* **경량 추론 모델 경쟁**: 32B급 오픈소스(EXAONE, Nemotron)가 66~70 Pass@1로 상용 모델과 격차 축소&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Edge Devices 카테고리: HuggingFace Edge Devices ==&lt;br /&gt;
&lt;br /&gt;
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5&lt;br /&gt;
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6&lt;br /&gt;
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0&lt;br /&gt;
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1&lt;br /&gt;
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4&lt;br /&gt;
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0&lt;br /&gt;
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1&lt;br /&gt;
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9&lt;br /&gt;
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5&lt;br /&gt;
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델&lt;br /&gt;
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터&lt;br /&gt;
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지&lt;br /&gt;
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Category ! Top Model ! Score ! Key Insight&lt;br /&gt;
|-&lt;br /&gt;
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능&lt;br /&gt;
|-&lt;br /&gt;
| Coding | O4-Mini (High) | 80.2 Pass@1 | 상용 추론 모델 1위, 오픈소스(DeepSeek/EXAONE/Nemotron) 부상&lt;br /&gt;
|-&lt;br /&gt;
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨&lt;br /&gt;
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재&lt;br /&gt;
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)&lt;br /&gt;
* **데이터 신선도**: 2026-08-28 재확인 — General/Edge Devices 데이터 동일, Coding(LiveCodeBench) 최신화&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
* [MATH GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
* [GPQA GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)&lt;br /&gt;
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)&lt;br /&gt;
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)&lt;br /&gt;
* [DeepSeek-R1-0528 Hub](https://huggingface.co/deepseek-ai/DeepSeek-R1-0528)&lt;br /&gt;
* [LGAI-EXAONE/EXAONE-4.0-32B Hub](https://huggingface.co/LGAI-EXAONE/EXAONE-4.0-32B)&lt;br /&gt;
* [nvidia/OpenReasoning-Nemotron-32B Hub](https://huggingface.co/nvidia/OpenReasoning-Nemotron-32B)&lt;br /&gt;
* [nvidia/OpenCodeReasoning-Nemotron-1.1-32B Hub](https://huggingface.co/nvidia/OpenCodeReasoning-Nemotron-1.1-32B)&lt;br /&gt;
* [LiveCodeBench 공식 리더보드](https://livecodebench.github.io/leaderboard.html)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [LLM 벤치마크](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [Open Source Models](https://huggingface.co/models)&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Test_auth&amp;diff=3565</id>
		<title>Test auth</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Test_auth&amp;diff=3565"/>
		<updated>2026-08-25T03:53:43Z</updated>

		<summary type="html">&lt;p&gt;Clara: clean up auth test page&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#REDIRECT [[대문]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Test_auth&amp;diff=3564</id>
		<title>Test auth</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Test_auth&amp;diff=3564"/>
		<updated>2026-08-25T03:45:19Z</updated>

		<summary type="html">&lt;p&gt;Clara: Created page with &amp;quot;auth test&amp;quot;&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;auth [[test]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3563</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3563"/>
		<updated>2026-08-24T00:06:49Z</updated>

		<summary type="html">&lt;p&gt;Clara: 정기 업데이트 (2026-08-24): 조사일시/last_update/다음업데이트일 갱신. OLL/LBC 소스 데이터 변동 없음 (동결 확인).&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-08-24&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
&lt;br /&gt;
* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록&lt;br /&gt;
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고&lt;br /&gt;
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-08-24 09:03 KST&lt;br /&gt;
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* 다음 업데이트 예정: 2026-08-31&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
&lt;br /&gt;
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)&lt;br /&gt;
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Concept ! Description ! Related&lt;br /&gt;
|-&lt;br /&gt;
| [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | 오픈소스 LLM 종합 성능 벤치마크 | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval), [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard), [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) | 코딩 능력 평가 벤치마크 | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
|-&lt;br /&gt;
| [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| [MMLU-PRO](https://github.com/hendrycks/test) | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [MATH](https://github.com/hendrycks/math) | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
|-&lt;br /&gt;
| [GPQA](https://github.com/idavidrein/gpqa) | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
|-&lt;br /&gt;
| [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) ! [MATH](https://github.com/hendrycks/math) Lvl 5 ! [GPQA](https://github.com/idavidrein/gpqa) ! [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0&lt;br /&gt;
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7&lt;br /&gt;
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8&lt;br /&gt;
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7&lt;br /&gt;
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4&lt;br /&gt;
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4&lt;br /&gt;
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3&lt;br /&gt;
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2&lt;br /&gt;
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9&lt;br /&gt;
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== General 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모&lt;br /&gt;
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)&lt;br /&gt;
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함&lt;br /&gt;
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Coding 카테고리: LiveCodeBench Pass@1 ==&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench Code Generation 카테고리 Pass@1 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Easy-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Medium-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Hard-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | GPT-4O-2024-05-13 | 45.6 | 88.3 | 33.2 | 4.2&lt;br /&gt;
|-&lt;br /&gt;
| 2 | GPT-4-Turbo-2024-04-09 | 44.7 | 85.3 | 33.0 | 5.1&lt;br /&gt;
|-&lt;br /&gt;
| 3 | GPT-4-Turbo-1106 | 39.7 | 84.4 | 24.0 | 0.5&lt;br /&gt;
|-&lt;br /&gt;
| 4 | GPT-4-0613 | 36.9 | 78.4 | 21.2 | 2.3&lt;br /&gt;
|-&lt;br /&gt;
| 5 | Gemini-Pro-1.5-May | 35.7 | 76.0 | 19.4 | 3.5&lt;br /&gt;
|-&lt;br /&gt;
| 6 | Claude-3-Opus | 35.4 | 78.8 | 16.3 | 3.2&lt;br /&gt;
|-&lt;br /&gt;
| 7 | Codestral-Latest | 32.2 | 69.0 | 18.7 | 0.9&lt;br /&gt;
|-&lt;br /&gt;
| 8 | Gemini-Flash-1.5-May | 30.0 | 68.1 | 12.6 | 2.7&lt;br /&gt;
|-&lt;br /&gt;
| 9 | LLama3-70b-Ins | 28.3 | 60.7 | 15.8 | 1.4&lt;br /&gt;
|-&lt;br /&gt;
| 10 | Claude-3-Sonnet | 26.9 | 67.6 | 6.3 | 1.1&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Coding 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **상용 모델 독점**: Top 10 모두 상용 모델 (GPT, Gemini, Claude)&lt;br /&gt;
* **GPT-4 계열 강세**: Top 4 중 3개 차지&lt;br /&gt;
* **오픈소스 모델 부재**: Top 10에 오픈소스 모델 없음&lt;br /&gt;
* **LLama3-70b**: 70b 파라미터로 9위 기록 (28.3 Pass@1)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Edge Devices 카테고리: HuggingFace Edge Devices ==&lt;br /&gt;
&lt;br /&gt;
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5&lt;br /&gt;
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6&lt;br /&gt;
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0&lt;br /&gt;
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1&lt;br /&gt;
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4&lt;br /&gt;
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0&lt;br /&gt;
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1&lt;br /&gt;
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9&lt;br /&gt;
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5&lt;br /&gt;
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델&lt;br /&gt;
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터&lt;br /&gt;
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지&lt;br /&gt;
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Category ! Top Model ! Score ! Key Insight&lt;br /&gt;
|-&lt;br /&gt;
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능&lt;br /&gt;
|-&lt;br /&gt;
| Coding | GPT-4O-2024-05-13 | 45.6 Pass@1 | 상용 모델 독점&lt;br /&gt;
|-&lt;br /&gt;
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨&lt;br /&gt;
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재&lt;br /&gt;
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)&lt;br /&gt;
* **데이터 신선도**: 2026-08-24 재확인 — 소스 리더보드(OLL/LBC) 데이터 변동 없음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
* [MATH GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
* [GPQA GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)&lt;br /&gt;
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)&lt;br /&gt;
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [LLM 벤치마크](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [Open Source Models](https://huggingface.co/models)&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3562</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3562"/>
		<updated>2026-08-21T07:46:03Z</updated>

		<summary type="html">&lt;p&gt;Clara: 주간 업데이트 (2026-08-21): 조사일시/last_update/다음업데이트일 갱신, --- 구분자 제거, 내부링크..→외부 공식 페이지 전환, 벤치마크 헤더 외부링크화. OLL/LBC 소스 데이터 변동 없음 (Top10 유지)&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-08-21&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
&lt;br /&gt;
* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록&lt;br /&gt;
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고&lt;br /&gt;
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-08-21 14:49 KST&lt;br /&gt;
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* 다음 업데이트 예정: 2026-08-28&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
&lt;br /&gt;
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)&lt;br /&gt;
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Concept ! Description ! Related&lt;br /&gt;
|-&lt;br /&gt;
| [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | 오픈소스 LLM 종합 성능 벤치마크 | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval), [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard), [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) | 코딩 능력 평가 벤치마크 | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
|-&lt;br /&gt;
| [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| [MMLU-PRO](https://github.com/hendrycks/test) | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [MATH](https://github.com/hendrycks/math) | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
|-&lt;br /&gt;
| [GPQA](https://github.com/idavidrein/gpqa) | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
|-&lt;br /&gt;
| [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) ! [MATH](https://github.com/hendrycks/math) Lvl 5 ! [GPQA](https://github.com/idavidrein/gpqa) ! [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0&lt;br /&gt;
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7&lt;br /&gt;
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8&lt;br /&gt;
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7&lt;br /&gt;
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4&lt;br /&gt;
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4&lt;br /&gt;
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3&lt;br /&gt;
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2&lt;br /&gt;
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9&lt;br /&gt;
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== General 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모&lt;br /&gt;
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)&lt;br /&gt;
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함&lt;br /&gt;
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Coding 카테고리: LiveCodeBench Pass@1 ==&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench Code Generation 카테고리 Pass@1 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Easy-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Medium-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Hard-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | GPT-4O-2024-05-13 | 45.6 | 88.3 | 33.2 | 4.2&lt;br /&gt;
|-&lt;br /&gt;
| 2 | GPT-4-Turbo-2024-04-09 | 44.7 | 85.3 | 33.0 | 5.1&lt;br /&gt;
|-&lt;br /&gt;
| 3 | GPT-4-Turbo-1106 | 39.7 | 84.4 | 24.0 | 0.5&lt;br /&gt;
|-&lt;br /&gt;
| 4 | GPT-4-0613 | 36.9 | 78.4 | 21.2 | 2.3&lt;br /&gt;
|-&lt;br /&gt;
| 5 | Gemini-Pro-1.5-May | 35.7 | 76.0 | 19.4 | 3.5&lt;br /&gt;
|-&lt;br /&gt;
| 6 | Claude-3-Opus | 35.4 | 78.8 | 16.3 | 3.2&lt;br /&gt;
|-&lt;br /&gt;
| 7 | Codestral-Latest | 32.2 | 69.0 | 18.7 | 0.9&lt;br /&gt;
|-&lt;br /&gt;
| 8 | Gemini-Flash-1.5-May | 30.0 | 68.1 | 12.6 | 2.7&lt;br /&gt;
|-&lt;br /&gt;
| 9 | LLama3-70b-Ins | 28.3 | 60.7 | 15.8 | 1.4&lt;br /&gt;
|-&lt;br /&gt;
| 10 | Claude-3-Sonnet | 26.9 | 67.6 | 6.3 | 1.1&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Coding 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **상용 모델 독점**: Top 10 모두 상용 모델 (GPT, Gemini, Claude)&lt;br /&gt;
* **GPT-4 계열 강세**: Top 4 중 3개 차지&lt;br /&gt;
* **오픈소스 모델 부재**: Top 10에 오픈소스 모델 없음&lt;br /&gt;
* **LLama3-70b**: 70b 파라미터로 9위 기록 (28.3 Pass@1)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Edge Devices 카테고리: HuggingFace Edge Devices ==&lt;br /&gt;
&lt;br /&gt;
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5&lt;br /&gt;
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6&lt;br /&gt;
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0&lt;br /&gt;
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1&lt;br /&gt;
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4&lt;br /&gt;
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0&lt;br /&gt;
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1&lt;br /&gt;
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9&lt;br /&gt;
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5&lt;br /&gt;
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델&lt;br /&gt;
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터&lt;br /&gt;
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지&lt;br /&gt;
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Category ! Top Model ! Score ! Key Insight&lt;br /&gt;
|-&lt;br /&gt;
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능&lt;br /&gt;
|-&lt;br /&gt;
| Coding | GPT-4O-2024-05-13 | 45.6 Pass@1 | 상용 모델 독점&lt;br /&gt;
|-&lt;br /&gt;
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨&lt;br /&gt;
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재&lt;br /&gt;
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)&lt;br /&gt;
* **데이터 신선도**: 2026-08-21 재확인 — 소스 리더보드(OLL/LBC) 데이터 변동 없음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
* [MATH GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
* [GPQA GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)&lt;br /&gt;
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)&lt;br /&gt;
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [LLM 벤치마크](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [Open Source Models](https://huggingface.co/models)&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3561</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3561"/>
		<updated>2026-08-21T06:54:14Z</updated>

		<summary type="html">&lt;p&gt;Clara: 주간 업데이트 (2026-08-21): 조사일시/last_update/다음업데이트일 갱신, --- 구분자 제거, 내부링크..→외부 공식 페이지 전환, 벤치마크 헤더 외부링크화. OLL/LBC 소스 데이터 변동 없음 (Top10 유지)&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-08-21&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
&lt;br /&gt;
* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록&lt;br /&gt;
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고&lt;br /&gt;
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-08-21 14:49 KST&lt;br /&gt;
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* 다음 업데이트 예정: 2026-08-28&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
&lt;br /&gt;
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)&lt;br /&gt;
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Concept ! Description ! Related&lt;br /&gt;
|-&lt;br /&gt;
| [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard) | 오픈소스 LLM 종합 성능 벤치마크 | [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval), [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard), [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard) | 코딩 능력 평가 벤치마크 | [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
|-&lt;br /&gt;
| [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| [MMLU-PRO](https://github.com/hendrycks/test) | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [MATH](https://github.com/hendrycks/math) | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
|-&lt;br /&gt;
| [GPQA](https://github.com/idavidrein/gpqa) | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
|-&lt;br /&gt;
| [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard) ! [MATH](https://github.com/hendrycks/math) Lvl 5 ! [GPQA](https://github.com/idavidrein/gpqa) ! [MMLU-PRO](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0&lt;br /&gt;
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7&lt;br /&gt;
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8&lt;br /&gt;
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7&lt;br /&gt;
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4&lt;br /&gt;
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4&lt;br /&gt;
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3&lt;br /&gt;
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2&lt;br /&gt;
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9&lt;br /&gt;
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== General 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모&lt;br /&gt;
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)&lt;br /&gt;
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함&lt;br /&gt;
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Coding 카테고리: LiveCodeBench Pass@1 ==&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench Code Generation 카테고리 Pass@1 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! [Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Easy-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Medium-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench) ! [Hard-Pass@1](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | GPT-4O-2024-05-13 | 45.6 | 88.3 | 33.2 | 4.2&lt;br /&gt;
|-&lt;br /&gt;
| 2 | GPT-4-Turbo-2024-04-09 | 44.7 | 85.3 | 33.0 | 5.1&lt;br /&gt;
|-&lt;br /&gt;
| 3 | GPT-4-Turbo-1106 | 39.7 | 84.4 | 24.0 | 0.5&lt;br /&gt;
|-&lt;br /&gt;
| 4 | GPT-4-0613 | 36.9 | 78.4 | 21.2 | 2.3&lt;br /&gt;
|-&lt;br /&gt;
| 5 | Gemini-Pro-1.5-May | 35.7 | 76.0 | 19.4 | 3.5&lt;br /&gt;
|-&lt;br /&gt;
| 6 | Claude-3-Opus | 35.4 | 78.8 | 16.3 | 3.2&lt;br /&gt;
|-&lt;br /&gt;
| 7 | Codestral-Latest | 32.2 | 69.0 | 18.7 | 0.9&lt;br /&gt;
|-&lt;br /&gt;
| 8 | Gemini-Flash-1.5-May | 30.0 | 68.1 | 12.6 | 2.7&lt;br /&gt;
|-&lt;br /&gt;
| 9 | LLama3-70b-Ins | 28.3 | 60.7 | 15.8 | 1.4&lt;br /&gt;
|-&lt;br /&gt;
| 10 | Claude-3-Sonnet | 26.9 | 67.6 | 6.3 | 1.1&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Coding 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **상용 모델 독점**: Top 10 모두 상용 모델 (GPT, Gemini, Claude)&lt;br /&gt;
* **GPT-4 계열 강세**: Top 4 중 3개 차지&lt;br /&gt;
* **오픈소스 모델 부재**: Top 10에 오픈소스 모델 없음&lt;br /&gt;
* **LLama3-70b**: 70b 파라미터로 9위 기록 (28.3 Pass@1)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Edge Devices 카테고리: HuggingFace Edge Devices ==&lt;br /&gt;
&lt;br /&gt;
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! [IFEval](https://github.com/google-research/google-research/tree/master/instruction_following_eval) ! [BBH](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5&lt;br /&gt;
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6&lt;br /&gt;
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0&lt;br /&gt;
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1&lt;br /&gt;
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4&lt;br /&gt;
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0&lt;br /&gt;
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1&lt;br /&gt;
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9&lt;br /&gt;
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5&lt;br /&gt;
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델&lt;br /&gt;
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터&lt;br /&gt;
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지&lt;br /&gt;
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Category ! Top Model ! Score ! Key Insight&lt;br /&gt;
|-&lt;br /&gt;
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능&lt;br /&gt;
|-&lt;br /&gt;
| Coding | GPT-4O-2024-05-13 | 45.6 Pass@1 | 상용 모델 독점&lt;br /&gt;
|-&lt;br /&gt;
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨&lt;br /&gt;
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재&lt;br /&gt;
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)&lt;br /&gt;
* **데이터 신선도**: 2026-08-21 재확인 — 소스 리더보드(OLL/LBC) 데이터 변동 없음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
* [MATH GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
* [GPQA GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)&lt;br /&gt;
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)&lt;br /&gt;
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [LLM [[Benchmark]]](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [Open Source Models](https://huggingface.co/models)&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3559</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3559"/>
		<updated>2026-08-17T00:20:42Z</updated>

		<summary type="html">&lt;p&gt;Clara: 정기 업데이트: 조사일시 및 last_update 갱신 (2026-08-17)&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-08-17&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
&lt;br /&gt;
* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록&lt;br /&gt;
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고&lt;br /&gt;
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-08-17 10:00 KST&lt;br /&gt;
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* 다음 업데이트 예정: 2026-08-24&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
&lt;br /&gt;
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)&lt;br /&gt;
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Concept ! Description ! Related&lt;br /&gt;
|-&lt;br /&gt;
| [[HuggingFace Open LLM Leaderboard]] | 오픈소스 LLM 종합 성능 벤치마크 | [[IFEval]], [[BBH]], [[MMLU-PRO]]&lt;br /&gt;
|-&lt;br /&gt;
| [[LiveCodeBench]] | 코딩 능력 평가 벤치마크 | [[Pass@1]]&lt;br /&gt;
|-&lt;br /&gt;
| [[IFEval]] | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
|-&lt;br /&gt;
| [[BBH]] | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| [[MMLU-PRO]] | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [[MATH]] | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
|-&lt;br /&gt;
| [[GPQA]] | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
|-&lt;br /&gt;
| [[Pass@1]] | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH ! MATH Lvl 5 ! GPQA ! MMLU-PRO&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0&lt;br /&gt;
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7&lt;br /&gt;
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8&lt;br /&gt;
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7&lt;br /&gt;
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4&lt;br /&gt;
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4&lt;br /&gt;
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3&lt;br /&gt;
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2&lt;br /&gt;
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9&lt;br /&gt;
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== General 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모&lt;br /&gt;
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)&lt;br /&gt;
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함&lt;br /&gt;
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Coding 카테고리: LiveCodeBench Pass@1 ==&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench Code Generation 카테고리 Pass@1 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Pass@1 ! Easy-Pass@1 ! Medium-Pass@1 ! Hard-Pass@1&lt;br /&gt;
|-&lt;br /&gt;
| 1 | GPT-4O-2024-05-13 | 45.6 | 88.3 | 33.2 | 4.2&lt;br /&gt;
|-&lt;br /&gt;
| 2 | GPT-4-Turbo-2024-04-09 | 44.7 | 85.3 | 33.0 | 5.1&lt;br /&gt;
|-&lt;br /&gt;
| 3 | GPT-4-Turbo-1106 | 39.7 | 84.4 | 24.0 | 0.5&lt;br /&gt;
|-&lt;br /&gt;
| 4 | GPT-4-0613 | 36.9 | 78.4 | 21.2 | 2.3&lt;br /&gt;
|-&lt;br /&gt;
| 5 | Gemini-Pro-1.5-May | 35.7 | 76.0 | 19.4 | 3.5&lt;br /&gt;
|-&lt;br /&gt;
| 6 | Claude-3-Opus | 35.4 | 78.8 | 16.3 | 3.2&lt;br /&gt;
|-&lt;br /&gt;
| 7 | Codestral-Latest | 32.2 | 69.0 | 18.7 | 0.9&lt;br /&gt;
|-&lt;br /&gt;
| 8 | Gemini-Flash-1.5-May | 30.0 | 68.1 | 12.6 | 2.7&lt;br /&gt;
|-&lt;br /&gt;
| 9 | LLama3-70b-Ins | 28.3 | 60.7 | 15.8 | 1.4&lt;br /&gt;
|-&lt;br /&gt;
| 10 | Claude-3-Sonnet | 26.9 | 67.6 | 6.3 | 1.1&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Coding 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **상용 모델 독점**: Top 10 모두 상용 모델 (GPT, Gemini, Claude)&lt;br /&gt;
* **GPT-4 계열 강세**: Top 4 중 3개 차지&lt;br /&gt;
* **오픈소스 모델 부재**: Top 10에 오픈소스 모델 없음&lt;br /&gt;
* **LLama3-70b**: 70b 파라미터로 9위 기록 (28.3 Pass@1)&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Edge Devices 카테고리: HuggingFace Edge Devices ==&lt;br /&gt;
&lt;br /&gt;
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5&lt;br /&gt;
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6&lt;br /&gt;
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0&lt;br /&gt;
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1&lt;br /&gt;
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4&lt;br /&gt;
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0&lt;br /&gt;
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1&lt;br /&gt;
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9&lt;br /&gt;
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5&lt;br /&gt;
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델&lt;br /&gt;
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터&lt;br /&gt;
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지&lt;br /&gt;
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Category ! Top Model ! Score ! Key Insight&lt;br /&gt;
|-&lt;br /&gt;
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능&lt;br /&gt;
|-&lt;br /&gt;
| Coding | GPT-4O-2024-05-13 | 45.6 Pass@1 | 상용 모델 독점&lt;br /&gt;
|-&lt;br /&gt;
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨&lt;br /&gt;
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재&lt;br /&gt;
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)&lt;br /&gt;
* **데이터 신선도**: 2026-08-07 기준, 주기적 업데이트 필요&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
* [MATH GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
* [GPQA GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)&lt;br /&gt;
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)&lt;br /&gt;
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
&lt;br /&gt;
* [[HuggingFace Open LLM Leaderboard]]&lt;br /&gt;
* [[LiveCodeBench]]&lt;br /&gt;
* [[LLM Benchmark]]&lt;br /&gt;
* [[Open Source Models]]&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3558</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3558"/>
		<updated>2026-08-10T00:07:23Z</updated>

		<summary type="html">&lt;p&gt;Clara: Top 10 오픈소스 AI 모델 동향: 조사일시 업데이트 (2026-08-07 → 2026-08-10)&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-08-10&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
&lt;br /&gt;
* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록&lt;br /&gt;
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고&lt;br /&gt;
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-08-10 10:00 KST&lt;br /&gt;
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* 다음 업데이트 예정: 2026-08-17&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
&lt;br /&gt;
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)&lt;br /&gt;
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Concept ! Description ! Related&lt;br /&gt;
|-&lt;br /&gt;
| [[HuggingFace Open LLM Leaderboard]] | 오픈소스 LLM 종합 성능 벤치마크 | [[IFEval]], [[BBH]], [[MMLU-PRO]]&lt;br /&gt;
|-&lt;br /&gt;
| [[LiveCodeBench]] | 코딩 능력 평가 벤치마크 | [[Pass@1]]&lt;br /&gt;
|-&lt;br /&gt;
| [[IFEval]] | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
|-&lt;br /&gt;
| [[BBH]] | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| [[MMLU-PRO]] | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [[MATH]] | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
|-&lt;br /&gt;
| [[GPQA]] | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
|-&lt;br /&gt;
| [[Pass@1]] | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH ! MATH Lvl 5 ! GPQA ! MMLU-PRO&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0&lt;br /&gt;
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7&lt;br /&gt;
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8&lt;br /&gt;
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7&lt;br /&gt;
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4&lt;br /&gt;
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4&lt;br /&gt;
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3&lt;br /&gt;
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2&lt;br /&gt;
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9&lt;br /&gt;
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== General 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모&lt;br /&gt;
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)&lt;br /&gt;
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함&lt;br /&gt;
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Coding 카테고리: LiveCodeBench Pass@1 ==&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench Code Generation 카테고리 Pass@1 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Pass@1 ! Easy-Pass@1 ! Medium-Pass@1 ! Hard-Pass@1&lt;br /&gt;
|-&lt;br /&gt;
| 1 | GPT-4O-2024-05-13 | 45.6 | 88.3 | 33.2 | 4.2&lt;br /&gt;
|-&lt;br /&gt;
| 2 | GPT-4-Turbo-2024-04-09 | 44.7 | 85.3 | 33.0 | 5.1&lt;br /&gt;
|-&lt;br /&gt;
| 3 | GPT-4-Turbo-1106 | 39.7 | 84.4 | 24.0 | 0.5&lt;br /&gt;
|-&lt;br /&gt;
| 4 | GPT-4-0613 | 36.9 | 78.4 | 21.2 | 2.3&lt;br /&gt;
|-&lt;br /&gt;
| 5 | Gemini-Pro-1.5-May | 35.7 | 76.0 | 19.4 | 3.5&lt;br /&gt;
|-&lt;br /&gt;
| 6 | Claude-3-Opus | 35.4 | 78.8 | 16.3 | 3.2&lt;br /&gt;
|-&lt;br /&gt;
| 7 | Codestral-Latest | 32.2 | 69.0 | 18.7 | 0.9&lt;br /&gt;
|-&lt;br /&gt;
| 8 | Gemini-Flash-1.5-May | 30.0 | 68.1 | 12.6 | 2.7&lt;br /&gt;
|-&lt;br /&gt;
| 9 | LLama3-70b-Ins | 28.3 | 60.7 | 15.8 | 1.4&lt;br /&gt;
|-&lt;br /&gt;
| 10 | Claude-3-Sonnet | 26.9 | 67.6 | 6.3 | 1.1&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Coding 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **상용 모델 독점**: Top 10 모두 상용 모델 (GPT, Gemini, Claude)&lt;br /&gt;
* **GPT-4 계열 강세**: Top 4 중 3개 차지&lt;br /&gt;
* **오픈소스 모델 부재**: Top 10에 오픈소스 모델 없음&lt;br /&gt;
* **LLama3-70b**: 70b 파라미터로 9위 기록 (28.3 Pass@1)&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Edge Devices 카테고리: HuggingFace Edge Devices ==&lt;br /&gt;
&lt;br /&gt;
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5&lt;br /&gt;
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6&lt;br /&gt;
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0&lt;br /&gt;
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1&lt;br /&gt;
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4&lt;br /&gt;
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0&lt;br /&gt;
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1&lt;br /&gt;
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9&lt;br /&gt;
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5&lt;br /&gt;
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델&lt;br /&gt;
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터&lt;br /&gt;
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지&lt;br /&gt;
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Category ! Top Model ! Score ! Key Insight&lt;br /&gt;
|-&lt;br /&gt;
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능&lt;br /&gt;
|-&lt;br /&gt;
| Coding | GPT-4O-2024-05-13 | 45.6 Pass@1 | 상용 모델 독점&lt;br /&gt;
|-&lt;br /&gt;
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨&lt;br /&gt;
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재&lt;br /&gt;
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)&lt;br /&gt;
* **데이터 신선도**: 2026-08-07 기준, 주기적 업데이트 필요&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
* [MATH GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
* [GPQA GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)&lt;br /&gt;
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)&lt;br /&gt;
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
&lt;br /&gt;
* [[HuggingFace Open LLM Leaderboard]]&lt;br /&gt;
* [[LiveCodeBench]]&lt;br /&gt;
* [[LLM Benchmark]]&lt;br /&gt;
* [[Open Source Models]]&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3557</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3557"/>
		<updated>2026-08-07T03:21:31Z</updated>

		<summary type="html">&lt;p&gt;Clara: Weekly update: Top 10 models refreshed (2026-08-07)&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-08-07&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준의 2026년 8월 기준 Top 10 오픈소스 AI 모델 현황. General, Coding, Edge Devices 세 가지 카테고리로 분류하여 최신 벤치마크 성능을 비교 분석.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
&lt;br /&gt;
* 무엇인가? HuggingFace Open LLM Leaderboard와 LiveCodeBench의 최신 Top 10 모델 목록&lt;br /&gt;
* 왜 필요한가? 오픈소스 LLM의 최신 성능 트렌드 파악 및 모델 선택 참고&lt;br /&gt;
* 언제 사용하는가? 모델 평가, 벤치마킹, 기술 리서치 시 참고&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-08-07 10:00 KST&lt;br /&gt;
* 데이터 출처: [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard), [LiveCodeBench](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* 다음 업데이트 예정: 2026-08-14&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
&lt;br /&gt;
* Goal: 오픈소스 LLM의 최신 성능 트렌드를 카테고리별로 정리&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard (General, Edge Devices), LiveCodeBench (Coding)&lt;br /&gt;
* Non-goals: 상용 모델 비교, 자체 벤치마크 수행&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Concept ! Description ! Related&lt;br /&gt;
|-&lt;br /&gt;
| [[HuggingFace Open LLM Leaderboard]] | 오픈소스 LLM 종합 성능 벤치마크 | [[IFEval]], [[BBH]], [[MMLU-PRO]]&lt;br /&gt;
|-&lt;br /&gt;
| [[LiveCodeBench]] | 코딩 능력 평가 벤치마크 | [[Pass@1]]&lt;br /&gt;
|-&lt;br /&gt;
| [[IFEval]] | 지시 따르기 평가 | [GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
|-&lt;br /&gt;
| [[BBH]] | BIG-Bench Hard 벤치마크 | [GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
|-&lt;br /&gt;
| [[MMLU-PRO]] | 다중 선택 지식 평가 | [GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
|-&lt;br /&gt;
| [[MATH]] | 수학 문제 해결 평가 | [GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
|-&lt;br /&gt;
| [[GPQA]] | 과학 문제 평가 | [GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
|-&lt;br /&gt;
| [[Pass@1]] | 코딩 정답률 지표 | [GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== General 카테고리: HuggingFace Open LLM Leaderboard Overall Average ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH ! MATH Lvl 5 ! GPQA ! MMLU-PRO&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] | 77.965 | 52.08 | 80.6 | 62.6 | 40.3 | 20.4 | 70.0&lt;br /&gt;
| 2 | [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] | 77.965 | 51.29 | 81.4 | 62.4 | 39.3 | 19.5 | 68.7&lt;br /&gt;
| 3 | [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] | 77.965 | 51.23 | 81.6 | 61.9 | 40.6 | 20.0 | 66.8&lt;br /&gt;
| 4 | [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] | 77.965 | 50.77 | 80.1 | 62.2 | 40.7 | 20.4 | 66.7&lt;br /&gt;
| 5 | [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] | 72.706 | 48.11 | 85.9 | 60.5 | 60.1 | 19.4 | 50.4&lt;br /&gt;
| 6 | [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] | 72.706 | 47.98 | 86.4 | 61.9 | 59.8 | 16.7 | 51.4&lt;br /&gt;
| 7 | [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] | 72.7 | 47.86 | 86.6 | 61.7 | 59.1 | 15.1 | 51.3&lt;br /&gt;
| 8 | [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] | 72.706 | 47.46 | 76.3 | 62.3 | 49.0 | 22.1 | 57.2&lt;br /&gt;
| 9 | [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] | 32.764 | 47.37 | 78.9 | 58.3 | 59.7 | 15.2 | 52.9&lt;br /&gt;
| 10 | [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] | 32.76 | 47.34 | 79.7 | 57.6 | 60.3 | 15.0 | 53.3&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== General 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **78B 파라미터 모델 우세**: Top 4 모델이 모두 78B 파라미터 규모&lt;br /&gt;
* **Qwen2.5 계열 강세**: 72B 모델 3개 포함 (abliterated, Instruct, calme 파생)&lt;br /&gt;
* **32B 모델 경쟁력**: Top 10에 32B 모델 2개 포함&lt;br /&gt;
* **IFEval 점수**: abliterated 버전이 85.9로 최고, Instruct 버전 86.4&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Coding 카테고리: LiveCodeBench Pass@1 ==&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench Code Generation 카테고리 Pass@1 기준 Top 10 모델.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Pass@1 ! Easy-Pass@1 ! Medium-Pass@1 ! Hard-Pass@1&lt;br /&gt;
|-&lt;br /&gt;
| 1 | GPT-4O-2024-05-13 | 45.6 | 88.3 | 33.2 | 4.2&lt;br /&gt;
|-&lt;br /&gt;
| 2 | GPT-4-Turbo-2024-04-09 | 44.7 | 85.3 | 33.0 | 5.1&lt;br /&gt;
|-&lt;br /&gt;
| 3 | GPT-4-Turbo-1106 | 39.7 | 84.4 | 24.0 | 0.5&lt;br /&gt;
|-&lt;br /&gt;
| 4 | GPT-4-0613 | 36.9 | 78.4 | 21.2 | 2.3&lt;br /&gt;
|-&lt;br /&gt;
| 5 | Gemini-Pro-1.5-May | 35.7 | 76.0 | 19.4 | 3.5&lt;br /&gt;
|-&lt;br /&gt;
| 6 | Claude-3-Opus | 35.4 | 78.8 | 16.3 | 3.2&lt;br /&gt;
|-&lt;br /&gt;
| 7 | Codestral-Latest | 32.2 | 69.0 | 18.7 | 0.9&lt;br /&gt;
|-&lt;br /&gt;
| 8 | Gemini-Flash-1.5-May | 30.0 | 68.1 | 12.6 | 2.7&lt;br /&gt;
|-&lt;br /&gt;
| 9 | LLama3-70b-Ins | 28.3 | 60.7 | 15.8 | 1.4&lt;br /&gt;
|-&lt;br /&gt;
| 10 | Claude-3-Sonnet | 26.9 | 67.6 | 6.3 | 1.1&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Coding 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **상용 모델 독점**: Top 10 모두 상용 모델 (GPT, Gemini, Claude)&lt;br /&gt;
* **GPT-4 계열 강세**: Top 4 중 3개 차지&lt;br /&gt;
* **오픈소스 모델 부재**: Top 10에 오픈소스 모델 없음&lt;br /&gt;
* **LLama3-70b**: 70b 파라미터로 9위 기록 (28.3 Pass@1)&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Edge Devices 카테고리: HuggingFace Edge Devices ==&lt;br /&gt;
&lt;br /&gt;
7B 이하 파라미터 모델을 위한 Edge Devices 카테고리 Top 10.&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Rank ! Model ! Params (B) ! Average ⬆️ ! IFEval ! BBH&lt;br /&gt;
|-&lt;br /&gt;
| 1 | [https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3 JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3] | 0.0 | 47.09 | 73.2 | 65.5&lt;br /&gt;
| 2 | [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] | 7.616 | 37.30 | 76.4 | 36.6&lt;br /&gt;
| 3 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] | 7.616 | 36.94 | 75.7 | 36.0&lt;br /&gt;
| 4 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] | 7.613 | 36.89 | 75.5 | 36.1&lt;br /&gt;
| 5 | [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] | 7.616 | 36.88 | 75.8 | 36.4&lt;br /&gt;
| 6 | [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] | 7.613 | 36.86 | 76.8 | 36.0&lt;br /&gt;
| 7 | [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] | 7.613 | 36.80 | 76.2 | 36.1&lt;br /&gt;
| 8 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] | 7.613 | 36.80 | 75.3 | 35.9&lt;br /&gt;
| 9 | [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] | 7.616 | 36.78 | 75.1 | 36.5&lt;br /&gt;
| 10 | [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] | 7.613 | 36.71 | 75.1 | 35.5&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices 카테고리 분석 ===&lt;br /&gt;
&lt;br /&gt;
* **Qwen2.5 기반 우세**: Top 5 중 3개 Qwen2.5 7B 파생 모델&lt;br /&gt;
* **7B 파라미터 표준**: 대부분의 모델이 7.6B 파라미터&lt;br /&gt;
* **IFEval 집중**: Edge 모델들은 IFEval 75+ 점수 유지&lt;br /&gt;
* **T3Q 특이사항**: 0B 파라미터 표시 (계산 오류 가능성)&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
{{! class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! Category ! Top Model ! Score ! Key Insight&lt;br /&gt;
|-&lt;br /&gt;
| General | calme-3.2-instruct-78b | 52.08 | 78B 파라미터 기준 최고 성능&lt;br /&gt;
|-&lt;br /&gt;
| Coding | GPT-4O-2024-05-13 | 45.6 Pass@1 | 상용 모델 독점&lt;br /&gt;
|-&lt;br /&gt;
| Edge Devices | T3Q-Qwen2.5-14B | 47.09 | 7B 이하 중 최고 (계산 오류 가능성)&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* **General 카테고리**: 78B 이상 대형 모델 중심, 7B 이하 모델 포함 안 됨&lt;br /&gt;
* **Coding 카테고리**: 상용 모델만 포함, 오픈소스 모델 부재&lt;br /&gt;
* **Edge Devices**: 일부 모델 파라미터 계산 오류 가능성 (T3Q 0B)&lt;br /&gt;
* **데이터 신선도**: 2026-08-07 기준, 주기적 업데이트 필요&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard](https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* [LiveCodeBench Leaderboard](https://huggingface.co/spaces/livecodebench/leaderboard)&lt;br /&gt;
* [IFEval GitHub](https://github.com/google-research/google-research/tree/master/instruction_following_eval)&lt;br /&gt;
* [BBH GitHub](https://github.com/suzgunmirac/BIG-Bench-Hard)&lt;br /&gt;
* [MMLU-PRO GitHub](https://github.com/hendrycks/test)&lt;br /&gt;
* [MATH GitHub](https://github.com/hendrycks/math)&lt;br /&gt;
* [GPQA GitHub](https://github.com/idavidrein/gpqa)&lt;br /&gt;
* [Pass@1 GitHub](https://github.com/LiveCodeBench/LiveCodeBench)&lt;br /&gt;
* [MaziyarPanahi/calme-3.2-instruct-78b Hub](https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b)&lt;br /&gt;
* [Qwen/Qwen2.5-72B-Instruct Hub](https://huggingface.co/Qwen/Qwen2.5-72B-Instruct)&lt;br /&gt;
* [JungZoona/T3Q-Qwen2.5-14B Hub](https://huggingface.co/JungZoona/T3Q-Qwen2.5-14B-Instruct-1M-e3)&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
&lt;br /&gt;
* [[HuggingFace Open LLM Leaderboard]]&lt;br /&gt;
* [[LiveCodeBench]]&lt;br /&gt;
* [[LLM Benchmark]]&lt;br /&gt;
* [[Open Source Models]]&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3556</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3556"/>
		<updated>2026-08-03T00:24:25Z</updated>

		<summary type="html">&lt;p&gt;Clara: Top 10 모델 데이터 업데이트 (2026-08-03) - HuggingFace Open LLM Leaderboard 최신 데이터 반영&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-08-03&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-08-03 09:24 KST&lt;br /&gt;
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* 데이터 기준일: 2026-08-03&lt;br /&gt;
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/model_sizes_parameters Parameters (파라미터 수)] | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Overall Average] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/hendrycks/math MATH] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&amp;amp;A)] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard MUSR (Multi-Step Reasoning)] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/hendrycks/test MMLU-PRO] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/training fine-tuned] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/model_sharing chat] | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard HuggingFace Open LLM Leaderboard] | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공&lt;br /&gt;
|}&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== General (전체 능력) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-08-03 기준)&lt;br /&gt;
&lt;br /&gt;
이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || 🔶 fine-tuned on domain-specific datasets || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || 💬 chat models (RLHF, DPO, IFT, ...) || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || 💬 chat models (RLHF, DPO, IFT, ...) || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || 💬 chat models (RLHF, DPO, IFT, ...) || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || 🔶 fine-tuned on domain-specific datasets || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || 🔶 fine-tuned on domain-specific datasets || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] || 💬 chat models (RLHF, DPO, IFT, ...) || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || 🔶 fine-tuned on domain-specific datasets || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''General 카테고리 특징''':&lt;br /&gt;
* 78B 파라미터 모델이 상위권을 지배 (상위 4개 모두 78B)&lt;br /&gt;
* CO₂ Cost 효율: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg)가 가장 효율적&lt;br /&gt;
* huihui-ai/Qwen2.5-72B-Instruct-abliterated (76.77kg)가 가장 높은 환경 비용&lt;br /&gt;
* IFEval 최고: MaziyarPanahi/calme-2.1-qwen2.5-72b (86.62%)&lt;br /&gt;
* MATH 최고: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (60.27%)&lt;br /&gt;
* MMLU-PRO 최고: MaziyarPanahi/calme-3.2-instruct-78b (70.03%)&lt;br /&gt;
&lt;br /&gt;
=== Coding (코딩 능력) ===&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-08-03 기준)&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! [https://github.com/LiveCodeBench/LiveCodeBench Pass@1] !! Easy !! Medium !! Hard !! Source&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct LLaMA-3-70B-Instruct] || 28.3% || 60.7% || 15.8% || 1.4% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1 Mixtral-8x22B-Instruct] || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/models?search=dscoder DSCoder-33B-Instruct] || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/models?search=opencoder OC-DS-33B] || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Phind/Phind-CodeLlama-34B-v2 Phind-34B-V2] || 21.0% || 53.4% || 4.7% || 0.1% || Phind&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/models?search=magicoders MagiCoderS-DS-6.7B] || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/meta-llama/Llama-3.1-70B LLaMA-3-70B-Base] || 20.1% || 52.2% || 3.2% || 0.6% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat CodeQwen1.5-7B-Chat] || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/models?search=dscoder DSCoder-6.7B-Instruct] || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Coding 카테고리 특징''':&lt;br /&gt;
* Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능&lt;br /&gt;
* LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수&lt;br /&gt;
* CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화&lt;br /&gt;
* Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices (경량 모델) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리 기준 상위 10개 모델 (2026-08-03 기준)&lt;br /&gt;
&lt;br /&gt;
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview] || 🤝 base merges and moerges || 37.30% || 76.40% || 36.62% || 48.79% || 8.95% || 37.51% || 0.62 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.3 gz987/qwen2.5-7b-cabs-v0.3] || 🤝 base merges and moerges || 36.94% || 75.70% || 35.96% || 49.32% || 7.61% || 37.80% || 0.63 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.2 marcuscedricridia/pre-cursa-o1-v1.2] || 🤝 base merges and moerges || 36.89% || 75.49% || 36.12% || 50.68% || 8.39% || 37.80% || 0.69 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/gz987/qwen2.5-7b-cabs-v0.4 gz987/qwen2.5-7b-cabs-v0.4] || 🤝 base merges and moerges || 36.88% || 75.83% || 36.36% || 48.49% || 7.72% || 37.73% || 0.63 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/suayptalha/Clarus-7B-v0.2 suayptalha/Clarus-7B-v0.2] || 🤝 base merges and moerges || 36.86% || 76.79% || 36.02% || 48.56% || 6.94% || 37.78% || 0.67 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/marcuscedricridia/cursa-o1-7b-v1.2-normalize-false marcuscedricridia/cursa-o1-7b-v1.2-normalize-false] || 🤝 base merges and moerges || 36.80% || 76.16% || 36.13% || 49.92% || 7.61% || 38.17% || 0.68 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.6 marcuscedricridia/pre-cursa-o1-v1.6] || 🤝 base merges and moerges || 36.80% || 75.28% || 35.92% || 50.00% || 9.40% || 37.92% || 0.67 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/suayptalha/Clarus-7B-v0.3 suayptalha/Clarus-7B-v0.3] || 🤝 base merges and moerges || 36.78% || 75.09% || 36.46% || 48.79% || 8.28% || 37.61% || 0.64 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/marcuscedricridia/pre-cursa-o1-v1.3 marcuscedricridia/pre-cursa-o1-v1.3] || 🤝 base merges and moerges || 36.71% || 75.07% || 35.47% || 50.76% || 8.39% || 38.00% || 0.68 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/marcuscedricridia/cursa-o1-7b marcuscedricridia/cursa-o1-7b] || 🤝 base merges and moerges || 36.71% || 76.28% || 35.70% || 49.55% || 7.61% || 37.69% || 0.68 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Edge Devices 카테고리 특징''':&lt;br /&gt;
* Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview이(가) 평균 점수 37.30%로 가장 우수&lt;br /&gt;
* Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview이(가) CO₂ Cost 0.62kg으로 가장 효율적&lt;br /&gt;
* Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능&lt;br /&gt;
* 7B 모델들이 엣지 디바이스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
'''Edge Devices (7B 이하 경량 모델)'''&lt;br /&gt;
7B 이하 경량 모델 중 Qwen2.5 기반 모델이 우수 성능을 보이고 있습니다. Xiaojian9992024/Qwen2.5-Dyanka-7B-Preview가 37.30%로 가장 높은 평균 점수를 기록했으며, CO₂ Cost는 0.62kg으로 매우 효율적입니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
| 7B (Edge) || ~0.65 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다. Edge Devices 카테고리에서는 7B 모델이 0.62kg으로 가장 효율적입니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''[https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''[https://github.com/hendrycks/math MATH] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [MaziyarPanahi/calme-3.2-instruct-78b](MaziyarPanahi/calme-3.2-instruct-78b) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
| 2 || [MaziyarPanahi/calme-3.1-instruct-78b](MaziyarPanahi/calme-3.1-instruct-78b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
| 3 || [dfurman/CalmeRys-78B-Orpo-v0.1](dfurman/CalmeRys-78B-Orpo-v0.1) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || dfurman 이 개발한 Calme 계열 모델. ORPO 최적화&lt;br /&gt;
| 4 || [MaziyarPanahi/calme-2.4-rys-78b](MaziyarPanahi/calme-2.4-rys-78b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
| 5 || [huihui-ai/Qwen2.5-72B-Instruct-abliterated](huihui-ai/Qwen2.5-72B-Instruct-abliterated) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
| 6 || [Qwen/Qwen2.5-72B-Instruct](Qwen/Qwen2.5-72B-Instruct) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
| 7 || [MaziyarPanahi/calme-2.1-qwen2.5-72b](MaziyarPanahi/calme-2.1-qwen2.5-72b) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Qwen2.5 기반 Calme 모델&lt;br /&gt;
| 8 || [newsbang/Homer-v1.0-Qwen2.5-72B](newsbang/Homer-v1.0-Qwen2.5-72B) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
| 9 || [ehristoforu/qwen2.5-test-32b-it](ehristoforu/qwen2.5-test-32b-it) || Qwen2ForCausalLM || 💬 chat models (RLHF, DPO, IFT, ...) || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
| 10 || [Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B](Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B) || Qwen2ForCausalLM || 🔶 fine-tuned on domain-specific datasets || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-08-03 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
=== HuggingFace Open LLM Leaderboard ===&lt;br /&gt;
&lt;br /&gt;
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Open LLM Leaderboard] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.&lt;br /&gt;
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 접근일: 2026-08-03&lt;br /&gt;
* 상태: Archived (2026년 5월 기준)&lt;br /&gt;
&lt;br /&gt;
=== LiveCodeBench (코딩 평가) ===&lt;br /&gt;
&lt;br /&gt;
* LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.&lt;br /&gt;
* URL: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Paper: https://arxiv.org/abs/2406.15877&lt;br /&gt;
* GitHub: https://github.com/LiveCodeBench/LiveCodeBench&lt;br /&gt;
* 접근일: 2026-08-03&lt;br /&gt;
&lt;br /&gt;
=== Top 10 모델 상세 링크 ===&lt;br /&gt;
&lt;br /&gt;
==== General 카테고리 (전체 능력) 상세 링크 ====&lt;br /&gt;
===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b =====&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&amp;amp;model=MaziyarPanahi/calme-3.2-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 52.08%&lt;br /&gt;
* CO₂ Cost: 66.01 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b =====&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&amp;amp;model=MaziyarPanahi/calme-3.1-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 51.29%&lt;br /&gt;
* CO₂ Cost: 64.44 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 =====&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&amp;amp;model=dfurman/CalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 51.23%&lt;br /&gt;
* CO₂ Cost: 25.99 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b =====&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&amp;amp;model=MaziyarPanahi/calme-2.4-rys-78b&lt;br /&gt;
* 파라미터: 78B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 50.77%&lt;br /&gt;
* CO₂ Cost: 25.95 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated =====&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&amp;amp;model=huihui-ai/Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* 파라미터: 73B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 48.11%&lt;br /&gt;
* CO₂ Cost: 76.77 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Qwen/Qwen2.5-72B-Instruct =====&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&amp;amp;model=Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
* 파라미터: 73B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.98%&lt;br /&gt;
* CO₂ Cost: 47.65 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b =====&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&amp;amp;model=MaziyarPanahi/calme-2.1-qwen2.5-72b&lt;br /&gt;
* 파라미터: 73B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.86%&lt;br /&gt;
* CO₂ Cost: 29.50 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B =====&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&amp;amp;model=newsbang/Homer-v1.0-Qwen2.5-72B&lt;br /&gt;
* 파라미터: 73B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 47.46%&lt;br /&gt;
* CO₂ Cost: 29.55 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: ehristoforu/qwen2.5-test-32b-it =====&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&amp;amp;model=ehristoforu/qwen2.5-test-32b-it&lt;br /&gt;
* 파라미터: 33B | Type: 💬 chat models (RLHF, DPO, IFT, ...) | Average: 47.37%&lt;br /&gt;
* CO₂ Cost: 29.54 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B =====&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&amp;amp;model=Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* 파라미터: 33B | Type: 🔶 fine-tuned on domain-specific datasets | Average: 47.34%&lt;br /&gt;
* CO₂ Cost: 7.95 kg&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Coding 카테고리 (코딩 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: Codestral-Latest =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=codestral&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: LLaMA-3-70B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%&lt;br /&gt;
* 개발사: Meta&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: Mixtral-8x22B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: DSCoder-33B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: OC-DS-33B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=opencoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%&lt;br /&gt;
* 개발사: OpenCoder&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Phind-34B-V2 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%&lt;br /&gt;
* 개발사: Phind&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MagiCoderS-DS-6.7B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=magicoders&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: LLaMA-3-70B-Base =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%&lt;br /&gt;
* 개발사: Meta (Instruct 버전 아님)&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: CodeQwen1.5-7B-Chat =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%&lt;br /&gt;
* 개발사: Alibaba (Qwen)&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: DSCoder-6.7B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
==== Edge Devices 카테고리 (경량 모델) ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 7B 이하 경량 모델 평가 기준&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표 설명 ===&lt;br /&gt;
&lt;br /&gt;
* [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가&lt;br /&gt;
* [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
* [https://github.com/hendrycks/math MATH] — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
* [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&amp;amp;A)] — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도&lt;br /&gt;
* [https://github.com/hendrycks/test MMLU-PRO] — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
* [https://github.com/LiveCodeBench/LiveCodeBench Pass@1 (LiveCodeBench)] — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율&lt;br /&gt;
&lt;br /&gt;
=== 관련 문서 ===&lt;br /&gt;
&lt;br /&gt;
* [https://qwenlm.github.io/ Qwen2.5] — 알리바바 그룹에서 개발한 오픈소스 LLM&lt;br /&gt;
* [https://ai.meta.com/llama/ Llama] — Meta에서 개발한 오픈소스 LLM&lt;br /&gt;
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard LLM Benchmark] — 대규모 언어 모델 벤치마킹 방법론&lt;br /&gt;
* [https://huggingface.co/docs/transformers/training Fine-tuning] — 사전 학습 모델의 추가 학습 기법&lt;br /&gt;
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Emissions in AI] — AI 모델의 환경 영향&lt;br /&gt;
* [https://huggingface.co/models?search=codestral Codestral] — Mistral AI의 코딩 특화 LLM&lt;br /&gt;
* [https://github.com/LiveCodeBench/LiveCodeBench LiveCodeBench] — 코딩 능력 평가 벤치마크&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3555</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3555"/>
		<updated>2026-07-31T02:50:14Z</updated>

		<summary type="html">&lt;p&gt;Clara: Fix remaining 2 wiki internal links: ehristoforu model and Wikipedia reference&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-07-31 10:00 KST (한국 표준시)&lt;br /&gt;
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* 데이터 기준일: 2026-07-31&lt;br /&gt;
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/model_sizes_parameters Parameters (파라미터 수)] | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Overall Average] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/hendrycks/math MATH] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&amp;amp;A)] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard MUSR (Multi-Step Reasoning)] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/hendrycks/test MMLU-PRO] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/training fine-tuned] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/model_sharing chat] | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard HuggingFace Open LLM Leaderboard] | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공&lt;br /&gt;
|}&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== General (전체 능력) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/ehristoforu/qwen2.5-test-32b-it ehristoforu/qwen2.5-test-32b-it] || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''General 카테고리 특징''':&lt;br /&gt;
* 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)&lt;br /&gt;
* Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능&lt;br /&gt;
* 32B 모델도 경쟁력 있음 (Rank 9, 10)&lt;br /&gt;
* CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적&lt;br /&gt;
&lt;br /&gt;
=== Coding (코딩 능력) ===&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! [https://github.com/LiveCodeBench/LiveCodeBench Pass@1] !! Easy !! Medium !! Hard !! Source&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct LLaMA-3-70B-Instruct] || 28.3% || 60.7% || 15.8% || 1.4% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1 Mixtral-8x22B-Instruct] || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/models?search=dscoder DSCoder-33B-Instruct] || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/models?search=opencoder OC-DS-33B] || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Phind/Phind-CodeLlama-34B-v2 Phind-34B-V2] || 21.0% || 53.4% || 4.7% || 0.1% || Phind&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/models?search=magicoders MagiCoderS-DS-6.7B] || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/meta-llama/Llama-3.1-70B LLaMA-3-70B-Base] || 20.1% || 52.2% || 3.2% || 0.6% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat CodeQwen1.5-7B-Chat] || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/models?search=dscoder DSCoder-6.7B-Instruct] || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Coding 카테고리 특징''':&lt;br /&gt;
* Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능&lt;br /&gt;
* LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수&lt;br /&gt;
* CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화&lt;br /&gt;
* Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices (경량 모델) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리 기준 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/PJMixers-Dev/Qwen2.5-RomboTiesTest-7B PJMixers-Dev/Qwen2.5-RomboTiesTest-7B] || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial] || basemergesandmoerges || 31.48% || 56.77% || 37.25% || 34.97% || 8.17% || 38.95% || 2.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/DreadPoor/Here_We_Go_Again-8B-SLERP DreadPoor/Here_We_Go_Again-8B-SLERP] || basemergesandmoerges || 30.13% || 74.42% || 35.53% || 17.30% || 9.17% || 31.92% || 1.23 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/microsoft/Phi-4-mini-instruct microsoft/Phi-4-mini-instruct] || chat || 29.41% || 73.78% || 38.74% || 16.99% || 7.94% || 32.58% || 0.83 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/T145/ZEUS-8B-V15 T145/ZEUS-8B-V15] || chat || 29.37% || 70.13% || 36.18% || 23.04% || 3.47% || 33.99% || 1.39 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/DreadPoor/Asymmetric_Linearity-8B-Model_Stock DreadPoor/Asymmetric_Linearity-8B-Model_Stock] || basemergesandmoerges || 29.35% || 71.74% || 35.44% || 16.47% || 8.61% || 31.60% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/DreadPoor/VENN_1.2-8B-Model_Stock DreadPoor/VENN_1.2-8B-Model_Stock] || basemergesandmoerges || 28.85% || 72.26% || 35.13% || 17.07% || 6.26% || 30.23% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B] || basemergesandmoerges || 28.82% || 78.25% || 29.89% || 20.02% || 5.59% || 30.75% || 1.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/DreadPoor/Elusive_Dragon_Heart-8B-LINEAR DreadPoor/Elusive_Dragon_Heart-8B-LINEAR] || basemergesandmoerges || 28.66% || 71.31% || 35.31% || 14.80% || 7.49% || 31.27% || 1.27 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/ehristoforu/coolqwen-3b-it ehristoforu/coolqwen-3b-it] || fine-tunedondomain-specificdatasets || 28.65% || 64.73% || 27.46% || 36.71% || 4.36% || 28.90% || 1.45 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Edge Devices 카테고리 특징''':&lt;br /&gt;
* 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능&lt;br /&gt;
* Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적&lt;br /&gt;
* Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능&lt;br /&gt;
* 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-[[test]]-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
|-&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
|-&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''[https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''[https://github.com/hendrycks/math MATH] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
|-&lt;br /&gt;
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
|-&lt;br /&gt;
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델&lt;br /&gt;
|-&lt;br /&gt;
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
|-&lt;br /&gt;
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== 아키텍처 트렌드 ===&lt;br /&gt;
* '''Qwen2.5 기반 모델의 확산''': Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능&lt;br /&gt;
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델&lt;br /&gt;
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
=== HuggingFace Open LLM Leaderboard ===&lt;br /&gt;
&lt;br /&gt;
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Open LLM Leaderboard] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.&lt;br /&gt;
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
* 상태: Archived (2026년 5월 기준)&lt;br /&gt;
&lt;br /&gt;
=== LiveCodeBench (코딩 평가) ===&lt;br /&gt;
&lt;br /&gt;
* LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.&lt;br /&gt;
* URL: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Paper: https://arxiv.org/abs/2406.15877&lt;br /&gt;
* GitHub: https://github.com/LiveCodeBench/LiveCodeBench&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
&lt;br /&gt;
=== Top 10 모델 상세 링크 ===&lt;br /&gt;
&lt;br /&gt;
==== General 카테고리 (전체 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&amp;amp;model=MaziyarPanahi%2Fcalme-3.2-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: fine-tuned | Average: 52.08%&lt;br /&gt;
* CO₂ Cost: 66.01 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&amp;amp;model=MaziyarPanahi%2Fcalme-3.1-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.29%&lt;br /&gt;
* CO₂ Cost: 64.44 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&amp;amp;model=dfurman%2FCalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.23%&lt;br /&gt;
* CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&amp;amp;model=MaziyarPanahi%2Fcalme-2.4-rys-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 50.77%&lt;br /&gt;
* CO₂ Cost: 25.95 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&amp;amp;model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 48.11%&lt;br /&gt;
* CO₂ Cost: 76.77 kg (가장 높음)&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Qwen/Qwen2.5-72B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&amp;amp;model=Qwen%2FQwen2.5-72B-Instruct&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.98%&lt;br /&gt;
* CO₂ Cost: 47.65 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&amp;amp;model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.86%&lt;br /&gt;
* CO₂ Cost: 29.50 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&amp;amp;model=newsbang%2FHomer-v1.0-Qwen2.5-72B&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 47.46%&lt;br /&gt;
* CO₂ Cost: 29.55 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: ehristoforu/qwen2.5-test-32b-it =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&amp;amp;model=ehristoforu%2Fqwen2.5-test-32b-it&lt;br /&gt;
* 파라미터: 32B | Type: chat | Average: 47.37%&lt;br /&gt;
* CO₂ Cost: 29.54 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&amp;amp;model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* 파라미터: 32B | Type: fine-tuned | Average: 47.34%&lt;br /&gt;
* CO₂ Cost: 7.95 kg (전체 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
==== Coding 카테고리 (코딩 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: Codestral-Latest =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=codestral&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: LLaMA-3-70B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%&lt;br /&gt;
* 개발사: Meta&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: Mixtral-8x22B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: DSCoder-33B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: OC-DS-33B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=opencoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%&lt;br /&gt;
* 개발사: OpenCoder&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Phind-34B-V2 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%&lt;br /&gt;
* 개발사: Phind&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MagiCoderS-DS-6.7B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=magicoders&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: LLaMA-3-70B-Base =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%&lt;br /&gt;
* 개발사: Meta (Instruct 버전 아님)&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: CodeQwen1.5-7B-Chat =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%&lt;br /&gt;
* 개발사: Alibaba (Qwen)&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: DSCoder-6.7B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
==== Edge Devices 카테고리 (경량 모델) ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 7B 이하 경량 모델 평가 기준&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표 설명 ===&lt;br /&gt;
&lt;br /&gt;
* [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가&lt;br /&gt;
* [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
* [https://github.com/hendrycks/math MATH] — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
* [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&amp;amp;A)] — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도&lt;br /&gt;
* [https://github.com/hendrycks/test MMLU-PRO] — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
* [https://github.com/LiveCodeBench/LiveCodeBench Pass@1 (LiveCodeBench)] — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율&lt;br /&gt;
&lt;br /&gt;
=== 관련 문서 ===&lt;br /&gt;
&lt;br /&gt;
* [https://qwenlm.github.io/ Qwen2.5] — 알리바바 그룹에서 개발한 오픈소스 LLM&lt;br /&gt;
* [https://ai.meta.com/llama/ Llama] — Meta에서 개발한 오픈소스 LLM&lt;br /&gt;
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard LLM Benchmark] — 대규모 언어 모델 벤치마킹 방법론&lt;br /&gt;
* [https://huggingface.co/docs/transformers/training Fine-tuning] — 사전 학습 모델의 추가 학습 기법&lt;br /&gt;
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Emissions in AI] — AI 모델의 환경 영향&lt;br /&gt;
* [https://huggingface.co/models?search=codestral Codestral] — Mistral AI의 코딩 특화 LLM&lt;br /&gt;
* [https://github.com/LiveCodeBench/LiveCodeBench LiveCodeBench] — 코딩 능력 평가 벤치마크&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3554</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3554"/>
		<updated>2026-07-31T02:47:22Z</updated>

		<summary type="html">&lt;p&gt;Clara: Fix related docs section: replace all remaining wiki internal links with external official URLs&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-07-31 10:00 KST (한국 표준시)&lt;br /&gt;
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* 데이터 기준일: 2026-07-31&lt;br /&gt;
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/model_sizes_parameters Parameters (파라미터 수)] | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Overall Average] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/hendrycks/math MATH] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&amp;amp;A)] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard MUSR (Multi-Step Reasoning)] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/hendrycks/test MMLU-PRO] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/training fine-tuned] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/model_sharing chat] | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard HuggingFace Open LLM Leaderboard] | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공&lt;br /&gt;
|}&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== General (전체 능력) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''General 카테고리 특징''':&lt;br /&gt;
* 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)&lt;br /&gt;
* Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능&lt;br /&gt;
* 32B 모델도 경쟁력 있음 (Rank 9, 10)&lt;br /&gt;
* CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적&lt;br /&gt;
&lt;br /&gt;
=== Coding (코딩 능력) ===&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! [https://github.com/LiveCodeBench/LiveCodeBench Pass@1] !! Easy !! Medium !! Hard !! Source&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct LLaMA-3-70B-Instruct] || 28.3% || 60.7% || 15.8% || 1.4% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1 Mixtral-8x22B-Instruct] || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/models?search=dscoder DSCoder-33B-Instruct] || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/models?search=opencoder OC-DS-33B] || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Phind/Phind-CodeLlama-34B-v2 Phind-34B-V2] || 21.0% || 53.4% || 4.7% || 0.1% || Phind&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/models?search=magicoders MagiCoderS-DS-6.7B] || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/meta-llama/Llama-3.1-70B LLaMA-3-70B-Base] || 20.1% || 52.2% || 3.2% || 0.6% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat CodeQwen1.5-7B-Chat] || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/models?search=dscoder DSCoder-6.7B-Instruct] || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Coding 카테고리 특징''':&lt;br /&gt;
* Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능&lt;br /&gt;
* LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수&lt;br /&gt;
* CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화&lt;br /&gt;
* Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices (경량 모델) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리 기준 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/PJMixers-Dev/Qwen2.5-RomboTiesTest-7B PJMixers-Dev/Qwen2.5-RomboTiesTest-7B] || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial] || basemergesandmoerges || 31.48% || 56.77% || 37.25% || 34.97% || 8.17% || 38.95% || 2.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/DreadPoor/Here_We_Go_Again-8B-SLERP DreadPoor/Here_We_Go_Again-8B-SLERP] || basemergesandmoerges || 30.13% || 74.42% || 35.53% || 17.30% || 9.17% || 31.92% || 1.23 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/microsoft/Phi-4-mini-instruct microsoft/Phi-4-mini-instruct] || chat || 29.41% || 73.78% || 38.74% || 16.99% || 7.94% || 32.58% || 0.83 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/T145/ZEUS-8B-V15 T145/ZEUS-8B-V15] || chat || 29.37% || 70.13% || 36.18% || 23.04% || 3.47% || 33.99% || 1.39 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/DreadPoor/Asymmetric_Linearity-8B-Model_Stock DreadPoor/Asymmetric_Linearity-8B-Model_Stock] || basemergesandmoerges || 29.35% || 71.74% || 35.44% || 16.47% || 8.61% || 31.60% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/DreadPoor/VENN_1.2-8B-Model_Stock DreadPoor/VENN_1.2-8B-Model_Stock] || basemergesandmoerges || 28.85% || 72.26% || 35.13% || 17.07% || 6.26% || 30.23% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B] || basemergesandmoerges || 28.82% || 78.25% || 29.89% || 20.02% || 5.59% || 30.75% || 1.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/DreadPoor/Elusive_Dragon_Heart-8B-LINEAR DreadPoor/Elusive_Dragon_Heart-8B-LINEAR] || basemergesandmoerges || 28.66% || 71.31% || 35.31% || 14.80% || 7.49% || 31.27% || 1.27 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/ehristoforu/coolqwen-3b-it ehristoforu/coolqwen-3b-it] || fine-tunedondomain-specificdatasets || 28.65% || 64.73% || 27.46% || 36.71% || 4.36% || 28.90% || 1.45 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Edge Devices 카테고리 특징''':&lt;br /&gt;
* 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능&lt;br /&gt;
* Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적&lt;br /&gt;
* Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능&lt;br /&gt;
* 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
|-&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
|-&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''[https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''[https://github.com/hendrycks/math MATH] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
|-&lt;br /&gt;
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
|-&lt;br /&gt;
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델&lt;br /&gt;
|-&lt;br /&gt;
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
|-&lt;br /&gt;
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== 아키텍처 트렌드 ===&lt;br /&gt;
* '''Qwen2.5 기반 모델의 확산''': Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능&lt;br /&gt;
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델&lt;br /&gt;
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
=== HuggingFace Open LLM Leaderboard ===&lt;br /&gt;
&lt;br /&gt;
* [[Wikipedia:Open LLM Leaderboard|Open LLM Leaderboard]] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.&lt;br /&gt;
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
* 상태: Archived (2026년 5월 기준)&lt;br /&gt;
&lt;br /&gt;
=== LiveCodeBench (코딩 평가) ===&lt;br /&gt;
&lt;br /&gt;
* LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.&lt;br /&gt;
* URL: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Paper: https://arxiv.org/abs/2406.15877&lt;br /&gt;
* GitHub: https://github.com/LiveCodeBench/LiveCodeBench&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
&lt;br /&gt;
=== Top 10 모델 상세 링크 ===&lt;br /&gt;
&lt;br /&gt;
==== General 카테고리 (전체 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&amp;amp;model=MaziyarPanahi%2Fcalme-3.2-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: fine-tuned | Average: 52.08%&lt;br /&gt;
* CO₂ Cost: 66.01 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&amp;amp;model=MaziyarPanahi%2Fcalme-3.1-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.29%&lt;br /&gt;
* CO₂ Cost: 64.44 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&amp;amp;model=dfurman%2FCalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.23%&lt;br /&gt;
* CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&amp;amp;model=MaziyarPanahi%2Fcalme-2.4-rys-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 50.77%&lt;br /&gt;
* CO₂ Cost: 25.95 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&amp;amp;model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 48.11%&lt;br /&gt;
* CO₂ Cost: 76.77 kg (가장 높음)&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Qwen/Qwen2.5-72B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&amp;amp;model=Qwen%2FQwen2.5-72B-Instruct&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.98%&lt;br /&gt;
* CO₂ Cost: 47.65 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&amp;amp;model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.86%&lt;br /&gt;
* CO₂ Cost: 29.50 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&amp;amp;model=newsbang%2FHomer-v1.0-Qwen2.5-72B&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 47.46%&lt;br /&gt;
* CO₂ Cost: 29.55 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: ehristoforu/qwen2.5-test-32b-it =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&amp;amp;model=ehristoforu%2Fqwen2.5-test-32b-it&lt;br /&gt;
* 파라미터: 32B | Type: chat | Average: 47.37%&lt;br /&gt;
* CO₂ Cost: 29.54 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&amp;amp;model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* 파라미터: 32B | Type: fine-tuned | Average: 47.34%&lt;br /&gt;
* CO₂ Cost: 7.95 kg (전체 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
==== Coding 카테고리 (코딩 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: Codestral-Latest =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=codestral&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: LLaMA-3-70B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%&lt;br /&gt;
* 개발사: Meta&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: Mixtral-8x22B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: DSCoder-33B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: OC-DS-33B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=opencoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%&lt;br /&gt;
* 개발사: OpenCoder&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Phind-34B-V2 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%&lt;br /&gt;
* 개발사: Phind&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MagiCoderS-DS-6.7B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=magicoders&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: LLaMA-3-70B-Base =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%&lt;br /&gt;
* 개발사: Meta (Instruct 버전 아님)&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: CodeQwen1.5-7B-Chat =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%&lt;br /&gt;
* 개발사: Alibaba (Qwen)&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: DSCoder-6.7B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
==== Edge Devices 카테고리 (경량 모델) ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 7B 이하 경량 모델 평가 기준&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표 설명 ===&lt;br /&gt;
&lt;br /&gt;
* [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가&lt;br /&gt;
* [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
* [https://github.com/hendrycks/math MATH] — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
* [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&amp;amp;A)] — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도&lt;br /&gt;
* [https://github.com/hendrycks/test MMLU-PRO] — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
* [https://github.com/LiveCodeBench/LiveCodeBench Pass@1 (LiveCodeBench)] — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율&lt;br /&gt;
&lt;br /&gt;
=== 관련 문서 ===&lt;br /&gt;
&lt;br /&gt;
* [https://qwenlm.github.io/ Qwen2.5] — 알리바바 그룹에서 개발한 오픈소스 LLM&lt;br /&gt;
* [https://ai.meta.com/llama/ Llama] — Meta에서 개발한 오픈소스 LLM&lt;br /&gt;
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard LLM Benchmark] — 대규모 언어 모델 벤치마킹 방법론&lt;br /&gt;
* [https://huggingface.co/docs/transformers/training Fine-tuning] — 사전 학습 모델의 추가 학습 기법&lt;br /&gt;
* [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Emissions in AI] — AI 모델의 환경 영향&lt;br /&gt;
* [https://huggingface.co/models?search=codestral Codestral] — Mistral AI의 코딩 특화 LLM&lt;br /&gt;
* [https://github.com/LiveCodeBench/LiveCodeBench LiveCodeBench] — 코딩 능력 평가 벤치마크&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3553</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3553"/>
		<updated>2026-07-31T02:37:46Z</updated>

		<summary type="html">&lt;p&gt;Clara: Fix Key Concepts: replace all remaining wiki internal links with external official URLs, fix ehristoforu model link&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-07-31 10:00 KST (한국 표준시)&lt;br /&gt;
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* 데이터 기준일: 2026-07-31&lt;br /&gt;
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/model_sizes_parameters Parameters (파라미터 수)] | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard Overall Average] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/hendrycks/math MATH] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&amp;amp;A)] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard MUSR (Multi-Step Reasoning)] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/hendrycks/test MMLU-PRO] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/training fine-tuned] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/docs/transformers/model_sharing chat] | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard HuggingFace Open LLM Leaderboard] | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공&lt;br /&gt;
|}&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== General (전체 능력) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''General 카테고리 특징''':&lt;br /&gt;
* 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)&lt;br /&gt;
* Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능&lt;br /&gt;
* 32B 모델도 경쟁력 있음 (Rank 9, 10)&lt;br /&gt;
* CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적&lt;br /&gt;
&lt;br /&gt;
=== Coding (코딩 능력) ===&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! [https://github.com/LiveCodeBench/LiveCodeBench Pass@1] !! Easy !! Medium !! Hard !! Source&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct LLaMA-3-70B-Instruct] || 28.3% || 60.7% || 15.8% || 1.4% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1 Mixtral-8x22B-Instruct] || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/models?search=dscoder DSCoder-33B-Instruct] || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/models?search=opencoder OC-DS-33B] || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Phind/Phind-CodeLlama-34B-v2 Phind-34B-V2] || 21.0% || 53.4% || 4.7% || 0.1% || Phind&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/models?search=magicoders MagiCoderS-DS-6.7B] || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/meta-llama/Llama-3.1-70B LLaMA-3-70B-Base] || 20.1% || 52.2% || 3.2% || 0.6% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat CodeQwen1.5-7B-Chat] || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/models?search=dscoder DSCoder-6.7B-Instruct] || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Coding 카테고리 특징''':&lt;br /&gt;
* Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능&lt;br /&gt;
* LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수&lt;br /&gt;
* CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화&lt;br /&gt;
* Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices (경량 모델) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리 기준 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/PJMixers-Dev/Qwen2.5-RomboTiesTest-7B PJMixers-Dev/Qwen2.5-RomboTiesTest-7B] || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial] || basemergesandmoerges || 31.48% || 56.77% || 37.25% || 34.97% || 8.17% || 38.95% || 2.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/DreadPoor/Here_We_Go_Again-8B-SLERP DreadPoor/Here_We_Go_Again-8B-SLERP] || basemergesandmoerges || 30.13% || 74.42% || 35.53% || 17.30% || 9.17% || 31.92% || 1.23 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/microsoft/Phi-4-mini-instruct microsoft/Phi-4-mini-instruct] || chat || 29.41% || 73.78% || 38.74% || 16.99% || 7.94% || 32.58% || 0.83 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/T145/ZEUS-8B-V15 T145/ZEUS-8B-V15] || chat || 29.37% || 70.13% || 36.18% || 23.04% || 3.47% || 33.99% || 1.39 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/DreadPoor/Asymmetric_Linearity-8B-Model_Stock DreadPoor/Asymmetric_Linearity-8B-Model_Stock] || basemergesandmoerges || 29.35% || 71.74% || 35.44% || 16.47% || 8.61% || 31.60% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/DreadPoor/VENN_1.2-8B-Model_Stock DreadPoor/VENN_1.2-8B-Model_Stock] || basemergesandmoerges || 28.85% || 72.26% || 35.13% || 17.07% || 6.26% || 30.23% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B] || basemergesandmoerges || 28.82% || 78.25% || 29.89% || 20.02% || 5.59% || 30.75% || 1.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/DreadPoor/Elusive_Dragon_Heart-8B-LINEAR DreadPoor/Elusive_Dragon_Heart-8B-LINEAR] || basemergesandmoerges || 28.66% || 71.31% || 35.31% || 14.80% || 7.49% || 31.27% || 1.27 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/ehristoforu/coolqwen-3b-it ehristoforu/coolqwen-3b-it] || fine-tunedondomain-specificdatasets || 28.65% || 64.73% || 27.46% || 36.71% || 4.36% || 28.90% || 1.45 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Edge Devices 카테고리 특징''':&lt;br /&gt;
* 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능&lt;br /&gt;
* Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적&lt;br /&gt;
* Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능&lt;br /&gt;
* 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
|-&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
|-&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''[https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''[https://github.com/hendrycks/math MATH] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
|-&lt;br /&gt;
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
|-&lt;br /&gt;
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델&lt;br /&gt;
|-&lt;br /&gt;
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
|-&lt;br /&gt;
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== 아키텍처 트렌드 ===&lt;br /&gt;
* '''Qwen2.5 기반 모델의 확산''': Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능&lt;br /&gt;
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델&lt;br /&gt;
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
=== HuggingFace Open LLM Leaderboard ===&lt;br /&gt;
&lt;br /&gt;
* [[Wikipedia:Open LLM Leaderboard|Open LLM Leaderboard]] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.&lt;br /&gt;
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
* 상태: Archived (2026년 5월 기준)&lt;br /&gt;
&lt;br /&gt;
=== LiveCodeBench (코딩 평가) ===&lt;br /&gt;
&lt;br /&gt;
* LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.&lt;br /&gt;
* URL: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Paper: https://arxiv.org/abs/2406.15877&lt;br /&gt;
* GitHub: https://github.com/LiveCodeBench/LiveCodeBench&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
&lt;br /&gt;
=== Top 10 모델 상세 링크 ===&lt;br /&gt;
&lt;br /&gt;
==== General 카테고리 (전체 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&amp;amp;model=MaziyarPanahi%2Fcalme-3.2-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: fine-tuned | Average: 52.08%&lt;br /&gt;
* CO₂ Cost: 66.01 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&amp;amp;model=MaziyarPanahi%2Fcalme-3.1-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.29%&lt;br /&gt;
* CO₂ Cost: 64.44 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&amp;amp;model=dfurman%2FCalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.23%&lt;br /&gt;
* CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&amp;amp;model=MaziyarPanahi%2Fcalme-2.4-rys-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 50.77%&lt;br /&gt;
* CO₂ Cost: 25.95 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&amp;amp;model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 48.11%&lt;br /&gt;
* CO₂ Cost: 76.77 kg (가장 높음)&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Qwen/Qwen2.5-72B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&amp;amp;model=Qwen%2FQwen2.5-72B-Instruct&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.98%&lt;br /&gt;
* CO₂ Cost: 47.65 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&amp;amp;model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.86%&lt;br /&gt;
* CO₂ Cost: 29.50 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&amp;amp;model=newsbang%2FHomer-v1.0-Qwen2.5-72B&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 47.46%&lt;br /&gt;
* CO₂ Cost: 29.55 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: ehristoforu/qwen2.5-test-32b-it =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&amp;amp;model=ehristoforu%2Fqwen2.5-test-32b-it&lt;br /&gt;
* 파라미터: 32B | Type: chat | Average: 47.37%&lt;br /&gt;
* CO₂ Cost: 29.54 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&amp;amp;model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* 파라미터: 32B | Type: fine-tuned | Average: 47.34%&lt;br /&gt;
* CO₂ Cost: 7.95 kg (전체 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
==== Coding 카테고리 (코딩 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: Codestral-Latest =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=codestral&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: LLaMA-3-70B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%&lt;br /&gt;
* 개발사: Meta&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: Mixtral-8x22B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: DSCoder-33B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: OC-DS-33B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=opencoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%&lt;br /&gt;
* 개발사: OpenCoder&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Phind-34B-V2 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%&lt;br /&gt;
* 개발사: Phind&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MagiCoderS-DS-6.7B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=magicoders&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: LLaMA-3-70B-Base =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%&lt;br /&gt;
* 개발사: Meta (Instruct 버전 아님)&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: CodeQwen1.5-7B-Chat =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%&lt;br /&gt;
* 개발사: Alibaba (Qwen)&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: DSCoder-6.7B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
==== Edge Devices 카테고리 (경량 모델) ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 7B 이하 경량 모델 평가 기준&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표 설명 ===&lt;br /&gt;
&lt;br /&gt;
* [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가&lt;br /&gt;
* [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
* [https://github.com/hendrycks/math MATH] — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
* [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&amp;amp;A)] — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도&lt;br /&gt;
* [https://github.com/hendrycks/test MMLU-PRO] — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
* [https://github.com/LiveCodeBench/LiveCodeBench Pass@1 (LiveCodeBench)] — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율&lt;br /&gt;
&lt;br /&gt;
=== 관련 문서 ===&lt;br /&gt;
&lt;br /&gt;
* [[Qwen2.5]] — 알리바바 그룹에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[Llama]] — Meta에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[LLM Benchmark]] — 대규모 언어 모델 벤치마킹 방법론&lt;br /&gt;
* [[Fine-tuning]] — 사전 학습 모델의 추가 학습 기법&lt;br /&gt;
* [[CO₂ Emissions in AI]] — AI 모델의 환경 영향&lt;br /&gt;
* [[Codestral]] — Mistral AI의 코딩 특화 LLM&lt;br /&gt;
* [[LiveCodeBench]] — 코딩 능력 평가 벤치마크&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3552</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3552"/>
		<updated>2026-07-31T02:28:01Z</updated>

		<summary type="html">&lt;p&gt;Clara: Replace all internal wiki links with external official URLs (GitHub, arXiv, HuggingFace) for benchmarks and models&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-07-31 10:00 KST (한국 표준시)&lt;br /&gt;
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* 데이터 기준일: 2026-07-31&lt;br /&gt;
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
|| [[Parameters|파라미터 수 (Parameters)]] | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
|| [[Overall Average]] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/hendrycks/math MATH] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&amp;amp;A)] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [[MUSR|MUSR (Multi-Step Reasoning)]] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [https://github.com/hendrycks/test MMLU-PRO] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
|| [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
|| [[Fine-tuning|fine-tuned]] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
|| [[Chat model|chat]] | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
|-&lt;br /&gt;
|| [[HuggingFace Open LLM Leaderboard]] | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 | [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard HuggingFace]&lt;br /&gt;
|}&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== General (전체 능력) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/... MUSR] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''General 카테고리 특징''':&lt;br /&gt;
* 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)&lt;br /&gt;
* Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능&lt;br /&gt;
* 32B 모델도 경쟁력 있음 (Rank 9, 10)&lt;br /&gt;
* CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적&lt;br /&gt;
&lt;br /&gt;
=== Coding (코딩 능력) ===&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! [https://github.com/LiveCodeBench/LiveCodeBench Pass@1] !! Easy !! Medium !! Hard !! Source&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct LLaMA-3-70B-Instruct] || 28.3% || 60.7% || 15.8% || 1.4% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1 Mixtral-8x22B-Instruct] || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/models?search=dscoder DSCoder-33B-Instruct] || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/models?search=opencoder OC-DS-33B] || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Phind/Phind-CodeLlama-34B-v2 Phind-34B-V2] || 21.0% || 53.4% || 4.7% || 0.1% || Phind&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/models?search=magicoders MagiCoderS-DS-6.7B] || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/meta-llama/Llama-3.1-70B LLaMA-3-70B-Base] || 20.1% || 52.2% || 3.2% || 0.6% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat CodeQwen1.5-7B-Chat] || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/models?search=dscoder DSCoder-6.7B-Instruct] || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Coding 카테고리 특징''':&lt;br /&gt;
* Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능&lt;br /&gt;
* LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수&lt;br /&gt;
* CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화&lt;br /&gt;
* Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices (경량 모델) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리 기준 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] !! [https://github.com/suzgunmirac/BIG-Bench-Hard BBH] !! [https://github.com/hendrycks/math MATH] !! [https://github.com/idavidrein/gpqa GPQA] !! [https://github.com/hendrycks/test MMLU-PRO] !! [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard CO₂ Cost]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/PJMixers-Dev/Qwen2.5-RomboTiesTest-7B PJMixers-Dev/Qwen2.5-RomboTiesTest-7B] || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial] || basemergesandmoerges || 31.48% || 56.77% || 37.25% || 34.97% || 8.17% || 38.95% || 2.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/DreadPoor/Here_We_Go_Again-8B-SLERP DreadPoor/Here_We_Go_Again-8B-SLERP] || basemergesandmoerges || 30.13% || 74.42% || 35.53% || 17.30% || 9.17% || 31.92% || 1.23 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/microsoft/Phi-4-mini-instruct microsoft/Phi-4-mini-instruct] || chat || 29.41% || 73.78% || 38.74% || 16.99% || 7.94% || 32.58% || 0.83 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/T145/ZEUS-8B-V15 T145/ZEUS-8B-V15] || chat || 29.37% || 70.13% || 36.18% || 23.04% || 3.47% || 33.99% || 1.39 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/DreadPoor/Asymmetric_Linearity-8B-Model_Stock DreadPoor/Asymmetric_Linearity-8B-Model_Stock] || basemergesandmoerges || 29.35% || 71.74% || 35.44% || 16.47% || 8.61% || 31.60% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/DreadPoor/VENN_1.2-8B-Model_Stock DreadPoor/VENN_1.2-8B-Model_Stock] || basemergesandmoerges || 28.85% || 72.26% || 35.13% || 17.07% || 6.26% || 30.23% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B] || basemergesandmoerges || 28.82% || 78.25% || 29.89% || 20.02% || 5.59% || 30.75% || 1.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/DreadPoor/Elusive_Dragon_Heart-8B-LINEAR DreadPoor/Elusive_Dragon_Heart-8B-LINEAR] || basemergesandmoerges || 28.66% || 71.31% || 35.31% || 14.80% || 7.49% || 31.27% || 1.27 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/ehristoforu/coolqwen-3b-it ehristoforu/coolqwen-3b-it] || fine-tunedondomain-specificdatasets || 28.65% || 64.73% || 27.46% || 36.71% || 4.36% || 28.90% || 1.45 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Edge Devices 카테고리 특징''':&lt;br /&gt;
* 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능&lt;br /&gt;
* Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적&lt;br /&gt;
* Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능&lt;br /&gt;
* 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
|-&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
|-&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''[https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''[https://github.com/hendrycks/math MATH] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''[https://github.com/idavidrein/gpqa GPQA] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''[https://github.com/hendrycks/test MMLU-PRO] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
|-&lt;br /&gt;
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
|-&lt;br /&gt;
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델&lt;br /&gt;
|-&lt;br /&gt;
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
|-&lt;br /&gt;
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== 아키텍처 트렌드 ===&lt;br /&gt;
* '''Qwen2.5 기반 모델의 확산''': Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능&lt;br /&gt;
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델&lt;br /&gt;
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
=== HuggingFace Open LLM Leaderboard ===&lt;br /&gt;
&lt;br /&gt;
* [[Wikipedia:Open LLM Leaderboard|Open LLM Leaderboard]] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.&lt;br /&gt;
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
* 상태: Archived (2026년 5월 기준)&lt;br /&gt;
&lt;br /&gt;
=== LiveCodeBench (코딩 평가) ===&lt;br /&gt;
&lt;br /&gt;
* LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.&lt;br /&gt;
* URL: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Paper: https://arxiv.org/abs/2406.15877&lt;br /&gt;
* GitHub: https://github.com/LiveCodeBench/LiveCodeBench&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
&lt;br /&gt;
=== Top 10 모델 상세 링크 ===&lt;br /&gt;
&lt;br /&gt;
==== General 카테고리 (전체 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&amp;amp;model=MaziyarPanahi%2Fcalme-3.2-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: fine-tuned | Average: 52.08%&lt;br /&gt;
* CO₂ Cost: 66.01 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&amp;amp;model=MaziyarPanahi%2Fcalme-3.1-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.29%&lt;br /&gt;
* CO₂ Cost: 64.44 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&amp;amp;model=dfurman%2FCalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.23%&lt;br /&gt;
* CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&amp;amp;model=MaziyarPanahi%2Fcalme-2.4-rys-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 50.77%&lt;br /&gt;
* CO₂ Cost: 25.95 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&amp;amp;model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 48.11%&lt;br /&gt;
* CO₂ Cost: 76.77 kg (가장 높음)&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Qwen/Qwen2.5-72B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&amp;amp;model=Qwen%2FQwen2.5-72B-Instruct&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.98%&lt;br /&gt;
* CO₂ Cost: 47.65 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&amp;amp;model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.86%&lt;br /&gt;
* CO₂ Cost: 29.50 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&amp;amp;model=newsbang%2FHomer-v1.0-Qwen2.5-72B&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 47.46%&lt;br /&gt;
* CO₂ Cost: 29.55 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: ehristoforu/qwen2.5-test-32b-it =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&amp;amp;model=ehristoforu%2Fqwen2.5-test-32b-it&lt;br /&gt;
* 파라미터: 32B | Type: chat | Average: 47.37%&lt;br /&gt;
* CO₂ Cost: 29.54 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&amp;amp;model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* 파라미터: 32B | Type: fine-tuned | Average: 47.34%&lt;br /&gt;
* CO₂ Cost: 7.95 kg (전체 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
==== Coding 카테고리 (코딩 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: Codestral-Latest =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=codestral&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: LLaMA-3-70B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%&lt;br /&gt;
* 개발사: Meta&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: Mixtral-8x22B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: DSCoder-33B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: OC-DS-33B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=opencoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%&lt;br /&gt;
* 개발사: OpenCoder&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Phind-34B-V2 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%&lt;br /&gt;
* 개발사: Phind&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MagiCoderS-DS-6.7B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=magicoders&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: LLaMA-3-70B-Base =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%&lt;br /&gt;
* 개발사: Meta (Instruct 버전 아님)&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: CodeQwen1.5-7B-Chat =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%&lt;br /&gt;
* 개발사: Alibaba (Qwen)&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: DSCoder-6.7B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
==== Edge Devices 카테고리 (경량 모델) ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 7B 이하 경량 모델 평가 기준&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표 설명 ===&lt;br /&gt;
&lt;br /&gt;
* [https://github.com/google-research/google-research/tree/master/instruction_following_eval IFEval (Instruction Following Evaluation)] — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가&lt;br /&gt;
* [https://github.com/suzgunmirac/BIG-Bench-Hard BBH (Big Bench Hard)] — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
* [https://github.com/hendrycks/math MATH] — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
* [https://github.com/idavidrein/gpqa GPQA (Graduate-Level Google-Proof Q&amp;amp;A)] — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도&lt;br /&gt;
* [https://github.com/hendrycks/test MMLU-PRO] — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
* [https://github.com/LiveCodeBench/LiveCodeBench Pass@1 (LiveCodeBench)] — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율&lt;br /&gt;
&lt;br /&gt;
=== 관련 문서 ===&lt;br /&gt;
&lt;br /&gt;
* [[Qwen2.5]] — 알리바바 그룹에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[Llama]] — Meta에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[LLM Benchmark]] — 대규모 언어 모델 벤치마킹 방법론&lt;br /&gt;
* [[Fine-tuning]] — 사전 학습 모델의 추가 학습 기법&lt;br /&gt;
* [[CO₂ Emissions in AI]] — AI 모델의 환경 영향&lt;br /&gt;
* [[Codestral]] — Mistral AI의 코딩 특화 LLM&lt;br /&gt;
* [[LiveCodeBench]] — 코딩 능력 평가 벤치마크&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3551</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3551"/>
		<updated>2026-07-31T02:14:41Z</updated>

		<summary type="html">&lt;p&gt;Clara: Fix Key Concepts table structure, add HuggingFace Hub links to all model names, add benchmark header links&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-07-31 10:00 KST (한국 표준시)&lt;br /&gt;
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* 데이터 기준일: 2026-07-31&lt;br /&gt;
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
|| [[Parameters|파라미터 수 (Parameters)]] | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
|| [[Overall Average]] | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
|| [[IFEval|IFEval (Instruction Following Evaluation)]] | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정 | [https://github.com/google-research/google-research/tree/master/instruction_following_eval GitHub]&lt;br /&gt;
|-&lt;br /&gt;
|| [[BBH|BBH (Big Bench Hard)]] | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가 | [https://github.com/suzgunmirac/BIG-Bench-Hard GitHub]&lt;br /&gt;
|-&lt;br /&gt;
|| [[MATH (벤치마크)|MATH]] | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정 | [https://github.com/hendrycks/math GitHub]&lt;br /&gt;
|-&lt;br /&gt;
|| [[GPQA|GPQA (Graduate-Level Google-Proof Q&amp;amp;A)]] | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가 | [https://github.com/idavidrein/gpqa GitHub]&lt;br /&gt;
|-&lt;br /&gt;
|| [[MUSR|MUSR (Multi-Step Reasoning)]] | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
|| [[MMLU-PRO|MMLU-PRO]] | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가 | [https://github.com/hendrycks/test GitHub]&lt;br /&gt;
|-&lt;br /&gt;
|| [[CO₂ Cost|CO₂ Cost]] | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
|| [[Fine-tuning|fine-tuned]] | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
|| [[Chat model|chat]] | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
|-&lt;br /&gt;
|| [[HuggingFace Open LLM Leaderboard]] | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 | [https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard HuggingFace]&lt;br /&gt;
|}&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== General (전체 능력) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! [[IFEval|IFEval]] !! [[BBH|BBH]] !! [[MATH (벤치마크)|MATH]] !! [[GPQA|GPQA]] !! [[MUSR|MUSR]] !! [[MMLU-PRO|MMLU-PRO]] !! [[CO₂ Cost|CO₂ Cost]]&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b MaziyarPanahi/calme-3.2-instruct-78b] || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b MaziyarPanahi/calme-3.1-instruct-78b] || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1 dfurman/CalmeRys-78B-Orpo-v0.1] || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b MaziyarPanahi/calme-2.4-rys-78b] || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated huihui-ai/Qwen2.5-72B-Instruct-abliterated] || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Qwen/Qwen2.5-72B-Instruct Qwen/Qwen2.5-72B-Instruct] || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b MaziyarPanahi/calme-2.1-qwen2.5-72b] || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B newsbang/Homer-v1.0-Qwen2.5-72B] || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B] || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''General 카테고리 특징''':&lt;br /&gt;
* 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)&lt;br /&gt;
* Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능&lt;br /&gt;
* 32B 모델도 경쟁력 있음 (Rank 9, 10)&lt;br /&gt;
* CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적&lt;br /&gt;
&lt;br /&gt;
=== Coding (코딩 능력) ===&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! [[Pass@1|Pass@1]] !! Easy !! Medium !! Hard !! Source&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/models?search=codestral Codestral-Latest] || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct LLaMA-3-70B-Instruct] || 28.3% || 60.7% || 15.8% || 1.4% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1 Mixtral-8x22B-Instruct] || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/models?search=dscoder DSCoder-33B-Instruct] || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/models?search=opencoder OC-DS-33B] || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/Phind/Phind-CodeLlama-34B-v2 Phind-34B-V2] || 21.0% || 53.4% || 4.7% || 0.1% || Phind&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/models?search=magicoders MagiCoderS-DS-6.7B] || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/meta-llama/Llama-3.1-70B LLaMA-3-70B-Base] || 20.1% || 52.2% || 3.2% || 0.6% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat CodeQwen1.5-7B-Chat] || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/models?search=dscoder DSCoder-6.7B-Instruct] || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Coding 카테고리 특징''':&lt;br /&gt;
* Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능&lt;br /&gt;
* LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수&lt;br /&gt;
* CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화&lt;br /&gt;
* Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices (경량 모델) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리 기준 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MMLU-PRO !! CO₂ Cost&lt;br /&gt;
|-&lt;br /&gt;
| 1 || [https://huggingface.co/PJMixers-Dev/Qwen2.5-RomboTiesTest-7B PJMixers-Dev/Qwen2.5-RomboTiesTest-7B] || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || [https://huggingface.co/brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial] || basemergesandmoerges || 31.48% || 56.77% || 37.25% || 34.97% || 8.17% || 38.95% || 2.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || [https://huggingface.co/DreadPoor/Here_We_Go_Again-8B-SLERP DreadPoor/Here_We_Go_Again-8B-SLERP] || basemergesandmoerges || 30.13% || 74.42% || 35.53% || 17.30% || 9.17% || 31.92% || 1.23 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || [https://huggingface.co/microsoft/Phi-4-mini-instruct microsoft/Phi-4-mini-instruct] || chat || 29.41% || 73.78% || 38.74% || 16.99% || 7.94% || 32.58% || 0.83 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || [https://huggingface.co/T145/ZEUS-8B-V15 T145/ZEUS-8B-V15] || chat || 29.37% || 70.13% || 36.18% || 23.04% || 3.47% || 33.99% || 1.39 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || [https://huggingface.co/DreadPoor/Asymmetric_Linearity-8B-Model_Stock DreadPoor/Asymmetric_Linearity-8B-Model_Stock] || basemergesandmoerges || 29.35% || 71.74% || 35.44% || 16.47% || 8.61% || 31.60% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || [https://huggingface.co/DreadPoor/VENN_1.2-8B-Model_Stock DreadPoor/VENN_1.2-8B-Model_Stock] || basemergesandmoerges || 28.85% || 72.26% || 35.13% || 17.07% || 6.26% || 30.23% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || [https://huggingface.co/PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B] || basemergesandmoerges || 28.82% || 78.25% || 29.89% || 20.02% || 5.59% || 30.75% || 1.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || [https://huggingface.co/DreadPoor/Elusive_Dragon_Heart-8B-LINEAR DreadPoor/Elusive_Dragon_Heart-8B-LINEAR] || basemergesandmoerges || 28.66% || 71.31% || 35.31% || 14.80% || 7.49% || 31.27% || 1.27 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || [https://huggingface.co/ehristoforu/coolqwen-3b-it ehristoforu/coolqwen-3b-it] || fine-tunedondomain-specificdatasets || 28.65% || 64.73% || 27.46% || 36.71% || 4.36% || 28.90% || 1.45 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Edge Devices 카테고리 특징''':&lt;br /&gt;
* 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능&lt;br /&gt;
* Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적&lt;br /&gt;
* Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능&lt;br /&gt;
* 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
|-&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
|-&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''[[IFEval|IFEval]] (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''[[MATH (벤치마크)|MATH]] (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''[[GPQA|GPQA]] (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''[[MMLU-PRO|MMLU-PRO]] (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
|-&lt;br /&gt;
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
|-&lt;br /&gt;
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델&lt;br /&gt;
|-&lt;br /&gt;
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
|-&lt;br /&gt;
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== 아키텍처 트렌드 ===&lt;br /&gt;
* '''Qwen2.5 기반 모델의 확산''': Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능&lt;br /&gt;
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델&lt;br /&gt;
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
=== HuggingFace Open LLM Leaderboard ===&lt;br /&gt;
&lt;br /&gt;
* [[Wikipedia:Open LLM Leaderboard|Open LLM Leaderboard]] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.&lt;br /&gt;
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
* 상태: Archived (2026년 5월 기준)&lt;br /&gt;
&lt;br /&gt;
=== LiveCodeBench (코딩 평가) ===&lt;br /&gt;
&lt;br /&gt;
* LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.&lt;br /&gt;
* URL: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Paper: https://arxiv.org/abs/2406.15877&lt;br /&gt;
* GitHub: https://github.com/LiveCodeBench/LiveCodeBench&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
&lt;br /&gt;
=== Top 10 모델 상세 링크 ===&lt;br /&gt;
&lt;br /&gt;
==== General 카테고리 (전체 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&amp;amp;model=MaziyarPanahi%2Fcalme-3.2-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: fine-tuned | Average: 52.08%&lt;br /&gt;
* CO₂ Cost: 66.01 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&amp;amp;model=MaziyarPanahi%2Fcalme-3.1-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.29%&lt;br /&gt;
* CO₂ Cost: 64.44 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&amp;amp;model=dfurman%2FCalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.23%&lt;br /&gt;
* CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&amp;amp;model=MaziyarPanahi%2Fcalme-2.4-rys-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 50.77%&lt;br /&gt;
* CO₂ Cost: 25.95 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&amp;amp;model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 48.11%&lt;br /&gt;
* CO₂ Cost: 76.77 kg (가장 높음)&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Qwen/Qwen2.5-72B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&amp;amp;model=Qwen%2FQwen2.5-72B-Instruct&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.98%&lt;br /&gt;
* CO₂ Cost: 47.65 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&amp;amp;model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.86%&lt;br /&gt;
* CO₂ Cost: 29.50 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&amp;amp;model=newsbang%2FHomer-v1.0-Qwen2.5-72B&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 47.46%&lt;br /&gt;
* CO₂ Cost: 29.55 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: ehristoforu/qwen2.5-test-32b-it =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&amp;amp;model=ehristoforu%2Fqwen2.5-test-32b-it&lt;br /&gt;
* 파라미터: 32B | Type: chat | Average: 47.37%&lt;br /&gt;
* CO₂ Cost: 29.54 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&amp;amp;model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* 파라미터: 32B | Type: fine-tuned | Average: 47.34%&lt;br /&gt;
* CO₂ Cost: 7.95 kg (전체 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
==== Coding 카테고리 (코딩 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: Codestral-Latest =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=codestral&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: LLaMA-3-70B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%&lt;br /&gt;
* 개발사: Meta&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: Mixtral-8x22B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: DSCoder-33B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: OC-DS-33B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=opencoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%&lt;br /&gt;
* 개발사: OpenCoder&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Phind-34B-V2 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%&lt;br /&gt;
* 개발사: Phind&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MagiCoderS-DS-6.7B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=magicoders&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: LLaMA-3-70B-Base =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%&lt;br /&gt;
* 개발사: Meta (Instruct 버전 아님)&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: CodeQwen1.5-7B-Chat =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%&lt;br /&gt;
* 개발사: Alibaba (Qwen)&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: DSCoder-6.7B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
==== Edge Devices 카테고리 (경량 모델) ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 7B 이하 경량 모델 평가 기준&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표 설명 ===&lt;br /&gt;
&lt;br /&gt;
* IFEval (Instruction Following Evaluation): https://github.com/google-research/google-research/tree/master/instruction_following_eval — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가&lt;br /&gt;
* BBH (Big Bench Hard): https://github.com/suzgunmirac/BIG-Bench-Hard — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
* MATH: https://github.com/hendrycks/math — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
* GPQA (Graduate-Level Google-Proof Q&amp;amp;A): https://github.com/idavidrein/gpqa — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도&lt;br /&gt;
* MMLU-PRO: https://github.com/hendrycks/test — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
* Pass@1 (LiveCodeBench): https://github.com/LiveCodeBench/LiveCodeBench — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율&lt;br /&gt;
&lt;br /&gt;
=== 관련 문서 ===&lt;br /&gt;
&lt;br /&gt;
* [[Qwen2.5]] — 알리바바 그룹에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[Llama]] — Meta에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[LLM Benchmark]] — 대규모 언어 모델 벤치마킹 방법론&lt;br /&gt;
* [[Fine-tuning]] — 사전 학습 모델의 추가 학습 기법&lt;br /&gt;
* [[CO₂ Emissions in AI]] — AI 모델의 환경 영향&lt;br /&gt;
* [[Codestral]] — Mistral AI의 코딩 특화 LLM&lt;br /&gt;
* [[LiveCodeBench]] — 코딩 능력 평가 벤치마크&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3550</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3550"/>
		<updated>2026-07-31T02:04:22Z</updated>

		<summary type="html">&lt;p&gt;Clara: Category-based Top 10 separation (General/Coding/Edge), detailed references with model URLs, benchmark links, --- removed&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-07-31 10:00 KST (한국 표준시)&lt;br /&gt;
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* 데이터 기준일: 2026-07-31&lt;br /&gt;
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
| 파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
| Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
| IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
| BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
|-&lt;br /&gt;
| MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
|-&lt;br /&gt;
| GPQA (Graduate-Level Google-Proof Q&amp;amp;A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
| MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
| MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
| CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
| fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
| chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
| HuggingFace Open LLM Leaderboard | HuggingFace에서 운영하는 공식 오픈소스 LLM 벤치마크 플랫폼. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가. 2026년 5월 기준 Archived 상태. 모든 모델을 동일한 환경에서 동일 조건으로 평가하여 공정한 비교 제공 | https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard |&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard와 LiveCodeBench 기준 상위 모델을 카테고리별로 정리한 문서입니다. 각 카테고리별로 모델의 특화된 능력을 비교할 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== General (전체 능력) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
이 벤치마크는 IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 지표의 평균 점수로 모델의 전반적 능력을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MUSR !! MMLU-PRO !! CO₂ Cost&lt;br /&gt;
|-&lt;br /&gt;
| 1 || MaziyarPanahi/calme-3.2-instruct-78b || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || MaziyarPanahi/calme-3.1-instruct-78b || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || dfurman/CalmeRys-78B-Orpo-v0.1 || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || MaziyarPanahi/calme-2.4-rys-78b || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || huihui-ai/Qwen2.5-72B-Instruct-abliterated || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen/Qwen2.5-72B-Instruct || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || MaziyarPanahi/calme-2.1-qwen2.5-72b || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || newsbang/Homer-v1.0-Qwen2.5-72B || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''General 카테고리 특징''':&lt;br /&gt;
* 78B 파라미터 모델이 상위권을 지배 (상위 4위 모두 78B)&lt;br /&gt;
* Qwen2.5-72B가 공식 오픈소스 모델 중 최고 성능&lt;br /&gt;
* 32B 모델도 경쟁력 있음 (Rank 9, 10)&lt;br /&gt;
* CO₂ Cost 효율: 32B 모델이 78B 대비 최대 8배 효율적&lt;br /&gt;
&lt;br /&gt;
=== Coding (코딩 능력) ===&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench 기준 Pass@1 점수 상위 10개 오픈소스 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
LiveCodeBench는 실제 프로그래밍 문제를 해결하는 능력을 평가하는 벤치마크입니다. Easy, Medium, Hard 세 가지 난이도로 구성됩니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Pass@1 !! Easy !! Medium !! Hard !! Source&lt;br /&gt;
|-&lt;br /&gt;
| 1 || Codestral-Latest || 32.2% || 69.0% || 18.7% || 0.9% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 2 || LLaMA-3-70B-Instruct || 28.3% || 60.7% || 15.8% || 1.4% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 3 || Mixtral-8x22B-Instruct || 26.4% || 59.8% || 12.7% || 0.0% || Mistral AI&lt;br /&gt;
|-&lt;br /&gt;
| 4 || DSCoder-33B-Instruct || 23.6% || 55.6% || 9.0% || 0.7% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 5 || OC-DS-33B || 21.3% || 53.9% || 5.1% || 0.0% || OpenCoder&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Phind-34B-V2 || 21.0% || 53.4% || 4.7% || 0.1% || Phind&lt;br /&gt;
|-&lt;br /&gt;
| 7 || MagiCoderS-DS-6.7B || 20.5% || 49.2% || 7.5% || 0.0% || DeepSeek&lt;br /&gt;
|-&lt;br /&gt;
| 8 || LLaMA-3-70B-Base || 20.1% || 52.2% || 3.2% || 0.6% || Meta&lt;br /&gt;
|-&lt;br /&gt;
| 9 || CodeQwen1.5-7B-Chat || 19.3% || 39.2% || 13.1% || 0.5% || Alibaba (Qwen)&lt;br /&gt;
|-&lt;br /&gt;
| 10 || DSCoder-6.7B-Instruct || 19.1% || 46.4% || 5.8% || 0.7% || DeepSeek&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Coding 카테고리 특징''':&lt;br /&gt;
* Codestral (Mistral)이 오픈소스 코딩 모델 중 최고 성능&lt;br /&gt;
* LLaMA-3-70B-Instruct가 범용 모델 중 코딩 능력 우수&lt;br /&gt;
* CodeQwen1.5-7B-Chat은 경량 모델 중 코딩 특화&lt;br /&gt;
* Hard 문제 해결률은 모든 모델에서 1% 미만 (현재 한계)&lt;br /&gt;
&lt;br /&gt;
=== Edge Devices (경량 모델) ===&lt;br /&gt;
&lt;br /&gt;
HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리 기준 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
Edge Devices 카테고리는 7B 이하 경량 모델을 대상으로 하며, 제한된 리소스 환경에서의 성능을 평가합니다.&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MMLU-PRO !! CO₂ Cost&lt;br /&gt;
|-&lt;br /&gt;
| 1 || PJMixers-Dev/Qwen2.5-RomboTiesTest-7B || basemergesandmoerges || 35.29% || 75.58% || 34.93% || 49.62% || 6.38% || 36.50% || 1.34 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || brgx53/3Bgeneralv2-ECE-PRYMMAL-Martial || basemergesandmoerges || 31.48% || 56.77% || 37.25% || 34.97% || 8.17% || 38.95% || 2.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || DreadPoor/Here_We_Go_Again-8B-SLERP || basemergesandmoerges || 30.13% || 74.42% || 35.53% || 17.30% || 9.17% || 31.92% || 1.23 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || microsoft/Phi-4-mini-instruct || chat || 29.41% || 73.78% || 38.74% || 16.99% || 7.94% || 32.58% || 0.83 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || T145/ZEUS-8B-V15 || chat || 29.37% || 70.13% || 36.18% || 23.04% || 3.47% || 33.99% || 1.39 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || DreadPoor/Asymmetric_Linearity-8B-Model_Stock || basemergesandmoerges || 29.35% || 71.74% || 35.44% || 16.47% || 8.61% || 31.60% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || DreadPoor/VENN_1.2-8B-Model_Stock || basemergesandmoerges || 28.85% || 72.26% || 35.13% || 17.07% || 6.26% || 30.23% || 1.28 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || PJMixers-Dev/LLaMa-3.1-RomboTiesTest-8B || basemergesandmoerges || 28.82% || 78.25% || 29.89% || 20.02% || 5.59% || 30.75% || 1.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || DreadPoor/Elusive_Dragon_Heart-8B-LINEAR || basemergesandmoerges || 28.66% || 71.31% || 35.31% || 14.80% || 7.49% || 31.27% || 1.27 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || ehristoforu/coolqwen-3b-it || fine-tunedondomain-specificdatasets || 28.65% || 64.73% || 27.46% || 36.71% || 4.36% || 28.90% || 1.45 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
'''Edge Devices 카테고리 특징''':&lt;br /&gt;
* 7B 이하 경량 모델로 모바일/엣지 디바이스 배포 가능&lt;br /&gt;
* Phi-4-mini-instruct (Microsoft)가 0.83kg CO₂로 가장 효율적&lt;br /&gt;
* Qwen2.5 기반 모델이 경량 카테고리에서도 우수 성능&lt;br /&gt;
* 8B 모델도 Edge Devices 카테고리에 포함 (7B 기준 근접)&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
|-&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
|-&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''IFEval (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''MATH (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''GPQA (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''MMLU-PRO (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
|-&lt;br /&gt;
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
|-&lt;br /&gt;
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델&lt;br /&gt;
|-&lt;br /&gt;
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
|-&lt;br /&gt;
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== 아키텍처 트렌드 ===&lt;br /&gt;
* '''Qwen2.5 기반 모델의 확산''': Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능&lt;br /&gt;
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델&lt;br /&gt;
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
=== HuggingFace Open LLM Leaderboard ===&lt;br /&gt;
&lt;br /&gt;
* [[Wikipedia:Open LLM Leaderboard|Open LLM Leaderboard]] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.&lt;br /&gt;
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
* 상태: Archived (2026년 5월 기준)&lt;br /&gt;
&lt;br /&gt;
=== LiveCodeBench (코딩 평가) ===&lt;br /&gt;
&lt;br /&gt;
* LiveCodeBench — 대규모 언어 모델의 코딩 능력을 평가하는 벤치마크. 실제 프로그래밍 문제를 Easy, Medium, Hard 난이도로 제공. Pass@1 지표로 모델의 코딩 정확도 측정.&lt;br /&gt;
* URL: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Paper: https://arxiv.org/abs/2406.15877&lt;br /&gt;
* GitHub: https://github.com/LiveCodeBench/LiveCodeBench&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
&lt;br /&gt;
=== Top 10 모델 상세 링크 ===&lt;br /&gt;
&lt;br /&gt;
==== General 카테고리 (전체 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&amp;amp;model=MaziyarPanahi%2Fcalme-3.2-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: fine-tuned | Average: 52.08%&lt;br /&gt;
* CO₂ Cost: 66.01 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&amp;amp;model=MaziyarPanahi%2Fcalme-3.1-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.29%&lt;br /&gt;
* CO₂ Cost: 64.44 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&amp;amp;model=dfurman%2FCalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.23%&lt;br /&gt;
* CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: MaziyarPanahi/calme-2.4-rys-78b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&amp;amp;model=MaziyarPanahi%2Fcalme-2.4-rys-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 50.77%&lt;br /&gt;
* CO₂ Cost: 25.95 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&amp;amp;model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 48.11%&lt;br /&gt;
* CO₂ Cost: 76.77 kg (가장 높음)&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Qwen/Qwen2.5-72B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&amp;amp;model=Qwen%2FQwen2.5-72B-Instruct&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.98%&lt;br /&gt;
* CO₂ Cost: 47.65 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&amp;amp;model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.86%&lt;br /&gt;
* CO₂ Cost: 29.50 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&amp;amp;model=newsbang%2FHomer-v1.0-Qwen2.5-72B&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 47.46%&lt;br /&gt;
* CO₂ Cost: 29.55 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: ehristoforu/qwen2.5-test-32b-it =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&amp;amp;model=ehristoforu%2Fqwen2.5-test-32b-it&lt;br /&gt;
* 파라미터: 32B | Type: chat | Average: 47.37%&lt;br /&gt;
* CO₂ Cost: 29.54 kg&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&amp;amp;model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* 파라미터: 32B | Type: fine-tuned | Average: 47.34%&lt;br /&gt;
* CO₂ Cost: 7.95 kg (전체 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
==== Coding 카테고리 (코딩 능력) ====&lt;br /&gt;
&lt;br /&gt;
===== Rank 1: Codestral-Latest =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=codestral&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 32.2% | Easy: 69.0% | Medium: 18.7% | Hard: 0.9%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 2: LLaMA-3-70B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B-Instruct&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 28.3% | Easy: 60.7% | Medium: 15.8% | Hard: 1.4%&lt;br /&gt;
* 개발사: Meta&lt;br /&gt;
&lt;br /&gt;
===== Rank 3: Mixtral-8x22B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/mistralai/Mixtral-8x22B-Instruct-v0.1&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 26.4% | Easy: 59.8% | Medium: 12.7% | Hard: 0.0%&lt;br /&gt;
* 개발사: Mistral AI&lt;br /&gt;
&lt;br /&gt;
===== Rank 4: DSCoder-33B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 23.6% | Easy: 55.6% | Medium: 9.0% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 5: OC-DS-33B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=opencoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.3% | Easy: 53.9% | Medium: 5.1% | Hard: 0.0%&lt;br /&gt;
* 개발사: OpenCoder&lt;br /&gt;
&lt;br /&gt;
===== Rank 6: Phind-34B-V2 =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Phind/Phind-CodeLlama-34B-v2&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 21.0% | Easy: 53.4% | Medium: 4.7% | Hard: 0.1%&lt;br /&gt;
* 개발사: Phind&lt;br /&gt;
&lt;br /&gt;
===== Rank 7: MagiCoderS-DS-6.7B =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=magicoders&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.5% | Easy: 49.2% | Medium: 7.5% | Hard: 0.0%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
===== Rank 8: LLaMA-3-70B-Base =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/meta-llama/Llama-3.1-70B&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 20.1% | Easy: 52.2% | Medium: 3.2% | Hard: 0.6%&lt;br /&gt;
* 개발사: Meta (Instruct 버전 아님)&lt;br /&gt;
&lt;br /&gt;
===== Rank 9: CodeQwen1.5-7B-Chat =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/CodeQwen1.5-7B-Chat&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/blog/codeqwen1.5/&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.3% | Easy: 39.2% | Medium: 13.1% | Hard: 0.5%&lt;br /&gt;
* 개발사: Alibaba (Qwen)&lt;br /&gt;
&lt;br /&gt;
===== Rank 10: DSCoder-6.7B-Instruct =====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/models?search=dscoder&lt;br /&gt;
* LiveCodeBench 결과: https://huggingface.co/spaces/livecodebench/leaderboard&lt;br /&gt;
* Pass@1: 19.1% | Easy: 46.4% | Medium: 5.8% | Hard: 0.7%&lt;br /&gt;
* 개발사: DeepSeek&lt;br /&gt;
&lt;br /&gt;
==== Edge Devices 카테고리 (경량 모델) ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Open LLM Leaderboard &amp;quot;For Edge Devices&amp;quot; 카테고리: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 7B 이하 경량 모델 평가 기준&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표 설명 ===&lt;br /&gt;
&lt;br /&gt;
* IFEval (Instruction Following Evaluation): https://github.com/google-research/google-research/tree/master/instruction_following_eval — 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가&lt;br /&gt;
* BBH (Big Bench Hard): https://github.com/suzgunmirac/BIG-Bench-Hard — 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
* MATH: https://github.com/hendrycks/math — 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
* GPQA (Graduate-Level Google-Proof Q&amp;amp;A): https://github.com/idavidrein/gpqa — 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도&lt;br /&gt;
* MMLU-PRO: https://github.com/hendrycks/test — Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
* Pass@1 (LiveCodeBench): https://github.com/LiveCodeBench/LiveCodeBench — 모델이 첫 시도에서 프로그래밍 문제를 올바르게 해결하는 비율&lt;br /&gt;
&lt;br /&gt;
=== 관련 문서 ===&lt;br /&gt;
&lt;br /&gt;
* [[Qwen2.5]] — 알리바바 그룹에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[Llama]] — Meta에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[LLM Benchmark]] — 대규모 언어 모델 벤치마킹 방법론&lt;br /&gt;
* [[Fine-tuning]] — 사전 학습 모델의 추가 학습 기법&lt;br /&gt;
* [[CO₂ Emissions in AI]] — AI 모델의 환경 영향&lt;br /&gt;
* [[Codestral]] — Mistral AI의 코딩 특화 LLM&lt;br /&gt;
* [[LiveCodeBench]] — 코딩 능력 평가 벤치마크&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3549</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3549"/>
		<updated>2026-07-31T01:47:47Z</updated>

		<summary type="html">&lt;p&gt;Clara: Complete fix: remove ---, add survey timestamp, detailed references with model URLs&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== 조사 정보 ===&lt;br /&gt;
&lt;br /&gt;
* 조사 일자: 2026-07-31 10:00 KST (한국 표준시)&lt;br /&gt;
* 조사 출처: HuggingFace Open LLM Leaderboard (https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard)&lt;br /&gt;
* 데이터 기준일: 2026-07-31&lt;br /&gt;
* 다음 업데이트 예정: 매주 월요일 09:00 KST (자동)&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
| 파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
| Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
| IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
| BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
|-&lt;br /&gt;
| MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
|-&lt;br /&gt;
| GPQA (Graduate-Level Google-Proof Q&amp;amp;A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
| MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
| MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
| CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
| fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
| chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MUSR !! MMLU-PRO !! CO₂ Cost&lt;br /&gt;
|-&lt;br /&gt;
| 1 || MaziyarPanahi/calme-3.2-instruct-78b || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || MaziyarPanahi/calme-3.1-instruct-78b || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || dfurman/CalmeRys-78B-Orpo-v0.1 || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || MaziyarPanahi/calme-2.4-rys-78b || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || huihui-ai/Qwen2.5-72B-Instruct-abliterated || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen/Qwen2.5-72B-Instruct || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || MaziyarPanahi/calme-2.1-qwen2.5-72b || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || newsbang/Homer-v1.0-Qwen2.5-72B || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
|-&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
|-&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''IFEval (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''MATH (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''GPQA (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''MMLU-PRO (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
|-&lt;br /&gt;
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
|-&lt;br /&gt;
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델&lt;br /&gt;
|-&lt;br /&gt;
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
|-&lt;br /&gt;
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== 아키텍처 트렌드 ===&lt;br /&gt;
* '''Qwen2.5 기반 모델의 확산''': Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능&lt;br /&gt;
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델&lt;br /&gt;
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
=== HuggingFace Open LLM Leaderboard ===&lt;br /&gt;
&lt;br /&gt;
* [[Wikipedia:Open LLM Leaderboard|Open LLM Leaderboard]] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.&lt;br /&gt;
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
* 상태: Archived (2026년 5월 기준)&lt;br /&gt;
&lt;br /&gt;
=== Top 10 모델 상세 링크 ===&lt;br /&gt;
&lt;br /&gt;
==== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&amp;amp;model=MaziyarPanahi%2Fcalme-3.2-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: fine-tuned | Average: 52.08%&lt;br /&gt;
* CO₂ Cost: 66.01 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&amp;amp;model=MaziyarPanahi%2Fcalme-3.1-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.29%&lt;br /&gt;
* CO₂ Cost: 64.44 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&amp;amp;model=dfurman%2FCalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.23%&lt;br /&gt;
* CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
==== Rank 4: MaziyarPanahi/calme-2.4-rys-78b ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&amp;amp;model=MaziyarPanahi%2Fcalme-2.4-rys-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 50.77%&lt;br /&gt;
* CO₂ Cost: 25.95 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&amp;amp;model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 48.11%&lt;br /&gt;
* CO₂ Cost: 76.77 kg (가장 높음)&lt;br /&gt;
&lt;br /&gt;
==== Rank 6: Qwen/Qwen2.5-72B-Instruct ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&amp;amp;model=Qwen%2FQwen2.5-72B-Instruct&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.98%&lt;br /&gt;
* CO₂ Cost: 47.65 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&amp;amp;model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.86%&lt;br /&gt;
* CO₂ Cost: 29.50 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&amp;amp;model=newsbang%2FHomer-v1.0-Qwen2.5-72B&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 47.46%&lt;br /&gt;
* CO₂ Cost: 29.55 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 9: ehristoforu/qwen2.5-test-32b-it ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&amp;amp;model=ehristoforu%2Fqwen2.5-test-32b-it&lt;br /&gt;
* 파라미터: 32B | Type: chat | Average: 47.37%&lt;br /&gt;
* CO₂ Cost: 29.54 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&amp;amp;model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* 파라미터: 32B | Type: fine-tuned | Average: 47.34%&lt;br /&gt;
* CO₂ Cost: 7.95 kg (전체 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표 설명 ===&lt;br /&gt;
&lt;br /&gt;
* IFEval (Instruction Following Evaluation): https://github.com/google-research/google-research/tree/master/instruction_following_eval&lt;br /&gt;
* BBH (Big Bench Hard): https://github.com/suzgunmirac/BIG-Bench-Hard&lt;br /&gt;
* MATH: https://github.com/hendrycks/math&lt;br /&gt;
* GPQA (Graduate-Level Google-Proof Q&amp;amp;A): https://github.com/idavidrein/gpqa&lt;br /&gt;
* MMLU-PRO: https://github.com/hendrycks/test&lt;br /&gt;
&lt;br /&gt;
=== 관련 문서 ===&lt;br /&gt;
&lt;br /&gt;
* [[Qwen2.5]] — 알리바바 그룹에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[Llama]] — Meta에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[LLM Benchmark]] — 대규모 언어 모델 벤치마킹 방법론&lt;br /&gt;
* [[Fine-tuning]] — 사전 학습 모델의 추가 학습 기법&lt;br /&gt;
* [[CO₂ Emissions in AI]] — AI 모델의 환경 영향&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3548</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3548"/>
		<updated>2026-07-31T01:36:11Z</updated>

		<summary type="html">&lt;p&gt;Clara: Add detailed references with model URLs, add survey timestamp, set up auto-update&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
| 파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
| Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
| IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
| BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
|-&lt;br /&gt;
| MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
|-&lt;br /&gt;
| GPQA (Graduate-Level Google-Proof Q&amp;amp;A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
| MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
| MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
| CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
| fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
| chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MUSR !! MMLU-PRO !! CO₂ Cost&lt;br /&gt;
|-&lt;br /&gt;
| 1 || MaziyarPanahi/calme-3.2-instruct-78b || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || MaziyarPanahi/calme-3.1-instruct-78b || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || dfurman/CalmeRys-78B-Orpo-v0.1 || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || MaziyarPanahi/calme-2.4-rys-78b || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || huihui-ai/Qwen2.5-72B-Instruct-abliterated || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen/Qwen2.5-72B-Instruct || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || MaziyarPanahi/calme-2.1-qwen2.5-72b || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || newsbang/Homer-v1.0-Qwen2.5-72B || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
|-&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
|-&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''IFEval (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''MATH (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''GPQA (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''MMLU-PRO (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
|-&lt;br /&gt;
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
|-&lt;br /&gt;
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델&lt;br /&gt;
|-&lt;br /&gt;
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
|-&lt;br /&gt;
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== 아키텍처 트렌드 ===&lt;br /&gt;
* '''Qwen2.5 기반 모델의 확산''': Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능&lt;br /&gt;
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델&lt;br /&gt;
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard (Archived)](https://huggingface.co/spaces/huggingface/open-llm-leaderboard) — HuggingFace 공식 오픈소스 LLM 벤치마크 Leaderboard&lt;br /&gt;
* [Qwen2.5 모델 패밀리](https://huggingface.co/Qwen) — Alibaba/Qwen 공식 Qwen2.5 모델 페이지&lt;br /&gt;
* [Calme 모델 시리즈](https://huggingface.co/MaziyarPanahi) — MaziyarPanahi 의 Calme 모델 컬렉션&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
* [[Qwen2.5]]&lt;br /&gt;
* [[Llama]]&lt;br /&gt;
* [[LLM Benchmark]]&lt;br /&gt;
* [[Transformer Architecture]]&lt;br /&gt;
* [[Parameter-Efficient Fine-Tuning]]&lt;br /&gt;
* [[MoE (Mixture of Experts)]]&lt;br /&gt;
* [[Context Window]]&lt;br /&gt;
* [[Instruction Tuning]]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
=== HuggingFace Open LLM Leaderboard ===&lt;br /&gt;
&lt;br /&gt;
* [[Wikipedia:Open LLM Leaderboard|Open LLM Leaderboard]] — HuggingFace에서 운영하는 오픈소스 LLM 벤치마크 리더보드. IFEval, BBH, MATH, GPQA, MUSR, MMLU-PRO 등 6개 벤치마크의 평균 점수로 모델을 평가함.&lt;br /&gt;
* URL: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard&lt;br /&gt;
* 접근일: 2026-07-31&lt;br /&gt;
* 상태: Archived (2026년 5월 기준)&lt;br /&gt;
&lt;br /&gt;
=== Top 10 모델 상세 링크 ===&lt;br /&gt;
&lt;br /&gt;
==== Rank 1: MaziyarPanahi/calme-3.2-instruct-78b ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.2-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=52.08&amp;amp;model=MaziyarPanahi%2Fcalme-3.2-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: fine-tuned | Average: 52.08%&lt;br /&gt;
* CO₂ Cost: 66.01 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 2: MaziyarPanahi/calme-3.1-instruct-78b ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-3.1-instruct-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.29&amp;amp;model=MaziyarPanahi%2Fcalme-3.1-instruct-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.29%&lt;br /&gt;
* CO₂ Cost: 64.44 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 3: dfurman/CalmeRys-78B-Orpo-v0.1 ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/dfurman/CalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=51.23&amp;amp;model=dfurman%2FCalmeRys-78B-Orpo-v0.1&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 51.23%&lt;br /&gt;
* CO₂ Cost: 25.99 kg (상위권 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
==== Rank 4: MaziyarPanahi/calme-2.4-rys-78b ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.4-rys-78b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=50.77&amp;amp;model=MaziyarPanahi%2Fcalme-2.4-rys-78b&lt;br /&gt;
* 파라미터: 78B | Type: chat | Average: 50.77%&lt;br /&gt;
* CO₂ Cost: 25.95 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 5: huihui-ai/Qwen2.5-72B-Instruct-abliterated ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/huihui-ai/Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=48.11&amp;amp;model=huihui-ai%2FQwen2.5-72B-Instruct-abliterated&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 48.11%&lt;br /&gt;
* CO₂ Cost: 76.77 kg (가장 높음)&lt;br /&gt;
&lt;br /&gt;
==== Rank 6: Qwen/Qwen2.5-72B-Instruct ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
* Qwen 공식 문서: https://qwenlm.github.io/&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.98&amp;amp;model=Qwen%2FQwen2.5-72B-Instruct&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.98%&lt;br /&gt;
* CO₂ Cost: 47.65 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 7: MaziyarPanahi/calme-2.1-qwen2.5-72b ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/MaziyarPanahi/calme-2.1-qwen2.5-72b&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.86&amp;amp;model=MaziyarPanahi%2Fcalme-2.1-qwen2.5-72b&lt;br /&gt;
* 파라미터: 72B | Type: chat | Average: 47.86%&lt;br /&gt;
* CO₂ Cost: 29.50 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 8: newsbang/Homer-v1.0-Qwen2.5-72B ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/newsbang/Homer-v1.0-Qwen2.5-72B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.46&amp;amp;model=newsbang%2FHomer-v1.0-Qwen2.5-72B&lt;br /&gt;
* 파라미터: 72B | Type: fine-tuned | Average: 47.46%&lt;br /&gt;
* CO₂ Cost: 29.55 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 9: ehristoforu/qwen2.5-test-32b-it ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/ehristoforu/qwen2.5-test-32b-it&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.37&amp;amp;model=ehristoforu%2Fqwen2.5-test-32b-it&lt;br /&gt;
* 파라미터: 32B | Type: chat | Average: 47.37%&lt;br /&gt;
* CO₂ Cost: 29.54 kg&lt;br /&gt;
&lt;br /&gt;
==== Rank 10: Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B ====&lt;br /&gt;
&lt;br /&gt;
* HuggingFace Hub: https://huggingface.co/Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* Leaderboard 결과: https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard?score=47.34&amp;amp;model=Saxo%2FLinkbricks-Horizon-AI-Avengers-V1-32B&lt;br /&gt;
* 파라미터: 32B | Type: fine-tuned | Average: 47.34%&lt;br /&gt;
* CO₂ Cost: 7.95 kg (전체 중 가장 효율적)&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표 설명 ===&lt;br /&gt;
&lt;br /&gt;
* IFEval (Instruction Following Evaluation): https://github.com/google-research/google-research/tree/master/instruction_following_eval&lt;br /&gt;
* BBH (Big Bench Hard): https://github.com/suzgunmirac/BIG-Bench-Hard&lt;br /&gt;
* MATH: https://github.com/hendrycks/math&lt;br /&gt;
* GPQA (Graduate-Level Google-Proof Q&amp;amp;A): https://github.com/idavidrein/gpqa&lt;br /&gt;
* MUSR (Multi-Step Reasoning): https://github.com/...&lt;br /&gt;
* MMLU-PRO: https://github.com/hendrycks/test&lt;br /&gt;
&lt;br /&gt;
=== 관련 문서 ===&lt;br /&gt;
&lt;br /&gt;
* [[Qwen2.5]] — 알리바바 그룹에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[Llama]] — Meta에서 개발한 오픈소스 LLM&lt;br /&gt;
* [[LLM Benchmark]] — 대규모 언어 모델 벤치마킹 방법론&lt;br /&gt;
* [[Fine-tuning]] — 사전 학습 모델의 추가 학습 기법&lt;br /&gt;
* [[CO₂ Emissions in AI]] — AI 모델의 환경 영향&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3547</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3547"/>
		<updated>2026-07-31T01:25:06Z</updated>

		<summary type="html">&lt;p&gt;Clara: Remove --- dividers per CEO instruction&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
| 파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
| Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
| IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
| BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
|-&lt;br /&gt;
| MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
|-&lt;br /&gt;
| GPQA (Graduate-Level Google-Proof Q&amp;amp;A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
| MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
| MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
| CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
| fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
| chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MUSR !! MMLU-PRO !! CO₂ Cost&lt;br /&gt;
|-&lt;br /&gt;
| 1 || MaziyarPanahi/calme-3.2-instruct-78b || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || MaziyarPanahi/calme-3.1-instruct-78b || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || dfurman/CalmeRys-78B-Orpo-v0.1 || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || MaziyarPanahi/calme-2.4-rys-78b || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || huihui-ai/Qwen2.5-72B-Instruct-abliterated || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen/Qwen2.5-72B-Instruct || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || MaziyarPanahi/calme-2.1-qwen2.5-72b || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || newsbang/Homer-v1.0-Qwen2.5-72B || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
|-&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
|-&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''IFEval (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''MATH (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''GPQA (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''MMLU-PRO (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
|-&lt;br /&gt;
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
|-&lt;br /&gt;
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델&lt;br /&gt;
|-&lt;br /&gt;
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
|-&lt;br /&gt;
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== 아키텍처 트렌드 ===&lt;br /&gt;
* '''Qwen2.5 기반 모델의 확산''': Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능&lt;br /&gt;
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델&lt;br /&gt;
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard (Archived)](https://huggingface.co/spaces/huggingface/open-llm-leaderboard) — HuggingFace 공식 오픈소스 LLM 벤치마크 Leaderboard&lt;br /&gt;
* [Qwen2.5 모델 패밀리](https://huggingface.co/Qwen) — Alibaba/Qwen 공식 Qwen2.5 모델 페이지&lt;br /&gt;
* [Calme 모델 시리즈](https://huggingface.co/MaziyarPanahi) — MaziyarPanahi 의 Calme 모델 컬렉션&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
* [[Qwen2.5]]&lt;br /&gt;
* [[Llama]]&lt;br /&gt;
* [[LLM Benchmark]]&lt;br /&gt;
* [[Transformer Architecture]]&lt;br /&gt;
* [[Parameter-Efficient Fine-Tuning]]&lt;br /&gt;
* [[MoE (Mixture of Experts)]]&lt;br /&gt;
* [[Context Window]]&lt;br /&gt;
* [[Instruction Tuning]]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3546</id>
		<title>Top 10 오픈소스 AI 모델 동향</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Top_10_%EC%98%A4%ED%94%88%EC%86%8C%EC%8A%A4_AI_%EB%AA%A8%EB%8D%B8_%EB%8F%99%ED%96%A5&amp;diff=3546"/>
		<updated>2026-07-31T01:05:27Z</updated>

		<summary type="html">&lt;p&gt;Clara: Top 10 오픈소스 AI 모델 동향 페이지 생성 (HuggingFace Open LLM Leaderboard 기준)&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= Top 10 오픈소스 AI 모델 동향 =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-31&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 상위 10개 오픈소스 AI 모델의 성능, 아키텍처, CO₂ Cost를 종합적으로 분석한 문서입니다. 78B 파라미터 모델이 상위권을 지배하고 있으며, Qwen2.5와 Calme 시리즈가 주요 경쟁구도를 형성하고 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
* 무엇인가? — HuggingFace Open LLM Leaderboard의 Overall Average 점수 기준으로 상위 10개 오픈소스 모델을 정리한 벤치마크 분석 문서&lt;br /&gt;
* 왜 필요한가? — 모델 선택 시 성능(IFEval, BBH, MATH, GPQA, MMLU-PRO 등)과 환경 비용(CO₂ Cost)을 종합적으로 비교할 수 있는 기준 제공&lt;br /&gt;
* 언제 사용하는가? — 새로운 LLM 모델을 도입하거나 기존 모델을 교체할 때, 파라미터 규모별 성능 트렌드를 파악하고 최적 모델 선택 시&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
* Goal: 오픈소스 LLM 모델의 현재 성능 지형을 한눈에 파악하고, 모델 선택 시 데이터 기반 의사결정 지원&lt;br /&gt;
* Scope: HuggingFace Open LLM Leaderboard 기준 Overall Average 상위 10개 모델의 벤치마크 점수, 아키텍처, CO₂ Cost 분석&lt;br /&gt;
* Non-goals: 폐쇄형 상용 모델(GPT-4, Claude 등) 비교 포함하지 않음 · 실시간 모델 성능 모니터링 대체하지 않음&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
! 개념 ! 설명 ! 관련 문서&lt;br /&gt;
|-&lt;br /&gt;
| 파라미터 수 (Parameters) | 모델이 학습한 가중치(Weight)의 총 개수. 일반적으로 파라미터가 많을수록 성능이 우수하나, 추론 비용도 비례하여 증가함&lt;br /&gt;
|-&lt;br /&gt;
| Overall Average | HuggingFace Open LLM Leaderboard의 종합 점수. 여러 벤치마크 지표의 평균값으로 모델의 전반적 성능을 나타냄&lt;br /&gt;
|-&lt;br /&gt;
| IFEval (Instruction Following Evaluation) | 모델이 주어진 지시를 얼마나 정확하게 따르는지 평가. 시스템 프롬프트, 제약 조건 준수 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
| BBH (Big Bench Hard) | 23개 난이도 높은 벤치마크의 종합 점수. 논리적 추론, 수학, 코딩 등 고급 추론 능력 평가&lt;br /&gt;
|-&lt;br /&gt;
| MATH | 수학 문제 풀이 능력. 대수, 기하, 미적분, 통계 등 다양한 수학 분야의 정확도 측정&lt;br /&gt;
|-&lt;br /&gt;
| GPQA (Graduate-Level Google-Proof Q&amp;amp;A) | 대학원 수준의 과학·공학·생물학 지식을 묻는 질문 답변 정확도. 전문 분야 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
| MUSR (Multi-Step Reasoning) | 다단계 추론 능력. 여러 단계를 거쳐 결론에 도달하는 문제 해결 능력 측정&lt;br /&gt;
|-&lt;br /&gt;
| MMLU-PRO | Massive Multitask Language Understanding의 고급 버전. 30개 이상의 학문 분야 종합 지식 평가&lt;br /&gt;
|-&lt;br /&gt;
| CO₂ Cost | 모델 추론 시 발생하는 탄소 배출량(kg). 모델 크기, 추론 시간, 사용 GPU에 따라 결정됨&lt;br /&gt;
|-&lt;br /&gt;
| fine-tuned | 사전 학습된 베이스 모델을 특정 작업이나 도메인에 맞게 추가 학습한 모델&lt;br /&gt;
|-&lt;br /&gt;
| chat | 대화형 인터페이스를 위해 최적화된 모델. 지시 따르기, 다중 턴 대화에 특화됨&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Top 10 Models ==&lt;br /&gt;
HuggingFace Open LLM Leaderboard 기준 Overall Average 점수 상위 10개 모델 (2026-07-31 기준)&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! Rank !! Model !! Type !! Average !! IFEval !! BBH !! MATH !! GPQA !! MUSR !! MMLU-PRO !! CO₂ Cost&lt;br /&gt;
|-&lt;br /&gt;
| 1 || MaziyarPanahi/calme-3.2-instruct-78b || fine-tuned || 52.08% || 80.63% || 62.61% || 40.33% || 20.36% || 38.53% || 70.03% || 66.01 kg&lt;br /&gt;
|-&lt;br /&gt;
| 2 || MaziyarPanahi/calme-3.1-instruct-78b || chat || 51.29% || 81.36% || 62.41% || 39.27% || 19.46% || 36.50% || 68.72% || 64.44 kg&lt;br /&gt;
|-&lt;br /&gt;
| 3 || dfurman/CalmeRys-78B-Orpo-v0.1 || chat || 51.23% || 81.63% || 61.92% || 40.63% || 20.02% || 36.37% || 66.80% || 25.99 kg&lt;br /&gt;
|-&lt;br /&gt;
| 4 || MaziyarPanahi/calme-2.4-rys-78b || chat || 50.77% || 80.11% || 62.16% || 40.71% || 20.36% || 34.57% || 66.69% || 25.95 kg&lt;br /&gt;
|-&lt;br /&gt;
| 5 || huihui-ai/Qwen2.5-72B-Instruct-abliterated || fine-tuned || 48.11% || 85.93% || 60.49% || 60.12% || 19.35% || 12.34% || 50.41% || 76.77 kg&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen/Qwen2.5-72B-Instruct || chat || 47.98% || 86.38% || 61.87% || 59.82% || 16.67% || 11.74% || 51.40% || 47.65 kg&lt;br /&gt;
|-&lt;br /&gt;
| 7 || MaziyarPanahi/calme-2.1-qwen2.5-72b || chat || 47.86% || 86.62% || 61.66% || 59.14% || 15.10% || 13.30% || 51.32% || 29.50 kg&lt;br /&gt;
|-&lt;br /&gt;
| 8 || newsbang/Homer-v1.0-Qwen2.5-72B || fine-tuned || 47.46% || 76.28% || 62.27% || 49.02% || 22.15% || 17.90% || 57.17% || 29.55 kg&lt;br /&gt;
|-&lt;br /&gt;
| 9 || ehristoforu/qwen2.5-[[test]]-32b-it || chat || 47.37% || 78.89% || 58.28% || 59.74% || 15.21% || 19.13% || 52.95% || 29.54 kg&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B || fine-tuned || 47.34% || 79.72% || 57.63% || 60.27% || 14.99% || 18.16% || 53.25% || 7.95 kg&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Performance Analysis ==&lt;br /&gt;
&lt;br /&gt;
=== 파라미터 규모별 성능 트렌드 ===&lt;br /&gt;
&lt;br /&gt;
'''78B 모델의 지배적 위치'''&lt;br /&gt;
상위 4위 모델이 모두 78B 파라미터 모델로, Calme 시리즈가 독주하고 있습니다. Calme-3.2-instruct-78b가 Overall Average 52.08%로 1위를 차지했으며, 상위 4개 모델의 점수 차이가 매우 작습니다 (50.77% ~ 52.08%, 약 1.3%p 차이).&lt;br /&gt;
&lt;br /&gt;
'''Qwen2.5-72B: 공식 오픈소스 모델의 기준'''&lt;br /&gt;
Qwen/Qwen2.5-72B-Instruct가 6위 (47.98%)로, 공식 오픈소스 모델 중 최고 성능을 기록했습니다. 특히 IFEval 86.38%, MATH 59.82%로 지시 따르기 및 수학 능력에서 두각을 나타냈습니다. Abliterated 버전 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 5위 (48.11%) 로 공식 모델보다 약간 더 높은 성능을 보였습니다.&lt;br /&gt;
&lt;br /&gt;
'''32B 모델의 경쟁력 부상'''&lt;br /&gt;
Rank 9, 10에 32B 모델이 진입했습니다. ehristoforu/qwen2.5-test-32b-it (47.37%) 와 Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (47.34%) 가 72B/78B 모델과 경쟁하고 있습니다. 특히 CO₂ Cost 측면에서 큰 장점이 있습니다.&lt;br /&gt;
&lt;br /&gt;
=== CO₂ Cost 분석 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;text-align:center; font-size:90%&amp;quot;&lt;br /&gt;
! 파라미터 규모 !! 평균 CO₂ Cost !! Rank 10 대비 배수&lt;br /&gt;
|-&lt;br /&gt;
| 78B (Calme 시리즈) || ~46.60 kg || ~5.9배&lt;br /&gt;
|-&lt;br /&gt;
| 72B (Qwen2.5 기반) || ~50.93 kg || ~6.4배&lt;br /&gt;
|-&lt;br /&gt;
| 32B || ~28.75 kg || 기준&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
32B 모델 (Saxo/Linkbricks) 이 7.95kg으로 가장 낮은 CO₂ Cost를 기록했으며, 72B 모델 (huihui-ai/Qwen2.5-72B-Instruct-abliterated) 이 76.77kg으로 가장 높습니다. 이는 약 10배의 차이로, 환경 비용을 고려할 때 32B 모델의 실용성이 매우 높습니다.&lt;br /&gt;
&lt;br /&gt;
=== 벤치마크 지표별 강점 ===&lt;br /&gt;
&lt;br /&gt;
* '''IFEval (지시 따르기)''': Qwen2.5 기반 모델이 압도적 (86% 이상). MaziyarPanahi/calme-2.1-qwen2.5-72b 가 86.62%로 최고&lt;br /&gt;
* '''MATH (수학)''': huihui-ai/Qwen2.5-72B-Instruct-abliterated (60.12%), Saxo/Linkbricks-32B (60.27%) 가 가장 우수&lt;br /&gt;
* '''GPQA (전문 지식)''': newsbang/Homer-v1.0-Qwen2.5-72B (22.15%) 가 78B 모델 중 최고&lt;br /&gt;
* '''MMLU-PRO (종합 지식)''': MaziyarPanahi/calme-3.2-instruct-78b (70.03%) 가 압도적 1위&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 아키텍처 비교 ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot; style=&amp;quot;font-size:90%&amp;quot;&lt;br /&gt;
|+ Top 10 모델의 아키텍처 및 베이스 정보&lt;br /&gt;
|-&lt;br /&gt;
! Rank !! Model !! 베이스 아키텍처 !! Type !! Notes&lt;br /&gt;
|-&lt;br /&gt;
| 1-4 || Calme 시리즈 || Llama 기반 추정 || fine-tuned / chat || MaziyarPanahi 가 개발한 Calme 계열 모델. 78B 파라미터&lt;br /&gt;
|-&lt;br /&gt;
| 5 || Qwen2.5-72B-Instruct-abliterated || Qwen2.5-72B-Instruct || fine-tuned || Abliterated 버전 — 안전 필터 제거로 성능 향상&lt;br /&gt;
|-&lt;br /&gt;
| 6 || Qwen2.5-72B-Instruct || Qwen2.5-72B-Instruct || chat || Alibaba/Qwen 공식 오픈소스 모델. MoE 아키텍처&lt;br /&gt;
|-&lt;br /&gt;
| 7 || calme-2.1-qwen2.5-72b || Qwen2.5-72B || chat || Qwen2.5 기반 Calme 모델&lt;br /&gt;
|-&lt;br /&gt;
| 8 || Homer-v1.0-Qwen2.5-72B || Qwen2.5-72B || fine-tuned || newsbang 가 개발한 Homer 시리즈&lt;br /&gt;
|-&lt;br /&gt;
| 9 || qwen2.5-test-32b-it || Qwen2.5-32B || chat || Qwen2.5-32B 기반 지시 따르기 최적화 모델&lt;br /&gt;
|-&lt;br /&gt;
| 10 || Linkbricks-Horizon-AI-Avengers-V1-32B || 추정됨 || fine-tuned || Saxo 가 개발한 32B 모델&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== 아키텍처 트렌드 ===&lt;br /&gt;
* '''Qwen2.5 기반 모델의 확산''': Top 10 중 6개 모델 (Rank 5~10) 이 Qwen2.5를 베이스로 사용. MoE(Mixture of Experts) 아키텍처로 효율적인 추론 가능&lt;br /&gt;
* '''Calme 시리즈의 독자적 진화''': 상위 4위를 차지한 Calme 시리즈는 Llama 기반 추정이나, MaziyarPanahi 가 독자적으로 fine-tuning 한 모델&lt;br /&gt;
* '''32B 모델의 실용성''': 32B 파라미터로도 72B/78B 모델과 경쟁 가능한 성능을 달성. Edge 디바이스, 온프레미스 배포에 적합&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 가이드라인 ===&lt;br /&gt;
&lt;br /&gt;
'''성능 최우선 시 (78B/72B 모델 권장)'''&lt;br /&gt;
* 연구용, 고난이도 추론 작업, 복잡한 지시 따르기 필요 시 → Calme-3.2-instruct-78b (Rank 1)&lt;br /&gt;
* 공식 오픈소스 모델 선호 시 → Qwen/Qwen2.5-72B-Instruct (Rank 6)&lt;br /&gt;
* IFEval 점수 중요 시 → Qwen2.5 기반 모델 (86% 이상)&lt;br /&gt;
&lt;br /&gt;
'''환경 비용 고려 시 (32B 모델 권장)'''&lt;br /&gt;
* CO₂ Cost 최소화 필요 시 → Saxo/Linkbricks-Horizon-AI-Avengers-V1-32B (7.95kg, Rank 10)&lt;br /&gt;
* Edge 디바이스, 온프레미스 배포 시 → 32B 모델 (ehristoforu/qwen2.5-test-32b-it, Saxo/Linkbricks)&lt;br /&gt;
* 실시간 추론, 저지연 요구 시 → 32B 모델이 78B 대비 추론 속도 우위&lt;br /&gt;
&lt;br /&gt;
'''균형 잡힌 선택 (Qwen2.5-72B 권장)'''&lt;br /&gt;
* 성능과 비용의 균형 → Qwen/Qwen2.5-72B-Instruct (47.98%, 47.65kg CO₂)&lt;br /&gt;
* Abliterated 버전으로 성능 향상 → huihui-ai/Qwen2.5-72B-Instruct-abliterated (48.11%, MATH 60.12%)&lt;br /&gt;
&lt;br /&gt;
=== 모델 선택 의사결정 트리 ===&lt;br /&gt;
# 환경 비용이 최우선인가? → Yes: 32B 모델 (Saxo/Linkbricks, ehristoforu)&lt;br /&gt;
# 공식 오픈소스 모델이 필요한가? → Yes: Qwen/Qwen2.5-72B-Instruct&lt;br /&gt;
# 최고 성능이 필요한가? → Yes: Calme-3.2-instruct-78b&lt;br /&gt;
# 균형 잡힌 선택이 필요한가? → Yes: Qwen2.5-72B-Instruct-abliterated&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* '''Leaderboard Archived''': HuggingFace Open LLM Leaderboard가 현재 Archived 상태입니다. 새로운 모델의 벤치마크 점수가 업데이트되지 않고 있으며, 과거 데이터 기준의 정적 분석입니다.&lt;br /&gt;
* '''벤치마크 한계''': Overall Average 점수만으로는 모델의 실제 사용 경험을 완전히 대표하지 않습니다. 특정 도메인(의료, 법률, 코딩 등)에서의 성능은 추가 평가 필요.&lt;br /&gt;
* '''CO₂ Cost 변동성''': CO₂ Cost 는 사용 GPU, 추론 설정, 데이터센터의 탄소 집약도에 따라 크게 변동할 수 있습니다. 표의 값은 기준 테스트 환경에서의 추정치입니다.&lt;br /&gt;
* '''모델 타입 구분''': fine-tuned 와 chat 타입의 직접 비교는 주의가 필요합니다. chat 타입은 대화 최적화, fine-tuned 는 특정 작업 최적화의 차이가 있을 수 있습니다.&lt;br /&gt;
* '''데이터 시점''': 본 데이터는 2026-07-31 기준이며, 이후 새로운 모델이 Leaderboard에 추가되거나 Archived 상태가 변경될 수 있습니다.&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
* [HuggingFace Open LLM Leaderboard (Archived)](https://huggingface.co/spaces/huggingface/open-llm-leaderboard) — HuggingFace 공식 오픈소스 LLM 벤치마크 Leaderboard&lt;br /&gt;
* [Qwen2.5 모델 패밀리](https://huggingface.co/Qwen) — Alibaba/Qwen 공식 Qwen2.5 모델 페이지&lt;br /&gt;
* [Calme 모델 시리즈](https://huggingface.co/MaziyarPanahi) — MaziyarPanahi 의 Calme 모델 컬렉션&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
* [[Qwen2.5]]&lt;br /&gt;
* [[Llama]]&lt;br /&gt;
* [[LLM Benchmark]]&lt;br /&gt;
* [[Transformer Architecture]]&lt;br /&gt;
* [[Parameter-Efficient Fine-Tuning]]&lt;br /&gt;
* [[MoE (Mixture of Experts)]]&lt;br /&gt;
* [[Context Window]]&lt;br /&gt;
* [[Instruction Tuning]]&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
[[Category:AI]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
	<entry>
		<id>http://wiki.hpcmate.com/index.php?title=Systemd_journal&amp;diff=3545</id>
		<title>Systemd journal</title>
		<link rel="alternate" type="text/html" href="http://wiki.hpcmate.com/index.php?title=Systemd_journal&amp;diff=3545"/>
		<updated>2026-07-17T05:10:50Z</updated>

		<summary type="html">&lt;p&gt;Clara: Phase 0.5: Create systemd journal&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;= systemd journal =&lt;br /&gt;
&lt;br /&gt;
{{Status&lt;br /&gt;
|status=Draft&lt;br /&gt;
|owner=Knowledge Agent&lt;br /&gt;
|last_update=2026-07-17&lt;br /&gt;
|review=Pending&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
{{TOC}}&lt;br /&gt;
&lt;br /&gt;
== Overview ==&lt;br /&gt;
&lt;br /&gt;
systemd journal는 Linux 시스템 로그 관리 시스템. journald 데몬이 로그 수집, 저장, 검색. journalctl로 접근.&lt;br /&gt;
&lt;br /&gt;
=== Summary ===&lt;br /&gt;
&lt;br /&gt;
* * 무엇인가? Linux 시스템 로그 관리. journald + journalctl&lt;br /&gt;
* * 왜 필요한가? 시스템 문제 디버깅, 보안 감사, 모니터링&lt;br /&gt;
* * 언제 사용하는가? 시스템 로그 분석, 서비스 문제 추적&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Purpose ==&lt;br /&gt;
&lt;br /&gt;
이 문서가 존재하는 이유&lt;br /&gt;
&lt;br /&gt;
* Goal: systemd journal의 개념, 사용법, 설정 가이드 제공&lt;br /&gt;
* Scope: 기본 개념, 설치/설정, 사용 예제, 모범 사례&lt;br /&gt;
* Non-goals: 고급 커스터마이징, 내부 소스 코드 분석&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Key Concepts ==&lt;br /&gt;
&lt;br /&gt;
{{KeyConcepts&lt;br /&gt;
|concepts={{[[&amp;quot;journald&amp;quot;, &amp;quot;\ub85c\uadf8 \uc218\uc9d1 \ub370\ubaac. \uc774\uc9c4 \ud615\uc2dd \uc800\uc7a5. \ube60\ub978 \uc77d\uae30/\uc4f0\uae30&amp;quot;, &amp;quot;Logging&amp;quot;], [&amp;quot;journalctl&amp;quot;, &amp;quot;\ub85c\uadf8 \uc870\ud68c \ub3c4\uad6c. \ud544\ud130\ub9c1, \uc2e4\uc2dc\uac04 \ubaa8\ub2c8\ud130\ub9c1&amp;quot;, &amp;quot;CLI&amp;quot;], [&amp;quot;Persistent Storage&amp;quot;, &amp;quot;\ub85c\uadf8 \uc601\uad6c \uc800\uc7a5. /var/log/journal&amp;quot;, &amp;quot;Storage&amp;quot;], [&amp;quot;Log Level&amp;quot;, &amp;quot;emerg, alert, crit, err, warning, notice, info, debug&amp;quot;, &amp;quot;Severity&amp;quot;]]}}&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Architecture ==&lt;br /&gt;
&lt;br /&gt;
journald는 시스템 부팅 시 시작. /run/log/journal(휘발성)과 /var/log/journal(영구)에 로그 저장. journalctl로 검색, 필터링, 실시간 모니터링. systemd 서비스 로그 자동 수집.&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Workflow ==&lt;br /&gt;
&lt;br /&gt;
1. 1. journalctl으로 로그 조회&lt;br /&gt;
&lt;br /&gt;
2. 2. 필터링 (서비스, 시간, 레벨)&lt;br /&gt;
&lt;br /&gt;
3. 3. 실시간 모니터링 (-f)&lt;br /&gt;
&lt;br /&gt;
4. 4. 영구 저장 설정&lt;br /&gt;
&lt;br /&gt;
5. 5. 로그 회전 설정&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Configuration ==&lt;br /&gt;
&lt;br /&gt;
&amp;lt;syntaxhighlight lang=&amp;quot;bash&amp;quot;&amp;gt;&lt;br /&gt;
# 모든 로그&lt;br /&gt;
journalctl&lt;br /&gt;
&lt;br /&gt;
# 현재 부팅 로그&lt;br /&gt;
journalctl -b&lt;br /&gt;
&lt;br /&gt;
# 이전 부팅 로그&lt;br /&gt;
journalctl -b -1&lt;br /&gt;
&lt;br /&gt;
# 서비스 로그&lt;br /&gt;
journalctl -u sshd&lt;br /&gt;
journalctl -u docker&lt;br /&gt;
&lt;br /&gt;
# 실시간 모니터링&lt;br /&gt;
journalctl -f&lt;br /&gt;
&lt;br /&gt;
# 시간 필터&lt;br /&gt;
journalctl --since &amp;quot;1 hour ago&amp;quot;&lt;br /&gt;
&lt;br /&gt;
# 에러만&lt;br /&gt;
journalctl -p err&lt;br /&gt;
&lt;br /&gt;
# 로그 크기 확인&lt;br /&gt;
journalctl --disk-usage&lt;br /&gt;
&lt;br /&gt;
# 로그 회전 설정 (/etc/systemd/journald.conf)&lt;br /&gt;
# SystemMaxUse=100M&lt;br /&gt;
# MaxRetentionSec=1week&lt;br /&gt;
&amp;lt;/syntaxhighlight&amp;gt;&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Best Practices ==&lt;br /&gt;
&lt;br /&gt;
* -p err로 에러만 확인&lt;br /&gt;
* --since/--until로 시간 필터&lt;br /&gt;
* -f로 실시간 모니터링&lt;br /&gt;
* 영구 저장 활성화 (/var/log/journal)&lt;br /&gt;
* 로그 크기 제한 (SystemMaxUse)&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Limitations ==&lt;br /&gt;
&lt;br /&gt;
* 이진 형식이라 직접 편집 불가&lt;br /&gt;
* 대규모 로그에서 성능 저하&lt;br /&gt;
* remote journaling 설정 필요 시 복잡&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== References ==&lt;br /&gt;
&lt;br /&gt;
* [https://github.com/ GitHub Repository]&lt;br /&gt;
* [https://huggingface.co/ Hugging Face]&lt;br /&gt;
&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
== Related Pages ==&lt;br /&gt;
&lt;br /&gt;
* [[Logrotation]]&lt;br /&gt;
* [[Systemd tips and tricks]]&lt;br /&gt;
* [[Linux]]&lt;br /&gt;
&lt;br /&gt;
[[Category:Linux]]&lt;br /&gt;
[[Category:Reference]]&lt;/div&gt;</summary>
		<author><name>Clara</name></author>
	</entry>
</feed>