기준 시점: 2026년 10월 5일 (허깅페이스 공개 API 실측)
실시간 대시보드: Hugging Face Official Benchmarks Map - a Hugging Face Space by quantid
TL;DR
- 허깅페이스가
benchmark:official로 지정한 데이터셋은 48개, 그중 리더보드 항목이 1건 이상인 것은 44개, 기본 화면 기준 등록 항목은 **1,023건(411개 모델, 95개 조직)**이다. - 참가 분포는 강하게 쏠려 있다. 벤치마크당 등록 수 중앙값 11.5건, 지니계수 0.583, 상위 5개 벤치마크가 전체의 45.9%, 상위 10개가 **62.8%**를 차지한다.
- 벤치마크 수는 에이전트·터미널(17개)이 가장 많지만, 등록은 과학·지식(348건, 벤치마크당 58건)에 몰린다. 에이전트는 벤치마크당 11.6건에 그친다.
- 기본 리더보드 화면은
base_model을 선언한 파생 모델을 제외한다. 파생 모델까지 포함하면 등록은 1,469건으로, 약 30%(446건)가 기본 화면에서 보이지 않는다. - 1위 보유 조직은 23곳이다. FINAL-Bench 9, Moonshot AI 4, Z.ai 4, DeepSeek 3, Xiaomi MiMo 3 순이다.
- 검증(verified) 표시가 붙은 항목은 0건이다. 모든 점수는 제작사 자체 보고값이다.
1. 허깅페이스 공인 리더보드는 어떻게 만들어지는가
허깅페이스 데이터셋 페이지의 Leaderboard 섹션은 별도 제출 양식이 있는 게 아니라, 모델 저장소에 들어 있는 .eval_results/*.yaml 파일을 허깅페이스가 주기적으로 수집해서 만든다. 모델 카드 메타데이터의 model-index 만으로는 등재되지 않는다.
YAML 한 항목의 형태는 대략 다음과 같다.
- dataset:
id: Idavidrein/gpqa
task_id: diamond
value: 94.44
source:
url: https://huggingface.co/<org>/<repo>
name: Model Card
notes: "evaluation settings ..."
운영상 알아 두면 좋은 동작이 몇 가지 있다.
| 동작 | 내용 |
|---|---|
| 배치 색인 | 커밋 즉시 반영되지 않는다. 짧게는 수 분, 길게는 수일 걸린다 |
| 기본 화면 필터 | 모델 카드 front matter 에 base_model: 이 있으면 파생 모델로 분류되어 기본 화면에서 빠진다. ?base_model=false 로 조회하면 포함된다 |
| 자체 보고 | 점수는 제작사가 자기 저장소에 쓴 값이다. verified 플래그는 허깅페이스가 별도로 표시하는 경우에만 참이다 |
| 파일명 | 자유다. 같은 GPQA 리더보드에도 gpqa.yaml, gpqa_diamond.yaml, gpqa-diamond.yaml 이 섞여 있다 |
base_model 필터는 집계 결과를 크게 바꾼다. 이번 측정에서 기본 화면 합계는 1,023건, 파생 포함 합계는 1,469건이었다. 미세조정·양자화·병합 모델이 많은 생태계 특성상, "리더보드에 몇 개가 올라 있나"를 말할 때는 어느 화면 기준인지부터 밝혀야 한다. 이 글의 수치는 모두 기본 화면 기준이다.
2. 데이터 수집 방법
공개 API 두 개면 충분하다. 인증이 필요 없고, CORS 도 열려 있어 브라우저에서 직접 호출할 수 있다.
GET https://huggingface.co/api/datasets?filter=benchmark:official&limit=100
GET https://huggingface.co/api/datasets/{dataset_id}/leaderboard
GET https://huggingface.co/api/datasets/{dataset_id}/leaderboard?base_model=false # 파생 모델 포함
목록 API 는 페이지네이션을 Link 헤더의 rel="next" 로 돌려준다. 리더보드 API 는 항목마다 rank, value, modelId, verified, source, filename 을 준다.
재현용 최소 코드다.
import requests, statistics, collections
API = "https://huggingface.co/api"
def get_all(url):
out = []
while url:
r = requests.get(url, timeout=30); r.raise_for_status()
out += r.json()
url = r.links.get("next", {}).get("url")
return out
benchmarks = get_all(f"{API}/datasets?filter=benchmark:official&limit=100")
rows, firsts = [], collections.Counter()
for d in benchmarks:
lb = requests.get(f"{API}/datasets/{d['id']}/leaderboard", timeout=30).json()
lb = lb if isinstance(lb, list) else []
rows.append((d["id"], len(lb)))
for e in lb:
if e.get("rank") == 1:
firsts[e["modelId"].split("/")[0]] += 1 # 조직 = 모델 저장소 네임스페이스
n = [c for _, c in rows]
print(len(benchmarks), sum(n), statistics.median(n))
print(firsts.most_common(5))
대시보드는 같은 로직을 브라우저 JavaScript 로 옮긴 것이다. 서버에 캐시하지 않고 페이지를 열 때마다 API 를 읽어 계산하기 때문에, 숫자를 고치거나 고를 수 있는 단계가 없다.
집계 규칙
- 조직: 모델 저장소의 네임스페이스. 다른 네임스페이스가 올린 미세조정 모델은 그 네임스페이스로 센다(예:
Tort-AI/GLM-5.3은 Z.ai 가 아니라 Tort-AI). - 공동 1위: rank 1 이 여러 개면 해당 조직을 모두 센다.
- 분야: 48개 벤치마크에 10개 분야를 사람이 붙였다(에이전트·터미널, 과학·지식, 문서·OCR, 코딩, 영상·시각, 법률·금융, 수학, 음성, 검색, 로봇).
- 국가: 조직 본사 소재지 기준으로 사람이 붙였다. 공개 정보로 확정하기 어려운 조직은
Unknown으로 둔다. 분류표는 대시보드의maps.js로 공개되어 있다. - 1위와 2위 격차:
|#1 − #2| / |#2| × 100. 단어 오류율처럼 낮을수록 좋은 지표도 rank 로 방향이 정해지므로 절댓값으로 처리한다.
3. 분포: 참가는 소수 벤치마크에 몰린다
| 통계량 | 값 |
|---|---|
| 공인 벤치마크 | 48 |
| 등록 1건 이상 | 44 |
| 등록 0건 | 4 |
| 총 등록(기본 화면) | 1,023 |
| 평균 / 중앙값 | 21.3 / 11.5 |
| 1사분위 / 3사분위 | 5 / 23 |
| 최대 | 141 (MMLU-Pro) |
| 지니계수 | 0.583 |
| HHI | 0.0578 |
| 상위 5개 점유율 | 45.9% |
| 상위 10개 점유율 | 62.8% |
| 등록 5건 이하 | 13 |
평균(21.3)이 중앙값(11.5)의 두 배에 가깝다는 건 분포가 오른쪽으로 길게 늘어져 있다는 뜻이다. MMLU-Pro(약 141), GPQA(약 111), HLE(약 89), SWE-bench Verified(약 67), Open ASR(약 62) 다섯 개가 절반 가까이를 가져간다.
실무적인 함의는 단순하다. "OO 리더보드 1위"라는 문장은 그 리더보드의 참가 수와 함께 읽어야 한다. 등록 141건 중 1위와 등록 3건 중 1위는 정보량이 전혀 다르다.
4. 분야: 벤치마크는 에이전트에, 등록은 과학에
| 분야 | 벤치마크 수 | 등록 수 | 벤치마크당 등록 |
|---|---|---|---|
| 과학·지식 | 6 | 348 | 58.0 |
| 에이전트·터미널 | 17 | 198 | 11.6 |
| 코딩 | 4 | 158 | 39.5 |
| 문서·OCR | 5 | 90 | 18.0 |
| 음성 | 2 | 72 | 36.0 |
| 수학 | 3 | 62 | 20.7 |
| 영상·시각 | 4 | 47 | 11.8 |
| 법률·금융 | 4 | 40 | 10.0 |
| 검색 | 2 | 4 | 2.0 |
| 로봇 | 1 | 4 | 4.0 |
에이전트 벤치마크는 공급(벤치마크 수)은 가장 많지만 수요(등록)는 벤치마크당 11.6건으로 과학·지식(58.0)의 5분의 1 수준이다. 원인은 평가 비용으로 보인다. GPQA·MMLU-Pro 는 객관식이라 단일 프로세스로 돌릴 수 있지만, Terminal-Bench·SWE-bench 계열은 컨테이너 샌드박스와 장시간 다단계 실행이 필요하고, 일부는 LLM 판정관 비용까지 든다. 결과적으로 에이전트 영역은 아직 참가자가 적은 블루오션이고, 지식 영역은 경쟁이 포화된 레드오션이다.
5. 참가자: 95개 조직, 그러나 절반은 한 번만 낸다
- 조직 95개, 모델 411개.
- 45개 조직(47%)은 벤치마크 딱 한 곳에만 등록했다. 소수의 대형 조직이 여러 리더보드에 동시에 이름을 올린다.
| 조직 | 참가 벤치마크 | 등록 수 | 1위 수 |
|---|---|---|---|
| Qwen | 31 | 136 | 1 |
| Z.ai (zai-org) | 32 | 84 | 4 |
| DeepSeek | 27 | 65 | 3 |
| Moonshot AI | 28 | 65 | 4 |
| NVIDIA | 15 | 63 | 0 |
| Ornith | 9 | 48 | 2 |
| OpenAI | 10 | 47 | 0 |
| MiniMax | 16 | 36 | 2 |
| Tencent | 17 | 34 | 2 |
| Xiaomi MiMo | 14 | 26 | 3 |
Qwen 은 31개 벤치마크에 136건을 올려 참가 규모로는 압도적이지만 1위는 1개다. 반대로 참가 폭은 좁아도 1위 비율이 높은 조직이 있다. 대시보드의 "참가 벤치마크 수 대 1위 수" 산점도가 이 차이를 보여 준다.
국가별 등록 비중
| 국가 | 등록 | 비중 |
|---|---|---|
| 중국 | 565 | 55.2% |
| 미국 | 231 | 22.6% |
| 미상 | 129 | 12.6% |
| 한국 | 42 | 4.1% |
| 프랑스 | 25 | 2.4% |
| 캐나다 | 16 | 1.6% |
| 체코 | 10 | 1.0% |
오픈 가중치 모델 생태계에서 중국 조직의 비중이 과반이라는 점은 다른 지표와도 일치한다. 미국은 빅테크 상당수가 공개 가중치를 내지 않거나, 내더라도 .eval_results 를 쓰지 않는 경우가 많아 실제 역량보다 적게 잡혔을 가능성이 있다.
6. 1위 현황
| 조직 | 국가 | 1위 수 |
|---|---|---|
| FINAL-Bench | 한국 | 9 |
| Moonshot AI | 중국 | 4 |
| Z.ai | 중국 | 4 |
| DeepSeek | 중국 | 3 |
| Xiaomi MiMo | 중국 | 3 |
| Ornith | 미상 | 2 |
1위 보유 조직은 23곳이다. FINAL-Bench 는 GPQA Diamond, MMLU-Pro, MMMU-Pro, AIME 2026, HMMT Feb 2026, LEXam, LEXam-hard, ExtractBench, IFStruct 에서 1위다. 등록 수가 가장 많은 두 리더보드(MMLU-Pro, GPQA)의 1위를 함께 갖고 있다는 점이 특징이다. 국내 조직 가운데 1위가 있는 곳은 FINAL-Bench 와 문서 파싱 모델의 KDLAI(ParseBench) 두 곳이다.
7. 1위와 2위 격차: 상당수는 오차 범위 안이다
2위가 있는 42개 리더보드에서 격차 중앙값은 **5.2%**다. 그런데 7개는 1% 미만이다.
| 가장 근소한 격차 | 격차 |
|---|---|
| MMMU-Pro | 0.10% |
| MMLU-Pro | 0.14% |
| ExtractBench | 0.46% |
| SWE-bench Verified | 0.47% |
| WBench | 0.51% |
| Toolathlon | 0.52% |
MMLU-Pro 의 0.14% 차이는 문항 수와 표본 변동을 감안하면 통계적으로 구분하기 어려운 수준이다. 이런 리더보드의 1위는 새 제출 하나로 언제든 뒤집힐 수 있다. 반대로 Long-Horizon-Terminal-Bench(100%)처럼 격차가 커 보이는 곳은 점수 자체가 작아(6 대 3) 상대 격차가 부풀려진 경우다. 격차는 상대값과 절댓값, 그리고 문항 수를 함께 봐야 의미가 있다.
8. 해석상 주의할 점
- 전부 자체 보고다.
verified표시가 붙은 항목은 0건이다. 같은 벤치마크라도 제출마다 샘플링(T=0 대 T>0), 단일 실행 대 다수결, 생각 모드 여부, 생성 길이 상한이 다르다. 좋은 제출은notes에 이 조건을 적는다. - 기본 화면은 파생 모델을 숨긴다.
base_model선언 여부에 따라 같은 모델이 보였다 안 보였다 한다. 이번 측정에서 약 30%가 기본 화면에서 빠졌다. - 조직 단위 집계는 계보를 반영하지 않는다. 기반 모델 제작사가 아니라 저장소 소유자로 센다. Qwen 기반 파생 모델의 1위는 Qwen 의 1위로 잡히지 않는다.
- 분야와 국가는 사람이 붙인 라벨이다. 분류 기준을 공개하고 정정 요청을 받는 이유다.
- 스냅샷이다. 공인 벤치마크와 등록은 계속 늘어난다. 이 글의 수치는 2026년 10월 5일 기준이며, 대시보드는 항상 현재 값을 보여 준다.
9. 마치며
개별 리더보드는 "누가 이 시험에서 가장 높은가"를 말해 준다. 48개를 한데 놓으면 다른 질문에 답할 수 있다. 어떤 능력을 측정하려는 시도가 늘고 있는지(에이전트), 실제 경쟁은 어디서 벌어지는지(과학·지식), 누가 넓게 참가하고 누가 좁게 이기는지, 어느 1위가 단단하고 어느 1위가 위태로운지. 모델을 고르거나 평가 전략을 세울 때, 리더보드 숫자 하나보다 이 지형도가 더 많은 것을 알려 준다.
대시보드: Hugging Face Official Benchmarks Map - a Hugging Face Space by quantid
(분야 히트맵, 벤치마크별 등록 수, 활발한 조직, 국가별 비중, 1위와 2위 격차, 참가 대비 1위 산점도 포함)

