ko-embedding-leaderboard 소개
RAG 시스템이나 검색 기능을 한국어로 만들 때 가장 먼저 부딪히는 선택은 "어떤 임베딩 모델을 쓸 것인가" 입니다. 후보는 많지만, 영어 벤치마크 점수가 높다고 해서 한국어 검색에서도 잘 동작한다는 보장은 없습니다. 모델마다 평가 방식과 데이터셋이 제각각이라 공정하게 비교하기도 어렵습니다.
ko-embedding-leaderboard는 이 문제를 한국어에 특화된 공개 리더보드로 정리한 프로젝트입니다. 임베딩 평가 벤치마크인 MTEB를 한국어 환경에 맞게 커스텀하고 데이터셋을 일부 수정해, 오픈소스 임베딩 모델을 여러 한국어 검색(IR) 과제로 평가하고 순위를 매깁니다. Sparse 임베딩과 Dense 임베딩을 나누어 순위를 제공하는 것이 특징입니다.
프로젝트 저자는 평가 방식과 대상 모델에 대한 문의나 제보를 이슈로 받고 있으며, 잘못된 부분에 대한 지적도 환영한다고 밝히고 있습니다. 아래에 정리하는 순위는 저장소의 리더보드를 옮긴 것으로, 새 모델이 추가되면서 계속 갱신됩니다.
ko-embedding-leaderboard의 평가 방식
아래 그림은 리더보드가 순위를 만드는 과정을 정리한 것입니다. 오픈소스 임베딩 모델을 여러 한국어 검색 데이터셋으로 평가하고, NDCG 점수의 평균으로 순위를 매깁니다.
Version 2부터는 클러스터링(Clustering) 이나 NLI 같은 과제를 빼고 정보 검색(IR) 만 평가합니다. 평가 지표는 NDCG@5와 NDCG@10의 평균이며, 사용하는 한국어 검색 데이터셋은 Ko-StrategyQA, AutoRAGRetrieval, PublicHealthQA, LawIRKo, WebFAQRetrieval, SQuADKorV1Retrieval, MIRACLRetrievalHardNegative 7종입니다.
모델을 불러올 때는 HuggingFace에 기재된 방식을 따르되 SentenceTransformer를 Transformers보다 우선해서 로드하고, HuggingFace에 Query fix가 기재된 경우 이를 적용합니다. 이 밖에도 중복되는 문장 쌍(pair) 은 제거하고, LLM 기반 임베딩 모델은 fp16/bf16으로 평가한다는 규칙이 함께 공개되어 있습니다. 평가 코드를 뜯어본 배경은 저자의 MTEB 코드 살펴보기 블로그 글에 정리되어 있습니다.
ko-embedding-leaderboard의 Dense 임베딩 순위
Dense 임베딩 모델의 검색 평균(Retrieval Average) 상위권은 다음과 같습니다. 점수는 7개 데이터셋에 대한 NDCG 평균입니다.
| 순위 | 모델 | 검색 평균 |
|---|---|---|
| 1 | perplexity-ai/pplx-embed-v1-4b | 82.79 |
| 2 | dragonkue/snowflake-arctic-embed-l-v2.0-ko | 82.14 |
| 3 | telepix/PIXIE-Rune-v1.0 | 81.57 |
| 4 | Qwen/Qwen3-Embedding-4B | 81.37 |
| 5 | nlpai-lab/KURE-v1 | 80.76 |
| 6 | jinaai/jina-embeddings-v5-text-small | 80.29 |
| 7 | Snowflake/snowflake-arctic-embed-l-v2.0 | 80.00 |
| 8 | BAAI/bge-m3 | 79.30 |
| 9 | google/embeddinggemma-300m | 78.19 |
| 10 | Qwen/Qwen3-Embedding-0.6B | 75.88 |
한국어에 특화 학습된 모델(snowflake-arctic-embed-l-v2.0-ko, KURE-v1) 과 다국어 범용 모델(Qwen3-Embedding, bge-m3, embeddinggemma) 이 상위권에 섞여 있는 점이 눈에 띕니다.
ko-embedding-leaderboard의 Sparse 임베딩 순위
Sparse 임베딩(예: SPLADE 계열) 모델의 IR 순위 상위권은 다음과 같습니다.
| 순위 | 모델 | Sparse 검색 평균 |
|---|---|---|
| 1 | telepix/PIXIE-Splade-v1.5 | 78.19 |
| 2 | yjoonjang/splade-ko-v1 | 77.00 |
| 3 | yjoonjang/inference-free-splade-ko-v1 | 76.75 |
| 4 | telepix/PIXIE-Splade-Preview | 74.79 |
| 5 | telepix/PIXIE-Splade-v1.0 | 70.40 |
ko-embedding-leaderboard 프로젝트 GitHub 저장소
더 읽어보기
-
NVIDIA, RTEB 1위 오픈 임베딩 모델 Nemotron 3 Embed 공개 (feat. RAG, 에이전트 검색)
-
Perplexity, 웹 스케일 검색을 위한, 양방향 디퓨전 어텐션을 적용한 다국어 임베딩 모델 pplx-embed 2종 공개
이 글은 GPT 모델로 정리한 글을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 덧글로 알려주시기를 부탁드립니다. ![]()
파이토치 한국 사용자 모임
이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일
로 보내드립니다! 텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. ![]()
아래
쪽에 좋아요
를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ ![]()

