NVIDIA, RTEB 1위 오픈 임베딩 모델 Nemotron 3 Embed 공개 (feat. RAG, 에이전트 검색)

Nemotron 3 Embed 소개

검색 증강 생성(Retrieval-Augmented Generation, RAG)이나 여러 단계를 거치는 에이전트 워크플로우에서 실제로 답변의 품질을 좌우하는 것은, 거대 언어 모델 자체보다 그 앞단에서 "관련 있는 문서를 얼마나 정확히 찾아오는가"입니다. 검색 단계가 엉뚱한 문서를 가져오면 에이전트는 잘못된 맥락 위에서 추론을 시작하고, 다시 질의하고, 토큰 예산을 낭비하며, 그 잡음을 이후 추론 단계까지 그대로 끌고 갑니다. 이 검색의 첫 단추를 담당하는 것이 바로 임베딩(Embedding) 모델입니다. 임베딩 모델은 질문과 문서를 같은 의미 공간의 밀집 벡터(dense vector)로 바꿔, 벡터 간 유사도만으로 관련 문서를 빠르게 골라낼 수 있게 해 줍니다.

NVIDIA가 공개한 Nemotron 3 Embed는 바로 이 검색 품질을 끌어올리면서, 동시에 프로덕션 환경에 배포할 때 필요한 현실적인 선택지(지연 시간, 비용, 처리량)를 함께 제공하는 것을 목표로 한 오픈 임베딩 모델 컬렉션입니다. 세 가지 모델로 구성되며, 그중 플래그십인 8B 모델은 실제 검색 성능을 측정하도록 설계된 RTEB(Retrieval Embedding Benchmark) 다국어 리더보드에서 1위를 기록했습니다. 한국어를 포함한 34개 언어와 코드 검색을 지원하며, 가중치와 학습 데이터, 학습 레시피가 모두 공개되어 있어 자체 인프라에서 검사하고 미세조정(fine-tuning)해 쓸 수 있습니다.

주목할 점은 이 컬렉션이 단순히 "가장 정확한 모델 하나"를 내놓은 것이 아니라, 정확도와 효율의 스펙트럼 전체를 덮도록 세 모델을 함께 설계했다는 점입니다. 정밀도가 절대적으로 중요한 고신뢰 엔터프라이즈 RAG에는 8B 모델을, 지연 시간과 비용이 중요한 대규모 프로덕션 서빙에는 1B 모델을, 그리고 NVIDIA Blackwell 아키텍처에서 최대 처리량을 뽑아내야 하는 환경에는 NVFP4 양자화 변형을 고를 수 있습니다. 최근 Google의 EmbeddingGemmaPerplexity의 pplx-embed, VoyageAI의 Voyage-3처럼 검색 특화 임베딩 모델 경쟁이 뜨거운 가운데, Nemotron 3 Embed는 "완전 공개 + 벤치마크 1위 + 배포 유연성"을 한 번에 제시한다는 점에서 눈여겨볼 만합니다.

세 가지 모델, 하나의 스펙트럼

Nemotron 3 Embed 컬렉션은 같은 검색 중심 설계를 공유하면서 서로 다른 배포 지점을 겨냥한 세 개의 모델로 이루어집니다. 세 모델 모두 32k 토큰의 긴 컨텍스트, 평균 풀링(mean pooling), 그리고 질의에는 query:, 문서에는 passage: 프리픽스를 붙이는 동일한 사용 방식을 따릅니다.

모델 역할 파라미터 임베딩 차원 최적 용도
Nemotron-3-Embed-8B-BF16 플래그십 품질 기준, RTEB 1위 8.0B 4096 정밀도가 중요한 검색, 고신뢰 엔터프라이즈 RAG
Nemotron-3-Embed-1B-BF16 고효율 표준 1.14B 2048 지연 시간과 비용에 민감한 프로덕션 서빙
Nemotron-3-Embed-1B-NVFP4 하드웨어 가속 변형(Blackwell 최적화) 1.14B 2048 초고처리량, 대규모 인프라

세 모델은 모두 동적 임베딩 크기(dynamic embedding size) 를 지원합니다. 즉, 8B 모델이 내놓는 4096차원 벡터를 앞에서부터 2048이나 1024차원으로 잘라 쓰고 다시 L2 정규화만 해 주면, 저장 공간과 검색 비용을 줄이면서도 상당한 성능을 유지할 수 있습니다. 벡터 저장소의 용량이 곧 비용인 대규모 시스템에서 특히 유용한 특성입니다.

RTEB 1위와 검색 벤치마크 전반의 성능 향상

가장 눈에 띄는 성과는 8B 모델이 RTEB 다국어 리더보드에서 1위를 차지했다는 점입니다. RTEB는 임베딩 모델이 실제 애플리케이션에서 보이는 검색 정확도를 신뢰성 있게 평가하기 위해 설계된 벤치마크로, 16개의 공개 태스크로 구성됩니다.

NVIDIA는 RTEB뿐 아니라 ViDoRe V3의 텍스트 부분, MMTEB의 검색 태스크, 그리고 LongEmbed까지 여러 벤치마크에서 평균 NDCG@10 기준으로 모델을 평가했습니다. 아래 표는 세 벤치마크에서 이전 세대 1B 모델과 이번 세대 모델을 비교한 결과입니다(모델 카드 기준, 평가 시 시퀀스 길이는 4096으로 설정한 값입니다).

모델 RTEB (16) ViDoRe V3 (텍스트) MMTEB (검색)
llama-nemotron-embed-vl-1b-v2 (이전 세대 1B) 61.98 52.54 59.71
Nemotron-3-Embed-1B-BF16 72.38 57.74 71.04
Nemotron-3-Embed-8B-BF16 78.46 60.60 75.45

8B 모델은 RTEB에서 78.5%, MMTEB 검색에서 75.5%를 기록했습니다. 더 인상적인 것은 1B 모델의 도약입니다. 1B 모델은 8B의 검색 품질 상당 부분을 훨씬 작은 배포 크기로 옮겨 담아 RTEB 72.4%, MMTEB 검색 71.0%를 달성했는데, 이는 직전 세대 1B 모델(llama-nemotron-embed-vl-1b-v2) 대비 오류율을 각각 27%, 28% 줄인 수치입니다. 같은 크기의 모델이 세대를 넘기며 오류를 4분의 1 이상 줄였다는 것은, 작은 모델을 쓰면서도 검색 품질 손실을 최소화할 수 있게 되었다는 의미입니다.

더 나은 검색이 에이전트에게 중요한 이유

임베딩 모델의 정확도 몇 퍼센트가 실제로 어떤 차이를 만드는지는, 에이전트 환경에서 가장 극적으로 드러납니다. NVIDIA는 Nemotron 3 Ultra로 구동되는 검색 에이전트를 두고, 그 검색 시스템이 쓰는 임베딩 모델만 바꿔 가며 평가했습니다.

결과의 핵심은 "더 강한 검색이 다운스트림 에이전트의 토큰 비용을 줄인다" 는 것입니다. 더 정확한 검색기는 관련 근거를 더 이른 단계에 되돌려 주므로, 에이전트가 같은 질문을 반복 검색하거나 불필요한 추론 턴을 도는 일이 줄어듭니다. ViDoRe V3, BRIGHT, BrowseComp-Plus 세 벤치마크에서, 8B 모델은 가장 높은 평균 검색 정확도와 가장 낮은 다운스트림 토큰 비용을 동시에 달성했습니다. 정확도를 높이면 비용이 오르는 통상적인 트레이드오프가 아니라, 정확한 검색이 오히려 전체 에이전트 실행 비용을 낮추는 방향으로 작동하는 셈입니다. (다운스트림 토큰 비용은 Nemotron 3 Ultra의 입출력 토큰 수를 GPT-5.5 요금 공식으로 환산해 추정했습니다.)

Blackwell에서 NVFP4로 검색을 확장하기

고처리량 배포에서는 지연 시간과 비용 목표를 맞추기 위해 흔히 더 작은 임베딩 모델을 택하는데, 그럴수록 검색 품질을 포기하게 됩니다. Nemotron-3-Embed-1B-NVFP4 는 이 "효율 대 품질"의 간극을 좁히기 위한 변형으로, NVIDIA Blackwell 아키텍처의 네이티브 NVFP4 가속을 활용합니다. 선형 계층(linear layer)의 가중치와 활성값을 4비트 NVFP4 데이터 타입으로 양자화(Quantization)해 추론을 가속하고, 긴 입력 시퀀스에서의 정확도를 되살리기 위해 양자화 인식 증류(Quantization-Aware Distillation, QAD) 를 적용했습니다.

성능 측면에서 NVFP4 변형은 두 가지 수치로 요약됩니다. 첫째, Blackwell에서 BF16 대비 최대 2배 높은 처리량(throughput)을 제공하여 저지연 고처리량 검색 서빙에 적합합니다. 둘째, 메모리 사용량을 줄이면서도 BF16 검색 정확도의 99% 이상을 유지합니다. 위 그림은 Qwen3-Embedding-0.6BEmbeddingGemma-300M 같은 소형 오픈 임베딩 베이스라인과 비교했을 때, NVFP4 변형이 서빙 효율과 검색 정확도 양쪽에서 앞선 위치를 차지함을 보여 줍니다.

여기에 더해 NVIDIA는 1B 모델을 위한 최적화된 NVIDIA NIM 마이크로서비스를 출시일에 맞춰 함께 공개했습니다. Rust 기반으로 구현된 이 NIM은 아래 그림처럼 NVIDIA GB200과 RTX PRO 6000 GPU에서, 입력 시퀀스 길이 256과 1024 모두에 걸쳐 vLLM 체크포인트와 동등하거나 그 이상의 서빙 성능을 냈습니다.

8B에서 1B로: 가지치기와 증류로 만든 효율

Nemotron 3 Embed의 효율은 작은 모델을 처음부터 새로 학습해 얻은 것이 아니라, 큰 모델을 체계적으로 압축해 만든 것입니다. 플래그십 8B 모델은 Ministral-3-8B-Instruct-2512 백본의 인과적 디코더(causal decoder)를 전체 시퀀스를 함께 보는 양방향 인코더(bidirectional encoder) 로 변환한 뒤, 웹 수집 데이터와 합성 데이터로 이루어진 텍스트 쌍에 대해 대조 학습(contrastive learning)으로 사전 학습하고, 법률, 금융, 의료, 비즈니스, 교육 등 여러 도메인의 다국어 검색 데이터셋으로 미세조정한 결과입니다.

1B 모델은 여기서 한 걸음 더 나아갑니다. 먼저 Ministral-3-3B-Instruct-2512에 양방향 적응 레시피를 적용해 3B 검색기 베이스를 만든 뒤, 두 차례의 구조적 가지치기(structured pruning)증류(distillation) 로 압축했습니다. 첫 단계에서는 NVIDIA ModelOpt의 mcore_minitron 신경망 아키텍처 탐색(NAS) 엔진으로 은닉 폭, FFN 크기, 어텐션 헤드 수, 깊이를 엄격한 파라미터 예산 아래 탐색해 3B를 2B로 줄이고, 8B 교사(teacher) 모델로부터 코사인 거리 손실과 평균 제곱 오차 손실을 함께 써 랭킹 정확도를 회복시켰습니다. 이 "가지치기 후 증류" 절차를 한 번 더 반복해 2B를 최종 1.14B 모델로 압축했습니다. 마지막 학습은 1024 토큰 컨텍스트에서 다국어 정렬을 재구성한 뒤 4096 토큰으로 컨텍스트를 확장하는 2단계 스케줄로 진행해, 작은 모델이 긴 입력에서도 변별력을 유지하도록 했습니다.

핵심 기능 요약

  • 완전 공개 (가중치, 데이터셋, 레시피): 가중치뿐 아니라 학습 데이터셋과 미세조정, 증류 레시피까지 공개되어, 팀이 검색 모델을 검사하고 자체 데이터로 튜닝해 자기 인프라에 배포할 수 있습니다.
  • 32k 토큰 컨텍스트: 긴 문서, 대규모 코드 컨텍스트, 여러 턴에 걸친 에이전트 이력을 잘림 없이 검색할 수 있습니다.
  • 다국어 및 코드 검색: 한국어를 포함한 34개 언어와 여러 파일에 걸친 코드 저장소 검색을 지원합니다.
  • NVFP4 효율: Blackwell에 최적화된 4비트 배포 경로로, 더 작은 메모리로 고처리량 검색을 수행합니다.
  • 미세조정 및 증류 레시피: NVIDIA NeMo AutoModel 기반의 미세조정 레시피증류 레시피로 도메인 적응과 모델 압축을 지원합니다.
  • 출시일 생태계 통합: Hugging Face에서 즉시 내려받아 vLLM으로 서빙하거나 NVIDIA NIM 마이크로서비스로 배포할 수 있으며, Baseten, Bitdeer AI, DeepInfra, 한국의 FriendliAI 같은 AI 클라우드 및 추론 파트너를 통해서도 접근할 수 있습니다.

사용해보기

세 모델 모두 Hugging Face 컬렉션에서 가중치와 모델 카드, 예제 코드를 제공합니다. BF16 체크포인트는 Sentence TransformersTransformers, vLLM에서 모두 동작하며, NVFP4 체크포인트는 vLLM 전용입니다. 아래는 Sentence Transformers로 8B 모델을 불러와 질의와 문서를 임베딩하고 유사도를 계산하는 예시입니다.

import torch
from sentence_transformers import SentenceTransformer

MODEL_ID = "nvidia/Nemotron-3-Embed-8B-BF16"

model = SentenceTransformer(
    MODEL_ID,
    device="cuda",
    model_kwargs={
        "dtype": torch.bfloat16,
        "attn_implementation": "flash_attention_2",
    },
    processor_kwargs={"padding_side": "left"},
)
model.max_seq_length = 32768

# Add the query: / passage: prefixes automatically via encode_query / encode_document
query_embeddings = model.encode_query(QUERIES, convert_to_tensor=True)
document_embeddings = model.encode_document(DOCUMENTS, convert_to_tensor=True)

scores = model.similarity(query_embeddings, document_embeddings)

임베딩은 L2 정규화되어 있으므로 내적과 코사인 유사도가 동일하게 동작합니다. 서빙 시에는 vLLM의 /v2/embed 엔드포인트가 input_type(query 또는 document) 값에 따라 프리픽스를 자동으로 붙여 주므로 원문 문자열을 그대로 넘기면 됩니다.

도메인 특화 검색이 필요하다면 공개된 미세조정 레시피와 함께 배포된 합성 데이터셋 Retrieval-Synthetic-NVDocs-v1을 활용할 수 있습니다. 이 데이터셋은 NVIDIA의 공개 콘텐츠를 바탕으로 NeMo Data Designer로 생성한 질문-답변 쌍 모음으로, 실제로 이 데이터로 1B 모델을 미세조정하자 NV Docs 평가에서 NDCG@10이 56.7%에서 63.3%로(+11.6%), Recall@5가 56.1%에서 62.8%로(+11.9%) 향상되었습니다.

무료로 먼저 사용해보기

가중치를 직접 내려받아 GPU에 올리기 전에, 1B 모델을 무료로 호출해 보고 싶다면 두 가지 경로가 있습니다. 하나는 NVIDIA build.nvidia.com의 호스팅 NIM 프리뷰로, 무료 API 키를 발급받으면 브라우저의 플레이그라운드나 코드에서 바로 임베딩을 뽑아볼 수 있습니다. 다른 하나는 OpenRouter의 무료 엔드포인트로, nvidia/nemotron-3-embed-1b:free 모델 ID를 지정하면 별도 비용 없이 호출할 수 있습니다.

다만 이 무료 경로들은 로컬 개발과 테스트, 프로토타이핑 용도에 적합할 뿐, 실제 서비스나 민감한 데이터를 다루는 프로덕션 용도로는 권장하지 않습니다. 특히 OpenRouter 무료 엔드포인트에는 다음과 같은 데이터 정책 경고가 붙어 있습니다.

:warning: Trains: this provider may use prompts for training and may retain prompt data.

(해당 제공자가 입력한 프롬프트를 모델 학습에 사용하거나 프롬프트 데이터를 보관할 수 있다는 의미입니다.)

즉, 무료 티어로 넘긴 질의와 문서가 제공자 측 학습에 활용되거나 서버에 보관될 수 있으므로, 사내 문서나 개인정보가 포함된 데이터를 임베딩할 때는 무료 엔드포인트를 피하는 편이 안전합니다. 다행히 Nemotron 3 Embed는 가중치가 OpenMDW 라이선스로 공개되어 상업적 이용까지 허용되므로, 프로덕션에서는 무료 티어에 의존하기보다 가중치를 직접 내려받아 자체 인프라에서 서빙하거나 NIM 마이크로서비스를 프라이빗 환경에 배포하는 쪽이 데이터 통제 측면에서도 유리합니다.

이미 검증에 나선 기업들

출시와 함께 여러 엔터프라이즈 소프트웨어 기업과 AI 네이티브 스타트업, 메모리 제공업체들이 Nemotron 3 Embed를 에이전트 검색, 에이전트 메모리, 코드 검색 등에서 평가하고 있습니다. 에이전트 메모리 플랫폼 Mem0는 자체 스택에서 여러 모델과 비교한 결과를 이렇게 전했습니다.

"우리 스택 안에서 여러 모델을 대상으로 Nemotron-3-Embed-1B를 돌려 봤더니 가장 좋은 결과가 나왔습니다. 예를 들어 LongMemEval의 Retrieval@10에서 Qwen-3-0.6B의 78.71% 대비 80.38%를 기록했습니다. 우리에게 가장 흥미로운 것은 공개된 가중치와 미세조정 레시피인데, 덕분에 모델을 메모리 텍스트에 맞춰 적응시키고 직접 서빙할 수 있기 때문입니다."

에이전트 메모리와 컨텍스트 검색을 평가한 Zep은 초기 내부 벤치마크에서 훨씬 큰 모델을 포함한 여러 후보 가운데 1B 모델이 모든 메모리 검색 태스크에서 1위를 차지했다고 밝혔으며, FP4 체크포인트가 저장 공간과 지연 시간 측면에서도 경쟁력을 준다고 평가했습니다. 이 밖에도 turbopuffer가 자사 임베딩 서비스에 모델을 통합했고, You.com은 재랭킹(re-ranking) 스택에 적용해 웹 페이지에서 질의 관련 스니펫을 고르는 정확도가 크게 올랐다고 전했습니다. Automation Anywhere, Boomi, IBM, Palantir, ServiceNow, Zoom 등도 각자의 검색 파이프라인에서 평가를 진행하고 있습니다.

라이선스

Nemotron 3 Embed의 세 모델은 모두 OpenMDW License Agreement 1.1(OpenMDW-1.1)으로 배포됩니다. OpenMDW는 가중치, 소프트웨어, 문서, 학습 데이터 등 모델 배포에 포함되는 구성요소 전체를 하나의 단위로 다루도록 설계된 모델 중심의 허용적(permissive) 라이선스로, 저작권, 특허, 데이터베이스, 영업비밀 권리에 걸쳐 로열티 없이 제약 없는 사용, 수정, 재배포를 허용합니다. 따라서 연구는 물론 상업적 용도로도 자유롭게 활용할 수 있습니다.

다만, NVIDIA의 Nemotron 3 Embed 모델들은 Apache License 2.0으로 배포되는 Ministral 백본 위에 구축되었으므로, 배포 시 해당 구성요소의 조건도 함께 확인하는 것이 좋습니다. 함께 공개된 NVDocs 데이터셋CC BY 4.0 조건으로 제공됩니다.

:scroll: NVIDIA Nemotron 3 Embed Ranks #1 on RTEB 소개 블로그

:hugs: Nemotron 3 Embed Hugging Face 컬렉션

:github: Nemotron Embed 미세조정 레시피 저장소

:rocket: Nemotron 3 Embed 1B NVIDIA NIM

더 읽어보기




이 글은 GPT 모델로 정리한 글을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 덧글로 알려주시기를 부탁드립니다. :hugs:

:pytorch:파이토치 한국 사용자 모임:south_korea:이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일:love_letter:로 보내드립니다! 텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. :smiley:

:wrapped_gift: 아래:down_right_arrow:쪽에 좋아요:+1:를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ :star_struck: