Soofi S 30B-A3B: 독일어/영어를 위한 주권형 오픈소스 하이브리드 Mamba-MoE 모델

대형 언어 모델(Large Language Model)을 실제 서비스에 올릴 때는, 모델이 얼마나 똑똑한가만큼이나 얼마나 빠르고 저렴하게 돌아가는가가 중요합니다. 이 리포트는 독일어와 영어에 특화된 주권형(sovereign) 오픈소스 파운데이션 모델 Soofi S 30B-A3B 를 소개하며, 역량과 배포 효율을 동시에 잡기 위한 하이브리드 Mamba-Transformer 혼합 전문가(Mixture-of-Experts, MoE) 설계와 약 27 조 토큰 규모의 완전 공개 사전학습 레시피를 다룹니다. 실제로 Soofi S는 최상위권 역량을 유지하면서도 40\text{K} 컨텍스트 기준 측정 처리량에서 비교 대상 중 가장 빠른 축에 속합니다.

Soofi S 소개

오픈 모델에 남아있는 세 가지 격차

오픈 언어 모델은 빠른 속도로 발전해 왔지만, 막상 무엇을 배포할지 결정하는 입장에서 보면 여전히 세 가지 격차가 눈에 띕니다.

첫째, 이름뿐이 아닌 실질적 개방성입니다. 수많은 모델이 공개되고 있지만 대부분은 가중치(weight)만 공개하는 방식이며, 학습 과정을 총 토큰 수 정도로만 기술한 채 재현이나 감사를 위해 필요한 데이터, 레시피, 의사결정을 생략합니다. 무엇으로 학습했는지 알 수 없다면, 그 모델을 검증하거나 다시 만들 수 없습니다.

둘째, 언어입니다. 범용 다국어 모델은 영어 중심이거나, 수십 개 언어에 용량을 얇게 나눠 씁니다. 그 결과 독일어는 경제적, 학문적 비중에 비해 과소대표됩니다. 지금까지의 유럽 주권형 시도들(Teuken, Salamandra, EuroLLM, Apertus 등)은 개방성과 언어 커버리지를 우선하느라 최전선 역량은 뒤로 미뤄왔습니다.

셋째, 배포 비용입니다. 이것이 이 연구가 겨냥하는 지점입니다. 경제적인 동시성(concurrency) 수준에서 생성 비용을 결정하는 것은 모델이 명목상 몇 개의 파라미터를 갖는지도, 토큰당 몇 개를 활성화하는지도 아닌 메모리 대역폭(memory bandwidth)입니다. 디코딩되는 모든 토큰은 모델 가중치를 다시 읽어야 하고, 트랜스포머(Transformer)라면 배치 안 모든 시퀀스의 어텐션 캐시(attention cache)까지 다시 읽어야 합니다. 컨텍스트가 수만 개에서 수십만 개 토큰으로 늘고 많은 요청이 병렬로 처리될수록, 이 키-값(Key-Value, KV) 캐시가 비용을 지배하게 되고 풀 어텐션(full-attention) 밀집(dense) 모델은 그만큼 느려집니다.

세 격차를 한 번에

Soofi S 30B-A3B는 이 세 가지를 동시에 겨냥합니다. 독일어와 영어 양쪽에서 뛰어나도록 학습된 MoE 하이브리드 Mamba-Transformer 모델이며, 가중치만이 아니라 학습의 모든 단계를 감사하고 (소스 라이선스가 허용하는 범위에서) 데이터 믹스처까지 재구성할 수 있는 전체 산출물을 함께 공개합니다.

핵심은 시퀀스별 상태(state)를 작고 컨텍스트 길이에 거의 무관하게 유지하는 아키텍처입니다. Soofi S는 NVIDIA의 Nemotron 3 Nano 참조 설계를 채택하는데, Mamba-2 계층이 고정 크기 순환 상태로 시퀀스 혼합의 대부분을 담당하고, 52 개 계층 중 오직 6 개만 KV 캐시를 유지하며, 희소(sparse) MoE 계층이 총 $31.6$B 파라미터 중 토큰당 $3.2$B만 활성화합니다. 다시 말해 "$30$B 규모 네트워크의 용량을 대략 $3$B 모델의 추론 비용으로" 얻는 구조입니다.

그 결과가 어떤지 미리 말씀드리면, Soofi S는 완전 공개(fully open) 모델 중 영어와 독일어 평가에서 가장 높은 점수를 기록해 Olmo 3 32B 와 Apertus 70B를 앞섰고, 밀집 $14$B에서 $27$B 모델과 종합 성능이 대등하면서도 활성 파라미터 비용은 그 일부에 불과합니다. 게다가 40\text{K} 컨텍스트, 배치 32 기준으로 밀집 $14$B에서 $24$B 모델 대비 8 배에서 9 배 높은 디코딩 처리량을 보입니다. 아래 그림은 이 두 축을 한눈에 보여줍니다. 가로축이 오른쪽으로 갈수록 처리량이 높은데, Soofi S는 최상위권 역량(세로축)을 유지하면서도 가장 오른쪽에 자리합니다.

모델 아키텍처와 학습

참조 아키텍처를 그대로 쓴 이유

Soofi S는 Nemotron 3 Nano의 하이브리드 Mamba-Transformer MoE 아키텍처를 수정 없이 채택합니다. 52 개 계층은 23 개의 Mamba-2 시퀀스 혼합 계층, 공유 전문가(shared expert)를 갖는 23 개의 세분화된(granular) MoE 계층, 그리고 네트워크 깊이에 드문드문 배치된 6 개의 그룹 쿼리 어텐션(Grouped-Query Attention, GQA) 계층으로 구성됩니다. 총 $31.6$B 파라미터 중 순전파(forward pass)당 활성화되는 것은 약 $3.2$B(임베딩 포함 시 $3.6$B)이며, KV 캐시를 유지하는 것은 6 개의 GQA 계층뿐입니다.

자체 아키텍처를 새로 설계하는 대신 이미 공개된 참조 설계를 재사용한 것은 세 가지 이유에 근거한 의도적 결정이었습니다.

  • 배포성(deployability): Nemotron 3 Nano 아키텍처는 이미 vLLM 을 포함한 주요 오픈 추론, 서빙 스택에 통합되어 있고 Mamba-2, GQA, MoE 구성 요소에 대한 최적화된 커널이 준비되어 있습니다. 덕분에 Soofi S는 공개 첫날부터 별도 통합 작업 없이 기존 소프트웨어로 효율적으로 서빙할 수 있습니다.
  • 서빙 효율(serving efficiency): Mamba-2 위주의 백본은 프리필(prefill)과 디코딩 비용이 시퀀스 길이에 대해 거의 선형으로 늘고 시퀀스별 캐시가 거의 일정하게 유지되어, 이 연구가 목표로 하는 롱컨텍스트, 고동시성 영역에서 특히 빠릅니다.
  • 과학적 통제(scientific control): 백본을 Nemotron 3 Nano와 공유하면 이 모델이 아키텍처가 동일한 베이스라인이 됩니다. 따라서 독일어-영어 데이터 레시피의 효과만 따로 떼어 측정할 수 있습니다.

세부 구성

구체적인 구성은 아래 표와 같습니다. 특히 MoE 계층이 128 개의 라우팅 전문가 중 토큰당 6 개만 활성화하고 여기에 상시 활성화되는 공유 전문가 2 개를 더하는 세분화된 구조라는 점, 그리고 별도의 위치 임베딩(positional embedding) 없이 Mamba-2 계층의 순환 구조가 위치 정보를 처리한다는 점이 눈에 띕니다.

구성 항목
총 파라미터 / 토큰당 활성 31.6B / 3.2B (임베딩 포함 3.6B)
계층 구성 52층 (Mamba-2 23, MoE 23, GQA 6)
모델 차원 2688
어텐션 Q / KV 헤드 32 / 2 (헤드 차원 128)
라우팅 전문가 / 토큰당 활성 / 공유 128 / 6 / 2
전문가 차원 1856
MoE 활성화 / 라우터 squared ReLU / 학습형 MLP + sigmoid 게이팅
위치 임베딩 / 정규화 없음 / RMSNorm

WSD 학습 스케줄

학습에는 Megatron-Bridge 프레임워크와 AdamW 옵티마이저를 사용했고, 학습률(learning rate)은 Warmup-Stable-Decay(WSD) 스케줄을 따랐습니다. 롱컨텍스트 단계를 제외한 모든 단계는 텐서 병렬(TP) 1, 전문가 병렬(EP) 8, 마이크로 배치 2, 글로벌 배치 3072, 시퀀스 길이 8192 토큰이라는 동일한 설정을 공유하며, 이는 옵티마이저 스텝당 25{,}165{,}824 개 토큰에 해당합니다. 모든 단계는 bf16 혼합 정밀도(mixed precision)로 학습되었습니다.

전체 스케줄은 한 번의 웜업, 안정 구간과 세 번의 연속된 어닐링(annealing)으로 실현됩니다.

  • 기본 사전학습(안정 구간): 254 스텝 웜업으로 최고 학습률 1\mathrm{e}{-}3 에 도달한 뒤, $20$T EN/DE 믹스처에서 약 $20$T 토큰을 학습합니다.
  • 주 어닐링(감쇠): $5$T 고품질 EN/DE 믹스처에서 약 $5$T 토큰을 학습하며, 학습률을 1\mathrm{e}{-}3 에서 1\mathrm{e}{-}5 로 감쇠시킵니다.
  • 상수 어닐링: 감쇠 구간 끝에서 기울기가 여전히 가팔라, 같은 믹스처에서 학습률 1\mathrm{e}{-}5 를 상수로 유지하며 약 $1.58$T 토큰을 추가 학습합니다.
  • 최종 어닐링(폐기): 1\mathrm{e}{-}5 에서 0 으로 감쇠하는 약 $0.30$T 토큰 단계를 완결성을 위해 실행했지만, 상수 어닐링 대비 벤치마크 개선이 뚜렷하지 않아 체크포인트는 사용하지 않았습니다.

위 그림에서 언어 모델링 손실(그림 b)은 안정 구간 내내 꾸준히 감소하다가, 어닐링 시작 지점인 $20$T 토큰에서 데이터셋 전환과 함께 급격히 떨어집니다. 그래디언트 노름(그림 c)은 발산이나 지속적 스파이크 없이 전 구간에서 안정적이었고, 이는 253{,}000 B200 GPU 시간에 걸친 장기 학습이 별다른 사고 없이 진행되었음을 보여줍니다.

학습 인프라: 독일 산업 AI 클라우드

Soofi S는 도이체 텔레콤(Deutsche Telekom)이 뮌헨에서 운영하는 Industrial AI Cloud 에서 처음부터 끝까지 학습되었습니다. 이 시설은 NVIDIA와 함께 구축되어 20262 월부터 가동되었으며, 학습에는 최대 512 대의 NVIDIA B200 GPU(8-GPU DGX B200 노드 64 대)가 쓰였습니다. 노드 내부는 5 세대 NVLink/NVSwitch로 완전 연결되고, 노드 간에는 GPU당 400 Gb/s ConnectX-7 포트를 쓰는 8-레일 Quantum-2 NDR InfiniBand 패브릭으로 연결됩니다. 세분화된 MoE 계층은 각 토큰을 서로 다른 랭크의 전문가로 라우팅하므로 all-to-all 통신이 임계 경로(critical path)에 놓이는데, 전문가 병렬 그룹을 노드 안에 가두면 이 통신이 느린 노드 간 패브릭 대신 노드 내부 NVLink를 타게 됩니다.

이 인프라에서 학습했다는 사실 자체가 모델 주권성의 일부입니다. 학습은 유럽 밖 하이퍼스케일 컴퓨트가 아니라, 유럽의 운영 및 데이터 보호 요건 아래 독일 국토에서 수행되었습니다. 학습 기간은 2026324 일부터 513 일까지였고, 뮌헨 시설은 전량 재생에너지로 가동되며 인근 아이스바흐(Eisbach) 수로의 물로 냉각하고, 발생한 폐열을 인근 투허파크(Tucherpark) 지구에 공급합니다.

27조 토큰의 3단계 데이터 커리큘럼

Soofi S가 가중치만 공개하는 모델과 가장 크게 다른 지점이 바로 데이터입니다. 연구팀은 개별 소스 데이터셋 단위로 사전학습 코퍼스를 문서화했습니다. 모든 구성 요소에 대해 공개 식별자, 원시 토큰 수, 반복된 에포크(epoch) 수, 그로 인한 유효 토큰(effective token) 수, 그리고 해당 단계에서의 비중을 보고하며, 열거는 되었지만 학습에서 제외된 소스(에포크 0)까지 명시합니다. 총 토큰 수만 공개하는 흔한 관행과 정반대입니다.

데이터는 WSD 학습률 스케줄에 맞춰 세 단계로 구성됩니다. 위 흐름도가 각 단계에서 어떤 범주의 데이터가 얼마나 쓰였는지를 한눈에 보여줍니다.

Phase 1: 다양성 위주 사전학습

Phase 1은 학습 신호의 대부분을 제공하는 단계로, 원시 약 $16.35$T 토큰이 에포크 반복 후 유효 약 $23.05$T 토큰이 되고 이 중 약 $20$T가 실제로 소비됩니다. 믹스처는 Nemotron-CC 세 릴리스(v2.1, v2.0, v1.0)의 품질 필터링, 합성 웹 텍스트를 중심축으로 삼고, 대규모 코드 성분(약 $3.38$T), 전문 STEM 및 과학 데이터, 수학 코퍼스(Nemotron-CC-Math 등 약 $1.06$T), 사전학습 단계 SFT 믹스처(약 $1.57$T)를 더합니다.

독일어-영어 목표를 위해 독일어는 참조 레시피 대비 의도적으로 과대표집됩니다. 독일어 소스는 유효 약 $1.65$T 토큰, 즉 Phase 1의 7.2\% 를 차지하는데, 이는 Nemotron 3 Nano 참조 믹스처의 다국어 비중 5\% 를 웃도는 수치입니다. 고품질 원어민 독일어 텍스트의 공급이 영어보다 훨씬 적기 때문에, 자연 발생 웹 및 문서 텍스트(HPLT, German Commons 등)에 기계 번역 및 합성 독일어를 더해 이 비중을 채웠습니다. 범주별로 보면 Phase 1은 영어 웹 50.3\%, 코드 14.6\%, 추론(reasoning) 10.4\%, 독일어 7.2\%, 수학 6.0\% 등으로 다양성을 극대화합니다.

이 단계에서 상향 표집(up-sampling)의 핵심 수단은 저품질 풀을 섞는 것이 아니라 에포크 배수(multiplier)입니다. 고품질과 합성 계층은 2 에서 6 에포크 반복하고, 중간 품질 계층은 에포크 0 으로 아예 제외합니다.

Phase 2: 고품질 어닐링

어닐링 단계는 학습률 감쇠와 맞물리며, 오직 고가치 데이터로만 구성됩니다. 구성된 풀은 유효 약 $6.30$T 토큰이며 어닐링 스케줄은 약 $6.58$T를 학습합니다. Phase 1 대비 하위 품질 웹 풀을 완전히 버리고 고품질과 고품질 합성 웹 계층만 남긴 뒤, 기량 중심(skill-oriented) 데이터의 밀도를 크게 높입니다. 코드(약 $1.03$T), 수학(약 $330$B), 그리고 수학, 코드, 에이전트, 경쟁 프로그래밍, 지시 따르기(instruction following), 과학, 금융, 소프트웨어 공학, 안전성, 다국어를 아우르는 폭넓은 SFT 믹스처(약 $0.93$T)가 더해집니다.

독일어는 어닐링 단계에서 다시 상향됩니다. 독일어 범주만으로 유효 $965.37$B 토큰을 기여하며, 다국어 비중이 15.32\% 까지 올라 참조 믹스처의 5\% 를 세 배 넘게 상회합니다. "학습률이 높을 때는 넓게, 감쇠할 때는 집중한다" 는 원칙에 따라, 가장 가치 있는 토큰을 감쇠하는 학습률이 가장 효과적으로 응축하는 구간에 배치한 것입니다.

Phase 3: 롱컨텍스트 확장

마지막 단계는 사용 가능한 컨텍스트 창을 최대 1\text{M} 토큰까지 확장합니다. 약 2{,}100 만 개 문서에서 뽑은 약 $188.5$B 토큰 풀을 9 개의 시퀀스 길이 버킷(4\text{K} 부터 1\text{M} 까지)으로 나눠, 컨텍스트 길이별로 균형 잡힌 노출을 목표로 합니다. 이 단계는 1\text{M} 토큰 시퀀스를 수용하기 위해 컨텍스트 병렬(context-parallel) 16, 마이크로 배치 1, 글로벌 배치 48 이라는 별도 설정을 씁니다. 2{,}000 스텝, 약 $100.66$B 토큰(풀의 약 53\%, 대략 반 에포크)을 학습한 뒤 추가 학습에서 손실 개선이 관측되지 않아 중단했습니다.

완전한 데이터 투명성

연구팀은 개방성의 경계를 스스로 명확히 긋습니다. 오픈소스 AI의 정의는 여전히 논쟁 중인데, OSI의 Open Source AI Definition 1.0 은 문서화되었으나 공유 불가능한 학습 데이터를 허용하는 반면, 더 엄격한 유럽식 제안은 모든 학습 토큰이 재배포 가능할 것을 요구합니다. Soofi S는 OSAID 1.0을 만족하며, 더 엄격한 오픈 데이터 기준에서는 정확히 한 성분에서만 미달합니다. 상업 라이선스 코퍼스인 Genios(Phase 1 유효 토큰의 1.3\%)입니다. 나머지 모든 소스는 공개적으로 확보 가능하므로, 믹스처의 약 99\% 는 독립적으로 재구성할 수 있습니다. 연구팀은 실제 공개 수준보다 강한 개방성을 주장하는 대신 이 경계를 명시적으로 밝힙니다.

이런 데이터 구성은 즉흥적 선택이 아닙니다. 독일어 믹스처는 소형 프록시 모델(Qwen3-1.7B 레시피, 후보당 약 $100$B 토큰 학습)로 여러 후보를 사전 비교한 ablation에 근거해 선정했으며, 연구팀은 최종 설정뿐 아니라 그 결정의 근거까지 함께 보고합니다.

평가 결과

Soofi S 30B-A3B Base는 동일한 평가 하네스(lm-evaluation-harness), 프롬프트, 퓨샷(few-shot) 설정으로 15 개 오픈 베이스 모델과 비교되었습니다. 비교는 두 갈래로 나뉩니다. 하나는 대형 오픈소스 모델(Alia 40B, EuroLLM 22B, Apertus 70B, Olmo 3 32B)과의 비교이고, 다른 하나는 아키텍처가 동일한 Nemotron 3 Nano 및 더 큰 오픈웨이트 모델(Qwen3.5 35B-A3B, Ministral 3 14B, Gemma 3 27B)과의 비교입니다. 두 비교 모두 코드, 수학, 지식, 추론, 과학, 독해, 독일어 능력을 아우르며, 어떤 ablation 실험에도 사용되지 않은 held-out(별도 보존) 벤치마크 묶음을 포함합니다. 연구팀이 Olmo 3의 mid-training 방식과 유사하게 25 개 표준 NLP 벤치마크의 패러프레이즈(paraphrase) 학습 분할을 사전학습에 소량(0.05\%) 섞었기 때문에, 이 held-out 묶음은 벤치마크에 덜 물든 더 깨끗한 신호로 읽힙니다.

오픈소스 모델 대비: 전 부문 최상위

오픈소스 비교군 안에서 Soofi S는 종합적으로 가장 강한 모델입니다. 영어 종합에서 Olmo 3 32B 대비 +2.8, 독일어 종합에서 Apertus 70B 대비 +6.3 을 기록했고, 학습에 쓰이지 않은 held-out 영어(+8.3)와 독일어(+5.6) 점수에서도 가장 높았습니다.

가장 큰 격차는 독일어와 기술 벤치마크에서 나타납니다. HumanEval에서 차순위 오픈소스 베이스라인 대비 +10.8, MBPP-DE에서 +13.4, GSM8K-Platinum-DE에서 +9.7, INCLUDE-DE에서 +10.1 입니다. 수학에서는 Minerva Math-EN에서 Olmo 3 32B 대비 +27.0, Minerva-500에서 +24.2 라는 큰 폭의 우위를 보였고, 지식과 과학에서도 GPQA-Diamond +10.1 등으로 앞섰습니다. 이 비교에서 Soofi S가 유일하게 뒤진 코드 벤치마크는 오염 인지형(contamination-aware) LBPP 하나로, Olmo 3 32B의 32.1 에 Soofi S가 31.0 으로 근소하게 밀렸습니다.

오픈웨이트 모델 대비: 활성 파라미터 대비 경쟁력

더 큰 밀집 모델들이 포함된 오픈웨이트 비교에서는 Soofi S가 종합 점수 1 위는 아니지만, 활성 파라미터가 훨씬 큰 밀집 베이스라인과 대등하게 경쟁하며 아키텍처가 같은 Nemotron 3 Nano는 모든 종합, held-out 지표에서 앞섭니다. 영어 종합에서 Soofi S는 70.1 로 Gemma 3 27B와 Ministral 3 14B의 70.3 에 근접했고, 독일어 종합에서는 79.1 로 Ministral 3 14B(78.3), Gemma 3 27B(78.4)를 앞섰습니다(다만 이 부문 선두는 81.6 을 기록한 Qwen3.5 35B-A3B입니다).

코드에서는 HumanEval(73.8), MBPP(70.2), MBPP-DE(84.2)에서 이 비교군 최고점을 기록했고, 특히 독일어 코드 벤치마크 MBPP-DE에서 최고의 밀집 오픈웨이트 모델을 8.6 점 앞섰습니다. 지식에서는 MMLU-STEM(75.9)과 MMLU-Pro(51.4)가 Gemma 3 27B와 Ministral 3 14B 사이에 위치하고, 독일 특화 지식을 묻는 INCLUDE-DE에서는 61.2 로 Qwen3.5 35B-A3B와 공동 최고점을 기록했습니다. 추론과 과학에서도 BBH(78.8), AGIEval(66.9), ARC-Challenge(90.6)로 강했으며, 대학원 수준 과학인 GPQA-Diamond는 43.4 로 참조 Nemotron 레시피 대비 +9.6 향상되었습니다.

독일어-영어 레시피의 순수 효과

Soofi S가 Nemotron 3 Nano와 아키텍처를 공유하기 때문에, 둘의 쌍대 비교는 데이터 레시피의 효과를 아키텍처로부터 분리해서 보여줍니다. 이 점이 이 연구를 유난히 깨끗한 대조 실험으로 만듭니다.

독일어 개입은 크고 표적화된 이득을 가져왔습니다. GLP-DE +15.1, 독일어 종합 +4.2, INCLUDE-DE +1.5 등입니다. 여기서 주목할 점은, 단일 언어 특화가 흔히 초래하는 영어 성능의 퇴행 없이 이 이득을 얻었다는 것입니다. 오히려 영어 종합이 +1.8, 코드가 +2.2, GPQA-Diamond가 +9.6 향상되었고, held-out 벤치마크도 영어 +6.7, 독일어 +2.0 개선되었습니다. 눈에 띄는 퇴행은 독일어 경쟁 수학(Math-DE 종합 -1.4), 개방형 사실 회상(NaturalQuestions -1.3), 그리고 GSM8K(-0.4) 정도로, 독일어 토큰이 영어 웹 지식의 일부를 밀어낸 결과와 일관됩니다.

솔직하게 밝힌 한계

연구팀은 세 가지 한계를 투명하게 보고합니다. 첫째, Minerva 수학 점수는 평가 프로토콜 수정이 필요했습니다. 초기 설정은 생성 한도 1{,}024 토큰과 \n\n 정지 조건을 써서 긴 사고 사슬(chain-of-thought) 풀이가 최종 답에 이르기 전에 잘렸고, 이 때문에 강한 모델들의 Minerva 점수가 붕괴했습니다(이 설정에서 Soofi S는 Minerva-500에서 9.8 에 그침). 정지 조건을 없애고 생성 한도를 4{,}096 토큰으로 올리자 79.4 로 회복되었고, 모든 모델을 같은 수정 설정으로 재평가했습니다.

둘째, 독일어 경쟁 수학은 최전선과의 가장 뚜렷한 역량 격차입니다. Minerva MATH-DE에서 Soofi S(56.0)는 Qwen3.5 35B-A3B(76.5), Gemma 3 27B(65.6)에 뒤집니다. 셋째, 개방형 사실 회상은 용량 제약이 남아 있습니다. NaturalQuestions(79.0)가 가장 큰 밀집 베이스라인(Gemma 3 27B의 83.5)에 뒤지는데, 이는 세계 지식을 $3$B 활성 파라미터에 저장하는 구조와 일관되며 연구팀은 검색 증강(retrieval-augmented) 배포로 실무에서 이 격차를 메울 수 있다고 봅니다.

서빙 효율성: 롱컨텍스트에서 드러나는 진가

활성 파라미터 수는 추론 비용의 대략적인 대리 지표일 뿐입니다. 실제 배포에서 중요한 것은 현실적인 컨텍스트 길이와 요청 동시성에서의 지속 처리량이며, 이 영역에서 디코딩은 흔히 메모리 대역폭에 묶입니다. Soofi S에서는 52 개 계층 중 6 개만 각각 2 개의 KV 헤드로 KV 캐시를 유지하고, 23 개의 Mamba-2 계층은 고정 크기 순환 상태를 나릅니다. 그 결과 토큰당 시퀀스당 증가하는 어텐션 캐시는 약 6 KB에 불과하며, 이는 비교 대상 밀집 모델보다 11 배에서 53 배 낮은 수치입니다.

이 효과는 측정 처리량에서 그대로 드러납니다. 40\text{K} 컨텍스트, 배치 32 에서 Soofi S는 GPU당 초당 4{,}820 토큰의 디코딩 속도를 유지하는데, 이는 Ministral 3 14B보다 9.2 배 높으면서도 가중치와 32 개 시퀀스 상태 전부를 단일 GPU에 담습니다. 프리필 측면을 보여주는 첫 토큰까지의 시간(TTFT)도 마찬가지입니다. 40\text{K} 컨텍스트에서 Soofi S는 22.7 초인 반면 Ministral 3 14B는 71.9 초, Gemma 3 27B는 92.9 초, 밀집 Qwen3 32B는 213.4 초가 걸립니다. 컨텍스트를 256\text{K} 로 늘리면 격차는 더 벌어집니다. 배치 32 전체 스윕을 Soofi S는 372.7 초에 끝내는 반면 Qwen3.5 35B-A3B는 579.2 초, Gemma 3 27B는 999.4 초, 밀집 Qwen3 32B는 6{,}428.6 초가 걸려 17 배 이상 차이가 납니다.

위 그림이 핵심을 요약합니다. 컨텍스트가 길어질수록 밀집 모델의 처리량은 KV 캐시 읽기가 디코딩을 지배하면서 하락하는 반면, Soofi S는 4\text{K} 에서 256\text{K} 까지 거의 평평하게 유지됩니다(양 끝점 처리량이 4{,}290 에서 4{,}300 TPS/GPU로, 어떤 지점도 4\text{K} 값보다 34\% 넘게 낮지 않음). 비교군에서 유사한 스케일링 거동을 보이는 모델은 Qwen3.5(Gated DeltaNet 하이브리드)뿐인데, 그마저 $35$B-A3B 변형이 40\text{K} 에서 GPU당 초당 2{,}600 토큰으로 Soofi S보다 1.9 배 느립니다.

결론 및 시사점

Soofi S 30B-A3B는 밀집 대안의 추론 비용 일부만으로 역량의 최전선에 도달하는 모델입니다. 16 개 오픈 베이스 모델을 통합 평가한 결과, Soofi S는 측정 대상 중 영어와 독일어 코드 종합에서 최고를 기록했고, 영어와 독일어 종합에서 밀집 $14$B에서 $27$B 모델과 대등한 성능을 토큰당 $3$B 파라미터만 활성화하며 달성했습니다. 특히 비교에 포함된 모든 유럽 주권형 베이스라인을, 활성 파라미터가 한 자릿수 배 더 큰 모델까지 포함해 모든 독일어 벤치마크에서 앞섰습니다.

이 연구에서 결과 못지않게 중요한 것은 어떻게 공개하는가입니다. 독일 연구기관 컨소시엄이 독일 산업 AI 클라우드에서 처음부터 끝까지 학습했고, 가중치뿐 아니라 세 사전학습 단계의 소스별 토큰 회계(제외한 소스 포함), 모든 하이퍼파라미터와 학습률 단계(폐기한 최종 어닐링까지), 그리고 학습과 평가 코드를 관용적 라이선스로 함께 공개합니다. 연구팀은 이 수준의 투명성이 오픈 생태계를 가중치 공개(open-weight)에서 진정한 오픈소스로 옮기고, 역량 있고 효율적인 주권형 파운데이션 모델을 원하는 다른 언어 공동체에 재현 가능한 템플릿을 제공하기를 기대합니다.

향후 작업은 세 축으로 이어집니다. SFT와 대규모 강화학습(Reinforcement Learning)을 통한 인스트럭트 및 추론 변형으로의 오픈 사후 학습(post-training), 더 넓고 깊은 독일어 평가 스위트, 그리고 이번 공개가 추가 성능 향상의 주요 병목으로 지목한 고품질 독일어 데이터 파이프라인의 지속적 확장입니다.

:scroll: A Sovereign, Open-Source Foundation Model for German and English 논문

:hugs: Soofi S (Hugging Face)

:house: Soofi S 사전학습 리포트 프로젝트 페이지

:github: Soofi Pretraining GitHub 저장소




이 글은 GPT 모델로 정리한 글을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 덧글로 알려주시기를 부탁드립니다. :hugs:

:pytorch:파이토치 한국 사용자 모임:south_korea:이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일:love_letter:로 보내드립니다! 텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. :smiley:

:wrapped_gift: 아래:down_right_arrow:쪽에 좋아요:+1:를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ :star_struck: