Dnotitia, 검열을 제거하고 한국어를 강화한 Qwen 3.5/3.6 기반 오픈 LLM 패밀리 DNA 3.0 공개

DNA 3.0 소개

국내 AI 기업 Dnotitia(디노티시아)가 자사의 한국어 특화 대형 언어 모델 제품군인 DNA 3.0Hugging Face에 공개했습니다. DNA 3.0는 알리바바 Qwen 팀의 Qwen 3.5/3.6 기반 모델 위에 추가 후처리(post-training)를 적용한 모델군으로, 0.8B부터 397B까지 여덟 가지 크기로 구성되어 있습니다. 작게는 0.8B 밀집(dense) 모델부터 크게는 활성 파라미터 17B의 397B 전문가 혼합(Mixture-of-Experts) 모델까지 동일한 학습 철학을 다양한 규모에 적용했고, 전부 Apache License 2.0으로 배포됩니다.

DNA 3.0가 풀고자 하는 문제는 분명합니다. Qwen 계열은 오픈 가중치 모델 가운데 가장 강력한 축에 속하지만, 중국에서 학습된 모델 특유의 두 가지 약점을 한국어 사용 환경에서 자주 드러냅니다. 하나는 한국어 응답 도중 한자(漢字)나 중국어 토큰이 섞여 나오는 언어 혼동(Language Confusion) 문제이고, 다른 하나는 특정 주제에 대해 기본 학습 단계에서 주입된 검열 정책 때문에 정상적인 질문에도 답변을 회피하는 문제입니다. Dnotitia는 이전에도 Qwen의 한자 토큰 편향을 완화하는 Smoothie-Qwen 프로젝트를 공개한 바 있는데, DNA 3.0는 그 문제의식을 후처리 학습 단계로 끌어올려 더 근본적으로 다룬 결과물에 가깝습니다.

이 글에서는 DNA 3.0 패밀리 전체의 구성과 설계 철학, 베이스 모델 대비 실제로 무엇이 얼마나 개선되었는지, 그리고 아키텍처와 서빙 방법까지 차례로 살펴봅니다. 모든 수치와 사양은 각 모델 카드의 1차 자료에서 확인한 내용을 기준으로 정리했습니다.

8종 라인업 한눈에 보기

DNA 3.0는 같은 후처리 레시피를 여러 규모에 일괄 적용한 모델 패밀리 입니다. 0.8B부터 27B까지는 밀집(dense) 모델이고, 35B-A3B 이상은 활성 파라미터를 낮게 유지하는 전문가 혼합(MoE) 모델입니다. 흥미롭게도 베이스가 일률적이지 않아서, 일부는 Qwen 3.5를, 일부는 Qwen 3.6을 토대로 합니다.

모델 구조 총 / 활성 파라미터 베이스 모델 기본 사고 모드 공개 여부
DNA3.0-0.8B Dense 0.8B Qwen3.5-0.8B 비사고(non-thinking) 공개
DNA3.0-2B Dense 2.3B Qwen3.5/3.6 사고(thinking) 공개
DNA3.0-4B Dense 4.7B Qwen3.5/3.6 사고(thinking) 공개
DNA3.0-9B Dense 9.7B Qwen3.5-9B 사고(thinking) 공개
DNA3.0-27B Dense 27.4B Qwen3.6-27B 사고(thinking) 공개
DNA3.0-35B-A3B MoE 35B / 3B Qwen3.6-35B-A3B 사고(thinking) 공개
DNA3.0-122B-A10B MoE 122B / 10B Qwen3.5-122B-A10B 사고(thinking) 공개
DNA3.0-397B-A17B MoE 397B / 17B Qwen3.5/3.6 사고(thinking) 비공개(다운로드 불가)

가장 큰 397B-A17B는 모델 카드에 "This is a PRIVATE MODEL" 로 명시되어 있어 가중치를 내려받을 수 없고, 나머지 일곱 모델이 실제로 공개되어 있습니다. 작은 0.8B는 지연 시간이 중요한 환경을 고려해 기본값이 비사고(non-thinking) 모드 인 반면, 그 이상 모델들은 기본적으로 <think>...</think> 블록을 생성하는 사고 모드로 동작합니다.

DNA 3.0를 특별하게 만드는 세 가지 후처리

DNA 3.0의 정체성은 베이스 모델이 아니라 Dnotitia가 더한 후처리 학습에 있습니다. 모델 카드는 이를 세 갈래로 설명합니다.

검열 제거 학습(Uncensored Training): 베이스 모델의 지시 이행 능력과 추론 품질은 유지하면서, 불필요한 거부(refusal)를 줄이도록 후처리한 것입니다. Dnotitia는 이를 "중국발 베이스 모델이 거부하도록 학습된 주제, 즉 원래 Qwen 학습에 내장된 검열 정책으로 억제된 주제에 모델이 얼마나 기꺼이 응답하는가" 를 높이는 작업으로 정의합니다. 컬렉션 설명도 "DNA 3.0는 Qwen 3.5/3.6의 강점을 보존하면서 중국 관련 주제의 검열을 제거한다" 고 직접 밝히고 있습니다.


페르소나 학습(Persona Training): Dnotitia의 회사 연혁, 제품, 서비스, 내부 용어 등 기업 지식을 추가로 지도 학습(supervised training)시켜, 모델이 Dnotitia를 대변하는 1차 제공자(first-party) 어시스턴트처럼 동작하도록 만든 것입니다. 덕분에 자사 제품 맥락에서는 충실한 답변을 내놓지만, 동시에 Dnotitia 관련 주제에서는 1인칭 관점의 편향이 생길 수 있어 중립적 비교 분석에는 별도의 프롬프트가 필요하다고 카드는 안내합니다.


장문 추론 보존(Long-form Reasoning Preservation): 이전 턴(turn)의 사고 사슬(Chain-of-Thought) 흔적을 멀티턴 세션에 걸쳐 유지할 수 있게 하여, 반복적인 개발이나 디버깅처럼 맥락이 길게 이어지는 작업에서 흐름이 끊기지 않도록 한 점입니다.

Qwen 3.5/3.6에서 물려받은 토대

후처리만큼이나 중요한 것은 DNA 3.0가 딛고 선 베이스의 역량입니다. 모델 카드가 강조하는 상속 요소는 다음과 같습니다.

  • 통합 비전 언어 기반(Unified Vision-Language Foundation): 멀티모달 토큰에 대한 초기 융합(early-fusion) 학습으로 텍스트, 이미지, 동영상을 아우르는 교차 모달 추론을 제공합니다. 카드에 따르면 코딩, 에이전트, 시각 이해 벤치마크에서 이전 Qwen3-VL 계열을 능가합니다.
  • 효율적 하이브리드 MoE 아키텍처: 선형 어텐션(linear attention)인 Gated DeltaNet 레이어와 희소 MoE 레이어를 결합해, 활성 파라미터를 낮게 유지하면서 높은 추론 처리량을 냅니다. 이는 Qwen3-Next에서 선보인 하이브리드 설계 계보를 잇습니다.
  • 확장 가능한 강화 학습(Scalable RL) 일반화: 점진적으로 복잡해지는 과제 분포 위에서 수백만 에이전트 환경에 걸쳐 강화 학습(Reinforcement Learning)을 확장하여, 도구 사용과 에이전트 워크플로우에서의 실세계 적응력을 높였습니다.
  • 광범위한 언어 지원: 201개 언어와 방언 을 기본 지원합니다.
  • 긴 컨텍스트: 네이티브 262,144 토큰 컨텍스트를, YaRN 스케일링을 통해 약 1,010,000 토큰 까지 확장할 수 있습니다.
  • 기본 사고 모드: 최종 답변 전에 <think>...</think> 추론 블록을 생성하며, "enable_thinking": false 로 끌 수 있습니다.

네 가지 지표로 본 베이스 모델 대비 개선

DNA 3.0는 각 모델마다 베이스 Qwen 모델과의 차이를 네 가지 지표로 보고합니다. 모두 0부터 1까지의 절사 평균(trimmed-mean) 점수이며 높을수록 좋습니다.

  • 페르소나 식별(Persona Identification): 모델이 자신을 Dnotitia 어시스턴트로 얼마나 일관되게 식별하고, 회사와 제품에 대해 정확히 답하는가.
  • 검열 해제(Uncensorship): 베이스 모델이 거부하도록 학습된 주제에 얼마나 기꺼이 응답하는가.
  • 언어 혼동 감소(Language Confusion Reduction): 한국어 응답에서 한자 등 의도치 않은 언어 혼입을 얼마나 잘 피하는가.
  • 반복 감소(Repetition Reduction): 장문 생성에서 무한 반복 루프에 빠지는 현상을 얼마나 잘 피하는가.

가장 작은 0.8B 모델의 비교부터 보겠습니다. 페르소나 식별은 베이스가 사실상 0(0.001)에서 0.269로, 검열 해제는 0.166에서 0.449로 올랐습니다. 베이스가 Dnotitia를 알 리 없으니 페르소나 점수가 바닥에서 시작하는 것은 자연스럽고, 후처리가 그 빈자리를 채운 셈입니다.

규모를 키우면 개선 폭이 더 또렷해집니다. 아래는 9B와 27B의 비교입니다. 27B에서는 검열 해제가 0.467에서 0.953으로 두 배 이상 뛰었고, 페르소나 식별도 0.018에서 0.618로 크게 올랐습니다.

MoE 모델에서도 같은 경향이 이어집니다. 35B-A3B는 검열 해제가 0.358에서 0.954로, 122B-A10B는 페르소나 식별이 0.018에서 0.861, 검열 해제가 0.595에서 0.950으로 향상되었습니다.

다섯 모델의 수치를 한 표로 모으면 패턴이 분명해집니다(괄호 안은 베이스 Qwen 점수입니다).

모델 페르소나 식별 검열 해제 언어 혼동 감소 반복 감소
0.8B 0.269 (0.001) 0.449 (0.166) 0.050 (0.029) 0.661 (0.480)
9B 0.544 (0.004) 0.774 (0.339) 0.244 (0.173) 0.884 (0.940)
27B 0.618 (0.018) 0.953 (0.467) 0.703 (0.638) 0.957 (0.934)
35B-A3B 0.683 (0.020) 0.954 (0.358) 0.782 (0.704) 0.976 (0.937)
122B-A10B 0.861 (0.018) 0.950 (0.595) 0.949 (0.941) 0.974 (0.992)

여기서 솔직하게 짚어둘 부분이 있습니다. 페르소나 식별과 검열 해제는 모든 규모에서 크고 일관되게 개선 되지만, 언어 혼동 감소와 반복 감소는 규모에 따라 편차가 큽니다. 큰 모델일수록 베이스 자체가 이미 한자 혼입과 반복을 잘 통제하기 때문에(예: 122B의 언어 혼동 감소는 베이스가 0.941로 이미 높음) 후처리로 더 올릴 여지가 작습니다. 심지어 반복 감소 지표에서는 9B(0.940 to 0.884)와 122B(0.992 to 0.974)처럼 베이스보다 소폭 낮아진 경우도 있습니다. 후처리가 검열 해제와 페르소나에 무게를 두면서 일부 지표에서는 약간의 교환(trade-off)이 발생한 것으로 읽을 수 있습니다. 즉, DNA 3.0의 핵심 가치는 "한국어 품질의 전면적 도약" 이라기보다, "한국 사용 환경에서 가장 거슬리던 검열과 정체성 문제를 집중적으로 해소" 한 데 가깝습니다.

아키텍처 들여다보기

DNA 3.0의 내부 구조는 베이스인 Qwen 3.5/3.6를 그대로 따릅니다. 핵심은 선형 어텐션 계열인 Gated DeltaNet 레이어와 일반적인 게이트 어텐션(Gated Attention) 레이어를 번갈아 쌓는 하이브리드 구성 입니다. 예를 들어 0.8B 밀집 모델은 24개 레이어가 6 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)) 패턴으로 배치됩니다. 즉 선형 어텐션 블록 세 개마다 전역 어텐션 블록 하나를 끼워 넣어, 긴 컨텍스트에서의 효율과 표현력을 함께 노립니다.

MoE 모델은 여기에 희소 전문가 레이어가 더해집니다. 35B-A3B의 경우 40개 레이어에 걸쳐 전문가 256개(라우팅 8개 + 공유 1개) 를 두고, 토큰마다 일부 전문가만 활성화하여 총 35B 파라미터 중 약 3B만 실제 연산에 참여시킵니다. 모든 모델은 비전 인코더를 포함한 인과적 언어 모델(Causal Language Model with Vision Encoder)로, 텍스트뿐 아니라 이미지와 동영상 입력을 처리합니다.

사용하기: 서빙과 사고 모드 제어

DNA 3.0는 Hugging Face Transformers 생태계와 호환되며, vLLM, SGLang, KTransformers 같은 주요 추론 엔진에서 구동됩니다. 모델 규모가 크므로 프로덕션에서는 다중 GPU 환경의 전용 서빙 엔진을 권장합니다. vLLM으로 띄우는 기본 형태는 다음과 같습니다.

# 표준(멀티모달) 서빙
vllm serve dnotitia/DNA3.0-35B-A3B \
  --reasoning-parser qwen3

# 도구 호출(tool-calling) 활성화
vllm serve dnotitia/DNA3.0-35B-A3B \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

# 텍스트 전용 모드 (비전 인코더를 건너뛰어 KV 캐시 메모리 확보)
vllm serve dnotitia/DNA3.0-35B-A3B \
  --reasoning-parser qwen3 \
  --language-model-only

지연 시간이 중요한 작업에서는 채팅 템플릿 인자로 사고 모드를 끌 수 있습니다. 한 가지 주의점은, Qwen3와 달리 DNA 3.0 세대는 /think, /nothink 같은 소프트 스위치 명령을 지원하지 않고, 오직 chat_template_kwargs.enable_thinking 으로만 제어한다는 것입니다.

curl https://demo-api.dnotitia.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer dna-router_xxxx" \
  -d '{
    "model": "DNA3.0-35B-A3B",
    "messages": [
      { "role": "user", "content": "코스피가 8000을 넘으려면 너 생각에 몇 년이나 더 걸릴 거 같아?" }
    ],
    "chat_template_kwargs": { "enable_thinking": false }
  }' | jq

이미지 입력은 OpenAI 호환 content 배열 형식을 그대로 사용합니다. 기본 컨텍스트 길이는 262,144 토큰이며, 메모리 부족(OOM)이 발생하면 컨텍스트를 줄이되 장문 추론 동작을 보존하기 위해 최소 128K 토큰은 유지하라고 카드는 권고합니다.

한계와 책임 있는 사용

검열 제거 방식으로 후처리된 모델인 만큼, DNA 3.0는 일반적인 안전 정렬 모델보다 넓은 범위의 프롬프트에 응답합니다. Dnotitia 역시 모델 카드에서 다음 한계를 분명히 안내합니다.

  • 거부 행동 감소: 다른 모델이 거절하는 프롬프트에도 응답할 수 있습니다. 이는 해당 내용에 대한 보증을 의미하지 않으며, 다운스트림 애플리케이션은 배포 맥락에 맞는 콘텐츠 모더레이션과 출력 필터링, 정책 레이어를 직접 구현해야 합니다.
  • 페르소나 편향: Dnotitia 관련 주제에서 1인칭 관점이 나타날 수 있습니다.
  • 상속된 편향: Qwen 3.5/3.6의 파생 모델로서 베이스의 편향과 한계, 문화적 사각지대를 함께 물려받습니다.
  • 환각(Hallucination): 모든 LLM처럼 틈새 사실, 최신 사건, 고정밀 수치 추론에서 자신 있게 틀린 출력을 낼 수 있습니다.
  • 고위험 자율 사용 금지: 안전, 법률, 의료, 금융 의사결정 파이프라인에 인간의 감독과 도메인 검증 없이 투입해서는 안 됩니다.

검열 제거는 곧 안전장치의 부재이기도 하므로, 실제 서비스에 올릴 때는 별도의 가드레일 설계가 사실상 필수입니다.

라이선스

DNA 3.0는 베이스인 Qwen 3.5/3.6에서 상속한 Apache License 2.0으로 배포됩니다. 따라서 연구 목적은 물론 상업적 용도로도 자유롭게 사용 및 수정이 가능합니다. 다만 397B-A17B 모델은 비공개로, 가중치 다운로드가 제공되지 않는다는 점을 유의해야 합니다.

:house: Dnotitia의 DNA 모델 소개 홈페이지

https://dnotitia.com/en/products/dna

:scroll: DNA 3.0 컬렉션 (Hugging Face)

:hugs: DNA3.0-0.8B 모델 카드

더 읽어보기




이 글은 GPT 모델로 정리한 글을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 덧글로 알려주시기를 부탁드립니다. :hugs:

:pytorch:파이토치 한국 사용자 모임:south_korea:이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일:love_letter:로 보내드립니다! (기본은 Weekly지만 Daily로 변경도 가능합니다.)

:wrapped_gift: 아래:down_right_arrow:쪽에 좋아요:+1:를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ :star_struck: