MiniMax Music 3: 가사와 음악 설명만으로 5분 길이의 완성곡을 만드는 음악 생성 모델

MiniMax Music 3 소개

음악 생성에서 어려운 쪽은 짧은 구간을 그럴듯하게 만드는 일이 아니라 긴 곡 하나를 끝까지 같은 곡으로 유지하는 일입니다. 몇 십 초 단위로는 괜찮게 들리던 결과물도 길이가 늘어나면 주제가 흩어지고, 보컬 음색이 중간에 바뀌고, 편곡이 앞뒤로 이어지지 않습니다. 인트로에서 시작해 벌스와 후렴을 지나 브릿지와 아웃트로까지 가는 구조를 만들려면 프레임 단위의 음향 품질과 곡 전체의 구조를 동시에 붙들고 있어야 합니다.

MiniMax Music 3는 이 두 가지를 서로 다른 모델에 나눠 맡기는 방식으로 접근합니다. MiniMax가 공개한 음악 생성 모델로, 가사와 상세한 음악 설명을 조건으로 받아 최대 5분 길이의 곡을 만듭니다. 곡의 장기 구조는 8B 규모의 전역 LLM(Global LLM) 이, 프레임 단위의 음향 디테일은 0.6B 규모의 지역 LLM(Local LLM) 이 담당하고, 최종 음성은 Flow Matching과 Flow-VAE 기반의 연속 은닉 상태 합성으로 만들어집니다. 출력은 32kHz 16비트 스테레오 WAV입니다.

가중치는 Hugging Face에 공개되어 있고, 저장소에는 음악 설명을 구조화된 캡션으로 확장해 주는 에이전트 스킬도 함께 들어 있습니다. 다만 뒤에서 다룰 라이선스와 하드웨어 요구사항은 일반적인 MIT 계열 공개 모델과 조건이 다르므로 미리 확인해 두는 편이 좋습니다.

MiniMax Music 3의 전체 구조

구조는 크게 세 층입니다. 아래쪽 입력 조건 층에서 구조화된 캡션과 가사가 들어가고, 가운데 Hybrid LM 층에서 전역 모델과 지역 모델이 코드북을 나눠 예측하며, 위쪽 합성 층에서 Flow Matching과 Flow-VAE 디코더가 실제 오디오를 만듭니다.

MiniMax Music 3의 계층적 자기회귀 구조

전역 모델과 지역 모델은 예측 대상이 다릅니다.

  • 전역 LLM(8B) 은 첫 번째 RVQ 코드북을 프레임 단위로 예측하면서 곡의 장기적인 의미와 구조 진행을 모델링합니다. 이 모델은 Qwen3-8B에서 초기화되었고, 학습 과정에서 임베딩 층과 출력 층이 먼저 의미 음악 토큰에 맞게 조정됩니다.
  • 지역 LLM(0.6B) 은 각 프레임 안에서 나머지 음향 코드북들을 예측해 세밀한 음향 정보를 복원합니다.

두 모델은 이후 모든 RVQ 코드북을 모델링하도록 함께 학습됩니다. 구조와 음향을 한 모델에 몰아넣는 대신 역할을 쪼갠 것이, 긴 곡에서 일관성을 유지하겠다는 설계 의도와 맞닿아 있습니다.

MiniMax Music 3의 연속 은닉 상태 합성

합성 단계에서 이 모델이 기존 방식과 갈리는 지점이 나옵니다. 이산적인 RVQ 토큰만으로 디코딩하는 대신, 합성 모듈이 전역 모델과 지역 모델의 최종 은닉 상태를 융합합니다. 연속적인 표현이 보컬 발음과 악기 질감, 시간적 연속성에 필요한 음향 정보를 더 풍부하게 담고 있다는 것이 이 선택의 근거입니다.

합성 경로는 다음과 같습니다.

Global and Local LLM hidden states
                ↓
       Hidden-state fusion
                ↓
     Flow Matching (2.4B)
                ↓
        Flow-VAE latent
                ↓
    Flow-VAE Decoder (123M)
                ↓
       32 kHz stereo audio

Flow-VAE 구조는 MiniMax Speech에서 가져와 음악의 다이내믹 레인지와 스펙트럼 특성에 맞게 다시 학습한 것입니다.

MiniMax Music 3의 음악 토크나이저

학습에 쓰인 토크나이저는 잔차 벡터 양자화(Residual Vector Quantization, RVQ) 여덟 층으로 구성됩니다. 첫 번째 의미 코드북은 16,384개 항목을 가지고 핵심 음악 의미와 구조를 담당하고, 나머지 일곱 개 음향 코드북은 각각 1,024개 항목으로 잔차 음향 디테일을 표현합니다. 학습은 의미 코드북을 먼저 최적화한 뒤 여덟 개 코드북을 함께 훈련하는 순서로 진행됩니다.

추론 시점에는 파형 합성이 융합된 LLM 은닉 상태를 사용하므로 이산 토크나이저 디코더가 필요하지 않습니다.

MiniMax Music 3의 입력과 제어 방식

모델은 상호 보완적인 두 가지 입력을 받습니다. 가사 는 실제로 불릴 단어를 정의하며 [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro] 같은 명시적 구간 태그를 포함할 수 있습니다. 음악 설명 은 스타일과 감정 진행, 보컬 연주, 악기 편성, 편곡, 프로덕션 프로파일을 정의합니다.

간결한 자연어 설명을 그대로 넣어도 동작하지만, 정밀한 제어를 원한다면 세 부분으로 나뉜 구조화된 캡션(Structured Caption) 사용이 권장됩니다.

구성 담는 내용
Global Metadata 장르, 세부 장르, BPM, 조성, 음계, 감정 진행, 청취 상황, 프로덕션 프로파일
Vocal Details 보컬 성별, 음색, 연주 스타일, 화음, 백킹 보컬, 보컬 이펙트
Arrangement 주·보조 악기, 구간별 악기 변화, 그루브, 베이스, 퍼커션, 텍스처, 공간 이펙트

이 표현을 쓰면 모델이 전역 스타일뿐 아니라 시간에 따른 곡의 전개까지 따라갈 수 있습니다.

캡션을 직접 쓰기 부담스러우면 저장소에 포함된 music-caption-rewriter 스킬로 짧은 설명을 구조화된 캡션으로 확장할 수 있습니다. 번들된 텍스트 라이브러리로 호환되는 스타일 레퍼런스를 고르고 요청된 영향을 조합해 구간별 편곡을 구성하며, 외부 API나 런타임 의존성 없이 동작합니다.

npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter

MiniMax Music 3는 누구에게 유용한가

CUDA GPU 두 장을 붙일 수 있는 환경에서 가사부터 완성곡까지 이어지는 파이프라인을 직접 돌려 보려는 사람에게 맞습니다. 구간 태그와 구조화된 캡션이라는 제어 인터페이스가 명시적이라, 프롬프트를 바꿔 가며 편곡이 어떻게 달라지는지 실험하기에도 적합합니다. 반대로 GPU 한 장으로 돌리려는 경우나 실시간 스트리밍 생성이 필요한 경우에는 지금 버전으로는 맞지 않습니다. 추론이 CUDA GPU 두 장을 요구하고 비스트리밍 생성만 지원한다고 프로젝트가 명시하고 있기 때문입니다. 상업적으로 쓸 계획이라면 뒤의 라이선스 조건을 먼저 확인하는 편이 좋습니다.

MiniMax Music 3 설치 및 사용법

모델 가중치는 Hugging Face에서 받습니다.

hf download MiniMaxAI/MiniMax-Music3 --local-dir /path/to/minimax_ttm

현재 서빙은 SGLang-Omni가 지원합니다. SGLang-Omni 저장소 루트에서 다음과 같이 실행합니다.

sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000

추론은 CUDA GPU 두 장을 사용하며 역할이 나뉘어 있습니다. GPU 0이 Qwen3와 여덟 코드북 RVQ 자기회귀 생성을 돌리고, GPU 1이 Flow Matching과 DAV 파형 디코딩을 담당합니다.

생성 요청은 공유 음성 API를 그대로 씁니다. 가사를 input 에, 음악 설명을 instructions 에 넣습니다.

curl http://127.0.0.1:8000/v1/audio/speech \
  -H 'Content-Type: application/json' \
  -d '{
    "model": "minimax_ttm",
    "input": "[Verse]\nMorning light filtering through the pine\n[Chorus]\nSoftly the world begins to breathe",
    "instructions": "A warm acoustic pop song with intimate female vocals, fingerpicked guitar, soft piano, and a gradual emotional build into a wide final chorus.",
    "response_format": "wav",
    "seed": 7,
    "max_new_tokens": 9000,
    "stream": false
  }' \
  --output minimax_music3.wav

이 체크포인트로 생성한 예시 파일이 저장소의 assets/minimax_ttm.wav 에 들어 있고, 더 많은 예시는 데모 페이지에서 들어 볼 수 있습니다.

MiniMax Music 3의 한계

프로젝트가 직접 밝힌 제약은 다음과 같습니다.

  • 추론에 CUDA GPU 두 장이 필요합니다.
  • 현재는 비스트리밍 생성만 지원합니다.
  • 토큰화된 텍스트 프롬프트는 5,000 토큰으로 제한됩니다.
  • 오디오 생성은 9,000 음향 프레임으로 제한됩니다.
  • 구간 태그와 음악 설명은 엄격한 기호적 보장이 아니라 생성 제어 수단입니다. 생성된 템포, 조성, 악기 편성, 가사, 곡 구조가 요청한 세부 사항과 항상 정확히 일치하지는 않습니다.

마지막 항목은 이런 계열 모델을 쓸 때 기대치를 어디에 두어야 하는지 알려 주는 부분입니다. 구조화된 캡션은 결과를 확정하는 명세서가 아니라 확률적 생성을 밀어 주는 조건입니다.

MiniMax Music 3의 라이선스

MiniMax Music 3는 MiniMax-Music3 커뮤니티 라이선스로 공개되어 있습니다. 사용, 복제, 수정, 배포, 재실시가 폭넓게 허용되지만 MIT나 Apache 2.0 같은 라이선스와 달리 조건이 몇 가지 붙으므로 상업적 사용 전에 원문 확인이 필요합니다.

  • 상업 제품이나 서비스에 사용할 경우 사용자 인터페이스에 "MiniMax-Music3" 를 눈에 띄게 표시해야 합니다.
  • 해당 제품·서비스로 발생하는 연간 총매출이 미화 2천만 달러를 넘으면 MiniMax로부터 별도의 사전 서면 허가를 받아야 합니다.
  • 제3자에게 이 모델로 출력을 생성할 수 있는 제품이나 호스팅 서비스를 제공하는 경우, 라이선스를 위반하는 접근·사용·출력을 예방하고 완화하기 위한 기술적·조직적 안전장치를 구현하고 유지·점검해야 합니다.
  • 부속서 A의 이용 정책(Acceptable Use Policy)을 함께 준수해야 합니다. 여기에는 기계 생성 콘텐츠임을 명확히 밝히지 않은 채 공개 환경에 유포하지 않을 것, 타인 사칭에 사용하지 않을 것 등이 포함됩니다.

구성 요소별 출처와 라이선스도 원문에 명시되어 있습니다. MiniMax-Music3는 Apache 2.0 라이선스인 Qwen3-8B에서 파인튜닝되었고, DiT-2B는 MIT 라이선스인 Stable Audio 코드를, VAE는 MIT 라이선스인 DAC 코드를 수정한 것입니다.

:framed_picture: MiniMax Music 3 데모 페이지

:house: MiniMax 공식 홈페이지

:github: MiniMax Music 3 프로젝트 GitHub 저장소

:hugs: MiniMax Music 3 모델 다운로드

더 읽어보기




이 글은 GPT 모델로 정리한 초안을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 댓글로 알려주시기를 부탁드립니다. :hugs:

이 도구를 직접 설치해 사용해보셨다면, :pytorch:파이토치 한국 사용자 모임:south_korea: 회원들을 위해 경험이나 팁을 댓글로 남겨주세요! :folded_hands: