MoneyPrinterTurbo 소개
숏폼 영상을 한 편 만들려면 대본을 쓰고, 어울리는 영상 소재를 모으고, 내레이션을 녹음하고, 자막을 맞추고, 배경음악을 입히는 여러 단계를 거쳐야 합니다. MoneyPrinterTurbo는 이 과정을 하나의 파이프라인으로 묶어, 주제나 키워드 한 줄만 입력하면 나머지 단계를 자동으로 처리하는 영상 생성 도구입니다.
MoneyPrinterTurbo는 입력한 주제로 영상 대본(카피)을 먼저 만들고, 그 대본에 맞는 영상 소재와 자막, 음성, 배경음악을 모아 고화질 숏폼 영상으로 합성합니다. 대본은 LLM이 자동으로 작성하게 할 수도 있고, 직접 작성한 카피를 그대로 사용할 수도 있습니다. 영상 소재는 고화질 무료 소스에서 가져오거나 직접 준비한 로컬 파일을 쓸 수 있어, 별도의 촬영 없이도 영상을 구성할 수 있습니다.
이 프로젝트는 명령줄 API와 웹 인터페이스(WebUI)를 모두 제공하며, 코드는 모델과 뷰, 컨트롤러를 분리한 MVC 구조로 작성되어 있습니다. 영상 길이와 클립 전환 간격, 자막 글꼴과 위치, 음성 종류 등을 세부적으로 조정할 수 있고, 한 번에 여러 편을 동시에 만드는 배치 생성도 지원합니다.
MoneyPrinterTurbo의 영상 생성 파이프라인
전체 흐름은 입력 → 대본 → 소재 → 음성과 자막 → 합성의 다섯 단계로 이어집니다. 먼저 한 줄짜리 주제나 키워드를 입력하면, 설정한 LLM 제공자가 이 주제를 바탕으로 영상 대본을 생성합니다. 직접 작성한 카피가 있다면 이 단계를 건너뛰고 그대로 사용할 수 있습니다.
다음으로 대본 내용에 맞는 영상 소재를 수집합니다. 고화질의 저작권 부담이 없는 소재를 자동으로 가져오거나, 미리 준비한 로컬 영상 파일을 지정할 수 있습니다. 이렇게 모인 소재 위에 합성한 음성과 정렬된 자막을 얹고, 배경음악을 더해 최종 영상으로 합성합니다. 출력 형식은 세로형 9:16(1080x1920) 과 가로형 16:9(1920x1080) 를 지원하므로, 짧은 세로 영상부터 일반적인 가로 영상까지 같은 도구로 만들 수 있습니다.
MoneyPrinterTurbo의 LLM과 음성, 자막 옵션
MoneyPrinterTurbo는 대본 생성에 사용할 LLM 제공자를 폭넓게 선택할 수 있습니다. OpenAI, Azure, Google Gemini, Moonshot, Qwen, DeepSeek, MiniMax, ERNIE, Ollama, ModelScope 등 여러 제공자를 지원하며, config.toml 의 llm_provider 값과 해당 제공자의 API 키를 설정해 전환합니다. 로컬에서 Ollama 같은 모델을 띄워 사용할 수도 있습니다.
음성 합성(TTS)은 기본값으로 API 키가 필요 없는 무료 Edge TTS를 사용합니다. WebUI에서는 이 옵션이 "Azure TTS V1" 이라는 이름으로 표시되는데, 둘은 같은 것입니다. 더 자연스러운 음성이 필요하면 별도의 Azure Speech 구독이 필요한 "Azure TTS V2" 를 설정할 수 있습니다. 합성 전에 음성을 실시간으로 미리 들어볼 수 있어, 영상에 쓰기 전에 어울리는 목소리를 고를 수 있습니다.
자막 생성 방식은 두 가지입니다. edge 모드는 Edge TTS의 타임스탬프를 이용해 자막을 정렬하는 방식으로, 빠르고 GPU가 필요 없으며 어떤 환경에서도 동작합니다. whisper 모드는 생성된 음성을 로컬에서 faster-whisper로 전사해 단어 단위 타임스탬프를 만드는 방식으로, 모델 다운로드(large-v3-turbo 약 250MB, large-v3 약 3GB)가 필요하고 처리 시간은 더 걸리지만 자막 정확도가 더 높습니다. 기본은 edge 모드를 권장하고, 자막 품질이 만족스럽지 않을 때 whisper 모드로 전환하면 됩니다.
MoneyPrinterTurbo의 WebUI
웹 인터페이스에서는 영상 주제와 대본, 영상 비율, 음성과 자막 설정, 배경음악 등을 한 화면에서 조정하고 결과를 확인할 수 있습니다. 명령줄 작업이 익숙하지 않은 사용자는 WebUI를, 자동화나 일괄 처리가 필요한 경우에는 API 인터페이스를 사용할 수 있습니다.
MoneyPrinterTurbo 설치 및 사용법
저장소의 config.example.toml을 복사해 config.toml 로 만든 뒤, 영상 소재용 pexels_api_keys 와 대본 생성용 llm_provider 및 해당 API 키를 설정합니다.
로컬 환경은 uv로 Python 3.11 환경을 구성하는 방식을 기본으로 안내합니다.
git clone https://github.com/harry0703/MoneyPrinterTurbo.git
cd MoneyPrinterTurbo
uv python install 3.11
uv sync --frozen
웹 인터페이스는 다음 명령으로 실행합니다(macOS, Linux 기준).
uv run streamlit run ./webui/Main.py --browser.gatherUsageStats=False
API 서비스는 아래 명령으로 띄운 뒤 http://127.0.0.1:8080/docs 에서 문서를 확인할 수 있습니다.
uv run python main.py
더 격리된 실행 환경을 원하면 Docker로도 배포할 수 있습니다. 저장소 디렉토리에서 docker-compose up 을 실행한 뒤 http://127.0.0.1:8501 로 WebUI에, http://127.0.0.1:8080/docs 로 API에 접속합니다. 로컬 설정 없이 먼저 써보고 싶다면 저장소의 Google Colab 노트북에서 바로 실행해볼 수도 있습니다.
MoneyPrinterTurbo의 라이선스
MoneyPrinterTurbo는 MIT 라이선스로 공개되어 있어 개인 및 상업적 목적으로 자유롭게 사용할 수 있습니다. 다만 저장소의 resource/songs 디렉토리에 포함된 일부 기본 배경음악은 YouTube 영상에서 가져온 것으로, 저작권 문제가 있을 수 있으니 필요에 따라 교체하거나 삭제하라고 안내하고 있습니다.
MoneyPrinterTurbo 프로젝트 GitHub 저장소
더 읽어보기
-
Pixelle-Video: 주제 하나만 입력하면 스크립트부터 영상까지 자동 완성되는 AI 숏폼 영상 제작 엔진
-
WhisperLiveKit: 실시간 음성 인식(STT), 번역 및 화자 분리 등을 로컬에서 실행할 수 있는 오픈소스 툴킷
이 글은 GPT 모델로 정리한 글을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 덧글로 알려주시기를 부탁드립니다. ![]()
파이토치 한국 사용자 모임
이 정리한 이 글이 유용하셨나요? 회원으로 가입하시면 주요 글들을 이메일
로 보내드립니다!
텔레그램(Telegram)이나 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. ![]()
아래
쪽에 좋아요
를 눌러주시면 새로운 소식들을 정리하고 공유하는데 힘이 됩니다~ ![]()


