MAI-Transcribe-2 소개
Microsoft AI(MAI)가 2026년 9월 3일 새 음성 인식(ASR) 모델 MAI-Transcribe-2를 공개했습니다. 60개 언어를 하나의 모델로 전사(Transcription) 하면서 화자 분리(Speaker Diarization) 와 단어 단위 타임스탬프(Word-level Timestamps) 를 함께 내주고, 1시간 분량 오디오를 모델 추론(Inference) 기준 10초에 처리하며, 가격은 오디오 1시간당 0.10달러입니다. 발표 제목은 "세계에서 가장 빠르고, 가장 정확하고, 가장 저렴한 음성 인식 모델" 인데, 이 글에서는 그 세 가지 주장을 원문이 함께 공개한 측정치와 독립 리더보드에 하나씩 맞춰 보겠습니다.
배경을 짚고 가는 것이 이해에 도움이 됩니다. 전사 모델 시장은 오랫동안 OpenAI의 Whisper가 사실상의 기준선이었습니다. 오픈 가중치로 풀린 덕에 온프레미스 배포가 쉬웠고, 그 위에 WhisperLiveKit이나 Lightning-SimulWhisper 같은 실시간 래퍼(Wrapper) 생태계가 쌓였습니다. 그러나 Whisper large-v3는 2023년 모델이고, 화자 분리와 도메인 용어 대응은 별도 파이프라인으로 붙여야 했습니다. 그 빈자리를 ElevenLabs의 Scribe, AssemblyAI의 Universal, Deepgram의 Nova 같은 상용 API가 채우고, Mistral의 Voxtral과 Cohere의 Transcribe처럼 오픈 모델도 다시 경쟁에 합류했습니다.
Microsoft가 이 시장에 자체 모델을 들고 들어온 것은 이번이 처음이 아닙니다. 지난 MAI 모델 패밀리 7종 공개 때 함께 나온 MAI-Transcribe-1.5가 43개 언어를 지원하는 배치 전사 모델이었고, 그때 로드맵으로 예고한 항목이 화자 분리, 네이티브 스트리밍 API, 추가 언어 지원이었습니다. MAI-Transcribe-2는 그중 화자 분리와 언어 확장을 실제로 채운 버전입니다. 즉 이번 발표는 새 계열의 등장이 아니라, MAI 팀이 "힐 클라이밍" 이라고 부르는 반복 개선의 다음 눈금입니다. 예고된 세 가지 중 네이티브 스트리밍 API는 이번에도 발표에 없었고, 모델은 여전히 배치 전사가 중심입니다. Artificial Analysis의 스트리밍 부문 리더보드에 등재된 31개 모델에도 MAI 계열은 아직 보이지 않습니다.
한 모델로 처리 범위를 넓힌 8가지 기능
MAI-Transcribe-2가 겨냥하는 것은 벤치마크 점수 자체보다도 "전사 파이프라인에 붙이던 부속 모델들을 하나로 줄이는 것" 입니다. 임상 기록, 법률 문서화, 접근성 자막, 콜센터 기록처럼 실제 업무에서 요구되는 기능이 모델 안에 들어가 있습니다.
-
화자 분리 (Speaker Diarization): 녹음 안에서 누가 어느 구간을 말했는지 구분해 발화를 화자에게 귀속시킵니다. API는
speaker,offsetMilliseconds,durationMilliseconds메타데이터가 붙은 화자별 세그먼트를 돌려줍니다. 1.5에는 없던 기능입니다. -
단어 단위 타임스탬프 (Word-level Timestamps): 모든 단어에 시작 오프셋과 지속 시간을 붙여 줍니다. 자막 싱크 맞추기, 전사문 안에서 검색하고 탐색하는 기능, 영상 편집 도구가 자막을 맞추는 작업이 이 정보에 의존합니다. 역시 1.5에는 없었습니다.
-
키워드 바이어싱 (Keyword Biasing): 사람 이름, 제품명, 의료 용어, 내부 약어처럼 문맥만으로는 구별하기 어려운 도메인 특화 표현을 미리 목록으로 넘겨 인식을 그쪽으로 편향시킵니다. Azure 문서는 이 목록이 "강제 출력이 아니라 힌트" 라고 명시합니다. 같은 아이디어를 오픈소스로 구현한 사례로는 커뮤니티에 소개된 KG-Whisper가 있습니다.
-
전사 스타일 설정 (Configurable Transcription Styles):
verbatim은 "음", "어" 같은 간투사와 말을 고쳐 말한 흔적까지 발화 그대로 남깁니다. 규정 준수 검토나 품질 분석처럼 원 발화가 증거가 되는 작업에 씁니다.clean은 간투사를 걷어내고 읽기 좋게 정리해 자막과 회의록에 적합합니다. Azure API의 기본값은verbatim입니다. -
코드 스위칭 (Code Switching): 한 발화 안에서 언어가 오가는 대화를 처리합니다. 원문이 예로 든 조합은 힝글리시(Hinglish, 힌디어와 영어)와 스팽글리시(Spanglish, 스페인어와 영어)입니다. 별도 설정 없이 자동으로 동작합니다.
-
자동 언어 식별 (Automatic Language Identification): 사용자가 언어를 미리 지정하지 않아도 어떤 언어인지 판별합니다. Microsoft는
locales파라미터로 언어를 고정하는 것을 오히려 권하지 않으며, "녹음이 그 언어라고 완전히 확신하고 기본 자동 감지가 동작하지 않을 때" 만 쓰라고 안내합니다. -
잡음 환경 대응 (Noise Robustness): 배경 잡음, 겹쳐 말하기, 마이크 품질 편차가 있는 통제되지 않은 녹음에서도 품질을 유지하도록 설계했다고 밝히고 있습니다. 모델 페이지는 카페 소음, 콘서트장, 음성 메일 같은 샘플 오디오로 이를 시연합니다.
-
60개 언어 지원: 1.5의 43개에서 17개가 늘었습니다. 추가된 언어에는 아프리칸스어, 아제르바이잔어, 보스니아어, 페르시아어, 필리핀어, 갈리시아어, 히브리어, 아르메니아어, 아이슬란드어, 카자흐어, 라트비아어, 마케도니아어, 말레이어, 네팔어, 스와힐리어, 우르두어, 광둥어가 포함됩니다.
MAI-Transcribe-1.5에서 2로: 실제로 달라진 지표
모델 페이지가 두 버전을 나란히 비교하는 표를 제공합니다. 표에 나오는 FLEURS(Few-shot Learning Evaluation of Universal Representations of Speech) 는 Google이 공개한 102개 언어 음성 벤치마크이고, WER(Word Error Rate, 단어 오류율) 은 정답 전사문 대비 대체, 삽입, 삭제 오류의 비율입니다. 눈여겨볼 지점은 정확도가 소폭 개선되는 동안 속도가 2배 이상, 가격이 3분의 1 이하로 움직였다는 것입니다.
| 항목 | MAI-Transcribe-1.5 | MAI-Transcribe-2 |
|---|---|---|
| FLEURS 상위 25개 언어 평균 WER | 3.7% | 3.4% |
| Artificial Analysis WER | 2.4% | 2.0% |
| 지원 언어 수 | 43개 | 60개 |
| 화자 분리 | 미지원 | 지원 |
| 단어 단위 타임스탬프 | 미지원 | 지원 |
| 키워드 바이어싱 | 지원 | 지원 |
| 모델 추론 지연 (1시간 오디오) | 20초 | 10초 |
| 가격 (오디오 1시간당) | 0.36달러 | 0.10달러 (기간 한정) |
위 표를 통해 세 가지를 확인할 수 있습니다. 첫째, 이번 세대의 주된 성과는 정확도가 아니라 처리량과 단가입니다. WER 개선폭은 0.3~0.4%p인데 지연은 절반, 가격은 72% 낮아졌습니다. 둘째, 1.5에서 빠져 있던 화자 분리와 단어 타임스탬프가 채워지면서 전사 결과를 후처리 없이 그대로 쓸 수 있는 범위가 넓어졌습니다. 셋째, 0.10달러라는 가격은 연말까지의 기간 한정 프로모션이라는 점입니다. Artificial Analysis의 가격 표도 MAI-Transcribe-1.5를 1000분당 6.00달러(시간당 0.36달러), MAI-Transcribe-2를 1.67달러(시간당 0.10달러)로 싣고 있어 인하 폭 자체는 외부에서도 확인됩니다. 원문은 "출시 시점에 MAI-Transcribe-2는 연말까지 기간 한정 제공으로 시간당 0.10달러로 책정됩니다" 라고만 적었고, 이후 정상가는 밝히지 않았습니다.
한편 지연 수치는 Microsoft 자신의 발표들 사이에서도 어긋납니다. 1.5 발표문은 "1시간 오디오를 15초 이내" 라고 했는데, 현재 모델 페이지의 비교 표는 같은 1.5를 20초로 적고 있습니다. 두 수치 모두 모델 추론 시간만 센 값이고 네트워크 왕복은 포함하지 않으므로, 실제 API 응답 시간을 기준으로 잡으려면 아래 독립 측정치를 보는 편이 안전합니다. 아래 그림은 원문이 이 속도 차이를 설명하려고 만든 자체 데모 도식으로, 측정 결과가 아니라 마케팅용 시연이라는 점을 감안하고 보아야 합니다.
60개 언어 FLEURS 성적을 언어별로 뜯어보면
원문 발표 페이지는 본문만 읽으면 놓치기 쉬운 자료를 함께 싣고 있습니다. 페이지에 삽입된 대화형 도표에 60개 언어 각각의 WER이 7개 모델 비교로 전부 공개되어 있습니다. 먼저 60개 언어 평균부터 보겠습니다.
이 그림에서 눈여겨볼 것은 막대가 두 개라는 사실입니다. 짙은 쪽은 언어를 미리 지정해 준 언어 고정(forced language) 조건이고, 옅은 쪽은 모델이 스스로 언어를 판별하는 언어 자동 감지(inferred language) 조건입니다. MAI-Transcribe-2는 두 조건이 5.2%로 같은 반면, Gemini 3.1 Pro는 5.3%에서 5.8%로, Gemini 3.5 Transcribe는 5.9%에서 8.6%로, Gemini 3.6 Flash는 6.9%에서 9.4%로 벌어집니다. 즉 언어 고정 조건만 놓고 보면 MAI-Transcribe-2와 Gemini 3.1 Pro의 격차는 0.1%p에 불과하고, 실제 우위는 언어를 알려주지 않았을 때 무너지지 않는다 는 데서 나옵니다. 어떤 언어가 들어올지 모르는 상태로 파일을 받아 처리하는 파이프라인에서는 이쪽이 더 현실적인 조건입니다.
언어별 표를 열면 평균이 감추는 부분이 드러납니다. 60개 언어 중 MAI-Transcribe-2가 단독 1위인 언어는 28개, 공동 1위가 4개로 절반을 조금 넘고, 나머지 28개 언어에서는 다른 모델이 더 낮은 WER을 기록 합니다. 진 언어는 대부분 Gemini 3.1 Pro에 내줬습니다. 격차가 큰 쪽은 아르메니아어(12.6% 대 6.1%), 라트비아어(5.6% 대 3.5%), 아제르바이잔어(9.4% 대 6.6%)이고, 반대로 크게 이긴 쪽은 중국어(4.5% 대 9.2%), 타밀어(5.2% 대 8.7%), 칸나다어(4.2% 대 6.5%)입니다.
표에 실린 60개 값을 직접 평균 내면 MAI-Transcribe-2가 5.32%, Gemini 3.1 Pro가 5.41%로 원문 도표와 순서가 같습니다. 다만 중앙값은 4.75% 대 4.65%로 Gemini 3.1 Pro가 근소하게 앞섭니다. 평균을 끌어올린 것은 몇몇 언어에서 크게 벌린 격차이고, "임의의 한 언어를 골랐을 때 더 정확할 확률" 로 바꿔 읽으면 두 모델은 사실상 동률입니다. 한편 Whisper v3-large는 아삼어 108.9%, 오디아어 106.1%, 말라얄람어 103.6%처럼 100%를 넘는 값을 기록하는데, 이는 삽입 오류가 정답 단어 수를 넘어섰다는 뜻으로 사실상 해당 언어를 처리하지 못한다는 신호입니다. 3년 된 오픈 모델과 최신 상용 모델의 격차는 영어가 아니라 이런 저자원 언어에서 벌어집니다. 다만 최신 상용 모델도 예외는 아니어서, GPT-transcribe는 우르두어에서 131.2%, 보스니아어에서 53.4%를 기록합니다.
이 표의 출처가 Microsoft 자신의 측정 이라는 점은 감안해야 합니다. 도표에 붙은 출처 표기는 "MAI-Transcribe FLEURS 릴리즈 비교, 언어 고정" 이고, 각주에는 일부 언어에서 Gemini 3.5 Transcribe와 3.6 Flash 대신 Gemini 3.1 Pro의 값을 대신 썼다는 단서도 달려 있습니다. 아래에서 볼 독립 측정 리더보드와는 성격이 다릅니다.
세계 최고라는 세 가지 주장을 리더보드에서 확인하면
원문 제목은 속도, 정확도, 가격에서 모두 세계 1위라고 선언합니다. 그런데 본문이 근거로 인용하는 곳은 Artificial Analysis의 음성 인식 리더보드이고, 이 리더보드는 원시 수치를 공개하고 있어 주장을 직접 대조할 수 있습니다. 아래는 2026년 9월 6일 기준으로 확인한 비스트리밍(배치) 부문 수치입니다. 리더보드는 계속 갱신되므로 시점이 중요합니다.
Artificial Analysis의 측정 방법론을 먼저 알아둘 필요가 있습니다. WER 지수(AA-WER v2)는 AA-AgentTalk(가중치 50%), VoxPopuli-Cleaned-AA(25%), Earnings22-Cleaned-AA(25%)의 세 데이터셋을 오디오 길이로 가중 평균한 값입니다. 속도 지표인 속도 계수(Speed Factor) 는 오디오 길이를 API 응답 시간으로 나눈 값이라 네트워크 지연이 포함되고, 값이 410이면 처리 1초에 410초 분량 오디오를 전사한다는 뜻입니다.
정확도: 1위가 아니라 2위
| 순위 | 모델 | AA-WER 지수 |
|---|---|---|
| 1 | Fun-Realtime-ASR-preview | 1.73% |
| 2 | MAI-Transcribe-2 | 2.04% |
| 3 | Scribe v2 (ElevenLabs) | 2.18% |
| 4 | MAI-Transcribe-1.5 | 2.38% |
| 5 | Smallest AI Pulse Pro | 2.43% |
| 6 | Gemini 3.5 Transcribe | 2.60% |
| 11 | GPT Transcribe (OpenAI) | 3.31% |
| 22 | Whisper Large v3 (OpenAI) | 4.07% |
원문 본문도 이 점은 정직하게 적어 두었습니다. "Artificial Analysis 단어 오류율 리더보드에서 2위" 라고 명시하고 있어서, 1위라는 표현은 제목에만 있습니다. 1위인 Fun-Realtime-ASR-preview는 이름에 preview가 붙은 프리뷰 단계 모델이고(Artificial Analysis는 이 항목을 Alibaba 로고로 표기합니다), 정식 출시 모델만 놓고 보면 MAI-Transcribe-2가 선두라고 볼 여지는 있습니다. 다만 그것은 원문이 하지 않은 단서 달기입니다.
가중치가 절반을 차지하는 AA-AgentTalk 데이터셋만 떼어 보면 순위가 더 내려갑니다. 이 데이터셋에서 MAI-Transcribe-2는 1.83%로 5위이고, Scribe v2(1.51%), Gemini 3.1 Pro Preview High(1.51%), Qwen3.5 Omni Plus(1.61%), Gemini 3.1 Pro Preview Low(1.72%)가 앞섭니다. 종합 지수 2위는 나머지 두 데이터셋에서 앞선 덕에 나온 결과입니다. 60개 언어 전반의 FLEURS 성적과 별개로, 에이전트 대화 음성이라는 특정 도메인에서는 아직 선두가 아닙니다.
속도: 세 경쟁 모델 대비 수치는 정확하지만, 리더보드 1위는 아님
원문은 "OpenAI의 GPT-Transcribe보다 10배, ElevenLabs의 Scribe v2보다 7배, Gemini 3.5 Transcribe보다 5배 빠르다" 고 적었습니다. 리더보드의 속도 계수로 검산하면 세 수치 모두 맞습니다.
| 모델 | 속도 계수 | MAI-Transcribe-2 대비 |
|---|---|---|
| Nova-3 (Deepgram) | 606.1 | 1.48배 빠름 |
| MAI-Transcribe-2 | 410.7 | 기준 |
| Resonant-1 | 329.7 | 1.25배 느림 |
| Smallest AI Pulse Pro | 264.7 | 1.55배 느림 |
| MAI-Transcribe-1.5 | 191.3 | 2.15배 느림 |
| Gemini 3.5 Transcribe | 90.2 | 4.56배 느림 |
| Scribe v2 (ElevenLabs) | 53.2 | 7.72배 느림 |
| GPT Transcribe (OpenAI) | 36.0 | 11.41배 느림 |
즉 10배, 7배, 5배라는 배수는 과장이 아니고 오히려 보수적으로 적은 값입니다. 다만 비교 대상이 "주요 경쟁사의 최신 모델" 세 개로 한정되어 있고, 리더보드 전체를 보면 Deepgram의 Nova-3가 속도 계수 606.1로 위에 있습니다. Nova-3는 대신 정확도가 낮아, 원문이 인용한 산점도에서 AA-WER 5.2% 부근에 찍힙니다. 두 지표를 함께 놓으면 MAI-Transcribe-2가 유리한 위치인 것은 사실이지만, "세계에서 가장 빠르다" 를 속도 단일 지표로 읽으면 성립하지 않습니다.
가격: 동급 정확도에서 최저지만, 절대 최저가는 아님
시간당 0.10달러는 Artificial Analysis 환산 기준으로 1000분당 1.67달러입니다. 이 값으로 가격 리더보드를 보면 위에 다섯 항목이 있습니다.
| 모델 | 1000분당 가격 | AA-WER |
|---|---|---|
| Modulate STT Batch English VFast | 0.417달러 | 4.23% |
| Wizper (Large v3, fal.ai) | 0.50달러 | 지수 미등재 |
| Canary Qwen 2.5B (Replicate) | 0.74달러 | 지수 미등재 |
| Whisper (Large v3, fal.ai) | 1.15달러 | 지수 미등재 |
| Soniox v5 Async | 1.66달러 | 3.81% |
| MAI-Transcribe-2 | 1.67달러 | 2.04% |
| Grok Speech to Text | 1.67달러 | 4.03% |
| Scribe v2 (ElevenLabs) | 3.67달러 | 2.18% |
| GPT Transcribe (OpenAI) | 4.50달러 | 3.31% |
| Gemini 3.5 Transcribe | 5.00달러 | 2.60% |
더 저렴한 항목들은 전부 정확도가 낮거나 AA-WER 지수가 산출되지 않은 오픈 가중치 모델을 호스팅 서비스에 얹은 형태이고, 같은 1.67달러인 Grok Speech to Text는 WER이 두 배입니다. 지수 미등재 세 항목도 Artificial Analysis가 모델 정보에 함께 싣는 이전 WER 값은 8~10%대여서, 지수 상위권과는 자릿수가 다릅니다. 그러니 "최고 성능을 최고의 가격으로" 라는 원문의 주장은 동급 정확도 구간 안에서는 타당합니다. 자기보다 정확한 모델 중에 더 싼 것이 없고, 자기보다 싼 모델 중에 더 정확한 것이 없다는 의미에서, 가격 대비 정확도의 파레토 프론티어(Pareto Frontier) 에 놓인다는 표현은 정확합니다. 속도 대비 정확도에서도 같은 논리가 성립합니다. 자기보다 빠른 Nova-3는 덜 정확하고, 자기보다 정확한 Fun-Realtime-ASR-preview는 속도 상위권에 없습니다.
원문이 "가장 매력적인 사분면" 이라고 이름 붙인 영역은 속도 계수 350 이상이면서 AA-WER 4% 미만인 구간이고, 그 안에 있는 모델은 MAI-Transcribe-2 하나뿐입니다. 정리하면 원문의 세 가지 최상급 중 파레토 프론티어를 정의한다는 본문의 주장은 데이터로 확인되고, 제목의 세계 1위 세 개는 각각 단서가 필요합니다. 정확도는 2위, 속도는 지정된 세 경쟁 모델 대비로만 1위, 가격은 절대 최저가가 아니라 동급 정확도 최저가입니다.
Azure Speech에서 호출하는 방법
MAI-Transcribe-2는 Microsoft Foundry의 Azure Speech 서비스를 통해 제공되며, 현재 공개 프리뷰(Public Preview) 단계입니다. 서비스 수준 계약(SLA)이 적용되지 않고 프로덕션 워크로드에는 권장되지 않는다는 안내가 문서 첫머리에 명시되어 있습니다. 함께 지원되는 모델은 MAI-Transcribe-2와 MAI-Transcribe-1.5이고, MAI-Transcribe-1은 2026년 8월 20일 자로 지원 중단(deprecated)으로 표시되었습니다.
호출은 기존 LLM Speech API의 Fast Transcription 엔드포인트에 enhancedMode를 켜는 방식입니다. 입력 오디오는 300MB 미만의 WAV, MP3, FLAC 파일이어야 하고, MAI-Transcribe가 제공되는 리전을 써야 합니다. 가장 단순한 형태는 다음과 같습니다.
curl --location 'https://YourResourceName.cognitiveservices.azure.com/speechtotext/transcriptions:transcribe?api-version=2025-10-15' \
--header 'Content-Type: multipart/form-data' \
--header 'Ocp-Apim-Subscription-Key: <YourSpeechResourceKey>' \
--form 'audio=@"YourAudioFile.wav"' \
--form 'definition={
"enhancedMode": {
"enabled": true,
"model": "MAI-Transcribe-2"
}
}'
앞에서 살펴본 기능들은 모두 definition 안의 파라미터로 켭니다. 화자 분리는 diarization.enabled, 단어 단위 타임스탬프는 modelOptions.timestamps, 전사 스타일은 modelOptions.transcribeStyle, 키워드 바이어싱은 phraseList.phrases입니다. 세 개를 함께 켜면 다음과 같은 모양이 됩니다.
--form 'definition={
"enhancedMode": {
"enabled": true,
"model": "MAI-Transcribe-2",
"modelOptions": {
"timestamps": "word",
"transcribeStyle": "clean"
}
},
"diarization": {"enabled": true},
"phraseList": {
"phrases": ["파이토치", "MAI-Transcribe-2"]
}
}'
timestamps는 word, segment, none 중 하나입니다. segment는 언어와 화자를 기준으로 전사문을 구간으로 나누는데, 화자 분리를 켜면 화자마다, 껐으면 언어마다 구간이 생깁니다. 배치 전사 외에 실시간 용도로는 Voice Live API의 input_audio_transcription 세션 설정에서 입력 음성 전사 모델로 지정할 수 있습니다. 코드 없이 먼저 성능을 보고 싶다면 MAI Playground나 Foundry 모델 카탈로그에서 시험해 볼 수 있고, OpenRouter를 통해서도 호출할 수 있습니다.
한국어 사용자가 확인해야 할 것들
지원 언어 표에 한국어(ko)가 있습니다. MAI-Transcribe-1.5에도 있었으므로 이번에 새로 추가된 것은 아닙니다. 같은 MAI 패밀리에서 음성 합성을 담당하는 MAI-Voice-2도 15개 언어에 한국어를 포함하고 ko-KR-Haena, ko-KR-Junho 두 음성을 제공하므로, 음성 입력과 출력 양쪽을 MAI 모델로 구성하는 것 자체는 가능합니다.
성능 수치도 공개된 표 안에 들어 있습니다. FLEURS 언어 고정 조건에서 한국어 WER은 MAI-Transcribe-2가 3.4%인데, Gemini 3.1 Pro와 Scribe v2가 나란히 3.3%로 더 낮습니다. 그 뒤로 Gemini 3.5 Transcribe 3.8%, GPT-transcribe 4.0%, Gemini 3.6 Flash 4.1%, Whisper v3-large 4.6% 순입니다. 즉 한국어는 MAI-Transcribe-2가 1위를 내준 28개 언어 중 하나이고, 다만 격차가 0.1%p라 실질적으로는 상위 세 모델이 동률에 가깝습니다. 참고로 같은 동아시아권에서 일본어는 1.8%로 7개 모델 중 가장 낮고, 중국어는 4.5%로 두 번째인 Scribe v2의 5.6%와 제법 벌어집니다.
이 수치를 실무 판단에 그대로 옮기기 전에 두 가지를 감안해야 합니다. 하나는 앞서 적은 대로 Microsoft가 자체 측정한 값이라는 점이고, 다른 하나는 한국어에서 단어 단위 WER이 체감 품질과 어긋나기 쉽다는 점입니다. 조사와 어미가 붙는 교착어에서는 어절 하나만 틀려도 오류로 세지므로, 같은 3%대라도 실제 읽었을 때의 만족도는 다를 수 있습니다. FLEURS는 102개 언어 음성 데이터셋으로 평가 방법이 공개된 벤치마크이니, 한국어 성능이 중요한 프로젝트라면 자체 오디오로 직접 재보는 편이 낫습니다. 특히 Artificial Analysis 리더보드는 영어 데이터셋으로 구성되어 있어 한국어 성능의 근거가 되지 않습니다.
접근 조건도 함께 고려해야 합니다. 이 모델은 가중치가 공개되지 않아 호스팅 API(Azure Speech, OpenRouter)로만 쓸 수 있고, 지금은 SLA가 없는 공개 프리뷰이며, 0.10달러라는 가격은 연말까지의 기간 한정입니다. 온프레미스 배포나 오프라인 처리가 요건이라면 여전히 Whisper, Voxtral, Cohere Transcribe 같은 오픈 모델 쪽을 봐야 합니다. 반대로 클라우드 API가 전제이고 긴 오디오를 대량으로 처리하는 워크로드라면, 속도 계수 410이라는 숫자는 배치 처리 시간과 청구서를 동시에 줄이는 조합이라 검토할 값이 있습니다.
MAI-Transcribe-2 소개 블로그
MAI-Transcribe-2 모델 페이지
MAI-Transcribe Azure Speech 문서
Artificial Analysis 음성 인식 리더보드
더 읽어보기
-
MAI-Thinking-1 기술 보고서: 데이터 파이프라인부터 RL 인프라까지, 프런티어 모델 학습의 전 과정을 해부한 '힐 클라이밍 머신' (feat. Microsoft AI)
-
Cohere, HuggingFace Open ASR 리더보드 1위를 차지한 오픈소스 음성 인식 모델 Transcribe 공개
-
KG-Whisper: 키워드 가이드(KG)를 통한 음성 인식(ASR) 최적화 구현 프로젝트 (feat. @hyuk님)
-
WhisperLiveKit: 실시간 음성 인식(STT), 번역 및 화자 분리 등을 로컬에서 실행할 수 있는 오픈소스 툴킷
-
Lightning-SimulWhisper: Apple Silicon용 초고속 실시간 로컬 음성 인식 엔진 (feat. Whisper)
-
Meta, 1100개 이상의 언어에 대한 음성-텍스트, 텍스트-음성 변환 모델 MMS(Massively Multilingual Speech) 공개
이 글은 GPT 모델로 정리한 초안을 바탕으로 한 것으로, 원문의 내용 또는 의도와 다르게 정리된 내용이 있을 수 있습니다. 관심있는 내용이시라면 원문도 함께 참고해주세요! 읽으시면서 어색하거나 잘못된 내용을 발견하시면 댓글로 알려주시기를 부탁드립니다. ![]()
파이토치 한국 사용자 모임
은 이런 글들을 한국어로 정리해 나누고 있습니다. 회원으로 가입하시면 주요 글들을 이메일
로 보내드리고, 텔레그램(Telegram)과 Slack/Discord/Teams/Dooray/GoogleChat 등으로도 새 글 알림을 받으실 수 있습니다. ![]()
아래
쪽에 좋아요
를 눌러주시면 다음 글을 정리하는 데 힘이 됩니다~ ![]()







