|
Microsoft, 1시간분량 오디오를 10초만에 전사하는 60개 언어 음성 인식 모델 MAI-Transcribe-2 출시 (가중치 공개 X)
|
|
0
|
130
|
9월 8, 2026
|
|
hayamimi: GPU와 클라우드 없이 CPU만으로 실시간 다국어 자막을 만드는 음성 인식 도구
|
|
0
|
147
|
9월 7, 2026
|
|
OpenLess: 말하면 AI가 다듬은 문장을 커서에 바로 넣어 주는 오픈소스 음성 입력 도구
|
|
0
|
280
|
6월 15, 2026
|
|
VibeVoice: 60분 장시간 음성 인식(ASR)과 실시간 TTS를 통합한 Microsoft의 오픈소스 음성 AI 모델 패밀리
|
|
0
|
797
|
4월 3, 2026
|
|
KG-Whisper: 키워드 가이드(KG)를 통한 음성 인식(ASR) 최적화 구현 프로젝트 (feat. @hyuk님)
|
|
0
|
354
|
4월 3, 2026
|
|
Cohere, HuggingFace Open ASR 리더보드 1위를 차지한 오픈소스 음성 인식 모델 Transcribe 공개
|
|
0
|
1713
|
3월 31, 2026
|
|
Lightning-SimulWhisper: Apple Silicon용 초고속 실시간 로컬 음성 인식 엔진 (feat. Whisper)
|
|
1
|
905
|
12월 9, 2025
|
|
WhisperLiveKit: 실시간 음성 인식(STT), 번역 및 화자 분리 등을 로컬에서 실행할 수 있는 오픈소스 툴킷
|
|
0
|
5785
|
9월 1, 2025
|
|
SeamlessM4T: Meta AI에서 공개한, 번역을 위한 멀티모달에서의 파운데이션 모델
|
|
0
|
1713
|
8월 23, 2023
|
|
Meta, 1100개 이상의 언어에 대한 음성-텍스트, 텍스트-음성 변환 모델 MMS(Massively Multilingual Speech) 공개
|
|
0
|
2421
|
5월 23, 2023
|