Microsoft가 60개 언어를 지원하는 MAI-Transcribe-2를 출시했습니다. 이번 음성 인식 모델 배포는 멀티모달 인프라의 중요한 이정표가 될 전망입니다. Microsoft는 공식적으로 MAI-Transcribe-2를 출시하며 60개 언어 전반에서 정확도와 지연 시간의 파레토 최적점을 새롭게 정의했습니다. MAI-Transcribe-1 출시 5개월, 버전 1.5 출시 3개월 만에 선보인 이 최신 파운데이션 모델은 다국어 FLEURS 벤치마크에서 평균 5.2%의 단어 오류율(WER)을 기록했으며, 경쟁 모델 대비 최대 10배 빠른 배치 처리 속도를 제공합니다. 가격은 오디오 시간당 10센트로 책정되어 기존 버전 1 및 1.5의 $0.36 대비 약 72% 저렴해졌습니다. 이를 통해 자동 음성 인식의 대중화를 가속화하는 한편, Microsoft Foundry 공개 프리뷰를 통해 화자 분리(diarization), 단어 수준 타임스탬프, 코드 스위칭 기능을 직접 제공합니다.
음성 인식 경제성 및 MAI-Transcribe-2 기능
핵심 요약
- Microsoft는 2026년 9월 3일 MAI-Transcribe-2를 출시했으며, 연말까지 오디오 시간당 $0.10의 도입 가격을 적용합니다.
- 해당 모델은 공개 FLEURS 벤치마크에서 60개 언어 평균 5.2%의 단어 오류율을 기록했으며, Artificial Analysis WER 리더보드에서 2위를 차지했습니다.
- 모델 기능에는 화자 분리, 단어 수준 타임스탬프, 도메인 키워드 바이어싱(biasing), 자동 언어 식별, 그리고 구성 가능한 전사(transcription) 포맷팅이 포함됩니다.
기업의 음성-텍스트(Speech-to-Text) 처리 경제성은 그동안 엔지니어링 팀에게 어려운 아키텍처 결정을 강요해 왔습니다. 고객 센터, 법률 문서 플랫폼, 임상 전사 워크플로우와 같이 대용량 오디오 파이프라인을 관리하는 조직들은 고가의 프론티어 API를 사용하는 높은 정확도와 자체 관리형 오픈 소스 모델 운영의 부담 사이에서 고민해 왔습니다. 전문 벤더들은 화자 분리나 오디오 타임스탬프와 같은 핵심 기능을 고가의 요금제에만 포함하는 방식으로 이러한 마찰을 가중시키기도 했습니다.

Microsoft AI의 모델 출시 주기는 내부 파운데이션 모델 역량을 구축하려는 신중한 전략을 반영합니다. 4월 25개 언어($0.36)에서 6월 43개 언어로, 그리고 9월 60개 언어($0.10)로 확장하며 5개월 만에 3개의 모델 세대를 선보인 것은 음성 모델 최적화를 위한 빠른 출시 파이프라인을 잘 보여줍니다. VentureBeat의 분석에 따르면, 배치 처리량이 높을수록 동일 작업량 대비 필요한 GPU 시간을 줄일 수 있으며, 초기 MAI-Transcribe 아키텍처 역시 운영 오버헤드를 낮추도록 설계되었습니다.
기술 의사 결정권자들에게 Microsoft의 MAI-Transcribe-2 60개 언어 지원 출시는 단가와 운영 처리량 두 가지 측면에서 미치는 영향을 분석해야 하는 과제입니다. 연간 수십만 시간의 오디오를 처리하는 고용량 환경에서 전사 비용을 시간당 10센트로 낮추는 것은 음성 인식을 주요 비용 센터에서 접근 가능한 유틸리티로 변화시키는 전환점이 될 것입니다. 또한 핵심 기능을 기본 모델에 번들로 제공함으로써 기업용 애플리케이션 내 복잡한 다중 벤더 라우팅 레이어의 필요성을 줄일 수 있습니다.
기술 아키텍처 및 지연 시간 파레토 최적점: MAI-Transcribe-2의 대규모 운영 방식
다양한 실제 오디오 환경에서 높은 정확도를 달성하려면 잡음이 많은 환경, 겹치는 음성, 저자원 어휘 등을 처리할 수 있는 모델이 필요합니다. Microsoft AI MAI-Transcribe-2 제품 페이지의 공식 성능 공개 내용에 따르면, MAI-Transcribe-2는 소음이 많은 녹음 조건, 혼합 언어 대화, 다양한 품질의 입력값 전반에서 강력한 성능을 발휘하도록 설계되었습니다.

표준화된 FLEURS 평가 제품군에서 이 모델은 60개 언어 전반에서 평균 5.2%의 단어 오류율을 기록했습니다. ITHome의 기술 보고서에서 재현된 Microsoft의 벤치마크 차트에 따르면, MAI-Transcribe-2는 강제 언어 식별 및 자동 언어 식별 실행 모두에서 5.2%의 평균을 유지합니다. 비교 평가에서 Gemini 3.5 Transcribe가 주요 산업 기준점으로 언급되었으며, 보조 벤치마크 차트에서는 Gemini 3.1 Pro(5.3%~5.8%), OpenAI의 GPT-Transcribe(10.4%~10.6%), Whisper V3-Large(22.8%~23.5%)와 동일한 테스트 세트에서 경쟁 우위를 보이고 있습니다.

처리량 경제성과 지연 시간 파레토 최적점
배치 오디오 처리에서 추론 처리량은 운영 컴퓨팅 비용과 서비스 가격 결정에 중요한 요소입니다. 실시간 대비 수백 배 빠른 속도로 녹음본을 처리할 수 있는 모델은 저속 대안들에 비해 동일한 양의 오디오를 처리하는 데 필요한 GPU 시간을 줄여줍니다. Artificial Analysis의 평가에 따르면 MAI-Transcribe-2는 정확도-지연 시간 파레토 최적점에 직접 위치하며, 실시간 대비 403.6배의 속도(1시간 분량의 녹음을 약 10초 만에 반환)를 보고했습니다.

아래 다이어그램은 개발자가 사용할 수 있는 지원 처리 기능을 요약합니다:
[수신 오디오 입력]
오디오 페이로드 (WAV / MP3 / FLAC / 문서화된 코덱)
│
▼
[지원되는 모델 기능]
├── 자동 언어 식별 (자동 감지 / 강제 설정)
├── 다국어 음성 인식 (60개 언어)
├── 화자 분리 및 단어 수준 타임스탬프
└── 키워드 바이어싱 지원
│
▼
[구성된 출력 생성]
형식화된 출력 스트림 (축어 모드 vs. 클린 모드)
다양한 비즈니스 요구 사항을 해결하기 위해 이 아키텍처는 유연한 출력 구성을 포함합니다. 개발자는 법적 준수 및 임상 감사를 위해 일시 정지, 채움 단어, 실수 등을 그대로 기록하는 축어(verbatim) 모드를 선택할 수 있습니다. 또는 회의 요약, 자막 및 외부 간행물을 위해 채움 단어를 자동으로 제거하여 세련된 전사본을 생성하는 클린 모드를 활용할 수도 있습니다.

엔터프라이즈 파이프라인의 음성-텍스트 패러다임 평가
음성 인식 아키텍처를 선택할 때는 호스팅 복잡성, 개인정보 보호 요구 사항, 장기 운영 비용을 평가해야 합니다. 엔지니어링 조직은 자동화된 전사 워크플로우를 구축할 때 일반적으로 세 가지 운영 모델을 고려합니다.
기술 평가: 자체 호스팅 모델 vs. 전문 고처리량 API
Whisper와 같은 자체 호스팅 오픈 소스 모델을 배포하면 데이터 거주지에 대한 완전한 통제권이 확보되지만 상당한 인프라 오버헤드가 발생합니다. 엔지니어링 팀은 GPU 클러스터를 관리하고, 배치 크기를 최적화하며, 화자 분리를 위한 별도의 파이프라인을 유지해야 합니다. 반면 클라우드 API는 지속적인 인프라 유지 관리 없이 즉각적인 확장성을 제공합니다.
아래 표는 대용량 엔터프라이즈 오디오를 처리하기 위한 표준 방법론들을 비교합니다:
| 아키텍처 | 인프라 점유율 | 화자 분리 및 타임스탬프 | 다국어 유지 관리 | 운영 트레이드오프 |
|---|---|---|---|---|
| 자체 호스팅 오픈 소스 (예: Whisper) | 높음 (전용 GPU 클러스터) | 2차 파이프라인 필요 | 자체 관리 모델 튜닝 및 평가 | 높은 유지 관리 비용과 함께 데이터 완전 격리 |
| 범용 프론티어 옴니모달 API | 낮음 (서버리스 클라우드 엔드포인트) | 벤더별 상이 | 광범위한 적용 범위 | 전사 전용 작업 시 잠재적으로 높은 단가 |
| 전문 음성 엔진 (MAI-Transcribe-2) | 낮음 (관리형 Azure / Foundry API) | 내장 화자 분리 및 타임스탬프 | 단일 통합 모델 배포 | 낮은 단가, 벤더 로드맵에 대한 의존성 |
물리적으로 격리된(air-gapped) 환경에서는 여전히 자체 호스팅이 필요하지만, 전문 API의 단위 경제성은 관리형 서비스로의 균형 이동을 촉진하고 있습니다. 화자 분리, 타임스탬프, 어휘 바이어싱을 시간당 10센트로 번들 제공하는 관리형 엔드포인트는 대부분의 상업적 워크플로우에 대한 총 소유 비용을 크게 절감합니다.
엔지니어링 체크리스트: 고처리량 음성 API 통합
클라우드 전사 모델을 프로덕션 워크플로우에 원활하게 통합하기 위해 개발 팀은 확립된 플랫폼 지침에 따라 구현을 구조화할 수 있습니다.
개발자 구현 체크리스트
- 오디오 제한 사항 검증: Microsoft의 일반 Fast Transcription API는 500MB 및 5시간 미만의 파일을 허용합니다. 개발자는 프로덕션 배포 전에 현재 MAI-Transcribe-2 프리뷰 엔드포인트의 모델별 제한 사항을 확인해야 합니다.
- 키워드 바이어싱 구성: MAI-Transcribe-2는 도메인별 어휘 및 약어에 대한 키워드 바이어싱을 지원합니다. 팀은 배포별 키워드 바이어싱 필드에 대해 현재 Foundry 프리뷰 스키마를 확인해야 합니다.
- 출력 포맷팅 스타일 선택: 직접적인 준수 및 감사 워크플로우에는 문서화된 축어(verbatim) 설정을 사용하고, 소비자용 요약 및 공개 메모에는 클린 전사 스타일을 활용하십시오.
보안 및 인프라 체크리스트
- 지역별 데이터 경계 확인: 오디오 처리 리소스가 클라우드 콘솔 내 조직의 데이터 거주지 및 거버넌스 요구 사항을 준수하는지 확인하십시오.
- 배치 청킹(Chunking) 로직 구현: 개별 파일 임계값을 초과하는 대규모 엔터프라이즈 아카이브의 경우, 음향 연속성을 유지하면서 자연스러운 일시 정지 지점을 따라 녹음을 분할하는 사전 처리 파이프라인을 배포하십시오.
- 프리뷰 엔드포인트 문서 검토: Microsoft의 출시 자료는 MAI-Transcribe-2의 화자 분리 기능을 확인하며, 이전 통합 문서는 업데이트 중입니다. 특정 요청 스키마를 사용하기 전에 최신 프리뷰 엔드포인트 매개변수를 확인하십시오.
이러한 체계적인 구현 표준을 채택함으로써 엔지니어링 조직은 아키텍처 예측 가능성을 유지하면서 핵심 데이터 파이프라인에 고처리량 전사 서비스를 통합할 수 있습니다.
자주 묻는 질문(FAQ)
FLEURS 벤치마크에서 5.2% 단어 오류율(WER)이 갖는 의미는 무엇인가요?
MAI-Transcribe-2는 OpenAI의 GPT-Transcribe 및 Whisper와 어떻게 다른가요?
축어(verbatim) 전사와 클린(clean) 전사 스타일의 차이점은 무엇인가요?
엔지니어링 팀을 위한 핵심 시사점
전용 음성 인식 모델의 지속적인 진화는 인공지능 분야에서 모달리티(modality)별 효율성으로의 광범위한 전환을 보여줍니다. 범용 멀티모달 모델이 추론 능력을 계속 확장하는 동안, 전문 음성 엔진은 타겟팅된 최적화가 우수한 지연 시간, 낮은 오류율 및 강력한 단위 경제성을 산출함을 입증하고 있습니다.
기술 조직에게 고처리량 전사 서비스 통합은 오디오 중심의 비즈니스 운영 전반에 걸쳐 확장 가능한 자동화를 구현할 수 있게 합니다. 기본 화자 분리, 사용자 정의 출력 포맷팅 및 효율적인 배치 추론을 결합한 전문 아키텍처를 선택함으로써, 개발 팀은 엔터프라이즈 수요에 맞춰 확장 가능한 반응형 데이터 워크플로우를 구축할 수 있습니다.
참고 문헌
-
Microsoft AI. MAI-Transcribe-2는 세계에서 가장 빠르고 정확하며 저렴한 음성 인식 모델입니다. https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/
-
Microsoft AI. MAI-Transcribe-2 모델 개요 및 사양. https://microsoft.ai/models/mai-transcribe-2/
-
Microsoft Learn. Fast Transcription API 사용하기. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/fast-transcription-create
-
Microsoft Learn. 구 목록(Phrase List)으로 인식 정확도 개선하기. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/improve-accuracy-phrase-list
-
Artificial Analysis. 음성-텍스트 리더보드 및 정확도-지연 시간 파레토 최적점. https://artificialanalysis.ai/speech-to-text/non-streaming
-
Google Research. FLEURS: 보편적 음성 표현의 퓨샷 학습 평가. https://huggingface.co/datasets/google/fleurs
-
VentureBeat. Microsoft AI의 MAI-Transcribe-2, 가격과 속도 면에서 OpenAI, Google, ElevenLabs를 앞서다. https://venturebeat.com/technology/microsoft-launches-3-new-ai-models-in-direct-shot-at-openai-and-google
-
Neowin. Microsoft의 MAI-Transcribe-2 모델, 시간당 $0.10의 가격으로 OpenAI와 Google을 압도. https://www.neowin.net/news/microsofts-mai-transcribe-2-model-beats-openai-and-google-while-costing-just-010-per-hour/
-
ITHome. Microsoft, 5.2% WER을 기록한 MAI-Transcribe-2 음성 인식 모델 출시. https://www.ithome.com/0/998/241.htm
Share this article



