Microsoftが60言語対応の「MAI-Transcribe-2」をリリースしました。今回の音声認識モデルの展開は、マルチモーダルインフラストラクチャにおける重要なマイルストーンです。MAI-Transcribe-2は、60言語において精度とレイテンシのパレート境界を再定義しました。MAI-Transcribe-1のリリースから5ヶ月、バージョン1.5からわずか3ヶ月という短期間で更新されたこの基盤モデルは、多言語FLEURSベンチマークで平均単語誤り率(WER)5.2%を達成し、競合するモデルと比較して最大10倍のバッチ処理速度を実現しています。価格は導入期として1オーディオ時間あたり0.10ドルに設定されており、これはバージョン1および1.5の0.36ドルから約72%の値下げとなります。Microsoftはこれにより、自動音声認識のコモディティ化を加速させるとともに、話者分離、単語単位のタイムスタンプ、コードスイッチングなどの機能をMicrosoft Foundryのパブリックプレビューを通じて提供します。
音声認識の経済性とMAI-Transcribe-2の機能
概要
- Microsoftは2026年9月3日にMAI-Transcribe-2をリリースしました。年内は導入価格として1オーディオ時間あたり0.10ドルで提供されます。
- 公共のFLEURSベンチマークにおいて、60言語で平均WER 5.2%を達成し、Artificial AnalysisのWERリーダーボードで第2位にランクインしています。
- モデル機能には、話者分離、単語単位のタイムスタンプ、ドメインキーワードのバイアス設定、自動言語識別、および設定可能な文字起こしフォーマットが含まれます。
これまで、企業における音声テキスト化処理の経済性は、エンジニアリングチームに困難なアーキテクチャ上のトレードオフを強いてきました。カスタマーコンタクトセンター、法務プラットフォーム、臨床記録ワークフローなど、大量の音声データを扱う組織では、高価な主要APIの高い精度と、オープンソースモデルを自社運用する際の実務負荷との間でバランスを取る必要がありました。また、専門ベンダーが話者分離やタイムスタンプなどの主要機能を高価格帯のプランに制限することで、この摩擦をさらに大きくしていました。

Microsoft AIのリリースサイクルは、自社で基盤モデルを構築するという明確な戦略を反映しています。4月の25言語(0.36ドル)から始まり、6月に43言語へ拡大、そして9月には60言語(0.10ドル)に到達するなど、わずか5ヶ月で3世代のモデルをリリースしており、音声モデル最適化のための迅速なリリースパイプラインを証明しています。VentureBeatの分析によれば、バッチ処理のスループットを向上させることで、一定のワークロードあたりのGPU消費時間を削減できる可能性があり、以前のMAI-Transcribeアーキテクチャも同様に、サービス提供時のオーバーヘッドを低減する設計がなされていました。
技術的意思決定者にとって、今回のMAI-Transcribe-2リリースが与える影響を評価するには、単価と運用のスループットの両面を分析する必要があります。年間数十万時間の音声を処理する高負荷な環境では、文字起こしの基本料金を1時間あたり0.10ドルに下げることで、音声認識は単なるコストセンターから利用しやすい実用的なリソースへと転換されます。さらに、主要機能をモデルに統合することで、エンタープライズアプリケーションにおいて複雑なマルチベンダーによるルーティング層を構築する必要性が低減されます。
技術アーキテクチャとレイテンシの限界:MAI-Transcribe-2の拡張性
多様な実環境の音声で高い精度を達成するには、困難な音響環境、音声の重なり、低リソースの語彙に対応できるモデルが必要です。Microsoft AIのMAI-Transcribe-2製品ページにおける公式発表によると、MAI-Transcribe-2は、ノイズの多い録音環境や多言語が混在する会話、品質の異なる入力に対しても堅牢に動作するように設計されています。

標準化されたFLEURS評価スイートにおいて、本モデルは60言語で平均5.2%のWERを達成しています。ITHomeの技術報道で転載されたMicrosoftのベンチマークチャートによると、MAI-Transcribe-2は言語指定あり、または自動検出のいずれの実行においても、この5.2%の平均値を維持しています。比較評価において、Gemini 3.5 Transcribeが主な業界ベースラインとして挙げられており、その他のベンチマークデータではGemini 3.1 Pro(5.3%~5.8%)、OpenAIのGPT-Transcribe(10.4%~10.6%)、Whisper V3-Large(22.8%~23.5%)と比較して競争力のある性能を示しています。

スループットの経済性とレイテンシのパレート境界
バッチ音声処理において、推論スループットは計算コストやサービス料金に直結する重要な要素です。リアルタイムの数倍以上の速度で録音を処理できるモデルは、低速な代替案と比較して、一定量の音声を処理するために必要なGPU時間を削減できます。Artificial Analysisによる評価では、MAI-Transcribe-2は精度とレイテンシのパレート境界上に位置しており、403.6倍というリアルタイム性を報告しています。これにより、1時間の録音をわずか10秒程度で処理することが可能です。

以下は、開発者が利用可能な処理機能の概要です:
[音声入力処理]
オーディオペイロード (WAV / MP3 / FLAC / 対応コーデック)
│
▼
[サポートモデル機能]
├── 自動言語識別 (自動検出 / 指定)
├── 多言語音声認識 (60言語)
├── 話者分離 & 単語単位のタイムスタンプ
└── キーワードバイアスサポート
│
▼
[設定済み出力生成]
フォーマット済み出力ストリーム (逐語モード vs. クリーンモード)
多様なビジネス要件に応えるため、本アーキテクチャは柔軟な出力設定を組み込んでいます。開発者は、法規制や臨床監査のために、言い淀み、フィラー、言い直しをすべて含める逐語モードを選択できます。あるいは、会議の要約や字幕、外部公開用に不要なフィラーを自動的に除去するクリーンモードを選択することも可能です。

エンタープライズパイプラインにおける音声テキスト化パラダイムの評価
音声認識アーキテクチャを選択するには、ホスティングの複雑さ、プライバシー要件、および長期的な運用コストを評価する必要があります。エンジニアリング組織は通常、自動文字起こしワークフローを構築する際、以下の3つの運用モデルを比較検討します。
技術評価:セルフホストモデル vs 専門的高スループットAPI
Whisperのようなセルフホスト型オープンソースモデルを展開すると、データの所在を完全に制御できますが、インフラストラクチャの負担が大幅に増大します。エンジニアリングチームは、GPUクラスターの管理、バッチサイズの最適化、話者分離のための個別パイプラインの保守を行う必要があります。対照的に、クラウドAPIはインフラストラクチャの保守なしで即時の拡張性を提供します。
以下の表は、エンタープライズにおける大量の音声処理手法を比較したものです:
| アーキテクチャ | インフラフットプリント | 話者分離 & タイムスタンプ | 多言語保守 | 運用のトレードオフ |
|---|---|---|---|---|
| セルフホスト型OSS (例: Whisper) | 高い (専用GPUクラスター) | 追加パイプラインが必要 | 自社によるチューニング・評価 | 完全なデータ分離が可能だが維持コストが重い |
| 汎用マルチモーダルAPI | 低い (サーバーレスクラウドエンドポイント) | ベンダーにより異なる | 広範なカバレッジ | 文字起こしのみのタスクでは単価が高くなる可能性 |
| 専用音声エンジン (MAI-Transcribe-2) | 低い (マネージドAzure / Foundry API) | 統合された話者分離とタイムスタンプ | 単一モデルの統一デプロイ | 低単価だがベンダーのロードマップに依存 |
エアギャップ環境ではセルフホストが必要ですが、そうでない場合、専用APIの経済性はマネージドサービスへと傾いています。話者分離、タイムスタンプ、語彙バイアスを1時間あたり0.10ドルで統合したマネージドエンドポイントは、商用ワークロードにおいて総所有コスト(TCO)を劇的に削減します。
エンジニアリングチェックリスト:高スループット音声APIの統合
クラウド文字起こしモデルを本番ワークフローにスムーズに統合するために、開発チームは確立されたプラットフォームのガイドラインに従って実装を構成できます。
開発者向け実装チェックリスト
- 音声制約の検証:Microsoftの高速文字起こしAPIは500MBかつ5時間未満のファイルを許容します。本番環境にデプロイする前に、MAI-Transcribe-2プレビューエンドポイントのモデル固有の制限を確認してください。
- キーワードバイアスの設定:MAI-Transcribe-2はドメイン固有の専門用語や略語に対するキーワードバイアスをサポートしています。展開固有のキーワードバイアスフィールドについては、最新のFoundryプレビュー仕様を確認してください。
- 出力フォーマットの選択:コンプライアンスや監査ワークフローには逐語設定を適用し、一般公開用の要約や公開メモにはクリーンな文字起こしスタイルを選択してください。
セキュリティおよびインフラチェックリスト
- データ境界の検証:オーディオ処理リソースが、クラウドコンソール内の組織のデータ所在およびガバナンス要件に準拠していることを確認してください。
- バッチチャンク処理のロジック実装:個別のファイル制限を超える大容量のエンタープライズアーカイブに対しては、自然な間隔で録音を分割し、音響的な継続性を保つための前処理パイプラインを実装してください。
- プレビューエンドポイントのドキュメント確認:Microsoftの発表資料はMAI-Transcribe-2における話者分離を裏付けていますが、従来のドキュメントは更新中の場合があります。特定の要求スキーマに依存する前に、最新のプレビューエンドポイントパラメータを検証してください。
これらの体系的な実装基準を採用することで、エンジニアリング組織は高いアーキテクチャの予測可能性を維持しながら、高スループットな文字起こしサービスをデータパイプラインに統合できます。
よくある質問 (FAQ)
FLEURSベンチマークにおける単語誤り率(WER)5.2%の意義は何ですか?
MAI-Transcribe-2とOpenAIのGPT-TranscribeやWhisperの比較は?
逐語モードとクリーンな文字起こしスタイルの違いは何ですか?
エンジニアリングチームへの重要なポイント
専用の音声認識モデルの進化は、AIにおけるモダリティ特化型の効率性への大きな転換を示しています。汎用マルチモーダルモデルが推論能力を拡大し続ける一方で、特化型音声エンジンは、ターゲットを絞った最適化により、優れたレイテンシ、低い誤り率、そして強力なコスト効率を実現できることを実証しています。
技術組織にとって、高スループットな文字起こしサービスを統合することは、音声データを多く扱う業務全体の自動化を拡張可能にします。話者分離機能、カスタマイズ可能な出力フォーマット、効率的なバッチ推論を組み合わせた特化型アーキテクチャを選択することで、開発チームはエンタープライズ需要に追従する、レスポンスが良く費用対効果の高いデータワークフローを構築できます。
参考資料
-
Microsoft AI. MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world. https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/
-
Microsoft AI. MAI-Transcribe-2 Model Overview and Specifications. https://microsoft.ai/models/mai-transcribe-2/
-
Microsoft Learn. Use the Fast Transcription API. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/fast-transcription-create
-
Microsoft Learn. Improve Recognition Accuracy with Phrase Lists. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/improve-accuracy-phrase-list
-
Artificial Analysis. Speech to Text Leaderboard and Accuracy-Latency Pareto Frontier. https://artificialanalysis.ai/speech-to-text/non-streaming
-
Google Research. FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech. https://huggingface.co/datasets/google/fleurs
-
VentureBeat. Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed. https://venturebeat.com/technology/microsoft-launches-3-new-ai-models-in-direct-shot-at-openai-and-google
-
Neowin. Microsoft’s MAI-Transcribe-2 model beats OpenAI and Google while costing just $0.10 per hour. https://www.neowin.net/news/microsofts-mai-transcribe-2-model-beats-openai-and-google-while-costing-just-010-per-hour/
-
ITHome. Microsoft launches MAI-Transcribe-2 speech recognition model with 5.2% WER. https://www.ithome.com/0/998/241.htm
Share this article



