Microsoftが「MAI-Transcribe-2」を公開:60言語対応で開発者にどのようなメリットがあるか

opoinstall
2026-09-04
5 min read

Microsoftが60言語対応の「MAI-Transcribe-2」をリリースしました。今回の音声認識モデルの展開は、マルチモーダルインフラストラクチャにおける重要なマイルストーンです。MAI-Transcribe-2は、60言語において精度とレイテンシのパレート境界を再定義しました。MAI-Transcribe-1のリリースから5ヶ月、バージョン1.5からわずか3ヶ月という短期間で更新されたこの基盤モデルは、多言語FLEURSベンチマークで平均単語誤り率(WER)5.2%を達成し、競合するモデルと比較して最大10倍のバッチ処理速度を実現しています。価格は導入期として1オーディオ時間あたり0.10ドルに設定されており、これはバージョン1および1.5の0.36ドルから約72%の値下げとなります。Microsoftはこれにより、自動音声認識のコモディティ化を加速させるとともに、話者分離、単語単位のタイムスタンプ、コードスイッチングなどの機能をMicrosoft Foundryのパブリックプレビューを通じて提供します。

音声認識の経済性とMAI-Transcribe-2の機能

概要

  • Microsoftは2026年9月3日にMAI-Transcribe-2をリリースしました。年内は導入価格として1オーディオ時間あたり0.10ドルで提供されます。
  • 公共のFLEURSベンチマークにおいて、60言語で平均WER 5.2%を達成し、Artificial AnalysisのWERリーダーボードで第2位にランクインしています。
  • モデル機能には、話者分離、単語単位のタイムスタンプ、ドメインキーワードのバイアス設定、自動言語識別、および設定可能な文字起こしフォーマットが含まれます。

これまで、企業における音声テキスト化処理の経済性は、エンジニアリングチームに困難なアーキテクチャ上のトレードオフを強いてきました。カスタマーコンタクトセンター、法務プラットフォーム、臨床記録ワークフローなど、大量の音声データを扱う組織では、高価な主要APIの高い精度と、オープンソースモデルを自社運用する際の実務負荷との間でバランスを取る必要がありました。また、専門ベンダーが話者分離やタイムスタンプなどの主要機能を高価格帯のプランに制限することで、この摩擦をさらに大きくしていました。

MAI-Transcribe-2の公式発表ヘッダー:速度、精度、効率性を強調

Microsoft AIのリリースサイクルは、自社で基盤モデルを構築するという明確な戦略を反映しています。4月の25言語(0.36ドル)から始まり、6月に43言語へ拡大、そして9月には60言語(0.10ドル)に到達するなど、わずか5ヶ月で3世代のモデルをリリースしており、音声モデル最適化のための迅速なリリースパイプラインを証明しています。VentureBeatの分析によれば、バッチ処理のスループットを向上させることで、一定のワークロードあたりのGPU消費時間を削減できる可能性があり、以前のMAI-Transcribeアーキテクチャも同様に、サービス提供時のオーバーヘッドを低減する設計がなされていました。

技術的意思決定者にとって、今回のMAI-Transcribe-2リリースが与える影響を評価するには、単価と運用のスループットの両面を分析する必要があります。年間数十万時間の音声を処理する高負荷な環境では、文字起こしの基本料金を1時間あたり0.10ドルに下げることで、音声認識は単なるコストセンターから利用しやすい実用的なリソースへと転換されます。さらに、主要機能をモデルに統合することで、エンタープライズアプリケーションにおいて複雑なマルチベンダーによるルーティング層を構築する必要性が低減されます。

技術アーキテクチャとレイテンシの限界:MAI-Transcribe-2の拡張性

多様な実環境の音声で高い精度を達成するには、困難な音響環境、音声の重なり、低リソースの語彙に対応できるモデルが必要です。Microsoft AIのMAI-Transcribe-2製品ページにおける公式発表によると、MAI-Transcribe-2は、ノイズの多い録音環境や多言語が混在する会話、品質の異なる入力に対しても堅牢に動作するように設計されています。

FLEURSベンチマークにおけるMAI-Transcribe-2と主要音声モデルの誤り率比較

標準化されたFLEURS評価スイートにおいて、本モデルは60言語で平均5.2%のWERを達成しています。ITHomeの技術報道で転載されたMicrosoftのベンチマークチャートによると、MAI-Transcribe-2は言語指定あり、または自動検出のいずれの実行においても、この5.2%の平均値を維持しています。比較評価において、Gemini 3.5 Transcribeが主な業界ベースラインとして挙げられており、その他のベンチマークデータではGemini 3.1 Pro(5.3%~5.8%)、OpenAIのGPT-Transcribe(10.4%~10.6%)、Whisper V3-Large(22.8%~23.5%)と比較して競争力のある性能を示しています。

FLEURSベンチマークにおけるサポート対象60言語の詳細内訳表

スループットの経済性とレイテンシのパレート境界

バッチ音声処理において、推論スループットは計算コストやサービス料金に直結する重要な要素です。リアルタイムの数倍以上の速度で録音を処理できるモデルは、低速な代替案と比較して、一定量の音声を処理するために必要なGPU時間を削減できます。Artificial Analysisによる評価では、MAI-Transcribe-2は精度とレイテンシのパレート境界上に位置しており、403.6倍というリアルタイム性を報告しています。これにより、1時間の録音をわずか10秒程度で処理することが可能です。

音声モデルのパレート境界を示すArtificial Analysisの速度対精度チャート

以下は、開発者が利用可能な処理機能の概要です:

[音声入力処理]
  オーディオペイロード (WAV / MP3 / FLAC / 対応コーデック)
                         │
                         ▼
[サポートモデル機能]
  ├── 自動言語識別 (自動検出 / 指定)
  ├── 多言語音声認識 (60言語)
  ├── 話者分離 & 単語単位のタイムスタンプ
  └── キーワードバイアスサポート
                         │
                         ▼
[設定済み出力生成]
  フォーマット済み出力ストリーム (逐語モード vs. クリーンモード)

多様なビジネス要件に応えるため、本アーキテクチャは柔軟な出力設定を組み込んでいます。開発者は、法規制や臨床監査のために、言い淀み、フィラー、言い直しをすべて含める逐語モードを選択できます。あるいは、会議の要約や字幕、外部公開用に不要なフィラーを自動的に除去するクリーンモードを選択することも可能です。

話者分離、タイムスタンプ、言語切り替え機能を比較した機能概要マトリックス

エンタープライズパイプラインにおける音声テキスト化パラダイムの評価

音声認識アーキテクチャを選択するには、ホスティングの複雑さ、プライバシー要件、および長期的な運用コストを評価する必要があります。エンジニアリング組織は通常、自動文字起こしワークフローを構築する際、以下の3つの運用モデルを比較検討します。

技術評価:セルフホストモデル vs 専門的高スループットAPI

Whisperのようなセルフホスト型オープンソースモデルを展開すると、データの所在を完全に制御できますが、インフラストラクチャの負担が大幅に増大します。エンジニアリングチームは、GPUクラスターの管理、バッチサイズの最適化、話者分離のための個別パイプラインの保守を行う必要があります。対照的に、クラウドAPIはインフラストラクチャの保守なしで即時の拡張性を提供します。

以下の表は、エンタープライズにおける大量の音声処理手法を比較したものです:

アーキテクチャ インフラフットプリント 話者分離 & タイムスタンプ 多言語保守 運用のトレードオフ
セルフホスト型OSS (例: Whisper) 高い (専用GPUクラスター) 追加パイプラインが必要 自社によるチューニング・評価 完全なデータ分離が可能だが維持コストが重い
汎用マルチモーダルAPI 低い (サーバーレスクラウドエンドポイント) ベンダーにより異なる 広範なカバレッジ 文字起こしのみのタスクでは単価が高くなる可能性
専用音声エンジン (MAI-Transcribe-2) 低い (マネージドAzure / Foundry API) 統合された話者分離とタイムスタンプ 単一モデルの統一デプロイ 低単価だがベンダーのロードマップに依存

エアギャップ環境ではセルフホストが必要ですが、そうでない場合、専用APIの経済性はマネージドサービスへと傾いています。話者分離、タイムスタンプ、語彙バイアスを1時間あたり0.10ドルで統合したマネージドエンドポイントは、商用ワークロードにおいて総所有コスト(TCO)を劇的に削減します。

エンジニアリングチェックリスト:高スループット音声APIの統合

クラウド文字起こしモデルを本番ワークフローにスムーズに統合するために、開発チームは確立されたプラットフォームのガイドラインに従って実装を構成できます。

開発者向け実装チェックリスト

  • 音声制約の検証:Microsoftの高速文字起こしAPIは500MBかつ5時間未満のファイルを許容します。本番環境にデプロイする前に、MAI-Transcribe-2プレビューエンドポイントのモデル固有の制限を確認してください。
  • キーワードバイアスの設定:MAI-Transcribe-2はドメイン固有の専門用語や略語に対するキーワードバイアスをサポートしています。展開固有のキーワードバイアスフィールドについては、最新のFoundryプレビュー仕様を確認してください。
  • 出力フォーマットの選択:コンプライアンスや監査ワークフローには逐語設定を適用し、一般公開用の要約や公開メモにはクリーンな文字起こしスタイルを選択してください。

セキュリティおよびインフラチェックリスト

  • データ境界の検証:オーディオ処理リソースが、クラウドコンソール内の組織のデータ所在およびガバナンス要件に準拠していることを確認してください。
  • バッチチャンク処理のロジック実装:個別のファイル制限を超える大容量のエンタープライズアーカイブに対しては、自然な間隔で録音を分割し、音響的な継続性を保つための前処理パイプラインを実装してください。
  • プレビューエンドポイントのドキュメント確認:Microsoftの発表資料はMAI-Transcribe-2における話者分離を裏付けていますが、従来のドキュメントは更新中の場合があります。特定の要求スキーマに依存する前に、最新のプレビューエンドポイントパラメータを検証してください。

これらの体系的な実装基準を採用することで、エンジニアリング組織は高いアーキテクチャの予測可能性を維持しながら、高スループットな文字起こしサービスをデータパイプラインに統合できます。

よくある質問 (FAQ)

FLEURSベンチマークにおける単語誤り率(WER)5.2%の意義は何ですか?
5.2%という単語誤り率は、標準化された読み上げベンチマークにおける60言語テストセット全体の平均的な多言語パフォーマンスを示しています。全体として高い精度を示していますが、個別の本番環境では、言語ごとの詳細な誤り率を評価することが依然として不可欠です。
MAI-Transcribe-2とOpenAIのGPT-TranscribeやWhisperの比較は?
公表されたベンチマークデータによると、MAI-Transcribe-2は多言語テスト全体においてWhisper V3-LargeやGPT-Transcribeよりも低いWERを達成しています。さらに、Artificial Analysisによる独立した評価では、GPT-Transcribeと比較して最大10倍の速さでバッチ推論を実行しつつ、1時間あたりの価格設定も安価であることが示されています。
逐語モードとクリーンな文字起こしスタイルの違いは何ですか?
逐語(verbatim)設定は、言い直しやフィラー、繰り返しなど、話された言葉をそのまま維持するため、法務記録、コンプライアンス監査、臨床メモに最適です。クリーン設定は、会話上のフィラーを自動的に削除して、公開記事、会議の要約、字幕に適した読みやすいテキストを生成します。

エンジニアリングチームへの重要なポイント

専用の音声認識モデルの進化は、AIにおけるモダリティ特化型の効率性への大きな転換を示しています。汎用マルチモーダルモデルが推論能力を拡大し続ける一方で、特化型音声エンジンは、ターゲットを絞った最適化により、優れたレイテンシ、低い誤り率、そして強力なコスト効率を実現できることを実証しています。

技術組織にとって、高スループットな文字起こしサービスを統合することは、音声データを多く扱う業務全体の自動化を拡張可能にします。話者分離機能、カスタマイズ可能な出力フォーマット、効率的なバッチ推論を組み合わせた特化型アーキテクチャを選択することで、開発チームはエンタープライズ需要に追従する、レスポンスが良く費用対効果の高いデータワークフローを構築できます。

参考資料

Share this article