أطلقت مايكروسوفت نموذج MAI-Transcribe-2 لدعم 60 لغة؛ ويُمثل هذا الإصدار في مجال التعرف على الكلام علامة فارقة في البنية التحتية متعددة الوسائط، حيث يُحدد النموذج الجديد توازن الأداء بين الدقة والسرعة (Pareto frontier) عبر ستين لغة. وبعد خمسة أشهر من إطلاق MAI-Transcribe-1 وثلاثة أشهر فقط من نسخة 1.5، يجمع هذا النموذج الأساسي المحدث بين معدل خطأ في الكلمات (WER) يبلغ 5.2% في معيار FLEURS متعدد اللغات، وسرعات معالجة دفعية أسرع بعشر مرات من الحلول المنافسة المتاحة حالياً. ومن خلال تسعير الخدمة بعشرة سنتات للساعة الصوتية—وهو ما يمثل انخفاضاً بنسبة 72% تقريباً عن سعر الإصدارات السابقة البالغ $0.36 للساعة—تُسرّع مايكروسوفت من تحويل تقنيات التعرف الآلي على الكلام إلى خدمة متاحة للجميع، مع توفير قدرات مثل تحديد هوية المتحدث (diarization)، والطوابع الزمنية على مستوى الكلمة، والتبديل بين اللغات مباشرة عبر Microsoft Foundry في مرحلة المعاينة العامة.
اقتصاديات التعرف على الكلام وقدرات MAI-Transcribe-2
نظرة سريعة
- أطلقت مايكروسوفت نموذج MAI-Transcribe-2 في 3 سبتمبر 2026، مع تحديد سعر تمهيدي قدره $0.10 لكل ساعة صوتية حتى نهاية العام.
- حقق النموذج متوسط معدل خطأ في الكلمات بلغ 5.2% عبر 60 لغة في معيار FLEURS العام، واحتل المرتبة الثانية في تصنيفات Artificial Analysis لمعدل WER.
- تشمل قدرات النموذج تحديد هوية المتحدث، والطوابع الزمنية، وتخصيص الكلمات الرئيسية، والتعرف التلقائي على اللغة، وتنسيقات النسخ القابلة للضبط.
لطالما فرضت اقتصاديات معالجة الكلام إلى نص على فرق الهندسة مقايضات معمارية صعبة. فالمؤسسات التي تدير مسارات صوتية عالية الحجم—مثل مراكز خدمة العملاء، ومنصات التوثيق القانوني، وسير عمل النسخ الطبي—كانت تواجه تحدي الموازنة بين الدقة العالية لواجهات برمجة التطبيقات باهظة الثمن وبين العبء التشغيلي لاستضافة نماذج مفتوحة المصدر. كما أن الموردين المتخصصين غالباً ما كانوا يزيدون من هذا التعقيد عبر حصر الميزات الحيوية مثل تحديد هوية المتحدث والطوابع الزمنية ضمن فئات تسعير مرتفعة.

يعكس جدول إصدارات Microsoft AI استراتيجية متعمدة لبناء قدرات نماذج أساسية داخلية. فمن خلال إطلاق ثلاثة أجيال من النماذج في غضون خمسة أشهر—انتقالاً من 25 لغة بسعر $0.36 في أبريل، إلى 43 لغة في يونيو، وصولاً إلى 60 لغة بسعر $0.10 في سبتمبر—تُثبت مايكروسوفت وجود مسار إطلاق سريع لتحسين نماذج الكلام. تشير التحليلات التي أجراها موقع VentureBeat إلى أن زيادة الإنتاجية في المعالجة الدفعية يمكن أن تقلل من ساعات تشغيل وحدات معالجة الرسوميات (GPU) المطلوبة لكل عبء عمل ثابت، كما صُممت بنيات MAI-Transcribe السابقة لتقليل تكاليف التشغيل.
بالنسبة لصناع القرار التقني، يتطلب تقييم تأثير إطلاق مايكروسوفت لنموذج MAI-Transcribe-2 عبر 60 لغة تحليل كل من تكاليف الوحدة والإنتاجية التشغيلية. في البيئات عالية الحجم التي تعالج مئات الآلاف من الساعات الصوتية سنوياً، يؤدي خفض رسوم النسخ الأساسية إلى عشرة سنتات للساعة إلى تحويل التعرف على الكلام من مركز تكلفة كبير إلى أداة ميسورة التكلفة. علاوة على ذلك، يمكن أن يؤدي دمج القدرات الأساسية في النموذج القاعدي إلى تقليل الحاجة إلى طبقات توجيه معقدة ومتعددة الموردين في تطبيقات المؤسسات.
البنية التقنية وحدود زمن الوصول: كيف يعمل MAI-Transcribe-2 على نطاق واسع
يتطلب تحقيق دقة عالية عبر بيئات صوتية واقعية متنوعة قدرة النماذج على التعامل مع الظروف الصوتية الصعبة، وتداخل الكلام، والمفردات المحدودة. وفقاً لإفصاحات الأداء الرسمية على صفحة منتج Microsoft AI MAI-Transcribe-2، تم تصميم MAI-Transcribe-2 ليعمل بكفاءة عبر ظروف التسجيل الصاخبة، والمحادثات متعددة اللغات، والمدخلات ذات الجودة المتغيرة.

في حزمة تقييم FLEURS الموحدة، يحقق النموذج متوسط معدل خطأ في الكلمات يبلغ 5.2% عبر 60 لغة. ووفقاً لمخطط التقييم الرسمي الذي نشرته مايكروسوفت وأوردته تقارير تقنية من ITHome، يحافظ MAI-Transcribe-2 على هذا المتوسط عبر عمليات تشغيل اللغات المحددة مسبقاً والتعرف التلقائي على اللغة. في التقييمات المقارنة، تم الاستشهاد بـ Gemini 3.5 Transcribe في ملاحظات مايكروسوفت الرسمية كخط أساس صناعي رئيسي، بينما تُظهر مخططات المعايير الثانوية أداءً تنافسياً مقابل Gemini 3.1 Pro (5.3% إلى 5.8%)، وGPT-Transcribe من OpenAI (10.4% إلى 10.6%)، وWhisper V3-Large (22.8% إلى 23.5%) عبر مجموعات اختبار متطابقة.

اقتصاديات الإنتاجية وحدود زمن الوصول (Pareto Latency Frontier)
في معالجة الصوت بالدفعات، تُعد إنتاجية الاستدلال عاملاً مهماً في تكاليف الحوسبة التشغيلية وتسعير الخدمة. فالنموذج القادر على معالجة التسجيلات بسرعة تفوق الزمن الحقيقي بمئات المرات يمكن أن يقلل من وقت الـ GPU المطلوب لمعالجة كمية ثابتة من الصوت مقارنة بالبدائل الأبطأ. تضع التقييمات التي أجرتها Artificial Analysis نموذج MAI-Transcribe-2 مباشرة على حدود توازن الأداء (Pareto frontier)، مع الإبلاغ عن عامل سرعة يبلغ 403.6 ضعف الزمن الحقيقي—مما يسمح بإتمام معالجة تسجيل مدته ساعة واحدة في حوالي عشر ثوانٍ.

يوضح الرسم التخطيطي أدناه قدرات المعالجة المتاحة للمطورين:
[Incoming Audio Ingestion]
Audio Payload (WAV / MP3 / FLAC / Documented Codecs)
│
▼
[Supported Model Capabilities]
├── Automatic Language Identification (Auto-detect / Forced)
├── Multilingual Speech Recognition (60 Languages)
├── Speaker Diarization & Word-Level Timestamps
└── Keyword Biasing Support
│
▼
[Configured Output Generation]
Formatted Output Stream (Verbatim Mode vs. Clean Mode)
ولتلبية متطلبات العمل المتنوعة، تتضمن البنية تكوينات مخرجات مرنة. يمكن للمطورين اختيار وضع "النص الحرفي" (verbatim) الذي يلتقط التوقفات، والكلمات الحشوية، والبدايات الخاطئة للأغراض القانونية والتدقيق السريري. وبدلاً من ذلك، يقوم الوضع "النظيف" (clean) تلقائياً بتصفية الحشوات الكلامية لإنتاج نصوص منقحة لملخصات الاجتماعات، والترجمة، والمنشورات الخارجية.

تقييم نماذج الكلام إلى نص في سير عمل المؤسسات
يتطلب اختيار بنية للتعرف على الكلام تقييم تعقيد الاستضافة، ومتطلبات الخصوصية، وتكاليف التشغيل طويلة الأمد. توازن المنظمات الهندسية عادةً بين ثلاثة نماذج تشغيلية متميزة عند بناء سير عمل النسخ الآلي.
التقييم التقني: النماذج المستضافة ذاتياً مقابل واجهات برمجة التطبيقات المتخصصة عالية الإنتاجية
يوفر نشر النماذج مفتوحة المصدر المستضافة ذاتياً مثل Whisper تحكماً كاملاً في مكان البيانات ولكنه يفرض تكاليف بنية تحتية كبيرة. يتعين على فرق الهندسة إدارة مجموعات الـ GPU، وتحسين أحجام الدفعات، وصيانة مسارات عمل منفصلة لتحديد هوية المتحدث. في المقابل، توفر واجهات برمجة تطبيقات السحابة قابلية توسع فورية دون الحاجة لصيانة مستمرة للبنية التحتية.
يقارن الجدول أدناه المنهجيات القياسية لمعالجة ملفات الصوت عالية الحجم في المؤسسات:
| البنية | البصمة التحتية | تحديد الهوية والطوابع الزمنية | صيانة تعدد اللغات | المقايضة التشغيلية |
|---|---|---|---|---|
| مفتوح المصدر مستضاف ذاتياً (مثل Whisper) | عالية (مجموعة GPU مخصصة) | يتطلب مسارات عمل ثانوية | ضبط وتقييم النموذج ذاتياً | عزل كامل للبيانات مع عبء صيانة ثقيل |
| واجهات برمجة تطبيقات عامة متعددة الوسائط | منخفضة (نقاط نهاية سحابية) | تختلف حسب المورد | تغطية واسعة | تكلفة وحدة أعلى محتملة لمهام النسخ فقط |
| محرك كلام متخصص (MAI-Transcribe-2) | منخفضة (Azure / Foundry API) | تحديد هوية وطوابع مدمجة | نشر موحد لنموذج واحد | تكلفة وحدة منخفضة مع الاعتماد على خرائط طريق المورد |
بينما تظل الاستضافة الذاتية ضرورية للبيئات المعزولة، فإن اقتصاديات واجهات برمجة التطبيقات المتخصصة تُغير التوازن نحو الخدمات المدارة. إن نقطة النهاية المدارة التي تجمع بين تحديد الهوية، والطوابع الزمنية، وتخصيص المفردات بسعر عشرة سنتات للساعة تقلل بشكل كبير من التكلفة الإجمالية للملكية لمعظم أحمال العمل التجارية.
قائمة التحقق الهندسية: دمج واجهات برمجة تطبيقات الكلام عالية الإنتاجية
لضمان تكامل سلس لنماذج النسخ السحابية في سير العمل الإنتاجي، يمكن لفرق التطوير هيكلة تنفيذها وفقاً لإرشادات المنصة المعتمدة.
قائمة تحقق المطورين
- التحقق من قيود الصوت: تقبل واجهة برمجة تطبيقات النسخ السريع من مايكروسوفت ملفات أقل من 500 ميجابايت وخمس ساعات؛ يجب على المطورين التحقق من حدود النموذج الخاصة بنقطة نهاية معاينة MAI-Transcribe-2 قبل النشر للإنتاج.
- تهيئة تخصيص الكلمات الرئيسية: يدعم MAI-Transcribe-2 تخصيص الكلمات الرئيسية للمفردات والمختصرات الخاصة بالمجال؛ يجب على الفرق التحقق من مخطط معاينة Foundry الحالي لحقل تخصيص الكلمات الخاص بالنشر.
- اختيار أنماط تنسيق المخرجات: توجيه مهام الامتثال والتدقيق المباشر عبر إعداد النص الحرفي الموثق، مع استخدام نمط النسخ النظيف للملخصات الموجهة للمستهلك والملاحظات العامة.
قائمة التحقق الأمنية والبنية التحتية
- التحقق من حدود البيانات الإقليمية: التأكد من أن موارد معالجة الصوت تتوافق مع متطلبات إقامة البيانات والحوكمة التنظيمية داخل لوحات التحكم السحابية.
- تنفيذ منطق تقسيم الدفعات: بالنسبة لأرشيفات المؤسسات الكبيرة التي تتجاوز حدود الملفات الفردية، قم بنشر مسارات معالجة مسبقة تقوم بتقسيم التسجيلات عند فترات التوقف الطبيعية للحفاظ على الاستمرارية الصوتية.
- مراجعة وثائق نقطة نهاية المعاينة: تؤكد مواد إطلاق مايكروسوفت وجود ميزة تحديد الهوية في MAI-Transcribe-2، بينما يتم تحديث وثائق التكامل السابقة؛ تحقق من أحدث معلمات نقطة نهاية المعاينة قبل الاعتماد على مخطط طلب محدد.
من خلال اعتماد معايير التنفيذ المنهجية هذه، يمكن للمؤسسات الهندسية دمج خدمات النسخ عالية الإنتاجية في مسارات بياناتها الأساسية مع الحفاظ على القدرة على التنبؤ المعماري.
الأسئلة الشائعة (FAQ)
ما أهمية معدل خطأ الكلمات 5.2% في معيار FLEURS؟
كيف يقارن MAI-Transcribe-2 مع GPT-Transcribe و Whisper من OpenAI؟
ما الفرق بين أنماط النسخ الحرفية والنظيفة؟
أهم النقاط لفرق الهندسة
يوضح التطور المستمر لنماذج التعرف على الكلام المخصصة تحولاً أوسع نحو الكفاءة المحددة بنوع الوسائط في الذكاء الاصطناعي. بينما تواصل النماذج متعددة الوسائط للأغراض العامة توسيع قدراتها على الاستدلال، تُظهر محركات الكلام المتخصصة أن التحسينات المستهدفة تؤدي إلى زمن وصول فائق، ومعدلات خطأ أقل، واقتصاديات وحدة مقنعة.
بالنسبة للمنظمات التقنية، يُمكّن دمج خدمات النسخ عالية الإنتاجية من إجراء أتمتة قابلة للتوسع عبر العمليات التجارية كثيفة الصوت. ومن خلال اختيار بنى متخصصة تجمع بين تحديد هوية المتحدث، وتنسيق المخرجات القابل للتخصيص، والاستدلال الدفعي الفعال، يمكن لفرق التطوير بناء مسارات بيانات سريعة الاستجابة وفعالة من حيث التكلفة تتوسع مع طلب المؤسسة.
المراجع
-
Microsoft AI. MAI-Transcribe-2 هو نموذج التعرف على الكلام الأسرع والأكثر دقة والأرخص في العالم. https://microsoft.ai/news/mai-transcribe-2-is-the-fastest-most-accurate-and-cheapest-speech-recognition-model-in-the-world/
-
Microsoft AI. نظرة عامة ومواصفات نموذج MAI-Transcribe-2. https://microsoft.ai/models/mai-transcribe-2/
-
Microsoft Learn. استخدام واجهة برمجة تطبيقات النسخ السريع (Fast Transcription API). https://learn.microsoft.com/en-us/azure/ai-services/speech-service/fast-transcription-create
-
Microsoft Learn. تحسين دقة التعرف باستخدام قوائم العبارات. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/improve-accuracy-phrase-list
-
Artificial Analysis. لوحة صدارة تحويل الكلام إلى نص وحدود توازن الأداء بين الدقة وزمن الوصول. https://artificialanalysis.ai/speech-to-text/non-streaming
-
Google Research. FLEURS: تقييم التعلم القليل من الأمثلة للتمثيلات العالمية للكلام. https://huggingface.co/datasets/google/fleurs
-
VentureBeat. نموذج MAI-Transcribe-2 من Microsoft AI يتفوق على OpenAI و Google و ElevenLabs في السعر والسرعة. https://venturebeat.com/technology/microsoft-launches-3-new-ai-models-in-direct-shot-at-openai-and-google
-
Neowin. نموذج MAI-Transcribe-2 من مايكروسوفت يتفوق على OpenAI و Google بتكلفة 0.10 دولار فقط للساعة. https://www.neowin.net/news/microsofts-mai-transcribe-2-model-beats-openai-and-google-while-costing-just-010-per-hour/
-
ITHome. مايكروسوفت تطلق نموذج التعرف على الكلام MAI-Transcribe-2 بمعدل خطأ 5.2%. https://www.ithome.com/0/998/241.htm
Share this article



