شركة NVIDIA تشحن Rubin NVL72؟ لماذا ارتفعت كفاءة الطاقة

opoinstall
2026-08-25
5 min read

هل شحنت NVIDIA نظام Rubin NVL72؟ كشف بيانات الأداء الجديدة على السيليكون أن منصة Vera Rubin NVL72 توفر إنتاجية أعلى تصل إلى 30 ضعفًا لكل ميجاوات وتكاليف رموز أقل بـ 35 ضعفًا لأحمال عمل الذكاء الاصطناعي الوكيل مقارنة بـ GB300 NVL72 في تكوين AgentX المُختبر، مما يضع خطًا أساسيًا جديدًا لكفاءة الأجهزة لمصانع الذكاء الاصطناعي ذات الطاقة المحدودة. مع انتقال وكلاء البرمجيات المستقلين من المطالبات التجريبية أحادية الجولة إلى خطوط إنتاج متعددة الخطوات، يتسع الطلب الحسابي بسرعة. تشير بيانات استخدام OpenRouter التي استشهدت بها NVIDIA إلى أن طلبًا وكيلًا واحدًا يستهلك حوالي 15 ضعف عدد الرموز التي يستهلكها طلب الدردشة العادي لأن الوكلاء يستعلمون مرارًا وتكرارًا عن قواعد البيانات، ويستردون المستندات الخارجية، ويُنشئون وكلاء فرعيين، ويحافظون على ذاكرة ذات سياق طويل. للحفاظ على هذه الإنتاجية عالية الكثافة ضمن ميزانيات طاقة مراكز البيانات الثابتة، تتجه بنيات الخوادم نحو التصميم المشترك المتطور للأجهزة والبرمجيات.

إعادة تنظيم الصناعة الأساسية وتحليل الأخبار: Vera Rubin NVL72 لنطاق الذكاء الاصطناعي الوكيل

لمحة سريعة

  • تُظهر بيانات أداء السيليكون الصادرة في 24 أغسطس 2026 أن Vera Rubin NVL72 توفر إنتاجية أعلى تصل إلى 30 ضعفًا لكل ميجاوات مقارنة بـ GB300 NVL72 في أحمال عمل البرمجة الوكيلة، مع قياس النتائج بواسطة NVIDIA باستخدام حمل عمل SemiAnalysis AgentX وهي قيد مراجعة SemiAnalysis حاليًا.
  • يستهلك الوكلاء المستقلون متعددو الخطوات رموزًا أكثر بنحو 15 مرة من تفاعلات روبوتات الدردشة القياسية، مما يجعل توفر الطاقة، والإنتاجية لكل ميجاوات، واقتصاديات الرموز قيودًا متزايدة الأهمية لبنية الذكاء الاصطناعي التحتية.
  • تجمع المنصة بين التقديم المفكك، والتخزين المؤقت الموزع لـ KV، والتوجيه الواعي لـ KV، ودقة NVFP4، والشبكات على مستوى الخزانة، والتصميم المشترك الأوسع للأجهزة والبرمجيات، مما يساهم في تخفيضات NVIDIA المبلغ عنها في تكلفة الرموز بنسبة تصل إلى 35 ضعفًا مقابل GB300 NVL72 في تكوين AgentX المُختبر.

التحول من واجهات روبوتات الدردشة الأساسية إلى تدفقات العمل الوكيلة المستقلة يدفع تحولًا هيكليًا في هندسة مراكز البيانات. عادة ما تعمل التفاعلات أحادية الجولة القياسية ضمن حدود إدخال وإخراج موجزة تتراوح بين 1000 و8000 رمز. في المقابل، يمتلك الوكلاء المستقلون حلقات استدلال تكرارية حيث تتراكم كل استدعاء للأداة، واسترجاع لقاعدة البيانات، ومخرج وسيط في نافذة السياق للخطوات اللاحقة. يخلق هذا السياق المتراكم دفعات غير منتظمة من الحساب يتبعها فترات من زمن انتقال الشبكة، مما يضغط على خوادم الاستدلال التقليدية المصممة لأحمال العمل الثابتة للاستجابة للمطالبات.

لتقييم أداء البنية التحتية في ظل هذه الظروف الواقعية، تبتعد تقييمات الأداء عن تقييمات التسلسل ثابتي الطول لصالح إعادة تشغيل الجلسات الديناميكية. باستخدام مجموعة اختبار SemiAnalysis AgentX، قامت NVIDIA بقياس إنتاجية النظام المستدامة عبر مسارات البرمجة ذات الطراز الإنتاجي المُعاد تشغيلها من النماذج الرائدة، بما في ذلك DeepSeek V4 Pro وKimi K3 وGLM-5.3. تحافظ الجلسات المسجلة على نمو السياق الواقعي، وفترات استدعاء الأدوات، وأنماط إنشاء الوكلاء الفرعيين لاختبار مدى كفاءة الأجهزة في تحويل الطاقة الخام إلى مخرجات قابلة للاستخدام، كما هو موضح بالتفصيل في الإعلان التقني لشركة NVIDIA. تعكس نتائج Vera Rubin هذه القياسات المبكرة وهي قيد المراجعة حاليًا من قبل SemiAnalysis.

صورة تقنية لـ NVIDIA توضح أداء الذكاء الاصطناعي الوكيل ومقاييس كفاءة الاستدلال

تُظهر قفزة الكفاءة المقاسة عبر منصة Vera Rubin تحولاً كبيرًا في كيفية تقييم منصات الحوسبة المسرعة. في مصانع الذكاء الاصطناعي محدودة الطاقة، تحدد الإنتاجية لكل ميجاوات إجمالي سعة التشغيل، بينما تحكم التكلفة لكل مليون رمز على هوامش الربح الإجمالية. تشير نتائج اختبار الأداء إلى أن Blackwell GB300 NVL72 يوفر إنتاجية أعلى تصل إلى 15 ضعفًا لكل ميجاوات وتكاليف رموز أقل بـ 10 أضعاف مقارنة بأنظمة Hopper H200. وتوسع هندسة Vera Rubin منحنى الكفاءة هذا بشكل أكبر، محققة إنتاجية أعلى تصل إلى 30 ضعفًا لكل ميجاوات مقارنة بـ GB300 عند أهداف التقديم التفاعلي البالغة 160 رمزًا في الثانية لكل مستخدم على أعباء عمل DeepSeek V4 Pro، كما هو مبلغ عنه في تقرير مدونة مطوري NVIDIA.

رسم بياني للمقارنة بين استدلال التسلسل الثابت التقليدي ومتطلبات عبء العمل الوكيل المعقد

الانفصال المعماري الداخلي: التقديم المفكك وتوجيه التخزين المؤقت لـ KV

تنبع مكاسب الأداء لبنية Rubin من معالجة عدم التوافق المادي الأساسي بين مرحلتي الإعداد (prefill) وفك التشفير (decode) لاستدلال نماذج اللغة الكبيرة. تعالج مرحلة الإعداد المطالبة الواردة وهي مقيدة بالحساب، وتستفيد من إنتاجية العمليات الحسابية المتوازية العالية. في المقابل، تقوم مرحلة فك التشفير بتوليد الرموز تسلسليًا وعادة ما تكون أكثر حساسية لعرض النطاق الترددي للذاكرة، خاصة في أحجام الدُفعات التفاعلية الأصغر، لأن توليد الرموز يسهل الوصول المتكرر إلى أوزان النموذج وحالة KV.

لإزالة الاحتكاك التشغيلي، تنفذ بنيات مصانع الذكاء الاصطناعي الحديثة تقنية التقديم المفكك. تفصل هذه التقنية بين تنفيذ مرحلتي الإعداد وفك التشفير عبر مجموعات عمل تتم جدولتها بشكل مستقل، مما يسمح لكل مرحلة بالتوسع بشكل مستقل ومطابقة معدلات التوليد ديناميكيًا عبر مجموعة الخوادم.

تحسين الذاكرة: التخزين المؤقت الموزع ونطاقات التوسعة لـ NVLink

في الجلسات الوكيلة طويلة الأمد، يؤدي إعادة حساب الرموز التي تمت معالجتها مسبقًا إلى تكرار هائل في الحسابات. للحفاظ على الكفاءة، تنشر أطر عمل التقديم تخزينًا مؤقتًا موزعًا للمفاتيح والقيم (KV) عبر نطاق التوصيل البيني عالي السرعة، مما يسمح لوحدات معالجة الرسومات بمشاركة السياق وإعادة استخدامه دون حسابات إعداد مكررة.

يوضح الرسم البياني أدناه الفصل المعماري بين معالجة الإعداد المفككة وتوليد فك التشفير الواعي بـ KV:

[Incoming Multi-Step Agent Request (Cumulative Context)]
                           │
                           ▼
    [ Disaggregated Prefill Worker Pool ] ──> Accelerated Context Encoding
                           │
                           ▼ (Context State Transfer via High-Bandwidth Fabric)
    [ KV-Aware Routing Dispatcher (Dynamo) ] ──> Matches Cached Worker Node
                           │
                           ▼
    [ Disaggregated Decode Worker Pool ]  ──> Low-Latency Token Generation

دعمًا لتقنيات الذاكرة الموزعة هذه، يستخدم النظام تبديل التوصيل البيني من الجيل السادس والذي يوفر معدلات حزم أعلى بشكل كبير وزمن انتقال أقل بكثير مقارنة بالشبكات الجاهزة. ويمتد طبقة التقديم عبر وحدات معالجة CUDA المحسنة، ومكتبات وقت التشغيل مثل TensorRT-LLM، وأطر التنسيق مثل NVIDIA Dynamo، لتوجيه الطلبات مباشرة إلى عقد التنفيذ التي تحتفظ بالفعل بالسياق المخزن مؤقتًا ذي الصلة. وتصرح NVIDIA أن تقنيات إدارة الطاقة DSX MaxLPS الخاصة بها يمكنها توفير ما يصل إلى 40% إضافية من وحدات معالجة الرسومات ضمن نفس ميزانية الميجاوات، مما يزيد من تعظيم الإنتاجية على نطاق المرافق.

رسم بياني للمقارنة يوضح تقديم Vera Rubin NVL72 لإنتاجية أعلى لكل ميجاوات من GB300 NVL72

يوضح هذا النهج الشامل مبدأً تقنيًا أوسع: يتطلب توسيع نطاق أحمال عمل الذكاء الاصطناعي الحديثة القضاء على الحسابات المتكررة وتحسين نقل الذاكرة عبر كل طبقة من طبقات النظام. في هندسة البرمجيات الموزعة، تُطبق مبادئ الكفاءة المتوازية عبر خطوط بيانات عالية الإنتاجية، حيث تفصل البنيات الاستيعاب عن تسوية الحالة لمنع اختناقات المعالجة.

رسم بياني يوضح تقديم GB300 NVL72 لكفاءة تكلفة رموز محسنة مقارنة بأجهزة H200 من الجيل السابق

الأنظمة غير المقترنة وتحليل المقارنة: التقديم المتراص مقابل مصانع الذكاء الاصطناعي المصممة بشكل مشترك

مع تطور البنيات عالية التزامن نحو معالجة مفككة تعتمد على جانب الخوير، يجب على فرق الهندسة تقييم كيف تؤثر تصميمات البنية التحتية على اقتصاديات الوحدات. يتطلب نشر خطوط الأنابيب الوكيلة ذات الدرجة الإنتاجية أنظمة خلفية تعظّم الإنتاجية لكل ميجاوات مع تقليل التكلفة لكل مليون رمز. يجب على المنظمات تقييم ما إذا كانت مثيلات التقديم المتراصة التقليدية قادرة على الحفاظ على أحمال العمل الوكيلة أم أن هناك حاجة إلى بنيات مخصصة مصممة بشكل مشترك.

التقييم المعماري: التقديم التقليدي مقابل المنصات المفككة

يؤدي نشر مثيلات تقديم متراصة تتعامل فيها كل وحدة معالجة رسومات مع مرحلتي الإعداد وفك التشفير إلى نقص حاد في استغلال الموارد أثناء جولات الوكيل طويلة السياق. وفي حين توفر عمليات النشر المتراصة إعدادًا أوليًا بسيطًا، إلا أنها تعاني من تجويع الحساب أثناء مراحل فك التشفير وقيود سعة الذاكرة أثناء دفعات الإعداد. في المقابل، تقوم بنيات مصانع الذكاء الاصطناعي المفككة بفصل تشفير السياق عن توليد الرموز ديناميكيًا، مما يحافظ على استغلال عالٍ عبر مجالات الحساب والذاكرة.

يحدد الجدول أدناه المقايضات المعمارية الرئيسية عبر منهجيات تقديم الاستدلال المختلفة:

نموذج البنية استراتيجية توسيع السياق تخصيص الإعداد/فك التشفير الإنتاجية لكل ميجاوات اقتصاديات تكلفة الرموز
تقديم أحادي العقدة ومتراص تخصيص ذاكرة ثابت مرتبط ارتباطًا وثيقًا الخط الأساسي خط أساسي مرتفع قياسي
الاستدلال المجموعاتي المقترن تجمعات الموارد المشتركة تخصيص العمال المتجانسين متوسط (يعتمد على عبء العمل) معدل المجموعات القياسي
مصنع الذكاء الاصطناعي المفكك والمصمم بشكل مشترك التوجيه الموزع للتخزين المؤقت لـ KV مفكك بالكامل ومستقل حتى 30 ضعفًا مقابل GB300 (مبلغ عنه) تلفة أقل تصل إلى 35 ضعفًا مقابل GB300

يمثل هذا التحول الهيكلي شكلاً من أشكال انكماش تكلفة الاستدلال: يمكن لكل ميجاوات ثابت من سعة مركز البيانات إنتاج عمل وكيل مفيد بشكل ملموس. من خلال الجمع بين تسريع الأجهزة وتوجيه عبء العمل الذكي، يمكن للمشغلين الحفاظ على الأداء التفاعلي عبر المهام المعقدة طويلة الأمد.

نظرة عامة على البنية التحتية لمصنع الذكاء الاصطناعي المتكامل التي تضم خوادم الحوسبة والتخزين والشبكات

قائمة التحقق الهندسي وجداول التحقق: تحسين قياس عن بعد للوكلاء على مستوى الخزانة

لإعداد البنية التحتية لمراكز البيانات وخطوط الأنابيب التطبيقية لأحمال العمل الوكيلة عالية الإنتاجية، يجب على الفرق التقنية والتشغيلية إنشاء ممارسات تحسين منظمة.

قائمة تحقق تنفيذ المطور

  • فصل عمال الإعداد عن عمال فك التشفير: فصل استيعاب السياق الكثيف الحسابي عن توليد الرموز المرتبط بالذاكرة إلى مجموعات عمل تتم جدولتها بشكل مستقل لتحقيق أقصى استفادة من المعالج.
  • تنفيذ التوجيه الواعي للتخزين المؤقت لـ KV: تكوين بوابات واجهة برمجة التطبيقات وموازنات الأحمال لتوجيه الطلبات الواردة متعددة الجولات إلى عقد العمال التي تخزن بالفعل السياق المخزن المؤقت ذي الصلة.
  • تقييم التكميم منخفض الدقة: قياس مسارات التنفيذ ذات الدقة المختلطة وNVFP4 عبر النماذج المستهدفة لتقليل بصمة الذاكرة مع التحقق من استقرار استدلال المخرجات.

قائمة التحقق التشغيلية والاقتصادية

  • مراقبة الإنتاجية لكل ميجاوات: تتبع الرموز المستدامة لكل ميجاوات عبر أحمال العمل الحية بدلاً من الاعتماد حصرًا على مقاييس زمن انتقال الطلب الفردي المعزول.
  • مراجعة اقتصاديات وحدة الرموز: قياس تكلفة البنية التحتية الشاملة لكل مليون رمز عبر مسارات الوكيل متعددة الخطوات للحفاظ على هوامش ربح مستدامة.
  • توصيف وقت استجابة الرمز الأول (TTFT): مراقبة زمن انتقال الاستجابة الأولية أثناء مراحل الإعداد طويلة السياق لضمان عدم المساس بتجربة المستخدم التفاعلية من خلال التجميع عالي الإنتاجية.

يتيح تبني هذه المنهجيات التشغيلية للفرق الهندسية نشر أنظمة وكيلة استجابة طويلة الأمد مع الحفاظ على حوكمة صارمة لتكلفة البنية التحتية.

الأسئلة الشائعة (FAQ)

لماذا تستهلك أحمال عمل الذكاء الاصطناعي الوكيل رموزًا أكثر بـ 15 مرة من استعلامات روبوتات الدردشة القياسية؟
تتطلب تدفقات العمل الوكيلة استدلالًا متعدد الخطوات، واستعلامات قواعد بيانات تكرارية، واستدعاءات أدوات، وتنسيقًا للوكلاء الفرعيين. نظرًا لأن السياق المتراكم من كل خطوة يصبح مدخلاً للجولات اللاحقة، يمكن أن تنمو جلسات الوكيل لتصل إلى مئات الآلاف من الرموز، مما يضاعف إجمالي استهلاك الرموز مقارنة بتفاعلات الدردشة أحادية الجولة.
كيف يعمل التقديم المفكك على تحسين إنتاجية مصنع الذكاء الاصطناعي لكل ميجاوات؟
يفصل التقديم المفكك مرحلة الإعداد الكثيفة الحسابية عن مرحلة فك التشفير الكثيفة لعرض النطاق الترددي للذاكرة عبر عقد وحدة معالجة رسومات متخصصة. من خلال تحسين كل مجموعة أجهزة لملفها الحسابي المحدد ومطابقة معدلات التوليد، تلغي البنية دورات المعالج الخاملة وتزيد من كفاءة الطاقة.
ما الفرق بين مقاييس كفاءة Blackwell GB300 NVL72 وVera Rubin NVL72؟
في حين أن Blackwell GB300 NVL72 يوفر إنتاجية أعلى تصل إلى 15 ضعفًا لكل ميجاوات مقارنة ببنيات Hopper على اختبارات الوكيل، فإن Vera Rubin NVL72 يحقق إنتاجية أعلى تصل إلى 30 ضعفًا لكل ميجاوات ويقلل تكاليف الرموز بنسبة تصل إلى 35 ضعفًا مقارنة بـ GB300، مما يوفر حدودًا موسعة للكفاءة لنماذج مزيج الخبراء الكبيرة.

الوجبات الرئيسية للفرق الهندسية

تسلط التطورات في الأجهزة المُثبتة عبر منصة Vera Rubin NVL72 الضوء على تحول أساسي في البنية التحتية للحوسبة: تتطلب عمليات الذكاء الاصطناعي القابلة للتطوير تصميماً مشتركاً شاملاً عبر السيليكون، وبنيات الذاكرة، وبيئات تشغيل البرمجيات. مع أصبح الوكلاء المستقلون متعددة الخطوات الواجهة القياسية لبرمجيات المؤسسات، يتم استبدال نماذج التقديم المتراصة التقليدية بأنظمة مفككة تتمحور حول الذاكرة.

بالنسبة لمهندسي البنية التحتية وقادة الهندسة، يتطلب التنقل في هذا العصر عالي الإنتاجية تبني مبادئ الأنظمة غير المقترنة عبر خطوط أنابيب مراكز البيانات. من خلال تطبيق التقديم المفكك، والتخزين المؤقت للسياق الموزع، وتوجيه أحمال العمل الذكي، يمكن للمنظمات بناء بنيات حوسبة مرنة قادرة على توسيع نطاق ذكاء الوكيل بكفاءة ضمن ميزانيات طاقة المرافق الثابتة.

Share this article