هل شحنت NVIDIA نظام Rubin NVL72؟ كشف بيانات الأداء الجديدة على السيليكون أن منصة Vera Rubin NVL72 توفر إنتاجية أعلى تصل إلى 30 ضعفًا لكل ميجاوات وتكاليف رموز أقل بـ 35 ضعفًا لأحمال عمل الذكاء الاصطناعي الوكيل مقارنة بـ GB300 NVL72 في تكوين AgentX المُختبر، مما يضع خطًا أساسيًا جديدًا لكفاءة الأجهزة لمصانع الذكاء الاصطناعي ذات الطاقة المحدودة. مع انتقال وكلاء البرمجيات المستقلين من المطالبات التجريبية أحادية الجولة إلى خطوط إنتاج متعددة الخطوات، يتسع الطلب الحسابي بسرعة. تشير بيانات استخدام OpenRouter التي استشهدت بها NVIDIA إلى أن طلبًا وكيلًا واحدًا يستهلك حوالي 15 ضعف عدد الرموز التي يستهلكها طلب الدردشة العادي لأن الوكلاء يستعلمون مرارًا وتكرارًا عن قواعد البيانات، ويستردون المستندات الخارجية، ويُنشئون وكلاء فرعيين، ويحافظون على ذاكرة ذات سياق طويل. للحفاظ على هذه الإنتاجية عالية الكثافة ضمن ميزانيات طاقة مراكز البيانات الثابتة، تتجه بنيات الخوادم نحو التصميم المشترك المتطور للأجهزة والبرمجيات.
إعادة تنظيم الصناعة الأساسية وتحليل الأخبار: Vera Rubin NVL72 لنطاق الذكاء الاصطناعي الوكيل
لمحة سريعة
- تُظهر بيانات أداء السيليكون الصادرة في 24 أغسطس 2026 أن Vera Rubin NVL72 توفر إنتاجية أعلى تصل إلى 30 ضعفًا لكل ميجاوات مقارنة بـ GB300 NVL72 في أحمال عمل البرمجة الوكيلة، مع قياس النتائج بواسطة NVIDIA باستخدام حمل عمل SemiAnalysis AgentX وهي قيد مراجعة SemiAnalysis حاليًا.
- يستهلك الوكلاء المستقلون متعددو الخطوات رموزًا أكثر بنحو 15 مرة من تفاعلات روبوتات الدردشة القياسية، مما يجعل توفر الطاقة، والإنتاجية لكل ميجاوات، واقتصاديات الرموز قيودًا متزايدة الأهمية لبنية الذكاء الاصطناعي التحتية.
- تجمع المنصة بين التقديم المفكك، والتخزين المؤقت الموزع لـ KV، والتوجيه الواعي لـ KV، ودقة NVFP4، والشبكات على مستوى الخزانة، والتصميم المشترك الأوسع للأجهزة والبرمجيات، مما يساهم في تخفيضات NVIDIA المبلغ عنها في تكلفة الرموز بنسبة تصل إلى 35 ضعفًا مقابل GB300 NVL72 في تكوين AgentX المُختبر.
التحول من واجهات روبوتات الدردشة الأساسية إلى تدفقات العمل الوكيلة المستقلة يدفع تحولًا هيكليًا في هندسة مراكز البيانات. عادة ما تعمل التفاعلات أحادية الجولة القياسية ضمن حدود إدخال وإخراج موجزة تتراوح بين 1000 و8000 رمز. في المقابل، يمتلك الوكلاء المستقلون حلقات استدلال تكرارية حيث تتراكم كل استدعاء للأداة، واسترجاع لقاعدة البيانات، ومخرج وسيط في نافذة السياق للخطوات اللاحقة. يخلق هذا السياق المتراكم دفعات غير منتظمة من الحساب يتبعها فترات من زمن انتقال الشبكة، مما يضغط على خوادم الاستدلال التقليدية المصممة لأحمال العمل الثابتة للاستجابة للمطالبات.
لتقييم أداء البنية التحتية في ظل هذه الظروف الواقعية، تبتعد تقييمات الأداء عن تقييمات التسلسل ثابتي الطول لصالح إعادة تشغيل الجلسات الديناميكية. باستخدام مجموعة اختبار SemiAnalysis AgentX، قامت NVIDIA بقياس إنتاجية النظام المستدامة عبر مسارات البرمجة ذات الطراز الإنتاجي المُعاد تشغيلها من النماذج الرائدة، بما في ذلك DeepSeek V4 Pro وKimi K3 وGLM-5.3. تحافظ الجلسات المسجلة على نمو السياق الواقعي، وفترات استدعاء الأدوات، وأنماط إنشاء الوكلاء الفرعيين لاختبار مدى كفاءة الأجهزة في تحويل الطاقة الخام إلى مخرجات قابلة للاستخدام، كما هو موضح بالتفصيل في الإعلان التقني لشركة NVIDIA. تعكس نتائج Vera Rubin هذه القياسات المبكرة وهي قيد المراجعة حاليًا من قبل SemiAnalysis.

تُظهر قفزة الكفاءة المقاسة عبر منصة Vera Rubin تحولاً كبيرًا في كيفية تقييم منصات الحوسبة المسرعة. في مصانع الذكاء الاصطناعي محدودة الطاقة، تحدد الإنتاجية لكل ميجاوات إجمالي سعة التشغيل، بينما تحكم التكلفة لكل مليون رمز على هوامش الربح الإجمالية. تشير نتائج اختبار الأداء إلى أن Blackwell GB300 NVL72 يوفر إنتاجية أعلى تصل إلى 15 ضعفًا لكل ميجاوات وتكاليف رموز أقل بـ 10 أضعاف مقارنة بأنظمة Hopper H200. وتوسع هندسة Vera Rubin منحنى الكفاءة هذا بشكل أكبر، محققة إنتاجية أعلى تصل إلى 30 ضعفًا لكل ميجاوات مقارنة بـ GB300 عند أهداف التقديم التفاعلي البالغة 160 رمزًا في الثانية لكل مستخدم على أعباء عمل DeepSeek V4 Pro، كما هو مبلغ عنه في تقرير مدونة مطوري NVIDIA.

الانفصال المعماري الداخلي: التقديم المفكك وتوجيه التخزين المؤقت لـ KV
تنبع مكاسب الأداء لبنية Rubin من معالجة عدم التوافق المادي الأساسي بين مرحلتي الإعداد (prefill) وفك التشفير (decode) لاستدلال نماذج اللغة الكبيرة. تعالج مرحلة الإعداد المطالبة الواردة وهي مقيدة بالحساب، وتستفيد من إنتاجية العمليات الحسابية المتوازية العالية. في المقابل، تقوم مرحلة فك التشفير بتوليد الرموز تسلسليًا وعادة ما تكون أكثر حساسية لعرض النطاق الترددي للذاكرة، خاصة في أحجام الدُفعات التفاعلية الأصغر، لأن توليد الرموز يسهل الوصول المتكرر إلى أوزان النموذج وحالة KV.
لإزالة الاحتكاك التشغيلي، تنفذ بنيات مصانع الذكاء الاصطناعي الحديثة تقنية التقديم المفكك. تفصل هذه التقنية بين تنفيذ مرحلتي الإعداد وفك التشفير عبر مجموعات عمل تتم جدولتها بشكل مستقل، مما يسمح لكل مرحلة بالتوسع بشكل مستقل ومطابقة معدلات التوليد ديناميكيًا عبر مجموعة الخوادم.
تحسين الذاكرة: التخزين المؤقت الموزع ونطاقات التوسعة لـ NVLink
في الجلسات الوكيلة طويلة الأمد، يؤدي إعادة حساب الرموز التي تمت معالجتها مسبقًا إلى تكرار هائل في الحسابات. للحفاظ على الكفاءة، تنشر أطر عمل التقديم تخزينًا مؤقتًا موزعًا للمفاتيح والقيم (KV) عبر نطاق التوصيل البيني عالي السرعة، مما يسمح لوحدات معالجة الرسومات بمشاركة السياق وإعادة استخدامه دون حسابات إعداد مكررة.
يوضح الرسم البياني أدناه الفصل المعماري بين معالجة الإعداد المفككة وتوليد فك التشفير الواعي بـ KV:
[Incoming Multi-Step Agent Request (Cumulative Context)]
│
▼
[ Disaggregated Prefill Worker Pool ] ──> Accelerated Context Encoding
│
▼ (Context State Transfer via High-Bandwidth Fabric)
[ KV-Aware Routing Dispatcher (Dynamo) ] ──> Matches Cached Worker Node
│
▼
[ Disaggregated Decode Worker Pool ] ──> Low-Latency Token Generation
دعمًا لتقنيات الذاكرة الموزعة هذه، يستخدم النظام تبديل التوصيل البيني من الجيل السادس والذي يوفر معدلات حزم أعلى بشكل كبير وزمن انتقال أقل بكثير مقارنة بالشبكات الجاهزة. ويمتد طبقة التقديم عبر وحدات معالجة CUDA المحسنة، ومكتبات وقت التشغيل مثل TensorRT-LLM، وأطر التنسيق مثل NVIDIA Dynamo، لتوجيه الطلبات مباشرة إلى عقد التنفيذ التي تحتفظ بالفعل بالسياق المخزن مؤقتًا ذي الصلة. وتصرح NVIDIA أن تقنيات إدارة الطاقة DSX MaxLPS الخاصة بها يمكنها توفير ما يصل إلى 40% إضافية من وحدات معالجة الرسومات ضمن نفس ميزانية الميجاوات، مما يزيد من تعظيم الإنتاجية على نطاق المرافق.

يوضح هذا النهج الشامل مبدأً تقنيًا أوسع: يتطلب توسيع نطاق أحمال عمل الذكاء الاصطناعي الحديثة القضاء على الحسابات المتكررة وتحسين نقل الذاكرة عبر كل طبقة من طبقات النظام. في هندسة البرمجيات الموزعة، تُطبق مبادئ الكفاءة المتوازية عبر خطوط بيانات عالية الإنتاجية، حيث تفصل البنيات الاستيعاب عن تسوية الحالة لمنع اختناقات المعالجة.

الأنظمة غير المقترنة وتحليل المقارنة: التقديم المتراص مقابل مصانع الذكاء الاصطناعي المصممة بشكل مشترك
مع تطور البنيات عالية التزامن نحو معالجة مفككة تعتمد على جانب الخوير، يجب على فرق الهندسة تقييم كيف تؤثر تصميمات البنية التحتية على اقتصاديات الوحدات. يتطلب نشر خطوط الأنابيب الوكيلة ذات الدرجة الإنتاجية أنظمة خلفية تعظّم الإنتاجية لكل ميجاوات مع تقليل التكلفة لكل مليون رمز. يجب على المنظمات تقييم ما إذا كانت مثيلات التقديم المتراصة التقليدية قادرة على الحفاظ على أحمال العمل الوكيلة أم أن هناك حاجة إلى بنيات مخصصة مصممة بشكل مشترك.
التقييم المعماري: التقديم التقليدي مقابل المنصات المفككة
يؤدي نشر مثيلات تقديم متراصة تتعامل فيها كل وحدة معالجة رسومات مع مرحلتي الإعداد وفك التشفير إلى نقص حاد في استغلال الموارد أثناء جولات الوكيل طويلة السياق. وفي حين توفر عمليات النشر المتراصة إعدادًا أوليًا بسيطًا، إلا أنها تعاني من تجويع الحساب أثناء مراحل فك التشفير وقيود سعة الذاكرة أثناء دفعات الإعداد. في المقابل، تقوم بنيات مصانع الذكاء الاصطناعي المفككة بفصل تشفير السياق عن توليد الرموز ديناميكيًا، مما يحافظ على استغلال عالٍ عبر مجالات الحساب والذاكرة.
يحدد الجدول أدناه المقايضات المعمارية الرئيسية عبر منهجيات تقديم الاستدلال المختلفة:
| نموذج البنية | استراتيجية توسيع السياق | تخصيص الإعداد/فك التشفير | الإنتاجية لكل ميجاوات | اقتصاديات تكلفة الرموز |
|---|---|---|---|---|
| تقديم أحادي العقدة ومتراص | تخصيص ذاكرة ثابت | مرتبط ارتباطًا وثيقًا | الخط الأساسي | خط أساسي مرتفع قياسي |
| الاستدلال المجموعاتي المقترن | تجمعات الموارد المشتركة | تخصيص العمال المتجانسين | متوسط (يعتمد على عبء العمل) | معدل المجموعات القياسي |
| مصنع الذكاء الاصطناعي المفكك والمصمم بشكل مشترك | التوجيه الموزع للتخزين المؤقت لـ KV | مفكك بالكامل ومستقل | حتى 30 ضعفًا مقابل GB300 (مبلغ عنه) | تلفة أقل تصل إلى 35 ضعفًا مقابل GB300 |
يمثل هذا التحول الهيكلي شكلاً من أشكال انكماش تكلفة الاستدلال: يمكن لكل ميجاوات ثابت من سعة مركز البيانات إنتاج عمل وكيل مفيد بشكل ملموس. من خلال الجمع بين تسريع الأجهزة وتوجيه عبء العمل الذكي، يمكن للمشغلين الحفاظ على الأداء التفاعلي عبر المهام المعقدة طويلة الأمد.

قائمة التحقق الهندسي وجداول التحقق: تحسين قياس عن بعد للوكلاء على مستوى الخزانة
لإعداد البنية التحتية لمراكز البيانات وخطوط الأنابيب التطبيقية لأحمال العمل الوكيلة عالية الإنتاجية، يجب على الفرق التقنية والتشغيلية إنشاء ممارسات تحسين منظمة.
قائمة تحقق تنفيذ المطور
- فصل عمال الإعداد عن عمال فك التشفير: فصل استيعاب السياق الكثيف الحسابي عن توليد الرموز المرتبط بالذاكرة إلى مجموعات عمل تتم جدولتها بشكل مستقل لتحقيق أقصى استفادة من المعالج.
- تنفيذ التوجيه الواعي للتخزين المؤقت لـ KV: تكوين بوابات واجهة برمجة التطبيقات وموازنات الأحمال لتوجيه الطلبات الواردة متعددة الجولات إلى عقد العمال التي تخزن بالفعل السياق المخزن المؤقت ذي الصلة.
- تقييم التكميم منخفض الدقة: قياس مسارات التنفيذ ذات الدقة المختلطة وNVFP4 عبر النماذج المستهدفة لتقليل بصمة الذاكرة مع التحقق من استقرار استدلال المخرجات.
قائمة التحقق التشغيلية والاقتصادية
- مراقبة الإنتاجية لكل ميجاوات: تتبع الرموز المستدامة لكل ميجاوات عبر أحمال العمل الحية بدلاً من الاعتماد حصرًا على مقاييس زمن انتقال الطلب الفردي المعزول.
- مراجعة اقتصاديات وحدة الرموز: قياس تكلفة البنية التحتية الشاملة لكل مليون رمز عبر مسارات الوكيل متعددة الخطوات للحفاظ على هوامش ربح مستدامة.
- توصيف وقت استجابة الرمز الأول (TTFT): مراقبة زمن انتقال الاستجابة الأولية أثناء مراحل الإعداد طويلة السياق لضمان عدم المساس بتجربة المستخدم التفاعلية من خلال التجميع عالي الإنتاجية.
يتيح تبني هذه المنهجيات التشغيلية للفرق الهندسية نشر أنظمة وكيلة استجابة طويلة الأمد مع الحفاظ على حوكمة صارمة لتكلفة البنية التحتية.
الأسئلة الشائعة (FAQ)
لماذا تستهلك أحمال عمل الذكاء الاصطناعي الوكيل رموزًا أكثر بـ 15 مرة من استعلامات روبوتات الدردشة القياسية؟
كيف يعمل التقديم المفكك على تحسين إنتاجية مصنع الذكاء الاصطناعي لكل ميجاوات؟
ما الفرق بين مقاييس كفاءة Blackwell GB300 NVL72 وVera Rubin NVL72؟
الوجبات الرئيسية للفرق الهندسية
تسلط التطورات في الأجهزة المُثبتة عبر منصة Vera Rubin NVL72 الضوء على تحول أساسي في البنية التحتية للحوسبة: تتطلب عمليات الذكاء الاصطناعي القابلة للتطوير تصميماً مشتركاً شاملاً عبر السيليكون، وبنيات الذاكرة، وبيئات تشغيل البرمجيات. مع أصبح الوكلاء المستقلون متعددة الخطوات الواجهة القياسية لبرمجيات المؤسسات، يتم استبدال نماذج التقديم المتراصة التقليدية بأنظمة مفككة تتمحور حول الذاكرة.
بالنسبة لمهندسي البنية التحتية وقادة الهندسة، يتطلب التنقل في هذا العصر عالي الإنتاجية تبني مبادئ الأنظمة غير المقترنة عبر خطوط أنابيب مراكز البيانات. من خلال تطبيق التقديم المفكك، والتخزين المؤقت للسياق الموزع، وتوجيه أحمال العمل الذكي، يمكن للمنظمات بناء بنيات حوسبة مرنة قادرة على توسيع نطاق ذكاء الوكيل بكفاءة ضمن ميزانيات طاقة المرافق الثابتة.
Share this article



