NVIDIA Melancarkan Rubin NVL72? Mengapa Kecekapan Tenaga Melonjak

opoinstall
2026-08-25
5 min read

NVIDIA Melancarkan Rubin NVL72? Data prestasi baharu atas silikon mendedahkan bahawa platform Vera Rubin NVL72 menyampaikan daya pemprosesan sehingga 30x ganda lebih tinggi setiap megawatt dan kos token 35x ganda lebih rendah untuk beban kerja AI agensi berbanding dengan GB300 NVL72 di bawah konfigurasi AgentX yang diuji, menetapkan garis asas kecekapan perkakasan baharu untuk kilang AI yang terhad kuasa. Apabila agen perisian autonomi beralih daripada gesaan satu pusingan eksperimen kepada saluran paip pengeluaran pelbagai langkah, permintaan pengkomputeran berkembang dengan pesat. Data penggunaan OpenRouter yang dipetik oleh NVIDIA menunjukkan bahawa satu permintaan agensi memakan kira-kira 15 kali ganda lebih banyak token berbanding permintaan sembang biasa kerana agen berulang kali membuat query pangkalan data, mendapatkan semula dokumen luaran, melahirkan sub-agen, dan mengekalkan memori konteks panjang. Untuk mengekalkan daya pemprosesan ketumpatan tinggi ini dalam sampul kuasa pusat data tetap, seni bina pelayan beralih ke arah reka bentuk bersama perkakasan-perisian yang ekstrem.

Penyelarasan Semula Industri Teras & Pecahan Berita: Vera Rubin NVL72 untuk Skala AI Agensi

Imbasan Pantas

  • Data prestasi atas silikon yang dikeluarkan pada 24 Ogos 2026, menunjukkan Vera Rubin NVL72 menyampaikan daya pemprosesan sehingga 30x ganda lebih tinggi setiap megawatt berbanding GB300 NVL72 pada beban kerja pengekodan agensi, dengan keputusan diukur oleh NVIDIA menggunakan beban kerja SemiAnalysis AgentX dan kini menunggu semakan SemiAnalysis.
  • Agen autonomi pelbagai langkah menggunakan kira-kira 15 kali ganda lebih banyak token daripada interaksi chatbot standard, menjadikan ketersediaan kuasa, daya pemprosesan setiap megawatt, dan ekonomi token sebagai kekangan yang semakin penting untuk infrastruktur AI.
  • Platform ini menggabungkan penyajian teragih, caching KV teragih, penghalaan sedar KV, ketepatan NVFP4, rangkaian skala rak, dan reka bentuk bersama perkakasan-perisian yang lebih luas, menyumbang kepada pengurangan kos token yang dilaporkan oleh NVIDIA sehingga 35x ganda berbanding GB300 NVL72 di bawah konfigurasi AgentX yang diuji.

Peralihan daripada antara muka chatbot asas kepada aliran kerja agensi autonomi sedang memacu transformasi struktur dalam kejuruteraan pusat data. Interaksi satu pusingan standard biasanya beroperasi dalam sempadan input-output ringkas antara 1,000 dan 8,000 token. Sebaliknya, agen autonomi melaksanakan gelung penaakulan berulang di mana setiap pemanggilan alat, pengambilan pangkalan data, dan output pertengahan terkumpul ke dalam tetingkap konteks langkah berikutnya. Konteks pengkompaunan ini mewujudkan lonjakan pengkomputeran yang tidak teratur diikuti oleh tempoh latensi rangkaian, membebankan pelayan inferens tradisional yang direka bentuk untuk beban kerja tanya-dan-balas statik.

Untuk menilai prestasi infrastruktur di bawah syarat realistik ini, penanda aras perkakasan beralih daripada penilaian urutan panjang tetap kepada ulangan sesi dinamik. Menggunakan suite penanda aras SemiAnalysis AgentX, NVIDIA mengukur daya pemprosesan sistem yang mampan merentasi trajektori pengekodan gaya pengeluaran yang diulang daripada model terkemuka, termasuk DeepSeek V4 Pro, Kimi K3, dan GLM-5.3. Sesi yang direkodkan mengekalkan pertumbuhan konteks yang realistik, selang panggilan alat, dan corak kelahiran sub-agen untuk menguji betapa cekap perkakasan menukar kuasa mentah kepada output yang boleh digunakan, seperti yang diperincikan dalam pengumuman teknikal korporat NVIDIA. Keputusan Vera Rubin mencerminkan pengukuran awal ini dan kini sedang menunggu semakan SemiAnalysis.

Visual teknikal NVIDIA menggambarkan metrik prestasi AI agensi dan kecekapan inferens

Lonjakan kecekapan yang diukur merentasi platform Vera Rubin menunjukkan peralihan besar dalam cara platform pengkomputeran dipercepatkan dinilai. Dalam kilang AI yang terhad kuasa, daya pemprosesan setiap megawatt menentukan jumlah kapasiti operasi, manakala kos setiap juta token mengawal margin kasar. Keputusan penanda aras menunjukkan bahawa Blackwell GB300 NVL72 menyampaikan daya pemprosesan sehingga 15x ganda lebih tinggi setiap megawatt dan kos token 10x ganda lebih rendah berbanding sistem Hopper H200. Seni bina Vera Rubin melanjutkan keluk kecekapan ini dengan lebih jauh, mencapai daya pemprosesan sehingga 30x ganda lebih tinggi setiap megawatt berbanding GB300 pada sasaran penyajian interaktif sebanyak 160 token sesaat setiap pengguna pada beban kerja DeepSeek V4 Pro, seperti yang dilaporkan dalam laporan Blog Pembangun NVIDIA.

Carta penanda aras membandingkan inferens urutan tetap tradisional dengan keperluan beban kerja agensi yang kompleks

Ketidakserasian Seni Bina Di Sebalik Tabir: Penyajian Teragih dan Penghalaan KV-Cache

Keuntungan prestasi seni bina Rubin terbit daripada penyelesaian ketidakpadanan fizikal asas antara peringkat prapengisian dan penyahkodan bagi inferens model bahasa besar. Fasa prapengisian memproses gesaan yang masuk dan terikat dengan pengkomputeran, mendapat manfaat daripada daya pemprosesan aritmetik selari yang tinggi. Sebaliknya, fasa penyahkodan menjana token secara berurutan dan biasanya lebih sensitif terhadap lebar jalur memori, terutamanya pada saiz kelompok interaktif yang lebih kecil, kerana penjanaan token berulang kali mengakses wajaran model dan keadaan KV.

Untuk menghilangkan geseran operasi ini, seni bina kilang AI moden melaksanakan penyajian teragih. Teknik ini memisahkan pelaksanaan prapengisian dan penyahkodan merentasi kumpulan pekerja berskala bebas, membolehkan setiap peringkat berskala secara bebas dan memadankan kadar penjanaan secara dinamik merentasi kluster pelayan.

Pengoptimuman Memori: Caching Teragih dan Domain Skala-Naik NVLink

Dalam sesi agensi yang berjalan lama, pengiraan semula token yang diproses sebelumnya mewujudkan kelembapan pengkomputeran yang besar. Untuk mengekalkan kecekapan, rangka kerja penyajian mengerahkan caching nilai-kunci (KV) teragih merentasi domain sambungan berkelajuan tinggi, membolehkan GPU berkongsi dan menggunakan semula konteks tanpa pengiraan prapengisian yang berlebihan.

Gambar rajah di bawah menggambarkan pemisahan seni bina antara pemprosesan prapengisian teragih dan penjanaan penyahkodan sedar KV:

[Permintaan Agen Pelbagai Langkah Masuk (Konteks Kumulatif)]
                           │
                           ▼
    [ Kumpulan Pekerja Prapengisian Teragih ] ──> Pengekodan Konteks Dipercepatkan
                           │
                           ▼ (Pemindahan Keadaan Konteks melalui Fabrik Lebar Jalur Tinggi)
    [ Penghantar Penghalaan Sedar KV (Dynamo) ] ──> Memadankan Nod Pekerja Ter-cache
                           │
                           ▼
    [ Kumpulan Pekerja Penyahkodan Teragih ]  ──> Penjanaan Token Latensi Rendah

Untuk menyokong teknik memori teragih ini, sistem ini menggunakan penukaran sambungan generasi keenam yang menyampaikan kadar paket yang jauh lebih tinggi dan latensi yang lebih rendah daripada rangkaian siap guna. Merentasi kernel CUDA yang dioptimumkan, perpustakaan masa jalan seperti TensorRT-LLM, and rangka kerja koordinasi seperti NVIDIA Dynamo, lapisan penyajian menghala permintaan secara terus ke nod pelaksanaan yang telah pun memegang konteks ter-cache yang berkaitan. NVIDIA menyatakan bahawa teknologi pengurusan kuasa DSX MaxLPS miliknya boleh memperuntukkan sehingga 40% lebih banyak GPU dalam bajet megawatt yang sama, seterusnya memaksimumkan daya pemprosesan pada skala utiliti.

Carta perbandingan daya pemprosesan menunjukkan Vera Rubin NVL72 menyampaikan daya pemprosesan yang lebih tinggi setiap megawatt berbanding GB300 NVL72

Pendekatan bertindan penuh ini menunjukkan prinsip teknikal yang lebih luas: menskalakan beban kerja AI moden memerlukan penyingkiran pengkomputeran berlebihan dan mengoptimumkan pengangkutan memori merentasi setiap lapisan sistem. Dalam kejuruteraan perisian teragih, prinsip kecekapan selari terpakai merentasi saluran paip data berdaya pemprosesan tinggi, di mana seni bina memisahkan penelanan daripada pendamaian keadaan untuk mengelakkan kesesakan pemprosesan.

Carta menunjukkan GB300 NVL72 menyampaikan kecekapan kos token yang lebih baik berbanding perkakasan H200 generasi sebelumnya

Sistem Tersuai & Analisis Perbandingan: Penyajian Monolitik vs. Kilang AI Reka Bentuk Bersama

Apabila seni bina konkurensi tinggi berkembang ke arah pemprosesan teragih di sisi pelayan, pasukan kejuruteraan mesti menilai cara reka bentuk infrastruktur memberi kesan kepada ekonomi unit. Mengerahkan saluran paip agensi gred pengeluaran memerlukan sistem bahagian belakang yang memaksimumkan daya pemprosesan setiap megawatt sambil meminimumkan kos setiap juta token. Organisasi mesti menilai sama ada inkuiri penyajian monolitik tradisional boleh mengekalkan beban kerja agensi atau sama ada seni bina reka bentuk bersama khusus diperlukan.

Penilaian Seni Bina: Penyajian Tradisional vs. Platform Teragih

Mengerahkan inkuiri penyajian monolitik di mana setiap GPU mengendalikan kedua-dua peringkat prapengisian dan penyahkodan membawa kepada kekurangan penggunaan sumber yang teruk semasa pusingan agensi konteks panjang. Walaupun pengerahan monolitik menawarkan persediaan awal yang mudah, ia mengalami kebuluran pengkomputeran semasa fasa penyahkodan dan had kapasiti memori semasa lonjakan prapengisian. Sebaliknya, seni bina kilang AI teragih memisahkan pengekodan konteks daripada penjanaan token secara dinamik, mengekalkan penggunaan yang tinggi merentasi domain pengkomputeran dan memori.

Jadual di bawah menggariskan pertukaran seni bina utama merentasi metodologi penyajian inferens yang berbeza:

Model Seni Bina Strategi Penskalaan Konteks Peruntukan Prapengisian/Penyahkodan Daya Pemprosesan setiap Megawatt Ekonomi Kos Token
Penyajian Nod Tunggal Monolitik Peruntukan Memori Statik Digandingkan Rapat Garis Asas Garis Asas Tinggi Standard
Inferens Berkelompok Digandingkan Kolam Sumber Berkongsi Peruntukan Pekerja Homogen Sederhana (Bergantung Beban Kerja) Kadar Berkelompok Standard
Kilang AI Reka Bentuk Bersama Teragih Penghalaan KV-Cache Teragih Sepenuhnya Teragih & Bebas Sehingga 30x vs GB300 (Dilaporkan) Kos Sehingga 35x Lebih Rendah vs GB300

Peralihan struktur ini mewakili satu bentuk deflasi kos inferens: setiap megawatt kapasiti pusat data tetap boleh menghasilkan kerja agensi yang jauh lebih berguna. Dengan menggabungkan pecutan perkakasan dengan penghalaan beban kerja yang bijak, pengendali boleh mengekalkan prestasi interaktif merentasi tugas yang kompleks dan berhorizon panjang.

Gambaran keseluruhan infrastruktur kilang AI bertindan penuh yang menampilkan rak pelayan pengkomputeran, storan, dan rangkaian

Senarai Semak Kejuruteraan & Jadual Pengesahan: Mengoptimumkan Telemetri Agensi Skala Rak

Untuk menyediakan infrastruktur pusat data dan saluran paip aplikasi untuk beban kerja agensi berdaya pemprosesan tinggi, pasukan teknikal dan operasi harus mewujudkan amalan pengoptimuman yang berstruktur.

Senarai Semak Pelaksanaan Pembangun

  • Pisahkan Prapengisian daripada Pekerja Penyahkodan: Asingkan penelanan konteks yang berat pengkomputeran daripada penjanaan token yang terikat dengan memori kepada kumpulan pekerja yang berskala secara bebas untuk memaksimumkan penggunaan pemproses.
  • Laksanakan Penghalaan Sedar KV-Cache: Konfigurasikan gerbang API dan pengimbang beban untuk menghala permintaan pelbagai pusingan yang masuk ke nod pekerja yang telah pun menyimpan konteks ter-cache yang berkaitan.
  • Nilai Kuantisasi Ketepatan Lebih Rendah: Penanda aras NVFP4 dan laluan pelaksanaan ketepatan campur merentasi model sasaran untuk mengurangkan jejak memori sambil mengesahkan kestabilan penaakulan output.

Senarai Semak Operasi & Ekonomi

  • Pantau Daya Pemprosesan setiap Megawatt: Jejaki token mampan setiap megawatt merentasi beban kerja langsung daripada bergantung sepenuhnya pada penanda aras latensi permintaan tunggal yang terpencil.
  • Audit Ekonomi Unit Token: Ukur jumlah kos infrastruktur setiap juta token merentasi trajektori agen pelbagai langkah untuk mengekalkan margin keuntungan yang mampan.
  • Profil Masa-ke-Token-Pertama (TTFT): Pantau latensi tindak balas awal semasa fasa prapengisian konteks panjang untuk memastikan pembompokan berdaya pemprosesan tinggi tidak menjejaskan pengalaman pengguna interaktif.

Mengguna pakai metodologi operasi ini membolehkan pasukan kejuruteraan mengerahkan sistem agensi yang responsif dan berhorizon panjang sambil mengekalkan tadbir urus kos infrastruktur yang ketat.

Soalan Lazim (FAQ)

Mengapakah beban kerja AI agensi menggunakan 15 kali ganda lebih banyak token berbanding pertanyaan chatbot standard?
Aliran kerja agensi memerlukan penaakulan pelbagai langkah, query pangkalan data berulang, pemanggilan alat, and koordinasi sub-agent. Oleh kerana konteks terkumpul daripada setiap langkah menjadi input untuk pusingan seterusnya, sesi agensi boleh berkembang kepada ratusan ribu token, menggandakan jumlah penggunaan token berbanding interaksi sembang satu pusingan.
Bagaimanakah penyajian teragih meningkatkan daya pemprosesan kilang AI setiap megawatt?
Penyajian teragih memisahkan peringkat prapengisian yang berat pengkomputeran daripada peringkat penyahkodan yang berat lebar jalur memori merentasi nod GPU khusus. Dengan mengoptimumkan setiap kluster perkakasan untuk profil pengkomputerannya yang tertentu dan memadankan kadar penjanaan, seni bina ini menghilangkan kitaran pemproses terbiar dan memaksimumkan kecekapan tenaga.
Apakah perbezaan antara metrik kecekapan Blackwell GB300 NVL72 dan Vera Rubin NVL72?
Walaupun Blackwell GB300 NVL72 menyampaikan daya pemprosesan sehingga 15x ganda lebih tinggi setiap megawatt berbanding seni bina Hopper pada penanda aras agensi, Vera Rubin NVL72 mencapai daya pemprosesan sehingga 30x ganda lebih tinggi setiap megawatt dan mengurangkan kos token sehingga 35x ganda berbanding GB300, menyediakan sempadan kecekapan yang diperluaskan untuk model campuran pakar yang besar.

Pengambilan Utama untuk Pasukan Kejuruteraan

Kemajuan perkakasan yang ditunjukkan merentasi platform Vera Rubin NVL72 menyerlahkan peralihan penting dalam infrastruktur pengkomputeran: operasi AI berskala memerlukan reka bentuk bersama bertindan penuh merentasi silikon, seni bina memori, dan masa jalan perisian. Apabila agen autonomi pelbagai langkah menjadi antara muka standard untuk perisian perusahaan, model penyajian monolitik tradisional digantikan oleh sistem teragih yang berpusatkan memori.

Untuk arkitek infrastruktur and pemimpin kejuruteraan, menavigasi era berdaya pemprosesan tinggi ini memerlukan penggunaan prinsip sistem terpisah merentasi saluran paip pusat data. Dengan melaksanakan penyajian teragih, caching konteks teragih, and penghalaan beban kerja yang bijak, organisasi boleh membina seni bina pengkomputeran yang berdaya tahan yang mampu menskalakan kecerdasan agensi dengan cekap dalam bajet kuasa utiliti tetap.

Share this article