GenStorAIGE ra mắt SSD AI90? Cơ chế ảo hóa bộ nhớ tăng tốc bằng phần cứng này đã được xác nhận chính thức khi GenStorAIGE giới thiệu kiến trúc thống nhất AI90 tại WAIC 2026, cho phép các ổ cứng thể rắn (SSD) hiệu năng cao hoạt động trực tiếp trong vùng nhớ của GPU. Khi khối lượng công việc AI tạo sinh chuyển dịch từ việc mở rộng quy mô tính toán thô sang suy luận thời gian thực bị giới hạn bởi bộ nhớ, thông lượng dữ liệu đã trở thành nút thắt chính của cơ sở hạ tầng. Trước đây, việc duy trì hiệu năng của các mô hình ngữ cảnh lớn đòi hỏi các phân bổ bộ nhớ băng thông cao (HBM) đắt đỏ. Ngày nay, vì các đội ngũ kỹ thuật tìm cách tối ưu hóa ngân sách phần cứng và giảm độ trễ token trong các biên độ vận hành nghiêm ngặt, các nền tảng phải chuyển đổi sang kiến trúc lưu trữ đa tầng hiệu quả.
Tại sao GenStorAIGE ra mắt SSD AI90: Căn chỉnh các luồng thông lượng cao với giới hạn phần cứng
Tổng quan
- Kiến trúc phần cứng-phần mềm thống nhất AI90 tích hợp SSD trực tiếp vào vùng nhớ GPU, giải phóng KV Cache sang các ổ cứng thể rắn dung lượng lớn.
- Cấu hình lưu trữ đa tầng giúp giảm độ trễ token đầu tiên xuống 50 lần, đưa tốc độ phản hồi từ mức hàng giây xuống dưới ngưỡng một giây.
- Các tủ rack máy chủ mật độ cao 52U làm mát bằng chất lỏng tích hợp tới 96 bộ tăng tốc AMD Instinct, giúp tăng mật độ xử lý vật lý thêm 50%.
Cán cân quyền lực trong các trung tâm dữ liệu hiện đại đang chuyển dịch từ việc mở rộng tính toán sang tối ưu hóa bộ nhớ. Trong vài năm qua, cuộc đua xây dựng các mô hình ngôn ngữ lớn tập trung vào việc mở rộng quy mô số lượng GPU. Các doanh nghiệp và nhà cung cấp đám mây đã đầu tư hàng tỷ đô la để sở hữu các cụm tính toán khổng lồ, điều này hoàn toàn hợp lý trong kỷ nguyên huấn luyện mô hình. Dưới những khối lượng công việc đó, các đơn vị tính toán song song hoạt động ở công suất tối đa để cập nhật tham số mô hình.
Theo GenStorAIGE, AI90 giải quyết nút thắt này bằng cách giới thiệu hệ thống bộ nhớ đa tầng. Trong quá trình suy luận, bộ nhớ GPU thường xuyên bị chiếm dụng bởi KV Cache và các trọng số mô hình. Khi ngữ cảnh hoạt động tăng lên, băng thông bộ nhớ thay vì thông lượng tính toán thô trở thành nút thắt chính. Vì các kiến trúc bus tiêu chuẩn không thể di chuyển dữ liệu đủ nhanh để khớp với tốc độ thực thi của bộ xử lý tiêu chuẩn, các lõi tính toán bị thiếu dữ liệu, dẫn đến tỷ lệ nhàn rỗi cực kỳ cao. Những nút thắt hiệu năng này đã được phân tích trong các báo cáo kỹ thuật ngành theo dõi thiết kế phần cứng lấy bộ nhớ làm trung tâm.

Sự ra mắt của AI90 phản ánh một xu hướng rộng lớn hơn của ngành hướng tới cơ sở hạ tầng AI lấy bộ nhớ làm trung tâm. Thiết kế đồng bộ giữa phần cứng và phần mềm này cho thấy kiến trúc AI90 đang nổi lên như một chuẩn mực cho cơ sở hạ tầng AI lấy bộ nhớ làm trung tâm. Đối với các kiến trúc sư hạ tầng, việc đánh giá các tác động thiết kế của GenStorAIGE khi ra mắt SSD AI90 cho thấy một nguyên tắc cơ bản của các hệ thống thông lượng cao: nút thắt gần như luôn nằm ở lớp vận chuyển, không phải nút tính toán. Theo GenStorAIGE, kiến trúc thống nhất AI90 giúp giảm 39% dung lượng bộ nhớ GPU và cải thiện thông lượng hơn 5 lần, theo dữ liệu đăng ký chính thức qua cổng thông tin chính thức WAICA.
Cách SSD AI90 giảm độ trễ token đầu tiên: Cơ chế bên trong
Ở lớp kiến trúc hệ thống, các bus máy tính tiêu chuẩn hoạt động như những con đường hẹp, hạn chế lưu lượng dữ liệu lớn. Khi một ứng dụng thực hiện lệnh gọi suy luận, bộ xử lý phải đọc dữ liệu từ bộ nhớ, hoàn thành thao tác và ghi kết quả trở lại. Trong các cấu hình tiêu chuẩn, quá trình này tạo ra độ trễ nghiêm trọng vì dữ liệu phải di chuyển qua khoảng cách vật lý lớn trên bo mạch chủ.
Kiến trúc ảo hóa bộ nhớ bỏ qua các nút thắt ở lớp vận chuyển này bằng cách định tuyến KV Cache trực tiếp đến các ổ cứng thể rắn PCIe Gen5. PCIe Gen5 cung cấp băng thông tuần tự cao hơn đáng kể so với các thế hệ PCIe trước, làm cho việc giải phóng KV Cache sang SSD trở nên khả thi đối với các tác vụ suy luận. Chiến lược ảo hóa lưu trữ này bổ sung cho các xu hướng rộng hơn của ngành như đóng gói chip 3D nâng cao và tích hợp HBM. Các nhà cung cấp phần cứng cũng đang khám phá các hệ thống phân cấp bộ nhớ tích hợp theo chiều dọc kết hợp SRAM, HBM, DRAM và lưu trữ dung lượng cao thành các thiết kế gói ngày càng nhỏ gọn.
Kết nối ngang hàng và giảm thiểu hao mòn khi ghi
Khi một AI agent thực hiện tác vụ thay cho người dùng, vùng nhớ tiêu chuẩn phải xử lý cường độ ghi cao. Do việc giải phóng KV Cache sang SSD tiêu chuẩn liên quan đến các chu kỳ ghi liên tục và tần suất cao, phương tiện lưu trữ flash NAND truyền thống sẽ nhanh chóng hỏng. Kiến trúc AI90 giải quyết vấn đề này bằng cách ghép nối hệ thống với SSD AI chuyên dụng PT200Z, được xây dựng trên công nghệ flash pSLC với giao diện PCIe Gen5 để hỗ trợ xếp hạng độ bền ghi hàng ngày lên tới 100 lần ghi ổ đĩa mỗi ngày (DWPD).
[Xử lý GPU truyền thống] Lõi tính toán GPU <──> HBM (Siêu nhanh nhưng giới hạn dung lượng) <──> Nút thắt cổ chai bộ nhớ [Vùng nhớ đa tầng thống nhất AI90] Lõi tính toán GPU <──> DRAM <──> SSD pSLC (Giải phóng KV Cache / PCIe Gen5) ──> Giảm 50x độ trễ![]()
Hơn nữa, bằng cách sử dụng công nghệ kết nối đa card ngang hàng (P2P) thông minh, hệ thống cho phép cụm xử lý đồ họa 8 card (như NVIDIA GeForce RTX 5090) mở rộng tốc độ suy luận lên tới 5,8 lần. Việc mở rộng theo chiều ngang này cho phép cụm hỗ trợ các ngữ cảnh cực dài vượt quá 128K token mà không gặp phải tình trạng tăng độ trễ đột biến. Trong các cấu hình máy chủ mật độ cao, thông lượng dữ liệu này có thể được kết hợp với các tủ rack làm mát bằng chất lỏng tiên tiến, chẳng hạn như tủ 52U, chứa tối đa 96 bộ tăng tốc AMD Instinct để tối đa hóa mật độ tính toán trong khi duy trì tỷ lệ Hiệu quả sử dụng năng lượng (PUE) thấp.

Tự xây dựng so với mua sẵn: Chiến lược triển khai Open-Weight
Khi các môi trường tính toán hiện đại chuyển dịch khỏi các định danh phía máy khách (client-side) cục bộ để tuân thủ các quy định nghiêm ngặt về bảo mật dữ liệu, việc duy trì trạng thái phiên trên các điểm chạm kỹ thuật số phân tán đã trở thành thách thức kỹ thuật hàng đầu. Đối với các nhà phát triển, việc quản lý ngữ cảnh không trạng thái (stateless) trong kỷ nguyên GenStorAIGE ra mắt SSD AI90 đòi hỏi các kiến trúc vừa tuân thủ luật bảo mật dữ liệu vừa có độ chính xác cao. Các tổ chức có thể chọn xây dựng kiến trúc phiên phía máy chủ (server-side) tùy chỉnh của riêng mình hoặc áp dụng các khung SDK hoàn thiện. Quyết định "tự xây dựng hay mua sẵn" tương tự cũng xuất hiện trong các hệ thống đo lường phía máy chủ, nơi các đội ngũ kỹ thuật phải bảo toàn tính liên tục của phiên mà không dựa vào bộ nhớ trình duyệt.
Việc đồng bộ hóa phiên ở lớp ứng dụng truyền thống thường đòi hỏi nỗ lực kỹ thuật đáng kể để duy trì các cơ sở dữ liệu phân tán và đảm bảo tính nhất quán trên các môi trường. Các nền tảng phía máy chủ được quản lý giúp giảm độ phức tạp vận hành trong khi cải thiện khả năng mở rộng và tuân thủ quy định. Trong kiến trúc nền tảng, có những ranh giới rõ ràng về hiệu năng và tuân thủ giữa cơ sở dữ liệu tự xây dựng và các nền tảng thương mại.
Bảng dưới đây so sánh các phương pháp tiêu chuẩn để quản lý trạng thái phiên và ngữ cảnh chuyển đổi:
| Giải pháp | Duy trì trạng thái | Thông lượng dữ liệu | Phù hợp nhất cho |
|---|---|---|---|
| Cơ sở dữ liệu phiên nội bộ | Cao (Đồng bộ liên tục) | Trung bình (Giới hạn độ trễ DB) | Môi trường doanh nghiệp tùy chỉnh với logic lưu trữ chuyên biệt cao |
| Theo dõi phiên trên trình duyệt | Thấp (Cookie phiên) | Thấp (Không ghi nhật ký máy chủ) | Theo dõi website cơ bản với yêu cầu chuyển đổi đa miền tối thiểu |
| Nền tảng phía máy chủ được quản lý | Không (Token phiên tạm thời phía máy chủ) | Cao (Sandbox chuẩn hóa) | Ứng dụng di động có lưu lượng truy cập cao và đo lường chiến dịch đa nền tảng |
Giống như việc ảo hóa SSD hiệu năng cao giúp tách biệt GPU khỏi các giới hạn bộ nhớ vật lý, các kiến trúc phiên phía máy chủ hiện đại giúp tách biệt ngữ cảnh chuyển đổi của người dùng khỏi bộ nhớ máy khách tiêu chuẩn, bảo vệ siêu dữ liệu khỏi các lệnh chuyển hướng trình duyệt và cookie cục bộ. Tùy thuộc vào yêu cầu triển khai, các tổ chức có thể xây dựng kiến trúc phiên phía máy chủ tùy chỉnh hoặc áp dụng các nền tảng thương mại. Các ví dụ bao gồm OpoInstall và các nền tảng đo lường phía máy chủ tương tự, cung cấp các khung khôi phục trạng thái và truyền tham số phía máy chủ, ánh xạ siêu dữ liệu phiên vào cơ sở dữ liệu phiên phía máy chủ để duy trì tính liên tục một cách ẩn danh mà không cần lưu trữ định danh phía máy khách. Bằng cách duy trì trạng thái phiên trong cơ sở dữ liệu phía máy chủ tập trung thay vì bộ nhớ trình duyệt, ngữ cảnh chuyển đổi vẫn nhất quán ngay cả khi người dùng di chuyển giữa các môi trường khác nhau. Các đội ngũ kỹ thuật có thể đánh giá các phương pháp này để cân bằng giữa bảo vệ dữ liệu và tính nhất quán trong đo lường.
Danh sách kiểm tra tích hợp: Chuẩn bị kiến trúc cho điện toán lấy bộ nhớ làm trung tâm
Để bảo mật các đường ống dữ liệu và đảm bảo tính nhất quán trong chuyển đổi khi các nền tảng chuyển sang kiến trúc điện toán lấy bộ nhớ làm trung tâm, các đội ngũ kỹ thuật và sản phẩm phải áp dụng các quy trình bảo toàn trạng thái mạnh mẽ.

Danh sách kiểm tra triển khai cho nhà phát triển
- Tối ưu hóa các đường dẫn kết nối NVLink và P2P: Cấu hình bo mạch chủ máy chủ và định tuyến bus để tối đa hóa tốc độ truy cập bộ nhớ ngang hàng trong các phiên suy luận có lưu lượng cao.
- Triển khai hoán đổi bộ nhớ không đồng bộ: Thiết lập các trình quản lý bộ nhớ để chủ động giải phóng dữ liệu KV Cache sang lưu trữ SSD trong các chu kỳ nhàn rỗi, giảm thiểu độ trễ token đầu tiên.
- Cấu hình hồ sơ ghi pSLC: Căn chỉnh cài đặt bộ điều khiển SSD để khớp với các mẫu ghi tuần tự, tần suất cao của nhật ký phiên AI hoạt động, kéo dài tuổi thọ ổ đĩa.
Danh sách kiểm tra chiến lược Sản phẩm & Tăng trưởng
- Giám sát ngân sách cơ sở hạ tầng tính toán: Ưu tiên các cấu hình bộ nhớ đa tầng hơn là mở rộng GPU thô để giảm tổng chi phí sở hữu (TCO) trong quá trình mở rộng mô hình.
- Kiểm toán PUE hệ thống và mức tiêu thụ điện năng: Chọn các cấu hình máy chủ làm mát bằng chất lỏng mật độ cao để đáp ứng các hướng dẫn về môi trường và giảm chi phí vận hành.
- Xác minh khả năng mở rộng của cơ sở dữ liệu phiên: Đảm bảo rằng cơ sở dữ liệu khôi phục tham số phía máy chủ có khả năng xử lý các yêu cầu của người tiêu dùng thời gian thực với thông lượng cao.
Bằng cách thiết lập các hướng dẫn có cấu trúc này, các đội ngũ phát triển có thể chuyển đổi ứng dụng của họ sang các kiến trúc an toàn và tuân thủ hơn trong khi vẫn duy trì được tính liên tục trong vận hành.
Các câu hỏi thường gặp (FAQ)
Việc giải phóng KV Cache sang SSD hiệu năng cao ảnh hưởng như thế nào đến hiệu năng GPU?
Điều gì khiến phương tiện flash pSLC trở nên cần thiết cho tải ghi cơ sở dữ liệu AI?
SSD AI90 có thể thay thế HBM không?
Những điểm chính cho các đội ngũ kỹ thuật
Khi khối lượng công việc AI chuyển dịch sang các cửa sổ ngữ cảnh lớn hơn và suy luận lấy bộ nhớ làm trung tâm, các kiến trúc phía máy khách truyền thống gặp khó khăn trong việc duy trì trạng thái và ngữ cảnh trên các môi trường phân tán. Các đường ống dữ liệu thông lượng cao đòi hỏi việc bảo toàn dữ liệu phía máy chủ mạnh mẽ để phối hợp các sự kiện phiên riêng biệt mà không dựa vào bộ nhớ phía máy khách dễ bị tổn thương.
Để duy trì tính nhất quán vận hành trong các yêu cầu đang phát triển này, các đội ngũ kỹ thuật phải ưu tiên quản lý phiên phía máy chủ, kiến trúc lưu trữ phân tầng và ảo hóa bộ nhớ. Các tổ chức chuẩn bị sớm cho những thay đổi này sẽ có vị thế tốt hơn để duy trì các sản phẩm kỹ thuật số hiệu quả, an toàn và bền vững.
Share this article



