Etched giao rack suy luận đầu tiên khi định giá tăng vọt lên 21 tỷ USD

opoinstall
2026-08-20
5 min read

Etched đã bắt đầu xuất货 phần cứng suy luận AI của mình chưa? Công ty khởi nghiệp này cho biết họ đã giao rack đầu tiên cho Jane Street đồng thời huy động được 700 triệu USD với mức định giá 21 tỷ USD. Khi các tác vụ suy luận mở rộng quy mô, băng thông bộ nhớ, độ trễ kết nối liên thông, khả năng cấp nguồn và mức sử dụng tính toán liên tục có thể trở nên quan trọng không kém thông lượng tính toán đỉnh. Các bộ xử lý đồ họa (GPU) truyền thống được thiết kế để xử lý các tác vụ có tính song song cao. Tuy nhiên, quá trình tạo tự hồi quy liên tục di chuyển trọng số mô hình, dữ liệu bộ nhớ đệm KV và trạng thái trung gian qua hệ thống phân cấp bộ nhớ, với các mẫu truy cập thay đổi theo kiến trúc mô hình và cấu hình phục vụ.

Tại sao Rack Đầu tiên của Etched Lại Quan trọng đối với Kinh tế Suy luận AI

Tổng quan nhanh

  • Etched đã hoàn thành vòng gọi vốn trị giá 700 triệu USD do Jane Street dẫn dắt, làm tăng gấp đôi mức định giá trên giấy tờ lên 21 tỷ USD chỉ trong vòng một tháng.
  • Công ty đã giao rack suy luận đầu tiên cho Jane Street, đánh dấu cột mốc quan trọng khi gã khổng lồ giao dịch định lượng bắt đầu triển khai phần cứng này vào các tác vụ của mình.
  • Etched đã đảm bảo hơn 1 tỷ USD hợp đồng khách hàng trên các công ty AI công cộng và tư nhân, cung cấp tín hiệu ban đầu về nhu cầu của thị trường.

Sự phát triển nhanh chóng của AI tạo sinh đã làm gia tăng nhu cầu về cơ sở hạ tầng điện toán hiệu năng cao. Trong kỷ nguyên huấn luyện ban đầu, các bộ xử lý đồ họa tiêu chuẩn rất hiệu quả vì việc huấn luyện mô hình dựa vào các phép tính lan truyền ngược liên tục. Các tác vụ huấn luyện thường có thể bộc lộ tính song song tính toán nhiều hơn quá trình giải mã tự hồi quy, khiến GPU đặc biệt phù hợp cho việc tính toán ma trận quy mô lớn.

Tuy nhiên, khi các ứng dụng chuyển đổi sang kỷ nguyên suy luận, các yêu cầu kỹ thuật đã thay đổi. Không giống như huấn luyện, suy luận không liên tục cập nhật trọng số mô hình; hiệu năng phục vụ thay vào đó phụ thuộc rất nhiều vào việc di chuyển và xử lý trạng thái mô hình một cách hiệu quả dưới các ràng buộc về độ trễ và thông lượng. Tùy thuộc vào đặc điểm của tác vụ, băng thông bộ nhớ và độ trễ kết nối liên thông có thể khiến tài nguyên tính toán bị sử dụng dưới mức tối ưu ngay cả khi thông lượng tính toán đỉnh ở mức cao. Etched lập luận rằng thông lượng suy luận liên tục trên các bộ tăng tốc AI hiện tại vẫn có thể thấp hơn đáng kể so với mức FLOPs đỉnh do các ràng buộc về nhiệt độ, bộ nhớ và kết nối giới hạn mức sử dụng.

Cụm suy luận tiên tiến được thiết kế để giúp suy luận AI quy mô lớn nhanh hơn và tiết kiệm chi phí hơn

Những ràng buộc này giúp giải thích lý do tại sao phần cứng suy luận chuyên dụng đang thu hút đầu tư. Etched đang theo đuổi một hệ thống suy luận được đồng thiết kế theo chiều dọc bao gồm silicon, rack, bộ nhớ, kết nối liên thông, phần mềm và hoạt động sản xuất. Mặc dù công ty ban đầu gắn liền với thiết kế silicon chuyên dụng cho Transformer, các hệ thống hiện tại của công ty được thiết kế để hỗ trợ một loạt các kiến trúc mô hình tiên tiến rộng lớn hơn, bao gồm các mô hình hỗn hợp chuyên gia (MoE) và, theo các giám đốc điều hành công ty, các kiến trúc phi Transformer như Mamba. Bằng cách đồng thiết kế toàn bộ ngăn xếp thực thi, phần cứng tùy chỉnh hướng tới mục tiêu giảm chi phí vận hành chung. Đánh đổi là rõ ràng: phần cứng tùy chỉnh thường ít linh hoạt hơn các nền tảng GPU đa năng đối với các tác vụ nằm ngoài miền suy luận mục tiêu của nó. Việc triển khai của Jane Street cung cấp một tín hiệu ban đầu về niềm tin của khách hàng đối với kiến trúc của Etched, mặc dù dữ liệu công khai chưa xác lập được hiệu năng ở quy mô sản xuất hoặc lợi thế chi phí của nó so với các hệ thống GPU hàng đầu, như được thảo luận trong bản tin của TechCrunch về vòng gọi vốn.

Cơ chế Hoạt động Bên trong: Suy luận Điện áp Thấp và Bộ nhớ Quy mô Cụm

Ở quy mô rack, các hệ thống con bộ nhớ và kết nối liên thông mở rộng quy mô có thể hạn chế tốc độ di chuyển trạng thái mô hình giữa bộ nhớ và tài nguyên tính toán. Khi một ứng dụng thực hiện lệnh gọi suy luận, bộ xử lý phải đọc dữ liệu từ bộ nhớ, hoàn thành thao tác và ghi kết quả trở lại. Trong các cấu hình tiêu chuẩn, các hoạt động truyền dữ liệu này có thể gây ra độ trễ và áp lực băng thông trên toàn bộ hệ thống phân cấp bộ nhớ và kết nối liên thông mở rộng.

Để giải quyết các nút thắt cổ chai suy luận này, Etched kết hợp hai phương pháp kiến trúc bổ sung cho các tác vụ thông lượng cao và độ trễ thấp:

Suy luận Điện áp Thấp (LVI) và Bộ nhớ Quy mô Cụm (CSM)

  • Suy luận Điện áp Thấp (LVI): Etched định vị LVI chủ yếu xoay quanh suy luận thông lượng cao và mô tả nó trong bối cảnh các tác vụ đòi hỏi nhiều tiền nạp. Etched cho biết các khối toán học điện áp thấp hơn cho phép mật độ tính toán cao hơn đáng kể trong giới hạn năng lượng và nhiệt độ có sẵn, đồng thời giảm thiểu mức độ phơi bày trước các ràng buộc về năng lượng và nhiệt độ.
  • Bộ nhớ Quy mô Cụm (CSM): CSM nhắm đến việc truy cập bộ nhớ độ trễ thấp và được thiết kế để giải quyết các nút thắt cổ chai khi giải mã. Etched lập luận rằng các hệ thống AI dựa trên HBM ngày nay phải vật lộn để đạt được độ trễ giải mã cấp độ SRAM do các nút thắt cổ chai ở hệ thống con bộ nhớ và kết nối liên thông. CSM giải quyết vấn đề này bằng cách kết nối nhiều chip thông qua một kết nối băng thông cao độc quyền, tạo ra một nhóm bộ nhớ dùng chung, độ trễ thấp trên toàn miền mở rộng.

Một sơ đồ ánh xạ đơn giản dựa trên mô tả của Etched về các tác vụ tiền nạp và giải mã có thể được biểu diễn như sau:

[Tác vụ Thông lượng Cao / Nặng tiền nạp]
                     │
                     ▼
       [Suy luận Điện áp Thấp — LVI]


[Tác vụ Độ trễ Thấp / Nặng giải mã]
                     │
                     ▼
       [Bộ nhớ Quy mô Cụm — CSM]

Bằng cách đồng thiết kế tính toán, bộ nhớ và kết nối liên thông, Etched nhằm mục đích cải thiện mức sử dụng suy luận liên tục. Cùng với nhau, các phương pháp này nhắm đến các ràng buộc khác nhau về tính toán, bộ nhớ và kết nối liên thông trên các tác vụ suy luận.

Kiến trúc bo mạch chủ và bố cục tấm silicon được thiết kế để xử lý mạng thần kinh tăng tốc

ASIC Chuyên dụng so với GPU Đa năng: Đánh giá Sự đánh đổi Chuyên môn hóa

Khi các môi trường điện toán hiện đại chuyển dịch sang các nền tảng phần cứng thay thế, các nhà phát triển phải đánh giá lại cách họ quản lý các ngăn xếp thực thi và tác vụ tính toán. Quá trình chuyển đổi từ GPU đa năng sang mạch tích hợp dành riêng cho ứng dụng (ASIC) thể hiện một lựa chọn chiến lược cơ bản. Các nhóm kỹ thuật phải cân nhắc giữa những lợi thế tiềm năng về hiệu suất của phần cứng chuyên dụng với rủi ro hệ thống của việc bị khóa chân phần mềm và các ranh giới kiến trúc cứng nhắc.

Đánh giá Kiến trúc: ASIC Tùy chỉnh so với GPU Đa năng

Việc phát triển một ASIC đòi hỏi nguồn lực kỹ thuật ban đầu đáng kể, các thỏa thuận sản xuất dài hạn và một cấu hình tác vụ ổn định, dễ dự đoán. Phương pháp này có thể cải thiện hiệu suất trên mỗi token và hiệu quả chi phí khi đặc điểm tác vụ bám sát với phần cứng, nhưng hạn chế khả năng thích ứng của nền tảng nếu các kiến trúc mạng thần kinh cơ bản trải qua một sự thay đổi đột ngột. Ngược lại, GPU hưởng lợi từ hệ sinh thái phần mềm trưởng thành và thường mang lại sự linh hoạt lớn hơn khi các kiến trúc mô hình tiến hóa, mặc dù các ASIC chuyên dụng theo tác vụ có thể mang lại hiệu quả cao hơn khi tác vụ khớp chặt với kiến trúc của chúng.

Bảng dưới đây phác thảo những đánh đổi cốt lõi giữa ASIC chuyên dụng và GPU đa năng:

Chiều kích ASIC Chuyên dụng GPU Đa năng
Tính linh hoạt của tác vụ Thấp hơn Cao hơn
Hệ sinh thái phần mềm Chuyên biệt hơn Trưởng thành (ví dụ: CUDA)
Tối ưu hóa suy luận Tiềm năng cao Rộng/chung
Rủi ro tập trung khi triển khai Phụ thuộc vào tác vụ/nhà cung cấp cao hơn Hệ sinh thái rộng hơn nhưng vẫn phụ thuộc nhà cung cấp
Kinh tế quy mô Phụ thuộc vào độ phù hợp tác vụ và mức sử dụng Đã được thiết lập
Tính linh hoạt khi nâng cấp Thấp hơn Cao hơn

Việc đánh giá những đánh đổi phần cứng này là rất quan trọng khi các tổ chức mở rộng quy mô các cụm triển khai hoạt động của họ. Mặc dù GPU đa năng vẫn là mặc định cho nghiên cứu tiêu chuẩn và thử nghiệm đa mô hình, các ASIC chuyên dụng ngày càng hấp dẫn đối với các tác vụ sản xuất có dung lượng lớn, được xác định rõ ràng, nơi việc giảm thiểu độ trễ là mục tiêu vận hành chính.

Danh sách kiểm tra Tích hợp: Cách Các Nhóm Kỹ thuật Chuẩn bị cho Đồng thiết kế Phần cứng - Phần mềm

Để duy trì sự ổn định thực thi và hiệu năng có thể dự đoán khi các trung tâm dữ liệu áp dụng phần cứng suy luận chuyên dụng, các nhóm kỹ thuật và sản phẩm phải áp dụng các quy trình làm việc đồng thiết kế mạnh mẽ.

Danh sách kiểm tra Triển khai dành cho Nhà phát triển

  • Lập hồ sơ Yêu cầu Bộ nhớ của Mô hình và Bộ nhớ đệm KV: Đo lường trọng số mô hình, sự phát triển của bộ nhớ đệm KV, bộ nhớ kích hoạt và độ nhạy kích thước lô dưới lưu lượng sản xuất.
  • Đánh giá Khả năng tương thích của Kiến trúc Mô hình: Xác minh rằng các mạng thần kinh sản xuất của bạn phù hợp với các toán tử toán học cấp phần cứng được hỗ trợ bởi ASIC.
  • Đánh giá Độ trễ Thực thi Cốt lõi: Lập hồ sơ các giai đoạn tiền nạp và giải mã riêng biệt dưới các phân phối lô thực tế để xác định các nút thắt tiềm năng trong đường ống.

Danh sách kiểm tra Sản phẩm & Chiến lược

  • Đánh giá Tính ổn định của Tác vụ Trước khi Chuyên môn hóa Phần cứng: Xác định tần suất thay đổi của các kiến trúc mô hình sản xuất trước khi cam kết chuyển sang phần cứng chuyên dụng hơn.
  • Kiểm toán Kinh tế Suy luận: Đánh giá thông lượng trên mỗi đô la và trên mỗi watt để biện minh cho chi phí chuyển đổi khi áp dụng các ngăn xếp phần cứng chuyên dụng.
  • Xác minh Khả năng Mở rộng của Hệ thống: Đảm bảo rằng kế hoạch triển khai phần cứng của bạn tính đến thời gian giao hàng nguyên liệu thô và các hạn chế về nguồn cung đóng gói tiên tiến.

Bằng cách thiết lập các hướng dẫn có cấu trúc này, các nhóm phát triển có thể chuyển đổi các ứng dụng của họ sang các cấu hình suy luận đáng tin cậy và hiệu quả hơn đồng thời duy trì tính liên tục trong vận hành.

Các câu hỏi thường gặp (FAQ)

Khi nào một ASIC suy luận chuyên dụng có thể vượt trội hơn một GPU đa năng?
Một bộ tăng tốc chuyên dụng có thể cải thiện hiệu quả khi kiến trúc của nó khớp chặt với một tác vụ ổn định. GPU vẫn giữ nguyên các lợi thế về khả năng lập trình, tính trưởng thành của hệ sinh thái phần mềm và hỗ trợ cho các tác vụ hoặc kiến trúc mô hình thay đổi thường xuyên.
Suy luận Điện圧 Thấp và Bộ nhớ Quy mô Cụm giải quyết các nút thắt tiền nạp và giải mã như thế nào?
Suy luận Điện áp Thấp xử lý giai đoạn tiền nạp ở điện áp thấp hơn, cải thiện mật độ tính toán trong giới hạn nhiệt độ tiêu chuẩn. Bộ nhớ Quy mô Cụm giải quyết nút thắt giải mã bằng cách kết nối nhiều chip thông qua kết nối băng thông cao, thiết lập một nhóm bộ nhớ dùng chung, độ trễ thấp giúp tối ưu hóa hiệu quả truy cập bộ nhớ trong quá trình tạo token.
Rủi ro kinh doanh lớn nhất khi áp dụng phần cứng suy luận chuyên dụng là gì?
Các hệ thống chuyên dụng có thể cải thiện mặt kinh tế khi các tác vụ phù hợp với kiến trúc, nhưng người mua phải gánh chịu các rủi ro về sự tập trung nhà cung cấp, tính di động của phần mềm, chuỗi cung ứng và sự tiến hóa của tác vụ. GPU vẫn giữ lợi thế về tính trưởng thành của hệ sinh thái và khả năng lập trình rộng rãi.

Điểm mấu chốt dành cho các Nhóm Kỹ thuật

Lô hàng rack đầu tiên của Etched mang lại cho công ty thứ mà mức định giá 21 tỷ USD trước đây còn thiếu: một ca triển khai thực tế cho khách hàng. Việc Jane Street áp dụng sớm và hơn 1 tỷ USD hợp đồng được báo cáo củng cố thêm trường hợp nhu cầu, nhưng các hợp đồng và thử nghiệm ban đầu không giống như kinh tế quy mô lớn đã được chứng minh.

Khoản đặt cược kỹ thuật này rộng hơn một con chip đơn lẻ. Etched đang đồng thiết kế silicon, bộ nhớ, kết nối liên thông, rack và phần mềm xoay quanh các tác vụ suy luận, sử dụng LVI cho hoạt động thông lượng cao và CSM để truy cập bộ nhớ độ trễ thấp. Đối với người mua, câu hỏi trung tâm là liệu những mức tăng hiệu quả đó có thể vượt qua sự linh hoạt, tính trưởng thành của hệ sinh thái, khả năng chống chịu của chuỗi cung ứng và lộ trình nâng cấp do GPU đa năng cung cấp hay không.

Tài liệu tham khảo

  1. Etched. From Zero to One: Shipped First Customer Delivery. https://www.etched.com/progress/from-zero-to-one

  2. Reuters. AI chip startup Etched valued at $21 billion in latest funding round. https://www.reuters.com/technology/ai-chip-startup-etched-valued-21-billion-latest-funding-round-2026-08-18/

  3. TechCrunch. Etched’s valuation doubles to $21B in a month. https://techcrunch.com/2026/08/18/etcheds-valuation-doubles-to-21b-in-a-month/

  4. TechCrunch. AI chip startup Etched defies skeptics, hits $10.3B valuation from big-name investors. https://techcrunch.com/2026/07/23/ai-chip-startup-etched-defies-skeptics-hits-10-3b-valuation-from-big-name-investors/

Share this article