Thinking Machines ra mắt Inkling? Thông báo này đã được xác nhận chính thức khi Thinking Machines Lab giới thiệu mô hình đa phương thức mã nguồn mở đầu tiên của mình là Inkling, được thiết kế để cạnh tranh với DeepSeek và các hệ thống AI tiên phong khác. Thay vì định vị mô hình như một API thương mại khép kín, công ty nhấn mạnh vào việc tùy chỉnh cho doanh nghiệp, triển khai mã nguồn mở và giảm chi phí vận hành cho các nhà phát triển. Vì Inkling được phát hành dưới giấy phép Apache 2.0, các nhà phát triển doanh nghiệp giờ đây có thể triển khai, sửa đổi và tinh chỉnh mô hình mà không cần phụ thuộc vào các API suy luận độc quyền.

Tại sao Thinking Machines ra mắt Inkling: Thách thức thế độc quyền của các hệ thống đóng
Tổng quan
- Startup của cựu CTO OpenAI Mira Murati, Thinking Machines Lab, đã phát hành mô hình AI nội bộ đầu tiên có tên Inkling, sử dụng giấy phép mã nguồn mở Apache 2.0.
- Hệ thống này là một transformer Mixture-of-Experts (MoE) với tổng cộng 975 tỷ tham số (41 tỷ tham số hoạt động cho mỗi tác vụ), được huấn luyện trên 45 nghìn tỷ token văn bản, hình ảnh, âm thanh và video.
- Không giống như các mô hình nguồn đóng tiêu chuẩn, Inkling được thiết kế như một nền tảng cơ sở để các tổ chức tự tinh chỉnh thông qua Tinker, nền tảng tùy chỉnh của công ty.
Sự phân chia giữa các mô hình mục đích chung tập trung và các hệ thống tùy chỉnh theo lĩnh vực đang trải qua một bước tiến lớn. Trong vài năm qua, các doanh nghiệp ngày càng so sánh giữa việc sử dụng API độc quyền với các giải pháp triển khai mã nguồn mở tự lưu trữ. Inkling gia nhập cuộc cạnh tranh này bằng cách cung cấp một mô hình Apache 2.0 được tối ưu hóa cho nhu cầu tùy chỉnh của doanh nghiệp thay vì suy luận lưu trữ mục đích chung.
Việc ra mắt Inkling phản ánh một xu hướng rộng lớn hơn của ngành hướng tới các mô hình mã nguồn mở tự lưu trữ và tùy chỉnh AI cho doanh nghiệp. Khi một công ty nhập các bí mật thương mại, mã nguồn và dữ liệu tài chính nhạy cảm vào một mô hình độc quyền, họ đối mặt với rủi ro thông tin đó bị hấp thụ vào các phiên bản công khai trong tương lai. Đối với nhiều nhóm kỹ thuật quy mô lớn, việc Thinking Machines ra mắt Inkling đại diện cho một cơ hội trực tiếp để giành lại quyền kiểm soát các phụ thuộc phần mềm cốt lõi, như được giải thích trong thông báo chính thức từ Thinking Machines.

Kiến trúc kỹ thuật: Cách Inkling so sánh với DeepSeek
Ở tầng giao thức, các mô hình transformer dày đặc (dense) tiêu chuẩn kích hoạt toàn bộ tập hợp tham số cho mỗi token, dẫn đến chi phí tính toán cao và độ trễ lớn. Để giải quyết những nút thắt này, mô hình mới phát hành sử dụng thiết kế Mixture-of-Experts (MoE) tương tự như mô hình đầu bảng mã nguồn mở DeepSeek-V3 của Trung Quốc. Mỗi lớp MoE chứa 256 chuyên gia được định tuyến và 2 chuyên gia chia sẻ, với chỉ 6 chuyên gia được định tuyến (khoảng 41 tỷ tham số hoạt động) thực thi trên mỗi token. Điều này cho phép hệ thống duy trì cơ sở kiến thức khổng lồ lên tới 975 tỷ tham số trong khi vẫn giữ chi phí suy luận và độ trễ ở mức thấp.
Đối với cơ chế chú ý (attention mechanism), hệ thống xen kẽ các lớp cửa sổ trượt (sliding-window) và lớp toàn cục với tỷ lệ 5:1, sử dụng 8 đầu key-value (KV). Không giống như các kiến trúc phổ biến như Llama và DeepSeek vốn dựa vào Rotary Positional Embedding (RoPE), hệ thống này triển khai các nhúng vị trí tương đối (relative positional embeddings), mang lại hiệu suất ngoại suy vượt trội trên các chuỗi bối cảnh dài lên đến 1 triệu token. Khác với DeepSeek-V3, Inkling được phát hành chính thức dưới giấy phép Apache 2.0 thay vì MIT, hướng tới cùng phân khúc mã nguồn mở doanh nghiệp trong khi nhấn mạnh vào các quy trình tùy chỉnh thông qua Tinker.
[Kiến trúc mô hình dày đặc tiêu chuẩn] Token đầu vào ──> Kích hoạt toàn bộ tham số (975B) ──> Chi phí tính toán & độ trễ cao [Kiến trúc Mixture-of-Experts (MoE)] Token đầu vào ──> Bộ định tuyến dựa trên Sigmoid ──> Chuyên gia hoạt động (41B) ──> Chi phí thấp, suy luận nhanh
Đối với nhiều hệ thống triển khai MoE quy mô lớn, vì hiệu quả suy luận ngày càng phụ thuộc vào băng thông bộ nhớ thay vì thông lượng tính toán, nhiều hệ thống đang chuyển hướng sang tối ưu hóa suy luận tập trung vào bộ nhớ. Trong khi mô hình cơ sở được huấn luyện từ đầu, giai đoạn hậu huấn luyện đã sử dụng dữ liệu tổng hợp được tạo bởi các mô hình mã nguồn mở hiện có, bao gồm Kimi K2.5 của Moonshot AI. Kết quả thử nghiệm cho thấy Inkling đạt hiệu suất tương đương với NVIDIA Nemotron 3 Ultra trong khi chỉ sử dụng một phần ba số lượng token. Các khả năng cấu trúc được xác nhận khi Thinking Machines ra mắt Inkling chứng minh cách các kiến trúc MoE tùy chỉnh giúp giảm chi phí vận hành tổng thể, như được mô tả trong báo cáo Interaction Models của Thinking Machines.
Inkling so với DeepSeek-V3 trong nháy mắt
Để minh họa các biến thể kỹ thuật giữa các kiến trúc mã nguồn mở hàng đầu này, bảng so sánh sau đây phác thảo các lựa chọn thiết kế cơ sở:
| Thông số kỹ thuật | Mô hình MoE Inkling | Kiến trúc DeepSeek-V3 |
|---|---|---|
| Giấy phép nguồn mở | Apache 2.0 (Phóng khoáng) | MIT (Phóng khoáng) |
| Tổng quy mô tham số | 975 tỷ tham số | 671 tỷ tham số |
| Tham số hoạt động | 41 tỷ tham số/token | 37 tỷ tham số/token |
| Kích thước cửa sổ bối cảnh | Lên đến 1 triệu token | Lên đến 128 nghìn token |
| Nhúng vị trí | Nhúng vị trí tương đối | Rotary Positional Embedding (RoPE) |

Xây dựng hay Mua: Chiến lược triển khai mã nguồn mở
Khi chi phí vận hành cho việc duy trì các API AI mục đích chung ngày càng tăng, sự ra mắt của Inkling cũng thúc đẩy các đội ngũ kỹ thuật tái đánh giá các chiến lược hạ tầng dài hạn. Việc đánh giá lại các phụ thuộc hệ thống cho thấy một thực tế tài chính quan trọng: việc thuê các mô hình độc quyền có thể dẫn đến cái bẫy thanh toán kép. Satya Nadella gần đây đã lập luận rằng các doanh nghiệp sử dụng AI độc quyền thực chất đang phải trả tiền hai lần: một lần cho chi phí đăng ký trực tiếp và lần thứ hai bằng cách bàn giao kiến thức kinh doanh độc quyền của họ được nhúng trong các câu lệnh, điều này đã được thảo luận trong bài tư vấn kỹ thuật của Nadella.
Chi phí suy luận thấp hơn cũng thay đổi cách các doanh nghiệp đánh giá chi tiêu hạ tầng. Từ góc độ FinOps, việc đánh giá xem nên xây dựng các luồng xử lý cục bộ tùy chỉnh hay tiếp tục đăng ký các endpoint đám mây độc quyền đòi hỏi một sự đánh giá nghiêm ngặt về hiệu quả tính toán. Khi Thinking Machines ra mắt Inkling, các nhà phát triển có thể cân bằng ngân sách token với các hồ sơ hiệu suất dễ dàng hơn. Vì trọng số mô hình được cung cấp công khai, các tổ chức có thể tùy chỉnh các luồng triển khai và triển khai thương mại các trọng số đã tùy chỉnh mà không bị khóa vào nền tảng độc quyền. Mô hình tùy chỉnh này được hỗ trợ đầy đủ bởi nền tảng tinh chỉnh Tinker của Thinking Machines Lab, nơi các tổ chức có thể tải lên các trọng số riêng tư và thực hiện huấn luyện theo lĩnh vực mục tiêu.
Các kịch bản triển khai và lựa chọn nền tảng
Để giúp các kiến trúc sư hạ tầng đánh giá cấu hình lưu trữ của họ trong bối cảnh các mô hình kinh tế thay đổi, ma trận triển khai dưới đây phác thảo các ưu nhược điểm tiêu chuẩn:
| Kịch bản triển khai | Chi phí suy luận | Hỗ trợ tùy chỉnh | Chủ quyền dữ liệu |
|---|---|---|---|
| API nguồn đóng được lưu trữ | Cao (Giá theo số lượng token) | Không (Mặc định hệ thống tĩnh) | Thấp (Định tuyến API bên ngoài) |
| Inkling cơ sở tự lưu trữ | Trung bình (Hạ tầng máy chủ) | Trung bình (Cập nhật thủ công cục bộ) | Cao (Lưu trữ cục bộ là ưu tiên) |
| Inkling được tinh chỉnh trên Tinker | Thấp (Runtime tối ưu hóa cho tác vụ) | Cao (Tinh chỉnh theo lập trình) | Cao (Cô lập trên đám mây riêng) |
Giá trị của phương pháp tùy chỉnh mã nguồn mở được chứng minh qua một dự án chung giữa Thinking Machines và Bridgewater Associates, quỹ đầu tư mạo hiểm lớn nhất thế giới. Bằng cách sử dụng một mô hình mở cơ sở và đào tạo thêm dựa trên chuyên môn tài chính độc quyền của Bridgewater, các nhà nghiên cứu đã xây dựng một hệ thống đạt 84,7% trong các bài kiểm tra lập luận tài chính. Mô hình tùy chỉnh này đã vượt qua các giải pháp độc quyền hàng đầu trong khi chi phí vận hành chỉ bằng khoảng một phần mười bốn. Các chỉ số hiệu suất này hỗ trợ trực tiếp cho các mục tiêu FinOps, cho phép các nhà phát triển cân bằng ngân sách token với các hồ sơ hiệu suất, như được ghi chép trong nghiên cứu về lập luận tài chính của Bridgewater.

Danh sách kiểm tra tích hợp: Cách đội ngũ kỹ thuật chuẩn bị cho thay đổi nền tảng
Để bảo mật các luồng dữ liệu và đảm bảo quyền tự chủ về kỹ thuật khi các mô hình mã nguồn mở trở thành tiêu chuẩn công nghiệp, các đội ngũ sản phẩm và kỹ thuật cần thiết lập một lộ trình chuyển đổi rõ ràng.
Danh sách kiểm tra thực hiện cho nhà phát triển
- Đánh giá các luồng suy luận: Thiết lập các tiêu chuẩn định lượng bằng cách sử dụng các framework như SGLang, vLLM hoặc llama.cpp để tối ưu hóa dấu chân bộ nhớ.
- Đánh giá hiệu suất GPU: Phân tích các lộ trình định tuyến chuyên gia để giảm thiểu các ràng buộc về băng thông bộ nhớ trong quá trình suy luận đồng thời.
- Kiểm tra quy trình tinh chỉnh: Cấu hình các mẫu tùy chỉnh mô hình trên các nền tảng như Tinker để tự động hóa các rubric đánh giá.
Danh sách kiểm tra chiến lược Sản phẩm & Tăng trưởng
- Xác minh các tham số cấp phép mô hình: Xem xét các điều khoản Apache 2.0 để đảm bảo tính tuân thủ cho việc tái phân phối thương mại sau đó.
- Thiết lập giám sát FinOps: So sánh chi phí lưu trữ máy chủ dài hạn của các mô hình mở tự lưu trữ với chi phí đăng ký API đám mây theo định mức để tối ưu hóa các luồng tính toán.
- Cô lập các kho dữ liệu độc quyền: Thiết lập các sandbox dữ liệu nghiêm ngặt để đảm bảo rằng kiến thức nhạy cảm của công ty không bị nạp vào các mô hình công cộng bên ngoài.
Bằng cách thiết lập các hướng dẫn có cấu trúc này, các đội ngũ phát triển có thể chuyển đổi các ứng dụng của họ sang các kiến trúc an toàn và tuân thủ hơn trong khi vẫn duy trì được sự liên tục trong vận hành.
Các câu hỏi thường gặp (FAQ)
Tại sao việc sử dụng các mô hình độc quyền nguồn đóng lại khiến công ty phải "trả tiền hai lần"?
Những ưu điểm kỹ thuật của kiến trúc mixture-of-experts (MoE) của Inkling là gì?
Liệu Inkling có an toàn cho việc triển khai doanh nghiệp mà không cần rào cản tập trung?
Inkling có phải là mã nguồn mở không?
Những điểm chính cho các đội ngũ kỹ thuật
Inkling chứng minh rằng AI doanh nghiệp đang hướng tới việc triển khai mã nguồn mở có khả năng tùy chỉnh. Thay vì thay thế hoàn toàn các nền tảng AI độc quyền, Inkling mở rộng các lựa chọn chiến lược triển khai có sẵn cho các đội ngũ kỹ thuật doanh nghiệp.
Các tổ chức áp dụng các mô hình mã nguồn mở sẽ ngày càng ưu tiên việc triển khai riêng tư, quản trị mô hình, suy luận hiệu quả và hiệu quả vận hành dài hạn thay vì phụ thuộc vào các API độc quyền. Do đó, các đội ngũ cần ưu tiên xây dựng hạ tầng có khả năng tinh chỉnh hiệu quả, tối ưu hóa suy luận và quản trị tốt.
Share this article



