Thinking Machines 推出 Inkling?這項公告已正式獲得確認,Thinking Machines Lab 發布了其首款開源權重多模態模型 Inkling,旨在與 DeepSeek 及其他前沿 AI 系統競爭。該公司並未將此模型定位為封閉的商業 API,而是強調企業客製化、開源權重部署,並為開發人員降低營運成本。由於 Inkling 是以 Apache 2.0 開源權重協議發布,企業開發人員現在可以自行部署、修改和微調模型,無需依賴任何封閉的推論 API。

為什麼 Thinking Machines 推出 Inkling:挑戰封閉原始碼的壟斷
重點總覽
- 前 OpenAI 技術長 Mira Murati 的新創公司 Thinking Machines Lab 發布了其首款內部 AI 模型 Inkling,並採用 Apache 2.0 開源權重授權。
- 該系統為 MoE (混合專家模型) Transformer 架構,擁有 9,750 億個總參數(每項任務啟用 410 億個),並使用 45 兆個文字、圖像、音訊和影片 Token 進行訓練。
- 與標準封閉原始碼模型不同,Inkling 旨在作為組織使用該公司客製化平台 Tinker 進行自我微調的起點。
集中式通用模型與客製化領域專用系統之間的界線正在經歷重大演變。過去幾年,企業越來越傾向將專有 API 與自行託管的開源權重部署進行比較。Inkling 透過提供適用於企業客製化而非通用託管推論的 Apache 2.0 模型,進入了這一競爭領域。
Inkling 的推出反映了產業界正朝向自行託管開源權重模型與企業 AI 客製化的廣泛轉變。當公司將敏感的商業機密、程式碼庫和財務計算輸入專有模型時,這些知識面臨被吸收至未來公共版本系統中的風險。對於許多大型工程團隊而言,Thinking Machines 推出 Inkling 代表了一個直接的機會,讓他們能夠重新掌握核心軟體相依性的控制權,詳情請參考官方 Thinking Machines 公告。

技術架構:Inkling 與 DeepSeek 的比較
在協定層面上,標準密集型 Transformer 會為每個 Token 啟用全部參數,導致計算成本高昂且延遲增加。為了解決這些運算瓶頸,這款新發布的模型採用了與中國開源旗艦 DeepSeek-V3 類似的混合專家模型 (MoE) 設計。每個 MoE 層包含 256 個路由專家與 2 個共享專家,每個 Token 僅由 6 個路由專家(約 410 億個活動參數)執行。這使系統能夠維持 9,750 億個參數的龐大知識庫,同時保持推論成本與延遲在低水平。
在注意力機制方面,該系統以 5:1 的比例交錯滑動視窗與全局層,並使用 8 個鍵值 (KV) 頭。與 Llama 和 DeepSeek 等依賴旋轉位置嵌入 (RoPE) 的熱門架構不同,該系統採用相對位置嵌入,這在長達 100 萬個 Token 的長上下文序列中展現出更優越的外推效能。與 DeepSeek-V3 不同,Inkling 正式以 Apache 2.0 授權發布,而非 MIT 授權,旨在鎖定相同的企業開源權重市場,同時透過 Tinker 強調客製化工作流程。
[標準密集模型架構] 輸入 Token ──> 全參數啟用 (975B) ──> 高計算成本與延遲 [混合專家模型 (MoE) 架構] 輸入 Token ──> Sigmoid 路由器 ──> 啟用專家 (41B) ──> 低成本、快速推論
對於許多大型 MoE 部署而言,由於推論效率越來越依賴記憶體頻寬而非算術處理能力,許多部署正轉向以記憶體為中心的推論優化。儘管基礎模型是從零開始預訓練的,但後訓練階段利用了由現有開源權重模型(包括 Moonshot AI 的 Kimi K2.5)生成的合成資料進行啟動。基準測試結果顯示,Inkling 在僅使用三分之一 Token 的情況下,達到了與 NVIDIA Nemotron 3 Ultra 相當的效能。Thinking Machines 推出 Inkling 時所驗證的結構性能力,展示了客製化 MoE 架構如何降低整體營運開銷,詳細資訊請參閱Thinking Machines 互動模型報告。
Inkling 與 DeepSeek-V3 概覽
為了說明這些領先的開源權重架構之間的技術差異,以下比較表概述了它們的基準設計選擇:
| 技術指標 | Inkling MoE 模型 | DeepSeek-V3 架構 |
|---|---|---|
| 開源授權 | Apache 2.0 (寬鬆) | MIT (寬鬆) |
| 總參數規模 | 9,750 億總參數 | 6,710 億總參數 |
| 活動參數 | 每個 Token 啟用 410 億 | 每個 Token 啟用 370 億 |
| 上下文視窗大小 | 高達 100 萬 Token | 高達 12.8 萬 Token |
| 位置嵌入 | 相對位置嵌入 | 旋轉位置嵌入 (RoPE) |

自建與採購:開源權重部署策略
隨著維護通用 AI API 的營運成本持續上升,Inkling 的發布也促使工程團隊重新評估長期基礎架構策略。重新評估系統相依性揭示了一個關鍵的財務現實:租用專有模型可能導致「重複付費陷阱」。Satya Nadella 最近指出,使用專有 AI 的企業實際上付出了兩次代價:一次是直接的訂閱費用,另一次則是將嵌入在提示詞中的專有商業知識交給了供應商,這一點在Nadella 技術諮詢文章中有詳細討論。
較低的推論成本也改變了企業評估基礎架構支出的方式。從 FinOps(財務營運)的角度來看,評估是建立客製化本地管道還是繼續訂閱專有雲端終端,需要對計算效率進行嚴格的評估。隨著 Thinking Machines 推出 Inkling,開發人員可以更容易地在 Token 預算與效能指標之間取得平衡。由於模型權重是公開可用的,組織可以客製化部署管道,並在不受專有平台綁定的情況下商業化部署客製化權重。這種客製化典範得到了 Thinking Machines Lab 微調平台 Tinker 的全面支援,組織可以在該平台上上傳私人權重並執行針對性的領域訓練。
部署場景與平台選擇
為了幫助基礎架構架構師在這些變動的經濟模式下評估其託管配置,下表概述了標準的權衡考量:
| 部署場景 | 推論成本 | 客製化支援 | 資料主權 |
|---|---|---|---|
| 託管式封閉來源 API | 高 (按 Token 計價) | 無 (靜態系統預設) | 低 (外部 API 路由) |
| 自行託管基礎版 Inkling | 中 (伺服器基礎架構) | 中 (手動本地更新) | 高 (本地優先託管) |
| 在 Tinker 上微調 Inkling | 低 (優化的任務特定執行環境) | 高 (程式化微調) | 高 (私有雲隔離) |
開源權重客製化方法的價值,透過 Thinking Machines 與全球最大避險基金 Bridgewater Associates 的聯合專案得到了證實。透過採用基礎開源模型,並在 Bridgewater 的專有財務專業知識上進一步訓練,研究人員構建了一個在財務推理測試中得分 84.7% 的系統。這個客製化模型不僅勝過頂尖的專有替代方案,且執行成本僅為其十四分之一。這些效能指標直接支援 FinOps 目標,使開發人員能夠在 Token 預算與效能設定檔之間取得平衡,詳細請參閱Bridgewater 財務推理研究報告。

整合清單:工程團隊如何準備平台變更
為了在開源權重模型成為產業標準的同時保護資料管道並確保技術自主權,工程與產品團隊必須建立明確的遷移路線圖。
開發人員實作檢查清單
- 評估推論管道:使用 SGLang、vLLM 或 llama.cpp 等框架設定量化基準,以優化記憶體佔用。
- 分析 GPU 利用率:分析活動專家路由路徑,以在並發推論執行期間最大限度地減少記憶體頻寬限制。
- 稽核微調工作流程:在 Tinker 等平台上設定模型客製化範本,以自動化評估準則。
產品與成長策略檢查清單
- 驗證模型授權參數:審查 Apache 2.0 條款,確保後續商業再發布的合規性。
- 建立 FinOps 監控:比較自行託管開源權重與計量式雲端 API 訂閱的長期伺服器託管成本,以優化計算管道。
- 隔離專有資料庫:建立嚴格的資料沙盒,確保敏感的公司知識不會被外部公共模型所擷取。
透過建立這些結構化準則,開發團隊可以在維持營運連續性的同時,將應用程式過渡到更安全、更合規的架構。
常見問題 (FAQ)
為什麼使用封閉來源的專有模型意味著企業需要「支付兩次」費用?
Inkling 的混合專家 (MoE) 架構有哪些技術優勢?
Inkling 在沒有集中式防護措施的情況下,是否適合企業部署?
Inkling 是開源的嗎?
工程團隊的關鍵重點
Inkling 表明企業 AI 正在朝向可客製化的開源權重部署發展。Inkling 並非直接取代專有 AI 平台,而是擴大了企業工程團隊可用的部署策略範圍。
採用開源權重模型的組織將越來越優先考慮私有部署、模型治理、高效推論以及長期營運效率,而非依賴專有 API。因此,團隊應優先建構具備高效微調、推論優化與治理能力的基礎架構。
Share this article



