小米透過全新 66 自由度人形機器人揭示了哪些突破?在 2026 世界機器人大會(WRC 2026)上,該公司公開展示了新一代雙足原型機,其核心在於提升手部靈活性與工業任務執行能力,而小米更廣泛的機器人研究也正日益聚焦於 VLA 與具身基礎模型。隨著具身人工智慧改變數位智慧與實體世界的介面互動方式,開發者必須評估標準軟體堆疊如何適應具身環境。傳統工業機器人往往依賴高度結構化的環境、特定任務編程以及基於模型的控制。如今,由於先進系統將多模態感知直接整合至即時控制迴圈中,工程優先事項正轉向具備通用性的視覺-語言-動作(VLA)基礎模型。
為什麼 33 個手部自由度對工業操作至關重要
快速總覽
- 新一代雙足原型機身高約 1.70 公尺、重 66 公斤,並將關節活動度擴展至 66 個自由度。
- 高度優先考量精細操作,其中 33 個自由度集中於雙手,能夠靈巧地處理柔軟且非標準的工業零件。
- 先前的工廠實測符合約 76 秒的生產週期要求;經過四個月的迭代,小米回報自攻螺絲工作站的成功率已從 90.2% 提升至 98%。
具身 AI 的崛起將軟體問題從基於螢幕的互動轉移至感知、規劃與實體執行。開發者不再只是渲染視覺資產與管理平面介面,而是開始設計能夠推導三維空間環境並協調高精度雙手軌跡的系統。
小米的工廠實測表明,該公司在進行更廣泛部署之前,正優先處理可重複的製造任務。在公開展示之前,該雙足系統在小米電動車裝配線上完成了為期四個月的嚴格實習,執行諸如自攻螺絲安裝和料箱搬運等任務。先前的測試要求機器人在大約 76 秒的工作站週期內運作。經過四個月的迭代,小米回報自攻螺絲安裝工作站的成功率已從 90.2% 提升至 98%。這項轉變證明了人形機器人正從基本的行走展示,邁向複雜實體環境中的可重複、高靈活性操作。

深入了解小米人形機器人生態系統的技術架構
在底層技術方面,相較於 2022 年的 CyberOne 原型機,這款新一代平台在機械設計與人工智慧整合上有了顯著的提升。第一代 CyberOne 僅具備 21 個關節自由度,而新模型則將此數字提升至 66 個關節自由度。此機械擴展主要集中於手部,總共配置了 33 個手部自由度,以實現精細動作控制、精準物體抓取與靈巧的工具操作。
除此之外,小米機器人實驗室在其統一框架下發布了多項具身 AI 模型與研究專案。這些開源專案包含即時執行模型 Xiaomi-Robotics-0、利用超過 10万 小時真實世界軌跡的規模化模型 Xiaomi-Robotics-1,以及 38B 統一自迴歸模型 Xiaomi-Robotics-U0。這些專案涵蓋了機器人動作生成、基礎策略以及具身世界建模。不過,公開資料並未證實 WRC 原型機在其生產控制堆疊中運行上述任一特定模型。
一個簡化的概念性 VLA 控制管線可表示為:
[視覺 / 語言輸入]
│
▼
[具身策略或 VLA 模型]
│
▼
[機器人動作 / 運動指令]
│
▼
[具體實體專屬控制器]
這些研究方向展示了從特定任務策略轉向旨在跨任務與機器人配置轉移知識的具身模型的更廣泛趨勢。透過開發將視覺與語言輸入轉化為機器人動作或任務級控制信號的模型,開發者能夠探索適用於更廣泛任務與實體型態的通用軟體。軟體堆疊必須將多模態感測器輸入與具體實體專屬的狀態估計、運動規劃以及底層控制相互協調。

傳統機器人控制與 VLA 基礎模型的比較
隨著機器人開發的實體需求超越簡單的導航,開發者必須選擇如何建構其機器人控制層。運用傳統數學模型建構自定義控制迴圈可提供高精度,但缺乏對非標準環境的適應能力。相反地,大規模學習策略通常需要大量的訓練資料,但在訓練覆蓋率與實體對齊足夠的情況下,能提供更廣泛的適應性。隨著任務變異性與物體多樣性增加,純粹的預編程控制將變得更難以擴展。
架構評估:傳統運動學與生成式 VLA
基於模型的控制可以提供精確且可預測的行為,但將其適應高度變化的環境通常需要額外的感知、規劃和特定任務工程。這種方法能在定義明確的操作限制內提供可預測的行為。開發自定義的內部運動學控制器需要投入大量的工程資源,以在地即時對應關節限制並求解逆運動學方程式。相對地,部署預先訓練的視覺-語言-動作(VLA)基礎模型可以提供更高的適應性,具體取決於訓練覆蓋率與實體對齊程度,但代價是需要更高的本地運算需求。
下表比較了管理機器人控制與任務執行的標準方法論:
| 範例 | 典型資料依賴性 | 適應性 | 運行時特性 | 最適合用於 |
|---|---|---|---|---|
| 基於模型 / 運動學控制 | 低至中等 | 在定義限制內表現強大 | 可預測且通常延遲低 | 高度結構化工廠環境中的確定性工業運動 |
| 行為複製 | 示範資料 | 在訓練分佈之外受限 | 依賴模型而定 | 結構化固定工作站上的重複學習任務 |
| VLA / 基礎策略 | 大型異質資料集 | 在各任務與環境中具備更高潛力 | 更高的運算與推論複雜度 | 動態環境中的通用操作與語言條件任務 |
這些架構決策直接影響機器人在生產線上的實體能力。透過採用統一的基礎模型,機器人系統可以從執行單一、孤立的動作,轉變為在動態工作空間中執行多階段的協作任務。工程團隊必須根據其特定的硬體能力、任務複雜度以及即時執行限制來評估這些軟體範例。

整合檢查清單:工程團隊如何為具身軟體開發做好準備
為了確保人形平台在過渡至工業環境時的運作穩定性與安全執行,工程與產品團隊應建立安全、驗證與部署工作流程。
開發者實施檢查清單
- 定義受安全約束的控制邊界:將關節、速度、力道和工作空間限制保留在學習策略之外,以便在執行前拒絕不安全的動作。
- 在模擬與受控硬體測試中驗證策略:在進入生產部署前,於模擬和分階段的真實機器人環境中評估學習到的行為。
- 衡量端到端控制延遲:分別對感知、模型推論、運動規劃和底層控制進行效能剖析,以找出效能瓶頸。
- 測試分佈外行為:評估不熟悉的物體、光照條件、佈局和任務變異,而不僅僅依賴訓練分佈基準。
- 設計備用控制模式:當學習到的行為產生低信賴度或無效動作時,提供確定性的恢復或安全停止行為。
產品與策略檢查清單
- 定義高價值的工業工作站:識別最適合機器人整合的重複性、高精度裝配工作站。
- 建立任務驗證管線:利用多攝影機監控系統即時評估機器人的任務成功率。
- 建構跨實體軟體介面:確保機器人作業系統能夠與周圍的工廠自動化網路進行通訊。
透過建立這些結構化準則,開發團隊可以在維持運作連續性的同時,將其應用程式過渡到更安全、更符合規範的架構。
常見問題 (FAQ)
小米 CyberOne 與新一代機器人在硬體上有哪些關鍵差異?
機器人在電動車工廠實習的確切成果為何?
為什麼手部靈活性被認為是工業人形機器人的關鍵門檻?
工程團隊的核心要點
小米的 66 自由度人形原型機展示了工業人形開發如何從移動展示轉向可重複的操作任務。憑藉集中在雙手上的 33 個自由度,以及涵蓋螺絲安裝、柔軟零件處理和材料管理的工廠實測,靈活性與任務可靠性正成為核心的工程指標。
對開發者而言,小米更廣泛的機器人研究也說明了 VLA 策略與具身世界模型在傳統控制系統之外日益增長的作用。實際的挑戰並非完全取代確定性控制,而是將學習到的策略與模擬、安全約束、延遲剖析、備用行為以及具體實體專屬控制器相結合,然後再將機器人部署到生產環境中。
參考資料
-
小米機器人預定於 8 月 19 日 2026 世界機器人大會上公開亮相。https://www.gizmochina.com/2026/08/18/xiaomi-robot-set-to-make-public-debut-at-2026-world-robot-conference-on-august-19/
-
Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution. https://arxiv.org/abs/2602.12684
-
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories. https://arxiv.org/abs/2607.15330
-
Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model. https://arxiv.org/abs/2607.11643
-
小米更新汽車工廠人形機器人進展,部分任務成功率達 98%。https://technode.com/2026/07/15/xiaomi-updates-progress-on-humanoid-robots-in-auto-factory-achieves-98-success-rate-in-some-tasks/
Share this article



