Xiaomiが新たに発表した66自由度の人型ロボットは、どのようなものなのでしょうか。WRC 2026において、同社は手の器用さと産業タスクの実行能力を高めた次世代の二足歩行プロトタイプを一般公開しました。同時に、Xiaomiのより広範なロボティクス研究は、VLA(視覚・言語・行動)および身体性基盤モデルにますます焦点を当てています。フィジカルAIがデジタルインテリジェンスと物理世界のインターフェースのあり方を変えていく中で、開発者は標準的なソフトウェアスタックが身体性を持つ環境にどのように適応するかを評価する必要があります。従来の産業用ロボットは、高度に構造化された環境、タスク特化型のプログラミング、モデルベース制御に依存することが多くありました。今日では、先進的なシステムがマルチモーダルな知覚をリアルタイムの制御ループに直接統合するため、エンジニアリングの優先事項は汎用的なビジョン・ランゲージ・アクション(VLA)基盤モデルへとシフトしています。
産業用マニピュレーションにおいて手の33自由度が重要な理由
概要
- 次世代の二足歩行プロトタイプは、身長約1.70メートル、体重66キログラムで、関節の可動域が66自由度に拡張されています。
- 微細な操作性が最優先されており、手に集中した33自由度により、柔軟性のある非標準的な産業用部品の器用な取り扱いが可能になっています。
- 初期の工場実証実験では約76秒の生産サイクルタイム要件を満たしていましたが、4か月のイテレーションを経て、タッピングネジ締めステーションでの成功率が90.2%から98%に向上したとXiaomiは報告しています。
フィジカルAIの台頭により、ソフトウェアの課題は画面ベースのインタラクションから、知覚、計画、物理的実行へと移行しています。視覚アセットのレンダリングやフラットなインターフェースの管理ではなく、開発者は現在、3次元の空間環境を推論し、高精度な両手軌道を調整できるシステムを設計しています。
Xiaomiの工場実証実験は、同社が本格的な導入の前に、再現性の高い製造タスクを優先していることを示しています。公開展示の前に、この二足歩行システムはXiaomiの電気自動車(EV)組立ラインで4か月の厳しい「インターンシップ」を完了し、タッピングネジの取り付けや材料ボックスのハンドリングなどのタスクを実行しました。初期の試行では、ロボットは約76秒のワークステーションサイクル内で稼働することが求められていました。4か月のイテレーションを経て、Xiaomiはタッピングネジ締め付けステーションでの成功率が90.2%から98%に向上したと報告しています。この移行は、人型ロボット工学が基本的な歩行のデモンストレーションを超え、複雑な物理環境における再現性の高い高精度な操作の段階へと進んでいることを示しています。

Xiaomiの人型ロボットエコシステムの技術アーキテクチャを理解する
内部構造において、この次世代プラットフォームは、2022年のCyberOneプロトタイプと比較して、機械設計と人工知能の統合において大幅な進化を遂げています。第一世代のCyberOneがわずか21の関節自由度しか備えていなかったのに対し、新モデルでは66の関節自由度へと増加しています。この機械的な拡張は主に手に集中しており、合計33の手の自由度を割り当てることで、微細な運動制御、正確な物体把持、および繊細なツールの操作を可能にしています。
個別の取り組みとして、Xiaomi Roboticsは、統合フレームワークの下でいくつかの身体性AIモデルや研究プロジェクトを発表しています。これらのオープンソースプロジェクトには、リアルタイム実行モデルであるXiaomi-Robotics-0、10万時間以上の現実世界の軌跡を活用したスケーリングモデルXiaomi-Robotics-1、そして38Bの統合自己回帰モデルXiaomi-Robotics-U0が含まれます。これらは総じて、ロボットの行動生成、基盤ポリシー、および身体性ワールドモデルにまたがっています。ただし、WRCプロトタイプがこれらのモデルのいずれかを本番用の制御スタックとして実行していることは、公開資料からは確認されていません。
簡略化された概念的なVLA制御パイプラインは、次のように表現できます:
[Visual / Language Input]
│
▼
[Embodied Policy or VLA Model]
│
▼
[Robot Action / Motion Command]
│
▼
[Embodiment-Specific Controller]
これらの研究の方向性は、タスク特化型のポリシーから、タスクやロボットの構成を超えて知識を転移できるように設計された身体性モデルへの幅広い移行を示しています。視覚や言語の入力をロボットの行動やタスクレベルの制御信号に翻訳するモデルを開発することで、開発者はより幅広いタスクや身体性に一般化できるソフトウェアを探索できるようになります。ソフトウェアスタックは、マルチモーダルセンサーの入力を、身体性に特化した状態推定、モーションプランニング、および低レベル制御と調整する必要があります。

従来のロボット制御とVLA基盤モデルの比較
ロボット開発の物理的要求が単純なナビゲーションを超えるにつれて、開発者はロボットの制御レイヤーをどのように構築するかを選択する必要があります。従来の数理モデルを使用したカスタム制御ループの構築は高い精度を提供しますが、非標準的な環境への適応性に欠けます。逆に、大規模な学習済みポリシーは一般により多くのトレーニングデータを必要としますが、トレーニングのカバレッジと身体性の整合性が十分であれば、より広い適応性を提供できます。タスクの変動性と多様性が高まるにつれて、純粋に事前プログラムされた制御のスケーリングはより困難になります。
アーキテクチャの評価:従来のキネマティクス対生成型VLA
モデルベース制御は正確で予測可能な動作を提供できますが、高度に変動する環境への適応には、多くの場合、追加の知覚、計画、およびタスク固有のエンジニアリングが必要です。このアプローチにより、明確に定義された運用制約内で予測可能な動作を実現できます。社内でカスタムのキネマティックコントローラーを開発するには、関節の制約をマッピングし、逆運動学の方程式をリアルタイムで解くために、相当量のエンジニアリングリソースが必要です。一方、事前トレーニング済みのビジョン・ランゲージ・アクション(VLA)基盤モデルをデプロイすると、ローカルの計算要件が高くなるという犠牲を伴うものの、トレーニングのカバレッジと身体性の整合性に応じて、より高い適応性を提供できます。
以下の表は、ロボット制御とタスク実行を管理するための標準的な手法を比較したものです:
| パラダイム | 一般的なデータ依存性 | 適応性 | ランタイムの特性 | 最適な用途 |
|---|---|---|---|---|
| モデルベース / キネマティック制御 | 低〜中程度 | 定義された制約内で強力 | 予測可能で、多くの場合低遅延 | 高度に構造化された工場環境における決定的産業モーション |
| 行動クローン | デモンストレーションデータ | トレーニング分布外では限定的 | モデル依存 | 構造化された固定ワークステーションでの反復学習タスク |
| VLA / 基盤ポリシー | 大規模な異種データセット | タスクや環境全体でより高い可能性 | より高い計算量と推論の複雑さ | 動的な設定における汎用マニピュレーションおよび言語条件付きタスク |
これらのアーキテクチャの決定は、生産ラインにおけるロボットの物理的性能に直接影響を与えます。統合された基盤モデルを採用することで、ロボットシステムは単一の孤立したアクションの実行から、動的なワークスペースでの多段階の協調タスクの実行へと移行できます。エンジニアリングチームは、特定のハードウェア機能、タスクの複雑さ、およびリアルタイム実行の制約に基づいて、これらのソフトウェアパラダイムを評価する必要があります。

統合チェックリスト:エンジニアリングチームが身体性ソフトウェア開発に備える方法
人型プラットフォームが産業環境へと移行するにつれて、運用の安定性と安全な実行を確保するために、エンジニアリングおよびプロダクトチームは安全、検証、およびデプロイのワークフローを確立する必要があります。
開発者向け実装チェックリスト
- 安全制約付きの制御境界を定義する:関節、速度、力、およびワークスペースの制限を学習済みポリシーの外側に維持し、安全でないアクションが実行前に拒否されるようにする。
- シミュレーションと制御されたハードウェアテストでポリシーを検証する:本番環境へのデプロイの前に、シミュレーションおよびステージングされた実際のロボット環境で学習された動作を評価する。
- エンドツーエンドの制御遅延を測定する:知覚、モデル推論、モーションプランニング、および低レベル制御を個別にプロファイルしてボトルネックを特定する。
- 分布外(OOD)の動作をテストする:トレーニング分布のベンチマークのみに頼るのではなく、馴染みのないオブジェクト、照明条件、レイアウト、およびタスクの変動を評価する。
- フォールバック制御モードを設計する:学習済みポリシーが信頼性の低いアクションや無効なアクションを生成した場合に、確実なリカバリまたは安全停止の動作を提供する。
プロダクトおよび戦略チェックリスト
- 高価値な産業用ワークステーションを定義する:ロボット統合に最も適した、反復的で高精度な組立ステーションを特定する。
- タスク検証パイプラインを確立する:マルチカメラ監視システムを活用して、ロボットのタスク成功率をリアルタイムで評価する。
- クロス身体性のソフトウェアインターフェースを構築する:ロボットオペレーティングシステムが周囲の工場オートメーションネットワークと通信できるようにする。
これらの構造化されたガイドラインを確立することで、開発チームは運用の継続性を維持しながら、アプリケーションをより安全でコンプライアンスに準拠したアーキテクチャへと移行させることができます。
よくある質問 (FAQ)
XiaomiのCyberOneと次世代ロボットの主なハードウェアの違いは何ですか?
ロボットのEV工場インターンシップの正確な結果はどうでしたか?
なぜ手の器用さが産業用人型ロボットの重要な閾値とみなされているのですか?
エンジニアリングチーム向けの主要なポイント
Xiaomiの66自由度人型プロトタイプは、産業用人型ロボットの開発が単なる移動のデモンストレーションから、再現性の高いマニピュレーションタスクへとどのようにシフトしているかを示しています。手に集中した33の自由度と、ネジの取り付け、柔軟な部品のハンドリング、材料管理を網羅する工場での実証実験により、器用さとタスクの信頼性が中心的なエンジニアリングの指標になりつつあります。
開発者にとって、Xiaomiのより広範なロボティクス研究は、従来の制御システムと並行して、VLAポリシーや身体性ワールドモデルの役割が拡大していることも示しています。実用的な課題は、決定論的な制御を完全に置き換えることではなく、ロボットを本番環境にデプロイする前に、学習済みポリシーをシミュレーション、安全制約、遅延プロファイリング、フォールバック動作、および身体性固有のコントローラーと組み合わせることです。
参考文献
-
Xiaomi Robot set to make public debut at 2026 World Robot Conference on August 19. https://www.gizmochina.com/2026/08/18/xiaomi-robot-set-to-make-public-debut-at-2026-world-robot-conference-on-august-19/
-
Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution. https://arxiv.org/abs/2602.12684
-
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories. https://arxiv.org/abs/2607.15330
-
Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model. https://arxiv.org/abs/2607.11643
-
Xiaomi updates progress on humanoid robots in auto factory, achieves 98% success rate in some tasks. https://technode.com/2026/07/15/xiaomi-updates-progress-on-humanoid-robots-in-auto-factory-achieves-98-success-rate-in-some-tasks/
Share this article



