Thinking Machines社がInklingを発表しました。同社は初のオープンウェイトマルチモーダルモデル「Inkling」を公開し、DeepSeekや他の最先端AIシステムに対抗する姿勢を明らかにしました。同社は、クローズドな商用APIとしてモデルを提供するのではなく、エンタープライズ向けのカスタマイズ性、オープンウェイトでのデプロイ、そして開発者にとっての低運用コストを重視しています。InklingはApache 2.0ライセンスの下でオープンウェイトとして公開されているため、企業開発者は独自にモデルをデプロイ、変更、ファインチューニングでき、専用の推論APIに依存する必要がありません。

Thinking Machines社がInklingを発表した理由:クローズドソースの独占に挑む
概要
- 元OpenAI CTOのMira Murati氏が立ち上げたThinking Machines Labが、同社初となるオープンウェイト(Apache 2.0ライセンス)のAIモデル「Inkling」をリリースしました。
- 本システムは9750億個の総パラメータ(タスクあたり410億個のアクティブパラメータ)を持つMixture-of-Experts (MoE) トランスフォーマーであり、テキスト、画像、音声、ビデオなど45兆個のトークンで学習されています。
- 標準的なクローズドソースモデルとは異なり、Inklingは企業が同社のカスタマイズプラットフォーム「Tinker」を使用して、自社でファインチューニングを行うための出発点となるように設計されています。
中央集権的な汎用モデルと、ドメイン特化型のカスタムシステムとの境界線は大きな進化を遂げています。ここ数年、企業は独自のAPIを利用するか、オープンウェイトモデルを自社ホスティングするかを比較検討する場面が増えています。Inklingはこの競争において、汎用的なホスト型推論ではなく、エンタープライズによるカスタマイズに最適化されたApache 2.0モデルを提供することで存在感を示しています。
Inklingの登場は、セルフホスト型のオープンウェイトモデルとAIのカスタマイズに向けた業界全体のシフトを反映しています。企業が自社の機密情報やコードベース、財務データをクローズドなモデルに供給すると、その知識がモデルの将来的なパブリックバージョンに吸収されてしまうリスクがあります。Thinking MachinesによるInklingの発表は、大規模エンジニアリングチームにとって、核心的なソフトウェア依存関係に対する制御を取り戻す直接的な機会となるものです。詳細はThinking Machinesの公式発表をご覧ください。

技術アーキテクチャ:InklingとDeepSeekの比較
プロトコル層において、標準的な密結合(dense)トランスフォーマーはすべてのパラメータをトークンごとに使用するため、高いコンピューティングコストと遅延が発生します。この計算のボトルネックを解消するため、今回発表されたモデルは、中国のオープンソースモデルであるDeepSeek-V3と同様のMixture-of-Experts (MoE) 設計を採用しています。各MoE層には256個のルーティング専門家と2個の共有専門家が含まれ、トークンごとに実行されるルーティング専門家は6個(約410億のアクティブパラメータ)に限定されます。これにより、推論コストと遅延を低く抑えつつ、9750億パラメータという膨大な知識ベースを維持しています。
アテンション機構については、8個のキーバリュー(KV)ヘッドを利用し、スライディングウィンドウ層とグローバル層を5:1の比率で交互に配置しています。LlamaやDeepSeekのような一般的なアーキテクチャがRotary Positional Embedding (RoPE) に依存しているのとは異なり、同システムは相対位置埋め込み(Relative Positional Embeddings)を実装しており、100万トークンまでの長大なコンテキストシーケンスにおいて優れた外挿性能を示します。DeepSeek-V3とは異なり、InklingはMITライセンスではなくApache 2.0の下で公式リリースされており、Tinkerを通じたカスタマイズワークフローを重視することで、同じオープンウェイト市場をターゲットにしています。
[標準的な密結合モデルのアーキテクチャ] 入力トークン ──> 全パラメータがアクティブ (975B) ──> 高いコンピューティングコストと遅延 [Mixture-of-Experts (MoE) アーキテクチャ] 入力トークン ──> Sigmoidベースのルーター ──> アクティブな専門家 (41B) ──> 低コスト・高速な推論
多くの大規模MoEデプロイメントにおいて、推論効率は計算スループットよりもメモリ帯域幅に依存するようになっているため、メモリ中心の推論最適化へとシフトしています。ベースモデルはゼロから事前学習されましたが、ポストトレーニングフェーズではMoonshot AIのKimi K2.5を含む既存のオープンウェイトモデルが生成した合成データブートストラップが活用されました。ベンチマーク結果によると、InklingはNVIDIA Nemotron 3 Ultraと同等のパフォーマンスを達成しつつ、必要なトークン数は3分の1に抑えられています。Thinking MachinesがInklingを発表したことで実証された構造的な能力は、カスタムMoEアーキテクチャがいかに運用負荷を軽減するかを示しています。詳細はThinking Machines Interaction Modelsレポートをご参照ください。
Inkling vs. DeepSeek-V3 比較一覧
これらの主要なオープンウェイトアーキテクチャの技術的な違いを示すため、以下の比較表に基本設計の選択肢をまとめました。
| 技術メトリクス | Inkling MoEモデル | DeepSeek-V3アーキテクチャ |
|---|---|---|
| オープンソースライセンス | Apache 2.0 (寛容的) | MIT (寛容的) |
| 総パラメータスケール | 9750億 パラメータ | 6710億 パラメータ |
| アクティブパラメータ | トークンあたり410億 | トークンあたり370億 |
| コンテキストウィンドウサイズ | 最大100万トークン | 最大12万8000トークン |
| 位置埋め込み | 相対位置埋め込み | Rotary Positional Embedding (RoPE) |

構築か購入か:オープンウェイトのデプロイ戦略
汎用AI APIの維持コストが上昇し続ける中、Inklingのリリースはエンジニアリングチームに対して長期的なインフラ戦略の再評価を促しています。システム依存関係を見直すと、重要な財務的現実が浮き彫りになります。商用モデルをレンタルすることは「二重払いの罠」を招く可能性があるという点です。Satya Nadella氏は最近、商用AIを利用する企業は、サブスクリプションコストを支払うだけでなく、プロンプトに含まれる自社の専門知識を無償で提供してしまっているため、実質的に二度支払っていると主張しました。詳細はNadella氏の技術アドバイザリー記事をご覧ください。
推論コストの低下は、企業がインフラ支出を評価する方法も変化させています。FinOpsの観点から、カスタマイズされたローカルパイプラインを構築するか、商用クラウドのエンドポイントを利用し続けるかを判断するには、計算効率の厳密な評価が求められます。Thinking MachinesがInklingを公開したことで、開発者はトークン予算とパフォーマンスプロファイルのバランスをより調整しやすくなりました。モデルのウェイトが公開されているため、組織はデプロイパイプラインをカスタマイズでき、商用プラットフォームにロックインされることなく、カスタムウェイトを導入可能です。このカスタマイズパラダイムはThinking Machines Labのファインチューニングプラットフォーム「Tinker」によって完全にサポートされており、企業はプライベートなウェイトをアップロードして特定のドメイン学習を実行できます。
デプロイシナリオとプラットフォーム選定
インフラアーキテクトがこれらの経済モデルの変化に応じてホスティング構成を評価できるよう、一般的なトレードオフを以下のデプロイマトリックスにまとめました。
| デプロイシナリオ | 推論コスト | カスタマイズ性 | データ主権 |
|---|---|---|---|
| ホスト型商用API | 高 (トークン課金) | なし (固定設定) | 低 (外部APIルーティング) |
| Inklingのセルフホスト | 中 (サーバーインフラ) | 中 (手動でのローカル更新) | 高 (ローカル優先ホスティング) |
| Tinkerでのファインチューニング | 低 (タスク特化型の最適化) | 高 (プログラマブルな調整) | 高 (プライベートクラウド隔離) |
このオープンウェイトでのカスタマイズアプローチの価値は、Thinking Machines社と世界最大のヘッジファンドであるBridgewater Associatesとの共同プロジェクトによって実証されています。オープンモデルをベースにし、Bridgewaterの財務的専門知識を用いてさらに学習させることで、財務推論テストで84.7%のスコアを達成するシステムを構築しました。このカスタマイズされたモデルは、上位の商用モデルを凌駕しつつ、運用コストは14分の1程度でした。これらのパフォーマンス指標はFinOpsの目的を直接的に支援するものであり、開発者がトークン予算とパフォーマンスを最適化することを可能にします。詳細はBridgewaterの財務推論研究レポートをご覧ください。

エンジニアリングチーム向けインテグレーションチェックリスト:プラットフォーム移行への準備
オープンウェイトモデルが業界標準となる中で、データパイプラインを保護し、技術的自立を確保するためには、エンジニアリングおよび製品開発チームが明確な移行ロードマップを策定する必要があります。
開発者向け実装チェックリスト
- 推論パイプラインの評価: SGLang、vLLM、llama.cppなどのフレームワークを使用して量子化ベンチマークを設定し、メモリフットプリントを最適化する。
- GPU使用率のベンチマーク: 並列推論実行中のメモリ帯域幅制約を最小化するため、アクティブな専門家ルーティングパスを分析する。
- ファインチューニングワークフローの監査: Tinkerなどのプラットフォーム上でモデルカスタマイズテンプレートを構成し、評価ルーチンを自動化する。
製品・成長戦略チェックリスト
- モデルライセンスパラメータの確認: Apache 2.0条項を精査し、その後の商用再配布におけるコンプライアンスを確保する。
- FinOps監視体制の構築: セルフホスト型オープンウェイトの長期的なサーバーホスティングコストと、課金型クラウドAPIのサブスクリプション料金を比較し、計算パイプラインを最適化する。
- 機密データリポジトリの隔離: 重要な企業知識が外部のパブリックモデルに取り込まれないよう、厳格なデータサンドボックスを構築する。
これらの構造化されたガイドラインを策定することで、開発チームは運用の継続性を維持しつつ、より安全でコンプライアンスに適合したアーキテクチャへとアプリケーションを移行できます。
よくある質問 (FAQ)
クローズドソースの商用モデルを利用すると、企業は「二重払い」になるとはどういうことですか?
InklingのMoE(Mixture-of-Experts)アーキテクチャにはどのような技術的利点がありますか?
Inklingは、中央集権的なガードレールなしでエンタープライズデプロイに使用しても安全ですか?
Inklingはオープンソースですか?
エンジニアリングチームへの要点
Inklingは、エンタープライズAIがカスタマイズ可能なオープンウェイトデプロイメントの方向へ向かっていることを示しています。既存の商用AIプラットフォームを単純に置き換えるのではなく、エンタープライズエンジニアリングチームが選択できるデプロイメント戦略の幅を広げるものです。
オープンウェイトモデルを採用する組織は、商用APIへの依存から脱却し、プライベートなデプロイメント、モデルガバナンス、効率的な推論、そして長期的な運用効率を重視するようになるでしょう。そのためチームは、効率的なファインチューニング、推論の最適化、ガバナンスを実現できるインフラを優先すべきです。
Share this article



