Thinking Machines lance Inkling ? Cette annonce a été officiellement confirmée, Thinking Machines Lab ayant introduit son premier modèle multimodal à poids ouverts, Inkling, conçu pour concurrencer DeepSeek et d'autres systèmes d'IA de pointe. Plutôt que de positionner le modèle comme une API commerciale fermée, l'entreprise met l'accent sur la personnalisation en entreprise, le déploiement de modèles à poids ouverts et la réduction des coûts opérationnels pour les développeurs. Puisque Inkling est publié sous licence Apache 2.0, les développeurs en entreprise peuvent désormais le déployer, le modifier et l'affiner sans dépendre d'API d'inférence propriétaires.

Pourquoi Thinking Machines lance Inkling : contester le monopole des systèmes fermés
En un coup d'œil
- La startup de l'ancienne CTO d'OpenAI, Mira Murati, Thinking Machines Lab, a publié son premier modèle d'IA interne baptisé Inkling, doté d'une licence Apache 2.0 à poids ouverts.
- Le système est un transformateur « Mixture-of-Experts » (MoE) comptant 975 milliards de paramètres au total (41 milliards actifs par tâche), entraîné sur 45 000 milliards de jetons de texte, d'images, d'audio et de vidéo.
- Contrairement aux modèles standards à source fermée, Inkling est conçu comme un point de départ permettant aux organisations de s'affiner elles-mêmes via Tinker, la plateforme de personnalisation de l'entreprise.
La distinction entre les modèles centralisés à usage général et les systèmes personnalisés spécifiques à un domaine connaît une évolution majeure. Au cours des dernières années, les entreprises ont de plus en plus comparé les API propriétaires aux déploiements auto-hébergés à poids ouverts. Inkling entre dans cette compétition en proposant un modèle Apache 2.0 optimisé pour la personnalisation en entreprise plutôt que pour l'inférence hébergée à usage général.
Le lancement d'Inkling reflète une tendance plus large du secteur vers les modèles auto-hébergés à poids ouverts et la personnalisation de l'IA en entreprise. Lorsqu'une société intègre ses secrets industriels, ses bases de code et ses calculs financiers dans un modèle propriétaire, elle court le risque de voir ces connaissances absorbées dans les futures versions publiques du système. Pour de nombreux groupes d'ingénierie à grande échelle, le lancement d'Inkling par Thinking Machines représente une opportunité directe de reprendre le contrôle sur leurs dépendances logicielles essentielles, comme expliqué dans l' annonce officielle de Thinking Machines.

Architecture technique : comment Inkling se compare-t-il à DeepSeek
Au niveau de la couche protocolaire, les transformateurs denses standards activent l'intégralité de leur suite de paramètres pour chaque jeton, ce qui entraîne des coûts de calcul et une latence élevés. Pour résoudre ces goulots d'étranglement, le modèle nouvellement publié utilise une conception « Mixture-of-Experts » (MoE) similaire au modèle phare open source chinois, DeepSeek-V3. Chaque couche MoE contient 256 experts routés et 2 experts partagés, avec seulement 6 experts routés (environ 41 milliards de paramètres actifs) exécutés par jeton. Cela permet au système de conserver une vaste base de connaissances de 975 milliards de paramètres tout en maintenant des coûts d'inférence et une latence faibles.
Pour le mécanisme d'attention, le système entrelace des couches à fenêtre glissante et globales selon un ratio de 5:1, utilisant 8 têtes clé-valeur (KV). Contrairement aux architectures populaires telles que Llama et DeepSeek qui reposent sur le codage positionnel rotatif (RoPE), le système met en œuvre des encodages positionnels relatifs, qui affichent des performances d'extrapolation supérieures sur des séquences à long contexte allant jusqu'à 1 million de jetons. Contrairement à DeepSeek-V3, Inkling est officiellement publié sous licence Apache 2.0 plutôt que MIT, ciblant le même marché des modèles à poids ouverts en entreprise tout en mettant l'accent sur les flux de travail de personnalisation via Tinker.
[Architecture standard de modèle dense] Jeton d'entrée ──> Tous les paramètres actifs (975B) ──> Coût de calcul et latence élevés [Architecture Mixture-of-Experts (MoE)] Jeton d'entrée ──> Routeur basé sur Sigmoid ──> Experts actifs (41B) ──> Inférence rapide à faible coût
Pour de nombreux déploiements MoE à grande échelle, étant donné que l'efficacité de l'inférence dépend de plus en plus de la bande passante mémoire plutôt que du débit arithmétique, de nombreux déploiements s'orientent vers une optimisation de l'inférence centrée sur la mémoire. Bien que le modèle de base ait été pré-entraîné à partir de zéro, la phase de post-entraînement a utilisé un bootstrap de données synthétiques généré par des modèles à poids ouverts existants, notamment Kimi K2.5 de Moonshot AI. Les résultats des tests montrent qu'Inkling atteint des performances comparables à NVIDIA Nemotron 3 Ultra tout en utilisant seulement un tiers des jetons. Les capacités structurelles vérifiées lors du lancement d'Inkling par Thinking Machines démontrent comment les architectures MoE personnalisées réduisent les frais opérationnels globaux, tel que décrit dans le rapport sur les modèles d'interaction de Thinking Machines.
Inkling vs DeepSeek-V3 en un coup d'œil
Pour illustrer les variations techniques entre ces architectures à poids ouverts de premier plan, le tableau de comparaison suivant présente leurs choix de conception de base :
| Métrique technique | Modèle Inkling MoE | Architecture DeepSeek-V3 |
|---|---|---|
| Licence Open Source | Apache 2.0 (Permissive) | MIT (Permissive) |
| Échelle totale des paramètres | 975 milliards de paramètres | 671 milliards de paramètres |
| Paramètres actifs | 41 milliards actifs par jeton | 37 milliards actifs par jeton |
| Taille de la fenêtre contextuelle | Jusqu'à 1 million de jetons | Jusqu'à 128 000 jetons |
| Encodage positionnel | Encodage positionnel relatif | Encodage positionnel rotatif (RoPE) |

Construire vs acheter : stratégies de déploiement à poids ouverts
Alors que les coûts opérationnels liés au maintien d'API d'IA à usage général continuent d'augmenter, la sortie d'Inkling incite également les équipes d'ingénierie à réévaluer leurs stratégies d'infrastructure à long terme. La réévaluation des dépendances système révèle une réalité financière critique : la location de modèles propriétaires peut mener à un piège à double paiement. Satya Nadella a récemment soutenu que les entreprises utilisant l'IA propriétaire paient effectivement deux fois : une fois en frais d'abonnement directs, et une seconde fois en cédant leur savoir-faire commercial exclusif intégré dans les prompts, un point discuté dans le billet de conseil technique de Nadella.
La baisse des coûts d'inférence modifie également la manière dont les entreprises évaluent leurs dépenses d'infrastructure. Dans une perspective FinOps, évaluer s'il faut construire des pipelines locaux personnalisés ou continuer à souscrire à des points de terminaison cloud propriétaires exige une évaluation rigoureuse de l'efficacité informatique. Avec le lancement d'Inkling par Thinking Machines, les développeurs peuvent plus facilement équilibrer les budgets de jetons avec les profils de performance. Étant donné que les poids du modèle sont ouvertement disponibles, les organisations peuvent personnaliser leurs pipelines de déploiement et déployer commercialement des poids personnalisés sans dépendre d'une plateforme propriétaire verrouillée. Ce paradigme de personnalisation est entièrement pris en charge par la plateforme d'affinage de Thinking Machines Lab, Tinker, où les organisations peuvent télécharger des poids privés et exécuter un entraînement ciblé par domaine.
Scénarios de déploiement et sélection de plateforme
Pour aider les architectes d'infrastructure à évaluer leurs configurations d'hébergement face à ces modèles économiques en évolution, la matrice de déploiement suivante présente les compromis standards :
| Scénario de déploiement | Coût d'inférence | Support de personnalisation | Souveraineté des données |
|---|---|---|---|
| API fermées hébergées | Élevé (Facturation par jeton) | Aucun (Valeurs par défaut du système) | Faible (Routage API externe) |
| Inkling auto-hébergé | Moyen (Infrastructure serveur) | Moyen (Mises à jour locales manuelles) | Élevé (Hébergement en priorité local) |
| Inkling affiné sur Tinker | Faible (Runtimes optimisés par tâche) | Élevé (Affinage par programmation) | Élevé (Isolation cloud privé) |
La valeur de l'approche de personnalisation par poids ouverts est démontrée par un projet conjoint entre Thinking Machines et Bridgewater Associates, le plus grand fonds spéculatif au monde. En prenant un modèle ouvert de base et en l'entraînant davantage sur l'expertise financière propriétaire de Bridgewater, les chercheurs ont construit un système qui a obtenu un score de 84,7 % aux tests de raisonnement financier. Ce modèle personnalisé a surpassé les alternatives propriétaires haut de gamme tout en coûtant environ quatorze fois moins cher à faire fonctionner. Ces mesures de performance soutiennent directement les objectifs FinOps, permettant aux développeurs d'équilibrer les budgets de jetons avec les profils de performance, comme documenté dans l' étude sur le raisonnement financier de Bridgewater.

Check-lists d'intégration : comment les équipes d'ingénierie peuvent se préparer aux changements de plateforme
Pour sécuriser les pipelines de données et garantir l'autonomie technique à mesure que les modèles à poids ouverts deviennent la norme de l'industrie, les équipes d'ingénierie et de produit doivent établir une feuille de route de migration claire.
Check-list de mise en œuvre pour les développeurs
- Évaluer les pipelines d'inférence : Configurer des benchmarks de quantification en utilisant des frameworks comme SGLang, vLLM ou llama.cpp pour optimiser l'empreinte mémoire.
- Benchmarker l'utilisation des GPU : Analyser les chemins de routage des experts actifs pour minimiser les contraintes de bande passante mémoire lors des exécutions d'inférence simultanées.
- Auditer les flux d'affinage : Configurer des modèles de personnalisation sur des plateformes comme Tinker pour automatiser les rubriques d'évaluation.
Check-list de stratégie produit et croissance
- Vérifier les paramètres de licence du modèle : Examiner les conditions d'Apache 2.0 pour garantir la conformité en vue d'une redistribution commerciale ultérieure.
- Établir un suivi FinOps : Comparer les coûts d'hébergement serveur à long terme des poids ouverts auto-hébergés par rapport à la facturation par abonnement API cloud pour optimiser les pipelines de calcul.
- Isoler les dépôts de données propriétaires : Établir des bacs à sable de données stricts pour s'assurer que les connaissances sensibles de l'entreprise ne sont pas ingérées par des modèles publics externes.
En établissant ces directives structurées, les équipes de développement peuvent faire transiter leurs applications vers des architectures plus sûres et plus conformes tout en maintenant leur continuité opérationnelle.
Questions fréquemment posées (FAQ)
Pourquoi l'utilisation de modèles propriétaires à source fermée signifie-t-elle que les entreprises "paient deux fois" ?
Quels sont les avantages techniques de l'architecture mixture-of-experts d'Inkling ?
Inkling est-il sûr pour un déploiement en entreprise sans garde-fous centralisés ?
Inkling est-il open source ?
Points clés pour les équipes d'ingénierie
Inkling démontre que l'IA en entreprise s'oriente vers un déploiement personnalisable à poids ouverts. Plutôt que de remplacer purement et simplement les plateformes d'IA propriétaires, Inkling élargit la gamme de stratégies de déploiement offertes aux équipes d'ingénierie en entreprise.
Les organisations adoptant des modèles à poids ouverts privilégieront de plus en plus le déploiement privé, la gouvernance des modèles, l'inférence efficace et l'efficience opérationnelle à long terme plutôt que la dépendance aux API propriétaires. Les équipes doivent donc donner la priorité à une infrastructure capable d'affinage efficace, d'optimisation de l'inférence et de gouvernance.
Share this article



