Thinking Machines lance Inkling : comment se compare-t-il à DeepSeek ?

opoinstall
2026-07-17
5 min read

Thinking Machines lance Inkling ? Cette annonce a été officiellement confirmée, Thinking Machines Lab ayant introduit son premier modèle multimodal à poids ouverts, Inkling, conçu pour concurrencer DeepSeek et d'autres systèmes d'IA de pointe. Plutôt que de positionner le modèle comme une API commerciale fermée, l'entreprise met l'accent sur la personnalisation en entreprise, le déploiement de modèles à poids ouverts et la réduction des coûts opérationnels pour les développeurs. Puisque Inkling est publié sous licence Apache 2.0, les développeurs en entreprise peuvent désormais le déployer, le modifier et l'affiner sans dépendre d'API d'inférence propriétaires.

Mira Murati, PDG de Thinking Machines Lab, présentant la mission des modèles à poids ouverts lors d'une conférence technologique

Pourquoi Thinking Machines lance Inkling : contester le monopole des systèmes fermés

En un coup d'œil

  • La startup de l'ancienne CTO d'OpenAI, Mira Murati, Thinking Machines Lab, a publié son premier modèle d'IA interne baptisé Inkling, doté d'une licence Apache 2.0 à poids ouverts.
  • Le système est un transformateur « Mixture-of-Experts » (MoE) comptant 975 milliards de paramètres au total (41 milliards actifs par tâche), entraîné sur 45 000 milliards de jetons de texte, d'images, d'audio et de vidéo.
  • Contrairement aux modèles standards à source fermée, Inkling est conçu comme un point de départ permettant aux organisations de s'affiner elles-mêmes via Tinker, la plateforme de personnalisation de l'entreprise.

La distinction entre les modèles centralisés à usage général et les systèmes personnalisés spécifiques à un domaine connaît une évolution majeure. Au cours des dernières années, les entreprises ont de plus en plus comparé les API propriétaires aux déploiements auto-hébergés à poids ouverts. Inkling entre dans cette compétition en proposant un modèle Apache 2.0 optimisé pour la personnalisation en entreprise plutôt que pour l'inférence hébergée à usage général.

Le lancement d'Inkling reflète une tendance plus large du secteur vers les modèles auto-hébergés à poids ouverts et la personnalisation de l'IA en entreprise. Lorsqu'une société intègre ses secrets industriels, ses bases de code et ses calculs financiers dans un modèle propriétaire, elle court le risque de voir ces connaissances absorbées dans les futures versions publiques du système. Pour de nombreux groupes d'ingénierie à grande échelle, le lancement d'Inkling par Thinking Machines représente une opportunité directe de reprendre le contrôle sur leurs dépendances logicielles essentielles, comme expliqué dans l' annonce officielle de Thinking Machines.

Inkling exécutant une tâche d'auto-affinage au sein de l'environnement de console Tinker

Architecture technique : comment Inkling se compare-t-il à DeepSeek

Au niveau de la couche protocolaire, les transformateurs denses standards activent l'intégralité de leur suite de paramètres pour chaque jeton, ce qui entraîne des coûts de calcul et une latence élevés. Pour résoudre ces goulots d'étranglement, le modèle nouvellement publié utilise une conception « Mixture-of-Experts » (MoE) similaire au modèle phare open source chinois, DeepSeek-V3. Chaque couche MoE contient 256 experts routés et 2 experts partagés, avec seulement 6 experts routés (environ 41 milliards de paramètres actifs) exécutés par jeton. Cela permet au système de conserver une vaste base de connaissances de 975 milliards de paramètres tout en maintenant des coûts d'inférence et une latence faibles.

Pour le mécanisme d'attention, le système entrelace des couches à fenêtre glissante et globales selon un ratio de 5:1, utilisant 8 têtes clé-valeur (KV). Contrairement aux architectures populaires telles que Llama et DeepSeek qui reposent sur le codage positionnel rotatif (RoPE), le système met en œuvre des encodages positionnels relatifs, qui affichent des performances d'extrapolation supérieures sur des séquences à long contexte allant jusqu'à 1 million de jetons. Contrairement à DeepSeek-V3, Inkling est officiellement publié sous licence Apache 2.0 plutôt que MIT, ciblant le même marché des modèles à poids ouverts en entreprise tout en mettant l'accent sur les flux de travail de personnalisation via Tinker.

[Architecture standard de modèle dense]
  Jeton d'entrée ──> Tous les paramètres actifs (975B) ──> Coût de calcul et latence élevés


[Architecture Mixture-of-Experts (MoE)]
  Jeton d'entrée ──> Routeur basé sur Sigmoid ──> Experts actifs (41B) ──> Inférence rapide à faible coût

Pour de nombreux déploiements MoE à grande échelle, étant donné que l'efficacité de l'inférence dépend de plus en plus de la bande passante mémoire plutôt que du débit arithmétique, de nombreux déploiements s'orientent vers une optimisation de l'inférence centrée sur la mémoire. Bien que le modèle de base ait été pré-entraîné à partir de zéro, la phase de post-entraînement a utilisé un bootstrap de données synthétiques généré par des modèles à poids ouverts existants, notamment Kimi K2.5 de Moonshot AI. Les résultats des tests montrent qu'Inkling atteint des performances comparables à NVIDIA Nemotron 3 Ultra tout en utilisant seulement un tiers des jetons. Les capacités structurelles vérifiées lors du lancement d'Inkling par Thinking Machines démontrent comment les architectures MoE personnalisées réduisent les frais opérationnels globaux, tel que décrit dans le rapport sur les modèles d'interaction de Thinking Machines.

Inkling vs DeepSeek-V3 en un coup d'œil

Pour illustrer les variations techniques entre ces architectures à poids ouverts de premier plan, le tableau de comparaison suivant présente leurs choix de conception de base :

Métrique technique Modèle Inkling MoE Architecture DeepSeek-V3
Licence Open Source Apache 2.0 (Permissive) MIT (Permissive)
Échelle totale des paramètres 975 milliards de paramètres 671 milliards de paramètres
Paramètres actifs 41 milliards actifs par jeton 37 milliards actifs par jeton
Taille de la fenêtre contextuelle Jusqu'à 1 million de jetons Jusqu'à 128 000 jetons
Encodage positionnel Encodage positionnel relatif Encodage positionnel rotatif (RoPE)

Benchmarks de performances complets comparant Inkling avec GLM 5.2, DeepSeek V4 Pro et Kimi K2.6

Construire vs acheter : stratégies de déploiement à poids ouverts

Alors que les coûts opérationnels liés au maintien d'API d'IA à usage général continuent d'augmenter, la sortie d'Inkling incite également les équipes d'ingénierie à réévaluer leurs stratégies d'infrastructure à long terme. La réévaluation des dépendances système révèle une réalité financière critique : la location de modèles propriétaires peut mener à un piège à double paiement. Satya Nadella a récemment soutenu que les entreprises utilisant l'IA propriétaire paient effectivement deux fois : une fois en frais d'abonnement directs, et une seconde fois en cédant leur savoir-faire commercial exclusif intégré dans les prompts, un point discuté dans le billet de conseil technique de Nadella.

La baisse des coûts d'inférence modifie également la manière dont les entreprises évaluent leurs dépenses d'infrastructure. Dans une perspective FinOps, évaluer s'il faut construire des pipelines locaux personnalisés ou continuer à souscrire à des points de terminaison cloud propriétaires exige une évaluation rigoureuse de l'efficacité informatique. Avec le lancement d'Inkling par Thinking Machines, les développeurs peuvent plus facilement équilibrer les budgets de jetons avec les profils de performance. Étant donné que les poids du modèle sont ouvertement disponibles, les organisations peuvent personnaliser leurs pipelines de déploiement et déployer commercialement des poids personnalisés sans dépendre d'une plateforme propriétaire verrouillée. Ce paradigme de personnalisation est entièrement pris en charge par la plateforme d'affinage de Thinking Machines Lab, Tinker, où les organisations peuvent télécharger des poids privés et exécuter un entraînement ciblé par domaine.

Scénarios de déploiement et sélection de plateforme

Pour aider les architectes d'infrastructure à évaluer leurs configurations d'hébergement face à ces modèles économiques en évolution, la matrice de déploiement suivante présente les compromis standards :

Scénario de déploiement Coût d'inférence Support de personnalisation Souveraineté des données
API fermées hébergées Élevé (Facturation par jeton) Aucun (Valeurs par défaut du système) Faible (Routage API externe)
Inkling auto-hébergé Moyen (Infrastructure serveur) Moyen (Mises à jour locales manuelles) Élevé (Hébergement en priorité local)
Inkling affiné sur Tinker Faible (Runtimes optimisés par tâche) Élevé (Affinage par programmation) Élevé (Isolation cloud privé)

La valeur de l'approche de personnalisation par poids ouverts est démontrée par un projet conjoint entre Thinking Machines et Bridgewater Associates, le plus grand fonds spéculatif au monde. En prenant un modèle ouvert de base et en l'entraînant davantage sur l'expertise financière propriétaire de Bridgewater, les chercheurs ont construit un système qui a obtenu un score de 84,7 % aux tests de raisonnement financier. Ce modèle personnalisé a surpassé les alternatives propriétaires haut de gamme tout en coûtant environ quatorze fois moins cher à faire fonctionner. Ces mesures de performance soutiennent directement les objectifs FinOps, permettant aux développeurs d'équilibrer les budgets de jetons avec les profils de performance, comme documenté dans l' étude sur le raisonnement financier de Bridgewater.

Métriques de performance de raisonnement financier du modèle personnalisé de Bridgewater Associates sur la plateforme Tinker

Check-lists d'intégration : comment les équipes d'ingénierie peuvent se préparer aux changements de plateforme

Pour sécuriser les pipelines de données et garantir l'autonomie technique à mesure que les modèles à poids ouverts deviennent la norme de l'industrie, les équipes d'ingénierie et de produit doivent établir une feuille de route de migration claire.

Check-list de mise en œuvre pour les développeurs

  • Évaluer les pipelines d'inférence : Configurer des benchmarks de quantification en utilisant des frameworks comme SGLang, vLLM ou llama.cpp pour optimiser l'empreinte mémoire.
  • Benchmarker l'utilisation des GPU : Analyser les chemins de routage des experts actifs pour minimiser les contraintes de bande passante mémoire lors des exécutions d'inférence simultanées.
  • Auditer les flux d'affinage : Configurer des modèles de personnalisation sur des plateformes comme Tinker pour automatiser les rubriques d'évaluation.

Check-list de stratégie produit et croissance

  • Vérifier les paramètres de licence du modèle : Examiner les conditions d'Apache 2.0 pour garantir la conformité en vue d'une redistribution commerciale ultérieure.
  • Établir un suivi FinOps : Comparer les coûts d'hébergement serveur à long terme des poids ouverts auto-hébergés par rapport à la facturation par abonnement API cloud pour optimiser les pipelines de calcul.
  • Isoler les dépôts de données propriétaires : Établir des bacs à sable de données stricts pour s'assurer que les connaissances sensibles de l'entreprise ne sont pas ingérées par des modèles publics externes.

En établissant ces directives structurées, les équipes de développement peuvent faire transiter leurs applications vers des architectures plus sûres et plus conformes tout en maintenant leur continuité opérationnelle.

Questions fréquemment posées (FAQ)

Pourquoi l'utilisation de modèles propriétaires à source fermée signifie-t-elle que les entreprises "paient deux fois" ?
Lorsqu'une entreprise envoie des données propriétaires, des flux de travail et des corrections de code via une API fermée, elle paie le fournisseur pour les jetons consommés. Simultanément, le fournisseur peut utiliser ces prompts et corrections pour entraîner de futures versions du modèle, capturant essentiellement le savoir-faire unique de l'entreprise sans compensation.
Quels sont les avantages techniques de l'architecture mixture-of-experts d'Inkling ?
La conception MoE permet au modèle de contenir une vaste base de connaissances de 975 milliards de paramètres tout en n'activant que 41 milliards de paramètres pour une tâche donnée. Cette architecture offre les capacités de raisonnement d'un système proche du millier de milliards de paramètres tout en conservant la vitesse d'exécution rapide et le faible coût opérationnel d'un modèle beaucoup plus petit.
Inkling est-il sûr pour un déploiement en entreprise sans garde-fous centralisés ?
Thinking Machines a entraîné Inkling pour se conformer à des normes de sécurité strictes concernant les capacités dangereuses, les risques NRBC et la confidentialité des données. S'agissant d'un modèle à poids ouverts, les développeurs peuvent personnaliser et auditer davantage ses garde-fous internes sur des plateformes comme Tinker, garantissant un contrôle total sur les comportements de sécurité.
Inkling est-il open source ?
Oui. Parce qu'Inkling est publié sous la licence permissive Apache 2.0, les organisations peuvent modifier, redistribuer et déployer le modèle commercialement sans restrictions de licence propriétaires ni frais d'inférence hébergée récurrents.

Points clés pour les équipes d'ingénierie

Inkling démontre que l'IA en entreprise s'oriente vers un déploiement personnalisable à poids ouverts. Plutôt que de remplacer purement et simplement les plateformes d'IA propriétaires, Inkling élargit la gamme de stratégies de déploiement offertes aux équipes d'ingénierie en entreprise.

Les organisations adoptant des modèles à poids ouverts privilégieront de plus en plus le déploiement privé, la gouvernance des modèles, l'inférence efficace et l'efficience opérationnelle à long terme plutôt que la dépendance aux API propriétaires. Les équipes doivent donc donner la priorité à une infrastructure capable d'affinage efficace, d'optimisation de l'inférence et de gouvernance.

Share this article