A Thinking Machines lançou o Inkling? Como ele se compara ao DeepSeek

opoinstall
2026-07-17
5 min read

A Thinking Machines lançou o Inkling? Este anúncio foi oficialmente confirmado, com o Thinking Machines Lab apresentando seu primeiro modelo multimodal de pesos abertos, o Inkling, projetado para competir com o DeepSeek e outros sistemas de IA de fronteira. Em vez de posicionar o modelo como uma API comercial fechada, a empresa enfatiza a personalização corporativa, a implementação de pesos abertos e custos operacionais menores para desenvolvedores. Como o Inkling é lançado sob a licença Apache 2.0, os desenvolvedores corporativos agora podem implementar, modificar e realizar ajustes finos sem depender de APIs de inferência proprietárias.

Mira Murati, CEO do Thinking Machines Lab, apresentando a missão de pesos abertos durante uma conferência de tecnologia

Por que a Thinking Machines lançou o Inkling: Desafiando o monopólio de código fechado

Visão geral

  • A startup de Mira Murati, ex-CTO da OpenAI, o Thinking Machines Lab, lançou seu primeiro modelo de IA interno chamado Inkling, com licença de pesos abertos Apache 2.0.
  • O sistema é um transformer de "Mixture-of-Experts" (MoE) com 975 bilhões de parâmetros totais (41 bilhões ativos por tarefa), treinado em 45 trilhões de tokens de texto, imagem, áudio e vídeo.
  • Ao contrário dos modelos padrão de código fechado, o Inkling foi projetado como um ponto de partida para organizações realizarem seus próprios ajustes finos usando o Tinker, a plataforma de personalização da empresa.

A divisão entre modelos centralizados de uso geral e sistemas personalizados para domínios específicos está passando por uma grande evolução. Nos últimos anos, as empresas têm comparado cada vez mais APIs proprietárias com implementações de pesos abertos auto-hospedadas. O Inkling entra nessa concorrência oferecendo um modelo Apache 2.0 otimizado para personalização corporativa, em vez de inferência hospedada de uso geral.

O lançamento do Inkling reflete uma mudança mais ampla da indústria em direção a modelos de pesos abertos auto-hospedados e personalização de IA corporativa. Quando uma empresa alimenta um modelo proprietário com seus segredos comerciais sensíveis, bases de código e cálculos financeiros, corre o risco de ter esse conhecimento absorvido em futuras versões públicas do sistema. Para muitos grupos de engenharia em larga escala, o lançamento do Inkling pela Thinking Machines representa uma oportunidade direta de recuperar o controle sobre dependências essenciais de software, conforme explicado no anúncio oficial da Thinking Machines.

Inkling executando um processo de ajuste fino automático dentro do ambiente do console Tinker

Arquitetura Técnica: Como o Inkling se compara ao DeepSeek

Na camada de protocolo, transformers densos padrão ativam todo o seu conjunto de parâmetros para cada token, resultando em altos custos computacionais e latência. Para resolver esses gargalos de computação, o modelo recém-lançado utiliza um design de "Mixture-of-Experts" (MoE) similar ao principal modelo de código aberto chinês, o DeepSeek-V3. Cada camada MoE contém 256 especialistas roteados e 2 especialistas compartilhados, com apenas 6 especialistas roteados (aproximadamente 41 bilhões de parâmetros ativos) sendo executados por token. Isso permite que o sistema mantenha uma vasta base de conhecimento de 975 bilhões de parâmetros, mantendo baixos os custos de inferência e a latência.

Para o mecanismo de atenção, o sistema intercala camadas de janela deslizante e globais em uma proporção de 5:1, utilizando 8 cabeças de chave-valor (KV). Ao contrário de arquiteturas populares como Llama e DeepSeek, que dependem de Rotary Positional Embedding (RoPE), o sistema implementa embeddings posicionais relativos, que apresentam um desempenho de extrapolação superior em sequências de longo contexto de até 1 milhão de tokens. Diferente do DeepSeek-V3, o Inkling é oficialmente lançado sob a licença Apache 2.0, em vez de MIT, visando o mesmo mercado corporativo de pesos abertos, enfatizando fluxos de trabalho de personalização por meio do Tinker.

[Arquitetura de Modelo Denso Padrão]
  Token de entrada ──> Todos os parâmetros ativos (975B) ──> Alto custo computacional e latência


[Arquitetura Mixture-of-Experts (MoE)]
  Token de entrada ──> Roteador baseado em Sigmoide ──> Especialistas ativos (41B) ──> Baixo custo, inferência rápida

Para muitas implementações de MoE de grande porte, como a eficiência da inferência depende cada vez mais da largura de banda da memória em vez do throughput aritmético, muitas implementações estão migrando para a otimização de inferência centrada em memória. Embora o modelo base tenha sido pré-treinado do zero, a fase de pós-treinamento utilizou um bootstrap de dados sintéticos gerados por modelos de pesos abertos existentes, incluindo o Kimi K2.5 da Moonshot AI. Os resultados dos benchmarks mostram que o Inkling atinge um desempenho comparável ao NVIDIA Nemotron 3 Ultra usando apenas um terço dos tokens. As capacidades estruturais verificadas com o lançamento do Inkling pela Thinking Machines demonstram como arquiteturas MoE personalizadas reduzem a sobrecarga operacional, conforme descrito no relatório de Modelos de Interação da Thinking Machines.

Inkling vs. DeepSeek-V3: Resumo

Para ilustrar as variações técnicas entre essas arquiteturas líderes de pesos abertos, a tabela de comparação a seguir descreve suas escolhas de design de base:

Métrica Técnica Modelo MoE Inkling Arquitetura DeepSeek-V3
Licença de Código Aberto Apache 2.0 (Permissiva) MIT (Permissiva)
Escala Total de Parâmetros 975 Bilhões de parâmetros 671 Bilhões de parâmetros
Parâmetros Ativos 41 Bilhões ativos por token 37 Bilhões ativos por token
Tamanho da Janela de Contexto Até 1 Milhão de tokens Até 128 Mil tokens
Embedding Posicional Embeddings Posicionais Relativos Rotary Positional Embedding (RoPE)

Benchmarks de desempenho abrangentes comparando o Inkling com GLM 5.2, DeepSeek V4 Pro e Kimi K2.6

Construir vs. Comprar: Estratégias de implementação de pesos abertos

À medida que os custos operacionais de manutenção de APIs de IA de uso geral continuam aumentando, o lançamento do Inkling também leva as equipes de engenharia a reavaliar estratégias de infraestrutura de longo prazo. A reavaliação das dependências do sistema revela uma realidade financeira crítica: alugar modelos proprietários pode levar a uma armadilha de pagamento duplo. Satya Nadella argumentou recentemente que as empresas que usam IA proprietária pagam efetivamente duas vezes: uma vez nos custos diretos de assinatura e novamente ao ceder seu conhecimento de negócios proprietário incorporado nos prompts, o que é discutido no artigo de consultoria técnica de Nadella.

Custos de inferência mais baixos também mudam a forma como as empresas avaliam os gastos com infraestrutura. De uma perspectiva de FinOps, avaliar se deve construir pipelines locais personalizados ou continuar assinando terminais de nuvem proprietários exige uma avaliação rigorosa da eficiência computacional. Com o lançamento do Inkling pela Thinking Machines, os desenvolvedores podem equilibrar melhor os orçamentos de tokens com os perfis de desempenho. Como os pesos do modelo estão abertamente disponíveis, as organizações podem personalizar pipelines de implementação e implementar comercialmente pesos personalizados sem o bloqueio de plataformas proprietárias. Este paradigma de personalização é totalmente suportado pela plataforma de ajuste fino do Thinking Machines Lab, o Tinker, onde as organizações podem fazer upload de pesos privados e executar treinamento de domínio direcionado.

Cenários de Implementação e Seleção de Plataforma

Para ajudar os arquitetos de infraestrutura a avaliar suas configurações de hospedagem sob esses modelos econômicos em mudança, a matriz de implementação a seguir descreve os trade-offs padrão:

Cenário de Implementação Custo de Inferência Suporte a Personalização Soberania de Dados
APIs de Código Fechado Hospedadas Alto (Preço medido por token) Nenhum (Padrões de sistema estáticos) Baixa (Roteamento via API externa)
Inkling Base Auto-hospedado Médio (Infraestrutura de servidor) Médio (Atualizações manuais locais) Alta (Hospedagem local primeiro)
Inkling Ajustado no Tinker Baixo (Runtimes otimizados por tarefa) Alta (Ajuste fino programático) Alta (Isolamento em nuvem privada)

O valor da abordagem de personalização de pesos abertos é demonstrado por um projeto conjunto entre a Thinking Machines e a Bridgewater Associates, o maior fundo de hedge do mundo. Ao pegar um modelo aberto de base e treiná-lo ainda mais na expertise financeira proprietária da Bridgewater, os pesquisadores construíram um sistema que obteve 84,7% em testes de raciocínio financeiro. Este modelo personalizado superou alternativas proprietárias de alto nível, custando aproximadamente um décimo quarto do valor de execução. Essas métricas de desempenho apoiam diretamente os objetivos de FinOps, permitindo que os desenvolvedores equilibrem orçamentos de tokens com perfis de desempenho, conforme documentado no estudo de raciocínio financeiro da Bridgewater.

Métricas de desempenho de raciocínio financeiro do modelo personalizado da Bridgewater Associates na plataforma Tinker

Checklists de Integração: Como as equipes de engenharia podem se preparar para mudanças de plataforma

Para proteger pipelines de dados e garantir autonomia técnica à medida que modelos de pesos abertos se tornam o padrão da indústria, as equipes de produto e engenharia devem estabelecer um roteiro claro de migração.

Checklist de Implementação para Desenvolvedores

  • Avaliar Pipelines de Inferência: Configure benchmarks de quantização usando frameworks como SGLang, vLLM ou llama.cpp para otimizar o uso de memória.
  • Benchmarking de Utilização de GPU: Analise caminhos de roteamento de especialistas ativos para minimizar restrições de largura de banda de memória durante execuções de inferência simultâneas.
  • Auditar Fluxos de Trabalho de Ajuste Fino: Configure modelos de personalização na plataforma Tinker para automatizar rubricas de avaliação.

Checklist de Estratégia de Produto e Crescimento

  • Verificar Parâmetros de Licenciamento do Modelo: Revise os termos da Apache 2.0 para garantir a conformidade com a redistribuição comercial subsequente.
  • Estabelecer Monitoramento de FinOps: Compare os custos de hospedagem de servidor a longo prazo de pesos abertos auto-hospedados com a cobrança de assinaturas de API em nuvem medidas para otimizar pipelines de computação.
  • Isolar Repositórios de Dados Proprietários: Estabeleça sandboxes de dados rígidos para garantir que o conhecimento sensível da empresa não seja ingerido por modelos públicos externos.

Ao estabelecer essas diretrizes estruturadas, as equipes de desenvolvimento podem migrar suas aplicações para arquiteturas mais seguras e compatíveis, mantendo a continuidade operacional.

Perguntas Frequentes (FAQ)

Por que usar modelos proprietários de código fechado significa que as empresas "pagam duas vezes"?
Quando uma empresa envia dados, fluxos de trabalho e correções de código proprietários por meio de uma API fechada, ela paga ao provedor pelos tokens consumidos. Simultaneamente, o provedor pode usar esses prompts e correções para treinar futuras versões do modelo, capturando essencialmente o conhecimento de negócios único da empresa sem compensação.
Quais são as vantagens técnicas da arquitetura de mistura de especialistas (MoE) do Inkling?
O design MoE permite que o modelo contenha uma vasta base de conhecimento de 975 bilhões de parâmetros, ativando apenas 41 bilhões de parâmetros para qualquer tarefa específica. Esta arquitetura entrega as capacidades de raciocínio de um sistema de quase um trilhão de parâmetros, mantendo a velocidade de execução rápida e o baixo custo operacional de um modelo muito menor.
O Inkling é seguro para implementação corporativa sem guardrails centralizados?
A Thinking Machines treinou o Inkling para cumprir rígidos padrões de segurança contra capacidades perigosas, CBRN e privacidade de dados. Por ser um modelo de pesos abertos, os desenvolvedores podem personalizar e auditar ainda mais seus guardrails internos em plataformas como o Tinker, garantindo controle total sobre os comportamentos de segurança.
O Inkling é de código aberto?
Sim. Como o Inkling é lançado sob a licença permissiva Apache 2.0, as organizações podem modificar, redistribuir e implementar o modelo comercialmente sem restrições de licenciamento proprietário ou taxas recorrentes de inferência hospedada.

Principais aprendizados para as equipes de engenharia

O Inkling demonstra que a IA corporativa está se movendo em direção à implementação de pesos abertos personalizáveis. Em vez de substituir totalmente as plataformas de IA proprietárias, o Inkling expande a gama de estratégias de implementação disponíveis para as equipes de engenharia corporativas.

As organizações que adotam modelos de pesos abertos priorizarão cada vez mais a implementação privada, governança de modelos, inferência eficiente e eficiência operacional de longo prazo em vez da dependência de APIs proprietárias. Portanto, as equipes devem priorizar infraestruturas capazes de ajuste fino eficiente, otimização de inferência e governança.

Share this article