Thinking Machines lanza Inkling: ¿Cómo se compara con DeepSeek?

opoinstall
2026-07-17
5 min read

¿Thinking Machines lanza Inkling? El anuncio ha sido confirmado oficialmente, ya que Thinking Machines Lab ha presentado Inkling, su primer modelo multimodal de pesos abiertos, diseñado para competir con DeepSeek y otros sistemas de IA de vanguardia. En lugar de posicionar el modelo como una API comercial cerrada, la empresa hace hincapié en la personalización empresarial, el despliegue de pesos abiertos y la reducción de costes operativos para los desarrolladores. Dado que Inkling se publica bajo la licencia Apache 2.0, los desarrolladores de empresas ya pueden desplegarlo, modificarlo y realizar ajustes (fine-tuning) sin depender de APIs de inferencia propietarias.

La consejera delegada de Thinking Machines Lab, Mira Murati, presentando la misión de pesos abiertos durante una conferencia tecnológica

Por qué Thinking Machines lanza Inkling: El reto al monopolio del código cerrado

Un vistazo rápido

  • La startup de la ex-CTO de OpenAI, Mira Murati, Thinking Machines Lab, ha lanzado su primer modelo de IA propio llamado Inkling, bajo una licencia de pesos abiertos Apache 2.0.
  • El sistema es un transformador de tipo Mixture-of-Experts (MoE) con 975 mil millones de parámetros totales (41 mil millones activos por tarea), entrenado con 45 billones de tokens de texto, imagen, audio y vídeo.
  • A diferencia de los modelos de código cerrado estándar, Inkling está diseñado como un punto de partida para que las organizaciones realicen sus propios ajustes utilizando Tinker, la plataforma de personalización de la compañía.

La división entre modelos centralizados de propósito general y sistemas personalizados de dominio específico está viviendo una evolución importante. En los últimos años, las empresas han comparado cada vez más las APIs propietarias con despliegues de pesos abiertos autohospedados. Inkling entra en esta competencia ofreciendo un modelo Apache 2.0 optimizado para la personalización empresarial en lugar de para la inferencia alojada de propósito general.

El lanzamiento de Inkling refleja una tendencia más amplia del sector hacia modelos de pesos abiertos autohospedados y la personalización de IA empresarial. Cuando una empresa introduce sus secretos comerciales sensibles, bases de código y cálculos financieros en un modelo propietario, se arriesga a que ese conocimiento sea absorbido por futuras versiones públicas del sistema. Para muchos grupos de ingeniería a gran escala, cuando Thinking Machines lanza Inkling, representa una oportunidad directa para recuperar el control sobre sus dependencias de software esenciales, tal como se explica en el anuncio oficial de Thinking Machines.

Inkling ejecutando un trabajo de auto-ajuste (fine-tuning) dentro del entorno de consola de Tinker

Arquitectura técnica: Cómo se compara Inkling con DeepSeek

En la capa de protocolo, los transformadores densos estándar activan todo su conjunto de parámetros para cada token, lo que deriva en costes computacionales y latencia elevados. Para resolver estos cuellos de botella de cómputo, el modelo recientemente lanzado utiliza un diseño de Mixture-of-Experts (MoE) similar al estándar de código abierto chino DeepSeek-V3. Cada capa MoE contiene 256 expertos enrutados y 2 expertos compartidos, donde solo 6 expertos enrutados (aproximadamente 41 mil millones de parámetros activos) se ejecutan por token. Esto permite al sistema mantener una vasta base de conocimientos de 975 mil millones de parámetros manteniendo bajos los costes de inferencia y la latencia.

Para el mecanismo de atención, el sistema intercala capas de ventana deslizante y globales en una proporción de 5:1, utilizando 8 cabezas clave-valor (KV). A diferencia de arquitecturas populares como Llama y DeepSeek, que dependen de Rotary Positional Embedding (RoPE), el sistema implementa embeddings posicionales relativos, que muestran un rendimiento de extrapolación superior en secuencias de contexto largo de hasta 1 millón de tokens. A diferencia de DeepSeek-V3, Inkling se publica oficialmente bajo la licencia Apache 2.0 en lugar de MIT, enfocándose en el mismo mercado empresarial de pesos abiertos mientras enfatiza los flujos de trabajo de personalización a través de Tinker.

[Arquitectura de Modelo Denso Estándar]
  Token de entrada ──> Todos los parámetros activos (975B) ──> Alto coste de cómputo y latencia


[Arquitectura Mixture-of-Experts (MoE)]
  Token de entrada ──> Enrutador basado en Sigmoid ──> Expertos activos (41B) ──> Bajo coste, inferencia rápida

Para muchos despliegues MoE a gran escala, dado que la eficiencia de la inferencia depende cada vez más del ancho de banda de la memoria y no solo del rendimiento aritmético, muchos despliegues se están orientando hacia la optimización de inferencia centrada en la memoria. Si bien el modelo base fue preentrenado desde cero, la fase de post-entrenamiento utilizó un arranque de datos sintéticos generado por modelos de pesos abiertos existentes, incluido Kimi K2.5 de Moonshot AI. Los resultados de las pruebas de rendimiento muestran que Inkling logra resultados comparables a NVIDIA Nemotron 3 Ultra utilizando solo un tercio de los tokens. Las capacidades estructurales verificadas cuando Thinking Machines lanza Inkling demuestran cómo las arquitecturas MoE personalizadas reducen los gastos operativos generales, como se describe en el informe de modelos de interacción de Thinking Machines.

Inkling frente a DeepSeek-V3: Vistazo rápido

Para ilustrar las variaciones técnicas entre estas arquitecturas líderes de pesos abiertos, la siguiente tabla comparativa resume sus decisiones de diseño base:

Métrica técnica Modelo MoE Inkling Arquitectura DeepSeek-V3
Licencia de código abierto Apache 2.0 (Permisiva) MIT (Permisiva)
Escala total de parámetros 975 mil millones 671 mil millones
Parámetros activos 41 mil millones por token 37 mil millones por token
Ventana de contexto Hasta 1 millón de tokens Hasta 128 mil tokens
Embedding posicional Relative Positional Embeddings Rotary Positional Embedding (RoPE)

Benchmarks de rendimiento comparando Inkling con GLM 5.2, DeepSeek V4 Pro y Kimi K2.6

Construir frente a comprar: Estrategias de despliegue de pesos abiertos

A medida que los costes operativos de mantener APIs de IA de propósito general siguen aumentando, el lanzamiento de Inkling también impulsa a los equipos de ingeniería a reevaluar sus estrategias de infraestructura a largo plazo. Al reconsiderar las dependencias del sistema se revela una realidad financiera crítica: alquilar modelos propietarios puede llevar a una trampa de pago doble. Satya Nadella argumentó recientemente que las empresas que utilizan IA propietaria pagan efectivamente dos veces: una en costes directos de suscripción y otra al ceder el conocimiento de negocio exclusivo integrado en sus prompts, tema que se discute en la publicación de asesoría técnica de Nadella.

Los costes de inferencia más bajos también cambian la forma en que las empresas evalúan el gasto en infraestructura. Desde una perspectiva FinOps, evaluar si construir pipelines locales personalizados o seguir suscribiéndose a endpoints de nube propietarios exige una evaluación rigurosa de la eficiencia de cómputo. A medida que Thinking Machines lanza Inkling, los desarrolladores pueden equilibrar más fácilmente los presupuestos de tokens con los perfiles de rendimiento. Dado que los pesos del modelo están disponibles abiertamente, las organizaciones pueden personalizar los pipelines de despliegue y comercializar los pesos personalizados sin depender de proveedores cerrados. Este paradigma de personalización cuenta con el respaldo total de la plataforma de ajuste Tinker de Thinking Machines Lab, donde las organizaciones pueden cargar pesos privados y ejecutar entrenamiento de dominio específico.

Escenarios de despliegue y selección de plataforma

Para ayudar a los arquitectos de infraestructura a evaluar sus configuraciones de alojamiento bajo estos modelos económicos cambiantes, la siguiente matriz de despliegue resume las compensaciones estándar:

Escenario de despliegue Coste de inferencia Soporte de personalización Soberanía de datos
APIs de código cerrado alojadas Alto (Precio por token) Ninguno (Valores predeterminados estáticos) Baja (Enrutamiento API externo)
Inkling base autohospedado Medio (Infraestructura de servidor) Medio (Actualizaciones locales manuales) Alta (Alojamiento local)
Inkling ajustado en Tinker Bajo (Runtimes optimizados por tarea) Alta (Ajuste programático) Alta (Aislamiento en nube privada)

El valor del enfoque de personalización de pesos abiertos queda demostrado por un proyecto conjunto entre Thinking Machines y Bridgewater Associates, el fondo de cobertura más grande del mundo. Al tomar un modelo abierto base y entrenarlo adicionalmente con la experiencia financiera propietaria de Bridgewater, los investigadores construyeron un sistema que obtuvo un 84.7% en pruebas de razonamiento financiero. Este modelo personalizado superó a las alternativas propietarias de primer nivel y costó aproximadamente una catorceava parte de ejecutar. Estas métricas de rendimiento respaldan directamente los objetivos de FinOps, permitiendo a los desarrolladores equilibrar los presupuestos de tokens con los perfiles de rendimiento, como se documenta en el estudio sobre razonamiento financiero de Bridgewater.

Métricas de rendimiento de razonamiento financiero del modelo personalizado de Bridgewater Associates en la plataforma Tinker

Listas de verificación de integración: Cómo pueden prepararse los equipos de ingeniería

Para asegurar los pipelines de datos y garantizar la autonomía técnica a medida que los modelos de pesos abiertos se convierten en el estándar de la industria, los equipos de producto e ingeniería deben establecer una hoja de ruta de migración clara.

Lista de verificación para desarrolladores

  • Evaluar pipelines de inferencia: Establecer pruebas comparativas de cuantización utilizando frameworks como SGLang, vLLM o llama.cpp para optimizar el uso de memoria.
  • Analizar la utilización de GPU: Analizar las rutas de enrutamiento de expertos activos para minimizar las restricciones de ancho de banda de memoria durante las inferencias concurrentes.
  • Auditar flujos de ajuste: Configurar plantillas de personalización de modelos en plataformas como Tinker para automatizar rúbricas de evaluación.

Lista de verificación de estrategia de producto y crecimiento

  • Verificar parámetros de licencia: Revisar los términos de Apache 2.0 para garantizar el cumplimiento en caso de redistribución comercial posterior.
  • Establecer monitoreo FinOps: Comparar los costes a largo plazo de servidores autohospedados frente a la facturación de APIs de nube para optimizar los flujos de cómputo.
  • Aislar repositorios de datos propietarios: Establecer sandboxes de datos estrictos para asegurar que el conocimiento sensible de la empresa no sea ingerido por modelos públicos externos.

Al establecer estas directrices estructuradas, los equipos de desarrollo pueden migrar sus aplicaciones a arquitecturas más seguras y conformes a normativas, manteniendo la continuidad operativa.

Preguntas frecuentes (FAQ)

¿Por qué usar modelos propietarios de código cerrado significa que las empresas "pagan dos veces"?
Cuando una empresa envía datos, flujos de trabajo y correcciones de código a través de una API cerrada, paga al proveedor por los tokens consumidos. Simultáneamente, el proveedor puede usar esos prompts y correcciones para entrenar futuras versiones del modelo, capturando esencialmente el conocimiento de negocio único de la empresa sin compensación alguna.
¿Cuáles son las ventajas técnicas de la arquitectura mixture-of-experts de Inkling?
El diseño MoE permite que el modelo contenga una vasta base de conocimientos de 975 mil millones de parámetros mientras activa solo 41 mil millones para cualquier tarea dada. Esta arquitectura ofrece la capacidad de razonamiento de un sistema casi a escala de billones de parámetros, manteniendo la rapidez de ejecución y el bajo coste operativo de un modelo mucho más pequeño.
¿Es Inkling seguro para el despliegue empresarial sin guardrails centralizados?
Thinking Machines entrenó a Inkling para cumplir con estrictos estándares de seguridad contra capacidades peligrosas, riesgos CBRN y privacidad de datos. Al ser un modelo de pesos abiertos, los desarrolladores pueden personalizar y auditar aún más sus guardrails internos en plataformas como Tinker, asegurando un control total sobre los comportamientos de seguridad.
¿Es Inkling de código abierto?
Sí. Como Inkling se publica bajo la licencia permisiva Apache 2.0, las organizaciones pueden modificar, redistribuir y desplegar el modelo comercialmente sin restricciones de licencias propietarias ni costes recurrentes de inferencia alojada.

Conclusiones clave para equipos de ingeniería

Inkling demuestra que la IA empresarial se encamina hacia un despliegue personalizable de pesos abiertos. En lugar de reemplazar por completo las plataformas de IA propietarias, Inkling amplía el rango de estrategias de despliegue disponibles para los equipos de ingeniería empresarial.

Las organizaciones que adopten modelos de pesos abiertos priorizarán cada vez más el despliegue privado, la gobernanza de modelos, la inferencia eficiente y la eficiencia operativa a largo plazo sobre la dependencia de APIs propietarias. Por lo tanto, los equipos deben priorizar infraestructuras capaces de realizar ajustes eficientes, optimización de inferencia y gobernanza.

Share this article