Thinking Machines представляет Inkling: как он соотносится с DeepSeek

opoinstall
2026-07-17
5 min read

Thinking Machines анонсирует Inkling: это официально подтвержденный запуск первой мультимодальной модели Thinking Machines Lab с открытыми весами, созданной для конкуренции с DeepSeek и другими передовыми ИИ-системами. Вместо того чтобы предлагать модель в виде закрытого коммерческого API, компания делает упор на кастомизацию для корпоративного сектора, развертывание с открытыми весами и снижение операционных расходов для разработчиков. Поскольку Inkling выпущена по лицензии Apache 2.0, корпоративные разработчики могут развертывать, изменять и дообучать ее, не завися от проприетарных API для вывода (инференса).

Генеральный директор Thinking Machines Lab Мира Мурати представляет миссию по открытию весов моделей на технологической конференции

Почему Thinking Machines запускает Inkling: вызов монополии закрытого ПО

Краткий обзор

  • Стартап Thinking Machines Lab под руководством бывшего технического директора OpenAI Миры Мурати выпустил свою первую собственную ИИ-модель Inkling с открытой лицензией Apache 2.0.
  • Система представляет собой трансформер архитектуры Mixture-of-Experts (MoE) с общим количеством 975 миллиардов параметров (41 миллиард активных параметров на задачу), обученный на 45 триллионах токенов текста, изображений, аудио и видео.
  • В отличие от стандартных закрытых моделей, Inkling спроектирована как фундамент, который организации могут дообучать самостоятельно с помощью Tinker — фирменной платформы для кастомизации.

Разрыв между централизованными моделями общего назначения и специализированными системами проходит через период масштабной трансформации. За последние несколько лет предприятия все чаще сравнивают проприетарные API с самохостируемыми развертываниями моделей с открытыми весами. Inkling вступает в эту конкуренцию, предлагая модель Apache 2.0, оптимизированную для корпоративной настройки, а не для размещения в облаке как сервиса общего пользования.

Запуск Inkling отражает более широкий отраслевой тренд на использование самохостируемых моделей и кастомизацию ИИ для бизнеса. Когда компания передает конфиденциальную информацию, кодовую базу или финансовые расчеты в проприетарную модель, она рискует тем, что эти данные будут интегрированы в будущие публичные версии системы. Как поясняется в официальном анонсе Thinking Machines, для крупных инженерных команд запуск Inkling — это реальная возможность вернуть контроль над критически важными программными зависимостями.

Inkling выполняет процесс самостоятельного дообучения в консольной среде Tinker

Техническая архитектура: сравнение Inkling и DeepSeek

На уровне протоколов стандартные плотные трансформеры активируют весь набор параметров для каждого токена, что приводит к высоким вычислительным затратам и задержкам. Чтобы устранить эти «узкие места», новая модель использует архитектуру Mixture-of-Experts (MoE), аналогичную флагману DeepSeek-V3. Каждый слой MoE содержит 256 маршрутизируемых экспертов и 2 общих эксперта, при этом для каждого токена активируются только 6 маршрутизируемых экспертов (около 41 миллиарда параметров). Это позволяет системе поддерживать базу знаний из 975 миллиардов параметров при сохранении низкой стоимости и высокой скорости вывода.

Что касается механизма внимания, система чередует скользящее окно и глобальные слои в соотношении 5:1, используя 8 головок KV (key-value). В отличие от популярных архитектур, таких как Llama и DeepSeek, которые полагаются на относительное позиционное кодирование (RoPE), система внедряет относительные позиционные эмбеддинги, демонстрирующие превосходную экстраполяцию на длинных контекстных последовательностях до 1 миллиона токенов. В отличие от DeepSeek-V3, Inkling официально выпущена под лицензией Apache 2.0, а не MIT, ориентируясь на корпоративный рынок открытых весов и emphasizing рабочие процессы настройки через Tinker.

[Архитектура стандартной плотной модели]
  Входящий токен ──> Все параметры активны (975B) ──> Высокие вычислительные затраты и задержки


[Архитектура Mixture-of-Experts (MoE)]
  Входящий токен ──> Маршрутизатор на базе сигмоиды ──> Активные эксперты (41B) ──> Низкая стоимость, быстрый вывод

Для многих масштабных MoE-развертываний, где эффективность вывода все больше зависит от пропускной способности памяти, а не от арифметической производительности, фокус смещается в сторону оптимизации с учетом работы с памятью. Хотя базовая модель была предобучена «с нуля», этап дообучения (post-training) использовал синтетический датасет, сгенерированный существующими моделями с открытыми весами, включая Kimi K2.5 от Moonshot AI. Результаты тестирования показывают, что Inkling достигает производительности, сопоставимой с NVIDIA Nemotron 3 Ultra, используя лишь треть объема токенов. Как описано в отчете Thinking Machines Interaction Models, структурные возможности Inkling наглядно показывают, как кастомные MoE-архитектуры сокращают общие операционные издержки.

Inkling против DeepSeek-V3: краткое сравнение

Чтобы проиллюстрировать технические различия между этими ведущими архитектурами, ниже приведена таблица сравнения их базовых проектных решений:

Техническая метрика Модель Inkling MoE Архитектура DeepSeek-V3
Лицензия Apache 2.0 (разрешительная) MIT (разрешительная)
Общий объем параметров 975 миллиардов 671 миллиард
Активные параметры 41 млрд на токен 37 млрд на токен
Размер контекстного окна До 1 миллиона токенов До 128 тысяч токенов
Позиционное кодирование Относительные эмбеддинги Rotary Positional Embedding (RoPE)

Комплексные тесты производительности Inkling в сравнении с GLM 5.2, DeepSeek V4 Pro и Kimi K2.6

Разработка или покупка: стратегии развертывания моделей с открытыми весами

По мере роста операционных расходов на поддержку ИИ-API общего назначения, выход Inkling побуждает инженерные команды пересмотреть долгосрочные инфраструктурные стратегии. Анализ зависимостей выявляет финансовую ловушку: аренда проприетарных моделей вынуждает бизнес «платить дважды». Сатья Наделла недавно отметил, что компании, использующие проприетарный ИИ, фактически платят дважды: сначала в виде прямых подписок, а затем — передавая свое уникальное ноу-хау, заложенное в промпты, о чем подробно говорится в техническом обзоре Наделлы.

Более низкие затраты на инференс также меняют подход к оценке расходов на инфраструктуру. С точки зрения FinOps, выбор между созданием кастомных локальных пайплайнов и подпиской на облачные API требует тщательного расчета вычислительной эффективности. С выходом Inkling разработчикам проще балансировать бюджеты токенов и профили производительности. Поскольку веса модели доступны публично, организации могут настраивать конвейеры развертывания и коммерчески эксплуатировать кастомизированные версии без привязки к проприетарным платформам. Этот подход полностью поддерживается платформой Tinker от Thinking Machines Lab, где организации могут загружать приватные веса и выполнять обучение под конкретные доменные задачи.

Сценарии развертывания и выбор платформы

Чтобы помочь архитекторам инфраструктуры оценить варианты хостинга в условиях меняющихся экономических моделей, следующая матрица описывает стандартные компромиссы:

Сценарий развертывания Стоимость вывода Поддержка кастомизации Суверенитет данных
Облачные закрытые API Высокая (оплата за токен) Нет (стандартные настройки) Низкий (внешний маршрут)
Самохостинг базовой Inkling Средняя (серверная инфраструктура) Средняя (ручные обновления) Высокий (локальный хостинг)
Inkling на Tinker Низкая (оптимизированный ран-тайм) Высокая (программное дообучение) Высокий (изоляция в частном облаке)

Эффективность подхода с кастомизацией моделей с открытыми весами подтверждается совместным проектом Thinking Machines и Bridgewater Associates, крупнейшим в мире хедж-фондом. Взяв за основу базовую модель и дообучив ее на своих проприетарных финансовых данных, исследователи создали систему, получившую 84,7% в тестах на финансовое мышление. Эта кастомная модель превзошла проприетарные аналоги, при этом затраты на её эксплуатацию составили примерно одну четырнадцатую от стоимости альтернатив. Эти показатели напрямую отвечают целям FinOps, позволяя разработчикам гибко управлять бюджетами и производительностью, как описано в исследовании Bridgewater по финансовому анализу.

Метрики производительности финансового анализа кастомной модели Bridgewater Associates на платформе Tinker

Чек-листы интеграции: как подготовить инженерные команды к смене платформы

Чтобы обеспечить безопасность конвейеров данных и техническую автономию, по мере того как модели с открытыми весами становятся индустриальным стандартом, командам необходимо разработать четкую дорожную карту миграции.

Чек-лист для разработчиков

  • Оценка пайплайнов инференса: Настройте бенчмарки квантования с использованием фреймворков вроде SGLang, vLLM или llama.cpp для оптимизации потребления памяти.
  • Анализ использования GPU: Проанализируйте пути маршрутизации активных экспертов, чтобы минимизировать ограничения пропускной способности памяти при параллельном выводе.
  • Аудит рабочих процессов дообучения: Настройте шаблоны кастомизации моделей на платформе Tinker для автоматизации критериев оценки.

Чек-лист для стратегии продукта и роста

  • Проверка лицензирования: Изучите условия Apache 2.0, чтобы обеспечить соблюдение требований при коммерческом распространении.
  • Внедрение мониторинга FinOps: Сравните долгосрочные затраты на хостинг самохостируемых моделей с тарифами облачных API для оптимизации вычислительных мощностей.
  • Изоляция проприетарных репозиториев: Установите строгие «песочницы» для данных, чтобы гарантировать, что конфиденциальные корпоративные знания не попадут в публичные внешние модели.

Следуя этим структурированным рекомендациям, команды разработки смогут перевести свои приложения на более безопасные и прозрачные архитектуры, сохраняя при этом непрерывность бизнес-процессов.

Часто задаваемые вопросы (FAQ)

Почему использование закрытых проприетарных моделей означает, что компании «платят дважды»?
Когда предприятие передает свои данные, бизнес-процессы и исправления кода через закрытый API, оно платит провайдеру за потребленные токены. При этом провайдер может использовать эти промпты и уточнения для обучения будущих версий модели, фактически присваивая себе уникальные бизнес-знания предприятия без какой-либо компенсации.
В чем технические преимущества архитектуры Inkling Mixture-of-Experts?
Архитектура MoE позволяет модели обладать базой знаний в 975 миллиардов параметров, активируя при этом только 41 миллиард для решения конкретной задачи. Такая структура обеспечивает интеллектуальные возможности системы почти с триллионом параметров, сохраняя при этом скорость и низкую стоимость работы гораздо более легкой модели.
Безопасен ли Inkling для корпоративного развертывания без централизованных защитных барьеров?
Thinking Machines обучила Inkling в соответствии со строгими стандартами безопасности, включая предотвращение опасных сценариев, работу с химическим и биологическим оружием (CBRN) и конфиденциальность данных. Поскольку это модель с открытыми весами, разработчики могут дополнительно настраивать и проверять внутренние фильтры безопасности на платформе Tinker, сохраняя полный контроль над поведением системы.
Является ли Inkling проектом с открытым исходным кодом?
Да. Inkling выпущена под разрешительной лицензией Apache 2.0, что позволяет организациям модифицировать, распространять и развертывать модель в коммерческих целях без ограничений проприетарных лицензий или регулярных платежей за облачный вывод.

Основные выводы для инженерных команд

Inkling доказывает, что корпоративный ИИ движется в сторону кастомизируемых моделей с открытыми весами. Вместо того чтобы полностью вытеснить проприетарные платформы, Inkling расширяет диапазон стратегий развертывания, доступных для инженерных команд.

Организации, внедряющие модели с открытыми весами, будут все чаще отдавать приоритет приватному развертыванию, управлению моделями, эффективному инференсу и долгосрочной операционной эффективности, отказываясь от зависимости от закрытых API. Командам следует сфокусироваться на инфраструктуре, способной обеспечить качественное дообучение, оптимизацию вывода и надежное управление данными.

Share this article