Thinking Machines 发布 Inkling?此消息已获官方确认。Thinking Machines Lab 推出了其首个开放权重的多模态模型 Inkling,旨在与 DeepSeek 及其他前沿 AI 系统展开竞争。该公司并未将此模型定位为封闭的商业 API,而是强调了企业定制化、开放权重部署以及降低开发者运营成本的价值。由于 Inkling 是以 Apache 2.0 协议发布的开放权重模型,企业开发者无需依赖专有的推理 API,即可进行部署、修改和微调。

为什么 Thinking Machines 要发布 Inkling:挑战闭源垄断
核心速览
- 前 OpenAI 首席技术官 Mira Murati 的创业公司 Thinking Machines Lab 发布了其首款自研 AI 模型 Inkling,采用开放的 Apache 2.0 协议。
- 该系统是一个拥有 9750 亿总参数的混合专家(MoE)Transformer 模型(单任务活跃参数为 410 亿),基于 45 万亿个文本、图像、音频和视频 Token 训练而成。
- 与标准的闭源模型不同,Inkling 被设计为一个起点,供组织利用公司旗下的定制化平台 Tinker 进行自主微调。
中心化通用模型与定制化领域专用系统之间的分界线正在经历重大演变。在过去几年中,企业越来越倾向于将私有 API 与自托管的开放权重部署进行对比。Inkling 通过提供针对企业定制化优化的 Apache 2.0 模型进入了这一竞争领域,而非提供通用的托管式推理服务。
Inkling 的发布反映了行业向自托管开放权重模型和企业 AI 定制化的更广泛转型。当企业将其敏感的商业机密、代码库和财务运算输入到闭源模型中时,其知识资产面临被纳入模型未来公共版本的风险。对于许多大型工程团队而言,Thinking Machines 发布 Inkling 意味着获得了一个重夺核心软件依赖控制权的直接机会,正如 Thinking Machines 官方公告 所解释的那样。

技术架构:Inkling 与 DeepSeek 的对比
在协议层面上,标准的稠密 Transformer 会为每一个 Token 激活全部参数组,从而导致高额的计算成本和延迟。为了解决这些计算瓶颈,该模型采用了与中国开源旗舰 DeepSeek-V3 类似的混合专家(MoE)设计。每个 MoE 层包含 256 个路由专家和 2 个共享专家,每个 Token 执行时仅调用 6 个路由专家(约 410 亿活跃参数)。这使得系统既能维持 9750 亿参数的庞大知识库,又能保持低推理成本和低延迟。
在注意力机制方面,系统以 5:1 的比例交替使用滑动窗口和全局层,并利用 8 个键值(KV)头。与依赖旋转位置嵌入(RoPE)的 Llama 和 DeepSeek 等主流架构不同,该系统实现了相对位置嵌入,在长达 100 万 Token 的长上下文序列中表现出更强的外推性能。与 DeepSeek-V3 不同,Inkling 是在 Apache 2.0 协议下正式发布的,而非 MIT 许可,其目标同样是企业级开放权重市场,同时强调通过 Tinker 平台进行定制化工作流。
[标准稠密模型架构] 输入 Token ──> 全部参数激活 (975B) ──> 高计算成本与延迟 [混合专家 (MoE) 架构] 输入 Token ──> 基于 Sigmoid 的路由 ──> 活跃专家 (41B) ──> 低成本、快速推理
对于许多大型 MoE 部署而言,由于推理效率日益依赖于内存带宽而非算力吞吐量,许多部署正在向以内存为中心的推理优化方向转变。虽然基础模型是从零开始预训练的,但后训练阶段使用了由现有开放权重模型(包括 Moonshot AI 的 Kimi K2.5)生成的合成数据进行引导。基准测试结果显示,Inkling 的性能可与 NVIDIA Nemotron 3 Ultra 相媲美,但 Token 使用量仅为后者的三分之一。正如 Thinking Machines 交互模型报告 所述,当 Thinking Machines 发布 Inkling 时所验证的结构性能力,展示了定制化 MoE 架构如何降低整体运营开销。
Inkling 与 DeepSeek-V3 速览
为了直观展示这些领先的开放权重架构之间的技术差异,下表概述了它们的基准设计选择:
| 技术指标 | Inkling MoE 模型 | DeepSeek-V3 架构 |
|---|---|---|
| 开源协议 | Apache 2.0 (宽松型) | MIT (宽松型) |
| 总参数规模 | 9750 亿总参数 | 6710 亿总参数 |
| 活跃参数 | 每个 Token 活跃 410 亿 | 每个 Token 活跃 370 亿 |
| 上下文窗口大小 | 最高 100 万 Token | 最高 12.8 万 Token |
| 位置嵌入 | 相对位置嵌入 | 旋转位置嵌入 (RoPE) |

构建还是购买:开放权重部署策略
随着通用 AI API 的运营成本不断上升,Inkling 的发布也促使工程团队重新评估其长期的基础设施策略。对系统依赖关系的重新考量揭示了一个关键的财务现实:租赁专有模型可能会导致“双重付费”陷阱。Satya Nadella 最近指出,使用专有 AI 的企业实际上支付了两次成本:一次是直接的订阅费用,另一次是交出了嵌入在提示词中的商业机密,这在 Nadella 技术建议文章 中有所探讨。
较低的推理成本也改变了企业评估基础设施支出的方式。从 FinOps 的角度来看,权衡是构建定制化的本地流水线,还是继续订阅专有的云端接口,需要对计算效率进行严格评估。随着 Thinking Machines 发布 Inkling,开发者可以更轻松地平衡 Token 预算与性能要求。由于模型权重是公开可用的,组织可以定制部署流水线,并在无专有平台锁定的情况下进行商业部署。这种定制化模式得到了 Thinking Machines Lab 微调平台 Tinker 的全力支持,组织可以在该平台上上传私有权重并执行针对性的领域训练。
部署场景与平台选择
为了帮助基础设施架构师在这些变化的经济模型下评估其托管配置,下表总结了标准权衡方案:
| 部署场景 | 推理成本 | 定制化支持 | 数据主权 |
|---|---|---|---|
| 托管式闭源 API | 高 (按 Token 定价) | 无 (静态系统默认值) | 低 (外部 API 路由) |
| 自托管基础 Inkling | 中 (服务器基础设施) | 中 (手动本地更新) | 高 (本地优先托管) |
| 基于 Tinker 微调 Inkling | 低 (优化任务专用运行时) | 高 (程序化微调) | 高 (私有云隔离) |
Thinking Machines 与全球最大对冲基金 Bridgewater Associates 的联合项目展示了这种开放权重定制化方法的价值。通过采用基础开放模型并针对 Bridgewater 的专有金融专业知识进行深入训练,研究人员构建了一个在金融推理测试中得分 84.7% 的系统。该定制化模型表现优于顶级专有替代方案,而运行成本仅为后者的十四分之一。这些性能指标直接支持了 FinOps 目标,使开发者能够在 Token 预算与性能档案之间取得平衡,正如 Bridgewater 金融推理研究 中所记录的那样。

集成清单:工程团队如何应对平台变更
随着开放权重模型成为行业标准,为了确保数据流安全并维持技术自主权,工程和产品团队必须建立明确的迁移路线图。
开发者实施清单
- 评估推理流水线:使用 SGLang、vLLM 或 llama.cpp 等框架建立量化基准,以优化内存占用。
- 基准化 GPU 利用率:分析活跃专家路由路径,以最大限度地减少并发推理运行时的内存带宽瓶颈。
- 审核微调工作流:在 Tinker 等平台上配置模型定制化模板,以自动化评估标准。
产品与增长策略清单
- 验证模型许可参数:审查 Apache 2.0 条款,确保后续商业再分发的合规性。
- 建立 FinOps 监控:对比自托管开放权重的长期服务器托管成本与按需云 API 订阅账单,以优化计算流水线。
- 隔离专有数据仓库:建立严格的数据沙箱,确保敏感的公司知识不会被外部公共模型摄取。
通过建立这些结构化的指导方针,开发团队可以将其应用程序迁移到更安全、更合规的架构,同时保持运营连续性。
常见问题解答 (FAQ)
为什么使用闭源专有模型意味着企业要“支付两次”成本?
Inkling 的混合专家架构在技术上有什么优势?
Inkling 在没有集中式护栏的情况下进行企业部署是否安全?
Inkling 是开源的吗?
工程团队的关键结论
Inkling 展示了企业 AI 正向可定制的开放权重部署方向发展。Inkling 并非要完全取代专有 AI 平台,而是扩展了企业工程团队可用的部署策略范围。
采用开放权重模型的组织将越来越倾向于优先考虑私有部署、模型治理、高效推理以及长期运营效率,而非对专有 API 的依赖。因此,团队应优先部署能够胜任高效微调、推理优化和治理的基础设施。
Share this article



