Thinking Machines Melancarkan Inkling? Bagaimana Ia Dibandingkan dengan DeepSeek

opoinstall
2026-07-17
5 min read

Thinking Machines Melancarkan Inkling? Pengumuman ini telah disahkan secara rasmi apabila Thinking Machines Lab memperkenalkan model multimodal 'open-weight' pertamanya, Inkling, yang direka untuk bersaing dengan DeepSeek dan sistem AI sempadan yang lain. Daripada meletakkan model ini sebagai API komersial tertutup, syarikat menekankan penyesuaian perusahaan, penggunaan 'open-weight', dan kos operasi yang lebih rendah bagi pembangun. Oleh kerana Inkling dikeluarkan sebagai model 'open-weight' Apache 2.0, pembangun perusahaan kini boleh menggunakan, mengubah suai, dan melaras halusnya tanpa bergantung kepada API inferens proprietari.

Ketua Pegawai Eksekutif Thinking Machines Lab, Mira Murati, membentangkan misi 'open-weights' semasa persidangan teknologi

Mengapa Thinking Machines Melancarkan Inkling: Mencabar Monopoli Sumber Tertutup

Sekilas Pandang

  • Permulaan bekas CTO OpenAI, Mira Murati iaitu Thinking Machines Lab, telah melancarkan model AI dalaman pertamanya bernama Inkling, yang menampilkan lesen Apache 2.0 'open-weight'.
  • Sistem ini merupakan transformer Mixture-of-Experts (MoE) dengan 975 bilion jumlah parameter (41 bilion aktif setiap tugasan), yang dilatih menggunakan 45 trilion token teks, imej, audio, dan video.
  • Tidak seperti model sumber tertutup standard, Inkling direka sebagai titik permulaan untuk organisasi melaras halus sistem mereka sendiri menggunakan Tinker, iaitu platform penyesuaian syarikat tersebut.

Pembahagian antara model berpusat untuk tujuan umum dan sistem tersuai khusus domain sedang mengalami evolusi besar. Sejak beberapa tahun kebelakangan ini, syarikat perusahaan semakin membandingkan API proprietari dengan penggunaan 'open-weight' yang dihoskan sendiri. Inkling menyertai persaingan ini dengan menawarkan model Apache 2.0 yang dioptimumkan untuk penyesuaian perusahaan berbanding inferens yang dihoskan bagi tujuan umum.

Pelancaran Inkling mencerminkan anjakan industri yang lebih luas ke arah model 'open-weight' yang dihoskan sendiri dan penyesuaian AI perusahaan. Apabila sesebuah syarikat memasukkan rahsia perdagangan sensitif, pangkalan kod, dan pengiraan kewangan mereka ke dalam model proprietari, ia berisiko membiarkan pengetahuan itu diserap ke dalam versi awam sistem tersebut pada masa hadapan. Bagi banyak kumpulan kejuruteraan berskala besar, apabila Thinking Machines melancarkan Inkling, ia mewakili peluang langsung untuk menuntut semula kawalan ke atas kebergantungan perisian teras, seperti yang dijelaskan dalam pengumuman rasmi Thinking Machines.

Inkling melaksanakan tugasan pelarasan halus kendiri di dalam persekitaran konsol Tinker

Seni Bina Teknikal: Bagaimana Inkling Dibandingkan dengan DeepSeek

Pada lapisan protokol, transformer padat standard mengaktifkan keseluruhan suite parameter untuk setiap token, yang mengakibatkan kos pengkomputeran dan kependaman (latency) yang tinggi. Untuk menyelesaikan kesesakan pengkomputeran ini, model yang baru dilancarkan ini menggunakan reka bentuk Mixture-of-Experts (MoE) yang serupa dengan tunjang utama sumber terbuka China, DeepSeek-V3. Setiap lapisan MoE mengandungi 256 pakar yang dihalakan dan 2 pakar kongsi, dengan hanya 6 pakar yang dihalakan (kira-kira 41 bilion parameter aktif) dilaksanakan bagi setiap token. Ini membolehkan sistem mengekalkan pangkalan pengetahuan 975 bilion parameter yang luas sambil memastikan kos inferens dan kependaman tetap rendah.

Untuk mekanisme perhatian, sistem ini menyelitkan lapisan tetingkap gelongsor (sliding-window) dan global pada nisbah 5:1, menggunakan 8 kepala nilai-kunci (KV). Tidak seperti seni bina popular seperti Llama dan DeepSeek yang bergantung pada Rotary Positional Embedding (RoPE), sistem ini melaksanakan pengebilan kedudukan relatif, yang menunjukkan prestasi ekstrapolasi yang lebih baik merentasi urutan konteks panjang sehingga 1 juta token. Tidak seperti DeepSeek-V3, Inkling dikeluarkan secara rasmi di bawah Apache 2.0 dan bukannya lesen MIT, menyasarkan pasaran 'open-weight' perusahaan yang sama sambil menekankan aliran kerja penyesuaian melalui Tinker.

[Seni Bina Model Padat Standard]
  Token Input ──> Semua Parameter Aktif (975B) ──> Kos Pengkomputeran & Kependaman Tinggi


[Seni Bina Mixture-of-Experts (MoE)]
  Token Input ──> Penghala Berasaskan Sigmoid ──> Pakar Aktif (41B) ──> Kos Rendah, Inferens Pantas

Bagi banyak penggunaan MoE berskala besar, kerana kecekapan inferens semakin bergantung pada lebar jalur memori berbanding daya pemprosesan aritmetik, banyak penggunaan beralih ke arah pengoptimuman inferens yang berpusatkan memori. Walaupun model asas dilatih dari awal, fasa pasca-latihan menggunakan butstrap data sintetik yang dijana oleh model 'open-weight' sedia ada, termasuk Kimi K2.5 daripada Moonshot AI. Keputusan penanda aras menunjukkan bahawa Inkling mencapai prestasi yang setanding dengan NVIDIA Nemotron 3 Ultra sambil menggunakan hanya satu pertiga daripada token. Keupayaan struktur yang disahkan apabila Thinking Machines melancarkan Inkling menunjukkan bagaimana seni bina MoE tersuai mengurangkan keseluruhan beban operasi, seperti yang diterangkan dalam laporan Model Interaksi Thinking Machines.

Sekilas Pandang Inkling lwn. DeepSeek-V3

Untuk menggambarkan variasi teknikal antara seni bina 'open-weight' terkemuka ini, jadual perbandingan berikut menggariskan pilihan reka bentuk asas mereka:

Metrik Teknikal Model MoE Inkling Seni Bina DeepSeek-V3
Lesen Sumber Terbuka Apache 2.0 (Permisif) MIT (Permisif)
Jumlah Skala Parameter 975 Bilion jumlah parameter 671 Bilion jumlah parameter
Parameter Aktif 41 Bilion aktif setiap token 37 Bilion aktif setiap token
Saiz Tetingkap Konteks Sehingga 1 Juta token Sehingga 128 Ribu token
Pengebilan Kedudukan Pengebilan Kedudukan Relatif Rotary Positional Embedding (RoPE)

Penanda aras prestasi komprehensif membandingkan Inkling dengan GLM 5.2, DeepSeek V4 Pro, dan Kimi K2.6

Bina lwn. Beli: Strategi Penggunaan 'Open-Weight'

Memandangkan kos operasi untuk mengekalkan API AI tujuan umum terus meningkat, pelancaran Inkling juga mendorong pasukan kejuruteraan untuk menilai semula strategi infrastruktur jangka panjang. Menilai semula kebergantungan sistem mendedahkan realiti kewangan yang kritikal: menyewa model proprietari boleh membawa kepada perangkap pembayaran berganda. Satya Nadella baru-baru ini berhujah bahawa syarikat perusahaan yang menggunakan AI proprietari sebenarnya membayar dua kali: sekali dalam kos langganan terus dan sekali lagi dengan menyerahkan pengetahuan perniagaan proprietari mereka yang tertanam dalam gesaan (prompt), perkara ini dibincangkan dalam catatan nasihat teknikal Nadella.

Kos inferens yang lebih rendah juga mengubah cara syarikat perusahaan menilai perbelanjaan infrastruktur. Dari perspektif FinOps, menilai sama ada untuk membina talian paip tempatan tersuai atau terus melanggan titik akhir awan proprietari memerlukan penilaian yang teliti terhadap kecekapan pengkomputeran. Apabila Thinking Machines melancarkan Inkling, pembangun boleh mengimbangi bajet token dengan profil prestasi dengan lebih mudah. Oleh kerana pemberat (weight) model tersedia secara terbuka, organisasi boleh menyesuaikan talian paip penggunaan dan menggunakan pemberat tersuai secara komersial tanpa terikat dengan platform proprietari. Paradigma penyesuaian ini disokong sepenuhnya oleh platform pelarasan halus Thinking Machines Lab, Tinker, di mana organisasi boleh memuat naik pemberat peribadi dan melaksanakan latihan domain yang disasarkan.

Senario Penggunaan dan Pemilihan Platform

Untuk membantu arkitek infrastruktur menilai konfigurasi pengehosan mereka di bawah model ekonomi yang berubah ini, matriks penggunaan berikut menggariskan pertukaran standard:

Senario Penggunaan Kos Inferens Sokongan Penyesuaian Kedaulatan Data
API Sumber Tertutup Dihoskan Tinggi (Harga bermeter setiap token) Tiada (Default sistem statik) Rendah (Penghalaan API luaran)
Inkling Asas Dihoskan Sendiri Sederhana (Infrastruktur pelayan) Sederhana (Kemas kini tempatan manual) Tinggi (Pengehosan utama tempatan)
Inkling Pelarasan Halus di Tinker Rendah (Masa jalan khusus tugasan yang dioptimumkan) Tinggi (Pelarasan halus programatik) Tinggi (Pengasingan awan peribadi)

Nilai pendekatan penyesuaian 'open-weight' ditunjukkan oleh projek bersama antara Thinking Machines dan Bridgewater Associates, dana lindung nilai terbesar di dunia. Dengan mengambil model terbuka asas dan melatihnya dengan lebih lanjut berdasarkan kepakaran kewangan proprietari Bridgewater, penyelidik membina sistem yang mendapat skor 84.7% dalam ujian penaakulan kewangan. Model tersuai ini mengatasi alternatif proprietari terkemuka sambil menelan kos kira-kira satu perempat belas daripada kos untuk dijalankan. Metrik prestasi ini menyokong secara langsung objektif FinOps, membolehkan pembangun mengimbangi bajet token dengan profil prestasi, seperti yang didokumenkan dalam kajian penaakulan kewangan Bridgewater.

Metrik prestasi penaakulan kewangan model tersuai Bridgewater Associates pada platform Tinker

Senarai Semak Integrasi: Bagaimana Pasukan Kejuruteraan Boleh Bersedia untuk Perubahan Platform

Untuk menjamin talian paip data dan memastikan autonomi teknikal apabila model 'open-weight' menjadi standard industri, pasukan kejuruteraan dan produk mesti menyediakan peta jalan migrasi yang jelas.

Senarai Semak Pelaksanaan Pembangun

  • Nilai Talian Paip Inferens: Sediakan penanda aras pengkuantuman menggunakan rangka kerja seperti SGLang, vLLM, atau llama.cpp untuk mengoptimumkan jejak memori.
  • Penanda Aras Penggunaan GPU: Analisis laluan penghalaan pakar aktif untuk meminimumkan kekangan lebar jalur memori semasa pelaksanaan inferens serentak.
  • Audit Aliran Kerja Pelarasan Halus: Konfigurasikan templat penyesuaian model pada platform seperti Tinker untuk mengautomasikan rubrik penilaian.

Senarai Semak Strategi Produk & Pertumbuhan

  • Sahkan Parameter Pelesenan Model: Semak syarat Apache 2.0 untuk memastikan pematuhan bagi pengagihan semula komersial seterusnya.
  • Wujudkan Pemantauan FinOps: Bandingkan kos pengehosan pelayan jangka panjang bagi 'open-weight' yang dihoskan sendiri dengan bil langganan API awan bermeter untuk mengoptimumkan talian paip pengkomputeran.
  • Asingkan Repositori Data Proprietari: Wujudkan kotak pasir data yang ketat untuk memastikan pengetahuan syarikat yang sensitif tidak ditelan oleh model awam luaran.

Dengan mewujudkan garis panduan berstruktur ini, pasukan pembangunan boleh memindahkan aplikasi mereka kepada seni bina yang lebih selamat dan patuh sambil mengekalkan kesinambangkan kesinambungan operasi.

Soalan Lazim (FAQ)

Mengapa menggunakan model proprietari sumber tertutup bermakna syarikat "membayar dua kali"?
Apabila sesebuah perusahaan menghantar data, aliran kerja, dan pembetulan kod proprietari melalui API tertutup, ia membayar pembekal untuk token yang digunakan. Pada masa yang sama, pembekal mungkin menggunakan gesaan dan pembetulan tersebut untuk melatih versi model masa depan, pada dasarnya mengambil pengetahuan perniagaan unik perusahaan tanpa pampasan.
Apakah kelebihan teknikal seni bina mixture-of-experts Inkling?
Reka bentuk MoE membolehkan model tersebut mengandungi pangkalan pengetahuan 975 bilion parameter yang luas sambil hanya mengaktifkan 41 bilion parameter untuk sebarang tugasan tertentu. Seni bina ini memberikan keupayaan penaakulan sistem hampir satu trilion parameter sambil mengekalkan kelajuan pelaksanaan yang pantas dan kos operasi yang rendah bagi model yang jauh lebih kecil.
Adakah Inkling selamat untuk penggunaan perusahaan tanpa pengawal (guardrails) berpusat?
Thinking Machines melatih Inkling untuk mematuhi piawaian keselamatan yang ketat bagi keupayaan berbahaya, CBRN, dan privasi data. Oleh kerana ia adalah model 'open-weight', pembangun boleh menyesuaikan dan mengaudit pengawal dalamannya dengan lebih lanjut pada platform seperti Tinker, memastikan kawalan penuh ke atas tingkah laku keselamatan.
Adakah Inkling sumber terbuka?
Ya. Kerana Inkling dikeluarkan di bawah lesen Apache 2.0 yang permisif, organisasi boleh mengubah suai, mengedar semula, dan menggunakan model tersebut secara komersial tanpa sekatan pelesenan proprietari atau yuran inferens yang dihoskan secara berulang.

Perkara Utama untuk Pasukan Kejuruteraan

Inkling menunjukkan bahawa AI perusahaan bergerak ke arah penggunaan 'open-weight' yang boleh disesuaikan. Daripada menggantikan platform AI proprietari secara langsung, Inkling mengembangkan rangkaian strategi penggunaan yang tersedia untuk pasukan kejuruteraan perusahaan.

Organisasi yang menggunakan model 'open-weight' akan semakin mengutamakan penggunaan peribadi, tadbir urus model, inferens yang cekap, dan kecekapan operasi jangka panjang berbanding kebergantungan pada API proprietari. Oleh itu, pasukan harus mengutamakan infrastruktur yang mampu melakukan pelarasan halus yang cekap, pengoptimuman inferens, dan tadbir urus.

Share this article