Thinking Machines ने Inkling लॉन्च किया? आधिकारिक घोषणा के अनुसार, Thinking Machines Lab ने अपना पहला ओपन-वेट मल्टीमॉडल मॉडल, Inkling पेश किया है, जिसे DeepSeek और अन्य अग्रणी AI सिस्टम्स के साथ प्रतिस्पर्धा करने के लिए डिज़ाइन किया गया है। कंपनी ने इस मॉडल को एक बंद कमर्शियल API के रूप में पेश करने के बजाय एंटरप्राइज कस्टमाइजेशन, ओपन-वेट डिप्लॉयमेंट और डेवलपर्स के लिए कम परिचालन लागत पर जोर दिया है। चूंकि Inkling को Apache 2.0 ओपन-वेट मॉडल के रूप में जारी किया गया है, इसलिए एंटरप्राइज डेवलपर्स अब किसी मालिकाना इंफरेंस API पर निर्भर हुए बिना इसे डिप्लॉय, मॉडिफाई और फाइन-ट्यून कर सकते हैं।

Thinking Machines ने Inkling क्यों लॉन्च किया: क्लोज्ड-सोर्स एकाधिकार को चुनौती
एक नज़र में
- पूर्व OpenAI CTO मीरा मुराती के स्टार्टअप, Thinking Machines Lab ने अपना पहला इन-हाउस AI मॉडल 'Inkling' जारी किया है, जो Apache 2.0 ओपन-वेट लाइसेंस के साथ आता है।
- यह सिस्टम 975 बिलियन कुल मापदंडों (प्रति कार्य 41 बिलियन सक्रिय) वाला एक मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) ट्रांसफॉर्मर है, जिसे 45 ट्रिलियन टेक्स्ट, इमेज, ऑडियो और वीडियो टोकन पर प्रशिक्षित किया गया है।
- मानक क्लोज्ड-सोर्स मॉडलों के विपरीत, Inkling को कंपनियों के लिए अपने Tinker प्लेटफॉर्म का उपयोग करके स्वयं फाइन-ट्यून करने के शुरुआती बिंदु के रूप में डिज़ाइन किया गया है।
केंद्रीकृत, सामान्य-उद्देश्य वाले मॉडलों और कस्टम, डोमेन-विशिष्ट प्रणालियों के बीच का अंतर एक बड़े बदलाव के दौर से गुजर रहा है। पिछले कुछ वर्षों में, उद्यमों ने मालिकाना API की तुलना स्वयं-होस्टेड ओपन-वेट डिप्लॉयमेंट से करना शुरू कर दिया है। Inkling सामान्य-उद्देश्य वाले होस्टेड इंफरेंस के बजाय एंटरप्राइज कस्टमाइजेशन के लिए अनुकूलित Apache 2.0 मॉडल प्रदान करके इस प्रतिस्पर्धा में प्रवेश करता है।
Inkling का लॉन्च स्वयं-होस्टेड ओपन-वेट मॉडलों और एंटरप्राइज AI कस्टमाइजेशन की ओर बढ़ते व्यापक उद्योग के रुझान को दर्शाता है। जब कोई कंपनी अपने संवेदनशील व्यापार रहस्य, कोडबेस और वित्तीय गणनाओं को मालिकाना मॉडल में डालती है, तो उसे यह जोखिम होता है कि वह जानकारी सिस्टम के भविष्य के सार्वजनिक संस्करणों में समाहित हो जाए। कई बड़े पैमाने के इंजीनियरिंग समूहों के लिए, Thinking Machines द्वारा Inkling का लॉन्च मुख्य सॉफ्टवेयर निर्भरताओं पर नियंत्रण वापस पाने का एक सीधा अवसर है, जैसा कि आधिकारिक Thinking Machines घोषणा में समझाया गया है।

तकनीकी आर्किटेक्चर: Inkling की DeepSeek से तुलना
प्रोटोकॉल स्तर पर, मानक डेंस ट्रांसफॉर्मर प्रत्येक टोकन के लिए अपने संपूर्ण पैरामीटर सूट को सक्रिय करते हैं, जिसके परिणामस्वरूप उच्च कंप्यूटिंग लागत और विलंबता होती है। इन कंप्यूट बाधाओं को हल करने के लिए, नया जारी किया गया मॉडल चीनी ओपन-सोर्स प्रमुख DeepSeek-V3 के समान मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) डिज़ाइन का उपयोग करता है। प्रत्येक MoE लेयर में 256 रूटेड एक्सपर्ट्स और 2 साझा एक्सपर्ट्स होते हैं, जिसमें प्रति टोकन केवल 6 रूटेड एक्सपर्ट्स (लगभग 41 बिलियन सक्रिय पैरामीटर) निष्पादित होते हैं। यह सिस्टम को 975-बिलियन-पैरामीटर का विशाल ज्ञान आधार बनाए रखने की अनुमति देता है, जबकि इंफरेंस लागत और विलंबता कम रहती है।
अटेंशन मैकेनिज्म के लिए, सिस्टम 5:1 अनुपात पर स्लाइडिंग-विंडो और ग्लोबल लेयर्स को इंटरलीव करता है, जिसमें 8 की-वैल्यू (KV) हेड का उपयोग होता है। Llama और DeepSeek जैसे लोकप्रिय आर्किटेक्चर के विपरीत जो रोटरी पोजीशनल एम्बेडिंग (RoPE) पर निर्भर हैं, यह सिस्टम सापेक्ष (Relative) पोजीशनल एम्बेडिंग लागू करता है, जो 1 मिलियन टोकन तक के लंबे-संदर्भ अनुक्रमों पर बेहतर एक्सट्रपलेशन प्रदर्शन दिखाता है। DeepSeek-V3 के विपरीत, Inkling को MIT लाइसेंसिंग के बजाय आधिकारिक तौर पर Apache 2.0 के तहत जारी किया गया है, जो Tinker के माध्यम से कस्टमाइजेशन वर्कफ़्लो पर जोर देते हुए उसी एंटरप्राइज ओपन-वेट बाजार को लक्षित करता है।
[मानक डेंस मॉडल आर्किटेक्चर] इनपुट टोकन ──> सभी पैरामीटर सक्रिय (975B) ──> उच्च कंप्यूटिंग लागत और विलंबता [मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर] इनपुट टोकन ──> सिगमॉइड-आधारित राउटर ──> सक्रिय एक्सपर्ट्स (41B) ──> कम लागत, तेज़ इंफरेंस
कई बड़े MoE डिप्लॉयमेंट के लिए, चूंकि इंफरेंस दक्षता तेजी से गणितीय थ्रूपुट के बजाय मेमोरी बैंडविड्थ पर निर्भर करती है, इसलिए कई डिप्लॉयमेंट मेमोरी-केंद्रित इंफरेंस ऑप्टिमाइज़ेशन की ओर बढ़ रहे हैं। जबकि बेस मॉडल को शून्य से प्री-ट्रेन किया गया था, पोस्ट-ट्रेनिंग चरण में Moonshot AI के Kimi K2.5 सहित मौजूदा ओपन-वेट मॉडलों द्वारा उत्पन्न सिंथेटिक डेटा बूटस्ट्रैप का उपयोग किया गया था। बेंचमार्क परिणाम बताते हैं कि Inkling केवल एक-तिहाई टोकन का उपयोग करते हुए NVIDIA Nemotron 3 Ultra के बराबर प्रदर्शन प्राप्त करता है। जब Thinking Machines Inkling लॉन्च करता है, तो सत्यापित संरचनात्मक क्षमताएं यह प्रदर्शित करती हैं कि कैसे कस्टम MoE आर्किटेक्चर समग्र परिचालन ओवरहेड को कम करते हैं, जैसा कि Thinking Machines Interaction Models रिपोर्ट में वर्णित है।
Inkling बनाम DeepSeek-V3 एक नज़र में
इन अग्रणी ओपन-वेट आर्किटेक्चर के बीच तकनीकी भिन्नताओं को स्पष्ट करने के लिए, निम्नलिखित तुलना तालिका उनके आधारभूत डिज़ाइन विकल्पों को रेखांकित करती है:
| तकनीकी मीट्रिक | Inkling MoE मॉडल | DeepSeek-V3 आर्किटेक्चर |
|---|---|---|
| ओपन सोर्स लाइसेंस | Apache 2.0 (अनुमति-आधारित) | MIT (अनुमति-आधारित) |
| कुल पैरामीटर स्केल | 975 बिलियन कुल पैरामीटर | 671 बिलियन कुल पैरामीटर |
| सक्रिय पैरामीटर | 41 बिलियन सक्रिय प्रति टोकन | 37 बिलियन सक्रिय प्रति टोकन |
| कॉन्टेक्स्ट विंडो का आकार | 1 मिलियन टोकन तक | 128 हजार टोकन तक |
| पोजीशनल एम्बेडिंग | सापेक्ष पोजीशनल एम्बेडिंग | रोटरी पोजीशनल एम्बेडिंग (RoPE) |

बनाएं बनाम खरीदें: ओपन-वेट डिप्लॉयमेंट रणनीतियां
जैसे-जैसे सामान्य-उद्देश्य वाले AI API के रखरखाव की परिचालन लागत बढ़ती जा रही है, Inkling का विमोचन इंजीनियरिंग टीमों को दीर्घकालिक बुनियादी ढांचा रणनीतियों का पुनर्मूल्यांकन करने के लिए प्रेरित करता है। सिस्टम निर्भरताओं का पुनर्मूल्यांकन एक महत्वपूर्ण वित्तीय वास्तविकता को उजागर करता है: मालिकाना मॉडलों को किराए पर लेने से 'दोहरी भुगतान' का जाल बन सकता है। सत्य नडेला ने हाल ही में तर्क दिया कि मालिकाना AI का उपयोग करने वाले उद्यम प्रभावी रूप से दो बार भुगतान करते हैं: एक बार प्रत्यक्ष सदस्यता लागत में, और दूसरी बार अपने मालिकाना व्यावसायिक ज्ञान को प्रॉम्प्ट में सौंपकर, जिसे नडेला तकनीकी सलाहकार पोस्ट में चर्चा की गई है।
कम इंफरेंस लागत यह भी बदलती है कि उद्यम बुनियादी ढांचे के खर्च का मूल्यांकन कैसे करते हैं। FinOps परिप्रेक्ष्य से, यह मूल्यांकन करना कि क्या कस्टम स्थानीय पाइपलाइन बनाई जाए या मालिकाना क्लाउड एंडपॉइंट्स की सदस्यता जारी रखी जाए, कंप्यूट दक्षता का कठोर आकलन मांगता है। जैसे-जैसे Thinking Machines Inkling लॉन्च करता है, डेवलपर्स टोकन बजट को प्रदर्शन प्रोफाइल के साथ अधिक आसानी से संतुलित कर सकते हैं। चूंकि मॉडल वेट खुले तौर पर उपलब्ध हैं, संगठन डिप्लॉयमेंट पाइपलाइन को कस्टमाइज़ कर सकते हैं और बिना मालिकाना प्लेटफ़ॉर्म लॉक-इन के व्यावसायिक रूप से अनुकूलित वेट डिप्लॉय कर सकते हैं। यह कस्टमाइजेशन प्रतिमान Thinking Machines Lab के फाइन-ट्यूनिंग प्लेटफ़ॉर्म, Tinker द्वारा पूरी तरह से समर्थित है, जहां संगठन निजी वेट अपलोड कर सकते हैं और लक्षित डोमेन प्रशिक्षण निष्पादित कर सकते हैं।
डिप्लॉयमेंट परिदृश्य और प्लेटफ़ॉर्म चयन
बुनियादी ढांचा आर्किटेक्ट्स को इन बदलते आर्थिक मॉडलों के तहत अपने होस्टिंग कॉन्फ़िगरेशन का मूल्यांकन करने में मदद करने के लिए, निम्नलिखित डिप्लॉयमेंट मैट्रिक्स मानक व्यापार-बंद (trade-offs) को रेखांकित करता है:
| डिप्लॉयमेंट परिदृश्य | इंफरेंस लागत | कस्टमाइजेशन सपोर्ट | डेटा संप्रभुता |
|---|---|---|---|
| होस्टेड क्लोज्ड-सोर्स API | उच्च (प्रति टोकन मूल्य निर्धारण) | कोई नहीं (स्थिर सिस्टम डिफ़ॉल्ट) | कम (बाहरी API राउटिंग) |
| स्वयं-होस्टेड बेस Inkling | मध्यम (सर्वर बुनियादी ढांचा) | मध्यम (मैनुअल स्थानीय अपडेट) | उच्च (लोकल-फर्स्ट होस्टिंग) |
| Tinker पर फाइन-ट्यून्ड Inkling | कम (अनुकूलित कार्य-विशिष्ट रनटाइम) | उच्च (प्रोग्रामेटिक फाइन-ट्यूनिंग) | उच्च (निजी क्लाउड आइसोलेशन) |
ओपन-वेट कस्टमाइजेशन दृष्टिकोण का मूल्य Thinking Machines और दुनिया के सबसे बड़े हेज फंड, Bridgewater Associates के बीच एक संयुक्त परियोजना द्वारा प्रदर्शित किया गया है। एक बेसलाइन ओपन मॉडल लेकर और उसे Bridgewater की मालिकाना वित्तीय विशेषज्ञता पर प्रशिक्षित करके, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया जिसने वित्तीय तर्क परीक्षणों पर 84.7% अंक प्राप्त किए। इस अनुकूलित मॉडल ने शीर्ष-स्तरीय मालिकाना विकल्पों से बेहतर प्रदर्शन किया, जबकि इसे चलाने की लागत लगभग चौदहवें हिस्से के बराबर थी। ये प्रदर्शन मीट्रिक सीधे FinOps उद्देश्यों का समर्थन करते हैं, जिससे डेवलपर्स टोकन बजट को प्रदर्शन प्रोफाइल के साथ संतुलित कर सकते हैं, जैसा कि Bridgewater वित्तीय तर्क अध्ययन में प्रलेखित है।

एकीकरण चेकलिस्ट: इंजीनियरिंग टीमें प्लेटफ़ॉर्म बदलावों के लिए कैसे तैयारी कर सकती हैं
डेटा पाइपलाइनों को सुरक्षित करने और तकनीकी स्वायत्तता सुनिश्चित करने के लिए जब ओपन-वेट मॉडल उद्योग मानक बन जाते हैं, इंजीनियरिंग और उत्पाद टीमों को एक स्पष्ट माइग्रेशन रोडमैप स्थापित करना होगा।
डेवलपर कार्यान्वयन चेकलिस्ट
- इंफरेंस पाइपलाइनों का मूल्यांकन करें: मेमोरी फुटप्रिंट को ऑप्टिमाइज़ करने के लिए SGLang, vLLM, या llama.cpp जैसे फ्रेमवर्क का उपयोग करके क्वांटाइजेशन बेंचमार्क सेट करें।
- GPU उपयोग का बेंचमार्क: समवर्ती इंफरेंस रन के दौरान मेमोरी बैंडविड्थ बाधाओं को कम करने के लिए सक्रिय एक्सपर्ट रूटिंग पथों का विश्लेषण करें।
- फाइन-ट्यूनिंग वर्कफ़्लो का ऑडिट करें: मूल्यांकन रूब्रिक्स को स्वचालित करने के लिए Tinker जैसे प्लेटफ़ॉर्म पर मॉडल-कस्टमाइजेशन टेम्प्लेट कॉन्फ़िगर करें।
उत्पाद और विकास रणनीति चेकलिस्ट
- मॉडल लाइसेंसिंग मापदंडों का सत्यापन करें: बाद के कमर्शियल पुनर्वितरण के लिए अनुपालन सुनिश्चित करने हेतु Apache 2.0 शर्तों की समीक्षा करें।
- FinOps मॉनिटरिंग स्थापित करें: कंप्यूट पाइपलाइनों को ऑप्टिमाइज़ करने के लिए मीटर्ड क्लाउड API सदस्यता बिलिंग के मुकाबले स्वयं-होस्टेड ओपन वेट की दीर्घकालिक सर्वर-होस्टिंग लागतों की तुलना करें।
- मालिकाना डेटा रिपॉजिटरी को अलग करें: सख्त डेटा सैंडबॉक्स स्थापित करें ताकि यह सुनिश्चित हो सके कि संवेदनशील कंपनी ज्ञान को बाहरी सार्वजनिक मॉडलों द्वारा ग्रहण नहीं किया जाए।
इन संरचित दिशानिर्देशों को स्थापित करके, विकास टीमें परिचालन निरंतरता बनाए रखते हुए अपने एप्लिकेशन को सुरक्षित और अधिक अनुपालन योग्य आर्किटेक्चर में स्थानांतरित कर सकती हैं।
अक्सर पूछे जाने वाले प्रश्न (FAQ)
क्लोज्ड-सोर्स मालिकाना मॉडलों का उपयोग करने का अर्थ यह क्यों है कि कंपनियां "दो बार भुगतान" करती हैं?
Inkling के मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर के तकनीकी लाभ क्या हैं?
क्या Inkling बिना केंद्रीकृत गार्डरेल्स के एंटरप्राइज डिप्लॉयमेंट के लिए सुरक्षित है?
क्या Inkling ओपन सोर्स है?
इंजीनियरिंग टीमों के लिए मुख्य निष्कर्ष
Inkling यह प्रदर्शित करता है कि एंटरप्राइज AI अनुकूलन योग्य ओपन-वेट डिप्लॉयमेंट की ओर बढ़ रहा है। मालिकाना AI प्लेटफ़ॉर्म को पूरी तरह से बदलने के बजाय, Inkling एंटरप्राइज इंजीनियरिंग टीमों के लिए उपलब्ध डिप्लॉयमेंट रणनीतियों की श्रेणी का विस्तार करता है।
ओपन-वेट मॉडलों को अपनाने वाले संगठन मालिकाना API पर निर्भरता के बजाय निजी डिप्लॉयमेंट, मॉडल गवर्नेंस, कुशल इंफरेंस और दीर्घकालिक परिचालन दक्षता को प्राथमिकता देंगे। इसलिए टीमों को कुशल फाइन-ट्यूनिंग, इंफरेंस ऑप्टिमाइज़ेशन और गवर्नेंस में सक्षम बुनियादी ढांचे को प्राथमिकता देनी चाहिए।
Share this article



