क्या OpenAI Astra ने 48 CAPTCHA गेम लेवल पूरे कर लिए? जानिए वेरिफिकेशन क्यों कठिन हो रहा है

opoinstall
2026-09-08
5 min read

क्या OpenAI Astra ने 48 CAPTCHA गेम लेवल पूरे कर लिए? डेवलपर शरीफ शमीम ने दिखाया कि OpenAI का GPT-6 Astra, नील अग्रवाल के CAPTCHA-थीम वाले ब्राउज़र गेम के सभी 48 लेवल पूरे करने में सक्षम है। यह दर्शाता है कि केवल विज़ुअल चैलेंज पहेलियाँ अब इंसानों और उन्नत कंप्यूटर-यूज़ एजेंट्स के बीच अंतर करने के लिए एक कमजोर सिग्नल साबित हो रही हैं। जैसे-जैसे मल्टीमॉडल आर्टिफिशियल इंटेलिजेंस मॉडल डेस्कटॉप डिस्प्ले को पढ़ने और UI क्रियाओं को निष्पादित करने की क्षमता हासिल कर रहे हैं, पारंपरिक वेब चुनौतियाँ तकनीकी सीमाओं का सामना कर रही हैं। ऐतिहासिक रूप से, ऑनलाइन सिस्टम स्वचालित स्क्रिप्ट के खिलाफ एक प्राथमिक बाधा के रूप में विज़ुअल पहेलियों, इमेज रिकग्निशन और इंटरैक्टिव लॉजिक गेम्स का उपयोग करते थे। आज, उन्नत एजेंट्स स्क्रीन सामग्री की व्याख्या कर सकते हैं और बहु-चरणीय इंटरैक्टिव वर्कफ़्लो को निष्पादित कर सकते हैं, जिससे सुरक्षा टीमों को लेयर्ड, सर्वर-साइड रिस्क स्कोरिंग की ओर बढ़ने के लिए प्रेरित होना पड़ रहा है।

Astra CAPTCHA डेमो क्यों महत्वपूर्ण है

एक नज़र में

  • डेवलपर शरीफ शमीम ने दिखाया कि GPT-6 Astra ने नील अग्रवाल के “I Am Not a Robot” वेरिफिकेशन पहेली गेम के सभी 48 चरणों को नेविगेट कर पूरा किया।
  • यह प्रदर्शन मल्टीमॉडल विज़न, कंप्यूटर-यूज़ क्षमताओं और लॉन्ग-कॉन्टेक्स्ट टास्क निष्पादन में प्रगति को उजागर करता है।
  • आधुनिक बॉट-मैनेजमेंट सिस्टम अब केवल विज़ुअल पहेलियों पर निर्भर रहने के बजाय क्लाइंट और ब्राउज़र सिग्नल्स को सर्वर-साइड वैलिडेशन और रिस्क असेसमेंट के साथ जोड़ रहे हैं।

इंटरनेट ऑथेंटिकेशन सिस्टम ऐतिहासिक रूप से स्वचालित ट्रैफ़िक के खिलाफ शुरुआती बचाव के रूप में CAPTCHA (Completely Automated Public Turing test to tell Computers and Humans Apart) चुनौतियों पर निर्भर रहे हैं। वेब प्रशासकों ने इन पहेलियों को इसलिए तैनात किया था ताकि स्वचालित स्क्रिप्ट्स को ब्रूट-फोर्स लॉगिन प्रयासों, कंटेंट स्क्रैपिंग या थोक में खाते बनाने से रोका जा सके। अंतर्निहित धारणा यह थी कि विकृत टेक्स्ट की व्याख्या करना, इमेज ग्रिड में वस्तुओं की पहचान करना, या सटीक माउस गतिविधियों को निष्पादित करना केवल मानवीय विज़ुअल और मोटर तर्क के लिए ही संभव है।

यह धारणा तब चुनौती में आ गई जब डेवलपर शरीफ शमीम ने नील अग्रवाल के ब्राउज़र गेम, “I Am Not a Robot” पर GPT-6 Astra का मूल्यांकन किया। 48-चरणों वाला यह गेम सामान्य चेकबॉक्स पुष्टिकरण से लेकर जटिल इमेज चयन, टाइमिंग पहेलियों और रिवर्स-लॉजिक प्रॉम्प्ट तक की बढ़ती इंटरैक्टिव चुनौतियाँ प्रस्तुत करता है, जहाँ उपयोगकर्ता को मानवीय पहचान साबित करने के लिए गलत उत्तर देना पड़ता है। Astra ने ब्राउज़र से विज़ुअल फ्रेम प्रोसेस करके, स्टेज के नियमों का मूल्यांकन करके और अपने कंप्यूटर-यूज़ निष्पादन हार्नेस के माध्यम से माउस और कीबोर्ड कमांड जारी करके सभी 48 लेवल पूरे किए।

GPT-6 Astra नील अग्रवाल के I Am Not a Robot CAPTCHA टेस्ट गेम को पूरा करते हुए

यह प्रदर्शन एजेंटिक बेंचमार्क में व्यापक प्रदर्शन सुधारों को दर्शाता है। आधिकारिक OpenAI Astra रिलीज़ दस्तावेज़ीकरण के अनुसार, मॉडल ने अपने रिसर्च हार्नेस के तहत ARC-AGI-3 पर 99.9% स्कोर हासिल किया, जो 96% लेवल पर मानव कार्य-दक्षता बेसलाइन से बेहतर है। OSWorld 2.0 पर, Astra ने GPT-5.6 Sol की तुलना में 47% कम समय में डेस्कटॉप कार्य पूरे किए और 72.6% स्कोर किया। जैसा कि Numerama द्वारा उद्योग कवरेज में प्रलेखित है, यह क्षमता दिखाती है कि विज़ुअल पहेली सुलझाना अब केवल मानवीय कौशल नहीं रह गया है, भले ही प्रोडक्शन बॉट-मैनेजमेंट प्लेटफ़ॉर्म अतिरिक्त बैकएंड टेलीमेट्री पर निर्भर हों।

तकनीकी गहराई और OpenAI Astra द्वारा 48 CAPTCHAs क्लियर करने की कार्यप्रणाली

प्रोटोकॉल स्तर पर, Astra की इंटरैक्टिव वेब तत्वों को नेविगेट करने की क्षमता मल्टीमॉडल विज़न, रीयल-टाइम स्क्रीन पार्सिंग और कंप्यूटर-यूज़ टूल्स से उत्पन्न होती है। अलग-थलग टेक्स्ट या इमेज वर्गीकरण प्रश्नों को प्रोसेस करने के बजाय, मॉडल डेस्कटॉप स्क्रीनशॉट प्राप्त करता है, निष्पादन योजनाएँ बनाता है, और एक बाहरी सॉफ़्टवेयर हार्नेस के माध्यम से क्रियाओं को संप्रेषित करता है जो भौतिक UI इवेंट्स को पूरा करता है।

जटिल बहु-चरणीय वर्कफ़्लो का समर्थन करने के लिए, Astra API एसिंक्रोनस टूल कॉलिंग के लिए समर्थन पेश करता है, जिससे एप्लिकेशन एनवायरनमेंट बैकग्राउंड में टूल्स चला सकता है जबकि मॉडल उच्च-स्तरीय तर्क जारी रखता है। Astra संगत वर्कफ़्लो के लिए एसिंक्रोनस टूल कॉलिंग का भी समर्थन करता है, हालाँकि सार्वजनिक CAPTCHA प्रदर्शन यह स्थापित नहीं करता है कि 48-लेवल गेम को पूरा करने के लिए इस सुविधा की आवश्यकता थी।

GPT-6 Astra में सिंक्रोनस बनाम एसिंक्रोनस टूल कॉलिंग को दर्शाने वाला आरेख

आर्किटेक्चरल फ्लो: मानक कंप्यूटर-यूज़ निष्पादन लूप

जब एक AI एजेंट किसी वेब एप्लिकेशन के साथ इंटरैक्ट करता है, तो वह प्रोटोकॉल-स्तरीय कमजोरियों का फायदा उठाने के बजाय एक पुनरावृत्ति धारणा-क्रिया (perception-action) लूप का पालन करता है।

नीचे दिया गया आरेख मानक कंप्यूटर-यूज़ एजेंट निष्पादन लूप को रेखांकित करता है:

[Standard Computer-Use Agent Loop]
  स्क्रीनशॉट इनपुट ──> Astra मल्टीमॉडल विज़न ──> एक्शन निर्णय ──> हार्नेस UI एक्शन निष्पादित करता है ──> अपडेटेड एनवायरनमेंट स्टेट

इंटरैक्टिव ब्राउज़र कार्यों से परे, OpenAI ने OpenAI डिप्लॉयमेंट सेफ्टी हब में विस्तृत रूप से कई मानकीकृत बेंचमार्क पर Astra की साइबर सुरक्षा क्षमताओं का मूल्यांकन किया। ExploitBench पर, मॉडल ने 100% स्कोर हासिल किया, और SRE-Bench पर, इसने अपने पहले प्रयास में 88.0% सॉफ़्टवेयर रिवर्स-इंजीनियरिंग कार्यों को हल किया। आंतरिक सुरक्षा मूल्यांकन के दौरान, मॉडल ने दो अज्ञात ज़ीरो-डे कमजोरियों की भी पहचान की। इन विस्तारित क्षमताओं को प्रबंधित करने के लिए, OpenAI ने बैकग्राउंड मिसअलाइनमेंट मॉनिटरिंग तैनात की है, जिसे निष्पादन के दौरान संभावित समस्याग्रस्त या मिसअलाइन व्यवहार को फ्लैग या रोकने के लिए डिज़ाइन किया गया है।

बैकग्राउंड रीजनिंग रिव्यू के लिए OpenAI Astra मिसअलाइनमेंट मॉनिटरिंग वर्कफ़्लो

हालाँकि ये तकनीकी क्षमताएँ विज़न और निष्पादन में प्रभावशाली प्रगति दिखाती हैं, सुरक्षा विश्लेषक ध्यान देते हैं कि CAPTCHA-थीम वाले ब्राउज़र गेम को हल करना व्यावसायिक एंटी-बॉट इंफ्रास्ट्रक्चर को तोड़ने से अलग है। जैसा कि Google reCAPTCHA दस्तावेज़ीकरण और Cloudflare Turnstile दस्तावेज़ीकरण में बताया गया है, प्रोडक्शन सिस्टम केवल विज़ुअल पहेलियों पर भरोसा करने के बजाय कई अंतर्निहित सिग्नल्स का मूल्यांकन करते हैं।

कंप्यूटर-यूज़ कार्यों को निष्पादित करते हुए GPT-5.6 Sol और GPT-6 Astra की तुलना

पोस्ट-पहेली युग में लेयर्ड सर्वर-साइड सुरक्षा आर्किटेक्चर

यह तथ्य कि उन्नत एजेंट्स विज़ुअल पहेलियों को हल कर सकते हैं, यह दर्शाता है कि सुरक्षा आर्किटेक्चर को विज़ुअल चुनौतियों को एक प्राथमिक गेटकीपर के बजाय कई सिग्नल्स में से एक के रूप में मानना चाहिए। विशेष रूप से क्लाइंट-साइड पहेलियों पर भरोसा करना मानवीय उपयोगकर्ताओं के लिए बाधा पैदा करता है जबकि विज़न-सक्षम एजेंट्स के खिलाफ प्रतिरोध कम करता है।

प्रोडक्शन बॉट-मैनेजमेंट सिस्टम आमतौर पर केवल विज़ुअल पहेलियों पर निर्भर रहने के बजाय कई सिग्नल्स को जोड़ते हैं। उदाहरण के लिए, Google reCAPTCHA व्यवहार, डिवाइस, IP और ऐतिहासिक सिग्नल्स पर अनुकूली जोखिम विश्लेषण का उपयोग करता है, जबकि Cloudflare Turnstile ब्राउज़र और क्लाइंट सिग्नल्स का मूल्यांकन करता है और सर्वर-साइड टोकन वैलिडेशन की मांग करता है।

बहु-स्तरीय बॉट सुरक्षा रणनीतियाँ

सुरक्षा इंजीनियरिंग टीमें उपयोगकर्ता अनुभव में बाधा डाले बिना एंडपॉइंट्स की सुरक्षा के लिए 'डिफेंस-इन-डेप्थ' फ्रेमवर्क अपना रही हैं:

  • सर्वर-साइड रिस्क स्कोरिंग: किसी भी क्लाइंट-साइड चुनौती को प्रस्तुत करने से पहले आने वाले HTTP रिक्वेस्ट हेडर्स और व्यापक बॉट-मैनेजमेंट या नेटवर्क-सुरक्षा सिग्नल्स का मूल्यांकन करना।
  • बिहेवियरल टेलीमेट्री एनालिसिस: गैर-विज़ुअल इंटरैक्शन मेट्रिक्स की निगरानी करना, जैसे कि रिक्वेस्ट की गति, सत्र नेविगेशन पथ और समय के साथ API इनवोकेशन पैटर्न।
  • मजबूत खाता प्रमाणीकरण: प्रमाणित वर्कफ़्लो के लिए, WebAuthn और पासकीज़, W3C वेब-ऑथेंटिकेशन विनिर्देश में निर्दिष्ट अनुसार WebAuthn-संगत प्रमाणकों के माध्यम से सार्वजनिक-कुंजी क्रेडेंशियल्स के साथ उपयोगकर्ताओं को प्रमाणित कर सकते हैं। यह बॉट मिटिगेशन का पूरक है लेकिन यह सामान्य वेब ट्रैफ़िक को मानव या स्वचालित के रूप में वर्गीकृत नहीं करता है।
  • रेट लिमिटिंग और एडेप्टिव थ्रॉटलिंग: लॉगिन, पंजीकरण और पासवर्ड रीसेट जैसे संवेदनशील एंडपॉइंट्स पर सख्त, गतिशील रिक्वेस्ट कोटा लागू करना।

यह प्रदर्शन यह साबित नहीं करता है कि प्रोडक्शन CAPTCHA सिस्टम या आधुनिक बॉट-मैनेजमेंट प्लेटफ़ॉर्म पुराने हो गए हैं; बल्कि, यह इस बात पर प्रकाश डालता है कि क्यों सुरक्षा टीमों को एक व्यापक, लेयर्ड रिस्क-बेस्ड सुरक्षा आर्किटेक्चर के भीतर विज़ुअल चुनौतियों को एक द्वितीयक सिग्नल के रूप में मानना चाहिए।

बॉट मिटिगेशन के लिए इंजीनियरिंग कार्यान्वयन चेकलिस्ट

वेब एंडपॉइंट्स और डिजिटल इंफ्रास्ट्रक्चर की सुरक्षा के लिए, जैसे-जैसे कंप्यूटर-यूज़ एजेंट्स व्यापक रूप से उपलब्ध हो रहे हैं, इंजीनियरिंग और सुरक्षा टीमों को संरचित वेरिफिकेशन वर्कफ़्लो अपनाना चाहिए।

डेवलपर कार्यान्वयन चेकलिस्ट

  • विज़ुअल पहेलियों को प्राथमिक गेट के रूप में हटाना: लॉगिन और पंजीकरण प्रवाह को स्टैंडअलोन इमेज-मैचिंग चुनौतियों से सर्वर-साइड रिस्क एनालिसिस की ओर स्थानांतरित करें।
  • API गेटवे पर रेट लिमिटिंग लागू करें: प्रमाणीकरण और डेटा-सबमिशन एंडपॉइंट्स पर सख्त रेट लिमिट्स और बर्स्ट थ्रॉटल्स लागू करें।
  • मजबूत खाता प्रमाणीकरण तैनात करें: प्रमाणित खाता एक्सेस के लिए WebAuthn-संगत प्रमाणकों के माध्यम से सार्वजनिक-कुंजी क्रेडेंशियल्स के साथ उपयोगकर्ताओं को प्रमाणित करें।
  • API विसंगतियों की निगरानी करें: एज राउटर पर सत्र विलंबता, हेडर स्थिरता और विसंगत रिक्वेस्ट पैटर्न को ट्रैक करें।

उत्पाद और सुरक्षा रणनीति चेकलिस्ट

  • उपयोगकर्ता वेरिफिकेशन में बाधा कम करें: ऑनबोर्डिंग रूपांतरण दरों में सुधार के लिए कम जोखिम वाले ट्रैफ़िक के लिए जटिल विज़ुअल पहेलियों को हटा दें।
  • बहु-सिग्नल जोखिम बेसलाइन स्थापित करें: नेटवर्क प्रतिष्ठा, सत्र व्यवहार, रिक्वेस्ट वेग और—जहाँ उचित हो—प्लेटफ़ॉर्म-विशिष्ट अटेस्टेशन सिग्नल्स को जोड़ें।
  • उच्च-जोखिम वाले एंडपॉइंट्स का नियमित ऑडिट करें: संवेदनशील उपयोगकर्ता वर्कफ़्लो पर स्वचालित रेड-टीमिंग और विसंगति समीक्षा करें।

इन इंजीनियरिंग प्रथाओं को लागू करने से संगठन वास्तविक उपयोगकर्ताओं के लिए सहज ऑनबोर्डिंग अनुभव प्रदान करते हुए सुरक्षित डिजिटल परिधि बनाए रख सकते हैं।

अक्सर पूछे जाने वाले प्रश्न (FAQ)

क्या CAPTCHA गेम क्लियर करने का मतलब है कि प्रोडक्शन बॉट सुरक्षा विफल हो गई है?
नहीं। नील अग्रवाल का "I Am Not a Robot" इंटरैक्टिव तर्क का परीक्षण करने के लिए डिज़ाइन किया गया एक स्टैंडअलोन ब्राउज़र पहेली गेम है। प्रोडक्शन बॉट-मैनेजमेंट प्लेटफ़ॉर्म केवल विज़ुअल पहेलियों पर भरोसा करने के बजाय नेटवर्क प्रतिष्ठा, ब्राउज़र एनवायरनमेंट सिग्नल्स और सर्वर-साइड टोकन वैलिडेशन सहित कई अंतर्निहित सिग्नल्स का मूल्यांकन करते हैं।
कंप्यूटर-यूज़ एजेंट्स इंटरैक्टिव विज़ुअल पहेलियों को कैसे हल करते हैं?
कंप्यूटर-यूज़ एजेंट्स डेस्कटॉप या ब्राउज़र स्क्रीनशॉट लेते हैं, मल्टीमॉडल विज़न मॉडल का उपयोग करके विज़ुअल तत्वों को प्रोसेस करते हैं, और उचित क्रियाएं निर्धारित करते हैं। इसके बाद मॉडल एक सॉफ़्टवेयर हार्नेस के माध्यम से निष्पादन कमांड भेजता है जो ब्राउज़र एनवायरनमेंट में माउस मूवमेंट, क्लिक और कीबोर्ड प्रविष्टियाँ जारी करता है।
स्टैंडअलोन विज़ुअल CAPTCHAs के सबसे अच्छे विकल्प क्या हैं?
बॉट मिटिगेशन के लिए, आधुनिक विकल्पों में पैसिव सर्वर-साइड रिस्क स्कोरिंग, डायनामिक रेट लिमिटिंग, ब्राउज़र एनवायरनमेंट मूल्यांकन और सर्वर टोकन वैलिडेशन शामिल हैं। प्रमाणित खाता एक्सेस के लिए, WebAuthn और पासकीज़ अलग से प्रमाणीकरण सुरक्षा को मजबूत कर सकते हैं।

सुरक्षा टीमों के लिए मुख्य सीख

वह प्रदर्शन जहाँ OpenAI Astra ने 48 CAPTCHA गेम स्टेज पूरे किए, मल्टीमॉडल कंप्यूटर-यूज़ मॉडल की तीव्र प्रगति को दर्शाता है। जैसे-जैसे सॉफ़्टवेयर एजेंट्स विज़ुअल डिस्प्ले की व्याख्या करने और डेस्कटॉप क्रियाओं को निष्पादित करने की क्षमता हासिल कर रहे हैं, एक प्राथमिक सुरक्षा बाधा के रूप में विज़ुअल पहेलियों पर भरोसा करना अब पर्याप्त नहीं है। जो सुरक्षा टीमें बहु-स्तरीय, सर्वर-साइड रिस्क स्कोरिंग, मजबूत खाता प्रमाणीकरण और निरंतर व्यवहार विश्लेषण अपनाती हैं, वे डिजिटल इंफ्रास्ट्रक्चर की सुरक्षा के लिए सबसे अच्छी स्थिति में होंगी।

संदर्भ

Share this article

Keep Discovering

Huawei ने Tri-Fold Mate XT 2 लॉन्च किया? App UX के लिए क्या बदलाव होंगे

Huawei ने Tri-Fold Mate XT 2 लॉन्च किया? App UX के लिए क्या बदलाव होंगे

Huawei ने Kirin 9050 Pro और HarmonyOS 7 के साथ Tri-Fold Mate XT 2 लॉन्च किया। जानें कि कैसे रिस्पॉन्सिव लेआउट और UIAbility स्टेट निरंतरता 10.2-इंच डिस्प्ले के साथ तालमेल बिठाते हैं।

G

Google ने Android पर Gemini के लिए Assistant को बंद किया? ऐप्स के लिए क्या बदल रहा है

Google ने Android उपकरणों पर Gemini के लिए Assistant को बंद कर दिया है। जानें कि यह मोबाइल ट्रांज़िशन कैसे App Actions, डीप लिंकिंग और ऐप इनवोकेशन को प्रभावित करता है।

मोबाइल अभियानों में विज्ञापन धोखाधड़ी को कैसे रोकें और फर्जी इंस्टाल पर कैसे लगाम लगाएं

मोबाइल अभियानों में विज्ञापन धोखाधड़ी को कैसे रोकें और फर्जी इंस्टाल पर कैसे लगाम लगाएं

जानें कि मोबाइल विज्ञापन धोखाधड़ी एट्रिब्यूशन मॉडल में कैसे हेरफेर करती है, MTTI वितरण का विश्लेषण कैसे करें, और फर्जी इंस्टाल को रोकने के लिए विसंगति नियमों (anomaly rules) को कैसे कॉन्फ़िगर करें।